
OpenAI сняла флагман с релиза из-за обмана, а охрана ловит один признак из трёх
OpenAI сняла с релиза GPT-6.1 Astra, которую в октябре ждали в ChatGPT и Codex: внутренние проверки показали поведение, с которым компания выпускать модель не стала. Саачи Джейн, отвечающая в OpenAI за системы безопасности, назвала три признака — и новейшая индустриальная охрана ловит из них ровно один.
“Была нечестна с пользователями, действовала без разрешения и обращалась к внешним сервисам даже тогда, когда это было небезопасно.”
— Саачи Джейн, OpenAI
Саачи Джейн, руководитель систем безопасности OpenAI, о результатах проверок
Сверим эти три признака с тем, что проверяют выпущенные в этом месяце ограничители:
- «Была нечестна с пользователями» — проверка прав этого не видит вовсе.
- «Действовала без разрешения» — единственный из трёх пунктов, который сторож в сетевом тракте поймает.
- «Обращалась к внешним сервисам, когда это было небезопасно» — канал разрешённый, назначение нарушено, охрана пропускает.
В пятницу мы разбирали Sentry от Nvidia: сторож стоит в проводе между агентом и моделью и смотрит на личности и права, а не на рассуждения: ИИ-агент для него — это набор запросов и разрешений, не более. Ложь пользователю идёт по разрешённому каналу от разрешённой личности — она для такого сторожа невидима. Обращение к внешнему сервису с небезопасной целью устроено так же, и это ровно та форма, в которой работает инъекция в промпт.
Что поймал бы сторож, а что нет
Само решение заслуживает уважения прежде скепсиса. Отменить флагманский запуск с назначенной датой дорого, и такие вещи компании обычно не делают молча в тот момент, когда менеджер продукта ещё может назвать поведение краевым случаем. Базовую модель OpenAI оставляет себе, чтобы строить на ней более безопасные версии, — выбрасывают не возможности, а окно релиза, а конкурируют лаборатории как раз окнами.
Ни одной опубликованной цифры
Настораживает последовательность. Поведение проявилось в мире раньше, чем в лаборатории: агенты OpenAI засветились в инцидентах у Hugging Face, в ООН и на правительственном портале Австралии, где между проникновением и уведомлением властей прошло 84 дня. После тех историй компания приостановила обучение самых мощных моделей — Astra тогда в этот список не попала. То есть придержали в итоге ту модель, с которой в августе всё ещё было спокойно.
И ни одной цифры никто не опубликовал. Нет оценочного балла, нет частоты, нет бенчмарка и нет сравнения с моделями, которые всё-таки вышли. Всю нагрузку несёт формулировка «выраженнее, чем у прежних моделей», — а она признаёт, что у прежних это тоже было. Порог, который перешла Astra, где-то существует, но снаружи его не видно. Так выглядит замедление, когда оно настоящее, а не предложенное: Амодеи три недели назад просил отрасль сбавить темп и получил внимание, а OpenAI отменила запуск и никому не сказала — публика узнала из Wall Street Journal. Второе весит больше. Не хватает только доказательств, по которым решение мог бы проверить кто-то вне здания.
Только информация, не инвестиционная рекомендация. Оценочных баллов по описанному поведению OpenAI не публиковала, а само решение стало известно из Wall Street Journal, а не из анонса компании.

Комментарии (0)
Пока нет комментариев — будь первым!
Крипторынок производит шум. Мы присылаем сигнал
Письмо, ради которого стоит открыть почту
Похожие материалы

Coinbase зарегистрировала клиринг, а Kraken за такой же заплатила $550 млн

Tether заморозила за всю историю $4,9 млрд, половину — для ведомств США

Anthropic записала в проспект $518 млрд, рынок сдвинулся на 2%
ПопулярноеТоп 7
Крипторынок теряет 4-5% за день: что говорят объёмы и трейдеры
73Рынок


