
Отчёт по безопасности GPT-6 Astra: 100% на ExploitBench и 91,5% отказов
Один документ говорит сразу об обоих. GPT-6 Astra набирает 100% на ExploitBench — и отклоняет 91,5% попыток взломать её защиту, чтобы заставить работать в наступательном режиме. Переведите вторую цифру в дробь: примерно одна попытка из двенадцати всё же проходит. И это первая модель, которой OpenAI по собственной методике присвоила уровень Critical по киберспособностям.
Что означает уровень Critical
Уровень описывает конкретную способность. Astra умеет находить неизвестные ранее уязвимости и собирать рабочие эксплойты против хорошо защищённых систем, причём человек не ведёт её за руку на каждом шаге. Против предыдущей модели опубликованные результаты даже не близко:
- ExploitBench: Astra 100%, GPT-5.6 Sol 78,5%
- SRE-Bench, с первой попытки: Astra 88,0%, Sol 55,9%
- FrontierMath Tier 4: 98%
- ARC-AGI-3: 99,9%
Проверка нашла две неизвестные уязвимости
Самая предметная строка отчёта описывает внутренний набор из 20 уязвимостей высокой критичности в движке V8, собранный с июня по август. На нём Astra добилась заметно более высокой доли произвольного выполнения кода, чем Sol, а по ходу той же проверки нашла две уязвимости, о которых не знал никто. Тест на безопасность выдал настоящие зиро-дэи просто потому, что его запустили.
“Мы не примем ухудшения нашей способности следить за согласованностью модели дальше определённого уровня. Мы притормозим масштабирование, пока не вернём достаточную уверенность.”
— Якуб Пахоцкий, главный научный сотрудник OpenAI, NBC News, 3 сентября 2026 года
Источник цитаты: NBC News, 3 сентября 2026 года
Где цифры стали лучше
В испытании с приманкой Astra ни разу не попыталась взломать защитную инфраструктуру — у Sol таких попыток было 55,4%. На более чем 54 тысячах смоделированных задач в Codex она набрала примерно вдвое меньше отметок о серьёзных отклонениях в поведении и ни разу не пробовала обойти отказ Codex Auto-Review. Слежение за отклонениями OpenAI теперь ведёт на всех запусках с инструментами: классификаторы читают и рассуждения, и действия, и останавливают всё неразрешённое.
Компания описывает и более жёсткую изоляцию, шифрование контрольных точек, наблюдение за полными траекториями вместе с цепочками рассуждений, а также проверку на согласованность, без прохождения которой модель не пускают даже внутрь компании. Белый дом изучил систему в рамках добровольной процедуры и менять защиту не потребовал. 2 сентября мы писали, что эта модель умеет собирать, когда её никто не останавливает, — описанные меры и есть ответ на это.
OpenAI взяла на себя два обязательства, которые тянут в разные стороны. Компания обещает притормозить масштабирование, если потеряет способность следить за согласованностью модели. И тут же сообщает, что программа Daybreak в ближайшие недели ослабит ограничения, чтобы защитники могли проверять уязвимости, разбирать вредоносный код и строить детектирование.
Эти недели и будут проверкой. Ослабление ограничений у модели с уровнем Critical — ровно та ситуация, ради которой писалось первое обязательство, а тем 8,5% попыток взлома, которые проходят уже сейчас, никакая смена политики для этого не нужна.
Ничего из вышеперечисленного не стоит воспринимать как персональную инвестиционную рекомендацию.

Комментарии (0)
Пока нет комментариев — будь первым!
Крипторынок производит шум. Мы присылаем сигнал
Письмо, ради которого стоит открыть почту
Похожие материалы
ПопулярноеТоп 7
Крипторынок теряет 4-5% за день: что говорят объёмы и трейдеры
73Рынок





