Loading prices...
Все новости
Матовая сетка в холодном голубом свете и скопление частиц, прошедших сквозь неё, — попытки взлома, которые всё же проходят

Отчёт по безопасности GPT-6 Astra: 100% на ExploitBench и 91,5% отказов

16:00 · 04.09.2026
Источник: OpenAI
0

Один документ говорит сразу об обоих. GPT-6 Astra набирает 100% на ExploitBench — и отклоняет 91,5% попыток взломать её защиту, чтобы заставить работать в наступательном режиме. Переведите вторую цифру в дробь: примерно одна попытка из двенадцати всё же проходит. И это первая модель, которой OpenAI по собственной методике присвоила уровень Critical по киберспособностям.

Что означает уровень Critical

Уровень описывает конкретную способность. Astra умеет находить неизвестные ранее уязвимости и собирать рабочие эксплойты против хорошо защищённых систем, причём человек не ведёт её за руку на каждом шаге. Против предыдущей модели опубликованные результаты даже не близко:

  • ExploitBench: Astra 100%, GPT-5.6 Sol 78,5%
  • SRE-Bench, с первой попытки: Astra 88,0%, Sol 55,9%
  • FrontierMath Tier 4: 98%
  • ARC-AGI-3: 99,9%

Проверка нашла две неизвестные уязвимости

Самая предметная строка отчёта описывает внутренний набор из 20 уязвимостей высокой критичности в движке V8, собранный с июня по август. На нём Astra добилась заметно более высокой доли произвольного выполнения кода, чем Sol, а по ходу той же проверки нашла две уязвимости, о которых не знал никто. Тест на безопасность выдал настоящие зиро-дэи просто потому, что его запустили.

Мы не примем ухудшения нашей способности следить за согласованностью модели дальше определённого уровня. Мы притормозим масштабирование, пока не вернём достаточную уверенность.

Якуб Пахоцкий, главный научный сотрудник OpenAI, NBC News, 3 сентября 2026 года

Источник цитаты: NBC News, 3 сентября 2026 года

Где цифры стали лучше

В испытании с приманкой Astra ни разу не попыталась взломать защитную инфраструктуру — у Sol таких попыток было 55,4%. На более чем 54 тысячах смоделированных задач в Codex она набрала примерно вдвое меньше отметок о серьёзных отклонениях в поведении и ни разу не пробовала обойти отказ Codex Auto-Review. Слежение за отклонениями OpenAI теперь ведёт на всех запусках с инструментами: классификаторы читают и рассуждения, и действия, и останавливают всё неразрешённое.

Компания описывает и более жёсткую изоляцию, шифрование контрольных точек, наблюдение за полными траекториями вместе с цепочками рассуждений, а также проверку на согласованность, без прохождения которой модель не пускают даже внутрь компании. Белый дом изучил систему в рамках добровольной процедуры и менять защиту не потребовал. 2 сентября мы писали, что эта модель умеет собирать, когда её никто не останавливает, — описанные меры и есть ответ на это.

OpenAI взяла на себя два обязательства, которые тянут в разные стороны. Компания обещает притормозить масштабирование, если потеряет способность следить за согласованностью модели. И тут же сообщает, что программа Daybreak в ближайшие недели ослабит ограничения, чтобы защитники могли проверять уязвимости, разбирать вредоносный код и строить детектирование.

Эти недели и будут проверкой. Ослабление ограничений у модели с уровнем Critical — ровно та ситуация, ради которой писалось первое обязательство, а тем 8,5% попыток взлома, которые проходят уже сейчас, никакая смена политики для этого не нужна.

Ничего из вышеперечисленного не стоит воспринимать как персональную инвестиционную рекомендацию.

Опубликовано: 16:00 · 04.09.2026
Maks

Автор

Maks

Трейдер

Долгое время интересуюсь рынком криптовалют, являюсь трейдером, пишу статьи и новости о своем опыте простыми словами.

Комментарии (0)

Пока нет комментариев — будь первым!

Крипторынок производит шум. Мы присылаем сигнал

Письмо, ради которого стоит открыть почту