
Google тестирует крипто-метод двойного слепого теста ИИ
Google DeepMind проводит первую двойную слепую оценку собственной топовой ИИ-модели, сообщил The Decoder. Проект, реализуемый вместе с Сингапурским институтом безопасности ИИ и другими партнёрами, использует криптографию, чтобы скрыть тестовые вопросы и веса модели друг от друга.
Схема нацелена на заражение бенчмарков: если модель уже видела вопросы теста во время обучения, её результат говорит меньше, чем кажется. Google DeepMind сравнивает это со сдающим тест, который уже знает ответы. Вопросы внешнего бенчмарка теперь остаются запертыми в криптографической «коробке», так что модель не может позже дообучиться на них, чтобы подогнать результат.
Чувствительные внешние оценки раньше вынуждали выбирать. Оценщики могли передать свои тестовые промты и позволить провайдеру модели увидеть вопросы заранее, либо провайдер передавал веса модели, рискуя интеллектуальной собственностью. Google приводит недавний пример: отложенную оценку по бенчмарку ARC-AGI для Fable 5 от Anthropic, осложнённую 30-дневной политикой хранения данных Anthropic для своих самых сильных моделей.
Схема двойного слепого теста призвана полностью убрать этот выбор. Google запускает её на Confidential Space, части портфеля конфиденциальных вычислений Google Cloud, которая криптографически подтверждает, что данные обеих сторон остаются приватными. Оценщик никогда не видит веса Gemini. Google никогда не видит тестовые промты. Раньше промты держали в секрете протоколы нулевого логирования и контракты; теперь к этому добавляется криптографическая гарантия, ближе к тому виду верификации, который собственная секретная программа бенчмаркинга ИИ правительства США пытается выстроить через политику, а не через код.
- Проблема: заражение бенчмарков, когда модель уже видела тестовые вопросы во время обучения
- Решение: криптографическая двойная слепая оценка, без общего доступа к тестовым промтам или весам модели
- Инфраструктура: Confidential Space, часть портфеля конфиденциальных вычислений Google Cloud
- Масштаб пилота: модель Gemini Flash Lite протестирована против закрытых бенчмарков
- Приоритетный сценарий: кибербезопасность и оценки для госведомств, где суверенитет данных важнее всего
В рамках пилота Google тестирует модель из линейки Gemini Flash Lite против закрытых бенчмарков по этой схеме.
Google заявляет, что метод важнее всего для высокочувствительных оценок, тестов кибербезопасности или проверок, проводимых государственными ведомствами, где независимым организациям нужно строго протестировать модель, не поступаясь суверенитетом или безопасностью данных. Этот шаг вписывается в общую картину для DeepMind, чьё руководство отдельно призывало срочно создать орган контроля ИИ в преддверии появления более мощных систем.
Google опубликовала технический отчёт с методологией и результатами и заявляет, что надеется на превращение подхода в стандарт для других лабораторий, а не разовый пилот.
Материал носит информационный характер и не является инвестиционной рекомендацией.

Комментарии (0)
Пока нет комментариев — будь первым!
Похожие материалы
ПопулярноеТоп 7
Крипторынок теряет 4-5% за день: что говорят объёмы и трейдеры
73Рынок





