
Граница ИИ там, где кончается проверка
Про искусственный интеллект все спрашивают, справится ли он с задачей. Вопрос неверный, и прошедшая неделя дала достаточно измеренных внедрений, чтобы показать почему. Верный вопрос уже и отвечать на него можно заранее: если работу сделают плохо, скажет ли об этом хоть что-нибудь, как скоро и кто заплатит за выяснение.
Пять внедрений, пять цифр
Пять внедрений, все с опубликованными цифрами, все за последние несколько дней:
- Meta: ИИ-набор для рекламы с ран-рейтом выше $60 млрд в год и более 9 млн малых компаний хотя бы с одним инструментом креатива.
- Klarna: время решения вопроса срезано минимум на 81,8%, после чего людей вернули обратно.
- Coca-Cola: позитивные упоминания вокруг рождественского ИИ-ролика упали с 23,8% до 10,2%.
- Полиция США: минимум 14 ошибочных арестов по совпадению лица и ноль сообщений о таких арестах в 20 с лишним юрисдикциях с запретом.
- NVIDIA: ИИ-агент переписал боевой робототехнический код пятью правками и доказал результат профайлером.
Метрика закупки приходит первой
Каждое из этих чисел существует потому, что кто-то что-то посчитал. Разница между успехами и откатами не в сложности задачи и не в качестве модели. Она в том, какое число пришло первым. Производственная метрика доступна в день установки: сэкономленные минуты на отчёт, сгенерированные оповещения, варианты в час, конверсии на тысячу показов. Метрика правильности приходит позже, дорого производится и почти всегда оплачивается не покупателем. Meta — случай, где разрыва нет вовсе: то, что оптимизируют, и то, что оценивают, — одно и то же событие. Клик либо случился, либо нет, рекламодатель видит это в тот же час, и созывать исследование, чтобы выяснить, сработала ли кампания, никому не нужно. Поэтому рекламный набор и перевалил за ран-рейт в $60 млрд без единой истории отката, и дело вовсе не в том, что реклама задача проще, чем поддержка клиентов.
Klarna — самая чистая демонстрация, потому что сработавшая часть работать не переставала. Ассистент вывозил отданный ему объём и срезал время обработки минимум на 81,8%, и эта цифра держалась до конца. Ухудшилось то, под что колонки ни у кого не было, и к маю 2025 года компания снова нанимала тех, кого заменила. Coca-Cola показывает ту же форму с другой стороны: на втором подряд рождественском ИИ-ролике позитивные упоминания упали на 13,6 процентного пункта, а негативные выросли на 0,6. Позитив сдвинулся в 22,7 раза сильнее негатива. Ролик не разозлил людей. Он выпил ровно то, ради чего кампания и существует, и приборной панели для этого не было.
“Поскольку стоимость, к сожалению, оказалась слишком весомым критерием оценки при организации всего этого, в итоге получаешь качество похуже.”
— Себастьян Семятковский, Klarna, цитата по Forbes
Себастьян Семятковский, глава Klarna, о том, что дало внедрение
Где проверка занимает секунды
Теперь обратный случай, и он самый поучительный из пяти. NVIDIA опубликовала разбор, в котором ИИ-агент переносит CUDA-ускоренный робототехнический узел: проверяет код, прослеживает, где данные переходят между памятью GPU и CPU, и пишет минимальную правку, убирающую эти переходы. Изменение транспорта — пять правок. В рабочем процессе семь шагов, и три из них аудит или проверка.
Работает всё это благодаря последнему шагу. Агент обязан подтвердить профайлером, что передач хост-устройство размером с нагрузку не осталось, и проверить, что сообщение возвращает тип бэкенда cuda. Это трассировка и сравнение строк: две механические проверки за секунды, ответ «да» или «нет», человеческого суждения между ними нет. Именно потому, что проверка так дёшева, агенту отдают работу, а не черновик работы. Мы разбирали это внедрение подробно, и закономерность подтвердилась: автономию выдала проверка, а не способность модели. Тот же агент с той же задачей в кодовой базе без профайлера и без проверки типа бэкенда был бы ровно так же способен, и ни один вменяемый инженер не дал бы ему право на коммит.
Где проверка занимает годы
Полиция стоит на дальнем конце той же оси, и последствия растут вместе с задержкой. Распознавание лиц дало минимум 14 задокументированных ошибочных арестов в США, 13 уголовных дел прекращены; NIST измерил долю ложных срабатываний — для чернокожих и азиатских лиц она до 100 раз выше, чем для лиц белых мужчин. Предиктивная программа под аудитом The Markup оказывалась права меньше чем в половине процента случаев: 0,6% по грабежам и нападениям и 0,1% по кражам со взломом. Каждый из этих инструментов исправно выдавал свою производственную метрику вплоть до дня отключения. В одном деле этого года женщина провела в тюрьме более пяти месяцев из-за преступлений в штате, где, по её словам, никогда не бывала. Проверка правильности пришла судебным делом, спустя годы после накладной. Самое наглядное сопоставление здесь — естественный эксперимент: более двадцати юрисдикций США запретили полиции распознавание лиц, и ни об одном ошибочном аресте по совпадению лица в городе с действующим запретом не сообщалось. Контролируемым исследованием это не назовёшь, но другого прямого сравнения у страны нет.
Поиск — случай, где метрики правильности нет вовсе, поэтому ничего и не остановилось. Ответ ИИ над ссылками срезает долю кликов с 15% до 8%, по ссылкам внутри ответа кликают примерно в 1% случаев, а 26% таких поисков сразу завершают сессию против 16% без ответа. Всё это платформа измеряет. Получил ли читатель то, за чем пришёл, и выживет ли издатель, который это написал, не стоит ни на чьей панели. Система оптимизировала ту половину, которую видела.
Во что проверка обходится в долларах
Стоимость проверки — не метафора, и три опубликованные цены это показывают. Rev берёт $0,07 за минуту машинной расшифровки и $0,79 за минуту с человеческой правкой, в 11,3 раза больше; на часовой записи это $4,20 против $47,40. OpenAI пообещала $1 млрд на защиту критической инфраструктуры — это 0,067% от $1,5 трлн контрактов на вычисления, которые та же отрасль набрала на ближайшие два года. Apple заплатила $250 млн за функцию ИИ, которую рекламировала и выпустила через 813 дней, и вышло примерно по $25 на устройство. Во всех трёх случаях машинный результат почти бесплатен, а дорого стоит проверка. Категорию при этом продают наоборот: в презентациях считают экономию на производстве, а расходы на вычитку, аудит и судебные издержки в расчёт не попадают, потому что ложатся они на другие статьи и на другие кварталы.
С диктовкой обычный читатель сталкивается с этим напрямую. Whisper даёт 2,7% ошибок в словах на чистом эталоне и от 8% до 12% на реальной речи, то есть рабочая доля ошибок в три-четыре с половиной раза выше рекламной. На пятнадцатиминутной записи это 180-270 неверных слов. Отдельно: выдуманные фразы встречаются примерно в 1% образцов, и 38% из них несут явный вред, а запускают их паузы дольше 30 секунд, оговорки и перебивания. Это описание обычного разговора, и арифметику стоит знать до того, как доверять расшифровке.
Правило, которое можно применить завтра
Три вопроса по порядку, прежде чем что-то внедрять. Если задачу сделают плохо, скажет ли мне об этом число? Если да, через сколько это число появится? И кто платит в промежутке. Где все три ответа хорошие, как у NVIDIA, работу можно отдавать. Где первый «да», а второй «через месяцы», как у Klarna, держите человека на исключениях и ждите отката, если не держите. Где первый ответ «нет», как у рождественского ролика или у ареста, вы внедряете не инструмент. Вы передаёте суждение, и счёт приходит туда, куда вы не смотрите.
Есть прочтение, важное именно для крипточитателя, и это не лозунг. Блокчейн, если снять с него всё остальное, — машина, которая делает один класс утверждений дёшево проверяемым и невозможным для заявления без доказательства. Свидетельства этой недели говорят, что внедрение ИИ упирается ровно в это ограничение: не в то, насколько модель способна, а в то, насколько дёшево кто угодно может установить, что она ошиблась. Проверка незаметно стала дефицитным ресурсом. Компании, построившие дешёвые проверки, отдают машинам настоящую работу. Те, кто не построил, нанимают людей обратно и объясняют графики настроений.
Информационный материал, не инвестиционная рекомендация. Каждая цифра здесь взята из раскрытия компании, рецензируемого исследования или опубликованного аудита со ссылкой на первоисточник; сопоставления между ними наши.

Автор
Intokened.comНовости о криптовалютах и искусственном интеллекте, анализ рынка и справочные руководства.
Комментарии (0)
Пока нет комментариев — будь первым!
Крипторынок производит шум. Мы присылаем сигнал
Письмо, ради которого стоит открыть почту
Похожие материалы

CLARITY Act провалился. Что теперь будет с криптовалютой?
Сенат заблокировал CLARITY 50 голосами против 49, XRP упал на 8,83%. Законопроект застрял, а не отклонён, и ФРС теперь весит больше, чем голосование.

Пузырь ИИ в конце 2026 года: за чем следить инвестору
Капзатраты гиперскейлеров идут к $725 млрд, около половины S&P 500 связано с ИИ, а стройку всё чаще финансируют в долг. Что на самом деле решит исход.

Публичный Wi-Fi и ваш крипто-портфель: модель угроз, которую инвесторы всё ещё недооценивают
Основатель и генеральный директор KeepSolid Василий Иванов разбирает, как публичный Wi-Fi подвергает крипто-кошельки пассивному наблюдению, атакам man-in-the-middle, сетям evil twin и манипуляциям через captive portal, и предлагает практический план опсека.
ПопулярноеТоп 7
Крипторынок теряет 4-5% за день: что говорят объёмы и трейдеры
73Рынок


