Loading prices...
Все статьи
Серебряная измерительная линейка: на размеченной части ровно стоят четыре зелёных кубика, а за её обрывом три багровых висят в воздухе без опоры

Граница ИИ там, где кончается проверка

12:30 · 23.09.2026
1

Про искусственный интеллект все спрашивают, справится ли он с задачей. Вопрос неверный, и прошедшая неделя дала достаточно измеренных внедрений, чтобы показать почему. Верный вопрос уже и отвечать на него можно заранее: если работу сделают плохо, скажет ли об этом хоть что-нибудь, как скоро и кто заплатит за выяснение.

Пять внедрений, пять цифр

Пять внедрений, все с опубликованными цифрами, все за последние несколько дней:

  • Meta: ИИ-набор для рекламы с ран-рейтом выше $60 млрд в год и более 9 млн малых компаний хотя бы с одним инструментом креатива.
  • Klarna: время решения вопроса срезано минимум на 81,8%, после чего людей вернули обратно.
  • Coca-Cola: позитивные упоминания вокруг рождественского ИИ-ролика упали с 23,8% до 10,2%.
  • Полиция США: минимум 14 ошибочных арестов по совпадению лица и ноль сообщений о таких арестах в 20 с лишним юрисдикциях с запретом.
  • NVIDIA: ИИ-агент переписал боевой робототехнический код пятью правками и доказал результат профайлером.

Метрика закупки приходит первой

Каждое из этих чисел существует потому, что кто-то что-то посчитал. Разница между успехами и откатами не в сложности задачи и не в качестве модели. Она в том, какое число пришло первым. Производственная метрика доступна в день установки: сэкономленные минуты на отчёт, сгенерированные оповещения, варианты в час, конверсии на тысячу показов. Метрика правильности приходит позже, дорого производится и почти всегда оплачивается не покупателем. Meta — случай, где разрыва нет вовсе: то, что оптимизируют, и то, что оценивают, — одно и то же событие. Клик либо случился, либо нет, рекламодатель видит это в тот же час, и созывать исследование, чтобы выяснить, сработала ли кампания, никому не нужно. Поэтому рекламный набор и перевалил за ран-рейт в $60 млрд без единой истории отката, и дело вовсе не в том, что реклама задача проще, чем поддержка клиентов.

Klarna — самая чистая демонстрация, потому что сработавшая часть работать не переставала. Ассистент вывозил отданный ему объём и срезал время обработки минимум на 81,8%, и эта цифра держалась до конца. Ухудшилось то, под что колонки ни у кого не было, и к маю 2025 года компания снова нанимала тех, кого заменила. Coca-Cola показывает ту же форму с другой стороны: на втором подряд рождественском ИИ-ролике позитивные упоминания упали на 13,6 процентного пункта, а негативные выросли на 0,6. Позитив сдвинулся в 22,7 раза сильнее негатива. Ролик не разозлил людей. Он выпил ровно то, ради чего кампания и существует, и приборной панели для этого не было.

Поскольку стоимость, к сожалению, оказалась слишком весомым критерием оценки при организации всего этого, в итоге получаешь качество похуже.

Себастьян Семятковский, Klarna, цитата по Forbes

Себастьян Семятковский, глава Klarna, о том, что дало внедрение

Где проверка занимает секунды

Теперь обратный случай, и он самый поучительный из пяти. NVIDIA опубликовала разбор, в котором ИИ-агент переносит CUDA-ускоренный робототехнический узел: проверяет код, прослеживает, где данные переходят между памятью GPU и CPU, и пишет минимальную правку, убирающую эти переходы. Изменение транспорта — пять правок. В рабочем процессе семь шагов, и три из них аудит или проверка.

Работает всё это благодаря последнему шагу. Агент обязан подтвердить профайлером, что передач хост-устройство размером с нагрузку не осталось, и проверить, что сообщение возвращает тип бэкенда cuda. Это трассировка и сравнение строк: две механические проверки за секунды, ответ «да» или «нет», человеческого суждения между ними нет. Именно потому, что проверка так дёшева, агенту отдают работу, а не черновик работы. Мы разбирали это внедрение подробно, и закономерность подтвердилась: автономию выдала проверка, а не способность модели. Тот же агент с той же задачей в кодовой базе без профайлера и без проверки типа бэкенда был бы ровно так же способен, и ни один вменяемый инженер не дал бы ему право на коммит.

Где проверка занимает годы

Полиция стоит на дальнем конце той же оси, и последствия растут вместе с задержкой. Распознавание лиц дало минимум 14 задокументированных ошибочных арестов в США, 13 уголовных дел прекращены; NIST измерил долю ложных срабатываний — для чернокожих и азиатских лиц она до 100 раз выше, чем для лиц белых мужчин. Предиктивная программа под аудитом The Markup оказывалась права меньше чем в половине процента случаев: 0,6% по грабежам и нападениям и 0,1% по кражам со взломом. Каждый из этих инструментов исправно выдавал свою производственную метрику вплоть до дня отключения. В одном деле этого года женщина провела в тюрьме более пяти месяцев из-за преступлений в штате, где, по её словам, никогда не бывала. Проверка правильности пришла судебным делом, спустя годы после накладной. Самое наглядное сопоставление здесь — естественный эксперимент: более двадцати юрисдикций США запретили полиции распознавание лиц, и ни об одном ошибочном аресте по совпадению лица в городе с действующим запретом не сообщалось. Контролируемым исследованием это не назовёшь, но другого прямого сравнения у страны нет.

Поиск — случай, где метрики правильности нет вовсе, поэтому ничего и не остановилось. Ответ ИИ над ссылками срезает долю кликов с 15% до 8%, по ссылкам внутри ответа кликают примерно в 1% случаев, а 26% таких поисков сразу завершают сессию против 16% без ответа. Всё это платформа измеряет. Получил ли читатель то, за чем пришёл, и выживет ли издатель, который это написал, не стоит ни на чьей панели. Система оптимизировала ту половину, которую видела.

Во что проверка обходится в долларах

Стоимость проверки — не метафора, и три опубликованные цены это показывают. Rev берёт $0,07 за минуту машинной расшифровки и $0,79 за минуту с человеческой правкой, в 11,3 раза больше; на часовой записи это $4,20 против $47,40. OpenAI пообещала $1 млрд на защиту критической инфраструктуры — это 0,067% от $1,5 трлн контрактов на вычисления, которые та же отрасль набрала на ближайшие два года. Apple заплатила $250 млн за функцию ИИ, которую рекламировала и выпустила через 813 дней, и вышло примерно по $25 на устройство. Во всех трёх случаях машинный результат почти бесплатен, а дорого стоит проверка. Категорию при этом продают наоборот: в презентациях считают экономию на производстве, а расходы на вычитку, аудит и судебные издержки в расчёт не попадают, потому что ложатся они на другие статьи и на другие кварталы.

С диктовкой обычный читатель сталкивается с этим напрямую. Whisper даёт 2,7% ошибок в словах на чистом эталоне и от 8% до 12% на реальной речи, то есть рабочая доля ошибок в три-четыре с половиной раза выше рекламной. На пятнадцатиминутной записи это 180-270 неверных слов. Отдельно: выдуманные фразы встречаются примерно в 1% образцов, и 38% из них несут явный вред, а запускают их паузы дольше 30 секунд, оговорки и перебивания. Это описание обычного разговора, и арифметику стоит знать до того, как доверять расшифровке.

Правило, которое можно применить завтра

Три вопроса по порядку, прежде чем что-то внедрять. Если задачу сделают плохо, скажет ли мне об этом число? Если да, через сколько это число появится? И кто платит в промежутке. Где все три ответа хорошие, как у NVIDIA, работу можно отдавать. Где первый «да», а второй «через месяцы», как у Klarna, держите человека на исключениях и ждите отката, если не держите. Где первый ответ «нет», как у рождественского ролика или у ареста, вы внедряете не инструмент. Вы передаёте суждение, и счёт приходит туда, куда вы не смотрите.

Есть прочтение, важное именно для крипточитателя, и это не лозунг. Блокчейн, если снять с него всё остальное, — машина, которая делает один класс утверждений дёшево проверяемым и невозможным для заявления без доказательства. Свидетельства этой недели говорят, что внедрение ИИ упирается ровно в это ограничение: не в то, насколько модель способна, а в то, насколько дёшево кто угодно может установить, что она ошиблась. Проверка незаметно стала дефицитным ресурсом. Компании, построившие дешёвые проверки, отдают машинам настоящую работу. Те, кто не построил, нанимают людей обратно и объясняют графики настроений.

Информационный материал, не инвестиционная рекомендация. Каждая цифра здесь взята из раскрытия компании, рецензируемого исследования или опубликованного аудита со ссылкой на первоисточник; сопоставления между ними наши.

Опубликовано: 12:30 · 23.09.2026
Intokened.com

Автор

Intokened.com

Новости о криптовалютах и ​​искусственном интеллекте, анализ рынка и справочные руководства.

Комментарии (0)

Пока нет комментариев — будь первым!

Крипторынок производит шум. Мы присылаем сигнал

Письмо, ради которого стоит открыть почту