Loading prices...
Все новости
Поле закрытых глиняных сфер, один ряд треснул и из него поднимаются зелёные ростки

Лучшая модель по математике вышла побочным продуктом, 120 задач открыты

GPT-6 Astra от OpenAI возглавила ErdosBench — бенчмарк из открытых математических задач, который ведёт ulam.ai, пишет The Decoder. Главный научный сотрудник компании говорит, что математику при обучении не приоритизировали, — значит, лучшая математическая модель вышла побочным эффектом работы, нацеленной на другое.

Таблица результатов:

  • 226 открытых задач в наборе, вдохновлённых проблемами Эрдёша.
  • Astra: оценка 3,23, решено 106 задач, 43 из них полностью, 27 опровергнуто.
  • GPT-5.6 Sol на максимальном рассуждении: оценка 3,12, решено 78 задач.

Из этой таблицы выходят два верных предложения, и рассказывают они разное. Astra решила на 35,9% больше задач, чем Sol. Astra набрала на 3,5% больше баллов, чем Sol. Первое число в десять раз больше второго, и оба описывают одну и ту же пару моделей.

Автор бенчмарка Пшемек Хоецкий оценил прибавку в солидные 5–10% по проверяемым исследовательским навыкам — это между нашими двумя цифрами и выше разрыва в баллах. Он же говорит, что до насыщения бенчмарку далеко. Это легко проверить: 120 задач из 226 остаются открытыми после того, как лучшая модель мира по ним прошлась.

Лаборатория целилась не сюда

Якуб Пахоцкий, главный научный сотрудник OpenAI, объяснил пропуск в эссе под названием An Alien Mind.

Мы считаем, что могли бы сделать модели лучше именно в математических исследованиях, если бы уделили этому дополнительное внимание, но мы не приоритизируем это направление из-за срочности, которую ощущаем в отношении рекурсивного самоулучшения и автоматизированных исследований по выравниванию.

Якуб Пахоцкий, Эссе An Alien Mind, в изложении The Decoder, 10 сентября 2026 года

Якуб Пахоцкий, OpenAI, в изложении The Decoder, 10 сентября 2026 года

RSI здесь — рекурсивное самоулучшение, идея направить модель на её собственное обучение. Бюджет оптимизации OpenAI тратит туда и на автоматизированную работу по выравниванию, аргументируя тем, что только это удерживает её на переднем крае.

Пахоцкий признаёт развилку, и это признание — самое полезное здесь. Способности растут там, куда лаборатория направляет вычисления, поэтому сила в одной области покупается отказом давить в другой. Кембриджский исследователь Адам Хант рисует для этого две формы: пологую кривую, где модель понемногу подбирается ко всем человеческим задачам сразу, и шипастую, где система возвышается в коде и математике, а качество языка, здравый смысл и социальное рассуждение стоят на месте.

Доказательств не мало, а много

Шипастая система — не то, что большинство называет AGI, и послужной список самой Astra в эту форму укладывается. Она возглавила математическую таблицу, под которую её не затачивали, умеет собирать кибератаки без участия человека, а ещё вчера та же лаборатория ставила условия для соавторства в математическом результате.

У математиков под первой проблемой лежит вторая. Теренс Тао сказал в этом году на Международном конгрессе математиков: если модели выдают доказательства быстрее, чем люди успевают их проверять, дисциплина переходит от дефицита доказательств к их избытку, и дефицитным ресурсом становится суждение о том, какие результаты важны.

Тао сравнивает момент с основаниями математики начала двадцатого века. Пока что самые трудные задачи стоят, и 120 из них лежат в одном бенчмарке ничьими.

Ничего из вышеперечисленного не стоит воспринимать как персональную инвестиционную рекомендацию.

Опубликовано: 18:20 · 10.09.2026
Maks

Автор

Maks

Трейдер

Долгое время интересуюсь рынком криптовалют, являюсь трейдером, пишу статьи и новости о своем опыте простыми словами.

Комментарии (0)

Пока нет комментариев — будь первым!

Крипторынок производит шум. Мы присылаем сигнал

Письмо, ради которого стоит открыть почту