
Лучшая модель по математике вышла побочным продуктом, 120 задач открыты
GPT-6 Astra от OpenAI возглавила ErdosBench — бенчмарк из открытых математических задач, который ведёт ulam.ai, пишет The Decoder. Главный научный сотрудник компании говорит, что математику при обучении не приоритизировали, — значит, лучшая математическая модель вышла побочным эффектом работы, нацеленной на другое.
Таблица результатов:
- 226 открытых задач в наборе, вдохновлённых проблемами Эрдёша.
- Astra: оценка 3,23, решено 106 задач, 43 из них полностью, 27 опровергнуто.
- GPT-5.6 Sol на максимальном рассуждении: оценка 3,12, решено 78 задач.
Из этой таблицы выходят два верных предложения, и рассказывают они разное. Astra решила на 35,9% больше задач, чем Sol. Astra набрала на 3,5% больше баллов, чем Sol. Первое число в десять раз больше второго, и оба описывают одну и ту же пару моделей.
Автор бенчмарка Пшемек Хоецкий оценил прибавку в солидные 5–10% по проверяемым исследовательским навыкам — это между нашими двумя цифрами и выше разрыва в баллах. Он же говорит, что до насыщения бенчмарку далеко. Это легко проверить: 120 задач из 226 остаются открытыми после того, как лучшая модель мира по ним прошлась.
Лаборатория целилась не сюда
Якуб Пахоцкий, главный научный сотрудник OpenAI, объяснил пропуск в эссе под названием An Alien Mind.
“Мы считаем, что могли бы сделать модели лучше именно в математических исследованиях, если бы уделили этому дополнительное внимание, но мы не приоритизируем это направление из-за срочности, которую ощущаем в отношении рекурсивного самоулучшения и автоматизированных исследований по выравниванию.”
— Якуб Пахоцкий, Эссе An Alien Mind, в изложении The Decoder, 10 сентября 2026 года
Якуб Пахоцкий, OpenAI, в изложении The Decoder, 10 сентября 2026 года
RSI здесь — рекурсивное самоулучшение, идея направить модель на её собственное обучение. Бюджет оптимизации OpenAI тратит туда и на автоматизированную работу по выравниванию, аргументируя тем, что только это удерживает её на переднем крае.
Пахоцкий признаёт развилку, и это признание — самое полезное здесь. Способности растут там, куда лаборатория направляет вычисления, поэтому сила в одной области покупается отказом давить в другой. Кембриджский исследователь Адам Хант рисует для этого две формы: пологую кривую, где модель понемногу подбирается ко всем человеческим задачам сразу, и шипастую, где система возвышается в коде и математике, а качество языка, здравый смысл и социальное рассуждение стоят на месте.
Доказательств не мало, а много
Шипастая система — не то, что большинство называет AGI, и послужной список самой Astra в эту форму укладывается. Она возглавила математическую таблицу, под которую её не затачивали, умеет собирать кибератаки без участия человека, а ещё вчера та же лаборатория ставила условия для соавторства в математическом результате.
У математиков под первой проблемой лежит вторая. Теренс Тао сказал в этом году на Международном конгрессе математиков: если модели выдают доказательства быстрее, чем люди успевают их проверять, дисциплина переходит от дефицита доказательств к их избытку, и дефицитным ресурсом становится суждение о том, какие результаты важны.
Тао сравнивает момент с основаниями математики начала двадцатого века. Пока что самые трудные задачи стоят, и 120 из них лежат в одном бенчмарке ничьими.
Ничего из вышеперечисленного не стоит воспринимать как персональную инвестиционную рекомендацию.

Комментарии (0)
Пока нет комментариев — будь первым!
Крипторынок производит шум. Мы присылаем сигнал
Письмо, ради которого стоит открыть почту
Похожие материалы
ПопулярноеТоп 7
Крипторынок теряет 4-5% за день: что говорят объёмы и трейдеры
73Рынок





