Loading prices...
Все новости
Плоская векторная иллюстрация небольшого светящегося многогранного кристалла, испускающего мощный луч света в сторону гораздо большей тусклой геометрической сферы на тёмно-синем фоне — символ компактной ИИ-модели, превосходящей куда более крупные модели-конкуренты

Qwen3.8-Flash-Next от Alibaba обходит модели крупнее за копейки

Команда Qwen из Alibaba выпустила Qwen3.8-Flash-Next, мультимодальную модель типа mixture-of-experts, построенную как превью архитектуры будущей Qwen4, сообщил The Decoder. Модель несёт 125 млрд параметров суммарно, но активирует лишь 6 млрд на токен, и это соотношение позволяет ей приближаться по результатам к куда более крупным и дорогим системам.

Часть этой эффективности даёт новый слой N-gram embedding, одно из архитектурных решений, запланированных уже для самой Qwen4. Слой хранит частые словосочетания как отдельные записи в подобии «словаря фраз» и может работать в обычной системной оперативной памяти вместо памяти GPU при относительно низких дополнительных затратах. Сам по себе он занимает 51 млрд параметров модели.

Qwen3.8-Flash-Next нативно работает с контекстным окном в 262 144 токена и может расширяться до одного миллиона токенов с помощью YaRN. Технический отчёт выложен на GitHub, а веса доступны на Hugging Face и ModelScope. Продакшн-версия поставляется как Qwen3.8-Flash через QwenCloud по цене $0,16 за миллион входных токенов и $0,47 за миллион выходных, а API должен заработать в ближайшее время.

История эффективности касается и самого обучения. Команда Qwen утверждает, что Flash-Next превосходит Qwen3.7-Plus, модель на 397 млрд параметров, активирующую 17 млрд параметров на токен, почти втрое больше, чем у Flash-Next, при этом обучение обошлось примерно в девять раз дешевле. Наибольший прирост приходится на задачи программирования и офисной работы.

Опубликованные бенчмарки Alibaba сравнивают Flash-Next с DeepSeek-V4-Flash (284 млрд параметров, 13 млрд активных) и Claude Opus 4.6 Max от Anthropic. Оба соперника крупнее, дороже или и то и другое сразу, но Flash-Next лидирует в большинстве протестированных задач.

Агентные бенчмарки по программированию, требующие от модели самостоятельно находить и исправлять баги в реальных программных проектах, показывают самый заметный отрыв. Flash-Next набрала 58,7 на DeepSWE и 62,5 на SWE-bench Pro, опередив и DeepSeek-V4-Flash, и Claude Opus 4.6. Разрыв ещё шире на офисных и продуктивных задачах: Flash-Next набрала 73,9 на CoWorkBench против 45,1 у DeepSeek-V4-Flash и 55,7 на JobBench, почти вдвое больше 27,6 у Qwen3.7-Plus. Научное мышление и соревновательное программирование остаются близкими по всем моделям: 91,7 на GPQA Diamond и 91,9 на LiveCodeBench v6.

  • Параметры: 125 млрд суммарно, 6 млрд активных на токен (Flash-Next); 51 млрд занимает один слой N-gram embedding
  • Контекстное окно: 262 144 токена нативно, до 1 млн через YaRN
  • DeepSWE: 58,7 у Flash-Next против более низких показателей Claude Opus 4.6 и DeepSeek-V4-Flash
  • CoWorkBench: 73,9 у Flash-Next против 45,1 у DeepSeek-V4-Flash
  • JobBench: 55,7 у Flash-Next против 27,6 у Qwen3.7-Plus
  • Цены QwenCloud: $0,16 за миллион входных токенов, $0,47 за миллион выходных

Claude Opus 4.6 вырывается вперёд на одном бенчмарке, Humanity's Last Exam, тесте на крайне сложные междисциплинарные задачи, но это уже более старый релиз Anthropic, выпущенный в феврале 2026 года.

Flash-Next уступает собственному текущему флагману Alibaba, Qwen3.8-Max, который вышел в начале августа и конкурирует с Claude Opus 4.8, Gemini 3.1 Pro и GPT-5.6 Sol. Intokened уже писал о том, насколько близко тот флагман подошёл к Claude Opus 4.8 при выходе, хотя Kimi K3 всё же обошёл обе модели по сырым баллам бенчмарков. Flash-Next показывает результаты чуть ниже самой Qwen3.8-Max, но стоит примерно в двенадцать раз дешевле: флагман обходится в $2,00 за миллион входных токенов и $6,00 за миллион выходных, против $0,16 и $0,47 у Flash-Next.

Такая цена продолжает давить на OpenAI и Anthropic снизу. Qwen3.8-27B уже собрала свою аудиторию за счёт локального запуска при сильных результатах и минимальных затратах, при наличии подходящего железа. OpenAI ответила крупными скидками на новую линейку GPT-5.6, шаг, выгодный пользователям, но работающий против быстрого роста выручки, который нужен ИИ-лабораториям, чтобы сохранить инвестиционную историю убедительной.

Материал носит информационный характер и не является инвестиционной рекомендацией.

Опубликовано: 23:40 · 26.08.2026
Maks

Автор

Maks

Трейдер

Долгое время интересуюсь рынком криптовалют, являюсь трейдером, пишу статьи и новости о своем опыте простыми словами.

Комментарии (0)

Пока нет комментариев — будь первым!