Loading prices...
Все новости
Четыре светящиеся стальные плиты за переполненной скамьёй с маленькими стеклянными фигурами

Четыре B200 обслуживают сорок человек — и это уже после оптимизации

Nvidia опубликовала цифры обслуживания Nemotron 3 Ultra на четырёх ускорителях B200, и полезная цифра там не та, что вынесена в заголовок. Полезная — сколько человек помещается в одну машину.

Замер при фиксированной интерактивности в 20 миллисекунд между токенами:

  • Базовый стек обслуживания: 718 выходных токенов в секунду на четырёх ускорителях.
  • Оптимизированный стек NIM 2.0.12: 1997 токенов в секунду на том же железе.
  • При 50 токенах в секунду на пользователя это 14 одновременных пользователей против 40.

Сорок одновременных пользователей на четырёх ускорителях Blackwell — после всех оптимизаций, которые смогли применить собственные инженеры Nvidia. До оптимизаций — четырнадцать. Это та самая модель, которая лежит в основании суверенного стека Palantir, объявленного на этой неделе.

Заголовок занижает собственную таблицу, и это достаточно необычно, чтобы отметить. Разделите 1997 на 718 — выйдет 2,78, а в названии стоит 2,5x. Nvidia округляет вниз, скорее всего потому, что кривая Парето даёт разные отношения при разных целях по задержке, а 50 токенов на пользователя — лишь одна точка на ней.

Часть работы делает сам профиль нагрузки

Профиль нагрузки здесь значит не меньше железа. В бенчмарке контекстное окно на 64 тысячи токенов, 400 выходных токенов и 76% переиспользования кэша ключей и значений между запросами. Такое высокое переиспользование реалистично для агентного трафика, где один и тот же длинный промпт возвращается шаг за шагом, и в результате оно делает настоящую работу. На трафике без такого переиспользования тот же стек показал бы меньший прирост.

Nvidia говорит об этом сама — фразой, которую большинство поставщиков опускает.

Опубликованные кривые — это отправная точка, а не обещание, что каждое приложение получит такой же результат.

NVIDIA, Технический блог, 10 сентября 2026 года

Технический блог NVIDIA, 10 сентября 2026 года

550 млрд параметров, срабатывают 55

Команда бенчмарка в посте называет модель полностью: nemotron-3-ultra-550b-a55b. Это 550 млрд параметров, из которых 55 млрд активны на токен, — схема со смесью экспертов, где тензорный параллелизм раскладывает веса по всем четырём ускорителям, а срабатывает на каждом токене лишь десятая их часть.

Поставьте это рядом с другой цифрой, которую Nvidia выложила в тот же день. На её же еженедельной задаче о распределении материалов Nemotron на 30 млрд параметров обошёл этот флагман на 550 млрд на 31 пункт. Сопоставимых цифр обслуживания для маленькой модели Nvidia не даёт, так что сказать, сколько пользователей она держит на машину, мы не можем, — а именно это сравнение и нужно эксплуатации.

Инженерия здесь настоящая: автоподобранные ядра под слои смеси экспертов и Mamba, префиксное кэширование с частичным совпадением, настройка планировщика и памяти, спекулятивное декодирование. Никакого фокуса, и всё это упаковано так, чтобы команда не начинала с пустой конфигурации рантайма.

Что пост тихо устанавливает, так это форму издержек. Отдать фронтирную открытую модель сорока людям на отзывчивой скорости стоит четырёх самых дорогих ускорителей на рынке и стека, настроенного теми, кто делал чип. Кто собирается держать такое у себя, должен прогнать собственный трафик прежде, чем верить кривой, — ровно это Nvidia и советует через AIPerf.

Текст написан в информационных целях и не призывает к конкретным инвестиционным решениям.

Опубликовано: 04:30 · 11.09.2026
Maks

Автор

Maks

Трейдер

Долгое время интересуюсь рынком криптовалют, являюсь трейдером, пишу статьи и новости о своем опыте простыми словами.

Комментарии (0)

Пока нет комментариев — будь первым!

Крипторынок производит шум. Мы присылаем сигнал

Письмо, ради которого стоит открыть почту