Qwen 3.8 2.4T: 288K токенов/с на Nvidia GB300 NVL72¶
6.0/10
NVIDIA в блоге разработчика сообщила об обслуживании заявленной 2.4T-параметровой модели Qwen на системе GB300 NVL72 с агрегированной пропускной способностью свыше 288K токенов/с (более 4K токенов/с на каждый из 72 GPU) и более 350 токенов/с на пользователя. Инференс выполняется в точности FP8 на Day 0 без дополнительной настройки модели, а дальнейшие оптимизации, включая NVFP4, должны повысить производительность со временем. Результат интересен как эталон для сверхбольших LLM на новом оборудовании, но опубликован вендором и не подкреплён независимым анализом сообщества.
Контекст¶
NVIDIA GB300 NVL72 — это стоечная система на базе 72 GPU архитектуры Blackwell, связанных через NVLink, ориентированная на масштабный инференс больших языковых моделей. Qwen — семейство LLM от Alibaba, среди которых фигурирует версия с заявленными 2.4T параметров, требующая значительных вычислительных ресурсов.
Влияние¶
Владельцы кластеров GB300 NVL72 получают возможность на Day 0 запускать 2.4T-модель Qwen с высокой удельной пропускной способностью в FP8 без доработки модели. Заявленные будущие улучшения в NVFP4 пока не подтверждены независимыми замерами.
Обсуждение сообщества¶
Комментарии на Reddit носят исключительно саркастический характер: пользователи шутят о покупке системы за миллионы долларов или наличии её в чулане и не приводят технического разбора.