Бенчмарк Qwen 3.8 Next на кластере 6x V100 с TP2 PP3 и MTP¶
6.0/10
Энтузиаст успешно запустил модель Qwen 3.8 Next на риге из 6 видеокарт NVIDIA V100 в конфигурации TP2 PP3, используя кастомный движок 1cat-vllm после сбоев из-за OOM в sglang-v100 и pxa. При выделенной памяти под KV-кэш в 8,78 GiB (531 288 токенов) скорость префилла масштабировалась от 1 389 tok/s на контексте 1K до пиковых 4 679 tok/s на 16K, снижаясь до 2 759 tok/s на 131K токенов. Использование спекулятивного декодирования MTP (Multi-Token Prediction) с параметром speculative=1 почти удвоило среднюю скорость генерации с 22,59 до 42,70 tok/s без превышения лимитов памяти, при этом стресс-тест показал стабилизацию температур на уровне 64°C при 76% оборотов кулеров.
Метод оптимизации¶
Развертывание модели Qwen 3.8 Next на кластере из шести Nvidia V100 реализовано с помощью движка 1cat-vllm, адаптированного под архитектуру SM70, в конфигурации гибридного параллелизма TP2 PP3. Ускорение генерации достигается за счет спекулятивного декодирования Multi-Token Prediction (MTP) с шагом speculative=1, где модель выполняет верификацию предсказанных кандидатов за проход. Глубина спекуляции жестко ограничена одним токеном, так как значение speculative=2 приводило к исчерпанию памяти (OOM), что позволило сохранить стабильный пул KV-кэша объемом 8,78 ГиБ (531 288 токенов).
Прирост эффективности¶
Спекулятивное декодирование MTP с шагом speculative=1 обеспечило прирост пропускной способности генерации в 1,89x (с 22,23–22,86 до 41,34–43,38 tok/s на длинах ответов от 128 до 2048 токенов). При этом размер KV-кэша позволил поддерживать конкурентность 2,03x для контекста 262 144 токена на запрос в рамках доступных 8,78 GiB памяти GPU.