Перейти к содержанию

Оптимизация раздельного Prefill/Decode-сервинга Qwen3.8-2.4T в vLLM на GB300 NVL72

6.0/10

Команда vLLM представила методику настройки и замеры производительности дезагрегированного Prefill/Decode (PD) сервинга для модели Qwen3.8-2.4T (NVFP4 MoE с BF16 GDN и Full-Attn слоями) на кластере GB300 NVL72 при нагрузке ISL/OSL 8192/1024. В конфигурации с максимальной пропускной способностью движок продемонстрировал до 5000 токенов общей пропускной способности на GPU, а в низколатентном сценарии достиг скорости 180 сгенерированных токенов в секунду на пользователя при сохранении точности 95% на бенчмарке GSM8K. Представленный пайплайн проектирования границы Парето объединяет независимый подбор топологий тензорного/экспертного параллелизма, точное статическое выделение памяти под CUDA-графы и согласование размера блоков KV-кэша.

Метод оптимизации

Гибридная архитектура модели требует раздельного учета состояний: Full-Attn занимает 2 КиБ на токен на слой, тогда как GDN требует фиксированные 4216 КиБ на весь запрос (Conv и SSM состояния), из-за чего размер блока KV-кэша был выровнен до 2112 токенов (4,125 МиБ) для совместимости передачи между узлами префилла и декода. Для декода использовались изолированные топологии 1×TEP8 и 1×TP4DP4+EP со спекулятивным декодированием MTP на 3 токена, а префилл балансировался масштабированием до четырех эндпоинтов TP2DP4+EP. Предварительная калибровка резерва под пиковые активации eager-режима и статическая оценка пула CUDA-графов позволили точно максимизировать объем видеопамяти, остающийся под KV-кэш.

Прирост эффективности

Дезагрегированная схема позволила масштабировать параллельную обработку до 2560 запросов, обеспечив выбор между экстремальной плотностью в 5000 токенов/с на один GPU и интерактивным режимом с задержкой генерации 180 токенов/с на пользователя.