Вышел релиз vLLM v0.29.0 с архитектурой Model Runner V2 по умолчанию¶
8.0/10
Команда vLLM выпустила версию 0.29.0, в которой архитектура Model Runner V2 (MRV2) сделана стандартом по умолчанию для всех моделей. В новом релизе реализовано профилирование памяти CUDA Graph для автоматического выбора размера KV-кэша, а также разделенное по батчам сэмплирование (batch-sharded sampling), сокращающее объем памяти для логитов пропорционально размеру Tensor Parallelism (1/TP). Добавлена поддержка новых моделей и архитектур, включая Hy4-preview, Qwen3.8-Flash-Next, GraniteSWA, NemotronH_Omni_Reasoning_V3 и чекпоинты Kimi K3 NVFP4. Релиз содержит значительные оптимизации производительности для Kimi-K3 и DeepSeek V4, ускорение префиксного кэширования Mamba на 9–25% по метрике TTFT, а также синхронизацию весов для обучения с подкреплением (RL) через бэкенд sharded_rdt. Изменения по умолчанию включают включение FlashInfer all-reduce для CUDA-групп TP и прекращение поддержки десяти устаревших архитектур моделей и входного модуля python -m vllm.entrypoints.openai.api_server в пользу vllm serve.
Контекст¶
vLLM — это открытый движок для высокопроизводительного инференса и обслуживания больших языковых моделей. Компонент Model Runner отвечает за подготовку входных данных, выполнение нейросети и сэмплирование токенов в процессе генерации. Архитектурное обновление Model Runner V2 было разработано для устранения ограничений первого поколения, упрощения работы со сложными тензорами состояния и повышения общей модульности системы [tool-1-1, tool-1-2, tool-1-3].
Влияние на разработчиков и инфраструктуру¶
Команды развертывания LLM смогут существенно сократить использование видеопамяти при обработке логитов на распределенных системах и ускорить время выдачи первого токена. При этом пользователям необходимо перевести скрипты запуска на точку входа vllm serve и учитывать удаление ряда устаревших архитектур моделей.
Технические детали и оптимизации¶
Для моделей Kimi-K3 и DeepSeek V4 добавлена оптимизация объединения финального top-k MXFP4 в хвостовой части K3, снижающая сквозную задержку примерно на 5%, а также подготовка метаданных Mamba за один запуск ядра Triton с ускорением ядра в 6.6–7.6 раза. В спекулятивном декодировании реализована сбор статистики принятых токенов на запрос через флаг --per-request-spec-decode-metrics в OpenAI API и выравнивание вызовов FULL cudagraph. Синхронизация весов RL получила P2P-бэкенд sharded_rdt, позволяющий каждому воркеру забирать только свой срез TP/EP через NIXL или Ray Direct Transport, а также локальные IPC-обновления весов. Для мультимодальных моделей реализован полный CUDA graph для ViT в Idefics3 и SmolVLM, исключено дублирующее вещание тензоров при попадании в кэш префиксов и добавлена поддержка видео-эмбеддингов в Python frontend. Кроме того, из дистрибутива удален бэкенд видеодекодера PyAV, а Olmo3, FlexOlmo и Hunyuan V1/VL мигрировали на официальный бэкенд Transformers.
Источники
Покрытие источниками¶
Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.
-
Найдена запись о релизе
Вышел релиз vLLM v0.29.0 с архитектурой Model Runner V2 по умолчанию
- github.com · подтверждает · первоисточник
- github.com · подтверждает · первоисточник
-
Поддерживается прямым источником
В новом релизе реализовано профилирование памяти CUDA Graph для автоматического выбора размера KV-кэша, а также разделенное по батчам сэмплирование (batch-sharded sampling), сокращающее объем памяти для логитов пропорционально размеру Tensor Parallelism (1/TP).
- github.com · подтверждает · компетентная запись
- github.com · подтверждает · компетентная запись
-
Предварительно: новость слишком свежая
Изменения по умолчанию включают включение FlashInfer all-reduce для CUDA-групп TP и прекращение поддержки десяти устаревших архитектур моделей и входного модуля python -m vllm.entrypoints.openai.api_server в пользу vllm serve.
- github.com · подтверждает · заинтересованная сторона