vLLM v0.28.0: оптимизации для Kimi-K3 и DeepSeek V4¶
8.0/10
Вышел vLLM v0.28.0 — крупный релиз открытого движка инференса LLM, собравший 584 коммита от 270 контрибьюторов (76 новых). Основная работа направлена на ускорение Kimi-K3 и DeepSeek V4: добавлены fused FlashKDA-ядра, поддержка DCP и SiTU, sparse MLA для DeepSeek V4, а также улучшения спекулятивного декодирования (DFlash2, DSpark confidence-scheduled verification). Kimi-K3 получил ROCm-поддержку через V2 model runner, DeepSeek V4 — ROCm на gfx11 и gfx950; комбинированные all-gather дают ускорение на уровне ядер в 1,5–3 раза, а адаптивный бюджет спекулятивных токенов улучшает DSpark TTFT примерно на 60%. В релизе изменены дефолты (max_num_batched_tokens поднят с 8192 до 16384, prefix caching включён для Mamba) и есть ломающие изменения: bitsandbytes вынесен в отдельный плагин, Transformers обновлён до 5.15.0, удалены calculate_kv_scales и override_attention_dtype.
Контекст¶
vLLM — популярный open-source движок для высокопроизводительного инференса больших языковых моделей, часто используемый для развёртывания OpenAI-совместимых API. Kimi-K3 и DeepSeek V4 — крупные модели, для которых важны эффективные kernels, спекулятивное декодирование и поддержка разных аппаратных платформ; vLLM регулярно выпускает версии с оптимизациями под новые модели и железо.
Влияние¶
Для инженеров, разворачивающих Kimi-K3 и DeepSeek V4, релиз даёт измеримые улучшения производительности (например, ~60% к TTFT при DSpark и экономия ~17 GiB на GPU при шардировании shared-экспертов), но требует учёта ломающих изменений: bitsandbytes теперь подключается как внешний плагин, а Transformers обновлён до 5.15.0.
Подробности¶
Среди новых моделей — Muse Glimmer, Ling 3.0 Flash (включая FP8 и гибридные MXFP4 routed experts), Dots3 NOTE с нативной мультимодальностью и Interns2mobius; для Qwen добавлены ROCm-поддержка Qwen3.8, fused CUDA post-conv MTP decode kernel для Qwen3.5 GDN и исправления text-only чекпоинтов. В Model Runner V2 появились E/P/D-дизагрегация, offloading весов, multi-layer MTP KV cache, encoder CUDA graphs и поддержка thinking_token_budget. Tiered KV cache offloading теперь включает дисковую выгрузку, внешние secondary-tier менеджеры через module_path и метрики тиринга. В engine core устранены GPU<->CPU синхронизации на execution path (с CI-проверкой), добавлен JIT warmup с predicate filtering, top-k/top-p Triton sampler запускается с 8 warps, а HF-ревизии резолвятся в commit hash один раз за загрузку модели. Для стартапа улучшена надёжность: file:// rendezvous для одноузловых executor'ов убирает гонки портов, frontend-процессы отслеживаются при запуске движка, исправлен livelock get_open_port().
Покрытие источниками¶
Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.
-
Только данные автора или производителя
vLLM v0.28.0: оптимизации для Kimi-K3 и DeepSeek V4
- github.com · подтверждает · первоисточник
- vllm.ai · контекст · первоисточник
- vllm-project.github.io · контекст · первоисточник
- vllm.ai · контекст · первоисточник
- freedom.tech · контекст · независимая публикация
-
Найдена запись о релизе
Вышел vLLM v0.28.0 — крупный релиз открытого движка инференса LLM, собравший 584 коммита от 270 контрибьюторов (76 новых).
- github.com · подтверждает · первоисточник
- github.com · подтверждает · первоисточник
- releasealert.dev · подтверждает · независимая публикация
-
Предварительно: новость слишком свежая
Основная работа направлена на ускорение Kimi-K3 и DeepSeek V4: добавлены fused FlashKDA-ядра, поддержка DCP и SiTU, sparse MLA для DeepSeek V4, а также улучшения спекулятивного декодирования (DFlash2, DSpark confidence-scheduled verification).
- github.com · подтверждает · первоисточник
- vllm.ai · контекст · первоисточник
- github.com · подтверждает · первоисточник
- vllm-project.github.io · контекст · первоисточник