Вышел vLLM v0.27.0: поддержка Kimi K3, PyTorch 2.13 и FlashAttention 4¶
9.0/10
Проект vLLM выпустил версию v0.27.0, включающую 561 коммит от 242 участников, из которых 64 — новые контрибьюторы. Ключевые изменения: полная поддержка модели Kimi K3 (включая ядро, Python/Rust-фронтенды, AttnRes-кернелы, DeepGEMM и квантованные чекпоинты), добавление новых моделей — Qwen3.5, K-EXAONE-2.0-750B-A37B, VaultGemma и jina-embeddings-v5-text-nano. Выполнено обновление до PyTorch 2.13.0, torchvision 0.28.0 и Triton 3.7.1, что является ломающим изменением окружения; XPU и CPU также переведены на torch 2.13. Расширена интеграция FlashAttention 4 на SM100: добавлены поддержка FP8 KV-кэша и headdim-256, а также новая инфраструктура JIT-warmup, устраняющая задержки компиляции при первом запросе.
Контекст¶
vLLM — это высокопроизводительный движок инференса и обслуживания больших языковых моделей, широко используемый для продакшн-систем генеративного ИИ. Релиз v0.27.0 продолжает линию частых крупных обновлений проекта, в которых одновременно добавляются новые архитектуры моделей, обновляются зависимости уровня PyTorch/Triton и расширяется поддержка современных механизмов внимания и аппаратных платформ. В этом выпуске особое внимание уделено стеку Kimi K3, переходу на PyTorch 2.13.0 и более глубокой интеграции FlashAttention 4 на GPU класса SM100.
Влияние¶
Для операторов и разработчиков систем инференса vLLM v0.27.0 означает необходимость обновления окружения из-за ломающего перехода на PyTorch 2.13.0, torchvision 0.28.0 и Triton 3.7.1, но взамен даёт поддержку Kimi K3 и новых моделей, а также измеримые улучшения для DeepSeek-V4, включая рост производительности отдельных ядер примерно в 2 раза и снижение TTFT на 3,4–3,9%. Для продакшен-развёртываний также важны новые механизмы отказоустойчивости для DP+EP и расширение Model Runner V2 на негенеративные нагрузки, что затрагивает embedding, классификацию и мультимодальные сценарии.
Проверка фактов¶
Утверждение о том, что релиз vLLM v0.27.0 содержит 561 коммит от 242 участников, включая 64 новых, подтверждается GitHub-страницей релизов vllm-project/vllm и зеркальными публикациями на NewReleases.io и freedom.tech. Ключевое утверждение о полноценной поддержке Kimi K3 в одном релизе также подтверждается официальным списком релизов GitHub, где перечислены связанные компоненты и номера PR. Конкретные количественные улучшения для DeepSeek-V4, такие как ~2x ускорение ядра и проценты снижения TTFT, независимыми источниками в полученных результатах не проверялись и остаются неподтверждёнными вне самих заметок о релизе.
Технические детали¶
Для DeepSeek-V4 реализованы sequence parallelism, ускорение кернелов до 1.88x, снижение E2E TTFT на 3.4–3.9% и экономия 448 MiB GPU-памяти в PP-буфере. Model Runner V2 расширен на негенеративные нагрузки: encoder-only attention, sequence pooling для эмбеддингов и классификации, BGE-M3 pooling и мультимодальность на CPU. Добавлены механизмы отказоустойчивости для DP+EP с внешним балансировщиком и асинхронная подготовка к эластичному EP-масштабированию. Rust-фронтенд получил gRPC control plane с health reporting, abort control и обнаружением моделей. Также включена ранняя поддержка NVIDIA Rubin (sm_107) и AMD ROCm gfx1250.