Релиз vLLM v0.30.0: Model Runner V2, трехуровневый KV-кэш HiSparse и поддержка MXFP8¶
8.0/10
В релизе движка vLLM v0.30.0 представлен фреймворк Model Runner V2 с поддержкой совмещения двух батчей (dual-batch overlap), интеграцией спекулятивного декодирования (MTP, EAGLE3, DFlash) в пайплайн-параллелизме и адаптивной верификацией драфт-моделей. Архитектура KV-кэша получила поддержку формата MXFP8 через FlashMLA V4.1 для чипов NVIDIA SM100, а также механизм многоуровневого оффлоадинга HiSparse, сбрасывающий страницы разреженного MLA-кэша в память хоста. На ускорителях NVIDIA H200 заморозка сборщика мусора при захвате CUDA-графов сократила время захвата с 12 до 2 с, снизив общую задержку инициализации движка с 28,9 до 8,2 с. Для архитектуры Kimi K3 оптимизация групповой вставки в FP8 MLA-кэш ускорила выполнение ядра в 4–6 раз на малых батчах, а исключение KDA gather/scatter подняло сквозную пропускную способность на 5,2–7,7%.
Технические механизмы оптимизации¶
Архитектура оффлоадинга HiSparse управляется через `HiSparseConnector`: при дефиците VRAM страницы KV-кэша Sparse-MLA вытесняются в pinned-память хоста (с возможностью шаринга между рангами TP), а промахи выборки top-k обслуживаются через выделенный hot-буфер видеопамяти запроса. Демон Fast Start кэширует квантованные и разделенные по тензорному параллелизму веса (включая FP4) прямо в GPU-памяти и передает их новым процессам движка через CUDA IPC с флагом `--load-format ipc_cache`, полностью минуя дисковый ввод-вывод. В Model Runner V2 также реализовано сжатие `--return-sampling-mask` непосредственно на GPU, что устранило двукратную регрессию времени шага при обучении с подкреплением.
Прирост производительности и экономия ресурсов¶
Инициализация инференс-сервера на H200 ускорилась более чем в 3,5 раза (с 28,9 до 8,2 с), а ядро DSV3 GEMM для strided-тензоров получило ускорение от 12% до 81%. Использование квантованных форматов MXFP8 и NVFP4 (`nvfp4_fp8_ds_mla`) кардинально снижает расход видеопамяти под контекст длинных сессий на новейших ускорителях класса SM100 и GB300.