Релиз Intel OpenVINO 2026.4: ускорение инференса с MTP, EAGLE3 и DFlash¶
5.0/10
В релизе OpenVINO 2026.4 компонент OpenVINO GenAI получил поддержку спекулятивного декодирования Multi-Token Prediction (MTP) для моделей Gemma 4, Qwen 3.5 и Qwen 3.6 на CPU и GPU, а также метод Tree Drafting (Top-K) для EAGLE3, повышающий пропускную способность VLM-пайплайнов по сравнению с Chain Drafting (Top-1). Для процессоров Intel Core Ultra Series 3 представлены оптимизации встроенной графики Xe3 под длинные контексты в семействе Gemma 4 и предварительная поддержка ускорения DFlash для архитектур Qwen на GPU. Дополнительно в OpenVINO Model Server появилась предварительная функция выгрузки неиспользуемых моделей для освобождения памяти, однако конкретные числовые бенчмарки пропускной способности (tok/s) и задержки в анонсе релиза не приведены.
Методы оптимизации инференса¶
В OpenVINO GenAI реализована спекулятивная генерация Multi-Token Prediction (MTP) для архитектур Gemma 4, Qwen 3.5 и Qwen 3.6 на CPU и GPU, обеспечивающая параллельную верификацию токенов-кандидатов без деградации точности исходных весов. Для мультимодальных пайплайнов (VLM) добавлен механизм древовидного драфтинга Tree Drafting (Top-K) в рамках EAGLE3, исследующий дерево гипотез вместо линейного цепочечного драфтинга (Top-1) для максимизации коэффициента принятия токенов за итерацию. Дополнительно стек оптимизирован под встроенную графику Xe3 в процессорах Intel Core Ultra Series 3 для обработки длинного контекста Gemma 4 и дополнен превью ускорения DFlash с оптимизацией визуальных токенов.
Эффективность и оптимизация ресурсов¶
Внедрение спекулятивного декодирования MTP, древовидного драфтинга EAGLE3 и механизма выгрузки простаивающих моделей в OpenVINO Model Server снижает задержку ответов и оптимизирует распределение памяти, хотя точные количественные показатели экономии ресурсов вендор пока не опубликовал.