Перейти к содержанию

llama.cpp b11132: поддержка draft-моделей Gemma 4 DSpark для спекулятивного декодирования

4.0/10

В релизе инференс-движка llama.cpp b11132 добавлена поддержка GGUF-конвертации и среды выполнения для draft-бэкбонов Gemma 4 DSpark, предназначенных для ускорения генерации методом спекулятивного декодирования (PR #29226). Обновление обеспечивает исполнение архитектур с полным вниманием (full-attention) и скользящим окном внимания (SWA), включая работу со связанными выходными весами (tied output weights) и булевыми метаданными бэкбона. Кроме того, в компоненте dflash реализован автоматический вывод характеристик draft-моделей Gemma из метаданных, однако официальные бенчмарки ускорения (tok/s) и замеры задержек в данном выпуске не опубликованы.

Механизм спекулятивного декодирования DSpark для Gemma 4

В релизе llama.cpp реализована конвертация в GGUF и рантайм-поддержка драфт-архитектур Gemma 4 для спекулятивного декодирования DSpark, включая варианты с полным вниманием (full-attention) и скользящим окном внимания (SWA). Метод расширяет подход DFlash с помощью полуавторегрессионного марковского блока, генерирующего пачку токенов за один прямой проход с последующей коррекцией логитов низкоранговым смещением по цепочке `tool-2-1`. Архитектурная поддержка в рантайме также включает привязку весов выхода (tied output weights) и автоматический вывод признаков драфта Gemma из булевых метаданных бэкбона.

Источники