Поддержка Multi-Token Prediction для Qwen Flash Next в llama.cpp¶
4.0/10
В проекте llama.cpp был принят пулл-реквест #29761 от разработчика am17an, добавивший поддержку спекулятивного декодирования через Multi-Token Prediction (MTP) для моделей архитектуры Qwen Flash Next. Изменение позволяет задействовать MTP-головы в квантованных сборках формата GGUF (в частности, для релиза Qwen3.8-Flash-Next-GGUF) непосредственно в среде llama.cpp. Эмпирические замеры пропускной способности (tok/s), времени до первого токена (TTFT) и детальные бенчмарки в исходной публикации не приводятся.
Механизм оптимизации¶
Пулл-реквест интегрирует нативную вспомогательную голову прогнозирования NextN/MTP архитектуры Qwen3.8-Flash-Next (qwen4exp) в существующий конвейер спекулятивного декодирования llama.cpp [tool-1-2, tool-1-3]. Данная схема исключает необходимость в отдельной модели-черновике (draft model), генерируя кандидаты следующих токенов непосредственно собственными слоями архитектуры с их последующей параллельной верификацией основным телом модели за один шаг инференса [tool-1-2, tool-1-3].