Релиз MTP для Qwen3.8-Flash-Next-GGUF и оптимизация llama.cpp¶
7.0/10
В репозитории unsloth/Qwen3.8-Flash-Next-GGUF опубликованы MTP-веса для Qwen3.8-Flash-Next-GGUF. Пользователь сообщества сообщил, что в llama.cpp уже вмержен PR #28123 с оптимизациями, которые значительно ускоряют инференс с MTP. По приведённым замерам, без черновика скорость составляет 108 ток/с, до изменений MTP давал 123 ток/с на коде и 83 ток/с на прозе, а после — 183 ток/с на коде и 144 ток/с на прозе. Отмечается, что до этого изменения MTP на прозе был медленнее, чем отказ от черновика. Это практическое улучшение для локального инференса LLM.
Предыстория¶
Qwen3.8-Flash-Next — это открытая мультимодальная MoE-модель на 125 млрд параметров (6 млрд активных на токен) на новой архитектуре Qwen4 с контекстом 262K токенов; она доступна для локального запуска через GGUF-квантования, в том числе от Unsloth. В этих GGUF сохранены тензоры blk.*.nextn.*, соответствующие обученным Qwen слоям multi-token prediction (MTP/nextn), которые llama.cpp без специальной поддержки просто игнорировал. В llama.cpp добавили спекулятивное декодирование draft-MTP (PR #22673, июль 2026): сервер генерирует черновые токены встроенной головой и проверяет их основной моделью, поэтому принятые черновики обходятся значительно дешевле полного прохода.
Влияние¶
Для пользователей, запускающих Qwen3.8-Flash-Next-GGUF локально, включение MTP после этого изменения может дать заметный прирост ток/с, особенно на код-нагрузках, но результат зависит от конкретной нагрузки и окружения.
Обсуждение¶
В комментариях отмечают, что оптимизация уже вмержена и даёт существенный прирост, а также задают вопросы о поддержке SSD-offload, о разнице между shared и не-shared вариантами MTP и о том, доступны ли эти файлы уже несколько дней.
Источники
Покрытие источниками¶
Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.
-
Только данные автора или производителя
Релиз MTP для Qwen3.8-Flash-Next-GGUF и оптимизация llama.cpp
- huggingface.co · контекст · первоисточник