Прунинг MoE и NVFP4: релиз модели Victoria с генерацией до 280 токенов/с¶
6.0/10
В сообществе представлена модель Victoria на базе Qwen3.8-Flash-Next, в которой с помощью метода REAP число MoE-экспертов было сокращено на 44% (с 512 до 288 на слой) с последующим дообучением напрямую в формате NVFP4. На аппаратной платформе Dell B300 встроенная спекулятивная голова (draft head) позволила поднять однопоточную пропускную способность со 135 до 280 токенов/с при объеме весов 48,0 ГиБ (GGUF Q4_K_M занимает 49,17 ГиБ). Модель набрала 70,0% на Terminal-Bench 2.1 и 159/164 на HumanEval, расходуя на 35% меньше токенов вывода по сравнению с предыдущей сборкой, однако для инференса GGUF через llama.cpp временно требуется форк с поддержкой ветки qwen4exp-mtp.
Метод оптимизации¶
Архитектурная оптимизация выполнена с применением метода REAP (Router-weighted Expert Activation Pruning), позволившего сократить количество экспертов в каждом MoE-слое с 512 до 288 (на 44%), с последующим прямым дообучением весов в формате NVFP4. Для повышения скорости инференса модель использует спекулятивное декодирование с интегрированным драфт-модулем (draft head) и отдельной n-gram таблицей на 95,4 ГиБ, ускоряющей валидацию токенов. Корректная загрузка и исполнение встроенного драфт-модуля реализованы через специализированную ветку движка llama.cpp (qwen4exp-mtp).
Показатели эффективности¶
Сочетание прунинга 44% экспертов и спекулятивного декодирования обеспечило рост темпа генерации в 2,07 раза (со 135 до 280 токенов/с на Dell B300) при сокращении длины вывода на 35%. Итоговый объем весов вместе со спекулятивной головой укладывается в 48,0 ГиБ в NVFP4 и 49,17 ГиБ в GGUF Q4_K_M.