Перейти к содержанию

Релиз сборок Qwen3.8-Flash-Next в формате GGUF с квантованием GSQ-RCO и прунингом экспертов

6.0/10

Лаборатория ISTA-DASLab представила GGUF-сборки разреженной MoE-модели Qwen3.8-Flash-Next (176.9B параметров, 512 экспертов на слой, 354 ГБ в BF16), оптимизированные связкой алгоритмов GSQ (Gumbel-Softmax Quantization) и RCO (Riemannian Constrained Optimization). Релиз включает квантованные варианты от 2.40 до 3.50 bpw объемом от 66.4 до 83.6 ГБ (IQ3_S, IQ3_XXS и Q2_0), где сборка IQ3_S превзошла исходный BF16 по среднему баллу бенчмарков (93.26 против 93.12), а Q2_0 сохранила средний zero-shot результат 78.00 против 76.94 у BF16 при пятикратном сокращении веса. Отдельно выпущена модификация Coder, в которой отсечено ровно 50% маршрутизируемых экспертов (256 из 512 на слой) посредством оптимизации дивергенции Кульбака — Лейблера через RCO с последующим квантованием оставшихся весов до 3.5 bpw, что дает амортизированную плотность ~1.89 bpw от исходной архитектуры. Вариант Coder сохраняет 98.7% качества базовой модели на LiveCodeBench v6 (86.28 против 87.43) и 91.3% на SWE-bench Verified (75.60 против 82.80) при наивысшем уровне рассуждений (xhigh reasoning effort).

Механизм оптимизации GSQ и RCO-прунинга

Метод объединяет пост-обучающее квантование GSQ (Gumbel-Softmax Quantization), которое совместно оптимизирует сетки округления и масштабы групп для выгрузки в стандартные типы GGUF, и риманову оптимизацию с ограничениями (RCO). RCO распределяет форматы квантования по тензорам через градиентный спуск по целевой функции потерь, а в сборке Coder отбирает для удаления 256 из 512 маршрутизируемых экспертов на каждом из 48 слоев за счет минимизации KL-дивергенции относительно исходной модели. Оставшиеся веса квантуются до уровня 3,50 bpw, что в совокупности с прунингом экспертов формирует усредненную плотность 1,89 бита на исходный параметр архитектуры.

Прирост вычислительной эффективности

Сочетание прунинга 256 экспертов на слой и квантования сократило резидентный объем памяти модели со 176.9 млрд параметров с 354 ГБ до 29.6 ГБ (при общем весе файла 58.4 ГБ за счет выноса n-gram шарда на диск), что делает возможным ее инференс на единственном потребительском или серверном ускорителе с 32 ГБ VRAM.

Источники