Перейти к содержанию

Квантование GSQ-RCO GGUF для Qwen3.8-Flash-Next: ускорение пропускной способности с Q2_0

6.0/10

Команда ISTA-DASLab выпустила квантования формата GSQ-RCO GGUF для модели Qwen3.8-Flash-Next, уменьшающие объем с исходных 80–95 ГБ до 68–76 ГБ при сохранении точности, близкой к базовой. Сборка Q2_0 за счет отказа от ресурсоемких таблиц поиска (lookup tables) демонстрирует прирост prompt-пропускной способности в 3,4 раза (и до 6,2 раза в задачах кодинга) при снижении сквозной задержки в 1,9 раза относительно IQ2_XS при сопоставимом среднем скоре (89,07 против 89,16). Конфигурация IQ3_XXS уменьшает объем модели приблизительно до одной пятой от BF16, полностью повторяя результат базовой версии на бенчмарке AIME25 (100,00) и уступая лишь 0,51 балла на GPQA-Diamond и 1,14 на LiveCodeBench v6.

Метод оптимизации

Подход GSQ-RCO сочетает точное низкобитное скалярное квантование отдельных тензоров (GSQ) с алгоритмом распределения типов квантования по слоям под заданный бюджет памяти (RCO), формируя неоднородные (mixed-precision) GGUF-модели. В скоростном варианте Q2_0 намеренно исключаются форматы квантования с крупными таблицами поиска (lookup tables), декодирование которых создает узкое место при инференсе Qwen3.8-Flash-Next, что обеспечивает стабильную скорость генерации без скачков задержки в зависимости от входного контекста.

Прирост эффективности

Использование Q2_0 обеспечивает снижение сквозной задержки вывода в 1,9 раза со стабильной скоростью декодирования вне зависимости от контента, а формат IQ3_XXS позволяет сократить занимаемый объем памяти примерно в 5 раз по сравнению с исходным весом BF16.

Источники