Перейти к содержанию

Ускорение Qwen3.8-27B до 190 токен/с на RTX 5090 через DFlash2 и Q8_0 KV

6.0/10

В бенчмарке llama-server на базе видеокарты NVIDIA RTX 5090 продемонстрирован запуск модели Qwen3.8-27B RVN Heretic в квантовании Q6_K с контекстным окном 159 744 токенов и квантованным KV-кэшем q8_0 (K/V). Применение спекулятивного декодирования DFlash2 (драфтер Qwen3.8-27B-DFlash2-Q4_K_M, n=4) в связке с ngram-map-k4v увеличило скорость генерации кода с базовых 62 токен/с без спекуляции до 140–190 токен/с (и около 100 токен/с на прозе). Занятый объем видеопамяти составил 29 996 МиБ после загрузки и 30 332 МиБ после обработки первого изображения при выносе эмбеддингов токенов на хост и отключении CUDA Graphs.

Механизм оптимизации

Стек реализует гибридное спекулятивное декодирование DFlash2 в связке с алгоритмом сопоставления n-грамм (`ngram-map-k4v`), генерируя до 4 токенов за итерацию на основе скрытых состояний целевой модели. Компактный 5-слойный драфтер (Q4_K_M, 1,14 ГБ) задействует скользящее окно (sliding window) на 2048 токенов, благодаря чему размер его собственного KV-кэша фиксируется на уровне ~40 МиБ вне зависимости от глубины контекста. Размещение сверхдлинного контекста на 159 744 токена достигается сжатием тензоров K/V в формат `q8_0`, выносом эмбеддингов токенов на хост и парковкой префиксных состояний в системной памяти (`--cache-ram 16384`).

Показатели эффективности

Спекулятивное декодирование DFlash2 обеспечило прирост пропускной способности генерации в 2,25–3,06 раза (до 190 токен/с против 62 токен/с), а пятислойная архитектура sliding-window драфтера удерживает его собственный KV-кэш в пределах всего ~40 МиБ даже на предельной длине контекста.

Источники