Оффлоадинг KV-кэша Qwen3.8-Flash-Next в RAM через vLLM без потери скорости декодирования¶
6.0/10
Разработчик реализовал в vLLM выгрузку KV-кэша в системную память RAM для архитектуры Qwen3.8-Flash-Next, добившись обработки контекста длиной 1M токенов на трех картах Nvidia RTX 3090 без квантования кэша. Из 48 слоев модели только 12 используют разреженное внимание (QSA), тогда как остальные 36 построены на gated delta-net слоях с фиксированным размером рекуррентного состояния. Механизм QSA ограничивает чтение кэша фиксированным окном (`indexer_budget=2048`), требуя передачи лишь 48 МиБ за шаг декодирования (около 3,9 ГБ/с через шину PCIe при 80 ток/с). Скорость декодирования снижается с ~80 ток/с до ~60 ток/с при заполнении лимита в 2048 токенов и остается неизменной с дальнейшим ростом контекста, при этом скорость префилла на 248k токенов достигает 3 701 ток/с, а общая пропускная способность — около 150 ток/с на 4 одновременных запросах.
Механизм гибридного разреженного оффлоадинга¶
Архитектура модели распределяет нагрузку между 36 слоями gated delta-net с фиксированным размером рекуррентного состояния и 12 слоями разреженного внимания (QSA), благодаря чему полный KV-кэш требуется лишь четверти сети. В слоях QSA постоянный резидентный индекс на GPU обрабатывает сжатые индексные ключи (66 байт на токен на слой) и динамически выбирает не более 2048 релевантных позиций контекста в рамках лимита `indexer_budget`. Основной несжатый массив KV-кэша выгружается в системную RAM, откуда по шине PCIe пересылаются исключительно отобранные 2048 строк (суммарно 48 МиБ за шаг генерации), ограничивая требуемую пропускную способность значением ~3,9 ГБ/с и гарантируя независимость времени декодирования от длины контекста.
Эффективность и память¶
В видеопамяти сохраняются только модель и сжатые ключи индексатора объемом 66 байт на токен на слой вместо стандартных 2 048 байт, что позволяет помещать веса модели в VRAM впритык и оффлоадить остальной кэш в RAM. Фиксированный объем выборки позволяет шине PCIe 4.0 x16 легко перекрывать передачу данных вычислениями без деградации задержки декодирования на длинных контекстах.