Движок Gewell: сжатие KV-кэша Gemma 4 до 0,625x и смешанное квантование G0¶
6.0/10
Gewell представляет собой специализированный движок инференса для Gemma 4 31B на архитектуре NVIDIA Blackwell (тестировался на Linux и Pro 6000), ориентированный на высокие нагрузки параллельной генерации данных. Архитектура движка математически сжимает объем памяти под KV-кэш до 0,625x без потери точности, эксплуатируя связанные веса K и V на глобальных слоях внимания Gemma и сохраняя лишь 25% повернутых компонент RoPE ключей K вместе с тензором V. В сравнении со стандартной LRU-политикой vLLM система задействует адаптивное растворение промежуточных чекпоинтов и явные хинты кэширования, предотвращая вытеснение долгоживущих префиксов в циклических агентных цепочках (planner/writer/critic). Инициализация движка занимает считаные секунды благодаря офлайн-профилированию форм GEMM-ядер и отказу от накладных расходов рантайма Python, а веса упаковываются в кастомный смешанный формат квантования G0 (~6 bpw).
Архитектура сжатия KV-кэша и управление памятью¶
Gewell реализует сжатие KV-кэша без потери точности до 0,625x от исходного объема: используя связанные веса K и V в слоях глобального внимания Gemma и тот факт, что RoPE применяется только к 25% измерений K, движок сохраняет в памяти полный V и лишь ротированную четверть K, динамически распаковывая тензор перед вычислением внимания. Вместо наивного алгоритма LRU система задействует специализированную политику вытеснения и оффлоадинг в RAM, растворяя промежуточные чекпоинты диалога и сохраняя горячими базовые префиксы циклических агентных цепочек по явным хинтам. Дополнительно движок использует формат смешанного квантования G0 (~6 bpw) с приоритизацией весов внимания и заранее профилированные офлайн GEMM-ядра, устраняющие накладные расходы при инициализации.
Показатели эффективности и экономия памяти¶
Сокращение объема KV-кэша до 0,625x в сочетании с форматом G0 (~6 bpw) позволяет разместить веса 31B-модели, модуль MTP и контекст до 250k токенов в пределах 32 ГБ VRAM. Сохранение горячих префиксов для чередующихся запросов обеспечивает Gewell превосходство над vLLM по общей пропускной способности (tok/s) в многошаговых конвейерах обработки данных.