Перейти к содержанию

Релиз ExLlamaV3 v1.5.3: оптимизация VRAM и динамический драфтинг при тензорном параллелизме

5.0/10

Движок инференса ExLlamaV3 получил обновление до версии v1.5.3, сфокусированное на сокращении накладных расходов памяти и расширении возможностей спекулятивного декодирования. В релиз вошли дополнительные оптимизации видеопамяти (VRAM), уменьшенный размер сборок wheel, а также экспериментальная функция n-gram корпуса. Ключевым архитектурным улучшением стала поддержка динамического размера драфт-модели при работе с тензорным параллелизмом (TP), однако точные количественные бенчмарки пропускной способности и экономии памяти в примечаниях к выпуску не приводятся.

Механизм оптимизации

В версии ExLlamaV3 v1.5.3 механизм спекулятивного декодирования расширен поддержкой динамического масштабирования драфт-модели (dynamic draft sizing) в конфигурациях с тензорным параллелизмом (TP), дополненной экспериментальным n-граммным корпусом для быстрого формирования кандидатов без лишних вычислений. Дополнительные внутренние оптимизации управления VRAM взаимодействуют с базовой архитектурой библиотеки, включающей квантование весов EXL3 и сжатие KV-кэша до 2–8 бит, что снижает накладные расходы видеопамяти при параллельном обслуживании запросов.

Влияние на эффективность

Обновление снижает порог потребления VRAM и повышает гибкость распределения памяти в спекулятивном пайплайне на нескольких GPU, хотя конкретные значения экономии в гигабайтах и прирост tok/s разработчиками пока не раскрыты.

Источники