Релиз ExLlamaV3 v1.5.1: интеграция DFlash2, квантование fractional-trellis и оптимизации MoE¶
6.0/10
Движок локального инференса ExLlamaV3 обновился до версии v1.5.1, добавив поддержку механизма спекулятивного декодирования DFlash2 и режима квантования дробной решеткой (fractional-trellis quantization). В релиз включена архитектура KimiLinearForCausalLM, а также расширена поддержка тензорного параллелизма (TP) для моделей Qwen3.8-Flash-Next, GLM5.3 и DeepseekV3/V4. Обновление также содержит оптимизации для MoE-моделей, доработки пайплайна самокалибровки с экспериментальной поддержкой YAQA и исправления утечек памяти. В чейнджлоге отсутствуют точные числовые бенчмарки пропускной способности, однако апдейт исправляет работу EXL3_MOE_PINNED_ARENA в окружениях Windows и Conda, повышая стабильность и масштабируемость распределенного развертывания.
Методы оптимизации и архитектурные улучшения¶
В версии ExLlamaV3 v1.5.1 интегрирована поддержка алгоритма спекулятивного декодирования DFlash2, режим квантования fractional-trellis и экспериментальный метод YAQA в конвейере самокалибровки моделей. Для эффективного масштабирования современных архитектур, включая DeepseekV3/V4, Qwen3.8-Flash-Next и GLM5.3, реализован расширенный тензорный параллелизм (TP) наряду с оптимизациями исполнения MoE-слоев и исправлением механизма выделения памяти EXL3_MOE_PINNED_ARENA.
Влияние на эффективность¶
Устранение утечек памяти и нормализация работы аллокатора EXL3_MOE_PINNED_ARENA предотвращают деградацию доступной VRAM при длительных сессиях инференса MoE-архитектур. Внедрение DFlash2 и поддержка TP для крупномасштабных моделей уровня Deepseek направлены на сокращение задержки генерации токенов в многопроцессорных конфигурациях.