Релиз ExLlamaV3 v1.5.2: оптимизация VRAM и поддержка архитектуры Turing¶
4.0/10
В релизе движка инференса ExLlamaV3 v1.5.2 представлена экспериментальная поддержка графических процессоров архитектуры NVIDIA Turing, а также добавлена совместимость с моделями MiMoV2ForCausalLM. Основные оптимизации коснулись управления видеопамятью: разработчики ограничили паразитные кратковременные (transient) аллокации VRAM и исправили излишне консервативные проходы прогрева (warmup) и замеров авторазделения (autosplit-measure). Обновление предотвращает неэффективное выделение ресурсов при инициализации сессий и включает общие исправления ошибок.
Метод оптимизации¶
В версии v1.5.2 оптимизировано управление памятью за счет жесткого контроля кратковременных (transient) аллокаций VRAM, а также исправления чрезмерно консервативных алгоритмов прогрева (warmup) и замеров при автоматическом разделении весов между GPU (autosplit-measure). Дополнительно в движок внедрена экспериментальная поддержка графических ускорителей архитектуры Turing и добавлена поддержка модели MiMoV2ForCausalLM.