Перейти к содержанию

ExLlamaV3 v1.5.4: квантование эмбеддингов, стриминг с диска и снижение расхода VRAM

5.0/10

Движок инференса ExLlamaV3 обновлен до версии v1.5.4, получив поддержку квантования токен-эмбеддингов и стриминга весов напрямую с диска. В релизе заявлены ускоренная загрузка моделей, оптимизация общей производительности и сниженное потребление как системной оперативной памяти, так и VRAM. Кроме того, модуль интеграции с экосистемой Hugging Face обновлен под спецификации Transformers 5 с добавлением обратного распространения ошибки (backprop) для обернутых EXL3-слоев, а также исправлены ошибки для MiMo-V2.6.

Методы оптимизации

В релизе ExLlamaV3 v1.5.4 оптимизация пайплайна достигается за счет внедрения квантования тензоров эмбеддингов токенов и механизма потокового чтения весов с диска (disk streaming), что существенно снижает пиковый оверхед системной памяти и VRAM при инициализации. Модуль интеграции с Hugging Face был обновлен до спецификации Transformers 5 с добавлением поддержки обратного распространения ошибки (backprop) для квантованных слоев EXL3. Дополнительно переработаны алгоритмы квантования для повышения итоговой точности и ускорен процесс загрузки моделей.

Прирост эффективности

Квантование эмбеддингов и потоковая загрузка с диска уменьшают пиковый расход VRAM и системной RAM в пайплайнах инференса. Сокращение времени инициализации весов снижает задержку холодного старта при развертывании моделей на локальных и серверных GPU.