Перейти к содержанию

ExLlamaV3: выгрузка MoE на CPU, Qwen-3.8-Flash-Next и GLM-5.3-Flash

8.0/10

В свежем крупном обновлении ExLlamaV3 от turboderp появились CPU-offload экспертов MoE, n-gram disk offload для Qwen-3.8-Flash-Next, поддержка GLM-5.3-Flash и новая техника self-calibrated optimization, а также множество других оптимизаций. Эти изменения позволяют запускать большие модели с открытыми весами на потребительском железе с NVIDIA GPU, выгружая часть данных в оперативную память и на диск. В посте приведён пример изображения кота, созданного моделью Qwen-3.8-Flash-Next-3.05bpw-exl3 по текстовому запросу. Автор отмечает, что владельцам NVIDIA-карт стоит попробовать актуальную версию; поддержки AMD в анонсе не упоминается.

Контекст

ExLlamaV3 — это библиотека инференса с оптимизированным квантованием для запуска больших языковых моделей локально на потребительских GPU, в первую очередь на видеокартах NVIDIA. Квантование снижает точность весов модели, чтобы она помещалась в видеопамять, а выгрузка на CPU или диск позволяет запускать очень большие модели даже при ограниченном объёме VRAM. MoE (смесь экспертов) — это архитектура, в которой при каждом запросе активируется лишь часть параметров модели, что делает такие модели эффективнее для инференса.

Влияние

Владельцы NVIDIA-карт с ограниченной VRAM получают возможность запускать крупные MoE-модели за счёт CPU-offload экспертов и n-gram disk offload, тогда как пользователи AMD остаются без этой функциональности.

Обсуждение сообщества

В комментариях хвалят ExLlamaV3: один пользователь отмечает, что при том же качестве кванты EXL3 на 25% меньше, чем Unsloth Dynamic 4-bit, другой называет его лучшим инференс-движком. Есть и критика: AMD-пользователи снова остаются без поддержки; также задают вопрос о сравнении exl3-квантов MoE с GGUF в llama.cpp/ik_llama.cpp, а один пользователь планирует тест Qwen-3.8-Flash 3.05-bit с n-gram disk offload на связке 32GB VRAM + 32GB RAM.

Источники