Qwen 3.8 27B: сильная модель с избыточным рассуждением¶
8.0/10
Контекст¶
Автор обозревает Qwen 3.8 27B — 27-миллиардную визуально-языковую модель под лицензией Apache 2 от Alibaba, которую можно запускать на мощном ноутбуке через LM Studio в квантовании Q4_K_M. Модель впечатляет возможностями, но её стандартная настройка глубокого рассуждения оказалась непрактичной.
Суть¶
По наблюдениям автора, модель по умолчанию использует уровень рассуждения xhigh, что ведёт к перерасходу: генерация SVG пеликана заняла 21 минуту и 22 276 токенов размышлений, а запрос «нарисуй круг» породил анимированный этюд вместо простой фигуры. Подняв лимит контекста до 262 144 токенов и понизив рассуждение до low или off, он получил рабочие результаты за минуты, сохранив качество в задачах вроде bounding boxes и управления кодинг-агентом Pi с вызовом инструментов. Главный недостаток — скорость (15–30 токенов/с в LM Studio), но включение механизма Multi-Token Prediction через llama-server дало прирост ~72% относительно дефолтного GGUF. Таким образом, автор показывает, что модель в 17 ГБ способна на многое, но требует настройки режима рассуждения и оптимизаций вывода.
Вывод¶
Автор заключает, что Qwen 3.8 27B доказывает: полноценная открытая модель с видением, кодом и длинным контекстом умещается в 17 ГБ. Однако её повседневному использованию мешают медлительность и неудачный дефолт рассуждения, которые легко исправить тонкой настройкой.