Qwen3.8-Flash-Next: новая архитектура для максимальной экономической эффективности¶
7.0/10
Qwen анонсировала новую архитектуру Qwen3.8-Flash-Next, нацеленную на радикальное снижение стоимости обучения и инференса. По заявлению Alibaba Qwen, модель обучалась примерно за 1/9 стоимости Qwen3.7-Plus и при этом превосходит её по всем показателям; комментаторы также утверждают, что она уверенно обходит Qwen3.8 27B. Точные технические детали и бенчмарки из оригинального блога недоступны, поэтому заявленные результаты пока нельзя проверить. В сообществе отмечают, что модель уже доступна в Unsloth Desktop, весит около 73 ГБ и требует как минимум 128 ГБ памяти на Mac или аналогичных системах, например Strix Halo. Новая архитектура рассматривается как предвестник Qwen 4.
Контекст¶
Qwen3.8-Flash-Next — это новая архитектура модели от Alibaba Qwen, представленная как предварительный вариант архитектуры Qwen4. Согласно репозиторию на GitHub, по сравнению с Qwen3.7-Plus она требует лишь около 1/9 затрат на обучение, но при этом показывает более высокие результаты в программировании и офисных задачах. На странице модели на Hugging Face и в рецептах vLLM указано, что основная модель имеет 125B параметров, дополнена 51B N-gram эмбеддингами, при этом активно лишь 6B параметров на токен, а поддерживаемый контекст достигает 262K токенов; также доступна FP8-версия для инференса.
Влияние¶
Для пользователей, заинтересованных в локальном развёртывании, размер модели около 73 ГБ означает, что запуск потребует высокопроизводительных машин с 128 ГБ унифицированной памяти, таких как Mac или Strix Halo, при этом Unsloth Desktop уже поддерживает эту модель.
Обсуждение¶
В комментариях выражают энтузиазм по поводу добавления модели в домашний стек и удивление тем, что она «чисто» обходит Qwen3.8 27B, а также делятся практическими деталями о доступности в Unsloth Desktop и размере 73 ГБ. Некоторые пользователи надеются, что модель будет рассуждать более прямо, чем меньшая модель, а один комментатор жалуется, что не может прокрутить страницу сайта.
Источники
Покрытие источниками¶
Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.
-
Предварительно: новость слишком свежая
Qwen3.8-Flash-Next: новая архитектура для максимальной экономической эффективности
- huggingface.co · подтверждает · первоисточник
- docs.sglang.io · подтверждает · компетентная запись
- unsloth.ai · подтверждает · заинтересованная сторона
-
Недостаточное покрытие источниками
Qwen анонсировала новую архитектуру Qwen3.8-Flash-Next, нацеленную на радикальное снижение стоимости обучения и инференса.
- qwen.ai · контекст · первоисточник
-
Не подходит для фактологической проверки
По заявлению Alibaba Qwen, модель обучалась примерно за 1/9 стоимости Qwen3.7-Plus и при этом превосходит её по всем показателям; комментаторы также утверждают, что она уверенно обходит Qwen3.8 27B.