Перейти к содержанию

Qwen3.8-Flash-Next: новая архитектура для максимальной экономической эффективности

7.0/10

Qwen анонсировала новую архитектуру Qwen3.8-Flash-Next, нацеленную на радикальное снижение стоимости обучения и инференса. По заявлению Alibaba Qwen, модель обучалась примерно за 1/9 стоимости Qwen3.7-Plus и при этом превосходит её по всем показателям; комментаторы также утверждают, что она уверенно обходит Qwen3.8 27B. Точные технические детали и бенчмарки из оригинального блога недоступны, поэтому заявленные результаты пока нельзя проверить. В сообществе отмечают, что модель уже доступна в Unsloth Desktop, весит около 73 ГБ и требует как минимум 128 ГБ памяти на Mac или аналогичных системах, например Strix Halo. Новая архитектура рассматривается как предвестник Qwen 4.

Контекст

Qwen3.8-Flash-Next — это новая архитектура модели от Alibaba Qwen, представленная как предварительный вариант архитектуры Qwen4. Согласно репозиторию на GitHub, по сравнению с Qwen3.7-Plus она требует лишь около 1/9 затрат на обучение, но при этом показывает более высокие результаты в программировании и офисных задачах. На странице модели на Hugging Face и в рецептах vLLM указано, что основная модель имеет 125B параметров, дополнена 51B N-gram эмбеддингами, при этом активно лишь 6B параметров на токен, а поддерживаемый контекст достигает 262K токенов; также доступна FP8-версия для инференса.

Влияние

Для пользователей, заинтересованных в локальном развёртывании, размер модели около 73 ГБ означает, что запуск потребует высокопроизводительных машин с 128 ГБ унифицированной памяти, таких как Mac или Strix Halo, при этом Unsloth Desktop уже поддерживает эту модель.

Обсуждение

В комментариях выражают энтузиазм по поводу добавления модели в домашний стек и удивление тем, что она «чисто» обходит Qwen3.8 27B, а также делятся практическими деталями о доступности в Unsloth Desktop и размере 73 ГБ. Некоторые пользователи надеются, что модель будет рассуждать более прямо, чем меньшая модель, а один комментатор жалуется, что не может прокрутить страницу сайта.

Источники

Покрытие источниками

Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.

  1. Предварительно: новость слишком свежая

    Qwen3.8-Flash-Next: новая архитектура для максимальной экономической эффективности

    • huggingface.co · подтверждает · первоисточник
    • docs.sglang.io · подтверждает · компетентная запись
    • unsloth.ai · подтверждает · заинтересованная сторона
  2. Недостаточное покрытие источниками

    Qwen анонсировала новую архитектуру Qwen3.8-Flash-Next, нацеленную на радикальное снижение стоимости обучения и инференса.

    • qwen.ai · контекст · первоисточник
  3. Не подходит для фактологической проверки

    По заявлению Alibaba Qwen, модель обучалась примерно за 1/9 стоимости Qwen3.7-Plus и при этом превосходит её по всем показателям; комментаторы также утверждают, что она уверенно обходит Qwen3.8 27B.