Перейти к содержанию

Запуск модели Qwen3.8-Flash-Next объемом 104 ГБ на Mac с 48 ГБ ОЗУ

6.0/10

Открытый движок инференса SlotStream продемонстрировал возможность запуска крупных языковых моделей на аппаратных конфигурациях с ограниченным объемом оперативной памяти. В рамках эксперимента модель Qwen3.8-Flash-Next объемом 104 ГБ была запущена на компьютере Mac с 48 ГБ объединенной памяти, обеспечив скорость генерации около 12 токенов в секунду. Этот результат показывает потенциал выполнения локальных нейросетей, размер которых более чем вдвое превышает доступную ОЗУ устройства. Высокая производительность достигается благодаря оптимизированной потоковой подкачке весов и эффективному управлению оперативной памятью.

Контекст

Модель Qwen3.8-Flash-Next построена на архитектуре Mixture-of-Experts (MoE) со 125 миллиардами параметров и требует более 100 ГБ памяти даже в 4-битном формате. Обычно запуск моделей, значительно превышающих объём оперативной памяти устройства, приводит к сильной деградации скорости из-за постоянного обращения к файлу подкачки. Инструмент SlotStream решает эту проблему за счёт удержания плотной части сети в RAM и динамической подгрузки активных экспертов напрямую с SSD.

Обсуждение в сообществе

Участники обсуждения с иронией отметили колоссальную нагрузку на SSD-накопитель из-за активного использования файла подкачки при таком соотношении объемов памяти. Также пользователей заинтересовал вопрос наличия аналогичных оптимизированных движков инференса для операционной системы Windows.

Источники

Покрытие источниками

Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.

  1. Предварительно: новость слишком свежая

    Запуск модели Qwen3.8-Flash-Next объемом 104 ГБ на Mac с 48 ГБ ОЗУ

    • github.com · подтверждает · заинтересованная сторона
    • atomic.chat · контекст · независимая публикация
    • news.ycombinator.com · подтверждает · заинтересованная сторона
    • modelfit.io · контекст · независимая публикация
  2. Только данные автора или производителя

    модель Qwen3.8-Flash-Next объемом 104 ГБ была запущена на компьютере Mac с 48 ГБ объединенной памяти, обеспечив скорость генерации около 12 токенов в секунду

    • github.com · подтверждает · заинтересованная сторона
    • insidepc.tech · контекст · независимая публикация
    • pachca.com · контекст · независимая публикация