Бенчмарк запуска Qwen3.8 Flash на RTX 5070 12GB с оффлоадингом на RAM и SSD¶
5.0/10
Пользователь протестировал модель Qwen3.8-Flash-Next-GSQ-RCO-GGUF с квантованием 3 bpw (IQ3_XXS) общим размером около 76 ГБ на конфигурации с RTX 5070 SFF (12 ГБ VRAM), 64 ГБ DDR5-5600 и 1 ТБ NVMe SSD с использованием утилиты FreeToken CLI с llama. Для работы потребовалось шардировать 47 ГБ весов в VRAM и системную RAM, а оставшуюся часть выгрузить на SSD, что обеспечило скорость генерации от 13,8 до 14,6 токенов/с на контекстах 1K–20K и 11,3 токенов/с при контексте 90–100K (максимально протестировано до 128K). Скорость обработки промпта на 20K токенов составила 104,7 токенов/с с задержкой до начала вывода 3,11 минуты, при этом холодный запуск и обработка 1K промпта заняли 31,7 секунды.
Архитектура многоуровневого оффлоадинга и квантования¶
Метод оптимизации базируется на экстремальном квантовании весов до 3 bpw (формат IQ3_XXS в GGUF) в сочетании с многоуровневым оффлоадингом через движок FreeToken. Из общего объема 76 ГБ лишь часть шардов (около 47 ГБ) загружается в пул VRAM (12 ГБ) и системной памяти RAM, тогда как остальные параметры динамически считываются напрямую с NVMe SSD. Потоковая передача тензоров между иерархиями памяти позволяет выполнять генерацию и инференс с длинным контекстом до 128K токенов на потребительском оборудовании.
Эффективность конфигурации¶
Многоуровневый оффлоадинг позволил исполнять 76-гигабайтную квантованную GGUF-модель на потребительской видеокарте с 12 ГБ VRAM, поддерживая стабильную скорость инференса 11,3–14,6 токенов/с на контекстах вплоть до 128K.