Бенчмарк Qwen3.8-Flash-Next в MXFP4-FP8 на 4x R9700: генерация до 150+ ток/с¶
5.0/10
В сообществе протестировали модель Qwen3.8-Flash-Next в квантовании MXFP4-FP8 на аппаратной платформе 4x R9700 в задачах агентного кодинга с тестовым окружением на базе pi. Производительность этапа prefill превысила 10 000 ток/с, а скорость одиночной генерации стабильно держится выше 150 ток/с. При параллельной нагрузке в 3–5 одновременных потоков система демонстрирует около 100 ток/с на каждый поток при сохранении высокого качества ответов.
Механизм оптимизации¶
Метод опирается на гибридное квантование с учетом активаций (activation-aware) в форматы MXFP4 и FP8, сжимающее модель Qwen3.8-Flash-Next до объема 116 ГБ для запуска на аппаратном комплексе из четырех ускорителей AMD AI PRO R9700. Сокращение расхода видеопамяти под параллельные сессии и длинные контексты обеспечивается переводом KV-кэша в формат FP8 с откалиброванными коэффициентами масштабирования, а также поддержкой выгрузки данных в системное ОЗУ (AMD RAM offload).
Прирост эффективности¶
Решение обеспечивает совокупную пропускную способность генерации от 300 до 500 ток/с при обслуживании 3–5 параллельных агентных сессий со сверхбыстрым TTFT за счет скорости prefill более 10 000 ток/с.