Бенчмарк 27B-модели на 4x V100 с распаковкой NVFP4 и dflash¶
5.0/10
В сообществе r/LocalLLaMA протестировали запуск чекпоинтов NVFP4 на 4 графических процессорах Nvidia V100 (TP=4) из состава сервера за $5400 с использованием форка 1Cat-vLLM, распаковывающего веса в FP16 на лету. В сочетании со спекулятивным декодированием dflash для модели размером 27B была достигнута скорость генерации свыше 200 токенов/с при скорости префилла около 2,5–3,5 тыс. токенов/с. Конфигурация также позволила удерживать контекстный KV-кэш объемом порядка 120 тыс. токенов при включенной обработке изображений.
Метод оптимизации¶
Технический механизм основан на использовании специализированного форка 1Cat-vLLM для микроархитектуры Volta (SM70), который интегрирует пути TurboMind и ядра Marlin для распаковки квантованных весов формата NVFP4 в FP16 прямо на лету [tool-1-1, tool-1-2]. Такой подход обходит отсутствие нативной аппаратной поддержки суб-FP8 форматов на чипах V100, радикально сокращая затраты пропускной способности памяти HBM2 при чтении весов модели [tool-1-2, tool-1-3]. Сверху накладывается спекулятивное декодирование с помощью dflash (DFlash2) в конфигурации с тензорным параллелизмом (TP=4), ускоряющее фазу декодирования за счет параллельной верификации черновых токенов.
Прирост эффективности¶
Использование спекулятивного декодирования dflash и распаковки NVFP4 на лету обеспечило генерацию со скоростью >200 токенов/с и префилл 2,5–3,5 тыс. токенов/с на 4 устаревших ускорителях V100 с доступным размером KV-кэша около 120k токенов.