Перейти к содержанию

Поддержка CUDA Graph для MTP-драфта в llama.cpp b11007

4.0/10

В релизе инференс-движка llama.cpp b11007 реализована поддержка выполнения через CUDA Graph для черновых моделей мультитокенового предсказания (Multi-Token Prediction, MTP) в рамках пулл-реквеста #28549. Изменение оптимизирует вычислительный пайплайн спекулятивного декодирования на GPU NVIDIA, снижая накладные расходы хоста на запуск CUDA-ядер при генерации черновых токенов. Конкретные замеры задержки, тактовой частоты генерации токенов (ток/с) и процентные показатели прироста производительности в описании данного релиза не приводятся. Готовые бинарные сборки выпуска предоставлены для платформ Linux и Windows с поддержкой CUDA версий 12 и 13.

Механизм оптимизации CUDA Graphs для MTP

В обновлении включена поддержка захвата и выполнения графов CUDA (CUDA Graphs) для драфт-ветки алгоритма многотокенного предсказания (Multi-Token Prediction, MTP). Механизм устраняет задержки хоста (CPU launch overhead) при спекулятивной генерации драфт-токенов за счет объединения последовательности запусков ядер в единый воспроизводимый граф. Для корректной работы конвейера также оптимизировано разделение внутренних графовых состояний и рабочих буферов между чередующимися фазами предсказания.

Источники