Перейти к содержанию

llama.cpp b11182: внедрение llama_prec_policy и инференса W4A4 с MXFP4 для CUDA

4.0/10

В релизе движка llama.cpp b11182 представлен фреймворк политик точности `llama_prec_policy` и реализован модельно-управляемый путь выполнения инференса с квантованием W4A4 (PR #24364). Изменения ориентированы на аппаратное ускорение NVIDIA CUDA через обновление диспетчеризации MXFP4 для исходных тензоров повышенной точности в вычислительных ядрах `ggml/src/ggml-cuda/mmq.cu`. Патч, подготовленный инженерами NVIDIA и мейнтейнерами проекта, также включает сопоставление политик активаций напрямую по тензорам `ggml` и устранение проблем с `launch_bounds` на бэкенде HIP. Конкретные бенчмарки пропускной способности (ток/с), метрики TTFT и замеры экономии VRAM в официальном описании релиза не опубликованы.

Механизм оптимизации

В рамках релиза реализован механизм политик точности `llama_prec_policy`, управляющий сопоставлением типов данных на уровне отдельных тензоров графа ggml для активаций. Архитектура внедряет специализированный путь инференса W4A4 с обновленной диспетчеризацией формата MXFP4 в CUDA-ядре `mmq.cu`. Данная схема обеспечивает маршрутизацию низкобитных матричных операций W4A4 с поддержкой операндов более высокой исходной точности.