Нативная поддержка GGUF и ядер ggml в библиотеке Hugging Face Transformers¶
6.0/10
В библиотеке Hugging Face Transformers реализована нативная загрузка квантованных моделей в формате GGUF через параметр `gguf_file` в `AutoModelForCausalLM`. На системах Apple Silicon инференс опирается на ядра `ggml`, выполняя вычисления напрямую поверх упакованных квантованных весов. Бенчмарки на процессоре Apple M2 Max продемонстрировали производительность, сравнимую с llama.cpp: модель Qwen3.5-4B (Q4_K_M) показала 70.4 tok/s против 71.8 tok/s, Qwen3.8-27B (UD-Q4_K_M) — 15.9 tok/s против 13.4 tok/s, а Qwen3.5-35B-A3B (UD-IQ4_XS) — 60.2 tok/s против 61.3 tok/s. Нововведение нацелено на сохранение гибкости экосистемы PyTorch, упрощая отладку, оценку и кастомную генерацию без необходимости конвертации весов.
Механизм интеграции и исполнения ядер ggml¶
Интеграция реализует нативную загрузку квантованных весов формата GGUF непосредственно через интерфейс `AutoModelForCausalLM.from_pretrained` с аргументом `gguf_file`. На системах Apple Silicon библиотека напрямую задействует оптимизированные Metal-ядра ggml, позволяя выполнять матричные вычисления над упакованными квантованными тензорами без их предварительной деквантизации в память. При этом цикл генерации сохраняется внутри стандартного рантайма PyTorch, что обеспечивает доступ к инструментам отладки, оценкам и привычному API экосистемы Transformers.
Прирост эффективности¶
Интеграция квантования GGUF (Q4_K_M, UD-IQ4_XS) позволяет разворачивать модели масштаба до 35B на потребительской памяти ноутбуков Apple Silicon без раздувания footprint в VRAM. Вычислительная пропускная способность практически достигает показателей специализированного рантайма llama.cpp, обеспечивая генерацию до 70.4 tok/s на Qwen3.5-4B и 15.9 tok/s на 27B-модели непосредственно в среде Transformers.