llama.cpp b11243: ускорение обработки промптов в 3,1 раза с Intel oneAPI 2026.1¶
5.0/10
В релизе llama.cpp b11243 тулчейн сборки бэкенда SYCL был обновлен с версии Intel oneAPI 2025.3.3 до унифицированного пакета oneAPI Toolkit 2026.1 совместно с Level Zero SDK 1.33.1. На ускорителе Intel Arc B570 при неизменной кодовой базе это обеспечило скачок скорости обработки промпта (prompt processing) с 434 до 1331 токенов в секунду (ускорение в 3,1 раза). Скорость генерации токенов (token generation) при этом увеличилась с 45,3–48,0 до 50,1 токенов в секунду.
Метод оптимизации¶
Сборочные процессы для Ubuntu и Windows были переведены на единый установщик Intel oneAPI Toolkit 2026.1 для сохранения библиотек oneDNN, удаленных из пакета Deep Learning Essentials начиная с версии 2026.0. Также была выполнена синхронизация с Level Zero SDK 1.33.1, обновлен состав распространяемых библиотек рантайма Windows (sycl9.dll и библиотеки MKL) и удалены устаревшие файлы резервной поддержки OpenCL (.spv bfloat16).
Прирост эффективности¶
Пропускная способность фазы предварительной обработки контекста на Intel Arc B570 выросла более чем в 3,1 раза (с 434 до 1331 t/s), что существенно сокращает время до получения первого токена (TTFT).