Перейти к содержанию

Hugging Face открыла исходный код более 200 WebGPU-ядер для инференса в браузере

4.0/10

Команда Hugging Face опубликовала открытую коллекцию WebGPU-ядер для ускорения локального инференса в веб-браузерах, охватывающую свыше 200 базовых ML-операций. Оптимизации планируется перенести в клиентские среды исполнения Transformers.js, ONNX Runtime Web и LiteRT.js. При этом в самом анонсе не приведено конкретных замеров задержек (TTFT) или пропускной способности (ток/с), подтверждающих заявленные показатели быстродействия.

Механизм оптимизации

Технический механизм основан на библиотеке из более чем 200 специализированных вычислительных ядер WebGPU, обеспечивающих прямое аппаратное ускорение базовых тензорных операций машинного обучения локально в браузере. Разработанные низкоуровневые ядра оптимизированы в качестве альтернативы стандартным операторам бэкенда WebGPU в ONNX Runtime Web для ускорения выполнения вычислительных графов на GPU. Кроме того, ведется интеграция оптимизированных реализаций в экосистему клиентского инференса, включая библиотеки Transformers.js, ONNX Runtime Web и LiteRT.js.

Источники