Hugging Face открыла исходный код более 200 WebGPU-ядер для инференса в браузере¶
4.0/10
Команда Hugging Face опубликовала открытую коллекцию WebGPU-ядер для ускорения локального инференса в веб-браузерах, охватывающую свыше 200 базовых ML-операций. Оптимизации планируется перенести в клиентские среды исполнения Transformers.js, ONNX Runtime Web и LiteRT.js. При этом в самом анонсе не приведено конкретных замеров задержек (TTFT) или пропускной способности (ток/с), подтверждающих заявленные показатели быстродействия.
Механизм оптимизации¶
Технический механизм основан на библиотеке из более чем 200 специализированных вычислительных ядер WebGPU, обеспечивающих прямое аппаратное ускорение базовых тензорных операций машинного обучения локально в браузере. Разработанные низкоуровневые ядра оптимизированы в качестве альтернативы стандартным операторам бэкенда WebGPU в ONNX Runtime Web для ускорения выполнения вычислительных графов на GPU. Кроме того, ведется интеграция оптимизированных реализаций в экосистему клиентского инференса, включая библиотеки Transformers.js, ONNX Runtime Web и LiteRT.js.