Ternary Bonsai 2: сжатие модели 27B до менее 6 ГБ для WebGPU¶
6.0/10
На Hugging Face выпущена модель Ternary Bonsai 2 на базе архитектуры Qwen3.8-27B, сжатая до объема менее 6 ГБ с помощью тернарных весов без изменения базовой структуры hybrid-attention. Экстремальная квантизация обеспечивает 9-кратное уменьшение размера по сравнению с FP16, сохраняя, согласно карточке модели, 98,2% исходных способностей. Столь низкие требования к памяти позволяют выполнять локальный инференс непосредственно в браузере с использованием WebGPU.
Метод оптимизации¶
Оптимизация базируется на экстремальном квантовании весов архитектуры hybrid-attention модели Qwen3.8-27B до тернарных значений без изменения исходного вычислительного графа. Такое представление параметров сжимает модель в 9 раз по сравнению с исходным форматом FP16, уменьшая итоговый размер до менее чем 6 ГБ при заявленном сохранении 98,2% исходного качества. Для исполнения в потребительском окружении используются специализированные WebGPU-кернелы, позволяющие развернуть инференс непосредственно в браузере, а также адаптации под форматы MLX и GGUF.
Показатели эффективности¶
Тернарное квантование снижает занимаемый объем видеопамяти с типичных для FP16 масштабов более чем в 9 раз — до менее чем 6 ГБ. Это устраняет необходимость в выделенных серверных GPU для инференса 27B-модели, позволяя развертывать ее на клиентских устройствах через WebGPU.