Сжатие Hy4-preview до 200 ГБ GGUF: заявлено 98% производительности¶
6.0/10
Согласно Reddit-посту, модель Hy4-preview от Tencent была сжата с исходного объёма около 1,5 ТБ до примерно 200 ГБ в формате GGUF, с сохранением около 98% производительности. Автор ссылается на файл AngelSlim/Hy4-preview-GGUF на Hugging Face. Однако заявление не подтверждено независимыми тестами, методология бенчмарков не приведена, а источник — пользовательский пост, а не официальный релиз. В комментариях пользователи просят проверить результат и отмечают, что даже при таком размере для запуска на RTX 3080 не хватает около 190 ГБ памяти. Также высказывается мнение, что Hy4-preview может быть недостаточно дообучена, и официальный релиз покажет более высокие результаты.
Контекст¶
Tencent Hy4-preview — это крупная мультимодальная модель от Tencent, опубликованная на Hugging Face вместе с пайплайном дообучения и инструментарием AngelSlim для сжатия больших моделей. GGUF — это формат, позволяющий запускать модели локально, а квантизация снижает их размер за счёт уменьшения точности весов; в данном случае применялись методы вроде IQ1_M и Q4_K_M с использованием imatrix и файла тензорных типов. Сообщество обсуждает, что сжатие модели с 1,5 ТБ до примерно 200 ГБ с сохранением около 98% производительности может указывать на недостаточную пост-тренировку Hy4-preview и на потенциал дальнейшего сжатия локальных моделей.
Влияние¶
Для энтузиастов локального ИИ это означает потенциальную возможность запуска очень крупной модели на обычном оборудовании, но из-за отсутствия проверки и методологии результат пока нельзя считать подтверждённым.
Обсуждение в сообществе¶
Пользователи в основном реагируют с воодушевлением и скепсисом: одни просят независимо протестировать модель, другие иронизируют, что для RTX 3080 не хватает ещё около 190 ГБ. Также есть мнение, что Hy4-preview недостаточно дообучена, поэтому официальный релиз может показать заметно более высокие результаты в бенчмарках.