Перейти к содержанию

Локальная модель 0.8B сравнялась с frontier-моделью на очистке диктовки

6.0/10

Автор представил SpeakoFlow Mini — Apache-2.0 дообучение модели Qwen3.5-0.8B для очистки результатов распознавания речи: модель применяет только реальные исправления говорящего и не «полирует» уже корректный текст. На специализированном англоязычном бенчмарке при одинаковом коротком фиксированном промпте и отключённом reasoning модель набрала 70,7% против 65,0% у hosted frontier-модели GPT-5.6 Luna; разница +5,8 пункта, но 95% интервал [-1,5; +12,9], поэтому это статистическая ничья, а не победа. По сравнению с базовой Qwen3.5-0.8B точность выросла с 47,3% до 70,7% (+23,4 пункта, 95% интервал [+16,3; +30,3]). Сборка Q8_0 занимает 833 МБ и работает полностью офлайн; автор подчёркивает, что при более длинном промпте и бюджете на reasoning Luna работает лучше и остаётся предпочтительной для нестандартных случаев вне узких паттернов.

Контекст

Qwen3.5-0.8B — это ультракомпактная мультимодальная модель Alibaba Cloud с 0,8 млрд параметров, выпущенная в феврале 2026 года; она использует гибридную архитектуру и может запускаться локально через Ollama или llama.cpp. Тонкая настройка (fine-tuning) дообучает такую базовую модель на узкой задаче, в данном случае — на «очистке диктовки», то есть исправлении вывода распознавания речи с учётом реальных поправок говорящего и без лишнего редактирования уже корректного текста. Для сравнения использовалась GPT-5.6 Luna — быстрая и экономичная модель OpenAI из серии GPT-5.6, доступная через API.

Влияние

Для разработчиков, которым нужна офлайн-очистка диктовки, это означает, что модель на 0,8B может сравниться с hosted frontier-моделью в узкой конфигурации (короткий фиксированный промпт, без reasoning), снижая затраты и риски приватности; однако результат статистически не значим и ограничен английским языком и узким набором паттернов.

Обсуждение

В комментариях проект в основном хвалят за практичность: один пользователь сравнивает его с API-моделью Google Gemini 3.5 Transcribe, другой отмечает сходство с Typeless. Также задают вопросы о совместимости с self-hosted LanguageTool в Firefox и о том, какой движок инференса и ASR-модель используются.

Источники