Luth-2: новые французские малые языковые модели¶
7.0/10
Авторы выпустили Luth-2-0.8B и Luth-2-2B — небольшие французскоязычные языковые модели без режима рассуждения, которые, по их утверждению, задают новый уровень качества для своего размера на ряде французских бенчмарков. Среди приведённых результатов: Luth-2-2B набирает 69,67 против 65,17 у Gemma-4-E2B-it на Multi-IF и 81,52 против 81,24 на Math-500, а Luth-2-0.8B получает 72,92 против 55,60 у granite-4.0-h-micro на MGSM-Rev2. Модели построены на базе Qwen3.5 и обучались с новой SFT-смесью на 3 млрд токенов, охватывающей математику, код, вызов инструментов, диалоги и научные темы. Также применялись обучение с подкреплением через экспертные специализации и многодоменная on-policy дистилляция. Авторы подчёркивают, что модели достаточно лёгкие для локального запуска и показывают, что многоязычные малые модели всё ещё имеют значительный неиспользованный потенциал за пределами английского языка.
Контекст¶
Luth-2 — продолжение проекта Luth, посвящённого эффективной французской специализации малых языковых моделей без потери кросс-языковых возможностей. Проект нацелен на улучшение моделей для относительно малоресурсных языков, таких как французский, и на публикацию качественных французских датасетов в экосистеме Hugging Face.
Значение¶
Релиз предлагает разработчикам и исследователям компактные открытые модели, ориентированные на французский язык, с заявленными конкурентоспособными результатами против моделей примерно втрое большего размера.
Обсуждение¶
Комментаторы положительно оценивают выпуск и публикаку SFT-данных, но спрашивают, проводилась ли дополнительная предобучающая адаптация базовых моделей под французский язык. Также высказываются сомнения в полноте сравнения: отмечается отсутствие LFM 2.5 2.6B среди конкурентов и вопрос, не было ли это намеренным.
Проверка фактов¶
Утверждение о выпуске Luth-2-2B как небольшой французской non-reasoning модели подтверждается официальной страницей Hugging Face, где она описана как 1,88-миллиардная модель, претендующая на state-of-the-art во французском для своего размера. Заявление о построении на Qwen3.5 с 3B-токенной SFT-смесью, обучением с подкреплением и multi-domain on-policy distillation подтверждается официальным репозиторием GitHub. Конкретные числовые сравнения с Gemma-4-E2B-it и granite-4.0-h-micro на Multi-IF, MGSM-Rev2 и Math-500 остаются непроверенными по независимым источникам в доступных результатах поиска.