Cloudflare представила открытые модели Clef и платформу RL-дообучения¶
7.0/10
Компания Cloudflare анонсировала Clef — семейство моделей принятия решений с открытыми весами, а также сопутствующую платформу для их дообучения с помощью обучения с подкреплением (RL). Релиз ориентирован на сценарии автоматизированного выбора действий и расширяет набор инструментов машинного обучения в инфраструктуре провайдера. Веса моделей распространяются под разрешительной лицензией, однако тренировочные датасеты и полный пайплайн воспроизведения на базе архитектуры Qwen авторы не опубликовали. Использование размещенного API оценивается примерно в 0,24 доллара за миллион входных токенов, что делает актуальным сценарий самостоятельного развертывания.
Контекст¶
Модели принятия решений (decision models) оптимизируются не для свободной генерации текста, а для структурированной классификации, маршрутизации запросов и выбора действий по заданным правилам. Дообучение с подкреплением (reinforcement learning) позволяет точнее настраивать такие системы под конкретные целевые метрики и ограничения среды. Формат открытых весов (open weights) дает возможность развертывать подобные специализированные модели на собственной инфраструктуре, избегая зависимости от закрытых провайдеров.
Влияние¶
Разработчики агентных систем и классификаторов получили открытую альтернативу проприетарным моделям принятия решений с лицензией Apache 2.0 и поддержкой API Jev, которую можно использовать через Workers AI или развертывать на собственной инфраструктуре.
Обсуждение в сообществе¶
Разработчики раскритиковали экономику хостинга Clef, отметив, что запуск миллиона решений обходится в несколько раз дороже аналогов вроде Jev, а также указали на невысокую точность 8-битной квантованной версии в задачах компьютерного зрения по сравнению с локальной Gemma. Кроме того, комментаторы подчеркнули разницу между открытыми весами и полноценным open source из-за отсутствия данных для воспроизведения обучения.