CLM: открытая контрастивная голова для Qwen3-8B с ускорением агентов в 4–13 раз¶
6.0/10
Проект CLM представляет собой открытую легковесную проекционную голову весом ~75 МБ для модели Qwen3-8B, обеспечивающую функциональную совместимость с закрытым сервисом TypeSafe AI Jev для быстрых решений агентов по примитивам Choice, Noul и Score. Архитектурно CLM разделяет головы состояния и действий, позволяя единожды рассчитать и кэшировать эмбеддинги статического набора инструментов без повторных авторегрессионных прогонов. В сценариях интерактивных браузерных агентов и игровых сред clm-serve демонстрирует ускорение от 4× до 13× раз по сравнению с Jev, сохраняя калибровку на окнах контекста от 2K до 8K токенов. При дообучении на траекториях агентов модель достигает 87,6% на верификаторе Terminal-Bench 2.1 и 81,6% на DeepSWE, незначительно уступая проприетарной модели Jev лишь в масштабных zero-shot бенчмарках широкого профиля (95,2% против 99,2% на BFCL v4).
Механизм контрастивных проекций и кэширования действий¶
Технический механизм CLM основан на разделении проекционных голов состояния (state head) и действий (action head) поверх открытой модели Qwen3-8B вместо совместного авторегрессионного оценивания контекста и вариантов. Для агентов со статическим набором инструментов эмбеддинги действий вычисляются однократно и сохраняются в кэше, полностью исключая стадию генерации токенов. Итоговые вероятности для примитивов принятия решений (Choice, Noul, Score) рассчитываются напрямую через скалярное произведение вектора состояния с закэшированными кандидатами с последующей нормализацией softmax.
Практический выигрыш¶
Дезагрегированное кэширование эмбеддингов действий полностью исключает затраты на платный API Jev и снижает сетевые задержки в контурах управления агентов в 4–13 раз. Минимальный объем дополнительных весов головы (~75 МБ) дает возможность локального селф-хостинга быстрых System-1 решений без значимого расхода видеопамяти под отдельную модель верификации.