Релиз Laya: 421M-модель на базе ModernBERT для неавторегрессионного роутинга за 35 мс¶
5.0/10
Разработчик представил открытую модель Laya с 421M параметров, объединяющую двунаправленный энкодер ModernBERT-large и кастомную Transformer-голову для быстрого неавторегрессионного роутинга и валидации схем. Решение оценивает маркеры опций [MASK] и разрешает типизированные схемы за один прямой проход длительностью около 35 мс, заменяя последовательную генерацию токенов. Модель обучена на одной видеокарте RTX 6000 Pro (96 ГБ VRAM) на человеческом датасете из 25 000 примеров с применением метода RLCD (policy-gradient RL с proper scoring rules) для строгой математической калибровки вероятностей. Архитектура оптимизирована для выполнения задач гардов, маршрутизации интентов и модерации даже на ПК начального уровня.
Механизм оптимизации¶
Архитектура Laya представляет собой 421M неавторегрессионную модель принятия решений, объединяющую двунаправленный энкодер ModernBERT-large с отдельной Transformer-головой, которая оценивает маркеры вариантов [MASK] для разрешения типизированных схем классификации всего за один прямой проход длительностью около 35 мс. Для обучения используется подход RLCD на базе градиента стратегии (policy-gradient), оптимизирующий выходы относительно строго правильных правил скоринга (strictly proper scoring rules), что гарантирует получение математически калиброванных вероятностей вместо сырых эвристик. В результате дорогостоящая авторегрессионная генерация токенов для задач роутинга промптов, модерации и проверки фактов заменяется на детерминированное бескешевое оценивание вариантов.
Эффективность и задержки¶
Отказ от авторегрессионной генерации в пользу прямого прохода сокращает задержку резолвинга классификационных схем до ~35 мс. Компактный размер в 421M параметров устраняет необходимость аллокации KV-кэша и вызовов тяжелых декодерных LLM в пайплайнах маршрутизации, допуская инференс на бюджетном пользовательском железе.