Перейти к содержанию

RL для рассуждений затрагивает 1-3% токенов, реплика без RL

7.0/10

В посте на Reddit пользователь juanviera23 поделился статьёй на arXiv (abs/2605.06241), в которой утверждается, что обучение с подкреплением (RL) для моделей рассуждения изменяет лишь 1–3% позиций токенов. Авторы пишут, что эти изменения разрежены, консервативны и сосредоточены в точках принятия решений с высокой энтропией, причём продвигаемый RL токен всегда входит в топ-5 альтернатив базовой модели. Они заявляют, что воспроизвели прирост качества без использования RL примерно с в 1000 раз меньшими вычислительными затратами, что ставит под вопрос необходимость RL для рассуждений. Обсуждение в сообществе LocalLLaMA показывает интерес, но и скептицизм из-за отсутствия проверенных деталей.

Предпосылки

Обучение с подкреплением (RL) часто применяется для улучшения рассуждений в больших языковых моделях, но ещё до этого предлагались RL-свободные методы вроде STaR и дообучения на основе отбора правильных решений, которые обучаются на собственных верных примерах модели с равномерной токен-уровневой потерей (tool-1-1). Исследования, включая отдельную работу arXiv:2506.01939 и минимальный RL-свободный метод ReasonMaxxer, показывают, что полезный эффект RL сосредоточен на небольшом числе токенов с высокой энтропией на точках принятия решений, и его можно воспроизвести через контрастивную потерю на таких участках (tool-1-2, tool-1-3).

Влияние

Если заявления статьи верны, исследователи и инженеры смогут обучать рассуждающие модели сопоставимого качества примерно в 1000 раз дешевле, избегая RL. Поскольку детали пока не проверены, практическая применимость остаётся под вопросом.

Обсуждение

В обсуждении преобладают скептицизм и оговорки: пользователи сомневаются в утверждении о топ-5, указывают на различие между языковыми и решающими моделями, подчёркивают роль RL для выравнивания и отмечают редакционные красные флаги статьи.

Источники