Скрытые рассуждения Claude и GPT расшифрованы¶
8.0/10
В Reddit-посте сообщается о статье, в которой утверждается, что найден способ извлечения 100% скрытых токенов рассуждений из всех моделей Claude и GPT через API, что ставит под сомнение достоверность бенчмарков и практики дистилляции. Автор поста отмечает, что примеры показывают, как Claude узнает задачи из бенчмарка AIME и знает ответ, что может означать завышение результатов проприетарных моделей по сравнению с открытыми. Также утверждается, что странные или избыточные рассуждения, наблюдаемые у открытых моделей, являются нормой даже для передовых моделей. В комментариях упоминаются ссылки на GitHub-репозиторий и X-пост, а также обсуждается, что закрытие этой уязвимости может замедлить дистилляцию, которую, по слухам, использовал Китай. Однако дата статьи (2608.09867) выглядит нереалистичной, и утверждения не были независимо проверены.
Контекст¶
Проприетарные LLM-модели (например, Claude и GPT) обычно скрывают свои внутренние «цепочки рассуждений» от пользователей, показывая только итоговый ответ. Это делается для защиты коммерческих секретов и предотвращения копирования моделей. Недавно исследователи заявили, что нашли способ извлекать эти скрытые рассуждения через API, что может повлиять на оценку бенчмарков и практику дистилляции моделей.
Влияние¶
Если подтвердится, что скрытые цепочки рассуждений Claude и GPT можно извлекать через совместимый декодер, это может подорвать достоверность бенчмарков (например, AIME), на которых основаны заявления о превосходстве проприетарных моделей над открытыми, а также ускорить дистилляцию закрытых моделей в открытые, что потенциально сократит разрыв в производительности. Однако эти выводы основаны на непроверенном препринте, и их практическое применение требует дальнейшего подтверждения.
Обсуждение в сообществе¶
Комментаторы в основном согласны с важностью находки, но расходятся в выводах: один пользователь приводит пример рассуждений Claude, подтверждающий знание ответа на задачу AIME, другой считает, что это помогает только в пост-тренинге и экономит деньги, а третий оптимистично прогнозирует появление открытых моделей уровня GPT-5.6 Luna max к концу года. Некоторые ссылаются на GitHub-репозиторий и X-пост для дополнительных деталей.
Проверка фактов¶
Утверждение о том, что статья существует и описывает извлечение 100% токенов рассуждений, не может быть проверено, так как ссылка на arXiv (2608.09867) содержит нереалистичный номер (2608 указывает на август 2026 года), что ставит под сомнение ее подлинность. Утверждение о том, что Claude знает ответ на задачу AIME, основано на цитате из комментария, но не подтверждено независимыми источниками. Ссылки на GitHub-репозиторий и X-пост не проверены, так как инструменты недоступны.