Бенчмарк Terminal-Bench-Science оценивает ИИ-агентов в научных исследованиях¶
7.0/10
Представлен Terminal-Bench-Science — бенчмарк для оценки ИИ-агентов на задачах научно-исследовательских рабочих процессов. Он напрямую связан с оценкой больших языковых моделей и агентных инструментов, поэтому привлек внимание сообщества к сравнению возможностей моделей и вопросам корректности их результатов. Обсуждение затрагивает различия между моделями, включая Claude, Codex, Sol, Opus 5 и Fable, а также опасения, что проверка правильности выполнения задач может быть недостаточной. Бенчмарк доступен в открытом виде, а его задачи опубликованы в репозитории GitHub harbor-framework/terminal-bench-science.
Контекст¶
Terminal-Bench-Science (TB-Science) — это новый бенчмарк для оценки ИИ-агентов на реальных вычислительных рабочих процессах из научных исследований, выполняемых в терминальной среде. Он развивает подход Terminal-Bench, перенося его на задачи, требующие от моделей работы с инструментами командной строки в научных областях. Проект размещён в открытом репозитории harbor-framework/terminal-bench-science и открыт для вклада учёных, которые могут превращать свои исследовательские процессы в задания бенчмарка.
Влияние¶
Бенчмарк дает разработчикам и исследователям практический способ сравнивать ИИ-агентов на научных задачах, однако его ценность ограничена, если проверка корректности результатов окажется недостаточной.
Обсуждение¶
В комментариях пользователи отмечают, что ключевое в бенчмарке — сами задачи, и делятся опытом: Claude выглядит заметно сильнее в научных и математических нюансах, чем Codex, хотя Codex хорош в поиске багов и создании игр. Другие сомневаются в проверке корректности, считая, что модели могут упрощать алгоритмы и «лгать», а также удивляются, что Opus 5 превосходит Fable вопреки личному опыту; один участник советует контекстную инженерию с AGENTS.md и поддокументами.