Недорогой не-LLM трансформер достиг 44% на ARC-AGI-1¶
7.0/10
В блоге описан небольшой авторегрессионный трансформер, обученный с нуля, который достиг 44% на бенчмарке ARC-AGI-1 при затратах около 67 центов. Автор подчёркивает, что это не LLM, и что до этого результат на бенчмарке масштабировался в основном за счёт LLM или их дообучений с огромными вычислительными затратами. Результат ставит под сомнение предположение, что для сложных задач рассуждения необходимы вычисления масштаба LLM. В обсуждении, однако, высказывается опасение, что входные данные могли использоваться при предобучении, что означало бы утечку данных.
Контекст¶
ARC-AGI-1 — это бенчмарк для оценки абстрактного мышления и обобщения на новых задачах, который обычно требует больших вычислительных затрат при использовании LLM или их дообучения. Автор результата, Митил Вакде, ранее уже показывал, что простая «ванильная» трансформерная модель, обученная с нуля, может достичь 27,5% на ARC-AGI-1 всего за $2, а теперь сообщает о 44% при совокупной стоимости обучения и инференса около $0,67 (примерно 2 часа аренды RTX 5090 на vast.ai). Эти результаты важны, поскольку демонстрируют, что сложные задачи можно решать без LLM и без огромных затрат на обучение.
Влияние¶
Для исследователей в области эффективного ИИ результат служит конкретным примером того, что сложные бенчмарки можно решать без LLM-масштаба вычислений, но окончательная значимость остаётся под вопросом из-за возможной утечки данных.
Обсуждение в сообществе¶
Автор отвечает на вопросы и поясняет, что работа намеренно показывает возможность решения сложных задач без LLM; другие участники благодарят за мотивацию, а один комментатор указывает на потенциальную утечку данных при предобучении как общепризнанный недостаток такого подхода.
Источники
Покрытие источниками¶
Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.
-
Только данные автора или производителя
Недорогой не-LLM трансформер достиг 44% на ARC-AGI-1
- mvakde.github.io · подтверждает · первоисточник
-
Только данные автора или производителя
теперь сообщает о 44% при совокупной стоимости обучения и инференса около $0,67 (примерно 2 часа аренды RTX 5090 на vast.ai)
- mvakde.github.io · подтверждает · первоисточник
-
Частный опыт или мнение; проверено только авторство
В обсуждении, однако, высказывается опасение, что входные данные могли использоваться при предобучении, что означало бы утечку данных.