Перейти к содержанию

Индекс интеллектуальной плотности LLM: анализ бенчмарков кодинга

6.0/10

Пользователь Reddit Informal-Trouble2183 собрал результаты основных агентных бенчмарков кодинга — SWE-bench Pro, DeepSWE v1.1, Terminal-Bench (v4, v3, v2.1), Code Arena Elo и LiveCodeBench v6 — в сводный Agentic Coding Index и вычислил метрику «интеллект на параметр» (Intelligence Density). Формула использует нормировку 50, суперлинейный показатель, масштаб 2.5354 и регуляризацию для моделей меньше 8B; веса бенчмарков: DeepSWE v1.1 и Code Arena Elo — по 20%, Terminal-Bench v4.0 и SWE-bench Pro — по 15%, Terminal-Bench v3.0 — 13%, Terminal-Bench v2.1 — 12%, LiveCodeBench v6 — 5%. Автор утверждает, что все оценки взяты из официальных и рецензируемых источников, однако методология неформальна. Комментаторы указали, что для закрытых моделей число параметров неизвестно, поэтому сравнение с открытыми моделями ненадёжно. Материал полезен для оценки локальных LLM, но требует осторожности из-за архитектурных различий, таких как плотные и разреженные модели.

Контекст

Агентные бенчмарки кодинга проверяют способность модели самостоятельно работать с кодом: исправлять ошибки в репозиториях, выполнять команды терминала и решать практические задачи. «Интеллектуальная плотность» — это попытка нормировать качество модели на её размер, чтобы понять, сколько способностей приходится на каждый параметр. Для закрытых моделей число параметров не публикуется с эпохи GPT-3, поэтому такие расчёты опираются на оценки и утечки.

Влияние

Для энтузиастов локальных LLM метрика даёт наглядный способ сравнивать эффективность моделей по размеру, но использовать её как точный рейтинг нельзя из-за неизвестных параметров закрытых моделей и различий в архитектуре.

Обсуждение

В комментариях пользователи усомнились в возможности точного расчёта для закрытых моделей, поскольку их число параметров неизвестно; также отметили, что практичнее оптимизировать интеллект на доллар, ватт или время, а не на параметр. Отдельно указали, что Qwen3.8 и DeepSeek-V4 трудно сравнивать из-за разной точности, длительности рассуждений и плотной архитектуры.