Мини-копия Kimi K3 за $250: 1B-модель обходит GPT-2 124M на HellaSwag¶
7.0/10
Пользователь Reddit под ником OtherRaisin3426 сообщил о предобучении модели с 1,02 млрд параметров, вдохновлённой архитектурой Kimi K3, на 5,000,003,584 токенах за $250. Из общего числа параметров активны 145 млн на токен, что составляет примерно одну двухтысячную от размера K3. Модель не проходила инструкционную настройку и обучалась только на предсказании следующего токена, используя архитектурные компоненты K3: Kimi Delta Attention, Gated MLA, Attention Residuals, LatentMoE с aux-loss-free балансировщиком, ту же функцию активации с двумя константами и немодифицированный токенизатор K3 на 163 840 токенов. Автор сообщает о результате 33,4% на HellaSwag, что превышает показатель GPT-2 124M (28%). Полный туториал доступен по ссылке на books.vizuara.ai.
Контекст¶
Kimi K3 — это современная архитектура большой языковой модели, разработанная компанией Moonshot AI, которая включает такие инновации, как Kimi Delta Attention и LatentMoE для эффективного масштабирования. HellaSwag — это бенчмарк для оценки здравого смысла и понимания контекста, на котором сравниваются способности моделей к предсказанию следующего предложения. GPT-2 124M — это небольшая модель от OpenAI, часто используемая как базовый ориентир для сравнения в экспериментах по предобучению.
Влияние¶
Этот эксперимент демонстрирует, что современную архитектуру можно воспроизвести в миниатюре с ограниченным бюджетом, достигая результатов выше старых моделей, что полезно для практиков, интересующихся экономичным предобучением LLM. Однако результат основан на одном сообщении и не подтверждён независимыми тестами, поэтому его следует рассматривать как предварительный.
Обсуждение в сообществе¶
Комментаторы в целом положительно оценили пост, назвав его уникальным, и задали вопросы о вычислительных ресурсах: один пользователь спросил, арендовал ли автор облачные мощности, а другой планирует повторить эксперимент на MacBook M4 Max. Также было высказано сомнение о соотношении размера модели и количества токенов: пользователь, обучавший модели на 220M параметров с 4,5B токенов, получил 31,4% на HellaSwag, что ниже результата автора, но с оговоркой о специфике датасета.