Перейти к содержанию

Собственная квантованная LLM: 250M параметров, 60 МБ, 100M токенов контекста

8.0/10

Разработчик обучил LLM с 250M параметров с нуля на 30B токенах датасета FineWeb и квантовал её ниже 2 бит на параметр, поэтому развёртывание занимает 60 МБ и около 80 МБ RAM. На обычном CPU ноутбука модель выдаёт примерно 400 ток/с без GPU. Длинный контекст устроен так: последние 2048 токенов хранятся в fp16 как обычный KV-кэш, а более старые сжимаются до 1 бита и пишутся на диск (~320 байт на токен, 1 млн токенов ≈ 320 МБ); модель обучали извлекать информацию из такого дискового кэша объёмом до 100M токенов, но не рассуждать над ней. На отложенных англоязычных веб-текстах базовая модель показывает кросс-энтропию 3,15 нат/токен, перплексию 23,3 и 0,99 бит/байт. Словарь тоже нестандартный: каждый из 131k токенов — фиксированный 512-битный код (8,4 МБ, ноль обучаемых параметров), и на WordSim-353 он даёт 0,619 корреляции Спирмена против 0,029 у случайных кодов.

Контекст

Обычные LLM при генерации хранят ключи и значения внимания (KV-кэш) в памяти, и его размер растёт с длиной контекста, что ограничивает работу с очень длинными текстами. Автор сжимает старые токены до одного бита и выносит их на диск, а модель обучается обращаться к этому кэшу, что позволяет довести контекст до 100M токенов при скромных ресурсах. Квантование весов ниже 2 бит дополнительно уменьшает модель до 60 МБ.

Влияние

Для разработчиков edge-устройств и исследователей длинного контекста это практическое доказательство, что 250M-модель с 60 МБ весов и дисковым 1-битным KV-кэшем может работать на обычном CPU; однако качество ограничено, так как модель обучена только извлекать факты из истории, а не рассуждать над ними.

Обсуждение

В комментариях пользователи впечатлены тем, что 1–2-битное сжатие даёт такие результаты, и спрашивают, как подход масштабируется на большие модели и планирует ли автор переходить к reasoning. Также обсуждают устройство офлайн-кэша: его сравнивают с векторной базой данных и просят дополнительные пояснения.

Покрытие источниками

Проверяются выбранные ключевые утверждения, а не истинность всей статьи целиком.

  1. Только данные автора или производителя

    Собственная квантованная LLM: 250M параметров, 60 МБ, 100M токенов контекста

  2. Только данные автора или производителя

    Разработчик обучил LLM с 250M параметров с нуля на 30B токенах датасета FineWeb и квантовал её ниже 2 бит на параметр, поэтому развёртывание занимает 60 МБ и около 80 МБ RAM.

  3. Только данные автора или производителя

    модель обучали извлекать информацию из такого дискового кэша объёмом до 100M токенов, но не рассуждать над ней.