Перейти к содержанию

Cactus выпустила Needle2: 14-МБ агентная LLM для edge-устройств

8.0/10

Компания Cactus представила Needle2 — компактную агентную LLM из 45 млн параметров, упакованную в один 14-МБ бинарный файл с 2-битным сжатием и работающую в сессии при 28 МБ RAM. Модель ориентирована на вызов инструментов, управление устройствами и структурированное извлечение данных на телефонах, носимых устройствах, умном доме, малых роботах и микроконтроллерах. Заявленная скорость декодирования достигает 500 токенов/с на Raspberry Pi 5, 400–1500 токенов/с на VR-устройствах вроде Meta Quest 3S и Apple Vision Pro и 300–700 токенов/с на телефонах дешевле $200. Cactus утверждает, что Needle2 конкурирует с небольшими моделями LFM2.5 230M и Apple Foundation Model на бенчмарках tool call и mobile device use, будучи в 5–70 раз меньше при сравнении f16-моделей с 2-битной Needle2. Модель основана на архитектуре Simple Attention Networks и дополнена механизмом оценки уверенности: при низком пороге уверенности задачу можно передать облаку или более крупной модели.

Контекст

Небольшие агентные языковые модели предназначены не для свободного диалога, а для сопоставления пользовательских команд с доступными функциями устройства и параметрами инструментов. Ранее Cactus уже выпускала первую версию Needle, а Needle 2 развивает ту же идею сверхкомпактного локального LLM для телефонов, носимых устройств, умного дома и малых роботов.

Влияние

Needle 2 позволяет перенести базовые агентские функции — вызов инструментов, управление устройствами и структурированное извлечение данных — на крайне ограниченные устройства, такие как микроконтроллеры, Raspberry Pi 5, недорогие телефоны и носимые гаджеты, без обязательной облачной зависимости. Для разработчиков это открывает путь к локальным ассистентам и автоматизации с малым энергопотреблением и быстрым откликом, особенно там, где нет NPU или дорогого GPU. Однако из-за ограниченных возможностей рассуждения модель, вероятно, будет использоваться как первый уровень в связке с более крупными моделями, а не как полная замена облачным LLM.

Обсуждение

Комментаторы сочли проект интересным для недооценённого сегмента микро-LLM, но отметили слабое качество рассуждений в веб-демо: модель игнорировала параметр яркости и неверно интерпретировала команду «затемнить гостиную». Также прозвучал вопрос, стоило ли приоритизировать скорость вместо большей «умности», если основные выходы модели — короткие tool calls.

Проверка фактов

Утверждение о том, что Needle 2 основан на Simple Attention Networks и ссылается на arXiv:2607.18363, подтверждается: arXiv содержит работу «A Controlled Study of Attention-Only Transformers», описывающую SANs, а документация репозитория cactus-compute/needle связывает SANs с function calling. Утверждения о 14MB-модели, 45M параметрах, 28MB RAM и конкретных скоростях 300–1500 tok/s в предоставленных результатах поиска независимо не проверялись и остаются неподтверждёнными.

Детали

Needle2 расширяет исходную модель поддержкой структурированного извлечения: вместо инструментов модели можно передать схему, а она вернёт структурированный вывод, что позволяет использовать её для классификации текста через enum-поля или суммаризации через заданные поля. Cactus позиционирует задачу как отображение «неаккутного» предложения на типизированные функции, где не нужны мировые знания или свободная генерация текста, что и позволяет обойтись 45 млн параметров. По заявлению компании, обычный трансформор сопоставимой ширины и глубины тратит 164 MFLOPs на токен, сжатый до параметрического уровня Needle — 87 MFLOPs, а сама Needle — 70 MFLOPs. Для адаптации под конкретный продукт предлагается дообучение через Python-пакет на Mac или PC за минуты или часы, с автоматизированной генерацией данных по нескольким примерам. Каждый ответ сопровождается выученным confidence score по технике Cactus Hybrid, что позволяет эскалировать неуверенные запросы в облако или к более крупной модели; в качестве примера называется связка Needle2 с приватным развёртыванием DeepSeek-v4-Flash.

Источники