Модель 1.5B превращает естественный язык в shell-команды на CPU за секунду¶
7.0/10
Автор дообучил Qwen2.5-Coder-1.5B на 125 тыс. пар «естественный язык → shell-команда», заквантовал модель до Q4_K_M (941 МБ) и запустил через llama.cpp на CPU ноутбука. На его машине ответ занимает в среднем 0,59 с; в бенчмарке InterCode-ALFA модель получила 0,620 — выше, чем у ненастроенной Qwen2.5-Coder-7B (0,613), но ниже, чем у GPT-4o (0,73). Веса и код опубликованы под Apache-2.0, есть более сильный вариант 3B. Автор предупреждает, что модель может сгенерировать опасную команду, поэтому нужна дополнительная проверка.
Контекст¶
Qwen2.5-Coder-1.5B — небольшая языковая модель для работы с кодом; дообучение на парах «запрос — команда» превращает её в специализированный NL2Shell-инструмент. Квантование до 4 бит уменьшает размер и требования к памяти, позволяя запускать модель на обычном CPU, а llama.cpp — популярный инференс-движок для таких локальных моделей.
Влияние¶
Для разработчиков это локальная быстрая замена поиску синтаксиса команд с качеством на уровне 7B-модели без GPU, но применять её следует с осторожностью из-за риска опасных команд.
Обсуждение сообщества¶
В комментариях проект хвалят, но иронизируют, что можно было прочитать man-страницы; метафора «дать ребёнку танк Т-34» подчёркивает риск опасных команд.
Подробности¶
На практике автор запускал модель на ноутбуке с Intel i5-11320H (4 потока): скорость 31,9 ток/с, медианное время ответа 0,59 с, потребление около 1,6 ГБ ОЗУ. Квантованная версия занимает 941 МБ и работает через llama.cpp; помимо 1.5B есть вариант 3B с более высоким баллом. Статический проверочный слой в проекте пока отсутствует, и автор прямо пишет, что модель «абсолютно напишет команду, которая сотрёт root», если её попросить. Код опубликован на GitHub, веса — на Hugging Face, оба под Apache-2.0; в LocalLLM проект собрал более 300 звёзд.