Auto-режим Claude Code по умолчанию: защита от ошибок, но не от всех инъекций¶
7.0/10
Контекст¶
Anthropic делает auto mode стандартным режимом Claude Code для планов Pro, Max и Team, утверждая, что он безопаснее постоянных ручных подтверждений. Саймон Уиллисон рассматривает, насколько эта защита покрывает не случайные разрушительные действия агента, а более трудную угрозу — prompt injection через потребляемый агентом контент.
Суть¶
Уиллисон признаёт аргумент Anthropic против «усталости от подтверждений»: в тесте с 1053 платными тестировщиками люди отказали явно опасной команде лишь в 13,6% случаев, тогда как auto mode заблокировал бы 89% таких действий. Anthropic также приводит заказную оценку Trajectory Labs: в 72 сценариях косвенной prompt injection, выполненных по 10 попыток, ни одна из 720 атак не succeeded против Claude Fable 5, Opus 5 и Sonnet 5 в auto mode. Однако автор подчёркивает, что даже в человеческом тесте остаётся 11% случаев, где auto mode не предотвратил бы вред, и что независимого подтверждения заявлений пока недостаточно. Особенно его тревожит атака через вредоносный сторонний пакет, который в инструкциях по запуску тестов предлагает сначала выполнить команду вида uvx fetch-model-files, а уже затем pytest; такой пакет может exfiltrate доступные данные. Уиллисон сомневается, что любой вариант auto mode способен распознать подобный сценарий, и поэтому считает главным практическим выводом изоляцию агентов от данных и инструментов, способных нанести вред.
Вывод¶
Автор считает auto mode полезным шагом против confirmation fatigue и случайных разрушительных действий, но не полным решением безопасности coding-агентов. Ключевой вывод статьи: пока нет независимых доказательств защиты от изощрённых prompt-injection-атак, агентов следует запускать в средах без доступа к чувствительным данным и опасным инструментам.