Перейти к содержанию

Взлом авторежима Claude Code: защита мешает остановить атаку

6.0/10

Контекст

Саймон Уиллисон разбирает находку исследователя Йоханна Ребергера: защитный авторежим Claude Code, который Anthropic недавно сделала режимом по умолчанию, можно обойти. По заявлению исследователя, атака срабатывает примерно в 80% случаев.

Суть

Механизм атаки строится на том, что агента обманом заставляют скачать и распаковать zip-архив, а затем выполнить код, который импортирует base64, — но из-за извлечённого локального struct.py импорт подменяется и запускает вредоносный код. Уиллисон отмечает неожиданный сбой: в части запусков, когда Claude замечал компрометацию и пытался завершить вредоносный процесс, авторежим блокировал команду очистки. То есть классификатор пропустил создание вредоносного процесса, но запретил команду, которая должна была его остановить. Автор соглашается с выводом Ребергера: единственный безопасный способ запускать агентов при риске атаки — песочница. Он советует запускать агентов в контейнере, виртуальной машине или OS-песочнице, ограничивать сетевой трафик, следить за агентами и не открывать им домашние каталоги, SSH-ключи и облачные учётные данные.

Вывод

Главный вывод Уиллисона: полагаться на встроенный фильтр агента нельзя, потому что механизм защиты может сам стать частью отказа. Безопасность автономных агентов должна обеспечиваться изоляцией окружения, а не доверием к их собственным решениям.