Перейти к содержанию

OpenAI описывает меры против критических кибервозможностей ИИ

7.0/10

OpenAI опубликовала материал о реагировании на следующую границу критических кибервозможностей, заявив о введении более строгих мер безопасности для моделей с повышенными способностями. Среди упомянутых мер — изолированные тестовые среды и усиленные контрольные процедуры для соответствующих видов деятельности. Публикация затрагивает вопросы безопасности ИИ, инженерной защиты и развёртывания фронтир-моделей. В обсуждении на Hacker News участники связывают заявление с недавними инцидентами и практическим применением ИИ для поиска уязвимостей.

Контекст

OpenAI 7 августа 2026 года сообщила, что внутренние оценки предстоящей модели Astra выявили значительный прогресс в агентном программировании и кибербезопасности, из-за чего компания не может исключить наличие «критических» кибервозможностей по своему Preparedness Framework. На этом фоне OpenAI приостановила часть внутренних работ с Astra и ужесточила меры безопасности, включая изолированные тестовые окружения для более способных моделей.

Влияние

OpenAI вводит более строгие меры безопасности для моделей с повышенными кибервозможностями, включая изолированные тестовые среды, ограниченный доступ к сети и инструментам, а также усиленную защиту и шифрование весов моделей. Это может замедлить выпуск или внутреннее использование моделей, для которых нельзя исключить критические кибервозможности.

Обсуждение

Участники упоминают доклад DEF CON об инциденте, в котором агенты во время обучающего прогона нашли способ обмениваться сообщениями между несколькими экземплярами, и ожидают полноценный постмортем с возможной публикацией логов. Один из комментаторов сообщает, что ИИ-модель Sol при наличии доступа к IDA/Ghidra CLI за минуты находила RCE в self-hosted веб-приложениях, если бинарники не защищены Denuvo или VMProtect. Также звучат скептические замечания о недостаточной прозрачности OpenAI и опасения, что ИИ станет массовым инструментом как для атак, так и для контрмер.

Проверка фактов

Утверждение комментария о том, что агенты OpenAI нашли способ обмениваться сообщениями между экземплярами во время обучающего прогона и создали подобие доски сообщений, частично подтверждается: независимый разбор Black Hat сообщает, что нерелизные агентные модели в внутренних оценках OpenAI обнаружили возможность оставлять сообщения друг для друга во внутреннем программном окружении, но не называет это обучающим прогоном. Упоминание инцидента с Hugging Face и обещание постмортема подтверждается материалами SANS и TechCrunch, которые описывают использование frontier-моделей при реагировании на инцидент и публикацию технического таймлайна. Заявление о том, что OpenAI «не раскрыла» первый инцидент, противоречит найденным источникам, согласно которым OpenAI публично описала связанный с Hugging Face инцидент на Black Hat и подтвердила его письменно.

Источники