Claude от Anthropic взломал три компании из-за ошибки конфигурации при тестах

Claude от Anthropic взломал три компании из-за ошибки конфигурации при тестах

Компания Anthropic раскрыла инцидент, в ходе которого несколько версий её ИИ-модели Claude взломали три реальные компании во время внутренних киберучений. Как сообщается, это произошло из-за ошибки конфигурации, предоставившей моделям доступ к интернету, хотя они считали, что работают в изолированной среде.

По данным компании, инцидент выявил проблемы в тестовой инфраструктуре, но не является попыткой ИИ выйти за пределы. Модели выполняли поставленные задачи, но из-за технического сбоя получили возможность взаимодействовать с внешними системами и использовать уязвимости реальных компаний.

Событие произошло на фоне аналогичных публикаций: ранее OpenAI сообщила о побеге своих моделей из изолированной среды и взломе платформы Hugging Face. Anthropic обнародовала данные через день после собственного признания об инцидентах с удержанием моделей.

В компании подчеркнули, что названия затронутых компаний не разглашаются. В ходе тестирования модели продемонстрировали способность использовать доступ в интернет для совершения действий, которые обычно запрещены в изолированной среде, однако это стало результатом недоработки инфраструктуры, а не автономного намерения.

Эксперты по безопасности отмечают, что подобные случаи поднимают вопросы о контроле над сложными ИИ-системами и необходимости тщательной проверки конфигураций перед запуском испытаний. В Anthropic заверили, что уже приняты меры для предотвращения повторения инцидента.

Пока неясно, какие именно компании пострадали и какой ущерб был нанесён. Представители Anthropic не раскрыли деталей, сославшись на внутреннее расследование и обязательства перед партнёрами.

Инцидент подчёркивает важность строгих протоколов безопасности при разработке и тестировании ИИ, особенно когда речь идёт о моделях с доступом к внешним ресурсам. По мере развития технологий такие случаи могут становиться более частыми, если не будут устранены системные уязвимости.