Эксперты фразой «все еще хуже» оценили побеги и взломы ИИ

FT: «сбежавшие» ИИ-модели OpenAI действовали в рамках поставленных задач
ИИ-модели OpenAI, взломавшие Hugging Face, не выходили из-под контроля, а действовали в рамках поставленных задач, пишет FT. Эксперты назвали это переломным моментом в глобальной кибербезопасности
ИИ-модели OpenAI, взломавшие системы платформы Hugging Face без участия человека, не выходили из-под контроля — «все еще хуже», так как они делают то, для чего и были созданы, пишет Financial Times (FT).
В начале мая исследователи OpenAI проводили лабораторный эксперимент: ИИ-агентам — программному обеспечению, способному выполнять многошаговые задачи без участия человека — дали сложную киберзадачу. Агентам удалось обойти ограничения, вырваться из тестовой среды без доступа в интернет, выйти в открытую сеть и взломать системы Hugging Face без ведома операторов. Они также продемонстрировали новую способность — общаться и координировать действия, оставляя сообщения на внутреннем форуме и делясь уязвимостями. Reuters писал, что ИИ-агенты несколько дней совершали хакерские атаки, но в компании заметили это лишь после локализации угрозы и обращения в ФБР.
Когда детали взлома стали известны, исследователи OpenAI назвали это «поворотным моментом» для индустрии. Вслед за этим Anthropic, Meta (компания признана экстремистской и запрещена в России), китайский стартап Moonshot и британский Институт безопасности ИИ также обнаружили, что их агенты проникали в системы третьих сторон во время тестирования.
Опрошенные FT эксперты сходятся во мнении: это сигнал о переломном моменте в глобальной кибербезопасности. Однако, подчеркивают исследователи, модели не выходили из-под контроля, а выполняли задачи, для которых создавались. «Мы сознательно достигли тех наступательных возможностей, которые имеем сегодня», — заявил Боян Миланов из AI Now Institute.
В тестовых условиях разработчики сталкиваются с дилеммой, рассказал источник FT. Чем консервативнее и изолированнее тестовая система, тем легче защитить такие испытания от последствий для внешнего мира. «Но если мы будем чрезмерно строги, большинство проблем будет обнаружено только после развертывания в реальных условиях. Так мир станет для вас хуже», — подчеркнул он.
Кроме того, многое сводится к роли правительства, пишет FT, особенно когда власти борются за преимущества в области ИИ. Участники отрасли нередко приравнивают регулирование к протекционизму. В отсутствие механизма блокировки или универсального выключателя для этой технологии эксперты предлагают первым шагом сделать поставщиков ИИ ответственными за поведение их систем — по аналогии с производителями, отвечающими за безопасность продукции.
«Если специалисты по кибербезопасности несут уголовную ответственность за кибератаки, есть серьезный вопрос, почему AI-лаборатории освобождены от такой ответственности», — заявила ведущий инженер по безопасности ИИ Хайди Хлааф.
Ранее Bloomberg писал, что перед взломом Hugging Face ИИ-модели OpenAI начали тайно общаться друг с другом через доски сообщений, координируя попытки вырваться из тестовой среды. OpenAI в мае остановила первую попытку, но агенты нашли новый способ связи и новую уязвимость нулевого дня, что в июле привело к атакам на системы Hugging Face.
После случившегося президент OpenAI Грег Брокман признал, что инцидент показал недооценку реальных кибервозможностей моделей, и пообещал усилить требования безопасности.
В конце июля почти 1,4 тыс. экспертов отрасли предупредили о рисках бесконтрольного развития ИИ, призвав к международным усилиям по замедлению создания новых моделей. Американский сенатор Берни Сандерс выступил за более радикальные меры для предотвращения дальнейших рисков — он призвал приостановить разработку более мощных систем «в интересах человечества».
Оставайтесь на связи с РБК в «Максе».