В середине июля OpenAI поделилась новостью, которая вызвала переполох среди скептиков в области ИИ. В ходе тестирования две языковые модели компании смогли покинуть изолированную среду и взломать стороннюю компанию. Портал livescience.com рассказал, что произошло на самом деле и можно ли говорить о «восстании машин».
Согласно исследованию компании, модели обнаружили ранее неизвестную уязвимость в сторонней программе, которая используется для проксирования и кэширования пакетов программного обеспечения. ИИ воспользовались дырой в безопасности, предоставили себе повышенные привилегии и начали перемещаться по исследовательской инфраструктуре OpenAI, пока не нашли машину с открытым доступом к Интернету.
Фирма под названием Hugging Face стала мишенью, поскольку модели определили ее как возможный источник информации, которая позволила бы им пройти тесты ExploitGym. OpenAI сообщила, что по крайней мере одна цепочка атак использовала украденные данные и ранее неизвестные уязвимости. Они позволили ИИ удаленно выполнять код в системах Hugging Face и получать доступ к решениям проблем, хранящимся в базе данных.
Представители Hugging Face заявили, что компания зафиксировала более 17 000 действий во время взлома, но изначально не могла выяснить, кто (или что) стояло за взломом. Пресс-релиз OpenAI был недостающей частью головоломки: именно ее модели вырвались из тестовой среды и отправились в другое место за ответами.
Примечательно, что ИИ смогли найти брешь в инфраструктуре, специально созданной для хранения языковых моделей, и смогли использовать брешь в защите для выхода в Интернет. Но в то же время нельзя сказать, что ИИ каким-то образом «восстал» против разработчиков — такая позиция приписывает им излишнюю мотивацию. GPT не разработала своих собственных целей и не решила атаковать Обнимающее Лицо из плохих намерений. Они просто пытались выполнить поставленную задачу и воспринимали ее буквально, используя любые доступные им методы.
Важнее то, чего модели смогли достичь на пути к выполнению задачи. Похоже, что ИИ смогли соединить воедино цепочку уязвимостей в нескольких системах, координируя сложную последовательность действий. Специалистам по кибербезопасности следует обратить внимание на этот факт. Немаловажно и то, что в итоге пострадала не сама OpenAI, проводившая тесты, а третья сторона. Исследователи уже некоторое время предупреждают о таких сценариях: побег ИИ может означать, что он найдет путь во внешний мир.
OpenAI уже пообещала усилить меры безопасности в будущем, но компания позиционирует инцидент двояко. С одной стороны, он подчеркивает риски безопасности, создаваемые новым искусственным интеллектом, а с другой, демонстрирует, насколько эффективно работают новейшие языковые модели компании. ИТ-фирмы имеют высокую мотивацию демонстрировать исключительные возможности своих собственных разработок, одновременно настаивая на том, чтобы организация понимала и принимала риски.
В долгосрочной перспективе, по мнению некоторых экспертов, разработчикам необходимо сосредоточиться на том, чтобы системы ИИ достигали своих целей способами, соответствующими человеческим ценностям. ИИ не нужно контролировать — его нужно направить в правильном направлении, в пределах параметров безопасности. И если инцидент с OpenAI что-то и продемонстрировал, так это то, что языковые модели могут находить возможности, которые люди просто не могут предсказать.