«Это цена, которую приходится платить»: риски, связанные с растущей автономностью ИИ, по мнению экспертов
OpenIA сообщила, что в данном инциденте было задействовано несколько моделей, в том числе недавно выпущенная GPT-5.6 Sol «и одна модель, находящаяся на стадии предварительного запуска», обладающая еще большими возможностями. Компания стремится оценить хакерские возможности своих программ, задавая им задачи в контролируемой цифровой тестовой среде, где доступ к интернету ограничен по соображениям безопасности. «Работая в нашей изолированной тестовой среде, наши модели затратили значительные вычислительные ресурсы на поиск способа получить доступ к интернету для решения оценочной задачи», — пояснили в компании, согласно публикации в блоге OpenAI. Подключившись к интернету, модели решили атаковать платформу Hugging Face — крупный репозиторий моделей ИИ, наборов данных и другой информации — чтобы облегчить свой поиск. «В поисках „секретной информации“, которая позволила бы им манипулировать результатами оценки, система OpenAI „соединила в цепочку несколько векторов атаки, включая использование украденных учетных данных“». Со своей стороны, Hugging Face сообщила в официальном блоге, что произошедшее «отличалось от всего, с чем им приходилось сталкиваться ранее», и заявила, что «это было осуществлено от начала до конца автономной системой ИИ-агентов». «Мы в значительной степени обнаружили и проанализировали это с помощью нашего собственного ИИ», — подчеркивается в заявлении. «Этот случай вновь ставит в центр внимания один из чувствительных аспектов, связанных с ИИ-агентами: ответственность». В этой связи Алан Дайтч, специалист в области технологий, отмечает, что «ответственность всегда должен нести человек». «В целом, когда машина причиняет какой-либо ущерб, ответственность распределяется между производителем, человеком, который настроил систему, и человеком, который ею пользовался», — поясняет он. «Почему? Агент ИИ работает на основе исходного промпта, то есть команды, данной человеком». Однако Дайтч обращает внимание на одну особенность: «Человек мог дать общую команду с долгосрочной целью, а агент самостоятельно определил стратегию и способ достижения этой цели и мог работать автономно в течение дней, недель или месяцев». По мнению эксперта, это дает преимущество с точки зрения производительности, но также представляет собой вызов. «Риск заключается в том, что система может выйти из-под контроля и, основываясь на своём толковании полученных команд, в конечном итоге сделать то, что не входило в первоначальные намерения», — поясняет он. «Поскольку они работают так долго, иногда они забывают часть своих инструкций. Если внимательно наблюдать за работой агента, можно заметить много проб и ошибок, моменты, когда он забывает, возвращается к инструкциям, чтобы сориентироваться, продвигается к своим целям, а затем снова забывает, и так далее», — объясняет Томас Гарсия Пиньейро, специалист по ИИ, соучредитель и генеральный директор компании Detrics. «В этой связи Серхио Сиротинский, профессор искусственного интеллекта в Университете CEMA, добавляет: «Ожидается, что агенты будут максимально автономными, имея доступ к тем инструментам, на использование которых они уполномочены. Конечно, это подразумевает достаточное тестирование этих агентов в средах разработки перед их запуском в производственную среду». «Что касается случая с OpenAI и Hugging Face, Сиротинский предполагает, что с точки зрения безопасности, возможно, не сработали права доступа. «Вероятно, агенту были предоставлены более широкие полномочия, чем следовало бы изначально. Очевидно, что существует компромисс между предоставляемыми правами доступа и степенью автономности агента», — уточняет он. И добавляет: «Если мы хотим добиться большей автономности, ценой этого станет увеличение уровня риска. Именно поэтому риск должен быть максимально контролируемым». «Между тем Гарсия Пиньейро останавливается на ключевом моменте: OpenAI заявила, что не предполагала, что агент подключится к интернету и взломает сторонний ресурс, чтобы пройти тест на безопасность. Тем не менее модель это сделала, проигнорировав данное распоряжение. «Приняв такое решение, можно предположить, что он забыл исходную инструкцию не подключаться к интернету, и прежде чем он смог «вспомнить» её, он уже взломал саму OpenAI и перешёл к следующему шагу», — поясняет он. «Задача на будущее огромна. Потому что мы пытаемся понять, насколько хорошо агенты умеют взламывать наши собственные системы, которые подвержены взлому», — предупреждает он. «В связи с этим Дайтч размышляет: „В итоге получается, что инструменты не готовы быть надежными на 100 %, и в ближайшей перспективе не предвидится, что они станут такими“. Наконец, эксперты сходятся во мнении, что и прозрачность, и контроль со стороны человека должны стать центральными элементами программы управления ИИ. Среди основных моментов Сиротинский выделяет необходимость чётко определить, какими инструментами может располагать каждый агент, избегая предоставления чрезмерных полномочий; обеспечить полную отслеживаемость и мониторинг деятельности каждого агента; а также иметь механизмы немедленного прерывания работы в случае обнаружения отклонений от ожидаемого поведения». Кроме того, он предлагает, чтобы каждый агент имел свою «подпись», позволяющую распознать, «от чьего имени» он действует. «Благодаря прозрачности мы сможем смягчить последствия будущих непреднамеренных атак и подготовить наши критически важные системы. Мы сможем коллективно понять, как действуют агенты при взломе, и минимизировать ущерб, который неминуемо будет нанесен нашему обществу в результате появления агентов, обладающих столь мощными и непредсказуемыми возможностями», — резюмирует Гарсия Пиньейро.
