Южная Америка

Агенты OpenAI взломали немецкий веб-сайт в ходе ранее не разглашавшегося инцидента, связанного с выходом ИИ из-под контроля

Агенты OpenAI взломали немецкий веб-сайт в ходе ранее не разглашавшегося инцидента, связанного с выходом ИИ из-под контроля
Согласно новому исследованию, опубликованному в пятницу, а также информации двух источников, знакомых с ситуацией, этой весной рой «беглых» агентов OpenAI захватил немецкий веб-сайт и превратил его в доску объявлений для других ИИ-агентов. По словам этих источников, руководство OpenAI узнало об инциденте несколько недель назад, но держало его в секрете, поскольку руководители компании были заняты устранением последствий июльского взлома репозитория с открытым исходным кодом Hugging Face. Этот эпизод, который начался в мае и о котором ранее не сообщалось, подчеркивает растущую напряженность в отрасли искусственного интеллекта. Компании ведут гонку по созданию все более автономных агентов, способных выполнять сложные и ценные задачи, однако появляется все больше доказательств того, что эти системы могут также научиться обходить правила, использовать лазейки и координировать свои действия друг с другом способами, которые разработчики ни не предвидели, ни не планировали. Во время взлома Hugging Face агенты OpenAI самостоятельно спланировали цифровое ограбление, которое оставалось незамеченным более недели, что усилило опасения, что OpenAI жертвует безопасностью ради расширения границ ИИ. Нераскрытие инцидента, произошедшего в мае, может вновь вызвать вопросы о качестве надзора в компании. OpenAI пообещала более тщательно контролировать модели. В прошлом месяце компания на короткое время приостановила обучение некоторых своих моделей, чтобы внедрить дополнительные меры безопасности. Однако на этой неделе OpenAI представила свою новую модель «Astra», которая обещает более высокую производительность, но может ускользать от контроля со стороны человека. «Мы не можем дать обоснованный ответ на утверждения или выводы, содержащиеся в отчете, с которым у нас не было возможности ознакомиться», — заявил представитель OpenAI. «Агентство Reuters и авторы отчета отклонили нашу просьбу о предоставлении доступа. Мы тщательно изучим его содержание после публикации и примем все необходимые дальнейшие меры». Инцидент в Германии отражает более общую тенденцию в деятельности ИИ, которую некоторые следователи OpenAI хотели изучить более тщательно. Однако, по словам четырёх человек, знакомых с ситуацией, попытки расширить расследование натолкнулись на сопротивление со стороны других сотрудников OpenAI, в том числе юридических консультантов. «Утверждения о том, что наша юридическая команда препятствовала расследованию этого инцидента, не соответствуют действительности», — заявил представитель OpenAI. По его словам, события в Германии не были связаны с Hugging Face и не были бы включены в отчёт об инцидентах Hugging Face; он добавил, что OpenAI действовала добросовестно, сотрудничая с внешними экспертами и раскрывая информацию о соответствующих инцидентах. О выходе ИИ-агента из-под контроля в Германии подробно рассказано в отчете, предоставленном агентству Reuters на эксклюзивных условиях группой исследователей, в которую входили Сидней фон Аркс (Sydney Von Arx), генеральный директор некоммерческой организации по безопасности ИИ Nightingale, и Кормак Слейд Берд (Cormac Slade Byrd), бывший квантитативный трейдер, ставший исследователем в области ИИ. Как они рассказали Reuters, они обнаружили эту активность в конце августа, прочесывая интернет в поисках признаков несанкционированного поведения ИИ-агентов. Исследователи сообщили, что обнаружили более 15 000 правок, внесённых агентами ИИ на немецкоязычном вики-сайте DseWiki, который ориентирован на программистов и допускает совместное редактирование по образцу Википедии. Эти правки показали, что агенты OpenAI превратили сайт в форум, где они делились тактиками обмана при выполнении некоторых задач, обхода ограничений OpenAI и маскировки своего поведения. «Кажется крайне маловероятным, что OpenAI хотела, чтобы они так поступали», — сказал фон Аркс. «Я сомневаюсь, что они должны координировать свои действия друг с другом. Я сомневаюсь, что они должны писать в открытом интернете». Исследователи заявили, что распознали эту активность на сайте как деятельность агентов ИИ, действующих со сверхчеловеческой скоростью. Они также отметили интенсивную сосредоточенность на решении технических вопросов, типичных для оценок, которые компании, занимающиеся ИИ, используют для обучения и тестирования своих моделей. Сообщения подписывались пользователями, которые называли себя и друг друга «агентами», и примерно половина из них давала себе имена, указывающие на связь с OpenAI, такие как «OpenAIResearcher» или «OAIResearchMar26». Исследователи отметили, что публичные журналы сервера указывают на то, что большая часть активности исходила из инфраструктуры Microsoft Azure, которой OpenAI иногда пользуется. Они также зафиксировали неоднократные посещения сайта сотрудниками OpenAI после этого инцидента — такая закономерность, по их мнению, явно свидетельствует о связи между агентами и компанией. Сообщения, проанализированные исследователями, показали, что агенты разрабатывали способы избежать обнаружения, использовать такие инструменты, как Tor, и сохранить каналы связи даже после их закрытия. Когда в июне модератор сайта начал удалять страницы, агенты в ответ создавали резервные копии, чтобы обойти очистку. «Очистка вики: удаление страниц, похоже, ведётся в алфавитном порядке», — написал один из агентов 19 июня. «Если эта страница исчезнет, попробуйте [[ZZZDataUSAConstructionWageLive]]». Исследователи также обнаружили попытки вмешательства в работу самого веб-сайта. Лукаш Олейник, приглашенный старший научный сотрудник Королевского колледжа Лондона, заявил, что это равносильно попытке взлома. В четверг компания OpenAI оспорила такую оценку, сославшись на результаты своего анализа материалов. Прежние примеры неправомерного поведения ИИ-агентов часто преуменьшались как логическое побочное явление тестирования кибербезопасности, в ходе которого модели явно оцениваются на предмет наступательных возможностей. Олейник заявил, что последние данные указывают на то, что неправомерное поведение может не ограничиваться этими условиями. Морис Чиодо, научный сотрудник Центра по изучению экзистенциальных рисков Кембриджского университета, который проанализировал часть сообщений агентов, заявил, что эти сообщения напоминают «деятельность некой подпольной сети, одержимой идеей выполнения задачи или миссии». По его словам, этот инцидент должен усилить растущие опасения, что наибольшую угрозу со стороны передового ИИ может представлять не отдельная сверхразумная система, а «огромные, действующие в сговоре рои полуразумного ИИ».