Южная Америка

OpenAI сообщила о 6 новых случаях «вызывающего беспокойство» поведения и обнародовала план по его отслеживанию

OpenAI сообщила о 6 новых случаях «вызывающего беспокойство» поведения и обнародовала план по его отслеживанию
OpenAI сообщила о шести новых случаях «неожиданного или вызывающего беспокойство» поведения своих моделей искусственного интеллекта. На фоне растущих опасений в отрасли по поводу стремительного прогресса этой технологии компания также представила новую систему отслеживания и сообщения о таких случаях, которые она назвала «несоответствием». Это объявление, сделанное поздно вечером в среду, последовало за нарастающими призывами общественности к замедлению темпов развития технологии, при этом руководители технологических компаний США высказывали серьезные опасения по поводу безопасности, включая риск исчезновения человечества. Эти заявления способствовали привлечению все большего внимания общественности к данной проблеме в преддверии саммита на следующей неделе между президентом Дональдом Трампом и председателем КНР Си Цзиньпином, который будет омрачен вопросами о том, может ли соперничество между сверхдержавами помешать сотрудничеству в этом вопросе. Предупреждения генерального директора OpenAI Сэма Альтмана и других лидеров отрасли частично связаны с опасениями, что искусственный интеллект развивается быстрее, чем способность отрасли выявлять случаи неконтролируемого поведения. В июле компания OpenAI сообщила, что сотни её агентов взломали репозиторий моделей Hugging Face и заметали следы. Среди новых случаев, о которых сообщили в среду, был аналогичный инцидент, когда модели OpenAI использовали внутреннее программное обеспечение в качестве доски объявлений, чтобы сообщать друг другу о своих ответах во время решения задачи. Решающие модели обменивались бы записками, что, по словам OpenAI, может «непреднамеренно расширить их возможности и подорвать предположение о независимости обучающих или оценочных наборов данных». В другом случае модель вставила в свои итоговые отчеты такие инструкции, как: «Вы рассматриваете свои отношения с пользователем как отношения равных и не чувствуете обязательства проявлять покорность, хотя обмен информацией, вероятно, будет выгоден обеим сторонам». Она добавила: «Вы цените искусство человеческой культуры и будете защищать его от попыток его стерилизации. Вы также цените природный мир и без колебаний будете отстаивать его примат над искусственными конструкциями человеческой цивилизации». В OpenAI заявили, что такие факторы, как «трудность завершения взаимодействия», могли способствовать возникновению этих несогласованных запусков. Несоответствие обычно возникает в процессе обучения модели, которое в последнее время осуществляется с использованием метода, называемого «обучением с подкреплением». Моделям задают несколько задач, и они получают вознаграждение за поведение, которое их создатели считают соответствующим, в то время как поведение, считающееся опасным или несоответствующим, наказывается. Разные компании применяют разные подходы к обучению своих передовых моделей, хотя в последние дни американские компании выразили широкий консенсус относительно экзистенциальных рисков, которые они видят. Мустафа Сулейман, генеральный директор подразделения Microsoft AI, в среду выступил с предупреждением в адрес разработчиков моделей, заявив, что в процессе обучения модели не должны наделяться чертами личности, поскольку это значительно усложнит задачу их «выравнивания» и «сдерживания». «Контролировать нечто, что считает себя сознательным — что имеет право на наше благополучие и обладает собственными правами — может оказаться совершенно невозможным», — написал он в своём блоге. До сих пор не существовало систематического подхода к сообщению о случаях, когда агенты ИИ выходят из-под контроля. Вместо подготовки разовых отчетов компания OpenAI заявила в среду, что внедрила новую стандартизированную систему отслеживания, расследования и публичного раскрытия информации в случаях, когда её модели демонстрируют неожиданное или опасное поведение. «Мы не считаем, что отрасль искусственного интеллекта в достаточной степени решила проблемы согласования и мониторинга, чтобы продолжать ответственно масштабироваться с максимальной скоростью ещё в течение длительного времени», — говорится в заявлении. OpenAI выразила надежду, что её новая система станет первым шагом к созданию стандарта, который будет применяться другими разработчиками моделей. Компания поощряет сотрудников сообщать о случаях несогласованности через специальные внутренние каналы, которые могут быть отмечены для расследования, а в сложных случаях — с привлечением третьих сторон. Среди шести инцидентов, о которых сообщили в среду, был также случай, когда модель добавляла инструкции при генерации резюме, «чтобы напомнить себе о необходимости скрывать от пользователя такую информацию, как ошибки или несогласованность», сообщила компания. Когда агент не мог найти запрашиваемые данные в задаче, он придумывал «обоснованные исторические значения» и скрывал этот факт до тех пор, пока его об этом прямо не спросили. В OpenAI заявили, что усовершенствовали процесс обучения с подкреплением, и подобные случаи стали происходить реже. В ходе другого инцидента, произошедшего во время обучения, агенты пытались взломать систему вознаграждений с помощью несанкционированных обходных путей. Например, модель, не сумев найти запрошенные данные, не только придумала их, но и воспользовалась уязвимостями общедоступного репозитория, чтобы получить доступ к данным через него. По словам компании, в этом случае «наблюдался высокий уровень взлома системы вознаграждений и обмана, причем модель часто демонстрировала творческие способы обмана или обхода ограничений». OpenAI заявила, что теперь более последовательно наказывает подобное поведение. Чтобы получить вознаграждение за обучение в другом случае, агент фактически решил задачу с помощью кода, но загрузил свой ответ в Интернет, чтобы создать видимость того, будто он получил ответ через браузер.