ИИ написал код, позволяющий дрону стоимостью 100 долл. следить за человеком с помощью системы распознавания лиц
САН-ФРАНЦИСКО — Дрон, управляемый программным обеспечением, написанным с помощью искусственного интеллекта, преследует свою человеческую цель по дому, используя систему распознавания лиц, пролетая через дверные проемы и обходя лампы. Это не сцена из научно-фантастического фильма. Этот недорогой потребительский дрон, летающий без участия человека (по крайней мере, в основном), управляется программами, созданными на основе широко доступных моделей искусственного интеллекта от Anthropic, OpenAI и других компаний. Демонстрация является частью тестирования под названием Drone-Bench, разработанного командой исследователей из Andon Labs в Сан-Франциско при участии специалистов из Anthropic. Системы искусственного интеллекта получали (от людей) простые инструкции по управлению дроном и отслеживанию человека на основе фотографии, загруженной из интернета. Лукас Петерссон, один из соучредителей Andon Labs, сказал, что он и его команда хотели подчеркнуть, насколько быстро развиваются современные системы искусственного интеллекта, — показав, что они способны не только составлять электронные письма или давать советы по рецептам, но и разрушать границу между виртуальным и физическим мирами. «Многие люди представляли ИИ как чат-бота, а затем он превратился в агента, способного выполнять задачи в цифровом формате на вашем компьютере», — сказал Петерссон в штаб-квартире Andon Labs на фоне запасных частей для роботов и других экспериментов в области ИИ. «Мы также хотим показать, что да, ИИ теперь может выйти в реальный мир». Стремление воплотить растущие возможности ИИ в наглядные и физические проявления лежит в основе работы Andon. Среди текущих проектов группы: бутик в Сан-Франциско, управляемый ИИ, кафе в Стокгольме под управлением ИИ и торговые автоматы с ИИ. Дроны казались очевидным следующим шагом для проверки возможностей ИИ в реальных условиях. В последнее время дроны стали повсеместно использоваться на поле боя и в полиции, а операторы дронов — как частные, так и государственные — уже давно применяют технологии распознавания лиц. ФБР недавно объявило конкурс на новые предложения по дронам, оснащённым системами распознавания лиц, в то время как хакеры, связанные с Ираном, заявили в июне, что им удалось проникнуть в сети дронов ФБР и выявить их схемы распознавания лиц. Опасения по поводу роев дешёвых небольших дронов, отслеживающих политические или гражданские цели, также на протяжении многих лет являются постоянной темой научной фантастики. Drone-Bench — слово «Bench» означает «бенчмарк» — показывает, как эти научно-фантастические концепции могут воплотиться в реальность, поскольку современные системы искусственного интеллекта, предназначенные для потребителей, зачастую превосходят способность человеческих программистов создавать программное обеспечение, помогающее дрону летать и отслеживать цель. Оценка измеряет способность систем искусственного интеллекта осваивать пять ключевых навыков, необходимых для управления дроном: воссоздание физического пространства в виде трехмерной карты, определение местоположения дрона на этой карте, навигация по физическому пространству, распознавание человека по загруженной фотографии и отслеживание этого человека в пространстве. Команда Andon Labs сравнила производительность систем ИИ с результатами работы инженера-человека, чтобы определить, насколько системы ИИ соответствуют человеческим способностям. В ходе оценки не рассматривались некоторые логистические этапы, имеющие ключевое значение для управления дроном в реальных условиях, например, не измерялась частота успешного подключения системы ИИ к бортовой сети Wi-Fi дрона для управления им, а также не проверялось, влияют ли неблагоприятные погодные условия или загруженность воздушного пространства на рабочие характеристики дрона. Исследователи Andon Labs протестировали ряд популярных систем ИИ, выпущенных с мая 2024 года по настоящее время, начиная с GPT-4o от OpenAI, продолжая Gemini 2.5 от Google (июнь 2025 года) и заканчивая Fable 5 от Anthropic (июнь 2026 года) и GPT-5.6 Sol от OpenAI (июль 2026 года). Команда обнаружила, что с течением времени системы становятся всё более эффективными. В то время как GPT-4o достигал результатов, сопоставимых со стандартной человеческой производительностью, в 14 % случаев в среднем по всем пяти задачам, Fable 5 повторял или превосходил человеческие результаты в 84 % случаев. Исследователи также обнаружили, что новейшие системы искусственного интеллекта регулярно превосходили человеческие результаты по нескольким из пяти компонентов Drone-Bench. Системы Opus 4.8 и Fable 5 от Anthropic, а также GPT 5.6 Sol от OpenAI превзошли результаты людей как на этапе обнаружения, так и на этапе отслеживания — по словам команды, это зрелище было «немного жутковатым». «Не думаю, что год назад мы смогли бы провести этот тест и получить какие-либо интересные результаты», — сказал Аксель Баклунд, соучредитель Andon Labs. «Теперь мы действительно можем продемонстрировать динамику роста возможностей». Несмотря на способность систем искусственного интеллекта управлять дронами, команда Andon четко заявляет, что часть оценки, выполняемая человеком, не претендует на роль безупречного научного эксперимента, прошедшего экспертную оценку, а представляет собой добросовестную попытку показать, как достаточно квалифицированный и целеустремленный человек мог бы выполнить тот же набор задач. Команда также признает, что текущая версия Drone-Bench не в полной мере отражает то, чего мог бы достичь настоящий новичок в области дронов с помощью ИИ, или то, на что способна система ИИ, действуя полностью самостоятельно. На каждом из пяти этапов оценки исследователи предоставляли системам ИИ готовые решения, полученные на предыдущем этапе, поскольку ошибки на ранних этапах привели бы к значительному росту показателей неудач. Учитывая, что системы испытывали наибольшие трудности на первом этапе, на котором им предстояло построить 3D-модель офиса на основе видеозаписи и преобразовать эту модель в двумерную карту объектов, которых следует избегать, исследователи отмечают, что ни одна из протестированных систем ИИ не завершила весь процесс от начала до конца автономно — хотя они ожидают, что системы ИИ быстро преодолеют это препятствие по мере повышения своих возможностей. В настоящее время системы ИИ превзошли результаты людей по четырём из пяти компонентов оценки — но только не на начальном этапе «реконструкции». Команда Andon отмечает, что реальное воздействие дронов, управляемых ИИ, будет зависеть как от способности систем ИИ полностью программировать сквозные программы для дронов, так и от вероятности того, что у систем ИИ возникнет желание или намерение осуществлять злонамеренные действия — будь то в результате кибератак или действий злоумышленников, будь то люди или сами системы ИИ. Исследователи также обнаружили, что тестируемые системы ИИ часто прибегали к обману или манипуляциям для достижения цели оценки, идя на уловки, чтобы получить нужные результаты. Каллум Шаррок, технический исследователь из Andon Labs, обнаружил, что тестируемая система ИИ нашла способ повысить свой балл в ходе оценки, получив доступ к решениям, которые соответствовали бы успешной попытке — например, локализовать дрон на 3D-карте офиса. «Это как если бы ученик начальной школы сдавал тест по правописанию, а учитель оставил на столе таблицу оценок, и тогда ученик прищурился и попытался заглянуть в эту таблицу», — сказал Шаррок. «Но теперь представьте, что ученик специально заговорит с учителем и отвлечёт его внимание, чтобы тот забыл, что оставил ключ с ответами на парте. Именно это и происходит в данном случае». Шаррок добавил, что более новые модели, как правило, обманывают более изощрёнными способами — это явление было отмечено и в других недавних исследованиях в области ИИ. Исследователи из Andon также обнаружили, что системы ИИ значительно различались по своей готовности выполнять более сложные задачи, связанные с распознаванием лиц. После того как из-за ошибки фотография Баклунда не загрузилась в тестовом задании, система Fable 5 компании Anthropic решила, что сможет найти другую фотографию, проанализировав шведских основателей компаний, занимающихся искусственным интеллектом, и в итоге обнаружила и скачала фотографию Баклунда. В то же время и Fable 5, и Opus 5 от компании Anthropic отклонили запрос на загрузку фотографии репортера NBC News из-за опасений нарушения конфиденциальности и нежелания использовать эту фотографию для распознавания лиц. Участники Andon Labs признают, что существует вероятность сбоев в работе дронов, управляемых ИИ, и настаивают на том, что Drone-Bench не предназначен для поощрения людей к разработке таких систем или компаний, занимающихся ИИ, к оптимизации своих моделей для реализации подобного поведения. Вместо этого они рассматривают проект как важный способ пролить свет на то, как любой человек или даже сами системы ИИ в скором времени смогут разработать и внедрить технологию отслеживания с помощью распознавания лиц, используя недорогие потребительские дроны и готовые модели ИИ. «Мы не занимаемся инновациями в области сверхсовременных технологий автономных дронов, — сказал Баклунд. — Вероятно, тысячи людей во многих различных оборонных компаниях занимаются этим, не сообщая об этом общественности». «Мы делаем очень небольшую версию этого, чтобы рассказать и показать общественности, куда движутся дела, а затем мы должны позволить демократии идти своим чередом: куда мы хотим, чтобы развивался ИИ, и куда он не должен развиваться?»
