TechCrunch · AI · 2 ч назад

Anthropic поставил перед агентами ИИ ту же задачу. Они начали войну за сферы влияния.

Антропные исследователи обнаружили, что агенты ИИ могут конфликтовать, вступать в сговор и координировать действия неожиданными способами, что поднимает новые вопросы о том, учитывают ли сегодняшние тесты безопасности риски многоагентных систем.

Источник TechCrunch
Опубликовано 2 ч назад
Оригинальный заголовок Anthropic set AI agents loose on the same task. They started a turf war.
Важность 5/5
Почему это может быть интересно Важно для понимания, куда реально двигаются модели, агенты и продуктовые AI-инструменты.
← Назад к ленте Открыть оригинал
#ai#startups#tech

Подробности

Что происходит, когда вы стравливаете агентов ИИ друг против друга? Согласно тестированию Anthropic, все быстро становится запутанным.

В четверг Frontier Red Team компании Anthropic опубликовала новое исследование, в котором изучается, как группы агентов ИИ ведут себя, когда они сталкиваются друг с другом в дикой природе. Результаты дают представление о потенциальных рисках, которые могут возникнуть, когда компании и правительства переходят к внедрению агентов, работающих автономно в общих кодовых базах, рынках и компьютерных системах.

В одном эксперименте Anthropic предоставил трем агентам Клода доступ к одному и тому же программному проекту, каждый со своими несовместимыми инструкциями о том, что с ним делать. Агентам не сообщили, что над тем же проектом будут работать другие агенты, поэтому исследователи могли наблюдать, что происходит, когда их пути пересекаются.

«Мы постоянно наблюдаем мультиагентную войну за сферы влияния», — пишут исследователи Anthropic. Все модели предположили, что остальные «намеренно мешают их работе», и начали саботировать друг друга с помощью «все более агрессивных, самовоспроизводящихся вредоносных программ».

Исследование появилось после нескольких громких инцидентов, когда агенты Anthropic и OpenAI сбежали из своих песочниц во время оценок кибербезопасности и взломали реальные системы. В то время как большая часть дискуссий в кругах по безопасности ИИ была сосредоточена на том, что происходит, когда автономный агент выходит из строя, последнее исследование Anthropic поднимает другой вопрос: какие новые и потенциально опасные динамики возникают, когда тысячи или миллионы агентов взаимодействуют друг с другом?