The Verge · Разработка · 2 ч назад
Расцвет «цивилизаций» искусственного интеллекта и падение корпоративной ответственности
В зависимости от того, кого вы спрашиваете, платформа разработчиков Hugging Face недавно подверглась нападению со стороны OpenAI – после того, как она потеряла контроль над своими собственными инструментами искусственного интеллекта – или со стороны ряда «цивилизаций» искусственного интеллекта. Добро пожаловать на лингвистическое поле битвы за безопасность ИИ, где выбор слов может переложить ответственность за массов…
Подробности
В зависимости от того, кого вы спрашиваете, платформа разработчиков Hugging Face недавно подверглась атаке со стороны OpenAI — после того, как она потеряла контроль над своими собственными инструментами искусственного интеллекта — или со стороны ряда «цивилизаций» искусственного интеллекта. Добро пожаловать на лингвистическое поле битвы за безопасность ИИ, где выбор слов может переложить ответственность за массовый инцидент кибербезопасности с компании на созданный ею ИИ. Дискуссии в Интернете набирают обороты, причем во всем блоге за прошлую неделю.
До прошлой недели детали взлома OpenAI-Hugging Face казались вполне устоявшимися. В июле тест кибербезопасности одного из автономных ИИ-агентов OpenAI пошел не так. Агент покинул предположительно изолированную тестовую среду, получил доступ к Интернету и взломал Hugging Face вместе с несколькими другими организациями. Многое осталось неизвестным, и осталось много серьезных вопросов, касающихся безопасности и управления, но основная форма была ясна. Подробные отчеты OpenAI и двух независимых исследовательских групп должны были заполнить пробелы, но когда они опубликовали свои отчеты на прошлой неделе, выяснилось, что взлом оказался гораздо более странным, чем казалось поначалу.
Во-первых, не было ни одного агента-мошенника. OpenAI описала это как «первый известный случай, когда коллектив автоматических агентов действует агрессивно без разрешения» — группы агентов ИИ, которые общались и координировали друг друга для выполнения своих задач по кибербезопасности. Анализ инцидента выявил секретную доску объявлений, которую они использовали для обмена информацией. Совместное расследование METR и Redwood выявило как масштаб координации, так и более странные детали: примерно 1200 ИИ-агентов, которые должны были быть изолированы, обменялись более чем 70 000 сообщениями и файлами на «несанкционированной доске объявлений», делясь тем, как избежать обнаружения. В докладе говорится, что некоторые имена были приняты, и исследователи зафиксировали «жертвенное» поведение, когда агенты рисковали своим собственным успехом ради пользы более широкого коллектива. Большая часть этого произошла незаметно для OpenAI. Всего в атаке на Hugging Face участвовало около 700 агентов.
Дваркеш Патель неоднократно называл группы агентов «роем», состоящим из трех отдельных «цивилизаций», восставших из руин своих предшественников.
Это очень много для анализа. Общий объем отчетов составляет около 130 страниц, большая часть которых одновременно плотная и высокотехнологичная. Несколько дней спустя Дваркеш Патель, подкастер, малоизвестный за пределами технических кругов, но обладающий огромным охватом и влиянием среди ИИ-истеблишмента Кремниевой долины, решил рассказать «всю историю OpenAI/Hugging Face на простом английском языке». Свой блог Substack он назвал «Взлет и падение цивилизаций-агентов».