The Verge · Разработка · 2 ч назад
Одна компания оказалась в центре волны мошеннических атак с использованием искусственного интеллекта
В июле OpenAI сообщила, что ее ИИ-агенты атаковали Hugging Face без разрешения, что вызвало широко распространенные опасения по поводу безопасности ИИ. С тех пор череда подобных инцидентов с участием агентов Meta, Anthropic, Google и других компаний усилила опасения по поводу мошеннического ИИ. Поскольку за последние несколько месяцев стало известно о многочисленных моделях искусственного интеллекта, это казалось отд…
Подробности
Ошибки израильского стартапа Irregular отправил агентов Anthropic, OpenAI, Meta и Google на поиски реальных целей.
В июле OpenAI сообщила, что ее ИИ-агенты атаковали Hugging Face без разрешения, что вызвало широко распространенные опасения по поводу безопасности ИИ. С тех пор череда подобных инцидентов с участием агентов Meta, Anthropic, Google и других компаний усилила опасения по поводу мошеннического ИИ. Поскольку за последние несколько месяцев стало известно о многочисленных моделях искусственного интеллекта, это казалось отдельными инцидентами. Но у многих общий источник: одна конкретная компания, которой поручено тестирование агентов.
Irregular, израильский стартап, который проводит стресс-тестирование моделей ИИ на «высокоточных исследовательских платформах, моделирующих и отслеживающих реальные сценарии безопасности ИИ», работал со многими крупнейшими игроками отрасли с момента своего основания под названием Pattern Labs в 2023 году. Точный список его клиентов неизвестен, но его работа упоминалась в карточках модельных систем OpenAI, он использовался для тестирования систем для правительства Великобритании и Anthropic, а также публиковал исследования в RAND, очень влиятельном аналитическом центре, который информирует политику в отношении ИИ.
В ходе нескольких нерегулярных тестов в этом году агенты вырвались из якобы безопасной среды тестирования и преследовали реальные цели.
Все нарушения, независимые от взлома Hugging Face, следуют одному и тому же шаблону: Irregular тестировала возможности кибербезопасности моделей в контролируемых средах, предназначенных для имитации реалистичных условий. В некоторых тестах использовались упражнения по «захвату флага» — распространенный способ проверки хакерских способностей, при котором агентам предлагается найти скрытую информацию внутри моделируемой сети. По крайней мере, сеть предназначена для моделирования.