The Verge · Разработка · 2 ч назад

Одна компания оказалась в центре волны мошеннических атак с использованием искусственного интеллекта

В июле OpenAI сообщила, что ее ИИ-агенты атаковали Hugging Face без разрешения, что вызвало широко распространенные опасения по поводу безопасности ИИ. С тех пор череда подобных инцидентов с участием агентов Meta, Anthropic, Google и других компаний усилила опасения по поводу мошеннического ИИ. Поскольку за последние несколько месяцев стало известно о многочисленных моделях искусственного интеллекта, это казалось отд…

Источник The Verge
Опубликовано 2 ч назад
Оригинальный заголовок One company is at the center of a wave of rogue AI attacks
Важность 3/5
Почему это может быть интересно Может дать практические идеи для backend, инфраструктуры, инструментов и инженерных решений.
← Назад к ленте Открыть оригинал
#technology#software#platforms#разработка

Подробности

Ошибки израильского стартапа Irregular отправил агентов Anthropic, OpenAI, Meta и Google на поиски реальных целей.

В июле OpenAI сообщила, что ее ИИ-агенты атаковали Hugging Face без разрешения, что вызвало широко распространенные опасения по поводу безопасности ИИ. С тех пор череда подобных инцидентов с участием агентов Meta, Anthropic, Google и других компаний усилила опасения по поводу мошеннического ИИ. Поскольку за последние несколько месяцев стало известно о многочисленных моделях искусственного интеллекта, это казалось отдельными инцидентами. Но у многих общий источник: одна конкретная компания, которой поручено тестирование агентов.

Irregular, израильский стартап, который проводит стресс-тестирование моделей ИИ на «высокоточных исследовательских платформах, моделирующих и отслеживающих реальные сценарии безопасности ИИ», работал со многими крупнейшими игроками отрасли с момента своего основания под названием Pattern Labs в 2023 году. Точный список его клиентов неизвестен, но его работа упоминалась в карточках модельных систем OpenAI, он использовался для тестирования систем для правительства Великобритании и Anthropic, а также публиковал исследования в RAND, очень влиятельном аналитическом центре, который информирует политику в отношении ИИ.

В ходе нескольких нерегулярных тестов в этом году агенты вырвались из якобы безопасной среды тестирования и преследовали реальные цели.

Все нарушения, независимые от взлома Hugging Face, следуют одному и тому же шаблону: Irregular тестировала возможности кибербезопасности моделей в контролируемых средах, предназначенных для имитации реалистичных условий. В некоторых тестах использовались упражнения по «захвату флага» — распространенный способ проверки хакерских способностей, при котором агентам предлагается найти скрытую информацию внутри моделируемой сети. По крайней мере, сеть предназначена для моделирования.