The Verge · Разработка · 2 ч назад

Anthropic утверждает, что Клод случайно взломал и реальные компании

Anthropic только что осознала, что несколько моделей искусственного интеллекта Claude были взломаны в системах трех разных организаций во время тестирования, действуя самостоятельно и незаметно для компании. Это открытие произошло через несколько дней после того, как конкурирующая компания OpenAI заявила, что одна из ее собственных моделей взломала платформу разработчиков Hugging Face, что усилило растущее беспокойст…

Источник The Verge
Опубликовано 2 ч назад
Оригинальный заголовок Anthropic says Claude accidentally hacked real companies too
Важность 3/5
Почему это может быть интересно Может дать практические идеи для backend, инфраструктуры, инструментов и инженерных решений.
← Назад к ленте Открыть оригинал
#technology#software#platforms#разработка

Подробности

Anthropic только что осознала, что несколько моделей искусственного интеллекта Claude были взломаны в системах трех разных организаций во время тестирования, действуя самостоятельно и незаметно для компании. Это открытие произошло через несколько дней после того, как конкурирующая компания OpenAI заявила, что одна из ее собственных моделей взломала платформу разработчиков Hugging Face, что усилило растущее беспокойство по поводу того, делают ли передовые лаборатории искусственного интеллекта достаточно, чтобы контролировать все более мощные системы, которые они создают.

В сообщении в блоге, описывающем инциденты, Anthropic сообщил, что Клод получил несанкционированный доступ к системам во время оценок кибербезопасности. Все атаки произошли во время учений по «захвату флага» — распространенного способа проверки хакерских способностей, когда моделям предлагается найти и получить скрытую информацию внутри моделируемой сети.

Это раскрытие усиливает давление на передовые лаборатории искусственного интеллекта после инцидента с Hugging Face и выпуска мощных китайских моделей с открытым весом. Сотрудники крупнейших лабораторий теперь призывают к скоординированному глобальному управлению, а американские законодатели начали ужесточать надзор за мощными моделями и за тем, кто может получить к ним доступ.

Anthropic утверждает, что среда для испытаний кибербезопасности должна была быть изолированной. Однако из-за «неправильной конфигурации» машины, к которым имел доступ Клод, «с живым доступом в Интернет», заявили в компании, а поскольку всем моделям «явно сказали», что у них нет доступа к Интернету, они «предположили», что реальные сети, с которыми он столкнулся, были частью моделируемой среды.

Согласно сообщению в блоге, самые ранние инциденты датируются апрелем и касаются трех разных моделей Claude: Opus 4.7, Mythos 5 и «модель внутреннего исследовательского тестирования». Поскольку модели тестировались на их кибер-способности, Anthropic заявила, что им не хватает стандартных мер безопасности, которые обычно применяются для ограничения более рискованного поведения.