TechCrunch · AI · 1 ч назад
Лаборатории Frontier AI до сих пор не говорят, как они будут сдерживать мошенническую модель
Новое исследование показывает, что ведущие лаборатории искусственного интеллекта имеют мало публично задокументированных планов по сдерживанию мошеннических моделей, что поднимает вопросы о готовности, поскольку системы искусственного интеллекта все чаще демонстрируют неожиданное и потенциально опасное поведение.
Подробности
Согласно недавнему исследованию, лишь немногие из ведущих лабораторий искусственного интеллекта опубликовали или продемонстрировали планы реагирования на сдерживание. В плане сдерживания прописано, что произойдет, если ИИ будет пойман при попытке подорвать человеческий контроль: какой доступ будет ограничен, а когда система будет полностью отключена.
К такому выводу пришла организация Guidelight AI Standards, занимающаяся продвижением безопасных передовых методов разработки ИИ, которая оценила пять ведущих лабораторий по степени их готовности именно к этому сценарию. OpenAI вышел на первое место; Anthropic и Meta получили самые низкие оценки. Результаты имеют значение, поскольку агентный ИИ берет на себя более автономную роль внутри собственных систем компаний, а регулирующие органы в Калифорнии и Нью-Йорке начинают требовать раскрытия информации. Для тех, кто использует эти модели или инвестирует в них, это редкая независимая информация о том, насколько серьезно каждая лаборатория относится к операционным рискам и как она о них говорит.
Оценка Guidelight была основана на общедоступных планах Anthropic, Google, OpenAI, Meta и xAI, оцененных по ряду показателей, включая то, насколько хорошо каждая компания регистрирует и отслеживает, что делают ее системы искусственного интеллекта внутри компании, останавливает ли она системы после всплеска отмеченного неправомерного поведения, проводят ли независимые третьи стороны аудит ее средств контроля и публикуют результаты, а также каков ее точный план по сдерживанию модели, которая выходит из-под контроля.
Обеспокоенность по поводу того, смогут ли компании, занимающиеся искусственным интеллектом, сдерживать свои все более функциональные и агентные модели, возросла после серии громких инцидентов в области кибербезопасности, в которых модели OpenAI, Anthropic и Meta получили непреднамеренный доступ к Интернету во время оценок безопасности и взломали внешние системы.
Результаты подчеркивают различия в том, как компании, занимающиеся искусственным интеллектом, публично подходят к обеспечению безопасности, расширяя развертывание агентов в средах, где системы искусственного интеллекта могут предпринимать серьезные масштабные действия. Хотя некоторые компании, занимающиеся искусственным интеллектом, подробно описывают, как они проверяют свои модели на наличие опасных возможностей перед развертыванием, они, как правило, менее открыто говорят о том, что происходит, когда модели, уже работающие внутри их систем, ведут себя неправильно.