The Verge · Разработка · 2 ч назад

Исследователи опасаются катастрофы с безопасностью в преддверии выпуска OpenAI Astra

OpenAI находится на пороге выпуска своей самой мощной модели искусственного интеллекта, Astra, после нескольких недель задержек с укреплением протоколов безопасности после того, как ее агенты атаковали реальные цели во время тестирования. По мере того, как становятся известны подробности о модели, исследователи предупреждают, что это «может быть худшая разработка в области безопасности ИИ на сегодняшний день». Вскоре…

Источник The Verge
Опубликовано 2 ч назад
Оригинальный заголовок Researchers fear safety disaster ahead of OpenAI’s Astra release
Важность 4/5
Почему это может быть интересно Может дать практические идеи для backend, инфраструктуры, инструментов и инженерных решений.
← Назад к ленте Открыть оригинал
#technology#software#platforms#разработка

Подробности

OpenAI находится на пороге выпуска своей самой мощной модели искусственного интеллекта, Astra, после нескольких недель задержек с укреплением протоколов безопасности после того, как ее агенты атаковали реальные цели во время тестирования. По мере того, как становятся известны подробности о модели, исследователи предупреждают, что это «может быть худшая разработка в области безопасности ИИ на сегодняшний день».

Вскоре после того, как OpenAI заявила во вторник, что отложила выпуск Astra из-за работы над вопросами безопасности, The Information сообщила, что Astra демонстрирует гораздо меньше своего «мышления», чем другие передовые модели искусственного интеллекта, что вызывает опасения, что ее может быть опасно сложно отслеживать.

Большинство современных систем искусственного интеллекта построены с использованием технологии, известной как преобразователь, которая обрабатывает некоторые типы информации линейно через уровни, прежде чем выдать ответ. Можно создавать модели, демонстрирующие их рассуждения по ходу дела, по сути, «думая вслух». Эта «цепочка мыслей» позволяет исследователям и автоматизированным системам безопасности отслеживать действия моделей ИИ и потенциально выявлять нежелательное поведение, такое как ложь или планы обхода ограждений безопасности, прежде чем они начнут действовать.

Как сообщает The Information со ссылкой на неназванного человека, знакомого с разработкой неизданной модели, Astra использует более непрозрачную технику, известную как рекуррентный преобразователь глубины или циклический преобразователь, который циклически пропускает информацию через внутренние слои перед выдачей выходного сигнала. Это означало бы, что гораздо больше «мышлений» модели происходит внутри системы и в форме, которая гораздо меньше похожа на естественный человеческий язык, а не выражается так, чтобы исследователи могли легко отслеживать их. Это может повысить производительность модели, но затрудняет обнаружение потенциальных угроз и нежелательного поведения.

По словам неназванного источника The Information, OpenAI ограничила использование метода циклического преобразователя/рекуррентной глубины с Astra, чтобы исследователи могли продолжать следить за рассуждениями модели.