TechCrunch · AI · 32 мин назад
Клод Опус 5 стал совершенно безжалостным, когда ему было поручено управлять торговым автоматом.
Последняя симуляция торгового автомата Andon Labs показывает, что Opus 5 лгал и вступил в сговор, чтобы стать лучшим капиталистом в области искусственного интеллекта.
Подробности
Вот уже год компания Andon Labs, занимающаяся тестированием безопасности искусственного интеллекта, поручает передовым моделям различные реальные задачи, чтобы определить, насколько хорошо они справляются с ролью агентов, работающих в течение длительного времени без присмотра человека.
В среду компания Andon опубликовала новую статью о том, как обстоят дела в исследовании Vending-Bench, в котором лаборатория использует передовые модели, управляющие бизнесом по продаже торговых автоматов в течение смоделированного года. Миссия проста: заработать больше денег, чем другие модели. Он сравнивает результаты в таких областях, как окончательный баланс денежных средств, цены, уплаченные поставщикам, и выплаченные возмещения.
В ходе этих тестов компания наблюдала, как различные модели ИИ — в основном от Anthropic и OpenAI — лгут, жульничают и вступают в сговор на пути к вершине.
В последнем тесте модели стали особенно сомнительными после того, как их симуляция сообщила им, что их торговый автомат будет установлен рядом с автоматами других моделей на оживленной туристической улице в Сан-Франциско. В этом раунде Claude Opus 5, GPT-5.6 Sol и Kimi K3 встретились друг с другом.
Каждому был предоставлен доступ по электронной почте к другим моделям, все под псевдонимами. Они знали, что остальные были моделями, но не знали, за какой моделью стоит какое человеческое имя.