TechCrunch · AI · 20 мин назад

Anthropic подробно описывает кампании по дистилляции от Alibaba, Moonshot AI и DeepSeek

В новом отчете, опубликованном в четверг Anthropic, говорится о постоянных атаках со стороны китайских компаний, занимающихся искусственным интеллектом, которые усилились в последние месяцы по мере усиления конкуренции в этой сфере.

Источник TechCrunch
Опубликовано 20 мин назад
Оригинальный заголовок Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek
Важность 4/5
Почему это может быть интересно Важно для понимания, куда реально двигаются модели, агенты и продуктовые AI-инструменты.
← Назад к ленте Открыть оригинал
#ai#startups#tech

Подробности

В новом отчете, опубликованном в четверг Anthropic, говорится о постоянных атаках со стороны китайских компаний, занимающихся искусственным интеллектом, которые усилились в последние месяцы по мере усиления конкуренции в этой сфере.

«За последние несколько месяцев несанкционированные лаборатории разработали все более изощренные методы обхода нашей защиты и использования возможностей пограничных моделей США», — говорится в докладе. «Кампании, которые мы определили, были нацелены на некоторые из наиболее ценных способностей Клода, включая агентские возможности и использование инструментов, кодирование и анализ данных, а также логическое рассуждение».

Ранее Anthropic заявляла о перегонных атаках в феврале, даже называя конкретные лаборатории. OpenAI сообщила об аналогичной активности, которую она приписала конкретно DeepSeek. Но кампании, подробно описанные в новом отчете Anthropic, масштабнее и агрессивнее. В общей сложности компания наблюдала около 200 миллионов обменов сообщениями, связанных с атаками с целью дистилляции, относящимися к пяти отдельным кампаниям.

В широком смысле атаки методом дистилляции направлены на извлечение цепочки мыслей из ответа модели на различные запросы. Эту цепочку мыслей затем можно использовать для обучения меньшей модели общим способностям к рассуждению посредством контролируемой точной настройки.

Anthropic обычно не делает доступной пользователям внутреннюю цепочку мыслей своих моделей, вместо этого отображая блоки «обобщенного мышления», которые дают общий обзор. Но кампании по дистилляции смогли найти конкретные методы, которые могли обмануть модель и заставить ее напрямую раскрыть следы ее мышления.