The Verge · Разработка · 2 ч назад
Microsoft заявляет, что практически никто не перехватывал статьи NYT через ее чат-бота
Microsoft Copilot редко воспроизводит даже полные предложения из новостных статей и книг, не говоря уже о существенных фрагментах, которые могли бы заменить оригинал, говорится в новых юридических документах компании, поскольку она борется с исками об авторских правах со стороны издателей, включая The New York Times, и авторов книг. В рамках раскрытия иска Microsoft предоставила 8,2 миллиона журналов чата Copilot экс…
Подробности
Microsoft Copilot редко воспроизводит даже полные предложения из новостных статей и книг, не говоря уже о существенных фрагментах, которые могли бы заменить оригинал, говорится в новых юридических документах компании, поскольку она борется с исками об авторских правах со стороны издателей, включая The New York Times, и авторов книг.
В рамках раскрытия иска Microsoft предоставила 8,2 миллиона журналов чата Copilot эксперту, нанятому издателями новостей. Журналы, утверждает он, были выбраны специально, «потому что они содержат ключевые слова, подразумевающие использование веб-сайтов истцов News, и, следовательно, с наибольшей вероятностью содержат работы истцов News». В нем говорится, что полученный анализ показывает, что 59 545 из них содержали как минимум 16 слов, общих с новостным контентом, используемым для обоснования модели ИИ. Эксперт Центра журналистских расследований обнаружил в наборе данных 51 случай «существенного совпадения» с работой CIR, сообщает Microsoft. Аналогичным образом, эксперт по иску авторов обнаружил, что в 8,2 миллиона разговоров с Copilot было только 24 ответа, содержащих не менее 30 совпадающих слов. Microsoft утверждает, что только 10 из 212 оцененных книг имели совпадения.
The Times не согласилась с выводами Microsoft. «Документы и показания, обнаруженные в ходе расследования, приводят только к одному выводу: Microsoft и OpenAI украли у The New York Times, чтобы создавать коммерческие продукты, которые заменяют ее журналистику, угрожают ее бизнесу и подрывают ее отрасль», — заявил в своем заявлении ведущий юрисконсульт Times Ян Кросби. «Мы с нетерпением ждем, когда Microsoft и OpenAI будут привлечены к ответственности за кражу». CIR и Гильдия авторов не сразу ответили на запросы о комментариях.
Microsoft утверждает, что эти цифры подтверждают ее позицию о том, что использование контента, защищенного авторским правом, для наборов данных для обучения ИИ следует считать добросовестным использованием. По его словам, хотя такие системы, как Copilot, полагаются на использование материалов, защищенных авторским правом, полученные системы используются для совершенно иных целей, чем оригинал. Тот факт, что они иногда воспроизводят фрагменты текста, заключает автор, «вряд ли подрывает преобразующую цель обучения LLM».
Иски были поданы в рамках судебного разбирательства, возбужденного издателями и авторами против Microsoft и OpenAI, которые, как утверждают истцы, создавали продукты на основе их произведений и теперь конкурируют с ними напрямую, отчасти за счет распространения контента, защищенного авторским правом. Иски издателей новостей и авторов книг были объединены под одним судьей, чтобы упростить процесс, несмотря на возражения со стороны издателей и авторов. Microsoft подала иск в пятницу, настаивая на том, чтобы судья вынес упрощенное решение, которое положило бы конец делу на ранней стадии. (Администрация Трампа на этой неделе также подала заявление о заинтересованности в деле New York Times, поддерживая OpenAI.) Если судья встанет на сторону издателей и авторов, судебная тяжба продолжится в суде.