Коммерсантъ FM

Один за всех, а все за ИИ

Насколько оправданы претензии правообладателей к разработчикам нейросетей

Пока российские правообладатели добиваются законодательного закрепления компенсаций за обучение ИИ на их контенте, зарубежные оспаривают происхождение датасетов в суде и пытаются добиться выплат от разработчиков моделей. Один из показательных примеров — мировое соглашение на $1,5 млрд, которое Anthropic заключила с авторами. «Ъ» разобрался, как именно правообладатели отстаивали права на свои произведения.

Фото: Александр Миридонов / Коммерсантъ

Фото: Александр Миридонов / Коммерсантъ

С начала лета российские правообладатели пытаются внести правки в ФЗ «О поддержке развития искусственного интеллекта в РФ» (подписан президентом РФ Владимиром Путиным 26 июля). Как неоднократно отмечали профильные ассоциации, принятая версия документа будет дестимулировать творчество отечественных авторов и превратит Россию в бесплатный хаб для обучения ИИ-моделей. Сейчас правообладатели в рабочих группах разрабатывают ряд подзаконных актов к ФЗ, которые будут учитывать их требования. Среди них — единоразовые выплаты компенсаций правообладателям за уже произведенное обучение ИИ на контенте, писали «Ведомости» 17 августа. Также предлагается публиковать запрет на использование контента в целях обучения ИИ на едином портале организации по коллективному управлению правами (ОКУП) (см. «Ъ» от 31 августа). В мировой практике, как и в российской, пока так и не урегулированы споры об обучении ИИ на авторском контенте.

Контент зачитали в суде

Один из самых громких случаев — коллективный иск авторов к американской Anthropic, поданный два года назад. Создатели контента утверждали, что компания без разрешения копировала защищенные книги, включая их произведения, формировала внутренние цифровые библиотеки и использовала эти материалы для обучения языковых моделей. Из материалов суда следует, что в 2021 году Anthropic получила набор Books3, включавший около 196 тыс. книг, а затем скачала не менее 5 млн книг из теневой библиотеки LibGen. В 2022 году компания добавила еще порядка 2 млн книг из Pirate Library Mirror (PiLiMi). В совокупности речь шла о многомиллионном массиве пиратских копий. Параллельно в 2024 году Anthropic начала закупать печатные книги, разбирать их, сканировать — создавать собственную внутреннюю цифровую библиотеку.

После подачи иска стороны перешли к спору о ключевом вопросе: является ли использование книг для обучения LLM добросовестным (fair use). Американский разработчик добился раннего рассмотрения этого вопроса без ожидания полноценного разбирательства по ущербу. Авторы, в свою очередь, требовали признания коллективного класса правообладателей, чьи книги оказались в пиратских массивах.

В результате в июне прошлого года суд вынес промежуточное решение по делу. Он разделил действия Anthropic на три части. Во-первых, признал обучение LLM на книгах трансформирующим использованием: модель извлекала статистические закономерности языка, а не создавала библиотеку для чтения книг пользователями. Во-вторых, признал допустимой оцифровку законно купленных бумажных экземпляров для внутреннего поиска и хранения: компания приобретала физическую книгу, уничтожала ее при сканировании и не распространяла полученную цифровую копию.

Однако в третьей части суд отказался считать fair use массовое скачивание и постоянное хранение пиратских копий из Books3, LibGen и PiLiMi. Основная причина — разработчик не может бесплатно скачать «все книги мира» из нелегальных источников и оправдать это тем, что часть текстов затем использовалась для обучения модели. Незаконное получение и создание постоянной внутренней пиратской библиотеки были отдельным нарушением.

Однако в конце августа прошлого года стороны сообщили о достижении мирного соглашения. В сентябре было объявлено об урегулировании на $1,5 млрд — рекордную сумму для авторско-правового спора такого масштаба. Затем началась техническая стадия: публикация списка книг, уведомление авторов и издателей, прием заявлений, а также проверка того, кому именно принадлежат права на каждое конкретное наименование. По сообщениям СМИ, суд окончательно утвердил соглашение в июле. Средний размер выплаты составил не менее $3 тыс. за произведение до вычета налогов, но реальное распределение зависит от числа заявителей и договоров между авторами и издателями.

Ранее Google договорилась с крупнейшими университетскими библиотеками аккуратно и безопасно оцифровать их громадные коллекции, чтобы «насытить» свою базу поиска, отмечает независимый книжный эксперт Владимир Харитонов. «Правообладатели — издатели с авторами — встали на дыбы с обычными криками «нас грабят». И даже предложения Google устроить какую-нибудь коммерцию правообладателей не успокоили». В результате Google фактически прекратила программу оцифровки.

Музыку включили в датасетах

Споры правообладателей и разработчиков ИИ коснулись не только издательской индустрии, но и музыкальной. Крупнейший конфликт с участием мейджоров (Universal Music Group, Sony Music Entertainment и Warner Music Group) датируется летом 2024 года, когда вышеперечисленные лейблы подали иски к музыкальным ИИ-сервисам Suno и Udio. Истцы обвиняли сервисы в массовом несанкционированном копировании фонограмм для обучения моделей. Важная деталь: речь шла прежде всего о правах на звукозаписи, которыми владеют лейблы, а не только об авторских правах на композиции и текст. Лейблы требовали признать нарушения, запретить дальнейшее использование их каталога, возместить ущерб и компенсировать судебные расходы. В качестве возмещения ущерба музыкальные лейблы требовали компенсацию в $150 тыс. за каждое произведение. Как отмечал Reuters, компании Suno, возможно, придется заплатить за 660 песен, а Udio — более чем за 1,5 тыс. композиций.

Также лейблы утверждали, что Suno и Udio скрывали состав датасетов, называя использованную музыку «публично доступной» либо ссылаясь на конфиденциальность сведений. Представители Suno и Udio, как и Anthropic, пытались настаивать на принципе fair use, однако лейблы возражали, что использование сугубо коммерческое, произведения копируются целиком, а сгенерированные треки способны конкурировать с оригинальными записями и будущим рынком лицензирования музыки для ИИ.

Впрочем, в прошлом году Universal Music Group и Udio объявили о заключении соглашения. Так, стороны анонсировали создание коммерческого сервиса генерации музыки на основе авторизованного каталога. В этом же году аналогичное соглашение заключили Warner Music Group и Suno. Согласно договоренностям, модели искусственного интеллекта также будут обучаться на лицензированной и авторской музыке, принадлежащей лейблу. Однако, несмотря на сделку с Warner, которая призвана разрешить обучение ИИ и выпуск треков на стриминговых платформах, аналогичные переговоры с Universal и Sony, по данным СМИ, зашли в тупик.

Исполнительный директор Zvonko Group Дмитрий Коннов отмечал, что другие лейблы вскоре последуют примеру компании Warner: «Музыкальная индустрия уже какое-то время сопротивлялась техническому прогрессу. Она усвоила, что музыка находится на передовом рубеже всех изменений в потреблении, поэтому стоит договариваться, а не судиться. Смысл всех этих договоренностей состоит в том, что так как ИИ учится на примерах человеческой деятельности, то музыкальные компании, не только Warner, будут получать отчисления от тех, кто будет эти треки эксплуатировать».

Сами AI-сервисы переходят от конфронтации к договорным моделям: вместо споров о законности обучения ИИ согласовывается лицензирование песен и образов артистов, резюмирует представитель ассоциации «Юристы музыкальной индустрии»: «Рынок движется к формату, где генерация музыки, использование голосов и образов артистов будут регулироваться так же четко, как традиционные способы использования».

Юлия Датская

Новости компаний Все