Перейти к содержанию

Рассекреченные документы иска Authors Guild к OpenAI раскрыли опасения по поводу LibGen

7.0/10

Рассекреченные судебные материалы по иску Гильдии авторов (Authors Guild) против OpenAI и Microsoft показали, что руководство и исследователи стартапа осознавали юридические и репутационные риски использования пиратских баз данных для обучения ИИ-моделей. В материалах дела приводится переписка за июль 2020 года, в которой сотрудник OpenAI Райан Лоу (Ryan Lowe) оценивал вероятность публичных вопросов об источнике данных книг более чем в 80%, отмечая невозможность раскрыть использование LibGen. Внутренние сообщения также демонстрируют опасения сотрудников относительно огласки на платформе Hacker News и публичного резонанса из-за обучения алгоритмов на материалах, защищенных авторским правом.

Контекст

Гильдия авторов США (Authors Guild) ведёт судебное разбирательство против OpenAI и Microsoft, обвиняя компании в несанкционированном использовании миллионов книг для обучения языковых моделей. В центре подобных исков находится практика сбора массивных обучающих датасетов из теневых онлайн-библиотек вроде Library Genesis (LibGen), которые бесплатно распространяют защищённую авторским правом литературу [tool-1-1, tool-1-3].

Последствия для правовой защиты

Раскрытие внутренней переписки ставит под удар ключевую линию защиты OpenAI о добросовестном использовании (fair use), предоставляя авторам и правообладателям веские аргументы в пользу умышленного нарушения авторских прав при обучении моделей.

Обсуждение в сообществе

Пользователи отметили, что руководство OpenAI явно понимало неэтичность и спорность использования пиратских материалов и поэтому опасалось реакции влиятельного технического сообщества. В то же время часть комментаторов раскритиковала риторику истцов и выступила в защиту LibGen как важного публичного хранилища научной литературы и книг.

Источники