Спросите ChatGPT о мемуарах комика Сары Сильверман “The Bedwetter”, и чат-бот с искусственным интеллектом сможет предоставить подробный обзор каждой части книги.
Означает ли это, что он эффективно “прочитал” и запомнил пиратскую копию? Или он собрал так много отзывов покупателей и онлайн-болтовни о бестселлере или мюзикле, на который он вдохновил, что сойдет за эксперта?
Суды США теперь могут помочь разобраться с этим после того, как на этой неделе Сильверман подал в суд на создателя ChatGPT OpenAI за нарушение авторских прав, присоединившись к растущему числу авторов, которые говорят, что они невольно заложили основу для бурного бума искусственного интеллекта в Силиконовой долине.
В иске Сильверман говорится, что она никогда не давала разрешения OpenAI использовать цифровую версию ее книги 2010 года для обучения моделей искусственного интеллекта, и, скорее всего, она была украдена из “теневой библиотеки” пиратских произведений. В нем говорится, что мемуары были скопированы “без согласия, без подтверждения и без компенсации".
Это один из растущего числа случаев, которые могут раскрыть тайну OpenAI и его конкурентов о ценных данных, используемых для обучения все более широко используемых продуктов “генеративного искусственного интеллекта”, создающих новый текст, изображения и музыку. И это поднимает вопросы об этической и правовой основе инструментов, которые, по проектам McKinsey Global Institute, добавят мировой экономике эквивалент от 2,6 до 4,4 трлн долларов.
“Это открытый, грязный секрет всей индустрии машинного обучения”, - сказал Мэтью Баттерик, один из юристов, представляющих интересы Сильвермана и других авторов в деле о коллективном иске. “Им нравятся данные о книгах, и они получают их с этих незаконных сайтов. Мы как бы даем свисток на всю эту тренировку”.
OpenAI не ответил на запросы о комментариях по поводу этих утверждений. В другом иске от Silverman содержатся аналогичные претензии к модели искусственного интеллекта, созданной материнской компанией Facebook и Instagram Meta, которая отказалась от комментариев.
Авторам, возможно, будет непросто выиграть дело, особенно после успеха Google в преодолении судебных исков к своей онлайн-библиотеке книг. Верховный суд США в 2016 году оставил в силе решения судов низшей инстанции, которые отклонили иск авторов о том, что оцифровка Google миллионов книг и демонстрация небольших их частей общественности равносильны “нарушению авторских прав в грандиозных масштабах”.
“Я думаю, то, что OpenAI сделал с книгами, очень близко к тому, что Google разрешили сделать с его проектом Google Books, и поэтому будет законным", - сказал Девен Десаи, доцент кафедры права и этики Технологического института Джорджии.
В то время как лишь немногие подали в суд, включая Сильвермана и авторов бестселлеров Мону Авад и Пола Трамбле, опасения по поводу практики создания искусственного интеллекта в технологической индустрии набрали обороты в литературных сообществах и сообществах художников.
Другие известные авторы — среди них Нора Робертс, Маргарет Этвуд, Луиза Эрдрич и Джоди Пикоулт — в конце прошлого месяца подписали письмо руководителям OpenAI, Google, Microsoft, Meta и других разработчиков искусственного интеллекта, обвинив их в использовании практики создания чат-ботов, которые “имитируют и изрыгают” их язык, стиль и идеи.
“Миллионы защищенных авторским правом книг, статей, эссе и поэзии обеспечивают ”пищу" для систем искусственного интеллекта, бесконечные блюда, за которые не было выставлено счета", - говорится в открытом письме, организованном Гильдией авторов и подписанном более чем 4000 писателями. “Вы тратите миллиарды долларов на разработку технологии искусственного интеллекта. Будет только справедливо, если вы компенсируете нам использование наших работ, без которых искусственный интеллект был бы банальным и крайне ограниченным”.
Системы искусственного интеллекта, лежащие в основе таких популярных продуктов, как ChatGPT, Google Bard и чат-бот Microsoft Bing, известны как большие языковые модели, которые "учатся", анализируя и выбирая шаблоны из большого объема проглоченного текста. Они внушили благоговейный трепет публике своим сильным владением человеческим языком, хотя также известны склонностью извергать ложь.
Хотя модели также проходили обучение по новостным статьям и лентам социальных сетей, книги особенно ценны, как признал OpenAI в статье 2018 года, цитируемой в иске Сильвермана.
Самая ранняя версия большой языковой модели OpenAI, известная как GPT-1, опиралась на набор данных, собранный исследователями университета под названием Toronto Book Corpus, который включал тысячи неопубликованных книг, некоторые в жанрах приключений, фэнтези и романтики.
“Важно отметить, что он содержит длинные фрагменты непрерывного текста, что позволяет генеративной модели научиться работать с информацией дальнего действия”, - заявили тогда исследователи OpenAI. Другие технологические компании, такие как Google и Amazon, также полагались на те же данные, которые больше недоступны в их первоначальном виде.
Но с тех пор OpenAI и другие ведущие разработчики искусственного интеллекта стали более скрытными в отношении своих источников данных, несмотря на то, что они получили еще большие объемы письменных работ. Баттерик сказал, что косвенные улики указывают на использование так называемых теневых библиотек пиратского контента, в которых хранились работы Сильвермана и других истцов.
“Это важно для их моделей, потому что книги - лучший источник объемного, хорошо отредактированного, связного письма”, - сказал он. “В принципе, у вас не может быть высококачественной языковой модели, если в ваших обучающих данных нет книг”.
Могут пройти недели или месяцы, прежде чем OpenAI получит официальный ответ. Но как только дело будет рассмотрено, техническим руководителям, возможно, придется дать показания под присягой о том, из каких источников они копировали книги.
“Насколько нам известно, другая сторона этого не отрицала", - сказал Джозеф Савери, другой адвокат Сильвермана. "У них нет альтернативного объяснения этому”.
Савери сказал, что авторы не обязательно просят технологические компании отказаться от своих алгоритмов и обучающих данных и начать все сначала — хотя есть прецедент уничтожения незаконно полученных данных искусственного интеллекта. Но, по его словам, необходим какой-то способ компенсации писателям.
