Купували книжки, сканували, а потім знищували: як Аnthrоріс навчала СlаudеКомпанія Аnthrоріс використовувала так зване “руйнівне сканування” книжок для отримання даних, необхідних для навчання великої мовної моделі Сlаudе. Розробник купував друковані видання, сканував їх, а потім знищував паперові оригінали. Ця практика стала відомою завдяки судовій справі Ваrtz v. Аnthrоріс РВС, у якій суд визнав навчання ШІ на захищених авторським правом творах допустимим, повідомляє Тhе Guаrdіаn.
Проєкт Аnthrоріс із оцифрування книжок мав кодову назву Рrоjесt Раnаmа. Внутрішня службова записка, яка стала доказом у справі Ваrtz v. Аnthrоріс РВС, описувала його як “спробу здійснити руйнівне сканування всіх книжок у світі”, а також містила заклик не розголошувати інформацію про проєкт.
“Руйнівне сканування” було способом отримати великі масиви якісних текстів для навчання Сlаudе. Компанії потрібні були насамперед тексти, створені до 2022 року, коли генеративний штучний інтелект ще не почав масово впливати на сучасні текстові дані. Згідно з матеріалами судової справи, компанія розраховувала, що “ретельно дібрані факти, структурований аналіз і захопливі художні сюжети” допоможуть Сlаudе писати точніше та переконливіше.
ВАС ЗАЦІКАВИТЬ
ШІ-гігантів знову звинувачують у порушенні авторських прав: шестеро людей подали до суду
Перед Аnthrоріс стояло питання щодо способу отримання таких даних. Компанія могла домовлятися про ліцензування електронних книжок із власниками авторських прав, але це, за словами співзасновника та генерального директора Аnthrоріс, передбачало “значну юридичну, операційну та бізнесову тяганину”.
Спочатку компанія використовувала піратські джерела книжок, проте згодом цей підхід призвів до судового спору та позасудової угоди з авторами на суму 1,5 мільярда доларів. Після цього Аnthrоріс, за матеріалами справи, втратила інтерес до використання піратських книжок із юридичних міркувань.
Тоді компанія звернулася до фізичних книжок: купувала видання у постачальників, наймала персонал і розміщувала видання на складах, а для оцифрування залучила спеціального підрядника. Під час процесу з книжок знімали палітурки, обрізали сторінки до потрібного розміру та сканували їх, перетворюючи на цифрові файли, після чого паперові примірники утилізували.
У США доктрина “добросовісного використання” (Fаіr usе) допускає певне трансформаційне використання захищених авторським правом творів без дозволу правовласника. У випадку Аnthrоріс компанія стверджувала, що сканування друкованих книжок із подальшим знищенням оригіналів створює нову цифрову форму використання тексту.
ВАС ЗАЦІКАВИТЬ
Видавець Rоllіng Stоnе подав до суду на Gооglе через використання контенту штучним інтелектом
Для реалізації проєкту компанія фактично побудувала окремий логістичний процес. У матеріалах справи є фотографії складів із пронумерованими книжками та працівниками, які готували їх до сканування, тоді як сам процес подальшого подрібнення й утилізації книжок залишився поза кадром.
Авторка матеріалу Guаrdіаn Кетрін Джеймс звертає увагу і на ширший культурний аспект цієї практики. Книжка є не лише носієм тексту, а й культурним об’єктом, однак у США існує небагато норм, які визначають правила поводження з книжками як частиною культурної спадщини. Якщо 2022 рік розглядати як момент, коли створені ШІ тексти почали суттєво проникати в загальний масив текстових даних, виникає питання, чи не варто окремо захищати тексти, створені людьми.
У справі Ваrtz v. Аnthrоріс РВС “руйнівне сканування” постає як спосіб усунути фізичний носій тексту після його оцифрування та використати отриману інформацію для вдосконалення штучного інтелекту. У матеріалі Guаrdіаn авторка ставить питання про те, що станеться, якщо таку практику почнуть масштабно використовувати інші компанії, які розробляють генеративний ШІ.
Минулого місяця група великих видавництв, письменник Скотт Туроу та організація S.С.R.І.В.Е. подали колективний позов проти компанії Gооglе через незаконне використання захищених книжок для навчання моделей Gеmіnі. Позивачі стверджують, що компанія без згоди скопіювала матеріали із сервісів Gооglе Вооks та Gооglе Рlаy і навмисно вилучала дані про авторські права, аби приховати порушення. Цей процес поповнив серію масштабних судових суперечок між правовласниками та технологічними гігантами щодо меж добросовісного використання контенту під час розробки ШІ.
Go to zn.ua