Konkurent ChatGPT pozwany. W grę wchodzą miliardy dolarów

Claude usunął mu 700 GB danych. Fatalna pomyłka sztucznej inteligencji

Autor:

w

Anthropic boryka się z poważnymi problemami. Sony Music Publishing oraz Warner Chappell oskarżają firmę o wykorzystanie bez licencji dziesiątek tysięcy utworów muzycznych podczas rozwijania modeli dostępnych w Claude. Pozew dotyka przede wszystkim kwestii dotyczących danych treningowych oraz odpowiedzi chatbota, ale nie tylko.

Jak zapewne zauważyliście, systemy takie jak ChatGPT przestały cytować teksty piosenek, i nie jest to przypadek: choć to nie do końca temat pozwu. Wydawcy twierdzą, że Anthropic najpierw pozyskało materiały chronione prawem autorskim z pirackich bibliotek oraz stron internetowych, następnie wykorzystało je do trenowania swoich modeli, a później umożliwiło ich reprodukcję w ramach odpowiedzi: dowody na to zostały dołączone do pozwu. Dokument zawiera także zarzut, że firma zmieniała lub usuwała informacje umożliwiające identyfikację właścicieli praw autorskich.

Od siedmiu milionów książek do zbiorów muzycznych

Wszystko dotyczy zbioru danych, który był gromadzony jeszcze przed uruchomieniem Claude’a. Zgodnie z pozwem, osoba o nazwisku Benjamin Mann, działająca na rzecz Anthropic na polecenie Daria Amodeiego, pobrała w 2021 roku co najmniej pięć milionów książek z bazy LibGen, a w 2022 roku kolejne dwa miliony z Pirate Library Mirror. W takim zbiorze miały znajdować się publikacje zawierające teksty i nuty utworów należących do powodów. Wśród wymienianych tytułów znajdują się między innymi „Hallelujah” Leonarda Cohena, „Livin’ on a Prayer” zespołu Bon Jovi oraz „September” zespołu Earth, Wind & Fire: utwory, które stały się kultowe. Informacja o pobraniu siedmiu milionów książek pochodzi z wcześniejszego sporu Anthropic, który zakończył się w sądzie.

Jednak rajdy na torrenty miały być tylko jednym z wielu nielegalnych działań. Wydawcy zarzucają Anthropic automatyczne zbieranie tekstów z Musixmatch i LyricFind, skanowanie książek z rynku dzieł używanych, a także korzystanie z zbiorów takich jak Common Crawl, The Pile i Books3. Niektóre z tych serwisów działają w pełni legalnie, jednak to nie oznacza zgody na masowe kopiowanie ich treści do komercyjnego zbioru danych do nauki. Pełny zakres działań związanych z pozyskiwaniem danych zostanie ustalony dopiero podczas postępowania sądowego i ujawniania dokumentów.

Pozew dotyczy zarówno treningu, jak i odpowiedzi modeli

Druga kwestia dotyczy sposobu, w jaki Anthropic wykorzystało pozyskane materiały. Wydawcy argumentują, że np. teksty piosenek były kopiowane podczas przygotowywania danych treningowych, a modele zapamiętywały fragmenty na tyle dobrze, aby później generować ich dosłowne lub niemal dosłowne wersje. Przykłady takie jak „Ain’t No Mountain High Enough”, „Uptown Funk” oraz „California Gurls” były podawane jako dowody. Pozew twierdzi również, że generowane przez Claude’a nowe teksty mogą konkurować z utworami tworzonymi przez ludzi, co wiąże się z potrzebą wykazania szkody… a to z pewnością stanowi pole do popisu dla najlepszych amerykańskich prawników. W kontekście tego sprawy mogą dziać się rzeczy, które są oszałamiające.

Czytaj dalej poniżej

OpenClaw 2.0 już jest. Co nowego w najpopularniejszym agencie AI na świecie?

Inny zarzut dotyczy informacji związanych z prawami autorskimi. Podczas przetwarzania danych, Anthropic miało intencjonalnie usuwać elementy uznane za powtarzalne lub zbędne, wśród których, według pozwu, znajdowały się oznaczenia umożliwiające przypisanie dzieł do właścicieli praw. Prowadziło to do braku odpowiedniej atrybucji, zwłaszcza gdy Claude reprodukował fragmenty tych dzieł bez wskazania ich źródła.

Nic nie jest przesądzone

Pozew przewiduje maksymalne odszkodowanie w wysokości 150 tysięcy dolarów za każde umyślne naruszenie praw autorskich. Przy dziesiątkach tysięcy kompozycji należących do tych wydawców, potencjalna suma może sięgać miliardów dolarów. Wydawcy domagają się również do 25 tysięcy dolarów za każde bezprawne usunięcie lub zmianę informacji dotyczących autorstwa. Sąd nie musi jednak przyznać tej kwoty, a strona powodowa może zamiast tego wybrać odszkodowanie odpowiadające rzeczywistej stracie oraz zyskom Anthropica.

Czytaj również: Zniszczyli miliony książek, aby „nakarmić” AI. Nastały smutne czasy

Wnioskują także o środki niepieniężne. Wydawcy żądają nakazu zaprzestania naruszeń, ujawnienia danych i metod treningowych (co mogłoby być szczególnie kłopotliwe dla Anthropic), a także zniszczenia nielegalnych kopii znajdujących się pod kontrolą firmy. Producent Claude’a odrzuca te zarzuty i zapowiada zdecydowaną obronę przed sądem. Warto zauważyć, że niedawno zawarta została ugoda na kwotę 1,5 miliarda dolarów z grupą autorów książek: czy tak samo będzie w tej sprawie?

Sąd będzie musiał ocenić oddzielnie sposób pozyskiwania materiałów, ich wykorzystanie podczas treningu oraz to, czy odpowiedzi Claude’a naruszały chronione prawa. To może oznaczać skomplikowany, wielowątkowy proces, który zwróci uwagę na kunszt wynajętych prawników. Zakładam jednak, że ostatecznie dojdzie do ugody i zmian, które będą wymuszone przez stronę powodową.