Godność danych: koniec darmowego obiadu w trenowaniu AI

Koniec ery darmowego skrobania sieci. Twórcy treści walczą o swoje prawa. Oto jak model rynkowy Dweve sprawiedliwie wynagradza twórców danych.

Godność danych: koniec darmowego obiadu w trenowaniu AI

The Greatest Heist in History

Let us call the first phase of generative AI what it truly was: the largest act of value extraction in human history.

Between 2018 and 2024, a handful of companies in Silicon Valley deployed armies of web crawlers across the entire internet. These crawlers consumed everything: every book ever digitized, every article ever published, every photograph ever uploaded, every forum post ever written, every line of code ever shared on GitHub, every song lyric, every doctoral thesis, every love letter posted on a personal blog.

They did this without asking permission. They did this without providing compensation. They did this without even acknowledging the source.

Then they took all of this extracted value, compressed it into mathematical weights, and built proprietary products that they sold for hundreds of billions of dollars. The people who created the value received nothing. The companies that extracted it became the most valuable enterprises on the planet.

This was not innovation. This was industrialized copyright arbitrage at unprecedented scale.

But the free lunch is ending. The creators are fighting back. And the legal, ethical, and economic foundations of the extraction model are crumbling.

Wielki transfer wartości: ekstrakcja a godnośćModel ekstrakcji (2018-2024)Cały internet przeszukanyBez pozwoleniaKsiążki, artykuły, kod, sztukaBez podania źródłaPraca twórcza i intelektualnaBez wynagrodzeniaSkutek:Ponad 2 biliony dolarówkapitalizacji rynkowej firm AI0 dolarów dla twórców treściModel godności danych (Dweve)Kuratorowane źródła wiedzyJawne licencjeŚledzone domeny eksperckiePełny łańcuch pochodzeniaPomiar użycia dla każdego zapytaniaPodział przychodówSkutek:Zrównoważony ekosystemTwórcy zmotywowani do współpracyWiedza wyższej jakości

Rosnące mury prawne

Podstawy prawne modelu ekstrakcji zawsze budziły wątpliwości. Firmy zajmujące się sztuczną inteligencją twierdziły, że trenowanie na materiałach chronionych prawem autorskim stanowi „dozwolony użytek", ponieważ model „przekształca" dane, zamiast kopiować je bezpośrednio. Utrzymywały, że jest to analogiczne do człowieka czytającego książki w bibliotece.

Ten argument upada w sądach na całym świecie.

Pozew The New York Times

Pozew The New York Times przeciwko OpenAI i Microsoftowi, złożony w grudniu 2023 roku, był pierwszym strzałem w tym, co zapowiada się na lata postępowań sądowych. Pozew wykazał, że ChatGPT potrafi odtwarzać artykuły z Timesa chronione prawem autorskim niemal słowo w słowo. Pokazał, że model potrafi omijać paywalle, streszczając artykuły tak dokładnie, że użytkownicy nie mieli powodu odwiedzać oryginalnego źródła.

To nie jest „przekształcenie". To substytucja rynkowa. Gdy sztuczna inteligencja może zastąpić funkcję subskrypcji gazety, obrona oparta na dozwolonym użytku upada.

Bunt artystów

Artyści wizualni należeli do pierwszych, którzy dostrzegli zagrożenie. Generatory obrazów trenowane na miliardach dzieł sztuki potrafią odtwarzać styl poszczególnych artystów z miażdżącą precyzją. Polecenie takie jak „w stylu [żyjącego artysty]" mogło wyprodukować nieograniczoną liczbę prac, które bezpośrednio konkurowały ze źródłem utrzymania oryginalnego twórcy.

Pozwy zbiorowe w imieniu artystów wizualnych przechodzą obecnie przez sądy. Ale artyści nie czekali na rozstrzygnięcie prawne. Opracowali techniczne środki zaradcze.

Narzędzia takie jak Glaze i Nightshade dodają do obrazów niedostrzegalne zakłócenia, które zatruwają trenowanie sztucznej inteligencji. Zeskrapowany obraz wygląda normalnie dla ludzi, ale powoduje degradację modelu lub nieprzewidywalne wyniki. To cyfrowa forma minowania treści i rozprzestrzenia się szybko.

Zamknięcie platform

Główne platformy zamknęły swoje drzwi przed trenowaniem sztucznej inteligencji. Reddit, jedno z największych źródeł danych konwersacyjnych do trenowania, pobiera obecnie zaporowe opłaty za dostęp do API. Twitter/X zablokował crawlerom sztucznej inteligencji dostęp w całości, zanim odwrócił kurs i zaczął monetyzować dostęp. Stack Overflow wprowadził surowe warunki przeciwko trenowaniu sztucznej inteligencji na ich pytaniach i odpowiedziach programistycznych.

„Otwarta sieć", na której polegały firmy zajmujące się sztuczną inteligencją, staje się mozaiką ogrodzonych ogrodów, z których każdy pobiera opłaty od każdej sztucznej inteligencji, która chce uzyskać dostęp.

Mury wznoszące się przeciwko ekstrakcji danychDziałania prawnePozew NYT przeciwko OpenAIPostępowanie sądowe Getty ImagesPozwy zbiorowe autorówObrona technicznaOchrona stylu GlazeZatruwanie danych NightshadeZnakowanie wodne treściBlokada platformPłatny dostęp do API RedditOgraniczenia Stack OverflowBlokady robotów wydawcówZerwana umowa społecznaWyszukiwarki wysyłały ruch. Sztuczna inteligencja przejmuje wartość. Ta wymiana jest zerwana.Dla firm AIRosnąca odpowiedzialność prawnaKurczące się źródła treningoweDla etycznej AI (Dweve)Czysty status prawnyDostęp do źródeł premium
Kontratak prawny zamienia dawny układ „najpierw indeksuj, potem pytaj" w granicę, która wymaga dowodu przed rozpoczęciem trenowania.

Godność danych: inna filozofia

W Dweve przyjmujemy koncepcję godności danych, termin spopularyzowany przez informatyka Jarona Laniera. Zasada jest prosta: jeśli Twoje dane przyczyniają się do wartości systemu AI, należy Ci się udział w tej wartości.

To nie jest działalność charytatywna. To nie jest nawet etyka dla samej etyki. To fundament zrównoważonej gospodarki opartej na AI.

Model wydobywczy nigdy nie był ekonomicznie uzasadniony. Opierał się na tymczasowej szarej strefie prawnej i praktycznej niemożności egzekwowania swoich praw przez miliony indywidualnych twórców. Gdy oba te warunki się zmieniają, firmy zbudowane na wydobywaniu danych stają w obliczu egzystencjalnego ryzyka.

Model oparty na godności tworzy natomiast spójne zachęty. Twórcy są zmotywowani do przekazywania swojej najlepszej pracy, ponieważ otrzymują za nią wynagrodzenie. Firmy AI uzyskują dostęp do danych wyższej jakości, ponieważ płacą za selekcję i weryfikację. Użytkownicy otrzymują lepsze wyniki, ponieważ dane treningowe są lepsze.

Architektura Dweve dla godności danych

Nasze podejście do godności danych to nie tylko stanowisko polityczne. Jest wbudowane w naszą architekturę techniczną.

Potok wiedzy Spindle

Dweve Spindle wdraża siedmioetapowy potok epistemologiczny, który śledzi każdy fragment wiedzy od źródła do wdrożenia:

  1. Kandydat: Surowa informacja jest identyfikowana i oznaczana metadanymi źródła
  2. Wydobyty: Ustrukturyzowana informacja jest wydobywana z zachowaniem pochodzenia
  3. Przeanalizowany: Treść jest rozkładana na fakty atomowe ze zweryfikowanym statusem licencji
  4. Połączony: Fakty są powiązane z grafem wiedzy za pomocą łańcuchów atrybucji
  5. Zweryfikowany: Walidacja wieloźródłowa potwierdza dokładność i status prawny
  6. Certyfikowany: Kontrola jakości potwierdza zgodność z wymogami godności danych
  7. Kanoniczny: Zweryfikowana wiedza staje się gotowa do użycia w AI z pełnym pochodzeniem

Ten potok oznacza, że możemy prześledzić każdy fragment wiedzy w naszym systemie aż do jego pierwotnego źródła. Możemy udowodnić status licencji. Możemy wskazać, którzy twórcy przyczynili się do powstania danego wyniku.

456 zestawów ograniczeń specjalistów domenowych

Architektura Dweve Loom obejmuje 456 wyspecjalizowanych zestawów ograniczeń, co umożliwia szczegółowe licencjonowanie i wynagradzanie. Każdy specjalista domenowy reprezentuje odrębną dziedzinę wiedzy z własnymi źródłami danych i ustaleniami licencyjnymi.

Gdy specjalista domeny prawnej (niemieckie prawo umów) przetwarza zapytanie, dokładnie wiemy, którzy wydawcy prawniczy i które kancelarie przyczynili się do powstania tej funkcji. Gdy specjalista domeny medycznej (onkologia) udziela informacji, możemy prześledzić ich pochodzenie aż do czasopism medycznych, baz danych klinicznych i instytucji badawczych, które dostarczyły wiedzę.

Ta szczegółowość umożliwia zaawansowany podział przychodów. Zamiast niejasnych twierdzeń o „trenowaniu na internecie" możemy precyzyjnie obliczyć, w jakim stopniu każde źródło danych przyczyniło się do powstania każdej funkcji.

Dweve Spindle: Potok godności danychSiedmioetapowy potok epistemologiczny1. KandydatSurowa informacjazidentyfikowana2. WyodrębnionaUstrukturyzowanaz pochodzeniem3. PrzeanalizowanaFakty atomowelicencja zweryfikowana4. PołączonaGraf wiedzypowiązany5. ZweryfikowanaWalidacjawieloźródłowa6. CertyfikowanaKontrola QA zakończonaufność 0.7+7. KanonicznaGotowa dla AI z pełnym pochodzeniemKażdy fakt prześledzony do źródła + status licencjiHierarchia 32 agentów waliduje na każdym etapieLoom: Licencjonowanie granularne456 specjalistów domenowych z oddzielnymi źródłami danychUdział w przychodach liczony per specjalista domenowyDostawcy danych wynagradzani proporcjonalnieMesh: Suwerenność sfederowanaDane pozostają u twórcówTrenowanie z zachowaniem prywatnościSMPC + szyfrowanie homomorficzne
Spindle sprawia, że godność danych staje się operacyjna, przenosząc razem źródło, prawa, status licencji oraz ograniczenia specjalistów dziedzinowych.

Rynek danych Fair Trade

Budujemy infrastrukturę dla nowej gospodarki danymi. Pomyśl o tym jak o certyfikacji „Fair Trade" dla danych treningowych AI.

Dla dostawców danych

Wydawcy, uczelnie, instytucje badawcze i eksperci dziedzinowi mogą rejestrować swoje treści na naszej platformie. To oni ustalają warunki licencji. To oni ustalają cenę. Zachowują kontrolę.

W przeciwieństwie do modelu wydobywczego, w którym ich treści były po prostu zabierane, stają się aktywnymi uczestnikami gospodarki AI. Mogą wybierać, które aplikacje AI mogą korzystać z ich danych, na jakich warunkach i za jaką cenę.

Wysokiej jakości dane osiągają wysokie ceny. Wydawca akademicki z rygorystycznie recenzowanymi badaniami może żądać więcej niż farma treści z klikbaitem zoptymalizowanym pod SEO. Rynek nagradza jakość.

Dla twórców AI

Firmy budujące aplikacje AI zyskują dostęp do prawnie czystych danych treningowych z udokumentowanym pochodzeniem. Mogą udowodnić regulatorom, ubezpieczycielom i sądom dokładnie, skąd pochodzą ich dane treningowe i że mieli prawo z nich korzystać.

To eliminuje rosnące ryzyko prawne modeli trenowanych na zeskrobanych danych. Zapewnia również dostęp do „ciemnej materii" wiedzy, ogromnych repozytoriów wysokiej jakości informacji, które nigdy nie były dostępne w otwartej sieci: archiwów korporacyjnych, badań za paywallem, zastrzeżonych baz danych.

Dla użytkowników końcowych

Użytkownicy uzyskują lepsze wyniki, ponieważ AI jest trenowane na wyższej jakości, starannie dobranych danych, a nie na szumie otwartego internetu. Otrzymują również przypisania, gdy nasz system dostarcza informacje z licencjonowanych źródeł, możemy cytować te źródła, umożliwiając weryfikację i głębszą eksplorację.

Rynek to miejsce, gdzie zgoda, przypisanie, płatność i kontrola ryzyka przedsiębiorstwa stają się jednym przepływem pracy.

Ekonomia jakości nad ilością

Krytycy twierdzą, że płacenie za dane czyni rozwój AI ekonomicznie nieopłacalnym. Utrzymują, że potrzebujesz „całego internetu", aby trenować zdolne modele.

To odzwierciedla przestarzałe myślenie z ery „big data" z lat 2020. Najnowsze badania wykazały jednoznacznie, że jakość danych ma znacznie większe znaczenie niż ich ilość.

Rozważ matematykę. Trenowanie GPT-3 wymagało około 45 terabajtów skompresowanego tekstu. Większość z tego to niskiej jakości skrobanie sieci: sekcje komentarzy, spam, nieaktualne informacje, błędy faktyczne i czysty nonsens.

Model trenowany na 500 gigabajtach starannie dobranych, wysokiej jakości treści podręcznikowych i akademickich może dorównać lub przewyższyć wydajność modeli trenowanych na 100 razy większej ilości danych. Stosunek sygnału do szumu w starannie dobranych danych jest po prostu znacznie wyższy.

Płacąc za dane, zyskujemy dostęp do treści, które nigdy nie były dostępne dla skrobaków: literatury medycznej za paywallami wydawców, badań finansowych w zastrzeżonych bazach danych, wiedzy przemysłowej w archiwach korporacyjnych. Ta „ciemna materia" jest czystsza, gęstsza i cenniejsza niż cokolwiek w otwartej sieci.

Ekonomia faktycznie przemawia za modelem godnościowym. Płacimy więcej za bajt, ale potrzebujemy znacznie mniej bajtów. Zyskujemy dostęp do źródeł premium, do których scrapery nigdy nie dotrą. I eliminujemy odpowiedzialność prawną, która obecnie zagraża firmom opartym na ekstrakcji danych karami sięgającymi miliardów.

Jakość ponad ilość: nowa ekonomia danychModel ekstrakcjiPonad 45 TB scrapowania sieciPonad 90% szumu niskiej jakościRosnąca odpowiedzialność prawnaModel godności danychOkoło 500 GB wyselekcjonowanych treściPonad 95% sygnału wysokiej jakościCzysty status prawnyPrzewaga ciemnej materiiLicencjonowane dane zapewniają dostęp do źródeł premium, do których scrapery nigdy nie dotrąCzasopisma medyczneBadania recenzowaneDane finansoweZastrzeżone bazy danychWiedza przemysłowaArchiwa korporacyjne

Imperatyw korporacyjny

Dla klientów korporacyjnych godność danych nie jest opcją. To wymóg zarządzania ryzykiem.

Duże organizacje ponoszą ogromne ryzyko odpowiedzialności prawnej w związku z systemami AI wytrenowanymi na danych wątpliwej jakości. Dział marketingu korzystający z generatora obrazów wytrenowanego na zeskrapowanych dziełach sztuki naraża się na roszczenia z tytułu naruszenia praw autorskich. Dział prawny korzystający z modelu językowego wytrenowanego na treściach za paywallem naraża się na odpowiedzialność z tytułu własności intelektualnej. Organizacja opieki zdrowotnej korzystająca z modelu, który nie może udowodnić pochodzenia swoich danych treningowych, naraża się na ryzyko regulacyjne.

Pozwy nadchodzą. Getty Images pozwało Stability AI. The New York Times pozwał OpenAI. Gildie autorów organizują pozwy zbiorowe. Potencjalne odszkodowania idą w miliardy.

Organizacje korzystające z systemów Dweve mogą wykazać dokładnie, skąd pochodzą nasze dane treningowe i że posiadaliśmy odpowiednie licencje na wszystkie z nich. To czyste pochodzenie jest warte znacznie więcej niż jakikolwiek marginalny zysk w możliwościach wynikający z danych zeskrapowanych.

Atrybucja i gospodarka oparta na wiedzy

Poza wynagrodzeniem godność danych wymaga atrybucji. Gdy nasze systemy dostarczają informacje pochodzące z licencjonowanych źródeł, cytujemy te źródła.

Tworzy to pozytywne koło. Użytkownicy mogą weryfikować informacje, sprawdzając oryginalne źródła. Mogą zgłębiać tematy, podążając za cytatami. Ruch wraca do twórców treści, przywracając zerwaną umowę społeczną sieci.

Dla naszych 456 zestawów ograniczeń specjalistycznych w Dweve Loom każda informacja ma łańcuch pochodzenia. Gdy specjalista ds. domeny medycznej udziela informacji o rzadkiej chorobie, możemy pokazać, które artykuły z czasopism medycznych wpłynęły na tę odpowiedź. Gdy specjalista ds. domeny prawnej wyjaśnia wymóg regulacyjny, możemy przytoczyć źródła ustawowe.

To nie tylko dobra etyka. To dobry projekt produktu. Użytkownicy bardziej ufają systemom, gdy mogą weryfikować twierdzenia. Przedsiębiorstwa wolą systemy, które potrafią wykazać swoje rozumowanie. Atrybucja buduje zaufanie.

Przyszłość, którą budujemy

Era ekstrakcji dobiega końca. To, co nadejdzie, jest właśnie przesądzane.

Jedna ścieżka prowadzi do zatrutego dobra wspólnego. Twórcy przyjmują coraz bardziej agresywne środki ochronne. Jakość danych treningowych spada. Rozwój AI utyka lub staje się domeną kilku firm z przewagą w postaci dziedziczonych danych.

Druga ścieżka prowadzi do zrównoważonej gospodarki opartej na wiedzy. Twórcy otrzymują wynagrodzenie za swój wkład. Wysokiej jakości dane są dostępne dla tych, którzy są gotowi uczciwie za nie zapłacić. Rozwój AI trwa przy szerokim udziale i rozłożonych korzyściach.

W Dweve budujemy infrastrukturę dla drugiej ścieżki. Nasza 96% redukcja zużycia energii pokazuje, że wydajne AI jest możliwe. Nasza 100% wyjaśnialność pokazuje, że przejrzyste AI jest osiągalne. Nasza architektura godności danych pokazuje, że etyczne AI jest praktyczne.

Wierzymy, że traktowanie twórców danych z godnością jest nie tylko moralnie słuszne. Jest ekonomicznie lepsze. Tworzy lepsze AI wytrenowane na lepszych danych, z czystszym statusem prawnym i zrównoważoną ekonomiką.

Darmowy obiad się skończył. Pytanie brzmi, co nadejdzie. Budujemy alternatywę.

Gotowi budować AI na fundamencie godności danych? Nasz rynek danych fair trade zapewnia pewność prawną, wyższą jakość danych treningowych i zrównoważoną ekonomikę. Skontaktuj się z nami, aby odkryć, jak godność danych może stać się Twoją przewagą konkurencyjną.

Trwała ścieżka to koło zamachowe: źródła wysokiej jakości są opłacane, pochodzenie jest zachowywane, ryzyko kupującego spada, a lepsze dane wciąż powstają.