Dostojanstvo podatkov: konec brezplačnega kosila pri usposabljanju umetne inteligence

Doba brezplačnega zajemanja spleta se izteka. Ustvarjalci vsebin se branijo. Takole Dwevin tržni model pravično nagrajuje ustvarjalce podatkov.

Dostojanstvo podatkov: konec brezplačnega kosila pri usposabljanju umetne inteligence

Največji rop v zgodovini

Prvo fazo generativne umetne inteligence imenujmo tako, kot v resnici je: največje dejanje izčrpavanja vrednosti v človeški zgodovini.

Med letoma 2018 in 2024 je peščica podjetij v Silicijevi dolini razporedila vojske spletnih pajkov po vsem internetu. Ti pajki so požrli vse: vsako digitalizirano knjigo, vsak objavljen članek, vsako naloženo fotografijo, vsako napisano objavo na forumu, vsako vrstico kode, kdaj koli deljene na GitHubu, vsako besedilo pesmi, vsako doktorsko disertacijo, vsako ljubezensko pismo, objavljeno na osebnem blogu.

To so storili brez vprašanja za dovoljenje. To so storili brez zagotovljenega nadomestila. To so storili, ne da bi sploh priznali vir.

Nato so vso to izčrpano vrednost stisnili v matematične uteži in zgradili lastniške izdelke, ki so jih prodajali za več sto milijard dolarjev. Ljudje, ki so ustvarili vrednost, niso dobili ničesar. Podjetja, ki so jo izčrpala, so postala najvrednejša podjetja na planetu.

To ni bila inovacija. To je bila industrializirana arbitraža avtorskih pravic v doslej nevidenem obsegu.

A brezplačnega kosila je konec. Ustvarjalci se upirajo. Pravni, etični in ekonomski temelji modela izčrpavanja pa se rušijo.

The Great Value Transfer: Extraction vs. DignityExtraction Model (2018-2024)Entire internet crawledWithout permissionBooks, articles, code, artWithout attributionCreative and intellectual laborWithout compensationThe Result:$2+ Trillionin AI company market cap$0 to content creatorsData Dignity Model (Dweve)Curated knowledge sourcesExplicit licensingExpert domains trackedFull provenance chainUsage metered per queryRevenue share distributedThe Result:Sustainable ecosystemCreators incentivized to contributeHigher quality knowledge

The Legal Walls Rising

Pravne podlage modela ekstrakcije so bile vedno vprašljive. Podjetja na področju umetne inteligence so trdila, da usposabljanje na avtorsko zaščitenem gradivu pomeni "pošteno uporabo", ker model podatke "preoblikuje" in jih ne kopira neposredno. Trdila so, da je to primerljivo s tem, ko človek bere knjige v knjižnici.

Ta argument na sodiščih po vsem svetu propada.

Tožba The New York Times

Tožba The New York Times proti podjetjema OpenAI in Microsoft, vložena decembra 2023, je bila prvi strel v tem, kar obeta biti več let trajajoč sodni spor. Tožba je pokazala, da lahko ChatGPT skoraj dobesedno reproducira avtorsko zaščitene članke časopisa The New York Times. Pokazala je, da lahko model zaobide plačljive dostope tako, da članke povzame tako izčrpno, da uporabniki nimajo razloga za obisk izvirnega vira.

To ni "preoblikovanje". To je nadomeščanje trga. Ko lahko umetna inteligenca nadomesti funkcijo naročnine na časopis, obramba s pošteno uporabo propade.

Upor umetnikov

Vizualni umetniki so bili med prvimi, ki so prepoznali grožnjo. Generatorji slik, usposobljeni na milijardah umetniških del, lahko z uničujočo natančnostjo posnemajo slog posameznih umetnikov. Poziv, kot je "v slogu [živečega umetnika]", lahko ustvari neomejeno število del, ki neposredno konkurirajo preživetju izvirnega ustvarjalca.

Skupinske tožbe v imenu vizualnih umetnikov zdaj potekajo po sodiščih. Toda umetniki niso čakali na pravno rešitev. Razvili so tehnične protiukrepe.

Orodja, kot sta Glaze in Nightshade, slikam dodajajo neopazne motnje, ki zastrupijo usposabljanje umetne inteligence. Strgana slika je za ljudi videti normalna, vendar povzroči poslabšanje modela ali nepredvidljive rezultate. To je digitalna oblika nastavljanja pasti vsebini in se hitro širi.

Zaklep platform

Velike platforme so zaprle svoja vrata za usposabljanje umetne inteligence. Reddit, ki je bil eden največjih virov podatkov za usposabljanje pogovorov, zdaj za dostop do API zaračunava previsoke pristojbine. Twitter/X je v celoti blokiral pajke umetne inteligence, preden je spremenil smer in začel monetizirati dostop. Stack Overflow je uvedel stroge pogoje proti usposabljanju umetne inteligence na svojem področju vprašanj in odgovorov o programiranju.

"Odprti splet", na katerega so se zanašala podjetja na področju umetne inteligence, postaja krpanka zaprtih vrtov, ki vsak posebej pobirajo dajatve od vsake umetne inteligence, ki želi dostop.

Zidovi, ki se dvigajo proti izčrpavanju podatkovPravni ukrepiTožba NYT proti OpenAISodni spor Getty ImagesSkupinske tožbe avtorjevTehnična obrambaZaščita sloga GlazeZastrupitev podatkov NightshadeVodni žigi vsebinZaklepanje platformPlačljivi API RedditOmejitve Stack OverflowBlokade pajkov založnikovZlomljena družbena pogodbaIskalniki so pošiljali promet. Sistemi z umetno inteligenco absorbirajo vrednost. Ta izmenjava je zlomljena.Za podjetja z umetno inteligencoNaraščajoča pravna odgovornostVse manj virov za usposabljanjeZa etično umetno inteligenco (Dweve)Čist pravni statusDostop do vrhunskih virov
Pravni protinapad spremeni staro pogodbo »najprej plazi, pozneje vprašaj« v mejo, ki pred usposabljanjem zahteva dokazila.

Podatkovno dostojanstvo: drugačna filozofija

Pri Dweve sprejemamo koncept podatkovnega dostojanstva, izraz, ki ga je populariziral računalničar Jaron Lanier. Načelo je preprosto: če vaši podatki prispevajo k vrednosti sistema umetne inteligence, si zaslužite delež te vrednosti.

To ni dobrodelnost. To niti ni etika zaradi etike same. To je temelj za trajnostno gospodarstvo umetne inteligence.

Model izkoriščanja nikoli ni bil ekonomsko vzdržen. Slonel je na začasnem pravnem sivem območju in praktični nezmožnosti milijonov posameznih ustvarjalcev, da uveljavijo svoje pravice. Ko se oba pogoja spreminjata, se podjetja, zgrajena na izkoriščanju, soočajo z eksistencialnim tveganjem.

Model, zgrajen na dostojanstvu, po drugi strani ustvarja usklajene spodbude. Ustvarjalci so motivirani, da prispevajo svoje najboljše delo, ker so zanj plačani. Podjetja umetne inteligence dobijo dostop do kakovostnejših podatkov, ker plačujejo za kuriranje in preverjanje. Uporabniki dobijo boljše rezultate, ker so učni podatki boljši.

Arhitektura Dweve za podatkovno dostojanstvo

Naš pristop k podatkovnemu dostojanstvu ni le stališče. Vgrajen je v našo tehnično arhitekturo.

Znanstveni cevovod Spindle

Dweve Spindle izvaja sedemstopenjski epistemološki cevovod, ki sledi vsakemu delčku znanja od izvora do uporabe:

  1. Kandidat: Surove informacije so prepoznane in označene z metapodatki o viru
  2. Izluščeno: Strukturirane informacije so izluščene z ohranjenim poreklom
  3. Analizirano: Vsebina je razčlenjena na atomska dejstva s preverjenim statusom licenciranja
  4. Povezano: Dejstva so povezana v graf znanja z verigami pripisovanja
  5. Preverjeno: Večvirska validacija potrjuje točnost in pravni status
  6. Certificirano: Zagotavljanje kakovosti potrjuje skladnost z zahtevami podatkovnega dostojanstva
  7. Kanonično: Preverjeno znanje postane pripravljeno za umetno inteligenco s polnim poreklom

Ta cevovod pomeni, da lahko vsak delček znanja v našem sistemu izsledimo nazaj do njegovega prvotnega vira. Lahko dokažemo status licenciranja. Lahko prepoznamo, kateri ustvarjalci so prispevali k kateremu koli rezultatu.

456 nizov omejitev za domenske specialiste

Arhitektura Dweve Loom s 456 specializiranimi nizi omejitev omogoča granularno licenciranje in nadomestila. Vsak domenski specialist predstavlja posebno področje znanja s svojimi viri podatkov in dogovori o licenciranju.

Ko specialist za pravno področje (nemško pogodbeno pravo) obdela poizvedbo, natančno vemo, kateri pravni založniki in odvetniške pisarne so prispevali k tej zmogljivosti. Ko specialist za medicinsko področje (onkologija) posreduje informacije, lahko izsledimo medicinske revije, klinične baze podatkov in raziskovalne ustanove, ki so zagotovile znanje.

Ta granularnost omogoča prefinjeno delitev prihodkov. Namesto nejasnih trditev o »usposabljanju na internetu« lahko natančno izračunamo, koliko je vsak vir podatkov prispeval k vsaki zmogljivosti.

Dweve Spindle: cevovod za dostojanstvo podatkovSedemstopenjski epistemski cevovod1. KandidatSurova informacijaprepoznana2. IzvlečenaStrukturiranaz izvorom3. AnaliziranaAtomska dejstvalicenca preverjena4. PovezanaZnanstvenigraf povezan5. PreverjenaVečvirskavalidacija6. PotrjenaKontrola kakovosti0,7+ zaupanje7. KanoničnaPripravljena za UI s popolnim izvoromVsako dejstvo izsledljivo do vira + status licence32-agentna hierarhija preverja na vsaki stopnjiLoom: granularno licenciranje456 strokovnjakov za domene z ločenimi viri podatkovDelitev prihodka izračunana na strokovnjaka za domenePrispevalci podatkov plačani sorazmernoMesh: zvezna suverenostPodatki ostanejo pri ustvarjalcihUsposabljanje, ki ohranja zasebnostSMPC + homomorfno šifriranje
Spindle omogoča operativno dostojanstvo podatkov tako, da skupaj nosi vir, pravice, status licence in omejitve strokovnjakov posameznih področij.

Tržnica podatkov pravične trgovine

Gradimo infrastrukturo za novo podatkovno gospodarstvo. Predstavljajte si jo kot certifikat »pravične trgovine« za podatke za usposabljanje umetne inteligence.

Za ponudnike podatkov

Založniki, univerze, raziskovalne ustanove in strokovnjaki s posameznih področij lahko registrirajo svojo vsebino na naši platformi. Sami določijo pogoje licenciranja. Sami določijo ceno. Ohranijo nadzor.

Za razliko od izvlečnega modela, kjer je bila njihova vsebina preprosto vzeta, postanejo dejavni udeleženci v gospodarstvu umetne inteligence. Lahko izberejo, katere aplikacije umetne inteligence lahko uporabljajo njihove podatke, pod kakšnimi pogoji in po kakšni ceni.

Kakovostni podatki dosegajo visoke cene. Akademski založnik s strogo strokovno pregledanimi raziskavami lahko zaračuna več kot vsebinska kmetija s klikabilnimi vabami, optimiziranimi za iskalnike. Trg nagrajuje kakovost.

Za razvijalce umetne inteligence

Podjetja, ki gradijo aplikacije umetne inteligence, dobijo dostop do pravno jasnih podatkov za usposabljanje z dokumentiranim izvorom. Regulatorjem, zavarovalnicam in sodiščem lahko natančno dokažejo, od kod prihajajo njihovi podatki za usposabljanje in da so jih imeli pravico uporabljati.

To odpravlja naraščajoče pravno tveganje modelov, usposobljenih na strganih podatkih. Prav tako omogoča dostop do »temne snovi« znanja, ogromnih zbirk visokokakovostnih informacij, ki nikoli niso bile na voljo na odprtem spletu: korporativnih arhivov, raziskav za plačljivim zidom, lastniških podatkovnih baz.

Za končne uporabnike

Uporabniki dobijo boljše rezultate, ker je umetna inteligenca usposobljena na kakovostnejših, skrbno izbranih podatkih in ne na šumu odprtega interneta. Prav tako dobijo pripis vira. Ko naš sistem zagotovi informacije iz licenciranih virov, lahko te vire navede, kar omogoča preverjanje in poglobljeno raziskovanje.

Tržnica je prostor, kjer soglasje, pripis vira, plačilo in obvladovanje tveganja podjetij postanejo en sam delovni tok.

Ekonomika kakovosti pred količino

Kritiki trdijo, da plačevanje podatkov naredi razvoj umetne inteligence ekonomsko nevzdržen. Trdijo, da za usposabljanje zmogljivih modelov potrebujete »ves internet«.

To odraža zastarelo razmišljanje iz obdobja »velikih podatkov« okoli leta 2020. Nedavne raziskave so prepričljivo dokazale, da je kakovost podatkov veliko pomembnejša od količine podatkov.

Pomislite na matematiko. Za usposabljanje modela GPT-3 je bilo potrebnih približno 45 terabajtov stisnjenega besedila. Večina tega je bilo nizkokakovostno strganje spleta: komentarji, neželena pošta, zastarele informacije, dejanske napake in čista nesmisel.

Model, usposobljen na 500 gigabajtih skrbno izbranih, kakovostnih učbeniških in akademskih vsebin, lahko doseže ali preseže zmogljivost modelov, usposobljenih na 100-krat več podatkov. Razmerje med signalom in šumom pri skrbno izbranih podatkih je preprosto toliko višje.

S plačevanjem podatkov dobimo dostop do vsebin, ki strgalcem nikoli niso bile na voljo: medicinske literature za plačljivim zidom založnikov, finančnih raziskav v lastniških podatkovnih bazah, industrijskega znanja v korporativnih arhivih. Ta »temna snov« je čistejša, gostejša in dragocenejša od česar koli na odprtem spletu.

Ekonomika dejansko daje prednost modelu dostojanstva. Na bajt plačamo več, a potrebujemo precej manj bajtov. Dostopamo do vrhunskih virov, do katerih strgalniki nikoli ne morejo priti. In odpravimo pravno odgovornost, ki zdaj ogroža podjetja, ki temeljijo na ekstrakciji, z milijardami možne škode.

Kakovost pred količino: nova ekonomika podatkovModel ekstrakcije45+ TB spletnega strganja90 %+ nizkokakovostnega šumaNaraščajoča pravna odgovornostModel dostojanstva podatkov~500 GB izbranih vsebin95 %+ visokokakovostnega signalaČist pravni statusPrednost temne snoviLicencirani podatki omogočajo dostop do vrhunskih virov, do katerih strgalniki nikoli ne morejo pritiMedicinske revijeRecenzirane raziskaveFinančni podatkiLastniške baze podatkovIndustrijsko znanjeKorporativni arhivi

Nuja za podjetja

Za poslovne stranke dostojanstvo podatkov ni neobvezno. Je zahteva za obvladovanje tveganj.

Velike organizacije se soočajo z ogromno odškodninsko odgovornostjo zaradi sistemov umetne inteligence, usposobljenih na vprašljivih podatkih. Marketinški oddelek, ki uporablja generator slik, usposobljen na prisvojenih umetniških delih, se sooča z možnimi zahtevki zaradi kršitve avtorskih pravic. Pravni oddelek, ki uporablja jezikovni model, usposobljen na vsebini za plačilnim zidom, se sooča z izpostavljenostjo intelektualni lastnini. Zdravstvena organizacija, ki uporablja model, ki ne more dokazati izvora svojih učnih podatkov, se sooča s regulativnim tveganjem.

Tožbe prihajajo. Getty Images je tožil Stability AI. The New York Times je tožil OpenAI. Avtorske zbornice organizirajo skupinske tožbe. Potencialna odškodnina znaša milijarde.

Organizacije, ki uporabljajo sisteme Dweve, lahko natančno dokažejo, od kod prihajajo naši učni podatki in da smo imeli za vse ustrezne licence. Ta čista sled izvora je vredna veliko več kot kakršna koli obrobna pridobitev zmogljivosti iz prisvojenih podatkov.

Pripisovanje vira in podatkovno gospodarstvo

Poleg nadomestila podatkovno dostojanstvo zahteva pripisovanje vira. Ko naši sistemi zagotavljajo informacije, pridobljene iz licenciranih virov, te vire navajamo.

To ustvarja pozitivni krog. Uporabniki lahko preverijo informacije z ogledom izvirnih virov. Teme lahko poglobijo s sledenjem navedbam. Promet se vrača k ustvarjalcem vsebin, kar obnavlja porušeno družbeno pogodbo spleta.

Za naših 456 naborov omejitev za domenske strokovnjake v Dweve Loom ima vsak del znanja verigo izvora. Ko strokovnjak za medicinsko področje zagotovi informacije o redki bolezni, lahko pokažemo, kateri članki iz medicinskih revij so prispevali k temu odgovoru. Ko strokovnjak za pravno področje pojasni regulativno zahtevo, lahko navedemo zakonske vire.

To ni le dobra etika. Je dobro oblikovanje izdelka. Uporabniki bolj zaupajo sistemom, ko lahko preverijo trditve. Podjetja imajo raje sisteme, ki lahko prikažejo svoje sklepanje. Pripisovanje vira gradi zaupanje.

Prihodnost, ki jo gradimo

Obdobje izkoriščanja se končuje. Kar sledi, se določa zdaj.

Ena pot vodi v zastrupljeno skupno lastnino. Ustvarjalci sprejemajo vse bolj agresivne zaščitne ukrepe. Kakovost učnih podatkov se slabša. Razvoj umetne inteligence zastane ali postane domena peščice podjetij s prednostjo dediščine podatkov.

Druga pot vodi v trajnostno podatkovno gospodarstvo. Ustvarjalci so nadomestili za svoje prispevke. Kakovostni podatki so na voljo tistim, ki so jih pripravljeni pošteno plačati. Razvoj umetne inteligence se nadaljuje s široko udeležbo in porazdeljenimi koristmi.

Pri Dweve gradimo infrastrukturo za drugo pot. Naše 96-odstotno zmanjšanje porabe energije dokazuje, da je učinkovita umetna inteligenca mogoča. Naša 100-odstotna razložljivost dokazuje, da je pregledna umetna inteligenca dosegljiva. Naša arhitektura podatkovnega dostojanstva dokazuje, da je etična umetna inteligenca praktična.

Verjamemo, da je obravnavanje ustvarjalcev podatkov z dostojanstvom ne le moralno pravilno. Je tudi ekonomsko boljše. Ustvarja boljšo umetno inteligenco, usposobljeno na boljših podatkih, s čistejšim pravnim statusom in trajnostno ekonomiko.

Brezplačnega kosila je konec. Vprašanje je, kaj sledi. Mi gradimo alternativo.

Pripravljeni graditi umetno inteligenco na temelju podatkovnega dostojanstva? Tržnica Dweve za pošteno trgovino s podatki zagotavlja pravno varnost, kakovostnejše učne podatke in trajnostno ekonomiko. Stopite v stik z nami in odkrijte, kako lahko podatkovno dostojanstvo postane vaša konkurenčna prednost.

Trajnostna pot je vztrajnik: kakovostni viri so plačani, izvor potuje, tveganje kupca se zmanjša in boljši podatki se še naprej ustvarjajo.