Dostojanstvo podataka: Kraj besplatnog ručka u obuci umjetne inteligencije
Najveća pljačka u povijesti
Nazovimo prvu fazu generativne umjetne inteligencije onim što je doista bila: najveći čin izvlačenja vrijednosti u ljudskoj povijesti.
Između 2018. i 2024. godine, šačica tvrtki iz Silicijske doline rasporedila je vojske web pauka po cijelom internetu. Ti su pauci progutali sve: svaku digitaliziranu knjigu, svaki objavljeni članak, svaku prenesenu fotografiju, svaki napisani forumski post, svaki redak koda ikad podijeljen na GitHubu, svaku pjesmu, svaku doktorsku disertaciju, svako ljubavno pismo objavljeno na osobnom blogu.
Učinili su to bez traženja dopuštenja. Učinili su to bez pružanja naknade. Učinili su to čak i bez priznavanja izvora.
Zatim su svu tu izvučenu vrijednost saželi u matematičke težine i izgradili vlasničke proizvode koje su prodavali za stotine milijardi dolara. Ljudi koji su stvorili vrijednost nisu dobili ništa. Tvrtke koje su je izvukle postale su najvrjednija poduzeća na planetu.
To nije bila inovacija. To je bila industrijalizirana autorska arbitraža na dosad neviđenoj razini.
Ali besplatnog ručka je kraj. Stvaratelji uzvraćaju udarac. A pravni, etički i ekonomski temelji modela izvlačenja se ruše.
Pravni zidovi koji se podižu
Pravne osnove modela izvlačenja podataka oduvijek su bile upitne. Tvrtke koje se bave umjetnom inteligencijom tvrdile su da treniranje na materijalima zaštićenim autorskim pravima predstavlja "poštenu upotrebu" jer model "transformira" podatke umjesto da ih izravno kopira. Tvrdile su da je to analogno čovjeku koji čita knjige u knjižnici.
Taj se argument sada ruši na sudovima diljem svijeta.
Tužba The New York Timesa
Tužba The New York Timesa protiv OpenAI-ja i Microsofta, podnesena u prosincu 2023., bila je prvi udarac u onome što obećava biti višegodišnji sudski postupci. Tužba je pokazala da ChatGPT može reproducirati članke Timesa zaštićene autorskim pravima gotovo doslovno. Pokazala je da model može zaobići paywall sažimajući članke tako potpuno da korisnici nisu imali razloga posjetiti izvorni izvor.
To nije "transformacija". To je zamjena na tržištu. Kada umjetna inteligencija može zamijeniti funkciju pretplate na novine, obrana poštenom upotrebom se urušava.
Pobuna umjetnika
Vizualni umjetnici bili su među prvima koji su prepoznali prijetnju. Generatori slika trenirani na milijardama umjetničkih djela mogli su replicirati stilove pojedinih umjetnika s poraznom preciznošću. Upit poput "u stilu [živućeg umjetnika]" mogao je proizvesti neograničen broj djela koja su se izravno natjecala sa sredstvima za život izvornog autora.
Kolektivne tužbe u ime vizualnih umjetnika sada prolaze kroz sudove. No umjetnici nisu čekali pravno rješenje. Razvili su tehničke protumjere.
Alati poput Glazea i Nightshadea dodaju neprimjetne perturbacije slikama koje truju AI trening. Skrapana slika izgleda normalno ljudima, ali uzrokuje degradaciju modela ili nepredvidive rezultate. To je digitalni oblik miniranja sadržaja i širi se ubrzano.
Zatvaranje platformi
Velike platforme zatvorile su svoja vrata za AI trening. Reddit, koji je bio jedan od najvećih izvora podataka za treniranje na razgovorima, sada naplaćuje prohibitivne naknade za API pristup. Twitter/X potpuno je blokirao AI crawlere prije nego što je promijenio kurs i monetizirao pristup. Stack Overflow uveo je stroge uvjete protiv AI treninga na svojoj platformi za programska pitanja i odgovore.
"Otvoreni web" na koji su se tvrtke za umjetnu inteligenciju oslanjale postaje mozaik ograđenih vrtova, od kojih svaki naplaćuje danak svakoj umjetnoj inteligenciji koja želi pristup.
Dostojanstvo podataka: drugačija filozofija
U Dweveu prihvaćamo koncept dostojanstva podataka, pojam koji je popularizirao računalni znanstvenik Jaron Lanier. Načelo je jednostavno: ako vaši podaci doprinose vrijednosti AI sustava, zaslužujete udio te vrijednosti.
To nije milostinja. To nije čak ni etika radi nje same. To je temelj održivog AI gospodarstva.
Model eksploatacije nikada nije bio ekonomski održiv. Oslanjao se na privremenu pravnu sivu zonu i praktičnu nemogućnost milijuna pojedinačnih kreatora da ostvare svoja prava. Kako se oba uvjeta mijenjaju, tvrtke izgrađene na eksploataciji suočavaju se s egzistencijalnim rizikom.
Model izgrađen na dostojanstvu, nasuprot tome, stvara usklađene poticaje. Kreatori su motivirani dati svoj najbolji rad jer su za njega plaćeni. AI tvrtke dobivaju pristup kvalitetnijim podacima jer plaćaju kuriranje i provjeru. Korisnici dobivaju bolje rezultate jer su podaci za treniranje vrhunski.
Dweve arhitektura za dostojanstvo podataka
Naš pristup dostojanstvu podataka nije samo političko stajalište. Ugrađen je u našu tehničku arhitekturu.
Spindle cjevovod znanja
Dweve Spindle implementira sedmostupanjski epistemološki cjevovod koji prati svaki djelić znanja od izvora do primjene:
- Kandidat: Neobrađene informacije identificiraju se i označavaju metapodacima o izvoru
- Ekstrahirano: Strukturirane informacije ekstrahiraju se uz očuvanu provinijenciju
- Analizirano: Sadržaj se razlaže na atomske činjenice uz provjeru statusa licenciranja
- Povezano: Činjenice se povezuju u graf znanja s lancima atribucije
- Provjereno: Validacija iz više izvora potvrđuje točnost i pravni status
- Certificirano: Osiguranje kvalitete potvrđuje usklađenost sa zahtjevima dostojanstva podataka
- Kanonsko: Provjereno znanje postaje AI-spremno s potpunom provinijencijom
Taj cjevovod znači da svaki djelić znanja u našem sustavu možemo pratiti do njegova izvornog izvora. Možemo dokazati status licenciranja. Možemo identificirati koji su kreatori doprinijeli bilo kojem danom rezultatu.
456 skupova ograničenja za specijalizirane domene
Arhitektura Dweve Loom s 456 specijaliziranih skupova ograničenja omogućuje granularno licenciranje i naknade. Svaki specijalist za domenu predstavlja zasebnu domenu znanja s vlastitim izvorima podataka i aranžmanima licenciranja.
Kada specijalist za pravnu domenu (njemačko ugovorno pravo) obradi upit, točno znamo koji su izdavači pravnih publikacija i odvjetnička društva doprinijeli toj sposobnosti. Kada specijalist za medicinsku domenu (onkologija) pruži informacije, možemo pratiti put do medicinskih časopisa, kliničkih baza podataka i istraživačkih institucija koje su pružile znanje.
Ta granularnost omogućuje sofisticiranu podjelu prihoda. Umjesto nejasnih tvrdnji o "treniranju na internetu", možemo precizno izračunati koliko je svaki izvor podataka doprinio svakoj sposobnosti.
Tržnica podataka poštene trgovine
Gradimo infrastrukturu za novo gospodarstvo podataka. Zamislite to kao certifikat "poštene trgovine" za podatke za obuku umjetne inteligencije.
Za pružatelje podataka
Izdavači, sveučilišta, istraživačke institucije i stručnjaci za domene mogu registrirati svoj sadržaj na našoj platformi. Oni postavljaju uvjete licenciranja. Oni postavljaju cijenu. Oni zadržavaju kontrolu.
Za razliku od modela eksploatacije u kojem je njihov sadržaj jednostavno uzet, oni postaju aktivni sudionici u gospodarstvu umjetne inteligencije. Mogu odabrati koje aplikacije umjetne inteligencije mogu koristiti njihove podatke, pod kojim uvjetima i po kojoj cijeni.
Visokokvalitetni podaci postižu premium cijene. Akademski izdavač s rigorozno recenziranim istraživanjem može naplatiti više od tvornice sadržaja s SEO-optimiziranim klikabilnim naslovima. Tržište nagrađuje kvalitetu.
Za programere umjetne inteligencije
Tvrtke koje grade aplikacije umjetne inteligencije dobivaju pristup pravno jasnim podacima za obuku s dokumentiranim podrijetlom. Regulatorima, osiguravateljima i sudovima mogu dokazati točno odakle njihovi podaci za obuku potječu i da su imali pravo koristiti ih.
To uklanja rastući pravni rizik modela obučenih na prikupljenim podacima. Također pruža pristup "tamnoj tvari" znanja, golemim spremištima visokokvalitetnih informacija koja nikada nisu bila dostupna na otvorenom webu: korporativnim arhivima, istraživanjima iza paywalla, vlasničkim bazama podataka.
Za krajnje korisnike
Korisnici dobivaju bolje rezultate jer je umjetna inteligencija obučena na kvalitetnijim, odabranim podacima, a ne na buci otvorenog interneta. Također dobivaju atribuciju: kada naš sustav pruža informacije iz licenciranih izvora, možemo citirati te izvore, omogućujući provjeru i dublje istraživanje.
Ekonomika kvalitete umjesto količine
Kritičari tvrde da plaćanje podataka čini razvoj umjetne inteligencije ekonomski neodrživim. Tvrde da vam treba "cijeli internet" za obuku sposobnih modela.
To odražava zastarjelo razmišljanje iz ere "velikih podataka" iz 2020-ih. Nedavna istraživanja uvjerljivo su pokazala da kvaliteta podataka znači daleko više od količine podataka.
Razmotrite matematiku. Za obuku GPT-3 bilo je potrebno približno 45 terabajta komprimiranog teksta. Većina toga bilo je niskokvalitetno struganje weba: sekcije komentara, neželjena pošta, zastarjele informacije, činjenične pogreške i potpune besmislice.
Model obučen na 500 gigabajta odabranog, visokokvalitetnog udžbeničkog i akademskog sadržaja može dosegnuti ili nadmašiti izvedbu modela obučenih na 100 puta više podataka. Omjer signala i šuma odabranih podataka jednostavno je toliko veći.
Plaćanjem podataka dobivamo pristup sadržaju koji strugačima nikada nije bio dostupan: medicinskoj literaturi iza izdavačkih paywalla, financijskim istraživanjima u vlasničkim bazama podataka, industrijskom znanju u korporativnim arhivima. Ta "tamna tvar" čišća je, gušća i vrijednija od bilo čega na otvorenom webu.
Ekonomija zapravo ide u prilog modelu dostojanstva. Plaćamo više po bajtu, ali nam treba znatno manje bajtova. Dobivamo pristup premium izvorima do kojih scraperi nikada ne mogu doći. I uklanjamo pravnu odgovornost koja sada prijeti tvrtkama koje se temelje na ekstrakciji potencijalnom štetom od milijardi.
Imperativ za poduzeća
Za korporativne kupce dostojanstvo podataka nije opcija. To je zahtjev upravljanja rizicima.
Velike organizacije suočavaju se s ogromnom odgovornošću zbog AI sustava treniranih na upitnim podacima. Marketinški odjel koji koristi generator slika treniran na preuzetim umjetničkim djelima suočava se s potencijalnim tužbama za kršenje autorskih prava. Pravni odjel koji koristi jezični model treniran na sadržaju iza paywalla suočava se s izloženošću intelektualnom vlasništvu. Zdravstvena organizacija koja koristi model koji ne može dokazati podrijetlo svojih podataka za treniranje suočava se s regulatornim rizikom.
Tužbe dolaze. Getty Images tužio je Stability AI. The New York Times tužio je OpenAI. Cehovi autora organiziraju skupne tužbe. Potencijalna šteta iznosi milijarde.
Organizacije koje koriste Dweve sustave mogu točno pokazati odakle potječu naši podaci za treniranje i da smo za sve njih imali odgovarajuće licence. Ovo čisto podrijetlo vrijedi daleko više od bilo kakvog marginalnog povećanja sposobnosti dobivenog preuzimanjem podataka.
Atribucija i ekonomija znanja
Osim naknade, dostojanstvo podataka zahtijeva atribuciju. Kada naši sustavi pružaju informacije iz licenciranih izvora, navodimo te izvore.
To stvara pozitivan ciklus. Korisnici mogu provjeriti informacije provjerom izvornih izvora. Mogu dublje istraživati teme prateći citate. Promet se vraća kreatorima sadržaja, obnavljajući narušeni društveni ugovor weba.
Za naših 456 skupova ograničenja za domenske stručnjake u Dweve Loom, svaki dio znanja ima lanac podrijetla. Kada stručnjak za medicinsku domenu pruži informacije o rijetkoj bolesti, možemo pokazati koji su članci iz medicinskih časopisa utjecali na taj odgovor. Kada stručnjak za pravnu domenu objasni regulatorni zahtjev, možemo navesti zakonske izvore.
Ovo nije samo dobra etika. To je dobar dizajn proizvoda. Korisnici više vjeruju sustavima kada mogu provjeriti tvrdnje. Poduzeća preferiraju sustave koji mogu pokazati svoje zaključivanje. Atribucija gradi povjerenje.
Budućnost koju gradimo
Era ekstrakcije završava. Ono što slijedi određuje se upravo sada.
Jedan put vodi do otrovane zajedničke imovine. Kreatori usvajaju sve agresivnije zaštitne mjere. Kvaliteta podataka za treniranje opada. Razvoj AI-ja stagnira ili postaje privilegija nekoliko tvrtki s naslijeđenim prednostima u podacima.
Drugi put vodi do održive ekonomije znanja. Kreatori su naknađeni za svoje doprinose. Kvalitetni podaci dostupni su onima koji su spremni pošteno platiti za njih. Razvoj AI-ja nastavlja se uz široko sudjelovanje i raspodijeljene koristi.
U Dweveu gradimo infrastrukturu za drugi put. Naše smanjenje potrošnje energije od 96% dokazuje da je učinkovit AI moguć. Naša 100% objašnjivost dokazuje da je transparentan AI ostvariv. Naša arhitektura dostojanstva podataka dokazuje da je etičan AI praktičan.
Vjerujemo da je tretiranje kreatora podataka s dostojanstvom ne samo moralno ispravno. To je ekonomski superiorno. Proizvodi bolji AI treniran na boljim podacima, s čišćim pravnim statusom i održivom ekonomikom.
Besplatnog ručka je kraj. Pitanje je što slijedi. Mi gradimo alternativu.
Spremni graditi AI na temelju dostojanstva podataka? Dweveova tržnica poštene trgovine podacima pruža pravnu sigurnost, kvalitetnije podatke za treniranje i održivu ekonomiku. Kontaktirajte nas kako biste otkrili kako dostojanstvo podataka može postati vaša konkurentska prednost.