Data Dignity: Sfârșitul prânzului gratuit în instruirea AI
Cea mai mare jaful din istorie
Să numim prima fază a IA generative exact ceea ce a fost: cel mai mare act de extragere de valoare din istoria omenirii.
Între 2018 și 2024, o mână de companii din Silicon Valley au desfășurat armate de crawler-e web pe tot internetul. Aceste crawler-e au consumat totul: fiecare carte digitalizată vreodată, fiecare articol publicat vreodată, fiecare fotografie încărcată vreodată, fiecare postare pe forum scrisă vreodată, fiecare linie de cod distribuită vreodată pe GitHub, fiecare vers de cântec, fiecare teză de doctorat, fiecare scrisoare de dragoste postată pe un blog personal.
Au făcut asta fără să ceară permisiunea. Au făcut asta fără să ofere compensații. Au făcut asta fără să recunoască măcar sursa.
Apoi au luat toată această valoare extrasă, au comprimat-o în greutăți matematice și au construit produse proprietare pe care le-au vândut pentru sute de miliarde de dolari. Oamenii care au creat valoarea nu au primit nimic. Companiile care au extras-o au devenit cele mai valoroase întreprinderi de pe planetă.
Aceasta nu a fost inovație. A fost arbitraj de copyright industrializat la o scară fără precedent.
Dar masa gratuită se termină. Creatorii luptă înapoi. Iar fundațiile legale, etice și economice ale modelului de extragere se prăbușesc.
Zidurile Legale care se Ridică
Fundațiile legale ale modelului de extracție au fost întotdeauna discutabile. Companiile de AI au susținut că instruirea pe material protejat de drepturi de autor constituie „utilizare loială", deoarece modelul „transformă" datele, mai degrabă decât să le copieze direct. Au susținut că acest lucru este analog cu un om care citește cărți într-o bibliotecă.
Acest argument eșuează în instanțele din întreaga lume.
Procesul New York Times
Procesul New York Times împotriva OpenAI și Microsoft, intentat în decembrie 2023, a fost prima salvă a ceea ce se anunță a fi ani de litigii. Procesul a demonstrat că ChatGPT poate reproduce articole protejate ale Times aproape cuvânt cu cuvânt. A arătat că modelul poate ocoli paywall-urile prin rezumarea articolelor atât de complet încât utilizatorii nu mai aveau niciun motiv să viziteze sursa originală.
Acesta nu este „transformare". Aceasta este substituire de piață. Când un AI poate înlocui funcția unui abonament la ziar, apărarea utilizării loiale se prăbușește.
Rebeliunea artiștilor
Artiștii vizuali au fost printre primii care au recunoscut amenințarea. Generatoarele de imagini instruite pe miliarde de opere de artă puteau replica stilurile individuale ale artiștilor cu o precizie devastatoare. Un prompt precum „în stilul [artistului în viață]" putea produce lucrări nelimitate care concurând direct cu mijloacele de trai ale creatorului original.
Procesele colective în numele artiștilor vizuali avansează acum prin instanțe. Dar artiștii nu au așteptat rezolvarea legală. Au dezvoltat contramăsuri tehnice.
Instrumente precum Glaze și Nightshade adaugă perturbații imperceptibile imaginilor care otrăvesc instruirea AI. O imagine răzuită pare normală pentru oameni, dar provoacă degradarea modelului sau rezultate imprevizibile. Este o formă digitală de capcană pentru conținut și se răspândește rapid.
Blocarea platformelor
Platformele majore au închis ușile instruirii AI. Reddit, care a fost una dintre cele mai mari surse de date conversaționale de instruire, percepe acum taxe prohibitive pentru accesul API. Twitter/X a blocat complet crawler-ele AI înainte de a-și schimba cursul și a monetiza accesul. Stack Overflow a implementat termeni stricți împotriva instruirii AI pe platforma lor de întrebări și răspunsuri de programare.
„Web-ul deschis" pe care companiile de AI se bazau devine un mozaic de grădini împrejmuite, fiecare extragând taxe de la orice AI care dorește acces.
Demnitatea datelor: o filosofie diferită
La Dweve, îmbrățișăm conceptul de demnitate a datelor, un termen popularizat de informaticianul Jaron Lanier. Principiul este simplu: dacă datele tale contribuie la valoarea unui sistem de inteligență artificială, meriți o parte din acea valoare.
Acesta nu este un act de caritate. Nu este nici măcar etică de dragul eticii. Este fundația unei economii sustenabile a inteligenței artificiale.
Modelul de extracție nu a fost niciodată solid din punct de vedere economic. Se baza pe o zonă gri juridică temporară și pe incapacitatea practică a milioane de creatori individuali de a-și impune drepturile. Pe măsură ce ambele condiții se schimbă, companiile construite pe extracție se confruntă cu un risc existențial.
Un model bazat pe demnitate, prin contrast, creează stimulente aliniate. Creatorii sunt motivați să contribuie cu cele mai bune lucrări ale lor pentru că sunt compensați. Companiile de inteligență artificială au acces la date de calitate superioară pentru că plătesc pentru curatare și verificare. Utilizatorii obțin rezultate mai bune pentru că datele de antrenare sunt superioare.
Arhitectura Dweve pentru demnitatea datelor
Abordarea noastră față de demnitatea datelor nu este doar o poziție politică. Este integrată în arhitectura noastră tehnică.
Pipeline-ul de cunoaștere Spindle
Dweve Spindle implementează un pipeline epistemologic în șapte etape care urmărește fiecare bucată de cunoaștere de la origine până la implementare:
- Candidat: Informațiile brute sunt identificate și etichetate cu metadate de sursă
- Extras: Informațiile structurate sunt extrase cu proveniența păstrată
- Analizat: Conținutul este descompus în fapte atomice cu statutul de licență verificat
- Conectat: Faptele sunt legate de graful de cunoaștere cu lanțuri de atribuire
- Verificat: Validarea multi-sursă confirmă acuratețea și statutul juridic
- Certificat: Asigurarea calității confirmă conformitatea cu cerințele de demnitate a datelor
- Canonic: Cunoașterea verificată devine gata pentru inteligența artificială cu proveniență completă
Acest pipeline înseamnă că putem urmări orice bucată de cunoaștere din sistemul nostru până la sursa sa originală. Putem dovedi statutul de licență. Putem identifica care creatori au contribuit la orice rezultat dat.
Cele 456 de seturi de constrângeri specializate pe domeniu
Arhitectura Dweve Loom, cu cele 456 de seturi de constrângeri specializate, permite licențierea și compensarea granulară. Fiecare specialist de domeniu reprezintă un domeniu distinct de cunoaștere, cu propriile surse de date și aranjamente de licențiere.
Când specialistul de domeniu juridic (Dreptul contractelor german) procesează o interogare, știm exact care editori juridici și firme de avocatură au contribuit la acea capacitate. Când specialistul de domeniu medical (Oncologie) oferă informații, putem urmări înapoi până la revistele medicale, bazele de date clinice și instituțiile de cercetare care au furnizat cunoașterea.
Această granularitate permite partajarea sofisticată a veniturilor. În loc de afirmații vagi despre „antrenare pe internet", putem calcula cu precizie cât a contribuit fiecare sursă de date la fiecare capacitate.
Piața de date cu comerț echitabil
Construim infrastructura pentru o nouă economie a datelor. Gândește-te la ea ca la o certificare de „comerț echitabil" pentru datele de instruire AI.
Pentru furnizorii de date
Editurile, universitățile, institutele de cercetare și experții de domeniu își pot înregistra conținutul pe platforma noastră. Ei stabilesc termenii de licențiere. Ei stabilesc prețul. Ei își păstrează controlul.
Spre deosebire de modelul extractiv în care conținutul lor era pur și simplu luat, ei devin participanți activi în economia AI. Ei pot alege ce aplicații AI pot folosi datele lor, în ce condiții și la ce preț.
Datele de înaltă calitate obțin prețuri premium. Un editor academic cu cercetări riguros evaluate de colegi poate cere mai mult decât o fermă de conținut cu titluri clickbait optimizate pentru SEO. Piața recompensează calitatea.
Pentru dezvoltatorii de AI
Companiile care construiesc aplicații AI obțin acces la date de instruire legal clare, cu proveniență documentată. Ele pot dovedi autorităților de reglementare, asigurătorilor și instanțelor exact de unde provin datele lor de instruire și că aveau dreptul să le folosească.
Aceasta elimină riscul juridic tot mai mare al modelelor instruite pe date răzuite. Oferă, de asemenea, acces la „materia întunecată" a cunoașterii, vastele depozite de informații de înaltă calitate care nu au fost niciodată disponibile pe web-ul deschis: arhive corporative, cercetări aflate în spatele paywall-urilor, baze de date proprietare.
Pentru utilizatorii finali
Utilizatorii obțin rezultate mai bune pentru că AI este instruit pe date curate, de calitate superioară, mai degrabă decât pe zgomotul internetului deschis. Ei beneficiază, de asemenea, de atribuire: atunci când sistemul nostru furnizează informații din surse licențiate, putem cita acele surse, permițând verificarea și explorarea aprofundată.
Economia calității în detrimentul cantității
Criticii susțin că plata pentru date face dezvoltarea AI neviabilă din punct de vedere economic. Ei pretind că ai nevoie de „tot internetul" pentru a instrui modele capabile.
Aceasta reflectă o gândire învechită din era „big data" a anilor 2020. Cercetările recente au demonstrat în mod decisiv că calitatea datelor contează mult mai mult decât cantitatea lor.
Gândește-te la matematică. Instruirea GPT-3 a necesitat aproximativ 45 de terabytes de text comprimat. Cea mai mare parte era răzuire web de calitate scăzută: secțiuni de comentarii, spam, informații depășite, erori factuale și pur și simplu nonsens.
Un model instruit pe 500 de gigabytes de conținut academic și manuale curat, de înaltă calitate, poate egala sau depăși performanța modelelor instruite pe date de 100 de ori mai multe. Raportul semnal-zgomot al datelor curate este pur și simplu mult mai ridicat.
Plătind pentru date, obținem acces la conținut care nu a fost niciodată disponibil răzuitorilor: literatură medicală în spatele paywall-urilor editurilor, cercetări financiare în baze de date proprietare, cunoștințe industriale în arhive corporative. Această „materie întunecată" este mai curată, mai densă și mai valoroasă decât orice de pe web-ul deschis.
Economia favorizează, de fapt, modelul demnității. Plătim mai mult pe octet, dar avem nevoie de mult mai puțini octeți. Avem acces la surse premium pe care scrapere-le nu le pot atinge niciodată. Și eliminăm răspunderea legală care amenință acum companiile bazate pe extracție cu daune potențiale de miliarde.
Imperativul enterprise
Pentru clienții enterprise, demnitatea datelor nu este opțională. Este o cerință de gestionare a riscurilor.
Organizațiile mari se confruntă cu o expunere uriașă la răspundere din cauza sistemelor de inteligență artificială antrenate pe date discutabile. Un departament de marketing care folosește un generator de imagini antrenat pe opere de artă colectate fără permisiune se confruntă cu potențiale cereri de încălcare a drepturilor de autor. Un departament juridic care folosește un model lingvistic antrenat pe conținut cu acces restricționat se confruntă cu expunere la proprietate intelectuală. O organizație din domeniul sănătății care folosește un model ce nu poate dovedi proveniența datelor de antrenament se confruntă cu riscuri de reglementare.
Procesele sunt iminente. Getty Images a dat în judecată Stability AI. The New York Times a dat în judecată OpenAI. Sindicatelor de autori organizează acțiuni în num colectiv. Daunele potențiale se ridică la miliarde.
Organizațiile care folosesc sistemele Dweve pot demonstra exact de unde provin datele noastre de antrenament și că am avut licențe adecvate pentru toate acestea. Această proveniență curată valorează mult mai mult decât orice câștig marginal de capacitate obținut din date colectate fără permisiune.
Atribuirea și economia cunoașterii
Dincolo de compensație, demnitatea datelor impune atribuirea. Când sistemele noastre oferă informații derivate din surse licențiate, cităm acele surse.
Aceasta creează un cerc virtuos. Utilizatorii pot verifica informațiile consultând sursele originale. Pot explora subiectele mai în profunzime urmând citările. Traficul revine către creatorii de conținut, refăcând contractul social rupt al web-ului.
Pentru cele 456 de seturi de constrângeri specializate pe domenii din Dweve Loom, fiecare informație are un lanț de proveniență. Când specialistul din domeniul medical oferă informații despre o boală rară, putem arăta ce lucrări din reviste medicale au fundamentat acel răspuns. Când specialistul din domeniul juridic explică o cerință de reglementare, putem cita sursele legislative.
Acest lucru nu este doar o chestiune de etică. Este și un bun design de produs. Utilizatorii au mai multă încredere în sistemele pe care le pot verifica. Întreprinderile preferă sistemele care își pot demonstra raționamentul. Atribuirea construiește încredere.
Viitorul pe care îl construim
Epoca extracției se apropie de final. Ceea ce urmează se decide acum.
O cale duce către un bun comun otrăvit. Creatorii adoptă măsuri de protecție din ce în ce mai agresive. Calitatea datelor de antrenament se degradează. Dezvoltarea inteligenței artificiale stagnează sau devine apanajul câtorva companii cu avantaje moștenite în materie de date.
Cealaltă cale duce către o economie sustenabilă a cunoașterii. Creatorii sunt compensați pentru contribuțiile lor. Datele de calitate sunt disponibile celor dispuși să plătească corect pentru ele. Dezvoltarea inteligenței artificiale continuă cu participare largă și beneficii distribuite.
La Dweve, construim infrastructura pentru cea de-a doua cale. Reducerea noastră de energie cu 96% demonstrează că inteligența artificială eficientă este posibilă. Explicabilitatea noastră de 100% demonstrează că inteligența artificială transparentă este realizabilă. Arhitectura noastră de demnitate a datelor demonstrează că inteligența artificială etică este practică.
Credem că tratarea creatorilor de date cu demnitate nu este doar corectă din punct de vedere moral. Este superioară din punct de vedere economic. Produce o inteligență artificială mai bună, antrenată pe date mai bune, cu un statut juridic mai curat și o economie sustenabilă.
Prânzul gratuit s-a terminat. Întrebarea este ce urmează. Noi construim alternativa.
Gata să construiți inteligență artificială pe o fundație de demnitate a datelor? Piața de date cu comerț echitabil a Dweve oferă certitudine juridică, date de antrenament de calitate superioară și o economie sustenabilă. Contactați-ne pentru a descoperi cum demnitatea datelor poate deveni avantajul vostru competitiv.