Dôstojnosť dát: Koniec bezplatného obeda v tréningu AI
Najväčšia lúpež v dejinách
Nazvime prvú fázu generatívnej umelej inteligencie tým, čím naozaj bola: najväčším aktom vyťaženia hodnoty v dejinách ľudstva.
V rokoch 2018 až 2024 nasadilo niekoľko spoločností v Silicon Valley armády webových prehľadávačov na celý internet. Tieto prehľadávače skonzumovali všetko: každú digitalizovanú knihu, každý publikovaný článok, každú nahranú fotografiu, každý príspevok na fóre, každý riadok kódu zdieľaný na GitHub, každý text piesne, každú dizertačnú prácu, každý milostný list uverejnený na osobnom blogu.
Urobili to bez toho, aby si vypýtali povolenie. Urobili to bez poskytnutia akejkoľvek kompenzácie. Urobili to bez toho, aby dokonca uznali zdroj.
Potom vzali všetku túto vyťaženú hodnotu, stlačili ju do matematických váh a vytvorili proprietárne produkty, ktoré predávali za stovky miliárd dolárov. Ľudia, ktorí hodnotu vytvorili, nedostali nič. Spoločnosti, ktoré ju vyťažili, sa stali najhodnotnejšími podnikmi na planéte.
Toto nebola inovácia. Toto bola industrializovaná arbitráž autorských práv v bezprecedentnom rozsahu.
Ale obed zadarmo sa končí. Tvorcovia sa bránia. A právne, etické a ekonomické základy modelu vyťaženia sa rozpadávajú.
Právne steny sa dvíhajú
Právne základy extrakčného modelu boli vždy sporné. Spoločnosti zaoberajúce sa umelou inteligenciou tvrdili, že trénovanie na materiáloch chránených autorským právom predstavuje „fair use", pretože model dáta „transformuje" a nekopíruje ich priamo. Tvrdili, že je to analogické tomu, ako človek číta knihy v knižnici.
Tento argument vo svete súdov zlyháva.
Žaloba denníka The New York Times
Žaloba denníka The New York Times proti spoločnostiam OpenAI a Microsoft, podaná v decembri 2023, bola prvým výstrelom toho, čo sľubuje byť dlhoročným súdnym sporom. Žaloba preukázala, že ChatGPT dokáže reprodukovať články denníka The New York Times chránené autorským právom takmer doslovne. Ukázala, že model dokáže obísť platené brány tým, že články sumarizoval tak úplne, že používatelia nemali dôvod navštíviť pôvodný zdroj.
Toto nie je „transformácia". Toto je nahradenie trhu. Keď umelá inteligencia dokáže nahradiť funkciu predplatného novín, obhajoba založená na fair use sa zrúti.
Rebélia umelcov
Výtvarní umelci patrili medzi prvých, ktorí rozpoznali hrozbu. Generátory obrázkov trénované na miliardách umeleckých diel dokázali replikovať štýly jednotlivých umelcov s ničivou presnosťou. Výzva ako „v štýle [žijúceho umelca]" mohla vyprodukovať neobmedzené množstvo diel, ktoré priamo konkurovali živobytiu pôvodného tvorcu.
Kolektívne žaloby v mene výtvarných umelcov sa teraz dostávajú na súdy. Umelci však nečakali na právne riešenie. Vyvinuli technické protiopatrenia.
Nástroje ako Glaze a Nightshade pridávajú do obrázkov nepostrehnuteľné perturbácie, ktoré otravujú trénovanie AI. Zoškrabaný obrázok vyzerá pre ľudí normálne, ale spôsobuje degradáciu modelu alebo nepredvídateľné výstupy. Je to digitálna forma nastražovania pascí na obsah a rýchlo sa šíri.
Uzavretie platforiem
Hlavné platformy zatvorili svoje brány pre trénovanie AI. Reddit, ktorý bol jedným z najväčších zdrojov konverzačných tréningových dát, teraz účtuje prohibičné poplatky za prístup k API. Twitter/X úplne zablokoval AI crawlerov predtým, než zmenil kurz a speňažil prístup. Stack Overflow zaviedol prísne podmienky proti trénovaniu AI na svojich programátorských otázkach a odpovediach.
„Otvorený web", na ktorý sa spoločnosti zaoberajúce sa umelou inteligenciou spoliehali, sa stáva mozaikou ohradených záhrad, pričom každá vyberá mýto od akejkoľvek AI, ktorá chce získať prístup.
Dôstojnosť údajov: Iná filozofia
V Dweve si osvojujeme koncept Dôstojnosti údajov, termín, ktorý spopularizoval počítačový vedec Jaron Lanier. Princíp je jednoduchý: ak vaše údaje prispievajú k hodnote systému umelej inteligencie, zaslúžite si podiel na tejto hodnote.
Toto nie je charita. Toto nie je ani etika pre etiku samu. Toto je základ pre udržateľnú ekonomiku umelej inteligencie.
Extrakčný model nikdy nebol ekonomicky udržateľný. Závisel od dočasnej právnej šedej zóny a praktickej neschopnosti miliónov jednotlivých tvorcov presadiť svoje práva. Keďže sa obe podmienky menia, spoločnosti postavené na extrakcii čelia existenčnému riziku.
Model postavený na dôstojnosti naopak vytvára zosúladené stimuly. Tvorcovia sú motivovaní prinášať svoju najlepšiu prácu, pretože sú za ňu odmeňovaní. Spoločnosti umelej inteligencie získavajú prístup ku kvalitnejším údajom, pretože platia za kurátorstvo a overovanie. Používatelia dosahujú lepšie výsledky, pretože tréningové údaje sú kvalitnejšie.
Architektúra Dweve pre dôstojnosť údajov
Náš prístup k dôstojnosti údajov nie je len politické stanovisko. Je zabudovaný priamo do našej technickej architektúry.
Pipeline znalostí Spindle
Dweve Spindle implementuje sedemstupňový epistemologický pipeline, ktorý sleduje každý kus znalosti od pôvodu až po nasadenie:
- Kandidát: Surové informácie sú identifikované a označené metadátami o zdroji
- Extrahované: Štruktúrované informácie sú extrahované so zachovaným pôvodom
- Analyzované: Obsah je rozložený na atómové fakty s overeným licenčným statusom
- Prepojené: Fakty sú prepojené do znalostného grafu s reťazcami priradenia
- Overené: Viaczdrojová validácia potvrdzuje presnosť a právny status
- Certifikované: Kontrola kvality potvrdzuje súlad s požiadavkami dôstojnosti údajov
- Kanonické: Overené znalosti sa stávajú pripravenými pre AI s úplným pôvodom
Tento pipeline znamená, že môžeme vysledovať akýkoľvek kus znalosti v našom systéme späť k jeho pôvodnému zdroju. Môžeme dokázať licenčný status. Môžeme identifikovať, ktorí tvorcovia prispeli k akémukoľvek výstupu.
456 súborov obmedzení pre doménových špecialistov
Architektúra Dweve Loom s 456 špecializovanými súbormi obmedzení umožňuje granulárne licencovanie a kompenzáciu. Každý doménový špecialista predstavuje odlišnú doménu znalostí s vlastnými zdrojmi údajov a licenčnými dojednaniami.
Keď špecialista na právnu doménu (nemecké zmluvné právo) spracúva dopyt, presne vieme, ktorí právni vydavatelia a advokátske kancelárie prispeli k tejto schopnosti. Keď špecialista na lekársku doménu (onkológia) poskytuje informácie, môžeme vysledovať späť k lekárskym časopisom, klinickým databázam a výskumným inštitúciám, ktoré poskytli znalosti.
Táto granularita umožňuje sofistikované zdieľanie príjmov. Namiesto vágnych tvrdení o „tréningu na internete" môžeme presne vypočítať, koľko každý zdroj údajov prispel ku každej schopnosti.
Trhovisko pre spravodlivý obchod s dátami
Budujeme infraštruktúru pre novú dátovú ekonomiku. Predstavte si to ako certifikáciu „Fair Trade" pre tréningové dáta umelej inteligencie.
Pre poskytovateľov dát
Vydavatelia, univerzity, výskumné inštitúcie a doménoví špecialisti môžu registrovať svoj obsah na našej platforme. Stanovia licenčné podmienky. Stanovia cenu. Zachovajú si kontrolu.
Na rozdiel od extrakčného modelu, kde bol ich obsah jednoducho zobratý, sa stávajú aktívnymi účastníkmi ekonomiky umelej inteligencie. Môžu si vybrať, ktoré aplikácie umelej inteligencie môžu používať ich dáta, za akých podmienok a za akú cenu.
Kvalitné dáta si pýtajú prémiové ceny. Akademický vydavateľ s prísne recenzovaným výskumom môže účtovať viac ako obsahová farma s clickbaitom optimalizovaným pre SEO. Trh odmeňuje kvalitu.
Pre vývojárov umelej inteligencie
Spoločnosti, ktoré vyvíjajú aplikácie umelej inteligencie, získavajú prístup k právne čistým tréningovým dátam s zdokumentovaným pôvodom. Regulátorom, poisťovniam a súdom môžu presne preukázať, odkiaľ ich tréningové dáta pochádzajú a že mali právo ich používať.
To eliminuje rastúce právne riziko modelov trénovaných na zoškrabaných dátach. Zároveň to poskytuje prístup k „temnej hmote" vedomostí, rozsiahlym repozitárom vysoko kvalitných informácií, ktoré nikdy neboli dostupné na otvorenom webe: firemné archívy, výskum za paywallom, proprietárne databázy.
Pre koncových používateľov
Používatelia dosahujú lepšie výsledky, pretože umelá inteligencia je trénovaná na kvalitnejších, kurátorských dátach, a nie na šume otvoreného internetu. Získavajú tiež atribúciu, keď náš systém poskytne informácie z licencovaných zdrojov, môžeme tieto zdroje citovať, čo umožňuje overenie a hlbší prieskum.
Ekonomika kvality nad kvantitou
Kritici tvrdia, že platenie za dáta robí vývoj umelej inteligencie ekonomicky neživotaschopným. Tvrdia, že na trénovanie schopných modelov potrebujete „celý internet".
To odráža zastarané myslenie z éry „veľkých dát" okolo roku 2020. Nedávny výskum presvedčivo ukázal, že kvalita dát je oveľa dôležitejšia ako ich množstvo.
Zamyslite sa nad matematikou. Na trénovanie GPT-3 bolo potrebných približne 45 terabajtov komprimovaného textu. Väčšina z toho bol nekvalitný webový scraping: sekcie komentárov, spam, zastarané informácie, faktické chyby a úplný nezmysel.
Model trénovaný na 500 gigabajtoch kurátorského, vysoko kvalitného učebnicového a akademického obsahu môže dosiahnuť alebo prekonať výkon modelov trénovaných na 100-násobne väčšom množstve dát. Pomer signálu k šumu kurátorských dát je jednoducho o toľko vyšší.
Platením za dáta získavame prístup k obsahu, ktorý nebol nikdy dostupný scraperom: lekárska literatúra za vydavateľskými paywallmi, finančný výskum v proprietárnych databázach, priemyselné znalosti vo firemných archívoch. Táto „temná hmota" je čistejšia, hustejšia a hodnotnejšia ako čokoľvek na otvorenom webe.
Ekonomika v skutočnosti nahráva modelu dôstojnosti. Platíme viac za bajt, ale potrebujeme oveľa menej bajtov. Získavame prístup k prémiovým zdrojom, ktoré scrapery nikdy nedosiahnu. A eliminujeme právnu zodpovednosť, ktorá dnes ohrozuje spoločnosti založené na extrakcii miliardovými potenciálnymi škodami.
Podnikový imperatív
Pre podnikových zákazníkov nie je dôstojnosť dát voliteľná. Je to požiadavka riadenia rizík.
Veľké organizácie čelia obrovskému riziku zodpovednosti v súvislosti so systémami umelej inteligencie trénovanými na sporných dátach. Marketingové oddelenie používajúce generátor obrázkov trénovaný na skopírovaných umeleckých dielach čelí možným nárokom z porušenia autorských práv. Právne oddelenie používajúce jazykový model trénovaný na platenom obsahu čelí riziku porušenia duševného vlastníctva. Zdravotnícka organizácia používajúca model, ktorý nedokáže preukázať pôvod svojich tréningových dát, čelí regulačnému riziku.
Súdne spory prichádzajú. Getty Images zažaloval Stability AI. The New York Times zažaloval OpenAI. Autorské cechy organizujú skupinové žaloby. Potenciálne škody sa pohybujú v miliardách.
Organizácie používajúce systémy Dweve môžu presne preukázať, odkiaľ pochádzajú naše tréningové dáta a že sme na všetky z nich mali riadne licencie. Tento čistý pôvod dát má oveľa väčšiu hodnotu než akýkoľvek okrajový nárast schopností zo skopírovaných dát.
Atribúcia a vedomostná ekonomika
Okrem kompenzácie si dôstojnosť dát vyžaduje atribúciu. Keď naše systémy poskytujú informácie odvodené z licencovaných zdrojov, citujeme tieto zdroje.
To vytvára pozitívny cyklus. Používatelia si môžu overiť informácie kontrolou pôvodných zdrojov. Môžu skúmať témy hlbšie sledovaním citácií. Návštevnosť prúdi späť k tvorcom obsahu, čím sa obnovuje narušená spoločenská zmluva webu.
Pre našich 456 doménových špecialistov v Dweve Loom má každý kus vedomostí reťazec pôvodu. Keď špecialista na lekársku doménu poskytne informácie o zriedkavom ochorení, vieme ukázať, ktoré články z lekárskych časopisov ovplyvnili túto odpoveď. Keď špecialista na právnu doménu vysvetľuje regulačnú požiadavku, vieme citovať zákonné zdroje.
Toto nie je len dobrá etika. Je to dobrý dizajn produktu. Používatelia viac dôverujú systémom, keď si môžu overiť tvrdenia. Podniky uprednostňujú systémy, ktoré vedia preukázať svoje uvažovanie. Atribúcia buduje dôveru.
Budúcnosť, ktorú budujeme
Éra extrakcie sa končí. To, čo príde ďalej, sa určuje práve teraz.
Jedna cesta vedie k otrávenému spoločnému priestoru. Tvorcovia prijímajú čoraz agresívnejšie ochranné opatrenia. Kvalita tréningových dát klesá. Vývoj umelej inteligencie sa zastavuje alebo sa stáva doménou niekoľkých spoločností s výhodou starých dát.
Druhá cesta vedie k udržateľnej vedomostnej ekonomike. Tvorcovia sú odmeňovaní za svoje príspevky. Kvalitné dáta sú dostupné tým, ktorí sú ochotní za ne spravodlivo zaplatiť. Vývoj umelej inteligencie pokračuje so širokou účasťou a rozloženými výhodami.
V Dweve budujeme infraštruktúru pre druhú cestu. Naše 96 % zníženie spotreby energie dokazuje, že efektívna umelá inteligencia je možná. Naša 100 % vysvetliteľnosť dokazuje, že transparentná umelá inteligencia je dosiahnuteľná. Naša architektúra dôstojnosti dát dokazuje, že etická umelá inteligencia je praktická.
Veríme, že zaobchádzať s tvorcami dát s dôstojnosťou nie je len morálne správne. Je to ekonomicky výhodnejšie. Vytvára to lepšiu umelú inteligenciu trénovanú na lepších dátach, s čistejším právnym statusom a udržateľnou ekonomikou.
Obedy zadarmo sa skončili. Otázkou je, čo príde ďalej. Budujeme alternatívu.
Ste pripravení budovať umelú inteligenciu na základe dôstojnosti dát? Trhovisko Dweve s férovým obchodom s dátami poskytuje právnu istotu, kvalitnejšie tréningové dáta a udržateľnú ekonomiku. Kontaktujte nás a zistite, ako sa dôstojnosť dát môže stať vašou konkurenčnou výhodou.