Dôstojnosť dát: Koniec bezplatného obeda v tréningu AI

Éra bezplatného scrapovania webu sa končí. Tvorcovia obsahu sa bránia. Takto Dweve trhový model spravodlivo odmeňuje tvorcov dát.

Dôstojnosť dát: Koniec bezplatného obeda v tréningu AI

Najväčšia lúpež v dejinách

Nazvime prvú fázu generatívnej umelej inteligencie tým, čím naozaj bola: najväčším aktom vyťaženia hodnoty v dejinách ľudstva.

V rokoch 2018 až 2024 nasadilo niekoľko spoločností v Silicon Valley armády webových prehľadávačov na celý internet. Tieto prehľadávače skonzumovali všetko: každú digitalizovanú knihu, každý publikovaný článok, každú nahranú fotografiu, každý príspevok na fóre, každý riadok kódu zdieľaný na GitHub, každý text piesne, každú dizertačnú prácu, každý milostný list uverejnený na osobnom blogu.

Urobili to bez toho, aby si vypýtali povolenie. Urobili to bez poskytnutia akejkoľvek kompenzácie. Urobili to bez toho, aby dokonca uznali zdroj.

Potom vzali všetku túto vyťaženú hodnotu, stlačili ju do matematických váh a vytvorili proprietárne produkty, ktoré predávali za stovky miliárd dolárov. Ľudia, ktorí hodnotu vytvorili, nedostali nič. Spoločnosti, ktoré ju vyťažili, sa stali najhodnotnejšími podnikmi na planéte.

Toto nebola inovácia. Toto bola industrializovaná arbitráž autorských práv v bezprecedentnom rozsahu.

Ale obed zadarmo sa končí. Tvorcovia sa bránia. A právne, etické a ekonomické základy modelu vyťaženia sa rozpadávajú.

Veľký presun hodnoty: extrakcia verzus dôstojnosťExtrakčný model (2018-2024)Prehľadaný celý internetBez povoleniaKnihy, články, kód, umenieBez uvedenia autoraTvorivá a intelektuálna prácaBez odmenyVýsledok:2+ bilióny dolárovv trhovej hodnote AI firiem0 dolárov pre tvorcov obsahuModel dôstojnosti dát (Dweve)Kurátorské zdroje vedomostíExplicitné licencovanieSledované expertné doményPlný reťazec pôvoduMerané využitie za dopytRozdeľovanie podielu z výnosovVýsledok:Udržateľný ekosystémTvorcovia motivovaní prispievaťKvalitnejšie vedomosti

Právne steny sa dvíhajú

Právne základy extrakčného modelu boli vždy sporné. Spoločnosti zaoberajúce sa umelou inteligenciou tvrdili, že trénovanie na materiáloch chránených autorským právom predstavuje „fair use", pretože model dáta „transformuje" a nekopíruje ich priamo. Tvrdili, že je to analogické tomu, ako človek číta knihy v knižnici.

Tento argument vo svete súdov zlyháva.

Žaloba denníka The New York Times

Žaloba denníka The New York Times proti spoločnostiam OpenAI a Microsoft, podaná v decembri 2023, bola prvým výstrelom toho, čo sľubuje byť dlhoročným súdnym sporom. Žaloba preukázala, že ChatGPT dokáže reprodukovať články denníka The New York Times chránené autorským právom takmer doslovne. Ukázala, že model dokáže obísť platené brány tým, že články sumarizoval tak úplne, že používatelia nemali dôvod navštíviť pôvodný zdroj.

Toto nie je „transformácia". Toto je nahradenie trhu. Keď umelá inteligencia dokáže nahradiť funkciu predplatného novín, obhajoba založená na fair use sa zrúti.

Rebélia umelcov

Výtvarní umelci patrili medzi prvých, ktorí rozpoznali hrozbu. Generátory obrázkov trénované na miliardách umeleckých diel dokázali replikovať štýly jednotlivých umelcov s ničivou presnosťou. Výzva ako „v štýle [žijúceho umelca]" mohla vyprodukovať neobmedzené množstvo diel, ktoré priamo konkurovali živobytiu pôvodného tvorcu.

Kolektívne žaloby v mene výtvarných umelcov sa teraz dostávajú na súdy. Umelci však nečakali na právne riešenie. Vyvinuli technické protiopatrenia.

Nástroje ako Glaze a Nightshade pridávajú do obrázkov nepostrehnuteľné perturbácie, ktoré otravujú trénovanie AI. Zoškrabaný obrázok vyzerá pre ľudí normálne, ale spôsobuje degradáciu modelu alebo nepredvídateľné výstupy. Je to digitálna forma nastražovania pascí na obsah a rýchlo sa šíri.

Uzavretie platforiem

Hlavné platformy zatvorili svoje brány pre trénovanie AI. Reddit, ktorý bol jedným z najväčších zdrojov konverzačných tréningových dát, teraz účtuje prohibičné poplatky za prístup k API. Twitter/X úplne zablokoval AI crawlerov predtým, než zmenil kurz a speňažil prístup. Stack Overflow zaviedol prísne podmienky proti trénovaniu AI na svojich programátorských otázkach a odpovediach.

„Otvorený web", na ktorý sa spoločnosti zaoberajúce sa umelou inteligenciou spoliehali, sa stáva mozaikou ohradených záhrad, pričom každá vyberá mýto od akejkoľvek AI, ktorá chce získať prístup.

Steny, ktoré sa dvíhajú proti extrakcii dátPrávne krokyŽaloba NYT proti OpenAISúdny spor Getty ImagesHromadné žaloby autorovTechnická obranaOchrana štýlu typu GlazeOtrava dát NightshadeVodoznaky obsahuUzavretie platforiemPlatené API ReddituObmedzenia Stack OverflowBlokovanie prehľadávačov vydavateľmiPorušená spoločenská zmluvaVyhľadávače posielali návštevnosť. AI motory pohlcujú hodnotu. Táto výmena je porušená.Pre AI spoločnostiRastúca právna zodpovednosťZmenšujúce sa zdroje na trénovaniePre etickú AI (Dweve)Čistý právny statusPrístup k prémiovým zdrojom
Právny protiútok mení starú dohodu „najprv plazenie, potom žiadosť" na hranicu, ktorá si pred tréningom vyžaduje dôkaz.

Dôstojnosť údajov: Iná filozofia

V Dweve si osvojujeme koncept Dôstojnosti údajov, termín, ktorý spopularizoval počítačový vedec Jaron Lanier. Princíp je jednoduchý: ak vaše údaje prispievajú k hodnote systému umelej inteligencie, zaslúžite si podiel na tejto hodnote.

Toto nie je charita. Toto nie je ani etika pre etiku samu. Toto je základ pre udržateľnú ekonomiku umelej inteligencie.

Extrakčný model nikdy nebol ekonomicky udržateľný. Závisel od dočasnej právnej šedej zóny a praktickej neschopnosti miliónov jednotlivých tvorcov presadiť svoje práva. Keďže sa obe podmienky menia, spoločnosti postavené na extrakcii čelia existenčnému riziku.

Model postavený na dôstojnosti naopak vytvára zosúladené stimuly. Tvorcovia sú motivovaní prinášať svoju najlepšiu prácu, pretože sú za ňu odmeňovaní. Spoločnosti umelej inteligencie získavajú prístup ku kvalitnejším údajom, pretože platia za kurátorstvo a overovanie. Používatelia dosahujú lepšie výsledky, pretože tréningové údaje sú kvalitnejšie.

Architektúra Dweve pre dôstojnosť údajov

Náš prístup k dôstojnosti údajov nie je len politické stanovisko. Je zabudovaný priamo do našej technickej architektúry.

Pipeline znalostí Spindle

Dweve Spindle implementuje sedemstupňový epistemologický pipeline, ktorý sleduje každý kus znalosti od pôvodu až po nasadenie:

  1. Kandidát: Surové informácie sú identifikované a označené metadátami o zdroji
  2. Extrahované: Štruktúrované informácie sú extrahované so zachovaným pôvodom
  3. Analyzované: Obsah je rozložený na atómové fakty s overeným licenčným statusom
  4. Prepojené: Fakty sú prepojené do znalostného grafu s reťazcami priradenia
  5. Overené: Viaczdrojová validácia potvrdzuje presnosť a právny status
  6. Certifikované: Kontrola kvality potvrdzuje súlad s požiadavkami dôstojnosti údajov
  7. Kanonické: Overené znalosti sa stávajú pripravenými pre AI s úplným pôvodom

Tento pipeline znamená, že môžeme vysledovať akýkoľvek kus znalosti v našom systéme späť k jeho pôvodnému zdroju. Môžeme dokázať licenčný status. Môžeme identifikovať, ktorí tvorcovia prispeli k akémukoľvek výstupu.

456 súborov obmedzení pre doménových špecialistov

Architektúra Dweve Loom s 456 špecializovanými súbormi obmedzení umožňuje granulárne licencovanie a kompenzáciu. Každý doménový špecialista predstavuje odlišnú doménu znalostí s vlastnými zdrojmi údajov a licenčnými dojednaniami.

Keď špecialista na právnu doménu (nemecké zmluvné právo) spracúva dopyt, presne vieme, ktorí právni vydavatelia a advokátske kancelárie prispeli k tejto schopnosti. Keď špecialista na lekársku doménu (onkológia) poskytuje informácie, môžeme vysledovať späť k lekárskym časopisom, klinickým databázam a výskumným inštitúciám, ktoré poskytli znalosti.

Táto granularita umožňuje sofistikované zdieľanie príjmov. Namiesto vágnych tvrdení o „tréningu na internete" môžeme presne vypočítať, koľko každý zdroj údajov prispel ku každej schopnosti.

Dweve Spindle: Pipeline dôstojnosti dátSedemstupňový epistemologický pipeline1. KandidátSurová informáciaidentifikovaná2. ExtrahovanáŠtruktúrovanás provenienciou3. AnalyzovanáAtómové faktylicencia overená4. PrepojenáZnalostnýgraf prepojený5. OverenáViaczdrojovávalidácia6. CertifikovanáQA dokončená0,7+ spoľahlivosť7. KanonickáPripravená pre AI s plnou provenienciouKaždý fakt vysledovaný k zdroju + stav licencieHierarchia 32 agentov validuje v každej fázeLoom: Granulárne licencovanie456 doménových špecialistov so samostatnými zdrojmi dátPodiel na príjmoch vypočítaný na doménového špecialistuPrispievatelia dát platení proporcionálneMesh: Federatívna suverenitaDáta zostávajú u tvorcovTréning zachovávajúci súkromieSMPC + homomorfné šifrovanie
Spindle robí dátovú dôstojnosť operačnou tým, že spolu nesie pôvod, práva, stav licencie a obmedzenia špecialistov v danej oblasti.

Trhovisko pre spravodlivý obchod s dátami

Budujeme infraštruktúru pre novú dátovú ekonomiku. Predstavte si to ako certifikáciu „Fair Trade" pre tréningové dáta umelej inteligencie.

Pre poskytovateľov dát

Vydavatelia, univerzity, výskumné inštitúcie a doménoví špecialisti môžu registrovať svoj obsah na našej platforme. Stanovia licenčné podmienky. Stanovia cenu. Zachovajú si kontrolu.

Na rozdiel od extrakčného modelu, kde bol ich obsah jednoducho zobratý, sa stávajú aktívnymi účastníkmi ekonomiky umelej inteligencie. Môžu si vybrať, ktoré aplikácie umelej inteligencie môžu používať ich dáta, za akých podmienok a za akú cenu.

Kvalitné dáta si pýtajú prémiové ceny. Akademický vydavateľ s prísne recenzovaným výskumom môže účtovať viac ako obsahová farma s clickbaitom optimalizovaným pre SEO. Trh odmeňuje kvalitu.

Pre vývojárov umelej inteligencie

Spoločnosti, ktoré vyvíjajú aplikácie umelej inteligencie, získavajú prístup k právne čistým tréningovým dátam s zdokumentovaným pôvodom. Regulátorom, poisťovniam a súdom môžu presne preukázať, odkiaľ ich tréningové dáta pochádzajú a že mali právo ich používať.

To eliminuje rastúce právne riziko modelov trénovaných na zoškrabaných dátach. Zároveň to poskytuje prístup k „temnej hmote" vedomostí, rozsiahlym repozitárom vysoko kvalitných informácií, ktoré nikdy neboli dostupné na otvorenom webe: firemné archívy, výskum za paywallom, proprietárne databázy.

Pre koncových používateľov

Používatelia dosahujú lepšie výsledky, pretože umelá inteligencia je trénovaná na kvalitnejších, kurátorských dátach, a nie na šume otvoreného internetu. Získavajú tiež atribúciu, keď náš systém poskytne informácie z licencovaných zdrojov, môžeme tieto zdroje citovať, čo umožňuje overenie a hlbší prieskum.

Trhovisko je miestom, kde sa súhlas, atribúcia, platba a kontrola podnikových rizík stávajú jedným pracovným postupom.

Ekonomika kvality nad kvantitou

Kritici tvrdia, že platenie za dáta robí vývoj umelej inteligencie ekonomicky neživotaschopným. Tvrdia, že na trénovanie schopných modelov potrebujete „celý internet".

To odráža zastarané myslenie z éry „veľkých dát" okolo roku 2020. Nedávny výskum presvedčivo ukázal, že kvalita dát je oveľa dôležitejšia ako ich množstvo.

Zamyslite sa nad matematikou. Na trénovanie GPT-3 bolo potrebných približne 45 terabajtov komprimovaného textu. Väčšina z toho bol nekvalitný webový scraping: sekcie komentárov, spam, zastarané informácie, faktické chyby a úplný nezmysel.

Model trénovaný na 500 gigabajtoch kurátorského, vysoko kvalitného učebnicového a akademického obsahu môže dosiahnuť alebo prekonať výkon modelov trénovaných na 100-násobne väčšom množstve dát. Pomer signálu k šumu kurátorských dát je jednoducho o toľko vyšší.

Platením za dáta získavame prístup k obsahu, ktorý nebol nikdy dostupný scraperom: lekárska literatúra za vydavateľskými paywallmi, finančný výskum v proprietárnych databázach, priemyselné znalosti vo firemných archívoch. Táto „temná hmota" je čistejšia, hustejšia a hodnotnejšia ako čokoľvek na otvorenom webe.

Ekonomika v skutočnosti nahráva modelu dôstojnosti. Platíme viac za bajt, ale potrebujeme oveľa menej bajtov. Získavame prístup k prémiovým zdrojom, ktoré scrapery nikdy nedosiahnu. A eliminujeme právnu zodpovednosť, ktorá dnes ohrozuje spoločnosti založené na extrakcii miliardovými potenciálnymi škodami.

Kvalita nad kvantitou: Nová ekonomika dátModel extrakcie45+ TB scrapovania webu90%+ nekvalitného šumuRastúca právna zodpovednosťModel dôstojnosti dát~500 GB kurátorského obsahu95%+ vysokokvalitného signáluČistý právny statusVýhoda temnej hmotyLicencované dáta poskytujú prístup k prémiovým zdrojom, ktoré scrapery nikdy nedosiahnuLekárske časopisyRecenzovaný výskumFinančné dátaProprietárne databázyPriemyselné znalostiPodnikové archívy

Podnikový imperatív

Pre podnikových zákazníkov nie je dôstojnosť dát voliteľná. Je to požiadavka riadenia rizík.

Veľké organizácie čelia obrovskému riziku zodpovednosti v súvislosti so systémami umelej inteligencie trénovanými na sporných dátach. Marketingové oddelenie používajúce generátor obrázkov trénovaný na skopírovaných umeleckých dielach čelí možným nárokom z porušenia autorských práv. Právne oddelenie používajúce jazykový model trénovaný na platenom obsahu čelí riziku porušenia duševného vlastníctva. Zdravotnícka organizácia používajúca model, ktorý nedokáže preukázať pôvod svojich tréningových dát, čelí regulačnému riziku.

Súdne spory prichádzajú. Getty Images zažaloval Stability AI. The New York Times zažaloval OpenAI. Autorské cechy organizujú skupinové žaloby. Potenciálne škody sa pohybujú v miliardách.

Organizácie používajúce systémy Dweve môžu presne preukázať, odkiaľ pochádzajú naše tréningové dáta a že sme na všetky z nich mali riadne licencie. Tento čistý pôvod dát má oveľa väčšiu hodnotu než akýkoľvek okrajový nárast schopností zo skopírovaných dát.

Atribúcia a vedomostná ekonomika

Okrem kompenzácie si dôstojnosť dát vyžaduje atribúciu. Keď naše systémy poskytujú informácie odvodené z licencovaných zdrojov, citujeme tieto zdroje.

To vytvára pozitívny cyklus. Používatelia si môžu overiť informácie kontrolou pôvodných zdrojov. Môžu skúmať témy hlbšie sledovaním citácií. Návštevnosť prúdi späť k tvorcom obsahu, čím sa obnovuje narušená spoločenská zmluva webu.

Pre našich 456 doménových špecialistov v Dweve Loom má každý kus vedomostí reťazec pôvodu. Keď špecialista na lekársku doménu poskytne informácie o zriedkavom ochorení, vieme ukázať, ktoré články z lekárskych časopisov ovplyvnili túto odpoveď. Keď špecialista na právnu doménu vysvetľuje regulačnú požiadavku, vieme citovať zákonné zdroje.

Toto nie je len dobrá etika. Je to dobrý dizajn produktu. Používatelia viac dôverujú systémom, keď si môžu overiť tvrdenia. Podniky uprednostňujú systémy, ktoré vedia preukázať svoje uvažovanie. Atribúcia buduje dôveru.

Budúcnosť, ktorú budujeme

Éra extrakcie sa končí. To, čo príde ďalej, sa určuje práve teraz.

Jedna cesta vedie k otrávenému spoločnému priestoru. Tvorcovia prijímajú čoraz agresívnejšie ochranné opatrenia. Kvalita tréningových dát klesá. Vývoj umelej inteligencie sa zastavuje alebo sa stáva doménou niekoľkých spoločností s výhodou starých dát.

Druhá cesta vedie k udržateľnej vedomostnej ekonomike. Tvorcovia sú odmeňovaní za svoje príspevky. Kvalitné dáta sú dostupné tým, ktorí sú ochotní za ne spravodlivo zaplatiť. Vývoj umelej inteligencie pokračuje so širokou účasťou a rozloženými výhodami.

V Dweve budujeme infraštruktúru pre druhú cestu. Naše 96 % zníženie spotreby energie dokazuje, že efektívna umelá inteligencia je možná. Naša 100 % vysvetliteľnosť dokazuje, že transparentná umelá inteligencia je dosiahnuteľná. Naša architektúra dôstojnosti dát dokazuje, že etická umelá inteligencia je praktická.

Veríme, že zaobchádzať s tvorcami dát s dôstojnosťou nie je len morálne správne. Je to ekonomicky výhodnejšie. Vytvára to lepšiu umelú inteligenciu trénovanú na lepších dátach, s čistejším právnym statusom a udržateľnou ekonomikou.

Obedy zadarmo sa skončili. Otázkou je, čo príde ďalej. Budujeme alternatívu.

Ste pripravení budovať umelú inteligenciu na základe dôstojnosti dát? Trhovisko Dweve s férovým obchodom s dátami poskytuje právnu istotu, kvalitnejšie tréningové dáta a udržateľnú ekonomiku. Kontaktujte nás a zistite, ako sa dôstojnosť dát môže stať vašou konkurenčnou výhodou.

Udržateľná cesta je zotrvačník: kvalitné zdroje sú platené, pôvod dát sa prenáša, riziko kupujúceho klesá a lepšie dáta sa neustále vytvárajú.