Důstojnost dat: Konec bezplatného oběda v tréninku AI
Největší loupež v dějinách
Nazvěme první fázi generativní umělé inteligence tím, čím skutečně byla: největším aktem vyvlastnění hodnot v dějinách lidstva.
Mezi lety 2018 a 2024 nasadilo několik společností ze Silicon Valley armády webových prohledávačů napříč celým internetem. Tyto prohledávače pohltily vše: každou digitalizovanou knihu, každý publikovaný článek, každou nahranou fotografii, každý příspěvek na fóru, každý řádek kódu sdílený na GitHubu, každý text písně, každou disertační práci, každý milostný dopis zveřejněný na osobním blogu.
Učinily tak bez žádosti o svolení. Učinily tak bez poskytnutí jakékoli kompenzace. Učinily tak, aniž by dokonce uvedly zdroj.
Poté vzaly všechnu tuto vytěženou hodnotu, stlačily ji do matematických vah a vybudovaly proprietární produkty, které prodávaly za stovky miliard dolarů. Lidé, kteří hodnotu vytvořili, nedostali nic. Společnosti, které ji vytěžily, se staly nejhodnotnějšími podniky na planetě.
Toto nebyla inovace. Toto byla industrializovaná arbitráž autorských práv v bezprecedentním měřítku.
Oběd zdarma ale končí. Tvůrci se brání. A právní, etické a ekonomické základy těžebního modelu se hroutí.
The Legal Walls Rising
Právní základy modelu extrakce byly vždy sporné. Společnosti zabývající se umělou inteligencí argumentovaly, že trénování na materiálech chráněných autorským právem představuje „fair use", protože model data „transformuje", nikoli je přímo kopíruje. Tvrdily, že je to obdobné tomu, jako když člověk čte knihy v knihovně.
Tento argument ve světových soudech selhává.
Žaloba deníku The New York Times
Žaloba deníku The New York Times proti společnostem OpenAI a Microsoft, podaná v prosinci 2023, byla úvodním výstřelem toho, co slibuje být léta trvajícím soudním sporem. Žaloba prokázala, že ChatGPT dokáže reprodukovat články deníku The New York Times chráněné autorským právem téměř doslovně. Ukázala, že model dokáže obejít paywally tím, že články shrne tak úplně, že uživatelé nemají důvod navštívit původní zdroj.
Toto není „transformace". Toto je nahrazení trhu. Když umělá inteligence dokáže nahradit funkci předplatného novin, obrana fair use se hroutí.
Vzpoura umělců
Výtvarní umělci patřili mezi první, kdo hrozbu rozpoznali. Generátory obrázků trénované na miliardách uměleckých děl dokázaly replikovat styl jednotlivých umělců se zničující přesností. Výzva jako „ve stylu [žijícího umělce]" mohla vytvořit neomezené množství děl, která přímo konkurovala živobytí původního tvůrce.
Kolektivní žaloby jménem výtvarných umělců nyní procházejí soudy. Umělci ale nečekali na právní řešení. Vyvinuli technická protiopatření.
Nástroje jako Glaze a Nightshade přidávají do obrázků nepostřehnutelné poruchy, které otravují trénování umělé inteligence. Seškrábaný obrázek vypadá pro lidi normálně, ale způsobuje degradaci modelu nebo nepředvídatelné výstupy. Je to digitální forma nastražení pasti na obsah a rychle se šíří.
Uzavření platforem
Hlavní platformy zavřely své brány trénování umělé inteligence. Reddit, který byl jedním z největších zdrojů konverzačních trénovacích dat, nyní účtuje prohibitivní poplatky za přístup k API. Twitter/X zcela zablokoval AI prohledávače, než změnil kurz a zpoplatnil přístup. Stack Overflow zavedl přísné podmínky proti trénování umělé inteligence na svých programátorských otázkách a odpovědích.
„Otevřený web", na který se společnosti zabývající se umělou inteligencí spoléhaly, se stává mozaikou ohrazených zahrad, z nichž každá vybírá mýtné od každé umělé inteligence, která chce přístup.
Datová důstojnost: jiná filozofie
Ve společnosti Dweve přijímáme koncept datové důstojnosti, termín, který zpopularizoval počítačový vědec Jaron Lanier. Princip je jednoduchý: pokud vaše data přispívají k hodnotě systému umělé inteligence, zasloužíte si podíl na této hodnotě.
Toto není charita. Není to ani etika kvůli etice samotné. Je to základ pro udržitelnou ekonomiku umělé inteligence.
Model těžby dat nebyl nikdy ekonomicky udržitelný. Spoléhal na dočasnou právní šedou zónu a na praktickou neschopnost milionů jednotlivých tvůrců vymáhat svá práva. Jakmile se obě tyto podmínky změní, společnosti postavené na těžbě dat čelí existenčnímu riziku.
Model založený na důstojnosti naopak vytváří sladěné pobídky. Tvůrci jsou motivováni přispívat svým nejlepším dílem, protože za něj dostávají zaplaceno. Společnosti zabývající se umělou inteligencí získávají přístup ke kvalitnějším datům, protože platí za kurátorství a ověřování. Uživatelé dostávají lepší výsledky, protože trénovací data jsou kvalitnější.
Architektura datové důstojnosti ve společnosti Dweve
Náš přístup k datové důstojnosti není jen politické prohlášení. Je zabudován do naší technické architektury.
Pipeline znalostí Spindle
Dweve Spindle implementuje sedmistupňovou epistemologickou pipeline, která sleduje každý kus znalosti od původu až po nasazení:
- Kandidát: Surová informace je identifikována a označena metadaty o zdroji
- Extrahováno: Strukturovaná informace je extrahována při zachování původu
- Analyzováno: Obsah je rozložen na atomická fakta s ověřeným licenčním statusem
- Propojeno: Fakta jsou propojena do znalostního grafu s řetězci přiřazení
- Ověřeno: Validace z více zdrojů potvrzuje přesnost a právní status
- Certifikováno: Kontrola kvality potvrzuje soulad s požadavky datové důstojnosti
- Kanonické: Ověřená znalost se stává připravenou pro umělou inteligenci s plným původem
Tato pipeline znamená, že můžeme vysledovat jakýkoli kus znalosti v našem systému zpět k jeho původnímu zdroji. Můžeme prokázat licenční status. Můžeme identifikovat, kteří tvůrci přispěli k jakémukoli danému výstupu.
456 sad omezení pro doménové specialisty
Architektura Dweve Loom se 456 specializovanými sadami omezení umožňuje granulární licencování a kompenzaci. Každý doménový specialista představuje odlišnou doménu znalostí s vlastními datovými zdroji a licenčními ujednáními.
Když specialista pro právní doménu (německé smluvní právo) zpracovává dotaz, víme přesně, kteří právní vydavatelé a advokátní kanceláře přispěli k této schopnosti. Když specialista pro lékařskou doménu (onkologie) poskytuje informace, můžeme se vrátit k lékařským časopisům, klinickým databázím a výzkumným institucím, které znalosti poskytly.
Tato granularita umožňuje sofistikované sdílení příjmů. Namísto vágních tvrzení o „trénování na internetu" můžeme přesně vypočítat, kolik každý datový zdroj přispěl ke každé schopnosti.
Tržiště pro data s certifikací Fair Trade
Budujeme infrastrukturu pro novou datovou ekonomiku. Představte si to jako certifikaci „Fair Trade" pro trénovací data umělé inteligence.
Pro poskytovatele dat
Vydavatelé, univerzity, výzkumné instituce a odborníci na danou oblast mohou na naší platformě registrovat svůj obsah. Stanoví licenční podmínky. Stanoví cenu. Zachovají si kontrolu.
Na rozdíl od modelu extrakce, kdy byl jejich obsah jednoduše odebrán, se stávají aktivními účastníky ekonomiky umělé inteligence. Mohou si zvolit, které aplikace umělé inteligence mohou jejich data používat, za jakých podmínek a za jakou cenu.
Kvalitní data dosahují prémiových cen. Akademický vydavatel s přísně recenzovaným výzkumem si může účtovat více než obsahová farma s clickbaitem optimalizovaným pro SEO. Trh odměňuje kvalitu.
Pro vývojáře umělé inteligence
Společnosti vyvíjející aplikace umělé inteligence získávají přístup k právně nezávadným trénovacím datům s doloženým původem. Mohou regulačním orgánům, pojišťovnám a soudům přesně prokázat, odkud jejich trénovací data pocházejí a že je měli právo používat.
To eliminuje rostoucí právní riziko modelů trénovaných na seškrabovaných datech. Zároveň to poskytuje přístup k „temné hmotě" znalostí, rozsáhlým úložištím vysoce kvalitních informací, která nikdy nebyla dostupná na otevřeném webu: firemní archivy, placený výzkum, proprietární databáze.
Pro koncové uživatele
Uživatelé dosahují lepších výsledků, protože umělá inteligence je trénována na kvalitnějších a kurátorovaných datech spíše než na šumu otevřeného internetu. Získávají také atribuci, když náš systém poskytuje informace z licencovaných zdrojů, můžeme tyto zdroje citovat, což umožňuje ověření a hlubší průzkum.
Ekonomika kvality nad kvantitou
Kritici tvrdí, že placení za data činí vývoj umělé inteligence ekonomicky neudržitelným. Prohlašují, že k trénování schopných modelů potřebujete „celý internet".
To odráží zastaralé myšlení z éry „velkých dat" kolem roku 2020. Nedávný výzkum přesvědčivě prokázal, že kvalita dat je mnohem důležitější než jejich množství.
Zvažte matematiku. Trénování GPT-3 vyžadovalo přibližně 45 terabajtů komprimovaného textu. Většinu tvořil nekvalitní webový scraping: sekce komentářů, spam, zastaralé informace, faktické chyby a naprostý nesmysl.
Model trénovaný na 500 gigabajtech kurátorovaného, vysoce kvalitního učebnicového a akademického obsahu může dosáhnout výkonu srovnatelného s modely trénovanými na 100krát větším objemu dat nebo je dokonce překonat. Poměr signálu k šumu u kurátorovaných dat je prostě mnohem vyšší.
Placením za data získáváme přístup k obsahu, který byl pro scrapery nikdy nedostupný: lékařská literatura za vydavatelskými paywally, finanční výzkum v proprietárních databázích, průmyslové znalosti ve firemních archivech. Tato „temná hmota" je čistší, hustší a hodnotnější než cokoli na otevřeném webu.
Ekonomika ve skutečnosti model důstojnosti zvýhodňuje. Platíme více za bajt, ale potřebujeme výrazně méně bajtů. Získáme přístup k prémiovým zdrojům, ke kterým se scrapery nikdy nedostanou. A eliminujeme právní odpovědnost, která dnes firmám založeným na extrakci hrozí škodami v miliardách.
Podnikový imperativ
Pro podnikové zákazníky není důstojnost dat volitelná. Je to požadavek řízení rizik.
Velké organizace čelí obrovskému riziku odpovědnosti kvůli systémům umělé inteligence trénovaným na sporných datech. Marketingové oddělení používající generátor obrázků trénovaný na zkopírovaných uměleckých dílech čelí potenciálním nárokům z porušení autorských práv. Právní oddělení používající jazykový model trénovaný na obsahu za paywallem čelí riziku porušení duševního vlastnictví. Zdravotnická organizace používající model, který nemůže prokázat původ svých trénovacích dat, čelí regulačnímu riziku.
Žaloby se blíží. Getty Images zažaloval Stability AI. The New York Times zažaloval OpenAI. Sdružení autorů organizují skupinové žaloby. Potenciální škody se pohybují v miliardách.
Organizace používající systémy Dweve mohou prokázat přesně to, odkud naše trénovací data pocházejí, a že jsme na všechna měli řádné licence. Tento čistý původ má hodnotu daleko vyšší než jakýkoli okrajový nárůst schopností díky zkopírovaným datům.
Přisuzování a znalostní ekonomika
Kromě kompenzace vyžaduje důstojnost dat také přisuzování. Když naše systémy poskytují informace odvozené z licencovaných zdrojů, tyto zdroje citujeme.
To vytváří ctnostný kruh. Uživatelé si mohou informace ověřit kontrolou původních zdrojů. Mohou zkoumat témata hlouběji sledováním citací. Provoz proudí zpět k tvůrcům obsahu, čímž se obnovuje narušená společenská smlouva webu.
Pro našich 456 sad doménových omezení v Dweve Loom má každý kus znalostí řetězec původu. Když specialista na lékařskou doménu poskytne informace o vzácném onemocnění, můžeme ukázat, které články z lékařských časopisů tuto odpověď ovlivnily. Když specialista na právní doménu vysvětluje regulační požadavek, můžeme citovat zákonné zdroje.
Toto není jen dobrá etika. Je to dobrý návrh produktu. Uživatelé více důvěřují systémům, když si mohou ověřit tvrzení. Podniky preferují systémy, které dokážou prokázat své uvažování. Přisuzování buduje důvěru.
Budoucnost, kterou budujeme
Éra extrakce končí. To, co přijde dál, se určuje právě teď.
Jedna cesta vede k otrávenému sdílenému prostoru. Tvůrci přijímají stále agresivnější ochranná opatření. Kvalita trénovacích dat se zhoršuje. Vývoj umělé inteligence se zastaví nebo se stane doménou několika společností s dědictvím datových výhod.
Druhá cesta vede k udržitelné znalostní ekonomice. Tvůrci jsou odměňováni za své příspěvky. Kvalitní data jsou dostupná těm, kteří jsou ochotni za ně spravedlivě zaplatit. Vývoj umělé inteligence pokračuje s širokou účastí a rozloženými přínosy.
Ve společnosti Dweve budujeme infrastrukturu pro druhou cestu. Naše 96% snížení spotřeby energie dokazuje, že efektivní umělá inteligence je možná. Naše 100% vysvětlitelnost dokazuje, že transparentní umělá inteligence je dosažitelná. Naše architektura důstojnosti dat dokazuje, že etická umělá inteligence je praktická.
Věříme, že zacházet s tvůrci dat s důstojností není jen morálně správné. Je to ekonomicky výhodnější. Vytváří to lepší umělou inteligenci trénovanou na lepších datech, s čistším právním statusem a udržitelnou ekonomikou.
Oběd zdarma skončil. Otázkou je, co přijde dál. Budujeme alternativu.
Jste připraveni budovat umělou inteligenci na základě důstojnosti dat? Tržiště Dweve pro spravedlivý obchod s daty poskytuje právní jistotu, kvalitnější trénovací data a udržitelnou ekonomiku. Kontaktujte nás a zjistěte, jak se důstojnost dat může stát vaší konkurenční výhodou.