Andmete väärikus: tasuta lõuna lõpp AI-koolituses

Dweve turumudel tasustab andmeloojaid õiglaselt.

Andmete väärikus: tasuta lõuna lõpp AI-koolituses

The Greatest Heist in History

Let us call the first phase of generative AI what it truly was: the largest act of value extraction in human history.

Between 2018 and 2024, a handful of companies in Silicon Valley deployed armies of web crawlers across the entire internet. These crawlers consumed everything: every book ever digitized, every article ever published, every photograph ever uploaded, every forum post ever written, every line of code ever shared on GitHub, every song lyric, every doctoral thesis, every love letter posted on a personal blog.

They did this without asking permission. They did this without providing compensation. They did this without even acknowledging the source.

Then they took all of this extracted value, compressed it into mathematical weights, and built proprietary products that they sold for hundreds of billions of dollars. The people who created the value received nothing. The companies that extracted it became the most valuable enterprises on the planet.

This was not innovation. This was industrialized copyright arbitrage at unprecedented scale.

But the free lunch is ending. The creators are fighting back. And the legal, ethical, and economic foundations of the extraction model are crumbling.

Suur väärtuse ülekanne: väljavõte vs. väärikusVäljavõtte mudel (2018-2024)Kogu internet läbi kraabitudIlma loataRaamatud, artiklid, kood, kunstIlma autorinimetaLoominguline ja intellektuaalne tööIlma tasutaTulemus:2+ triljonit dollarittehisintellekti ettevõtete turuväärtuses0 dollarit sisuloojateleAndmeväärikuse mudel (Dweve)Kureeritud teadmiste allikadSelgesõnaline litsentsEkspertvaldkonnad jälgitudTäielik päritoluahelKasutus mõõdetud päringu kaupaTulude jagamine jaotatudTulemus:Jätkusuutlik ökosüsteemLoojatel on stiimul panustadaKõrgema kvaliteediga teadmised

Kerkivad õiguslikud müürid

The legal foundations of the extraction model were always questionable. AI companies argued that training on copyrighted material constituted "fair use" because the model "transforms" the data rather than copying it directly. They claimed this was analogous to a human reading books in a library.

This argument is failing in courts worldwide.

The New York Times Lawsuit

The New York Times lawsuit against OpenAI and Microsoft, filed in December 2023, was the opening salvo of what promises to be years of litigation. The lawsuit demonstrated that ChatGPT could reproduce copyrighted Times articles nearly verbatim. It showed that the model could bypass paywalls by summarizing articles so completely that users had no reason to visit the original source.

This is not "transformation." This is market substitution. When an AI can replace the function of a newspaper subscription, the fair use defense collapses.

The Artist Rebellion

Visual artists were among the first to recognize the threat. Image generators trained on billions of artworks could replicate individual artists' styles with devastating precision. A prompt like "in the style of [living artist]" could produce unlimited works that competed directly with the original creator's livelihood.

Class action lawsuits on behalf of visual artists are now working through the courts. But artists didn't wait for legal resolution. They developed technical countermeasures.

Tools like Glaze and Nightshade add imperceptible perturbations to images that poison AI training. A scraped image appears normal to humans but causes model degradation or unpredictable outputs. It's a digital form of booby-trapping content, and it's spreading rapidly.

The Platform Lockdown

Major platforms have closed their doors to AI training. Reddit, which was one of the largest sources of conversational training data, now charges prohibitive fees for API access. Twitter/X blocked AI crawlers entirely before reversing course and monetizing access. Stack Overflow implemented strict terms against AI training on their programming Q&A.

The "open web" that AI companies relied upon is becoming a patchwork of walled gardens, each extracting tolls from any AI that wants access.

Andmekaevanduse vastu kerkivad müüridÕiguslikud meetmedNYT vs OpenAI kohtuasiGetty Images'i kohtuvaidlusAutorite kollektiivhagiTehniline kaitseGlaze stiilikaitseNightshade andmemürgitusSisu vesimärgistaminePlatvormide sulgemineRedditi API tasuline kasutusStack Overflow piirangudKirjastajate roomaja blokeeringudMurdunud sotsiaalne lepingOtsingumootorid saatsid liiklust. AI-mootorid neelavad väärtust. Vahetus on katkenud.AI-ettevõteteleKasvav õiguslik vastutusKahanavad koolitusallikadEetilisele AI-le (Dweve)Puhas õiguslik staatusJuurdepääs tipptasemel allikatele
Õiguslik vasturünnak muudab vana rooma-ennast-üleandmise tehingu piiriks, mis nõuab enne treenimist tõendit.

Andmeväärikus: teistsugune filosoofia

Dweve'is hõlmame andmeväärikuse kontseptsiooni, termini, mille populariseeris arvutiteadlane Jaron Lanier. Põhimõte on lihtne: kui teie andmed aitavad kaasa AI-süsteemi väärtusele, väärite te osa sellest väärtusest.

See ei ole heategevus. See ei ole isegi eetika iseenesest. See on jätkusuutliku AI-majanduse alus.

Ekstraheerimismudel ei olnud kunagi majanduslikult jätkusuutlik. See sõltus ajutisest õiguslikust hallist tsoonist ja miljonite üksikute loojate praktilisest suutmatusest oma õigusi jõustada. Kui mõlemad tingimused muutuvad, seisavad ekstraheerimisele ehitatud ettevõtted silmitsi eksistentsiaalse riskiga.

Väärikusele ehitatud mudel loob seevastu ühtlustatud stiimulid. Loojad on motiveeritud oma parimat tööd panustama, sest neile selle eest makstakse. AI-ettevõtted saavad juurdepääsu kvaliteetsematele andmetele, sest nad maksavad kureerimise ja kontrollimise eest. Kasutajad saavad paremaid tulemusi, sest treeningandmed on paremad.

Dweve'i arhitektuur andmeväärikuseks

Meie lähenemine andmeväärikusele ei ole ainult poliitiline seisukoht. See on ehitatud meie tehnilisse arhitektuuri.

Spindle'i teadmiste torustik

Dweve Spindle rakendab seitsmeetapilist epistemoloogilist torustikku, mis jälgib iga teadmistükki päritolust kasutuselevõtuni:

  1. Kandidaat: Toorinfo tuvastatakse ja märgistatakse allika metaandmetega
  2. Ekstraheeritud: Struktureeritud info ekstraheeritakse, säilitades päritolu
  3. Analüüsitud: Sisu jaotatakse aatomilisteks faktideks, kusjuures litsentsi staatus on kontrollitud
  4. Ühendatud: Faktid seotakse teadmiste graafiga omistamisahelatega
  5. Kontrollitud: Mitme allika valideerimine kinnitab täpsuse ja õigusliku staatuse
  6. Sertifitseeritud: Kvaliteedikontroll kinnitab vastavust andmeväärikuse nõuetele
  7. Kanooniline: Kontrollitud teadmus muutub AI-valmis täieliku päritoluga

See torustik tähendab, et saame jälgida iga teadmistükki oma süsteemis tagasi selle algallikani. Saame tõendada litsentsi staatust. Saame tuvastada, millised loojad aitasid kaasa mis tahes antud väljundile.

456 valdkonnaspetsialisti piirangukomplekti

Dweve Loomi arhitektuur, mis koosneb 456 spetsialiseeritud piirangukomplektist, võimaldab granulaarset litsentsimist ja hüvitamist. Iga valdkonnaspetsialist esindab eraldiseisvat teadmiste valdkonda oma andmeallikate ja litsentsikorraldustega.

Kui õigusvaldkonna spetsialist (Saksa lepinguõigus) töötleb päringut, teame täpselt, millised õigusväljaandjad ja advokaadibürood aitasid kaasa selle võimekuse loomisele. Kui meditsiinivaldkonna spetsialist (onkoloogia) annab teavet, saame jälgida tagasi meditsiiniajakirjade, kliiniliste andmebaaside ja teadusasutusteni, mis teadmuse andsid.

See granulaarsus võimaldab keerukat tulude jagamist. Selle asemel, et rääkida ebamääraselt "internetist treenimisest", saame täpselt välja arvutada, kui palju iga andmeallikas aitas kaasa iga võimekuse loomisele.

Dweve Spindle: Andmete väärikuse torustikSeitsmeastmeline epistemoloogiline torustik1. KandidaatToorinfotuvastatud2. EraldatudStruktureeritudpäritoluga3. AnalüüsitudAatomifaktidlitsents kontrollitud4. ÜhendatudTeadmusgraaflingitud5. KontrollitudMitmeallikalinevalideerimine6. SertifitseeritudQA lõpetatud0.7+ usaldusväärsus7. KanoonilineAI-valmis täieliku päritolugaIga fakt jälgitav allikani + litsentsi staatus32-agendi hierarhia valideerib igal etapilLoom: Granulaarne litsentsimine456 valdkonnaspetsialisti eraldi andmeallikategaTulude jagamine arvutatud valdkonnaspetsialisti kohtaAndmete esitajatele makstakse proportsionaalseltMesh: Föderatiivne suveräänsusAndmed jäävad loojate juurdePrivaatsust säilitav treenimineSMPC + homomorfne krüpteerimine
Spindle muudab andmeväärikuse toimivaks, kandes koos päritolu, õigused, litsentsi staatuse ja valdkonnaekspertide piirangud.

Õiglase kaubanduse andmeturg

Me ehitame taristut uuele andmemajandusele. Mõelge sellest kui "õiglase kaubanduse" sertifikaadist AI treeningandmetele.

Andmepakkujatele

Kirjastajad, ülikoolid, teadusasutused ja valdkonnaeksperdid saavad oma sisu meie platvormil registreerida. Nemad määravad litsentsitingimused. Nemad määravad hinna. Nemad säilitavad kontrolli.

Erinevalt kaevandamismudelist, kus nende sisu lihtsalt võeti, saavad nad AI-majanduse aktiivseteks osalisteks. Nad saavad valida, millised AI-rakendused nende andmeid kasutada võivad, millistel tingimustel ja mis hinnaga.

Kvaliteetsed andmed nõuavad kõrgeid hindu. Akadeemiline kirjastaja, kellel on rangelt eelretsenseeritud teadustööd, saab küsida rohkem kui sisufarm, mis toodab SEO-optimeeritud klikisööta. Turg premeerib kvaliteeti.

AI-arendajatele

Ettevõtted, kes AI-rakendusi ehitavad, saavad juurdepääsu õiguslikult selgetele treeningandmetele, millel on dokumenteeritud päritolu. Nad saavad regulaatoritele, kindlustusandjatele ja kohtutele tõestada, kust nende treeningandmed täpselt pärinevad ja et neil oli õigus neid kasutada.

See kaotab kasvava õigusliku riski, mis kaasneb kraabitud andmetel treenitud mudelitega. See annab ka juurdepääsu teadmiste "tumeainele", tohututele kvaliteetse teabe hoidlatele, mis polnud kunagi avatud veebis kättesaadavad: ettevõtete arhiivid, tasulise juurdepääsuga teadustööd, patenteeritud andmebaasid.

Lõppkasutajatele

Kasutajad saavad paremaid tulemusi, sest AI on treenitud kvaliteetsemate ja kureeritud andmetega, mitte avatud interneti müraga. Nad saavad ka viiteid, kui meie süsteem annab teavet litsentseeritud allikatest, saame me neid allikaid tsiteerida, võimaldades kontrollimist ja sügavamat uurimist.

Turg on koht, kus nõusolek, viitamine, makse ja ettevõtte riskikontroll saavad üheks töövoog.

Kvaliteedi majandus versus kvantiteet

Kriitikud väidavad, et andmete eest maksmine muudab AI-arenduse majanduslikult jätkusuutmatuks. Nad väidavad, et vajate "kogu internetti", et treenida võimekaid mudeleid.

See peegeldab vananenud mõtlemist 2020. aastate "suurandmete" ajastust. Hiljutised uuringud on veenvalt näidanud, et andmete kvaliteet on palju olulisem kui andmete hulk.

Mõelge matemaatikale. GPT-3 treenimine nõudis ligikaudu 45 terabaiti tihendatud teksti. Enamik sellest oli madala kvaliteediga veebikraabimine: kommentaariumid, rämpspost, vananenud teave, faktivead ja puhas mõttetus.

Mudel, mis on treenitud 500 gigabaidil kureeritud, kvaliteetsel õpiku- ja akadeemilisel sisul, suudab saavutada või ületada mudelite jõudlust, mis on treenitud 100 korda rohkem andmetel. Kureeritud andmete signaali-müra suhe on lihtsalt nii palju kõrgem.

Andmete eest makstes saame juurdepääsu sisule, mis polnud kunagi kraapijatele kättesaadav: meditsiinikirjandus kirjastajate tasuliste seinte taga, finantsuuringud patenteeritud andmebaasides, tööstuslikud teadmised ettevõtete arhiivides. See "tumeaine" on puhtam, tihedam ja väärtuslikum kui ükski avatud veebi sisu.

Majanduslikult on väärikuse mudel tegelikult soodsam. Maksame baidi kohta rohkem, kuid vajame oluliselt vähem baite. Pääseme ligi tipptasemel allikatele, milleni kraapijad kunagi ei jõua. Ning välistame juriidilise vastutuse, mis ähvardab praegu ekstraktsioonipõhiseid ettevõtteid miljardite suuruste kahjunõuetega.

Kvaliteet üle kvantiteedi: andmemajanduse uus loogikaEkstraktsioonimudel45+ TB veebikraapimist90%+ madala kvaliteediga müraKasvav juriidiline vastutusAndmeväärikuse mudel~500 GB kureeritud sisu95%+ kvaliteetne signaalPuhas juriidiline staatusTumeda aine eelisLitsentseeritud andmed avavad juurdepääsu tippallikatele, milleni kraapijad kunagi ei jõuaMeditsiiniajakirjadEelretsenseeritud teadusuuringudFinantsandmedKinnised andmebaasidTööstuslikud teadmisedEttevõtete arhiivid

Ettevõtete hädavajadus

Ettevõtluskliendi jaoks pole andmeväärikus vabatahtlik. See on riskijuhtimise nõue.

Suured organisatsioonid seisavad silmitsi tohutu vastutusriskiga, kui nende AI-süsteemid on treenitud kahtlase kvaliteediga andmetel. Turundusosakond, mis kasutab piltide generaatorit, mis on treenitud kogutud kunstiteostel, võib sattuda autoriõiguse rikkumise nõuete alla. Õigusosakond, mis kasutab keelemudelit, mis on treenitud tasulisele sisule, puutub kokku intellektuaalomandi riskidega. Tervishoiuorganisatsioon, mis kasutab mudelit, mis ei suuda tõendada oma treeningandmete päritolu, seisab silmitsi regulatiivsete riskidega.

Kohtuvaidlused on tulemas. Getty Images kaebas Stability AI kohtusse. The New York Times kaebas OpenAI kohtusse. Autorite ühendused korraldavad kollektiivseid hagisid. Võimalikud kahjunõuded ulatuvad miljarditesse.

Organisatsioonid, kes kasutavad Dweve süsteeme, saavad täpselt näidata, kust meie treeningandmed pärinevad ja et meil olid kõigi nende jaoks nõuetekohased litsentsid. See puhas päritolu on väärt palju rohkem kui igasugune marginaalne võimekuse kasv, mida kogutud andmed annavad.

Autorlus ja teadmiste majandus

Lisaks hüvitamisele nõuab andmeväärikus autorluse märkimist. Kui meie süsteemid pakuvad teavet, mis on tuletatud litsentsitud allikatest, viitame me nendele allikatele.

See loob voorusliku ringi. Kasutajad saavad teavet kontrollida, vaadates algallikaid. Nad saavad teemadesse süvitsi minna, järgides viiteid. Liiklus voolab tagasi sisuloojate juurde, taastades veebi purunenud sotsiaalse lepingu.

Meie 456 valdkonnaspetsiifilise piirangukomplekti puhul Dweve Loomis on igal teadmisel päritoluahel. Kui meditsiinivaldkonna spetsialist annab teavet haruldase haiguse kohta, saame näidata, millised meditsiiniajakirjade artiklid seda vastust mõjutasid. Kui õigusvaldkonna spetsialist selgitab regulatiivset nõuet, saame viidata seaduslikele allikatele.

See pole ainult hea eetika. See on hea tootedisain. Kasutajad usaldavad süsteeme rohkem, kui nad saavad väiteid kontrollida. Ettevõtted eelistavad süsteeme, mis suudavad oma arutluskäiku näidata. Autorluse märkimine loob usaldust.

Tulevik, mida me ehitame

Ekstraheerimise ajastu lõpeb. See, mis edasi tuleb, otsustatakse praegu.

Üks tee viib mürgitatud ühisvarani. Loojad võtavad kasutusele üha agressiivsemad kaitsemeetmed. Treeningandmete kvaliteet halveneb. AI areng peatub või muutub mõne ettevõtte eesõiguseks, kellel on pärandandmete eelis.

Teine tee viib jätkusuutliku teadmiste majanduseni. Loojad saavad oma panuse eest hüvitist. Kvaliteetsed andmed on kättesaadavad neile, kes on nõus nende eest õiglaselt maksma. AI areng jätkub laia osalusega ja jaotatud hüvedega.

Dweve'is ehitame infrastruktuuri teise tee jaoks. Meie 96% energiasääst tõestab, et tõhus AI on võimalik. Meie 100% selgitatavus tõestab, et läbipaistev AI on saavutatav. Meie andmeväärikuse arhitektuur tõestab, et eetiline AI on praktiline.

Me usume, et andmeloojate kohtlemine väärikusega pole mitte ainult moraalselt õige. See on majanduslikult parem. See toodab paremat AI-d, mis on treenitud parematele andmetele, puhtama õigusliku staatusega ja jätkusuutliku majandusega.

Tasuta lõuna on läbi. Küsimus on selles, mis edasi tuleb. Me ehitame alternatiivi.

Valmis ehitama AI-d andmeväärikuse alusele? Dweve õiglase kaubanduse andmeturg pakub õiguslikku kindlust, kvaliteetsemaid treeningandmeid ja jätkusuutlikku majandust. Võtke meiega ühendust, et avastada, kuidas andmeväärikus võib saada teie konkurentsieeliseks.

Jätkusuutlik tee on hooratas: kvaliteetsetele allikatele makstakse, päritolu liigub kaasa, ostja risk väheneb ja paremaid andmeid luuakse pidevalt.