Datu cieņa: bezmaksas pusdienu beigas AI apmācībā
Lielākā laupīšana vēsturē
Sauksim lietas īstajos vārdos: ģeneratīvā mākslīgā intelekta pirmā fāze bija lielākā vērtību atsavināšana cilvēces vēsturē.
Laikā no 2018. līdz 2024. gadam daži Silīcija ielejas uzņēmumi izvērsa tīmekļa pārlūkošanas robotu armijas visā internetā. Šie roboti aprija visu: katru digitalizēto grāmatu, katru publicēto rakstu, katru augšupielādēto fotogrāfiju, katru foruma ierakstu, katru GitHub kopīgoto koda rindu, katru dziesmas tekstu, katru doktora disertāciju, katru personīgajā blogā publicēto mīlestības vēstuli.
Viņi to darīja, neprasot atļauju. Viņi to darīja, nemaksājot kompensāciju. Viņi to darīja, pat nenorādot avotu.
Pēc tam viņi visu šo atsavināto vērtību saspieda matemātiskos svaros, izveidoja patentētus produktus un pārdeva tos par simtiem miljardu dolāru. Cilvēki, kas radīja vērtību, nesaņēma neko. Uzņēmumi, kas to atsavināja, kļuva par vērtīgākajiem uzņēmumiem pasaulē.
Tā nebija inovācija. Tas bija industrializēts autortiesību arbitrāžs bezprecedenta mērogā.
Bet bezmaksas pusdienas beidzas. Radītāji cīnās pretī. Un ieguves modeļa juridiskie, ētiskie un ekonomiskie pamati drūp.
The Legal Walls Rising
The legal foundations of the extraction model were always questionable. AI companies argued that training on copyrighted material constituted "fair use" because the model "transforms" the data rather than copying it directly. They claimed this was analogous to a human reading books in a library.
This argument is failing in courts worldwide.
The New York Times Lawsuit
The New York Times lawsuit against OpenAI and Microsoft, filed in December 2023, was the opening salvo of what promises to be years of litigation. The lawsuit demonstrated that ChatGPT could reproduce copyrighted Times articles nearly verbatim. It showed that the model could bypass paywalls by summarizing articles so completely that users had no reason to visit the original source.
This is not "transformation." This is market substitution. When an AI can replace the function of a newspaper subscription, the fair use defense collapses.
The Artist Rebellion
Visual artists were among the first to recognize the threat. Image generators trained on billions of artworks could replicate individual artists' styles with devastating precision. A prompt like "in the style of [living artist]" could produce unlimited works that competed directly with the original creator's livelihood.
Class action lawsuits on behalf of visual artists are now working through the courts. But artists didn't wait for legal resolution. They developed technical countermeasures.
Tools like Glaze and Nightshade add imperceptible perturbations to images that poison AI training. A scraped image appears normal to humans but causes model degradation or unpredictable outputs. It's a digital form of booby-trapping content, and it's spreading rapidly.
The Platform Lockdown
Major platforms have closed their doors to AI training. Reddit, which was one of the largest sources of conversational training data, now charges prohibitive fees for API access. Twitter/X blocked AI crawlers entirely before reversing course and monetizing access. Stack Overflow implemented strict terms against AI training on their programming Q&A.
The "open web" that AI companies relied upon is becoming a patchwork of walled gardens, each extracting tolls from any AI that wants access.
Datu cieņa: cita filozofija
Uzņēmumā Dweve mēs pieņemam Datu cieņas koncepciju, terminu, ko popularizējis datorzinātnieks Džerons Lanjē. Princips ir vienkāršs: ja jūsu dati veicina mākslīgā intelekta sistēmas vērtību, jums pienākas daļa no šīs vērtības.
Tā nav labdarība. Tā pat nav ētika pašas dēļ. Tas ir pamats ilgtspējīgai mākslīgā intelekta ekonomikai.
Ieguves modelis nekad nebija ekonomiski pamatots. Tas bija atkarīgs no pagaidu juridiskās pelēkās zonas un praktiskās nespējas miljoniem atsevišķu radītāju aizstāvēt savas tiesības. Abiem nosacījumiem mainoties, uz ieguvi balstīti uzņēmumi saskaras ar eksistenciālu risku.
Uz cieņu balstīts modelis, turpretim, rada saskaņotus stimulus. Radītāji ir motivēti sniegt savu labāko darbu, jo par to saņem atlīdzību. Mākslīgā intelekta uzņēmumi iegūst piekļuvi augstākas kvalitātes datiem, jo maksā par kūrēšanu un pārbaudi. Lietotāji saņem labākus rezultātus, jo apmācības dati ir augstākas kvalitātes.
Dweve arhitektūra datu cieņai
Mūsu pieeja datu cieņai nav tikai politikas nostāja. Tā ir iebūvēta mūsu tehniskajā arhitektūrā.
Spindle zināšanu cauruļvads
Dweve Spindle īsteno septiņu posmu epistemoloģisko cauruļvadu, kas izseko katru zināšanu daļu no izcelsmes līdz ieviešanai:
- Kandidāts: Neapstrādāta informācija tiek identificēta un marķēta ar avota metadatiem
- Iegūts: Strukturēta informācija tiek iegūta, saglabājot izcelsmes pierādījumus
- Analizēts: Saturs tiek sadalīts atomiskos faktos ar pārbaudītu licencēšanas statusu
- Savienots: Fakti tiek saistīti ar zināšanu grafiku ar attiecinājuma ķēdēm
- Pārbaudīts: Vairāku avotu validācija apstiprina precizitāti un juridisko statusu
- Sertificēts: Kvalitātes nodrošināšana apstiprina atbilstību datu cieņas prasībām
- Kanonisks: Pārbaudītas zināšanas kļūst gatavas mākslīgajam intelektam ar pilnu izcelsmes pierādījumu
Šis cauruļvads nozīmē, ka mēs varam izsekot jebkuru zināšanu daļu mūsu sistēmā līdz tās sākotnējam avotam. Mēs varam pierādīt licencēšanas statusu. Mēs varam identificēt, kuri radītāji ir veicinājuši jebkuru konkrētu rezultātu.
456 domēna speciālistu ierobežojumu kopas
Dweve Loom arhitektūra ar 456 specializētām ierobežojumu kopām nodrošina detalizētu licencēšanu un atlīdzību. Katrs domēna speciālists pārstāv atšķirīgu zināšanu domēnu ar saviem datu avotiem un licencēšanas līgumiem.
Kad Juridiskā domēna speciālists (Vācu līgumtiesības) apstrādā vaicājumu, mēs precīzi zinām, kuri tiesību izdevēji un advokātu biroji ir veicinājuši šo iespēju. Kad Medicīnas domēna speciālists (Onkoloģija) sniedz informāciju, mēs varam izsekot līdz medicīnas žurnāliem, klīniskajām datubāzēm un pētniecības iestādēm, kas sniedza zināšanas.
Šī detalizācijas pakāpe nodrošina sarežģītu ieņēmumu sadali. Tā vietā, lai izteiktu neskaidrus apgalvojumus par „apmācību internetā", mēs varam precīzi aprēķināt, cik daudz katrs datu avots ir veicinājis katru iespēju.
Taisnīgas tirdzniecības datu tirgus
Mēs veidojam infrastruktūru jaunai datu ekonomikai. Domājiet par to kā par "taisnīgas tirdzniecības" sertifikāciju AI apmācības datiem.
Datu sniedzējiem
Izdevēji, universitātes, pētniecības iestādes un nozares eksperti var reģistrēt savu saturu mūsu platformā. Viņi nosaka licencēšanas noteikumus. Viņi nosaka cenu. Viņi saglabā kontroli.
Atšķirībā no ieguves modeļa, kur viņu saturs tika vienkārši paņemts, viņi kļūst par aktīviem dalībniekiem AI ekonomikā. Viņi var izvēlēties, kuras AI lietojumprogrammas var izmantot viņu datus, ar kādiem nosacījumiem un par kādu cenu.
Augstas kvalitātes dati prasa augstākas cenas. Akadēmisks izdevējs ar stingri recenzētiem pētījumiem var prasīt vairāk nekā satura ferma ar SEO optimizētiem klikšķu ēsmas rakstiem. Tirgus atalgo kvalitāti.
AI izstrādātājiem
Uzņēmumi, kas veido AI lietojumprogrammas, iegūst piekļuvi juridiski skaidriem apmācības datiem ar dokumentētu izcelsmi. Viņi var pierādīt regulatoriem, apdrošinātājiem un tiesām, no kurienes tieši nāk viņu apmācības dati un ka viņiem bija tiesības tos izmantot.
Tas novērš pieaugošo juridisko risku, kas saistīts ar modeļiem, kuri apmācīti uz nokasītiem datiem. Tas arī nodrošina piekļuvi zināšanu "tumšajai matērijai", plašajām augstas kvalitātes informācijas krātuvēm, kas nekad nebija pieejamas atvērtajā tīmeklī: korporatīvie arhīvi, aiz maksas sienas esošie pētījumi, patentētas datubāzes.
Galalietotājiem
Lietotāji iegūst labākus rezultātus, jo AI ir apmācīts uz augstākas kvalitātes, atlasītiem datiem, nevis uz atvērtā interneta troksni. Viņi arī iegūst attiecinājumu, kad mūsu sistēma sniedz informāciju no licencētiem avotiem, mēs varam atsaukties uz šiem avotiem, nodrošinot pārbaudi un dziļāku izpēti.
Kvalitātes pār kvantitāti ekonomika
Kritiķi apgalvo, ka maksāšana par datiem padara AI izstrādi ekonomiski neiespējamu. Viņi apgalvo, ka jums ir nepieciešams "viss internets", lai apmācītu spējīgus modeļus.
Tas atspoguļo novecojušu domāšanu no 2020. gada "lielo datu" laikmeta. Jaunākie pētījumi ir pārliecinoši pierādījuši, ka datu kvalitātei ir daudz lielāka nozīme nekā datu apjomam.
Apsveriet matemātiku. GPT-3 apmācībai bija nepieciešami aptuveni 45 terabaiti saspiesta teksta. Lielākā daļa no tā bija zemas kvalitātes tīmekļa nokasīšana: komentāru sadaļas, surogātpasts, novecojusi informācija, faktu kļūdas un pilnīgas muļķības.
Modelis, kas apmācīts uz 500 gigabaitiem atlasīta, augstas kvalitātes mācību grāmatu un akadēmiskā satura, var sasniegt vai pārspēt modeļu veiktspēju, kas apmācīti uz 100 reizes lielāku datu apjomu. Atlasīto datu signāla un trokšņa attiecība ir vienkārši tik daudz augstāka.
Maksājot par datiem, mēs iegūstam piekļuvi saturam, kas nekad nebija pieejams skrāpētājiem: medicīniskā literatūra aiz izdevēju maksas sienām, finanšu pētījumi patentētās datubāzēs, rūpnieciskās zināšanas korporatīvajos arhīvos. Šī "tumšā matērija" ir tīrāka, blīvāka un vērtīgāka par jebko atvērtajā tīmeklī.
Ekonomika patiesībā ir par labu cieņas modelim. Mēs maksājam vairāk par baitu, bet mums vajag ievērojami mazāk baitu. Mēs iegūstam piekļuvi premium avotiem, kurus skreperi nekad nevar sasniegt. Un mēs novēršam juridisko atbildību, kas tagad apdraud uz ekstrakciju balstītus uzņēmumus ar miljardiem iespējamo zaudējumu.
Uzņēmumu prasība
Uzņēmumu klientiem datu cieņa nav izvēles jautājums. Tā ir riska pārvaldības prasība.
Lielas organizācijas saskaras ar milzīgu atbildības risku saistībā ar mākslīgā intelekta sistēmām, kas apmācītas uz apšaubāmiem datiem. Mārketinga nodaļa, kas izmanto attēlu ģeneratoru, kurš apmācīts uz nokopētiem mākslas darbiem, saskaras ar iespējamām autortiesību pārkāpumu prasībām. Juridiskā nodaļa, kas izmanto valodas modeli, kurš apmācīts uz maksas saturu, saskaras ar intelektuālā īpašuma risku. Veselības aprūpes organizācija, kas izmanto modeli, kurš nevar pierādīt savu apmācības datu izcelsmi, saskaras ar regulatīvo risku.
Tiesas prāvas tuvojas. Getty Images iesūdzēja Stability AI. The New York Times iesūdzēja OpenAI. Rakstnieku ģildes organizē grupu prasības. Iespējamie zaudējumi ir miljardos.
Organizācijas, kas izmanto Dweve sistēmas, var pierādīt, no kurienes tieši nāk mūsu apmācības dati un ka mums bija pienācīgas licences visiem tiem. Šī tīrā izcelsme ir vērtīgāka par jebkuru nelielu iespēju pieaugumu, ko sniedz nokopēti dati.
Autorība un zināšanu ekonomika
Papildus kompensācijai datu cieņa prasa autorības norādi. Kad mūsu sistēmas sniedz informāciju, kas iegūta no licencētiem avotiem, mēs norādām šos avotus.
Tas rada pozitīvu ciklu. Lietotāji var pārbaudīt informāciju, iepazīstoties ar oriģinālajiem avotiem. Viņi var dziļāk izpētīt tēmas, sekojot atsaucēm. Satiksme plūst atpakaļ pie satura veidotājiem, atjaunojot izjaukto tīmekļa sociālo līgumu.
Mūsu 456 nozares speciālistu ierobežojumu kopās Dweve Loom katram zināšanu elementam ir izcelsmes ķēde. Kad medicīnas nozares speciālists sniedz informāciju par retu slimību, mēs varam parādīt, kuri medicīnas žurnālu raksti veidoja šo atbildi. Kad juridiskās nozares speciālists izskaidro normatīvo prasību, mēs varam norādīt normatīvos avotus.
Tā nav tikai laba ētika. Tas ir labs produkta dizains. Lietotāji vairāk uzticas sistēmām, kad var pārbaudīt apgalvojumus. Uzņēmumi dod priekšroku sistēmām, kas var parādīt savu pamatojumu. Autorības norāde veido uzticību.
Nākotne, ko mēs veidojam
Ieguves laikmets tuvojas beigām. Tas, kas notiks tālāk, tiek noteikts tagad.
Viens ceļš ved uz saindētu kopienu. Satura veidotāji pieņem arvien agresīvākus aizsardzības pasākumus. Apmācības datu kvalitāte pasliktinās. MI attīstība apstājas vai kļūst par dažu uzņēmumu ar mantotām datu priekšrocībām prerogatīvu.
Otrs ceļš ved uz ilgtspējīgu zināšanu ekonomiku. Satura veidotāji saņem kompensāciju par savu ieguldījumu. Kvalitatīvi dati ir pieejami tiem, kas ir gatavi par tiem godīgi maksāt. MI attīstība turpinās ar plašu dalību un sadalītiem ieguvumiem.
Uzņēmumā Dweve mēs veidojam infrastruktūru otrajam ceļam. Mūsu 96% enerģijas samazinājums pierāda, ka efektīvs MI ir iespējams. Mūsu 100% izskaidrojamība pierāda, ka caurskatāms MI ir sasniedzams. Mūsu datu cieņas arhitektūra pierāda, ka ētisks MI ir praktisks.
Mēs uzskatām, ka izturēšanās pret datu veidotājiem ar cieņu nav tikai morāli pareiza. Tā ir ekonomiski pārāka. Tā rada labāku MI, kas apmācīts uz labākiem datiem, ar tīrāku juridisko statusu un ilgtspējīgu ekonomiku.
Bezmaksas pusdienas ir beigušās. Jautājums ir, kas notiks tālāk. Mēs veidojam alternatīvu.
Vai esat gatavi veidot MI uz datu cieņas pamata? Dweve godīgas tirdzniecības datu tirgus nodrošina juridisku noteiktību, augstākas kvalitātes apmācības datus un ilgtspējīgu ekonomiku. Sazinieties ar mums, lai uzzinātu, kā datu cieņa var kļūt par jūsu konkurences priekšrocību.