Data-arvokkuus: ilmaislounaan loppu tekoälyn koulutuksessa

Nettisivujen ilmainen kaapiminen on päättymässä. Sisällöntuottajat iskevät takaisin. Näin Dweven markkinapaikkamalli korvaa datan tuottajille reilusti.

Data-arvokkuus: ilmaislounaan loppu tekoälyn koulutuksessa

Historian suurin ryöstö

Kutsukaamme generatiivisen tekoälyn ensimmäistä vaihetta sillä nimellä, joka se todella oli: ihmiskunnan historian suurin arvonkeruun teko.

Vuosien 2018 ja 2024 välillä joukko Piilaakson yrityksiä lähetti valtavia verkkorobottiarmeijoita koko internetiin. Nämä robotit kuluttivat kaiken: jokaisen digitoidun kirjan, jokaisen julkaistun artikkelin, jokaisen ladatun valokuvan, jokaisen kirjoitetun keskustelupalstakommentin, jokaisen GitHubissa jaetun koodirivin, jokaisen laulunsanoituksen, jokaisen väitöskirjan, jokaisen henkilökohtaiseen blogiin kirjoitetun rakkauskirjeen.

He tekivät tämän kysymättä lupaa. He tekivät tämän maksamatta korvausta. He tekivät tämän edes mainitsematta lähdettä.

Sitten he ottivat kaiken tämän kerätyn arvon, puristivat sen matemaattisiksi painoiksi ja rakensivat omia tuotteita, joita he myivät sadoilla miljardeilla dollareilla. Arvon luojat eivät saaneet mitään. Yritykset, jotka keräsivät arvon, nousivat maapallon arvokkaimmiksi yrityksiksi.

Tämä ei ollut innovaatiota. Tämä oli teollistettua tekijänoikeusarbitraasia ennennäkemättömässä mittakaavassa.

Mutta ilmainen lounas on loppumassa. Tekijät taistelevat takaisin. Ja keräysmallin oikeudelliset, eettiset ja taloudelliset perustat ovat murenemassa.

Suuri arvon siirto: louhinta vastaan ihmisarvoLouhintamalli (2018-2024)Koko internet kaavittuIlman lupaaKirjat, artikkelit, koodi, taideIlman lähdemerkintääLuova ja älyllinen työIlman korvaustaTulos:Yli 2 biljoonaa dollariatekoäly-yritysten markkina-arvossa0 dollaria sisällöntuottajilleDatan ihmisarvon malli (Dweve)Kuratoituja tiedonlähteitäNimenomainen lisensointiAsiantuntija-alueet seurannassaTäysi alkuperäketjuKäyttö mitattu kyselyittäinTulojen jako toteutettuTulos:Kestävä ekosysteemiTekijöille kannustin osallistuaLaadukkaampaa tietoa

Oikeudelliset muurit nousevat

Oikeudelliset perusteet koulutusmallille olivat aina kyseenalaiset. Tekoäly-yritykset väittivät, että tekijänoikeudella suojatun materiaalin käyttö koulutuksessa oli "reilua käyttöä", koska malli "muuntaa" dataa sen sijaan, että kopioisi sitä suoraan. Ne väittivät tämän olevan verrattavissa siihen, että ihminen lukee kirjoja kirjastossa.

Tämä argumentti on kaatumassa tuomioistuimissa ympäri maailmaa.

The New York Timesin oikeusjuttu

The New York Timesin joulukuussa 2023 nostama oikeusjuttu OpenAI:ta ja Microsoftia vastaan oli avauslaukaus sille, mikä lupaa olla vuosia kestävä oikeudenkäyntien sarja. Oikeusjuttu osoitti, että ChatGPT pystyi toistamaan Timesin tekijänoikeudella suojattuja artikkeleita lähes sanatarkasti. Se osoitti, että malli pystyi kiertämään maksumuurit tiivistämällä artikkelit niin täydellisesti, että käyttäjillä ei ollut syytä vierailla alkuperäisessä lähteessä.

Tämä ei ole "muuntamista". Tämä on markkinakorvaamista. Kun tekoäly voi korvata sanomalehden tilauksen toiminnon, reilun käytön puolustus romahtaa.

Taiteilijoiden kapina

Kuvataiteilijat olivat ensimmäisten joukossa tunnistamassa uhkan. Kuvageneraattorit, jotka oli koulutettu miljardeilla taideteoksilla, pystyivät jäljittelemään yksittäisten taiteilijoiden tyylejä tuhoisalla tarkkuudella. Kehote, kuten "tyyliin [elossa oleva taiteilija]", pystyi tuottamaan rajattomasti teoksia, jotka kilpailivat suoraan alkuperäisen tekijän toimeentulon kanssa.

Ryhmäkanteet kuvataiteilijoiden puolesta etenevät nyt tuomioistuimissa. Mutta taiteilijat eivät odottaneet oikeudellista ratkaisua. He kehittivät teknisiä vastatoimia.

Työkalut, kuten Glaze ja Nightshade, lisäävät kuviin huomaamattomia häiriöitä, jotka myrkyttävät tekoälyn koulutuksen. Kaapattu kuva näyttää ihmisistä normaalilta, mutta aiheuttaa mallin heikkenemistä tai arvaamattomia tulosteita. Se on digitaalinen tapa ansastaa sisältöä, ja se leviää nopeasti.

Alustojen sulkeutuminen

Suuret alustat ovat sulkeneet ovensa tekoälyn koulutukselta. Reddit, joka oli yksi suurimmista keskustelupohjaisen koulutusdatan lähteistä, veloittaa nyt kohtuuttomia maksuja API-pääsystä. Twitter/X esti tekoälyn verkkorobotit kokonaan ennen kuin se käänsi kurssin ja alkoi kaupallistaa pääsyä. Stack Overflow asetti tiukat ehdot tekoälyn koulutusta vastaan ohjelmointikysymys-vastauspalvelussaan.

"Avoin verkko", johon tekoäly-yritykset luottivat, on muuttumassa tilkkutäkiksi suljetuista puutarhoista, joista jokainen perii tulleja jokaiselta tekoälyltä, joka haluaa pääsyn.

Muureja datan louhintaa vastaanOikeustoimetNYT vs OpenAI -kanneGetty Images -oikeudenkäyntiKirjailijoiden ryhmäkanteetTekninen puolustusGlaze-tyylisuojausNightshade-datan myrkytysSisällön vesileimausAlustojen sulkeminenReddit API -maksuStack Overflow -rajoituksetJulkaisijoiden estotRikkoutunut yhteiskuntasopimusHakukoneet lähettivät liikennettä. Tekoälymoottorit imevät arvon. Vaihtokauppa on rikki.TekoälyyrityksilleKasvava oikeudellinen vastuuKutistuvat koulutuslähteetEettiselle tekoälylle (Dweve)Puhdas oikeudellinen asemaPääsy premium-lähteisiin
Oikeudellinen vastaisku muuttaa vanhan "ensin ryömitään, sitten kysytään" -sopimuksen rajaksi, joka vaatii todisteita ennen koulutusta.

Data Dignity: erilainen filosofia

Dwevellä omaksumme Data Dignity -käsitteen, jonka tietojenkäsittelytieteilijä Jaron Lanier teki tunnetuksi. Periaate on yksinkertainen: jos tietosi lisäävät tekoälyjärjestelmän arvoa, ansaitset osuuden siitä arvosta.

Tämä ei ole hyväntekeväisyyttä. Tämä ei ole edes etiikkaa sen itsensä vuoksi. Tämä on kestävän tekoälytalouden perusta.

Louhintamalli ei ollut koskaan taloudellisesti järkevä. Se perustui väliaikaiseen oikeudelliseen harmaaseen alueeseen ja siihen, että miljoonat yksittäiset tekijät eivät käytännössä kyenneet valvomaan oikeuksiaan. Kun molemmat olosuhteet muuttuvat, louhinnan varaan rakennetut yritykset kohtaavat olemassaolonsa uhkaavan riskin.

Sitä vastoin ihmisarvolle rakennettu malli luo yhdenmukaiset kannustimet. Tekijät motivoituvat tarjoamaan parasta työtään, koska he saavat siitä korvauksen. Tekoälyyritykset saavat käyttöönsä laadukkaampaa dataa, koska ne maksavat kuratoinnista ja varmentamisesta. Käyttäjät saavat parempia tuloksia, koska koulutusdata on laadukkaampaa.

Dweven arkkitehtuuri Data Dignitylle

Lähestymistapamme dataan liittyvään ihmisarvoon ei ole vain kannanotto. Se on rakennettu tekniseen arkkitehtuuriimme.

Spindle-tietoputki

Dweve Spindle toteuttaa seitsemänvaiheisen epistemologisen putken, joka jäljittää jokaisen tiedon alkuperästä käyttöönottoon:

  1. Ehdokas: Raaka tieto tunnistetaan ja merkitään lähdemetatiedoilla
  2. Louhittu: Jäsennelty tieto erotetaan siten, että alkuperä säilyy
  3. Analysoitu: Sisältö puretaan atomisiksi tosiasioiksi ja lisensointitila varmistetaan
  4. Yhdistetty: Tosiasiat linkitetään tietograafiin attribuutioketjuilla
  5. Varmennettu: Monilähdevalidointi vahvistaa tarkkuuden ja oikeudellisen aseman
  6. Sertifioitu: Laadunvarmistus vahvistaa Data Dignity -vaatimusten täyttymisen
  7. Kaanoninen: Varmennettu tieto muuttuu tekoälyvalmiiksi täydellä alkuperätiedolla

Tämä putki tarkoittaa, että voimme jäljittää minkä tahansa järjestelmämme tiedon alkuperäiseen lähteeseensä. Voimme todistaa lisensointitilan. Voimme tunnistaa, mitkä tekijät ovat vaikuttaneet mihin tahansa tuotokseen.

456 toimialakohtaista rajoitusjoukkoa

Dweve Loomin arkkitehtuuri, jossa on 456 erikoistunutta rajoitusjoukkoa, mahdollistaa yksityiskohtaisen lisensoinnin ja korvaukset. Jokainen toimialan erikoisasiantuntija edustaa omaa tiedon aluettaan omine tietolähteineen ja lisensointijärjestelyineen.

Kun oikeudellisen toimialan erikoisasiantuntija (saksalainen sopimusoikeus) käsittelee kyselyn, tiedämme tarkalleen, mitkä oikeudelliset kustantajat ja lakitoimistot ovat vaikuttaneet kyseiseen toimintoon. Kun lääketieteen erikoisasiantuntija (onkologia) tarjoaa tietoa, voimme jäljittää tiedon lääketieteellisiin lehtiin, kliinisiin tietokantoihin ja tutkimuslaitoksiin, jotka ovat tarjonneet tiedon.

Tämä yksityiskohtaisuus mahdollistaa kehittyneen tulonjaon. Sen sijaan, että puhuttaisiin epämääräisesti "internetistä kouluttamisesta", voimme laskea tarkasti, kuinka paljon kukin tietolähde on vaikuttanut kuhunkin toimintoon.

Dweve Spindle: Tiedon arvokkuuden putkistoSeitsemän vaiheen epistemologinen putkisto1. EhdokasRaaka tietotunnistettu2. PoimittuJäsenneltyalkuperän kanssa3. AnalysoituAtomiset faktatlisenssi varmistettu4. YhdistettyTietoverkkolinkitetty5. VarmennettuMonilähteinenvalidointi6. SertifioituQA valmis0.7+ luottamus7. KanoninenTekoälyvalmis täydellä alkuperälläJokainen fakta jäljitetty lähteeseen + lisenssitilaan32-agentin hierarkia validoi jokaisessa vaiheessaLoom: Hienojakoinen lisensointi456 alan asiantuntijaa erillisillä tietolähteilläTulojen jako laskettu alan asiantuntijaa kohdenTiedon tuottajille maksetaan suhteessaMesh: Hajautettu suvereniteettiTieto pysyy tuottajillaYksityisyyden säilyttävä koulutusSMPC + homomorfinen salaus
Spindle tekee dataomistajuudesta toimivaa kuljettamalla lähdetiedot, oikeudet, lisenssitilan ja asiantuntijoiden asettamat rajoitteet mukana.

Reilun kaupan datamarkkinapaikka

Rakennamme infrastruktuuria uudelle dataekonomialle. Ajattele sitä "Reilun kaupan" sertifiointina tekoälyn koulutusdatalle.

Datan tarjoajille

Kustantajat, yliopistot, tutkimuslaitokset ja alan asiantuntijat voivat rekisteröidä sisältönsä alustallemme. He asettavat lisenssiehdot. He asettavat hinnan. He säilyttävät hallinnan.

Toisin kuin louhintamallissa, jossa heidän sisältönsä yksinkertaisesti otettiin, heistä tulee aktiivisia toimijoita tekoälytaloudessa. He voivat valita, mitkä tekoälysovellukset voivat käyttää heidän dataansa, millä ehdoilla ja mihin hintaan.

Laadukas data saa korkean hinnan. Akateeminen kustantaja, jolla on tiukasti vertaisarvioitua tutkimusta, voi veloittaa enemmän kuin sisältöfarmi, joka tuottaa hakukoneoptimoituja klikkiotsikoita. Markkinat palkitsevat laadun.

Tekoälyn kehittäjille

Tekoälysovelluksia rakentavat yritykset saavat käyttöönsä juridisesti selkeää koulutusdataa, jonka alkuperä on dokumentoitu. Ne voivat osoittaa viranomaisille, vakuutusyhtiöille ja tuomioistuimille tarkalleen, mistä niiden koulutusdata on peräisin ja että niillä oli oikeus käyttää sitä.

Tämä poistaa kaavittuun dataan koulutettujen mallien kasvavan juridiset riskit. Se avaa myös pääsyn tiedon "pimeään aineeseen", valtaviin korkealaatuisen tiedon arkistoihin, jotka eivät koskaan olleet avoimessa verkossa: yritysarkistot, maksullisen tutkimuksen takana oleva sisältö, omat tietokannat.

Loppukäyttäjille

Käyttäjät saavat parempia tuloksia, koska tekoäly on koulutettu laadukkaammalla ja kuratoidulla datalla avoimen internetin kohinan sijaan. He saavat myös lähdemerkinnät: kun järjestelmämme tarjoaa tietoa lisensoiduista lähteistä, voimme mainita nämä lähteet, mikä mahdollistaa tiedon varmentamisen ja syvemmän tutkimisen.

Markkinapaikassa suostumus, lähdemerkinnät, maksu ja yritysten riskienhallinta muodostuvat yhdeksi työnkulkuksi.

Laadun taloustiede määrän sijaan

Kriitikot väittävät, että datasta maksaminen tekee tekoälyn kehittämisestä taloudellisesti kannattamatonta. He sanovat, että tarvitset "koko internetin" kyetäksesi kouluttamaan toimivia malleja.

Tämä heijastaa vanhentunutta ajattelua 2020-luvun "ison datan" aikakaudelta. Tuore tutkimus on osoittanut kiistattomasti, että datan laadulla on paljon suurempi merkitys kuin datan määrällä.

Mieti matematiikkaa. GPT-3:n kouluttaminen vaati noin 45 teratavua pakattua tekstiä. Suurin osa siitä oli heikkolaatuista verkkokaavintaa: kommenttiosioita, roskapostia, vanhentunutta tietoa, asiavirheitä ja silkkaa hölynpölyä.

Malli, joka on koulutettu 500 gigatavulla kuratoitua, korkealaatuista oppikirja- ja akateemista sisältöä, voi yltää samaan tai ylittää mallit, jotka on koulutettu 100 kertaa suuremmalla datamäärällä. Kuratoidun datan signaali-kohinasuhde on yksinkertaisesti niin paljon parempi.

Maksamalla datasta saamme käyttöön sisältöä, joka ei ole koskaan ollut kaavintatyökalujen ulottuvilla: lääketieteellistä kirjallisuutta kustantajien maksumuurien takana, taloustutkimusta omissa tietokannoissa, teollista tietämystä yritysarkistoissa. Tämä "pimeä aine" on puhtaampaa, tiiviimpää ja arvokkaampaa kuin mikään avoimessa verkossa.

Taloudellisesti arvoajattelumalli on itse asiassa edullisempi. Maksamme enemmän tavua kohden, mutta tarvitsemme huomattavasti vähemmän tavuja. Saamme pääsyn premium-lähteisiin, joihin kaavintaohjelmat eivät koskaan yllä. Ja poistamme juridisen vastuun, joka nyt uhkaa poimintaan perustuvia yrityksiä miljardien eurojen mahdollisilla vahingonkorvauksilla.

Laatu määrän sijaan: uusi dataekonomiaPoimintamalliYli 45 Tt verkkopoimintaaYli 90 % heikkolaatuista kohinaaKasvava juridinen vastuuArvoajattelumalliNoin 500 Gt kuratoitua sisältöäYli 95 % korkealaatuista signaaliaPuhdas juridinen asemaPimeän aineen etuLisensoitu data avaa premium-lähteet, joihin kaavintaohjelmat eivät koskaan ylläLääketieteelliset lehdetVertaisarvioitu tutkimusRahoitusdataOmistetut tietokannatTeollinen tietämysYritysarkistot

Yritysten välttämättömyys

Yritysasiakkaille arvoajattelu ei ole valinnaista. Se on riskienhallinnan vaatimus.

Suurilla organisaatioilla on valtava vastuuriski tekoälyjärjestelmistä, jotka on koulutettu kyseenalaisella datalla. Markkinointiosasto, joka käyttää kuvageneraattoria, joka on koulutettu kaapatuilla taideteoksilla, altistuu mahdollisille tekijänoikeusloukkausvaatimuksille. Lakiosasto, joka käyttää kielimallia, joka on koulutettu maksumuurin takana olevalla sisällöllä, altistuu immateriaalioikeusriskille. Terveydenhuoltoorganisaatio, joka käyttää mallia, joka ei voi todistaa koulutusdatansa alkuperää, altistuu sääntelyriskille.

Oikeusjutut ovat tulossa. Getty Images haastoi Stability AI:n oikeuteen. The New York Times haastoi OpenAI:n oikeuteen. Kirjailijajärjestöt järjestävät ryhmäkanteita. Mahdolliset vahingonkorvaukset ovat miljardeissa.

Organisaatiot, jotka käyttävät Dweven järjestelmiä, voivat osoittaa tarkalleen, mistä koulutusdatamme on peräisin ja että meillä oli asianmukaiset lisenssit kaikkeen siihen. Tämä puhdas alkuperä on arvoltaan paljon suurempi kuin mikään marginaalinen toimintakyvyn parannus, joka saadaan kaapatusta datasta.

Attribuointi ja tietotalous

Korvausten lisäksi datan arvokkuus edellyttää attribuointia. Kun järjestelmämme tuottavat tietoa lisensoiduista lähteistä, viittaamme näihin lähteisiin.

Tämä luo hyvän kierteen. Käyttäjät voivat varmistaa tiedon tarkistamalla alkuperäiset lähteet. He voivat tutkia aiheita syvemmin seuraamalla viittauksia. Liikenne virtaa takaisin sisällöntuottajille, mikä korjaa verkon rikkoutuneen yhteiskuntasopimuksen.

Kaikissa 456:ssä toimialakohtaisessa rajoitusjoukossamme Dweve Loomissa jokaisella tiedonpalalla on alkuperäketju. Kun lääketieteen toimialan asiantuntija antaa tietoa harvinaisesta sairaudesta, voimme osoittaa, mitkä lääketieteelliset lehtiartikkelit vaikuttivat vastaukseen. Kun lakialan asiantuntija selittää sääntelyvaatimuksen, voimme viitata lainsäädäntölähteisiin.

Tämä ei ole vain hyvää etiikkaa. Se on hyvää tuotesuunnittelua. Käyttäjät luottavat järjestelmiin enemmän, kun he voivat varmistaa väitteet. Yritykset suosivat järjestelmiä, jotka voivat osoittaa päättelynsä. Attribuointi rakentaa luottamusta.

Tulevaisuus, jota rakennamme

Louhinnan aikakausi on päättymässä. Se, mitä seuraa, määräytyy nyt.

Toinen polku johtaa myrkytettyyn yhteisomaisuuteen. Sisällöntuottajat ottavat käyttöön yhä aggressiivisempia suojatoimia. Koulutusdatan laatu heikkenee. Tekoälyn kehitys pysähtyy tai muuttuu harvojen yritysten yksinoikeudeksi, joilla on perittyjä dataetuja.

Toinen polku johtaa kestävään tietotalouteen. Sisällöntuottajat saavat korvauksen panoksestaan. Laadukas data on saatavilla niille, jotka ovat valmiita maksamaan siitä reilusti. Tekoälyn kehitys jatkuu laajalla osallistumisella ja hajautetuilla hyödyillä.

Dwevellä rakennamme infrastruktuuria toiselle polulle. 96 prosentin energiansäästömme osoittaa, että tehokas tekoäly on mahdollista. 100 prosentin selitettävyytemme osoittaa, että läpinäkyvä tekoäly on saavutettavissa. Data-arvokkuusarkkitehtuurimme osoittaa, että eettinen tekoäly on käytännöllistä.

Uskomme, että datan luojiin suhtautuminen arvokkaasti ei ole vain moraalisesti oikein. Se on taloudellisesti parempi vaihtoehto. Se tuottaa parempaa tekoälyä, joka on koulutettu paremmalla datalla, puhtaammalla oikeudellisella asemalla ja kestävämmällä taloudella.

Ilmainen lounas on ohi. Kysymys on siitä, mitä seuraa. Rakennamme vaihtoehtoa.

Valmiina rakentamaan tekoälyä data-arvokkuuden perustalle? Dweven reilun kaupan datamarkkinapaikka tarjoaa oikeudellista varmuutta, laadukkaampaa koulutusdataa ja kestävää taloutta. Ota yhteyttä ja selvitä, miten data-arvokkuudesta voi tulla kilpailuetusi.

Kestävä polku on hyvä kierre: laadukkaista lähteistä maksetaan, alkuperä kulkee mukana, ostajan riski pienenee ja parempaa dataa syntyy jatkuvasti.