Data-arvokkuus: ilmaislounaan loppu tekoälyn koulutuksessa
Historian suurin ryöstö
Kutsukaamme generatiivisen tekoälyn ensimmäistä vaihetta sillä nimellä, joka se todella oli: ihmiskunnan historian suurin arvonkeruun teko.
Vuosien 2018 ja 2024 välillä joukko Piilaakson yrityksiä lähetti valtavia verkkorobottiarmeijoita koko internetiin. Nämä robotit kuluttivat kaiken: jokaisen digitoidun kirjan, jokaisen julkaistun artikkelin, jokaisen ladatun valokuvan, jokaisen kirjoitetun keskustelupalstakommentin, jokaisen GitHubissa jaetun koodirivin, jokaisen laulunsanoituksen, jokaisen väitöskirjan, jokaisen henkilökohtaiseen blogiin kirjoitetun rakkauskirjeen.
He tekivät tämän kysymättä lupaa. He tekivät tämän maksamatta korvausta. He tekivät tämän edes mainitsematta lähdettä.
Sitten he ottivat kaiken tämän kerätyn arvon, puristivat sen matemaattisiksi painoiksi ja rakensivat omia tuotteita, joita he myivät sadoilla miljardeilla dollareilla. Arvon luojat eivät saaneet mitään. Yritykset, jotka keräsivät arvon, nousivat maapallon arvokkaimmiksi yrityksiksi.
Tämä ei ollut innovaatiota. Tämä oli teollistettua tekijänoikeusarbitraasia ennennäkemättömässä mittakaavassa.
Mutta ilmainen lounas on loppumassa. Tekijät taistelevat takaisin. Ja keräysmallin oikeudelliset, eettiset ja taloudelliset perustat ovat murenemassa.
Oikeudelliset muurit nousevat
Oikeudelliset perusteet koulutusmallille olivat aina kyseenalaiset. Tekoäly-yritykset väittivät, että tekijänoikeudella suojatun materiaalin käyttö koulutuksessa oli "reilua käyttöä", koska malli "muuntaa" dataa sen sijaan, että kopioisi sitä suoraan. Ne väittivät tämän olevan verrattavissa siihen, että ihminen lukee kirjoja kirjastossa.
Tämä argumentti on kaatumassa tuomioistuimissa ympäri maailmaa.
The New York Timesin oikeusjuttu
The New York Timesin joulukuussa 2023 nostama oikeusjuttu OpenAI:ta ja Microsoftia vastaan oli avauslaukaus sille, mikä lupaa olla vuosia kestävä oikeudenkäyntien sarja. Oikeusjuttu osoitti, että ChatGPT pystyi toistamaan Timesin tekijänoikeudella suojattuja artikkeleita lähes sanatarkasti. Se osoitti, että malli pystyi kiertämään maksumuurit tiivistämällä artikkelit niin täydellisesti, että käyttäjillä ei ollut syytä vierailla alkuperäisessä lähteessä.
Tämä ei ole "muuntamista". Tämä on markkinakorvaamista. Kun tekoäly voi korvata sanomalehden tilauksen toiminnon, reilun käytön puolustus romahtaa.
Taiteilijoiden kapina
Kuvataiteilijat olivat ensimmäisten joukossa tunnistamassa uhkan. Kuvageneraattorit, jotka oli koulutettu miljardeilla taideteoksilla, pystyivät jäljittelemään yksittäisten taiteilijoiden tyylejä tuhoisalla tarkkuudella. Kehote, kuten "tyyliin [elossa oleva taiteilija]", pystyi tuottamaan rajattomasti teoksia, jotka kilpailivat suoraan alkuperäisen tekijän toimeentulon kanssa.
Ryhmäkanteet kuvataiteilijoiden puolesta etenevät nyt tuomioistuimissa. Mutta taiteilijat eivät odottaneet oikeudellista ratkaisua. He kehittivät teknisiä vastatoimia.
Työkalut, kuten Glaze ja Nightshade, lisäävät kuviin huomaamattomia häiriöitä, jotka myrkyttävät tekoälyn koulutuksen. Kaapattu kuva näyttää ihmisistä normaalilta, mutta aiheuttaa mallin heikkenemistä tai arvaamattomia tulosteita. Se on digitaalinen tapa ansastaa sisältöä, ja se leviää nopeasti.
Alustojen sulkeutuminen
Suuret alustat ovat sulkeneet ovensa tekoälyn koulutukselta. Reddit, joka oli yksi suurimmista keskustelupohjaisen koulutusdatan lähteistä, veloittaa nyt kohtuuttomia maksuja API-pääsystä. Twitter/X esti tekoälyn verkkorobotit kokonaan ennen kuin se käänsi kurssin ja alkoi kaupallistaa pääsyä. Stack Overflow asetti tiukat ehdot tekoälyn koulutusta vastaan ohjelmointikysymys-vastauspalvelussaan.
"Avoin verkko", johon tekoäly-yritykset luottivat, on muuttumassa tilkkutäkiksi suljetuista puutarhoista, joista jokainen perii tulleja jokaiselta tekoälyltä, joka haluaa pääsyn.
Data Dignity: erilainen filosofia
Dwevellä omaksumme Data Dignity -käsitteen, jonka tietojenkäsittelytieteilijä Jaron Lanier teki tunnetuksi. Periaate on yksinkertainen: jos tietosi lisäävät tekoälyjärjestelmän arvoa, ansaitset osuuden siitä arvosta.
Tämä ei ole hyväntekeväisyyttä. Tämä ei ole edes etiikkaa sen itsensä vuoksi. Tämä on kestävän tekoälytalouden perusta.
Louhintamalli ei ollut koskaan taloudellisesti järkevä. Se perustui väliaikaiseen oikeudelliseen harmaaseen alueeseen ja siihen, että miljoonat yksittäiset tekijät eivät käytännössä kyenneet valvomaan oikeuksiaan. Kun molemmat olosuhteet muuttuvat, louhinnan varaan rakennetut yritykset kohtaavat olemassaolonsa uhkaavan riskin.
Sitä vastoin ihmisarvolle rakennettu malli luo yhdenmukaiset kannustimet. Tekijät motivoituvat tarjoamaan parasta työtään, koska he saavat siitä korvauksen. Tekoälyyritykset saavat käyttöönsä laadukkaampaa dataa, koska ne maksavat kuratoinnista ja varmentamisesta. Käyttäjät saavat parempia tuloksia, koska koulutusdata on laadukkaampaa.
Dweven arkkitehtuuri Data Dignitylle
Lähestymistapamme dataan liittyvään ihmisarvoon ei ole vain kannanotto. Se on rakennettu tekniseen arkkitehtuuriimme.
Spindle-tietoputki
Dweve Spindle toteuttaa seitsemänvaiheisen epistemologisen putken, joka jäljittää jokaisen tiedon alkuperästä käyttöönottoon:
- Ehdokas: Raaka tieto tunnistetaan ja merkitään lähdemetatiedoilla
- Louhittu: Jäsennelty tieto erotetaan siten, että alkuperä säilyy
- Analysoitu: Sisältö puretaan atomisiksi tosiasioiksi ja lisensointitila varmistetaan
- Yhdistetty: Tosiasiat linkitetään tietograafiin attribuutioketjuilla
- Varmennettu: Monilähdevalidointi vahvistaa tarkkuuden ja oikeudellisen aseman
- Sertifioitu: Laadunvarmistus vahvistaa Data Dignity -vaatimusten täyttymisen
- Kaanoninen: Varmennettu tieto muuttuu tekoälyvalmiiksi täydellä alkuperätiedolla
Tämä putki tarkoittaa, että voimme jäljittää minkä tahansa järjestelmämme tiedon alkuperäiseen lähteeseensä. Voimme todistaa lisensointitilan. Voimme tunnistaa, mitkä tekijät ovat vaikuttaneet mihin tahansa tuotokseen.
456 toimialakohtaista rajoitusjoukkoa
Dweve Loomin arkkitehtuuri, jossa on 456 erikoistunutta rajoitusjoukkoa, mahdollistaa yksityiskohtaisen lisensoinnin ja korvaukset. Jokainen toimialan erikoisasiantuntija edustaa omaa tiedon aluettaan omine tietolähteineen ja lisensointijärjestelyineen.
Kun oikeudellisen toimialan erikoisasiantuntija (saksalainen sopimusoikeus) käsittelee kyselyn, tiedämme tarkalleen, mitkä oikeudelliset kustantajat ja lakitoimistot ovat vaikuttaneet kyseiseen toimintoon. Kun lääketieteen erikoisasiantuntija (onkologia) tarjoaa tietoa, voimme jäljittää tiedon lääketieteellisiin lehtiin, kliinisiin tietokantoihin ja tutkimuslaitoksiin, jotka ovat tarjonneet tiedon.
Tämä yksityiskohtaisuus mahdollistaa kehittyneen tulonjaon. Sen sijaan, että puhuttaisiin epämääräisesti "internetistä kouluttamisesta", voimme laskea tarkasti, kuinka paljon kukin tietolähde on vaikuttanut kuhunkin toimintoon.
Reilun kaupan datamarkkinapaikka
Rakennamme infrastruktuuria uudelle dataekonomialle. Ajattele sitä "Reilun kaupan" sertifiointina tekoälyn koulutusdatalle.
Datan tarjoajille
Kustantajat, yliopistot, tutkimuslaitokset ja alan asiantuntijat voivat rekisteröidä sisältönsä alustallemme. He asettavat lisenssiehdot. He asettavat hinnan. He säilyttävät hallinnan.
Toisin kuin louhintamallissa, jossa heidän sisältönsä yksinkertaisesti otettiin, heistä tulee aktiivisia toimijoita tekoälytaloudessa. He voivat valita, mitkä tekoälysovellukset voivat käyttää heidän dataansa, millä ehdoilla ja mihin hintaan.
Laadukas data saa korkean hinnan. Akateeminen kustantaja, jolla on tiukasti vertaisarvioitua tutkimusta, voi veloittaa enemmän kuin sisältöfarmi, joka tuottaa hakukoneoptimoituja klikkiotsikoita. Markkinat palkitsevat laadun.
Tekoälyn kehittäjille
Tekoälysovelluksia rakentavat yritykset saavat käyttöönsä juridisesti selkeää koulutusdataa, jonka alkuperä on dokumentoitu. Ne voivat osoittaa viranomaisille, vakuutusyhtiöille ja tuomioistuimille tarkalleen, mistä niiden koulutusdata on peräisin ja että niillä oli oikeus käyttää sitä.
Tämä poistaa kaavittuun dataan koulutettujen mallien kasvavan juridiset riskit. Se avaa myös pääsyn tiedon "pimeään aineeseen", valtaviin korkealaatuisen tiedon arkistoihin, jotka eivät koskaan olleet avoimessa verkossa: yritysarkistot, maksullisen tutkimuksen takana oleva sisältö, omat tietokannat.
Loppukäyttäjille
Käyttäjät saavat parempia tuloksia, koska tekoäly on koulutettu laadukkaammalla ja kuratoidulla datalla avoimen internetin kohinan sijaan. He saavat myös lähdemerkinnät: kun järjestelmämme tarjoaa tietoa lisensoiduista lähteistä, voimme mainita nämä lähteet, mikä mahdollistaa tiedon varmentamisen ja syvemmän tutkimisen.
Laadun taloustiede määrän sijaan
Kriitikot väittävät, että datasta maksaminen tekee tekoälyn kehittämisestä taloudellisesti kannattamatonta. He sanovat, että tarvitset "koko internetin" kyetäksesi kouluttamaan toimivia malleja.
Tämä heijastaa vanhentunutta ajattelua 2020-luvun "ison datan" aikakaudelta. Tuore tutkimus on osoittanut kiistattomasti, että datan laadulla on paljon suurempi merkitys kuin datan määrällä.
Mieti matematiikkaa. GPT-3:n kouluttaminen vaati noin 45 teratavua pakattua tekstiä. Suurin osa siitä oli heikkolaatuista verkkokaavintaa: kommenttiosioita, roskapostia, vanhentunutta tietoa, asiavirheitä ja silkkaa hölynpölyä.
Malli, joka on koulutettu 500 gigatavulla kuratoitua, korkealaatuista oppikirja- ja akateemista sisältöä, voi yltää samaan tai ylittää mallit, jotka on koulutettu 100 kertaa suuremmalla datamäärällä. Kuratoidun datan signaali-kohinasuhde on yksinkertaisesti niin paljon parempi.
Maksamalla datasta saamme käyttöön sisältöä, joka ei ole koskaan ollut kaavintatyökalujen ulottuvilla: lääketieteellistä kirjallisuutta kustantajien maksumuurien takana, taloustutkimusta omissa tietokannoissa, teollista tietämystä yritysarkistoissa. Tämä "pimeä aine" on puhtaampaa, tiiviimpää ja arvokkaampaa kuin mikään avoimessa verkossa.
Taloudellisesti arvoajattelumalli on itse asiassa edullisempi. Maksamme enemmän tavua kohden, mutta tarvitsemme huomattavasti vähemmän tavuja. Saamme pääsyn premium-lähteisiin, joihin kaavintaohjelmat eivät koskaan yllä. Ja poistamme juridisen vastuun, joka nyt uhkaa poimintaan perustuvia yrityksiä miljardien eurojen mahdollisilla vahingonkorvauksilla.
Yritysten välttämättömyys
Yritysasiakkaille arvoajattelu ei ole valinnaista. Se on riskienhallinnan vaatimus.
Suurilla organisaatioilla on valtava vastuuriski tekoälyjärjestelmistä, jotka on koulutettu kyseenalaisella datalla. Markkinointiosasto, joka käyttää kuvageneraattoria, joka on koulutettu kaapatuilla taideteoksilla, altistuu mahdollisille tekijänoikeusloukkausvaatimuksille. Lakiosasto, joka käyttää kielimallia, joka on koulutettu maksumuurin takana olevalla sisällöllä, altistuu immateriaalioikeusriskille. Terveydenhuoltoorganisaatio, joka käyttää mallia, joka ei voi todistaa koulutusdatansa alkuperää, altistuu sääntelyriskille.
Oikeusjutut ovat tulossa. Getty Images haastoi Stability AI:n oikeuteen. The New York Times haastoi OpenAI:n oikeuteen. Kirjailijajärjestöt järjestävät ryhmäkanteita. Mahdolliset vahingonkorvaukset ovat miljardeissa.
Organisaatiot, jotka käyttävät Dweven järjestelmiä, voivat osoittaa tarkalleen, mistä koulutusdatamme on peräisin ja että meillä oli asianmukaiset lisenssit kaikkeen siihen. Tämä puhdas alkuperä on arvoltaan paljon suurempi kuin mikään marginaalinen toimintakyvyn parannus, joka saadaan kaapatusta datasta.
Attribuointi ja tietotalous
Korvausten lisäksi datan arvokkuus edellyttää attribuointia. Kun järjestelmämme tuottavat tietoa lisensoiduista lähteistä, viittaamme näihin lähteisiin.
Tämä luo hyvän kierteen. Käyttäjät voivat varmistaa tiedon tarkistamalla alkuperäiset lähteet. He voivat tutkia aiheita syvemmin seuraamalla viittauksia. Liikenne virtaa takaisin sisällöntuottajille, mikä korjaa verkon rikkoutuneen yhteiskuntasopimuksen.
Kaikissa 456:ssä toimialakohtaisessa rajoitusjoukossamme Dweve Loomissa jokaisella tiedonpalalla on alkuperäketju. Kun lääketieteen toimialan asiantuntija antaa tietoa harvinaisesta sairaudesta, voimme osoittaa, mitkä lääketieteelliset lehtiartikkelit vaikuttivat vastaukseen. Kun lakialan asiantuntija selittää sääntelyvaatimuksen, voimme viitata lainsäädäntölähteisiin.
Tämä ei ole vain hyvää etiikkaa. Se on hyvää tuotesuunnittelua. Käyttäjät luottavat järjestelmiin enemmän, kun he voivat varmistaa väitteet. Yritykset suosivat järjestelmiä, jotka voivat osoittaa päättelynsä. Attribuointi rakentaa luottamusta.
Tulevaisuus, jota rakennamme
Louhinnan aikakausi on päättymässä. Se, mitä seuraa, määräytyy nyt.
Toinen polku johtaa myrkytettyyn yhteisomaisuuteen. Sisällöntuottajat ottavat käyttöön yhä aggressiivisempia suojatoimia. Koulutusdatan laatu heikkenee. Tekoälyn kehitys pysähtyy tai muuttuu harvojen yritysten yksinoikeudeksi, joilla on perittyjä dataetuja.
Toinen polku johtaa kestävään tietotalouteen. Sisällöntuottajat saavat korvauksen panoksestaan. Laadukas data on saatavilla niille, jotka ovat valmiita maksamaan siitä reilusti. Tekoälyn kehitys jatkuu laajalla osallistumisella ja hajautetuilla hyödyillä.
Dwevellä rakennamme infrastruktuuria toiselle polulle. 96 prosentin energiansäästömme osoittaa, että tehokas tekoäly on mahdollista. 100 prosentin selitettävyytemme osoittaa, että läpinäkyvä tekoäly on saavutettavissa. Data-arvokkuusarkkitehtuurimme osoittaa, että eettinen tekoäly on käytännöllistä.
Uskomme, että datan luojiin suhtautuminen arvokkaasti ei ole vain moraalisesti oikein. Se on taloudellisesti parempi vaihtoehto. Se tuottaa parempaa tekoälyä, joka on koulutettu paremmalla datalla, puhtaammalla oikeudellisella asemalla ja kestävämmällä taloudella.
Ilmainen lounas on ohi. Kysymys on siitä, mitä seuraa. Rakennamme vaihtoehtoa.
Valmiina rakentamaan tekoälyä data-arvokkuuden perustalle? Dweven reilun kaupan datamarkkinapaikka tarjoaa oikeudellista varmuutta, laadukkaampaa koulutusdataa ja kestävää taloutta. Ota yhteyttä ja selvitä, miten data-arvokkuudesta voi tulla kilpailuetusi.