Fine dei dati gratuiti nell'addestramento dell'IA

L'era del web scraping gratuito volge al termine. I creatori di contenuti reagiscono. Ecco come il modello di marketplace di Dweve compensa equamente i...

Fine dei dati gratuiti nell'addestramento dell'IA

La più grande rapina della storia

Chiamiamo la prima fase dell'IA generativa con il suo vero nome: il più grande atto di estrazione di valore nella storia umana.

Tra il 2018 e il 2024, una manciata di aziende della Silicon Valley ha schierato eserciti di crawler web su tutta Internet. Questi crawler hanno consumato tutto: ogni libro mai digitalizzato, ogni articolo mai pubblicato, ogni fotografia mai caricata, ogni post di forum mai scritto, ogni riga di codice mai condivisa su GitHub, ogni testo di canzone, ogni tesi di dottorato, ogni lettera d'amore pubblicata su un blog personale.

Lo hanno fatto senza chiedere il permesso. Lo hanno fatto senza fornire alcun compenso. Lo hanno fatto senza nemmeno riconoscere la fonte.

Poi hanno preso tutto questo valore estratto, lo hanno compresso in pesi matematici e hanno costruito prodotti proprietari che hanno venduto per centinaia di miliardi di dollari. Le persone che hanno creato il valore non hanno ricevuto nulla. Le aziende che lo hanno estratto sono diventate le imprese più preziose del pianeta.

Questa non era innovazione. Era arbitraggio del copyright industrializzato su una scala senza precedenti.

Ma il pranzo gratis sta finendo. I creatori stanno reagendo. E le fondamenta legali, etiche ed economiche del modello di estrazione stanno crollando.

Il Grande Trasferimento di Valore: Estrazione vs. DignitàModello di Estrazione (2018-2024)Intero internet indicizzatoSenza permessoLibri, articoli, codice, arteSenza attribuzioneLavoro creativo e intellettualeSenza compensoIl risultato:Oltre 2.000 miliardi di dollaridi capitalizzazione di mercato delle aziende IA0 dollari ai creatori di contenutiModello di Dignità dei Dati (Dweve)Fonti di conoscenza curateLicenze espliciteDomini esperti tracciatiCatena di provenienza completaUtilizzo misurato per queryCondivisione dei ricavi distribuitaIl risultato:Ecosistema sostenibileCreatori incentivati a contribuireConoscenza di qualità superiore

I Muri Legali che Si Alzano

Le fondamenta giuridiche del modello di estrazione sono sempre state discutibili. Le aziende di IA sostenevano che l'addestramento su materiale protetto da copyright costituisse "fair use" perché il modello "trasforma" i dati anziché copiarli direttamente. Affermavano che ciò fosse analogo a un essere umano che legge libri in una biblioteca.

Questa argomentazione sta fallendo nei tribunali di tutto il mondo.

La causa del New York Times

La causa del New York Times contro OpenAI e Microsoft, intentata nel dicembre 2023, è stata il primo colpo di quella che si preannuncia come anni di contenzioso. La causa ha dimostrato che ChatGPT poteva riprodurre articoli del Times protetti da copyright quasi alla lettera. Ha mostrato che il modello poteva aggirare i paywall riassumendo gli articoli in modo così completo che gli utenti non avevano alcun motivo di visitare la fonte originale.

Questo non è "trasformazione". Questa è sostituzione del mercato. Quando un'IA può sostituire la funzione di un abbonamento a un giornale, la difesa del fair use crolla.

La ribellione degli artisti

Gli artisti visivi sono stati tra i primi a riconoscere la minaccia. I generatori di immagini addestrati su miliardi di opere d'arte potevano replicare lo stile dei singoli artisti con una precisione devastante. Un prompt come "nello stile di [artista vivente]" poteva produrre opere illimitate che competeva direttamente con il sostentamento del creatore originale.

Le azioni legali collettive per conto degli artisti visivi stanno ora avanzando nei tribunali. Ma gli artisti non hanno aspettato la risoluzione legale. Hanno sviluppato contromisure tecniche.

Strumenti come Glaze e Nightshade aggiungono perturbazioni impercettibili alle immagini che avvelenano l'addestramento dell'IA. Un'immagine raccolta appare normale agli esseri umani ma causa degrado del modello o output imprevedibili. È una forma digitale di trappola esplosiva sui contenuti, e si sta diffondendo rapidamente.

La chiusura delle piattaforme

Le principali piattaforme hanno chiuso le porte all'addestramento dell'IA. Reddit, che era una delle più grandi fonti di dati conversazionali per l'addestramento, ora applica tariffe proibitive per l'accesso API. Twitter/X ha bloccato del tutto i crawler IA prima di invertire la rotta e monetizzare l'accesso. Stack Overflow ha implementato termini severi contro l'addestramento dell'IA sul proprio Q&A di programmazione.

Il "web aperto" su cui le aziende di IA facevano affidamento sta diventando un mosaico di giardini recintati, ognuno dei quali impone pedaggi a qualsiasi IA che voglia accedervi.

Le barriere che si alzano contro l'estrazione dei datiAzione legaleCausa NYT contro OpenAIContenzioso Getty ImagesAzioni collettive degli autoriDifesa tecnicaProtezione dello stile GlazeAvvelenamento dati NightshadeFiligrana dei contenutiBlocco delle piattaformePaywall API di RedditRestrizioni di Stack OverflowBlocchi crawler degli editoriIl contratto sociale infrantoI motori di ricerca inviavano traffico. I motori AI assorbono valore. Lo scambio è rotto.Per le aziende AIResponsabilità legale in aumentoFonti di addestramento in diminuzionePer l'AI etica (Dweve)Status legale pulitoAccesso a fonti premium
La controffensiva legale trasforma il vecchio patto del "prima strisciare" in un confine che richiede una prova prima dell'addestramento.

Dignità dei dati: una filosofia diversa

In Dweve, abbracciamo il concetto di Dignità dei dati, un termine reso popolare dall'informatico Jaron Lanier. Il principio è semplice: se i tuoi dati contribuiscono al valore di un sistema di IA, meriti una parte di quel valore.

Non è beneficenza. Non è nemmeno etica fine a se stessa. È il fondamento per un'economia dell'IA sostenibile.

Il modello estrattivo non è mai stato economicamente valido. Dipendeva da una zona grigia legale temporanea e dall'incapacità pratica di milioni di singoli creatori di far valere i propri diritti. Con il cambiamento di entrambe le condizioni, le aziende costruite sull'estrazione affrontano un rischio esistenziale.

Un modello basato sulla dignità, al contrario, crea incentivi allineati. I creatori sono motivati a contribuire con il loro lavoro migliore perché vengono compensati. Le aziende di IA ottengono accesso a dati di qualità superiore perché pagano per la cura e la verifica. Gli utenti ottengono risultati migliori perché i dati di addestramento sono superiori.

L'architettura Dweve per la dignità dei dati

Il nostro approccio alla dignità dei dati non è solo una posizione politica. È integrato nella nostra architettura tecnica.

La pipeline di conoscenza Spindle

Dweve Spindle implementa una pipeline epistemologica in sette fasi che traccia ogni conoscenza dall'origine alla distribuzione:

  1. Candidato: Le informazioni grezze vengono identificate e contrassegnate con metadati di origine
  2. Estratto: Le informazioni strutturate vengono estratte con provenienza preservata
  3. Analizzato: Il contenuto viene scomposto in fatti atomici con stato di licenza verificato
  4. Connesso: I fatti vengono collegati al grafo della conoscenza con catene di attribuzione
  5. Verificato: La validazione multi-fonte conferma accuratezza e stato legale
  6. Certificato: Il controllo qualità conferma la conformità ai requisiti di dignità dei dati
  7. Canonico: La conoscenza verificata diventa pronta per l'IA con provenienza completa

Questa pipeline significa che possiamo risalire a qualsiasi conoscenza nel nostro sistema fino alla sua fonte originale. Possiamo dimostrare lo stato di licenza. Possiamo identificare quali creatori hanno contribuito a qualsiasi output.

I 456 set di vincoli per domini specialistici

L'architettura di Dweve Loom, composta da 456 set di vincoli specializzati, consente licenze e compensi granulari. Ogni specialista di dominio rappresenta un dominio di conoscenza distinto con le proprie fonti di dati e accordi di licenza.

Quando lo specialista del dominio legale (diritto contrattuale tedesco) elabora una query, sappiamo esattamente quali editori legali e studi legali hanno contribuito a quella capacità. Quando lo specialista del dominio medico (oncologia) fornisce informazioni, possiamo risalire alle riviste mediche, ai database clinici e agli istituti di ricerca che hanno fornito la conoscenza.

Questa granularità consente una condivisione dei ricavi sofisticata. Invece di vaghe affermazioni sull'"addestramento su internet", possiamo calcolare con precisione quanto ogni fonte di dati ha contribuito a ciascuna capacità.

Dweve Spindle: il pipeline per la dignità dei datiPipeline epistemologica in sette fasi1. CandidatoInformazionigrezze identificate2. EstrattoStrutturatocon provenienza3. AnalizzatoFatti atomicilicenza verificata4. CollegatoGrafo dellaconoscenza collegato5. VerificatoValidazionemulti-fonte6. CertificatoQA completatofiducia 0.7+7. CanonicoPronto per l'IA con piena provenienzaOgni fatto tracciato alla fonte + stato della licenzaGerarchia di 32 agenti valida in ogni faseLoom: licenze granulari456 specialisti di dominio con fonti dati separateCondivisione dei ricavi calcolata per specialistaContributori di dati pagati proporzionalmenteMesh: sovranità federataI dati restano ai creatoriAddestramento che preserva la privacySMPC + crittografia omomorfica
Spindle rende operativa la data dignity trasportando insieme origine, diritti, stato della licenza e vincoli degli specialisti di dominio.

Il mercato dei dati del commercio equo e solidale

Stiamo costruendo le infrastrutture per una nuova economia dei dati. Pensatelo come una certificazione "Fair Trade" per i dati di addestramento dell'IA.

Per i fornitori di dati

Editori, università, istituti di ricerca ed esperti di dominio possono registrare i propri contenuti sulla nostra piattaforma. Definiscono i termini di licenza. Fissano il prezzo. Mantengono il controllo.

A differenza del modello estrattivo in cui i loro contenuti venivano semplicemente presi, diventano partecipanti attivi nell'economia dell'IA. Possono scegliere quali applicazioni di IA possono usare i loro dati, a quali condizioni e a quale prezzo.

I dati di alta qualità ottengono prezzi premium. Un editore accademico con ricerca rigorosamente sottoposta a revisione paritaria può far pagare più di una content farm con clickbait ottimizzato per la SEO. Il mercato premia la qualità.

Per gli sviluppatori di IA

Le aziende che sviluppano applicazioni di IA ottengono accesso a dati di addestramento legalmente chiari con provenienza documentata. Possono dimostrare a regolatori, assicuratori e tribunali esattamente da dove provengono i loro dati di addestramento e che avevano il diritto di usarli.

Questo elimina il crescente rischio legale dei modelli addestrati su dati estratti dal web. Offre inoltre accesso alla "materia oscura" della conoscenza, i vasti archivi di informazioni di alta qualità mai disponibili sul web aperto: archivi aziendali, ricerca dietro paywall, database proprietari.

Per gli utenti finali

Gli utenti ottengono risultati migliori perché l'IA è addestrata su dati curati e di qualità superiore, piuttosto che sul rumore di internet aperto. Ottengono anche l'attribuzione: quando il nostro sistema fornisce informazioni da fonti con licenza, possiamo citare quelle fonti, consentendo verifica ed esplorazione più approfondita.

Il mercato è il luogo in cui consenso, attribuzione, pagamento e controllo del rischio aziendale diventano un unico flusso di lavoro.

L'economia della qualità sulla quantità

I critici sostengono che pagare per i dati renda lo sviluppo dell'IA economicamente insostenibile. Affermano che serva "tutto internet" per addestrare modelli capaci.

Questo riflette un pensiero superato dell'era dei "big data" degli anni 2020. Ricerche recenti hanno dimostrato in modo decisivo che la qualità dei dati conta molto più della quantità.

Considerate la matematica. L'addestramento di GPT-3 richiedeva circa 45 terabyte di testo compresso. Gran parte era scraping web di bassa qualità: sezioni commenti, spam, informazioni obsolete, errori fattuali e pura assurdità.

Un modello addestrato su 500 gigabyte di contenuti curati e di alta qualità, come libri di testo e materiale accademico, può eguagliare o superare le prestazioni di modelli addestrati su 100 volte più dati. Il rapporto segnale-rumore dei dati curati è semplicemente molto più alto.

Pagando per i dati, otteniamo accesso a contenuti mai disponibili per gli scraper: letteratura medica dietro paywall degli editori, ricerca finanziaria in database proprietari, conoscenza industriale negli archivi aziendali. Questa "materia oscura" è più pulita, più densa e più preziosa di qualsiasi cosa sul web aperto.

L'economia favorisce in realtà il modello della dignità. Paghiamo di più per byte ma ci servono molti meno byte. Accediamo a fonti premium che i crawler non potranno mai raggiungere. Ed eliminiamo la responsabilità legale che oggi minaccia le aziende basate sull'estrazione con miliardi di potenziali danni.

Qualità sulla quantità: la nuova economia dei datiModello di estrazioneOltre 45 TB di scraping webOltre il 90% di rumore di bassa qualitàResponsabilità legale in crescitaModello della dignità dei datiCirca 500 GB di contenuti curatiOltre il 95% di segnale di alta qualitàSituazione legale pulitaIl vantaggio della materia oscuraI dati concessi in licenza offrono accesso a fonti premium che i crawler non potranno mai raggiungereRiviste medicheRicerca sottoposta a revisione paritariaDati finanziariDatabase proprietariConoscenza industrialeArchivi aziendali

L'imperativo aziendale

Per i clienti enterprise, la dignità dei dati non è facoltativa. È un requisito di gestione del rischio.

Le grandi organizzazioni affrontano un'enorme esposizione alla responsabilità legale a causa di sistemi di IA addestrati su dati discutibili. Un reparto marketing che utilizza un generatore di immagini addestrato su opere d'arte estratte senza autorizzazione rischia potenziali rivendicazioni per violazione del copyright. Un reparto legale che utilizza un modello linguistico addestrato su contenuti dietro paywall rischia un'esposizione alla proprietà intellettuale. Un'organizzazione sanitaria che utilizza un modello incapace di dimostrare la provenienza dei propri dati di addestramento rischia sanzioni normative.

Le cause legali stanno arrivando. Getty Images ha citato in giudizio Stability AI. Il New York Times ha citato in giudizio OpenAI. Le associazioni di autori stanno organizzando azioni collettive. I potenziali danni ammontano a miliardi.

Le organizzazioni che utilizzano i sistemi di Dweve possono dimostrare esattamente da dove provengono i nostri dati di addestramento e che disponevamo delle licenze adeguate per tutti. Questa provenienza pulita vale molto più di qualsiasi miglioramento marginale delle capacità ottenuto da dati estratti senza autorizzazione.

Attribuzione ed economia della conoscenza

Oltre al risarcimento, la dignità dei dati richiede l'attribuzione. Quando i nostri sistemi forniscono informazioni derivate da fonti autorizzate, citiamo tali fonti.

Questo crea un circolo virtuoso. Gli utenti possono verificare le informazioni controllando le fonti originali. Possono esplorare gli argomenti più a fondo seguendo le citazioni. Il traffico torna ai creatori di contenuti, ripristinando il contratto sociale spezzato del web.

Per i nostri 456 set di vincoli specialistici di dominio in Dweve Loom, ogni informazione ha una catena di provenienza. Quando lo specialista del dominio medico fornisce informazioni su una malattia rara, possiamo mostrare quali articoli di riviste mediche hanno informato quella risposta. Quando lo specialista del dominio legale spiega un requisito normativo, possiamo citare le fonti statutarie.

Non è solo etica. È buona progettazione di prodotto. Gli utenti si fidano maggiormente dei sistemi quando possono verificare le affermazioni. Le imprese preferiscono sistemi in grado di dimostrare il proprio ragionamento. L'attribuzione costruisce fiducia.

Il futuro che stiamo costruendo

L'era dell'estrazione sta finendo. Ciò che verrà dopo si sta decidendo ora.

Un percorso conduce a un patrimonio comune avvelenato. I creatori adottano misure protettive sempre più aggressive. La qualità dei dati di addestramento si degrada. Lo sviluppo dell'IA si arresta o diventa appannaggio di poche aziende con vantaggi derivanti da dati legacy.

L'altro percorso conduce a un'economia della conoscenza sostenibile. I creatori vengono compensati per i loro contributi. I dati di qualità sono disponibili a chi è disposto a pagarli equamente. Lo sviluppo dell'IA continua con ampia partecipazione e benefici distribuiti.

In Dweve stiamo costruendo le infrastrutture per il secondo percorso. La nostra riduzione del consumo energetico del 96% dimostra che un'IA efficiente è possibile. La nostra spiegabilità al 100% dimostra che un'IA trasparente è realizzabile. La nostra architettura per la dignità dei dati dimostra che un'IA etica è pratica.

Crediamo che trattare i creatori di dati con dignità non sia solo moralmente giusto. È economicamente superiore. Produce un'IA migliore addestrata su dati migliori, con uno status legale più pulito ed economie sostenibili.

Il pranzo gratis è finito. La domanda è cosa verrà dopo. Stiamo costruendo l'alternativa.

Pronti a costruire un'IA su fondamenta di dignità dei dati? Il mercato del commercio equo dei dati di Dweve offre certezza legale, dati di addestramento di qualità superiore ed economie sostenibili. Contattateci per scoprire come la dignità dei dati può diventare il vostro vantaggio competitivo.

Il percorso duraturo è un volano: le fonti di qualità vengono pagate, la provenienza viaggia, il rischio per l'acquirente diminuisce e dati migliori continuano a essere creati.