GDPR 2.0 i umjetna inteligencija: Zašto standardni veliki jezični modeli ne mogu biti usklađeni sa zakonom o zaštiti podataka

Dizajnom rješava nemogućnost zaborava u standardnim modelima

GDPR 2.0 i umjetna inteligencija: Zašto standardni veliki jezični modeli ne mogu biti usklađeni sa zakonom o zaštiti podataka

Scenarij iz noćne more

Evo scenarija koji glavnim službenicima za privatnost i službenicima za zaštitu podataka ne da spavati noću. Nije riječ o povredi podataka. Nije riječ ni o hakiranju. Riječ je o kupcu koji ostvaruje svoja temeljna prava prema europskom zakonodavstvu.

Kupac (nazovimo ga gospodin Schmidt) šalje e-poruku vašoj tvrtki. Poziva se na članak 17. Opće uredbe o zaštiti podataka: „Pravo na brisanje", poznatije kao pravo na zaborav. Više nije kupac. Želi da se njegovi osobni podaci izbrišu iz svih vaših sustava. Na to ima zakonsko pravo, a vama preostaje 30 dana za postupanje.

Za vaše tradicionalne IT sustave to je riješen problem. Vaš administrator baze podataka pokreće skriptu: DELETE FROM customers WHERE id = 'schmidt_42';. Redci nestaju iz PostgreSQL-a. Sigurnosne kopije brišu se prema vašem rasporedu čuvanja. Unosi u zapisnicima anonimiziraju se. Gospodinu Schmidtu šaljete potvrdnu e-poruku u kojoj dokumentirate što je izbrisano. Usklađenost postignuta. Postupak košta otprilike 50 EUR administrativnih troškova.

No postoji problem. Prošlog tromjesečja vaš tim za znanost o podacima upotrijebio je zapisnike korisničke podrške (uključujući tisuće e-poruka i prijepisa razgovora gospodina Schmidta tijekom njegove 8-godišnje veze s vašom tvrtkom) za fino podešavanje vaše umjetne inteligencije za korisničku službu. Taj veliki jezični model upio je Schmidtove pritužbe, njegove adrese za dostavu, njegove sporove oko plaćanja, možda čak i medicinske podatke koje je spomenuo u zahtjevu za odgovornošću za proizvod.

Schmidtovi podaci ne postoje u umjetnoj inteligenciji kao redak u tablici. Oni su razgrađeni. Tokenizirani su, pretvoreni u visokodimenzionalne vektore ugradnje i raspršeni po milijardama pokretnih zareza u težinama. Nisu pohranjeni ni u kakvom obliku čitljivom čovjeku. Postoje kao vjerojatnosna sklonost modela da generira određene nizove tokena kada se na određeni način potakne.

Dilema brisanja podataka: baza podataka naspram neuronske mreže Zašto standardni LLM-ovi u osnovi ne mogu ispuniti zahtjeve članka 17. GDPR-a TRADICIONALNA BAZA PODATAKA (SQL, PostgreSQL, itd.) id: schmidt_42 MOŽE SE OBRISATI address: Hauptstr. 15, Berlin MOŽE SE OBRISATI email: [email protected] MOŽE SE OBRISATI support_tickets: [list of 47] MOŽE SE OBRISATI DELETE WHERE id='schmidt_42'; USKLAĐENO S GDPR-OM VELIKI JEZIČNI MODEL (GPT, Claude, Llama, itd.) Milijarde težina s pomičnim zarezom Podaci gospodina Schmidta raspršeni su po težinama Naredba DELETE ne postoji Zahtijevalo bi potpunu ponovnu obuku modela (~5 mil. EUR) NIJE USKLAĐENO S GDPR-OM Kazna: do 4 % globalnog prihoda Standardni LLM-ovi ne mogu kirurški ukloniti pojedinačne podatke. Arhitektura je u osnovi nekompatibilna s GDPR-om.

Ne možete pokrenuti SQL upit na neuronskoj mreži. Ne možete utvrditi koji specifični neuroni "drže" adresu za dostavu gospodina Schmidta. Ako modelu postavite upit "Koja je adresa za kupca schmidt_42?", možda će je generirati iz svojih raspadnutih sjećanja. Ili možda neće. Ali podaci su tu, ugrađeni u matematičku strukturu težina modela.

Da biste istinski "izbrisali" podatke gospodina Schmidta, morali biste potpuno uništiti model i ponovno ga istrenirati od nule, pažljivo isključujući sve podatke povezane s njim. Ako je taj model stajao 5 milijuna eura i trebalo je tri mjeseca da se istrenira na klasteru H100 GPU-ova, jedan GDPR zahtjev jednog kupca upravo je postao financijska katastrofa.

A imate 2 milijuna kupaca. Što se događa kada sljedeći zahtjev za brisanje stigne sutra? A onaj nakon njega prekosutra?

Pravna stvarnost: članak 17. GDPR-a u detalje

Članak 17. GDPR-a je nedvosmislen. Navodi da "ispitanik ima pravo od voditelja obrade ishoditi brisanje osobnih podataka koji se na njega odnose bez nepotrebnog odgađanja."

Uredba definira brisanje kao činjenje podataka "više nedostupnima." Europski sudovi i tijela za zaštitu podataka dosljedno su to tumačili kao zahtjev za stvarno brisanje, a ne samo skrivanje ili deaktivaciju podataka. Podaci moraju biti uništeni na način koji onemogućuje oporavak.

Za neuronske mreže istrenirane na osobnim podacima, to stvara nemoguću situaciju:

  • Podaci nisu "pohranjeni" u bilo kojem obliku koji se može povratiti. Pretvoreni su u statističke obrasce raspoređene po milijardama parametara.
  • Ne postoji operacija "brisanja". Arhitekture neuronskih mreža ne pružaju mehanizam za uklanjanje utjecaja specifičnih primjera za treniranje.
  • Ponovno treniranje je ekonomski neisplativo. Za velike modele, potpuno ponovno treniranje košta milijune eura i traje mjesecima.
  • Djelomično ponovno treniranje ne funkcionira. Tehnike poput "mašinskog od-učenja" ne mogu dokazivo ukloniti podatke. Duh podataka ostaje detektabilan.

Pravne posljedice su ozbiljne. Kršenja GDPR-a mogu rezultirati kaznama do 20 milijuna eura ili 4% globalnog godišnjeg prometa, ovisno o tome što je veće. Za veliko poduzeće, sustavna nemogućnost poštivanja zahtjeva za brisanje mogla bi rezultirati odgovornošću u milijardama.

Članak 17. postaje problem fizičkog brisanja: redovi u bazi podataka mogu se izbrisati, neuronske težine ne mogu.

Zašto je "strojno zaboravljanje" lažno obećanje

Akademska zajednica računalnih znanosti grozničavo radi na području koje se naziva "strojno zaboravljanje". Cilj je razviti algoritme koji mogu kirurški ažurirati težine modela kako bi "zaboravili" određene primjere za treniranje bez potrebe za potpunim ponovnim treniranjem.

To zvuči obećavajuće. U praksi je to neriješen problem za velike modele, a vjerojatno i nerješiv s obzirom na temeljna matematička ograničenja.

Problem 1: Katastrofalno zaboravljanje

Neuronske mreže uče prilagođavajući težine kako bi smanjile pogrešku predviđanja na cijelom skupu podataka za treniranje. Težine kodiraju preklapajuće, distribuirane reprezentacije. Pokušaj kirurške izmjene težina radi uklanjanja jednog dijela znanja obično oštećuje strukturni integritet povezanog znanja.

Istraživači su otkrili da pokušaji zaboravljanja uzrokuju "katastrofalno zaboravljanje" pri čemu model gubi sposobnosti daleko šire od ciljanih podataka. Model treniran na podacima korisničke službe mogao bi "zaboraviti" kako oblikovati gramatički ispravne rečenice nakon postupka zaboravljanja usmjerenog na jednog korisnika.

Problem 2: Provjera je nemoguća

Čak i nakon postupka zaboravljanja, kako dokazati da su podaci doista nestali? Sofisticirani napadi poput napada zaključivanja o članstvu i napada inverzijom modela mogu otkriti je li određeni podatak bio dio skupa za treniranje. Istraživanja su pokazala da trenutne tehnike zaboravljanja padaju na tim testovima. Statistički potpis podataka za treniranje ostaje vidljiv.

Ako regulator revidira vaš model i utvrdi da, unatoč vašem postupku "zaboravljanja", model i dalje pokazuje obrasce karakteristične za podatke gospodina Schmidta, niste u skladu s propisima. Teret dokazivanja je na vama da pokažete potpuno brisanje, a s trenutnom tehnologijom taj se dokaz ne može pružiti.

Problem 3: Pravni presedan

Europska tijela za zaštitu podataka još nisu službeno odlučila zadovoljava li strojno zaboravljanje zahtjeve GDPR-a. Međutim, trend provedbe propisa sugerira da će zahtijevati dokazivo i provjerljivo brisanje. "Pokrenuli smo algoritam koji je vjerojatno smanjio utjecaj podataka" vjerojatno neće zadovoljiti regulatore naviknute na sigurnost naredbi DELETE u bazama podataka.

Arhitektonsko rješenje: odvajanje rasuđivanja i podataka

U Dweveu smo rano prepoznali da je strojno zaboravljanje zamka. Arhitektonski problem ne možete riješiti algoritamskim zakrpama. Rješenje je dizajnirati AI sustave u kojima problem uopće ne postoji.

Naš pristup temelji se na temeljnom arhitektonskom načelu: strogom odvajanju sposobnosti rasuđivanja od osobnih podataka. AI model sadrži inteligenciju (sposobnost rasuđivanja, analize i generiranja). Osobni podaci žive u zasebnim, upravljivim sustavima za pohranu gdje se mogu pravilno upravljati, revidirati i brisati.

Dweveova arhitektura privatnosti po dizajnu Strogo odvajanje rasuđivanja (modela) i podataka (pohrane) omogućuje istinsku usklađenost s GDPR-om Zahtjev korisnika "Gdje je moja narudžba?" Sigurna pohrana podataka SQL / vektorska baza MOŽE SE OBRISATI Kontekstni prozor Ubrizgavanje u stvarnom vremenu Privremeno (briše se) Dweve Loom 456 skupova ograničenja BEZ OSOBNIH PODATAKA Kontekst u stvarnom vremenu (privremena radna memorija) Sustav: Ovdje je zapis o korisniku za schmidt_42: [Narudžba #DE-2024-8847, isporučena 1. studenog, praćenje: DHL-ABC123456]. Korisnik pita: "Gdje je moja narudžba?" Ovaj kontekst postoji samo tijekom obrade zahtjeva, a zatim se briše iz memorije. Generiran odgovor Kontekstni prozor odmah se briše Zahtjev za brisanje prema članku 17. GDPR-a 1. Brisanje iz SQL-a Trenutačno, potpuno 2. Model nepromijenjen Nikada nije sadržavao osobne podatke USKLAĐENO ZA 30 SEKUNDI Bez ponovnog treniranja. Bez troškova. Potpuni revizijski trag.

Načelo 1: Modeli temeljeni na ograničenjima bez osobnih podataka

Temeljni modeli tvrtke Dweve izgrađeni su pomoću otkrivanja binarnih ograničenja, a ne tradicionalnog dubokog učenja na osobnim podacima. Naše temeljne modele (1.937 algoritama u Dweve Core i 456 skupova ograničenja u Dweve Loom) treniramo isključivo na neosobnim izvorima:

  • Znanstveni radovi i tehnička dokumentacija (javno vlasništvo)
  • Repozitoriji otvorenog koda (licencirani)
  • Sintetički zadaci zaključivanja i logičke zagonetke
  • Anonimizirani, agregirani statistički obrasci
  • Formalne specifikacije i strukturirane baze znanja

Prije početka bilo kojeg postupka treniranja agresivno filtriramo osobne podatke (PII). Naš sedmostupanjski epistemološki cjevovod u Dweve Spindle uključuje automatsko otkrivanje PII-ja u fazama kandidata i ekstrakcije. Hijerarhija od 32 agenta uključuje specijalizirane agente za prepoznavanje i uklanjanje osobnih podataka prije nego što uđu u sustav znanja.

Rezultat su modeli koji razumiju jezik, logiku, zaključivanje i stručno znanje bez sadržavanja osobnih podataka bilo kojeg pojedinca. Razumiju koncept „prigovora kupca" bez poznavanja identiteta bilo kojeg konkretnog kupca. Mogu analizirati spor oko dostave, a da nikada nisu vidjeli adresu gospodina Schmidta.

Načelo 2: Ubrizgavanje konteksta u stvarnom vremenu

Ako model ne sadrži osobne podatke, kako onda pomaže gospodinu Schmidtu s njegovim konkretnim pitanjem o njegovoj konkretnoj narudžbi?

Odgovor je ubrizgavanje konteksta u stvarnom vremenu. Kada gospodin Schmidt pita „Gdje je moja narudžba?", naš sustav:

  1. Autentificira i autorizira zahtjev - Provjerava identitet gospodina Schmidta i njegovo pravo na pristup tim podacima.
  2. Ispituje sigurnu pohranu podataka - Dohvaća relevantne zapise gospodina Schmidta iz tradicionalne baze podataka usklađene s GDPR-om (njegove nedavne narudžbe, status dostave, brojeve za praćenje).
  3. Ubrizgava kontekst u radnu memoriju - Smješta dohvaćene podatke u kontekstni prozor modela zajedno s njegovim pitanjem.
  4. Generira odgovor - Model koristi svoje sposobnosti zaključivanja za analizu pruženog konteksta i generiranje korisnog odgovora.
  5. Čisti kontekst - Odmah nakon generiranja odgovora, kontekstni prozor se prazni. Osobni podaci postojali su u memoriji samo milisekunde potrebne za obradu zahtjeva.

Uporaba u osnovi postaje: „Ovdje je zapis o kupcu: [strukturirani podaci iz baze podataka]. Kupac pita: 'Gdje je moja narudžba?' Molimo pružite koristan odgovor."

Model se ne „sjeća" gospodina Schmidta između sesija. Ne prikuplja znanje o njemu. Svaka interakcija je bez stanja. Osobni podaci prolaze kroz sustav poput vode kroz cijev, dodirujući mehanizam zaključivanja samo privremeno, ali nikada se u njega ne upijaju.

Načelo 3: Upravljiv životni ciklus znanja

Dweve Spindle pruža upravljanje znanjem na razini poduzeća s potpunim upravljanjem životnim ciklusom. Svaki podatak koji ulazi u sustav prati se kroz naš sedmostupanjski epistemološki cjevovod:

  1. Kandidat: Neobrađeni podatak identificiran i označen izvorom, vremenskom oznakom i klasifikacijom podataka.
  2. Ekstrahiran: Strukturirani podatak ekstrahiran uz otkrivanje PII-ja.
  3. Analiziran: Rastavljen na atomske činjenice s klasifikacijom osjetljivosti.
  4. Povezan: Povezan s grafom znanja uz mapiranje odnosa.
  5. Provjeren: Validacija iz više izvora i potvrda točnosti.
  6. Certificiran: Osiguranje kvalitete uz ocjenu pouzdanosti.
  7. Kanonski: Autoritativni status s potpunim revizijskim tragom.

Za osobne podatke ovaj cjevovod osigurava da svaki podatak ima jasno podrijetlo, definiran rok čuvanja i put za brisanje. Kada gospodin Schmidt zatraži brisanje, možemo:

  • Identificirati svaki sustav u kojem postoje njegovi podaci
  • Provesti brisanje u svim sustavima
  • Generirati izvješće o usklađenosti koje točno pokazuje što je obrisano, kada i odakle
  • Dokazati da u težinama modela nema zaostalih podataka (jer ih tamo nikada nije ni bilo)
Dweve Spindle: Upravljanje znanjem u 7 faza za usklađenost s GDPR-om Osobni podaci nikada ne ulaze u težine modela. Potpuni revizijski trag u svakoj fazi. 1. KANDIDAT Detekcija PII Označi osobne podatke 2. IZDVOJENO Izolacija PII Preusmjeri u sigurnu bazu 3. ANALIZIRANO Klasifikacija Razina osjetljivosti 4. POVEZANO Revizija povezanosti Mapa odnosa 5. VERIFICIRANO Provjera usklađenosti Pravna osnova 6. CERTIFICIRANO Osigurana kvaliteta Politika zadržavanja 7. KANONSKO Potpuni revizijski trag Put brisanja Tijek osobnih podataka (izolirani put) Identificirano u fazi 1 PII označen Preusmjereno u fazi 2 U sigurnu pohranu Nikada ne ulazi u treniranje modela Stroga arhitektonska odvojenost Može se izbrisati na zahtjev Potpuna usklađenost s GDPR-om Tijek neosobnih podataka (put treniranja modela) Verificiran ne-PII Javno vlasništvo, licencirano Cijeli cjevovod Verifikacija u 7 faza Ulazi u treniranje ograničenja Binarno otkrivanje ograničenja Težine modela Nema GDPR odgovornosti Hijerarhija od 32 agenta Dweve Spindlea osigurava da se osobni podaci identificiraju, izoliraju i nikada ne ulaze u treniranje modela
Usklađena arhitektura odvaja osobne podatke koje treba izbrisati od sposobnosti rasuđivanja, tako da brisanje ostaje dokazivo.

Diferencijalna privatnost za agregirano učenje

Postoje legitimni slučajevi uporabe u kojima trebate učiti obrasce iz podataka koji uključuju osobne informacije. Bolnica bi mogla trenirati AI za otkrivanje ranih pokazatelja raka iz skenova pacijenata. Osiguravajuća kuća bi mogla modelirati obrasce rizika iz povijesti odštetnih zahtjeva. Banka bi mogla otkriti obrasce prijevara iz transakcijskih podataka.

Za te slučajeve, Dweve implementira diferencijalnu privatnost (DP), zlatni standard strojnog učenja koje čuva privatnost.

Diferencijalna privatnost matematički je okvir koji pruža dokaziva jamstva privatnosti. Tijekom procesa učenja dodajemo kalibrirani statistički šum izračunima. Ograničavamo utjecaj svake pojedinačne točke podataka kako bismo spriječili da dominira naučenim obrascima.

Rezultat je model koji uči obrasce na razini populacije ("Pacijenti s obilježjima X, Y, Z imaju povišen rizik od stanja W"), a da pritom ne može reproducirati specifične podatke bilo kojeg pojedinca ("Pacijent Hans Mueller ima genetski marker Z").

S diferencijalnom privatnošću možemo izračunati matematički proračun privatnosti koji se naziva epsilon (ε). Ta vrijednost kvantificira najveće moguće curenje privatnosti. Regulatorima možemo dokazati: "Vjerojatnost ponovne identifikacije bilo kojeg pojedinca iz ovog modela ograničena je na ε, što je ispod regulatornog praga." Privatnost se pretvara iz nejasnog obećanja u matematičko jamstvo s formalnim dokazom.

Ovaj pristup zadovoljava načelo GDPR-a "privatnost ugrađena u dizajn i prema zadanim postavkama" (članak 25.). Zaštita privatnosti nije naknadna misao niti kućica koju treba označiti. Ugrađena je u matematičke temelje načina na koji sustav uči.

Agregirano učenje prikazano je kao put s proračunom privatnosti od osjetljivih zapisa do obrazaca populacije.

Prednost usklađenosti

Mnoge tvrtke, osobito one sa sjedištem u jurisdikcijama sa slabijim zaštitama privatnosti, GDPR doživljavaju kao teret. Na privatnost gledaju kao na troškovno središte, pravnu prepreku, zapreku inovacijama.

Mi to vidimo drugačije. Usklađenost s GDPR-om, ako se provodi ispravno, konkurentska je prednost.

Povjerenje: Kupcima je sve važnije kako se postupa s njihovim podacima. Dokaziva predanost privatnosti (ne samo politika privatnosti skrivena sitnim slovima, već stvarne arhitektonske odluke koje zlouporabu čine nemogućom) gradi povjerenje koje se pretvara u lojalnost kupaca i spremnost na dijeljenje podataka.

Smanjenje rizika: Novčane kazne prema GDPR-u znatne su, ali reputacijska šteta od povreda privatnosti može biti i gora. Tvrtke koje ugrade privatnost u svoju arhitekturu eliminiraju čitave kategorije rizika.

Bolji sustavi: Arhitektonska ograničenja koja omogućuju privatnost (razdvajanje odgovornosti, jasni tokovi podataka, revizijski tragovi, upravljanje životnim ciklusom) također proizvode bolje projektirane sustave. Oni su lakši za održavanje, lakši za otklanjanje pogrešaka, lakši za testiranje. Privatnost i kvaliteta međusobno se pojačavaju.

Priprema za budućnost: Propisi o privatnosti samo postaju stroži. EU-ov Akt o umjetnoj inteligenciji, koji stupa na snagu 2026., dodaje dodatne zahtjeve za sustave umjetne inteligencije koji obrađuju osobne podatke. Tvrtke koje danas grade arhitekturu usklađenu s privatnošću neće sutra morati naknadno prilagođavati svoje sustave.

Što to znači za vašu organizaciju

Ako uvodite sustave umjetne inteligencije koji rade s osobnim podacima, suočavate se s izborom:

Opcija 1: Nadati se najboljem. Uvedite standardne LLM-ove, trenirajte ih na podacima kupaca i nadajte se da regulatori neće pokucati. Nadajte se da će algoritmi za "strojnо zaboravljanje" sazrijeti prije nego vas uhvate. Nadajte se da će kazne ostati teorijske.

To je pristup koji većina dobavljača umjetne inteligencije danas primjenjuje. To je također pristup koji će dovesti do velikih propusta u usklađenosti kako provedba bude jačala.

Opcija 2: Ugradite usklađenost u arhitekturu. Uvedite sustave umjetne inteligencije projektirane od samog početka tako da poštuju životni ciklus podataka, vode revizijske tragove i omogućuju istinsko brisanje. Koristite modele koji sadrže inteligenciju bez sadržavanja osobnih podataka. Provedite diferencijalnu privatnost za svako agregirano učenje koje mora dirati osobne podatke.

To je Dweve pristup. Zahtijeva više posla unaprijed, ali eliminira čitave kategorije pravnog, reputacijskog i financijskog rizika.

Put naprijed

GDPR je stupio na snagu 2018., prije nego što je postojala sadašnja generacija velikih jezičnih modela. Pisci te uredbe nisu mogli predvidjeti specifičan izazov osobnih podataka otopljenih u težinama neuronskih mreža.

No načela koja su artikulirali i dalje vrijede: pojedinci imaju temeljna prava nad svojim osobnim podacima, uključujući pravo na njihovo brisanje. Svaki AI sustav koji ne može poštivati ta prava u osnovi nije usklađen. Nije važno koliko su impresivne mogućnosti ili koliko su vrijedni uvidi. Ako ne možete izbrisati podatke, kršite zakon.

Tvrtke koje će napredovati u eri umjetne inteligencije nisu one koje prikupe najviše podataka ili istreniraju najveće modele. To su one koje grade najpouzdanije sustave. Sustave koji mogu objasniti svoje odluke, koji poštuju prava korisnika, koji mogu dokazati usklađenost arhitekturom, a ne obećanjima.

Dweve gradi AI koji poštuje prava na podatke po dizajnu. Naša Binary Constraint Discovery arhitektura osigurava da osobni podaci nikada ne ulaze u težine modela. Naša Spindle platforma za upravljanje znanjem pruža cjelovito upravljanje životnim ciklusom s potpunim revizijskim tragovima. Naše implementacije diferencijalne privatnosti omogućuju agregirano učenje s matematičkim jamstvima privatnosti.

Ako se vaša organizacija suočava sa sjecištem umjetne inteligencije i propisa o privatnosti, ako trebate AI mogućnosti bez GDPR odgovornosti, ako želite izgraditi povjerenje kupaca kroz dokazivu zaštitu privatnosti, trebali bismo razgovarati.

Pravo na zaborav nije opcija. To je zakon. I uz pravu arhitekturu, to je ostvarivo.

Put naprijed tretira GDPR usklađenost kao arhitekturu povjerenja, a ne kao pravni zakrpu.