GDPR 2.0 ja tehisintellekt: miks standardsed suured keelemudelid ei suuda järgida andmekaitseseadust
Õudusstsenaarium
Siin on stsenaarium, mis ei lase peamistel privaatsusametnikel ja andmekaitsespetsialistidel öösiti magada. See ei ole andmetega seotud rikkumine. See ei ole häkkimine. See on klient, kes kasutab oma põhiõigusi Euroopa seaduste alusel.
Klient (nimetagem teda härra Schmidtiks) saadab teie ettevõttele meili. Ta viitab isikuandmete kaitse üldmääruse artiklile 17: „õigus andmete kustutamisele", mida tavaliselt tuntakse õigusena olla unustatud. Ta ei ole enam klient. Ta soovib, et tema isikuandmed kustutataks kõigist teie süsteemidest. Tal on seaduslik õigus seda nõuda ja teil on täitmiseks aega 30 päeva.
Teie traditsiooniliste IT-süsteemide jaoks on see lahendatud probleem. Teie andmebaasiadministraator käivitab skripti: DELETE FROM customers WHERE id = 'schmidt_42';. Read kaovad PostgreSQL-ist. Varukoopiad kustutatakse vastavalt teie säilitusgraafikule. Logikirjed anonümiseeritakse. Saadate härra Schmidtile kinnitusmeili, milles dokumenteerite, mis kustutati. Nõuetele vastavus saavutatud. Protsess maksab ligikaudu 50 eurot halduskuludena.
Kuid on üks probleem. Eelmises kvartalis kasutas teie andmeteaduse meeskond klienditoe logisid (sealhulgas tuhandeid meile ja vestluste transkripte härra Schmidtilt tema 8-aastase suhte jooksul teie ettevõttega) teie klienditeeninduse tehisintellekti täiustamiseks. See suur keelemudel on töödelnud härra Schmidti kaebusi, tema saatmisaadresse, tema maksevaidlusi, võib-olla isegi meditsiinilist teavet, mida ta mainis tootevastutuse nõudes.
Härra Schmidti andmed ei eksisteeri tehisintellektis tabelireana. Need on lahustunud. Need on tokeniseeritud, teisendatud kõrgmõõtmelisteks manustamisvektoriteks ja hajutatud miljardite ujukoma-kaalude vahel. Neid ei salvestata üheski inimesele loetavas vormis. Need eksisteerivad tõenäosusliku kalduvusena mudelil genereerida teatud tokenijadasid, kui seda teatud viisil kutsutakse.
SQL-päringut närvivõrgu vastu käivitada ei saa. Ei saa ka tuvastada, millised konkreetsed neuronid "hoiavad" hr Schmidti tarneaadressi. Kui mudelile esitada päring "Mis on kliendi schmidt_42 aadress?", võib ta selle genereerida oma hajunud mälestustest. Või ei pruugi. Kuid andmed on seal sees, mudeli kaalude matemaatilisse struktuuri küpsetatuna.
Et hr Schmidti andmed tõeliselt "kustutada", tuleks mudel täielikult hävitada ja nullist uuesti treenida, jättes hoolikalt välja kõik temaga seotud andmed. Kui see mudel maksis 5 miljonit eurot ja selle treenimine H100 GPU-de klastril võttis kolm kuud, on ühest kliendist tulenev üksainus GDPR-i taotlus muutunud rahanduslikuks katastroofiks.
Ja teil on 2 miljonit klienti. Mis juhtub, kui homme saabub järgmine kustutamistaotlus? Ja ülehomme veel üks?
Õiguslik reaalsus: GDPR-i artikkel 17 üksikasjalikult
GDPR-i artikkel 17 on ühemõtteline. Selles on kirjas, et "andmesubjektil on õigus saada vastutavalt töötlejalt tema kohta käivate isikuandmete kustutamist põhjendamatu viivituseta".
Määrus määratleb kustutamise kui andmete "enam mitte kättesaadavaks" muutmise. Euroopa kohtud ja andmekaitseasutused on seda järjekindlalt tõlgendanud nii, et nõutud on tegelik kustutamine, mitte üksnes andmete peitmine või deaktiveerimine. Andmed tuleb hävitada viisil, mis muudab taastamise võimatuks.
Isikuandmetel treenitud närvivõrkude puhul tekitab see võimatu olukorra:
- Andmed ei ole "salvestatud" ühelgi taastataval kujul. Need on muudetud statistilisteks mustriteks, mis on jaotatud miljardite parameetrite vahel.
- "Kustutamise" toimingut ei eksisteeri. Närvivõrgu arhitektuurid ei paku mehhanismi konkreetsete treeningnäidete mõju eemaldamiseks.
- Ümbertreenimine on majanduslikult keelav. Suurte mudelite puhul maksab täielik ümbertreenimine miljoneid eurosid ja võtab kuid.
- Osaline ümbertreenimine ei toimi. Sellised tehnikad nagu "masinõppe unustamine" ei suuda andmeid tõestatavalt eemaldada. Andmete kummitus jääb tuvastatavaks.
Õiguslikud tagajärjed on rasked. GDPR-i rikkumiste eest võidakse määrata trahvi kuni 20 miljonit eurot või 4% ülemaailmsest aastakäibest, olenevalt sellest, kumb on suurem. Suurettevõtte jaoks võib süstemaatiline suutmatus kustutamistaotlusi täita kaasa tuua miljardite suuruse vastutuse.
Miks "masinõppe unustamine" on vale lubadus
Akadeemiline arvutiteaduse kogukond on palavikuliselt töötanud valdkonnaga nimega "masinõppe unustamine". Eesmärk on välja töötada algoritmid, mis suudavad kirurgilise täpsusega värskendada mudeli kaale, et "unustada" konkreetseid treeningnäiteid ilma täieliku ümbertreeninguta.
See kõlab paljulubavalt. Praktikas on see suurte mudelite puhul lahendamata probleem ja tõenäoliselt lahendamatu, arvestades fundamentaalseid matemaatilisi piiranguid.
Probleem 1: katastroofiline unustamine
Närvivõrgud õpivad, kohandades kaale, et minimeerida ennustusviga kogu treeningandmestiku ulatuses. Kaalud kodeerivad kattuvaid, jaotatud esitusi. Katse kirurgilise täpsusega kaale muuta, et eemaldada üks teadmiste osa, kahjustab tavaliselt seotud teadmiste struktuurilist terviklikkust.
Teadlased on leidnud, et unustamiskatsed põhjustavad "katastroofilist unustamist", kus mudel kaotab võimeid palju laiemalt kui sihitud andmed. Klienditeenindusandmetel treenitud mudel võib "unustada", kuidas moodustada grammatiliselt korrektseid lauseid pärast unustamisprotseduuri, mis oli suunatud ühele kliendile.
Probleem 2: kontrollimine on võimatu
Isegi pärast unustamisprotseduuri, kuidas tõestada, et andmed on tõesti kadunud? Keerukad ründed nagu liikmelisuse järeldamise ründed ja mudeli inversiooniründed suudavad tuvastada, kas konkreetsed andmed olid treeningkomplekti osa. Uuringud on näidanud, et praegused unustamistehnikad nendel testidel läbi kukuvad. Treeningandmete statistiline signatuur jääb tuvastatavaks.
Kui regulaator auditeerib teie mudelit ja leiab, et vaatamata teie "unustamis"protseduurile näitab mudel endiselt härra Schmidti andmetele iseloomulikke mustreid, olete te nõuetele mittevastav. Tõendamiskoormis on teil: peate näitama täielikku kustutamist, ja praeguse tehnoloogiaga ei saa seda tõendit esitada.
Probleem 3: õiguslik pretsedent
Euroopa andmekaitseasutused ei ole veel ametlikult otsustanud, kas masinõppe unustamine vastab isikuandmete kaitse üldmääruse nõuetele. Ent jõustamise suundumus viitab sellele, et nad nõuavad tõendatavat ja kontrollitavat kustutamist. "Me käitasime algoritmi, mis tõenäoliselt vähendas andmete mõju" ei rahulda tõenäoliselt regulaatoreid, kes on harjunud andmebaasi DELETE-lausete kindlusega.
Arhitektuurne lahendus: arutlusvõime ja andmete eraldamine
Dweve'is mõistsime varakult, et masinõppe unustamine on lõks. Arhitektuurilist probleemi ei saa lahendada algoritmiliste plaastritega. Lahendus on kujundada tehisintellektisüsteemid nii, et probleemi ei tekiks kunagi esimeses kohas.
Meie lähenemine põhineb fundamentaalsel arhitektuuripõhimõttel: arutlusvõime range eraldamine isikuandmetest. Tehisintellekti mudel sisaldab intelligentsust (võime arutleda, analüüsida ja luua). Isikuandmed asuvad eraldi, hallatavates salvestussüsteemides, kus neid saab nõuetekohaselt hallata, auditeerida ja kustutada.
Põhimõte 1: Piirangupõhised mudelid ilma isikuandmeteta
Dweve'i alusmudelid on üles ehitatud binaarse piirangute avastamise meetodil, mitte traditsioonilisel süvaõppel isikuandmete põhjal. Me treenime oma põhimudeleid (1 937 algoritmi Dweve Core'is ja 456 piirangukogumit Dweve Loom'is) rangelt mitteisikulistel allikatel:
- Teadusartiklid ja tehniline dokumentatsioon (avalik domeen)
- Avatud lähtekoodiga tarkvarahoidlad (litsentseeritud)
- Sünteetilised arutlusülesanded ja loogikamõistatused
- Anonüümseks muudetud, koondatud statistilised mustrid
- Formaalsed spetsifikatsioonid ja struktureeritud teadmusbaasid
Me filtreerime agressiivselt isikut tuvastavat teavet (PII) enne treeningprotsessi algust. Meie seitsmeastmeline epistemoloogiline torustik Dweve Spindle'is hõlmab automatiseeritud PII-tuvastust kandidaadi- ja ekstraheerimisetapis. 32-agendiline hierarhia hõlmab spetsialiseerunud agente, kes tuvastavad ja eemaldavad isikuandmed enne, kui need saavad jõuda teadmussüsteemi.
Tulemuseks on mudelid, mis mõistavad keelt, loogikat, arutlust ja valdkondlikke teadmisi, ilma et need sisaldaksid ühegi konkreetse isiku isikuandmeid. Nad mõistavad mõistet "kliendikaebus", teadmata, kes konkreetne klient on. Nad suudavad analüüsida saatmisvaidlust, ilma et oleksid kunagi näinud härra Schmidti aadressi.
Põhimõte 2: Käitusaja konteksti sisestamine
Kui mudel ei sisalda isikuandmeid, kuidas saab see aidata härra Schmidtit tema konkreetse küsimuse ja konkreetse tellimusega?
Vastus on käitusaja konteksti sisestamine. Kui härra Schmidt küsib "Kus mu tellimus on?", teeb meie süsteem järgmist:
- Autentib ja volitab taotluse - Kontrollib härra Schmidti identiteedi ja tema õiguse nendele andmetele juurde pääseda.
- Pärib turvalisest andmelaoist - Toob härra Schmidti asjakohased andmed traditsioonilisest, GDPR-ile vastavast andmebaasist (tema hiljutised tellimused, saatmisolek, jälgimisnumbrid).
- Sisestab konteksti töömällu - Paigutab hangitud andmed mudeli kontekstiaknasse koos tema küsimusega.
- Genereerib vastuse - Mudel kasutab oma arutlusvõimeid, et analüüsida esitatud konteksti ja koostada abistav vastus.
- Tühjendab konteksti - Kohe pärast vastuse genereerimist tühjendatakse kontekstiaken. Isikuandmed eksisteerisid mälus vaid need millisekundid, mis kulusid taotluse töötlemiseks.
Päring muutub sisuliselt järgmiseks: "Siin on kliendikirje: [struktureeritud andmed andmebaasist]. Klient küsib: 'Kus mu tellimus on?' Palun koosta abistav vastus."
Mudel ei "mäleta" härra Schmidtit seansside vahel. See ei kogu tema kohta teadmisi. Iga interaktsioon on olekuta. Isikuandmed voolavad läbi süsteemi nagu vesi läbi toru, puudutades arutlusmootorit ajutiselt, kuid neeldumata sellesse kunagi.
Põhimõte 3: Juhitav teadmiste elutsükkel
Dweve Spindle pakub ettevõttekvaliteediga teadmiste haldust koos täieliku elutsükli juhtimisega. Iga süsteemi sisenev infokild jälgitakse läbi meie seitsmeastmelise epistemoloogilise torustiku:
- Kandidaat: Toorinfo tuvastatakse ja märgistatakse allika, ajatempli ja andmete klassifikatsiooniga.
- Ekstraheeritud: Struktureeritud info eraldatakse koos PII-tuvastusega.
- Analüüsitud: Jaotatakse aatomilisteks faktideks koos tundlikkuse klassifikatsiooniga.
- Ühendatud: Seotakse teadmusgraafiga koos seoste kaardistamisega.
- Kontrollitud: Mitmeallikaline valideerimine ja täpsuse kinnitamine.
- Sertifitseeritud: Kvaliteeditagamine koos usaldusväärsuse hinnanguga.
- Kanooniline: Autoriteetne staatus koos täieliku auditi jäljega.
Isikuandmete puhul tagab see torustik, et igal infokillul on selge päritolu, määratletud säilitusaeg ja kustutamistee. Kui hr Schmidt taotleb andmete kustutamist, saame:
- Tuvastada kõik süsteemid, kus tema andmed asuvad
- Teostada kustutamise kõigis süsteemides
- Koostada vastavusaruande, mis näitab täpselt, mis kustutati, millal ja kust
- Tõendada, et ühtegi jääkandet pole mudeli kaaludes (sest neid seal kunagi polnud)
Diferentsiaalne privaatsus agregeeritud õppimiseks
On legitiimseid kasutusjuhtumeid, kus peate õppima mustreid andmetest, mis sisaldavad isikuandmeid. Haigla võib soovida treenida tehisintellekti, et tuvastada varajasi vähinäitajaid patsientide skaneeringutest. Kindlustusettevõte võib vajada riskimustrite modelleerimist kahjunõuete ajaloost. Pank võib soovida tuvastada pettusemustreid tehinguandmetest.
Nendel juhtudel rakendab Dweve diferentsiaalset privaatsust (DP), mis on privaatsust säilitava masinõppe kuldstandard.
Diferentsiaalne privaatsus on matemaatiline raamistik, mis annab tõestatavad privaatsusgarantiid. Õppeprotsessi käigus lisame arvutustele kalibreeritud statistilist müra. Me piirame üksikute andmepunktide mõju, et vältida nende domineerimist õpitud mustrites.
Tulemuseks on mudel, mis õpib populatsiooni tasandi mustreid („Patsientidel, kellel on tunnused X, Y, Z, on kõrgendatud risk seisundi W suhtes") ilma, et see suudaks reprodutseerida üksikisiku konkreetseid andmeid („Patsiendil Hans Muelleril on geneetiline marker Z").
Diferentsiaalse privaatsusega saame arvutada matemaatilise privaatsuseelarve, mida nimetatakse epsiloniks (ε). See väärtus kvantifitseerib maksimaalse võimaliku privaatsuslekke. Saame regulaatoritele tõestada: „Selle mudeli põhjal üksikisiku uuesti tuvastamise tõenäosus on piiratud ε-ga, mis jääb regulatiivsest lävendist allapoole." Privaatsus muutub ebamäärasest lubadusest matemaatiliseks garantiiks koos formaalse tõestusega.
See lähenemine vastab GDPR-i põhimõttele „privaatsus disaini ja vaikimisi" (artikkel 25). Privaatsuskaitse ei ole järelmõte ega märkeruut. See on sisse ehitatud süsteemi õppimise matemaatilistesse alustesse.
Vastavuse eelis
Paljud ettevõtted, eriti need, mis asuvad jurisdiktsioonides, kus privaatsuskaitse on nõrgem, peavad GDPR-i koormaks. Nad kohtlevad privaatsust kulukeskusena, õigusliku takistusena, innovatsiooni pidurina.
Me näeme seda teisiti. Nõuetekohane GDPR-ile vastavus on konkurentsieelis.
Usaldus: Kliendid hoolivad üha enam sellest, kuidas nende andmeid käsitletakse. Tõendatav pühendumus privaatsusele (mitte ainult peenes kirjas peidetud privaatsuspoliitika, vaid tegelikud arhitektuurilised otsused, mis muudavad väärkasutuse võimatuks) loob usalduse, mis muutub kliendilojaalsuseks ja valmisolekuks andmeid jagada.
Riski vähendamine: GDPR-i trahvid on märkimisväärsed, kuid privaatsusrikkumistest tulenev mainekahju võib olla hullem. Ettevõtted, kes ehitavad privaatsuse oma arhitektuuri, välistavad terveid riskikategooriaid.
Paremad süsteemid: Arhitektuurilised piirangud, mis võimaldavad privaatsust (kohustuste eraldamine, selged andmevood, auditijäljed, elutsükli haldus), toodavad ka paremini ehitatud süsteeme. Need on hooldatavamad, silutavamad, testitavamad. Privaatsus ja kvaliteet tugevdavad teineteist.
Tulevikukindlus: Privaatsusmäärused muutuvad ainult rangemaks. EL-i AI-määrus, mis jõustub 2026. aastal, lisab täiendavaid nõudeid isikuandmeid töötlevatele AI-süsteemidele. Ettevõtted, kes ehitavad täna privaatsusnõuetele vastava arhitektuuri, ei pea homme oma süsteeme ümber ehitama.
Mida see teie organisatsiooni jaoks tähendab
Kui juurutate AI-süsteeme, mis suhtlevad isikuandmetega, seisate valiku ees:
Variant 1: Loota parimat. Juurutage tavalised LLM-id, treenige neid kliendiandmetel ja lootke, et regulaatorid uksele ei koputa. Lootke, et "masinunustamise" algoritmid küpsevad enne, kui te vahele jääte. Lootke, et trahvid jäävad teoreetiliseks.
See on lähenemine, mida enamik AI-müüjaid täna kasutab. See on ka lähenemine, mis toob kaasa massiivseid vastavusrikkumisi, kui jõustamine tugevneb.
Variant 2: Ehitage vastavus arhitektuuri. Juurutage AI-süsteeme, mis on nullist kavandatud austama andmete elutsüklit, säilitama auditijälgi ja võimaldama tõelist kustutamist. Kasutage mudeleid, mis sisaldavad intelligentsust ilma isikuandmeteta. Rakendage diferentsiaalset privaatsust igasuguse koondõppe puhul, mis peab puudutama isikuandmeid.
See on Dweve lähenemine. See nõuab rohkem tööd alguses, kuid välistab terveid õiguslike, mainealaste ja rahaliste riskide kategooriaid.
Tee edasi
GDPR jõustus 2018. aastal, enne kui praegune suurte keelemudelite põlvkond eksisteeris. Määruse koostajad ei saanud ette näha isikuandmete lahustumise konkreetset väljakutset närvivõrgu kaaludesse.
Kuid nende sõnastatud põhimõtted jäävad kehtima: üksikisikutel on põhiõigused oma isikuandmetele, sealhulgas õigus nende kustutamisele. Iga AI-süsteem, mis ei suuda neid õigusi austada, on põhimõtteliselt mittenõuetele vastav. Pole tähtis, kui muljetavaldavad on võimalused või kui väärtuslikud on teadmised. Kui te ei saa andmeid kustutada, rikute seadust.
Ettevõtted, mis AI-ajastul edu saavutavad, ei ole need, mis koguvad kõige rohkem andmeid või treenivad suurimaid mudeleid. Need on ettevõtted, mis ehitavad kõige usaldusväärsemaid süsteeme. Süsteeme, mis suudavad oma otsuseid selgitada, austavad kasutajate õigusi ja suudavad tõendada vastavust arhitektuuri, mitte lubaduste kaudu.
Dweve ehitab AI-d, mis austab andmeõigusi juba disaini poolest. Meie Binary Constraint Discovery arhitektuur tagab, et isikuandmed ei jõua kunagi mudeli kaaludesse. Meie Spindle teadmiste haldamise platvorm pakub täielikku elutsükli haldust koos täielike auditijälgedega. Meie diferentsiaalse privaatsuse rakendused võimaldavad koondõpet matemaatiliste privaatsusgarantiidega.
Kui teie organisatsioon maadleb AI ja privaatsusregulatsiooni ristumiskohaga, kui vajate AI-võimalusi ilma GDPR-vastutuseta, kui soovite luua klientide usaldust tõendatava privaatsuskaitse kaudu, peaksime rääkima.
Õigus unustamisele ei ole vabatahtlik. See on seadus. Ja õige arhitektuuriga on see saavutatav.