GDPR 2.0 a AI: Prečo štandardné veľké jazykové modely nedokážu spĺňať požiadavky zákona o ochrane údajov

Zabudnutie je technicky nemožné v štandardnom veľkom jazykovom modeli. Osobné údaje rozpustené vo váhach neurónovej siete nemožno chirurgicky odstrániť bez...

GDPR 2.0 a AI: Prečo štandardné veľké jazykové modely nedokážu spĺňať požiadavky zákona o ochrane údajov

Nočná mora

Tu je scenár, ktorý nedá spávať hlavným referentom pre ochranu údajov a poverencom pre ochranu údajov. Nejde o únik údajov. Nejde o hack. Ide o zákazníka, ktorý si uplatňuje svoje základné práva podľa európskeho práva.

Zákazník (nazvime ho pán Schmidt) pošle vašej spoločnosti e-mail. Cituje článok 17 všeobecného nariadenia o ochrane údajov: „právo na výmaz", bežne známe ako právo byť zabudnutý. Už nie je zákazníkom. Chce, aby ste jeho osobné údaje vymazali zo všetkých systémov. Má na to zákonné právo a vy máte 30 dní na splnenie požiadavky.

Pre vaše tradičné IT systémy je to vyriešený problém. Správca databázy spustí skript: DELETE FROM customers WHERE id = 'schmidt_42';. Riadky zmiznú z PostgreSQL. Zálohy sa vymažú podľa plánu uchovávania. Záznamy v denníkoch sa anonymizujú. Pánovi Schmidtovi pošlete potvrdzujúci e-mail s dokumentáciou o tom, čo bolo vymazané. Súlad je dosiahnutý. Proces stojí približne 50 EUR na administratívnych nákladoch.

Je tu však problém. Minulý štvrťrok váš tím dátovej vedy použil denníky zákazníckej podpory (vrátane tisícov e-mailov a prepisov chatov od pána Schmidta počas jeho 8-ročného vzťahu s vašou spoločnosťou) na doladenie vašej umelej inteligencie pre zákaznícky servis. Tento veľký jazykový model absorboval Schmidtove sťažnosti, jeho dodacie adresy, jeho platobné spory, možno aj zdravotné informácie, ktoré spomenul v reklamácii za škodu spôsobenú výrobkom.

Schmidtove údaje neexistujú v umelej inteligencii ako riadok v tabuľke. Boli rozpustené. Boli tokenizované, prevedené na vysoko-dimenzionálne vektory vloženia a rozptýlené naprieč miliardami váh s pohyblivou rádovou čiarkou. Nie sú uložené v žiadnej čitateľnej podobe. Existujú ako pravdepodobnostná tendencia modelu generovať určité sekvencie tokenov, keď je vyzvaný určitým spôsobom.

Dilema mazania údajov: databáza verzus neurónová sieť Prečo štandardné LLM v zásade nedokážu vyhovieť článku 17 GDPR TRADIČNÁ DATABÁZA (SQL, PostgreSQL, atď.) id: schmidt_42 VYMAZATEĽNÉ address: Hauptstr. 15, Berlin VYMAZATEĽNÉ email: [email protected] VYMAZATEĽNÉ support_tickets: [list of 47] VYMAZATEĽNÉ DELETE WHERE id='schmidt_42'; VYHOVUJE GDPR VEĽKÝ JAZYKOVÝ MODEL (GPT, Claude, Llama, atď.) Miliardy váh s pohyblivou rádovou čiarkou Údaje pána Schmidta sú rozpustené vo váhach Príkaz DELETE neexistuje Vyžadovalo by úplné pretrénovanie modelu (~5 mil. EUR) NEVYHOVUJE GDPR Pokuta: až 4 % celosvetových tržieb Štandardné LLM nedokážu chirurgicky odstrániť jednotlivé údaje. Architektúra je v zásade nezlučiteľná s GDPR.

Nemôžete spustiť SQL dotaz na neurónovej sieti. Nemôžete identifikovať, ktoré konkrétne neuróny „držia" dodaciu adresu pána Schmidta. Ak model vyzvete otázkou „Aká je adresa zákazníka schmidt_42?", môže ju vygenerovať zo svojich rozpustených spomienok. Alebo nemusí. Dáta sú však tam, zapečené do matematickej štruktúry váh modelu.

Aby ste dáta pána Schmidta skutočne „vymazali", museli by ste model úplne zničiť a natrénovať ho odznova, pričom by ste starostlivo vylúčili všetky dáta s ním spojené. Ak taký model stál 5 miliónov eur a trénoval sa tri mesiace na klastri GPU H100, jediná žiadosť podľa GDPR od jediného zákazníka sa práve stala finančnou katastrofou.

A vy máte 2 milióny zákazníkov. Čo sa stane, keď zajtra príde ďalšia žiadosť o vymazanie? A ďalšia o deň neskôr?

Právna realita: Článok 17 GDPR podrobne

Článok 17 GDPR je jednoznačný. Uvádza, že „dotknutá osoba má právo dosiahnuť od prevádzkovateľa bez zbytočného odkladu vymazanie osobných údajov, ktoré sa jej týkajú."

Nariadenie definuje vymazanie ako zabezpečenie toho, aby údaje „už neboli dostupné." Európske súdy a orgány na ochranu údajov to dôsledne interpretovali ako požiadavku na skutočné vymazanie, nielen skrytie alebo deaktiváciu údajov. Údaje musia byť zničené spôsobom, ktorý znemožňuje ich obnovenie.

Pre neurónové siete trénované na osobných údajoch to vytvára nemožnú situáciu:

  • Údaje nie sú „uložené" v žiadnej obnoviteľnej forme. Boli transformované na štatistické vzory rozložené naprieč miliardami parametrov.
  • Neexistuje žiadna operácia „vymazať". Architektúry neurónových sietí neposkytujú žiadny mechanizmus na odstránenie vplyvu konkrétnych tréningových príkladov.
  • Retrénovanie je ekonomicky neúnosné. Pre veľké modely stojí úplné retrénovanie milióny eur a trvá mesiace.
  • Čiastočné retrénovanie nefunguje. Techniky ako „machine unlearning" nedokážu preukázateľne odstrániť dáta. Duch dát zostáva zistiteľný.

Právne následky sú závažné. Za porušenie GDPR môžu byť uložené pokuty až do výšky 20 miliónov eur alebo 4 % celosvetového ročného obratu, podľa toho, ktorá suma je vyššia. Pre veľký podnik by systematická neschopnosť vyhovieť žiadostiam o vymazanie mohla znamenať záväzky v miliardách.

Článok 17 sa stáva problémom fyzického vymazania: riadky databázy možno vymazať, neurónové váhy nie.

Prečo je „strojové zabúdanie“ falošným sľubom

Akademická komunita v oblasti počítačovej vedy sa zúfalo snaží rozvíjať oblasť nazývanú „strojové zabúdanie“. Cieľom je vyvinúť algoritmy, ktoré dokážu chirurgicky aktualizovať váhy modelu, aby „zabudol“ konkrétne tréningové príklady bez nutnosti úplného pretrénovania.

To znie sľubne. V praxi je to pre veľké modely nevyriešený problém a vzhľadom na základné matematické obmedzenia pravdepodobne aj neriešiteľný.

Problém 1: Katastrofické zabúdanie

Neurónové siete sa učia úpravou váh tak, aby minimalizovali chybu predikcie na celom tréningovom súbore. Váhy kódujú prekrývajúce sa, distribuované reprezentácie. Pokus o chirurgickú úpravu váh s cieľom odstrániť jeden kus vedomostí zvyčajne poškodí štrukturálnu integritu súvisiacich vedomostí.

Výskumníci zistili, že pokusy o zabúdanie spôsobujú „katastrofické zabúdanie“, pri ktorom model stráca schopnosti ďaleko presahujúce cielené dáta. Model trénovaný na dátach zákazníckej podpory by mohol po postupe zabúdania zameranom na jediného zákazníka „zabudnúť“, ako tvoriť gramaticky správne vety.

Problém 2: Overenie je nemožné

Aj po postupe zabúdania, ako dokážete, že dáta naozaj zmizli? Sofistikované útoky, ako sú útoky na základe členstva v tréningovej množine a útoky na inverziu modelu, dokážu zistiť, či boli konkrétne dáta súčasťou tréningovej množiny. Výskum ukázal, že súčasné techniky zabúdania tieto testy nezvládajú. Štatistická stopa tréningových dát zostáva zistiteľná.

Ak regulátor vykoná audit vášho modelu a zistí, že napriek vášmu postupu „zabúdania“ model stále vykazuje vzorce charakteristické pre dáta pána Schmidta, nie ste v súlade s predpismi. Dôkazné bremeno je na vás, aby ste preukázali úplné vymazanie, a so súčasnou technológiou tento dôkaz poskytnúť nemožno.

Problém 3: Právny precedens

Európske orgány na ochranu údajov zatiaľ formálne nerozhodli o tom, či strojové zabúdanie spĺňa požiadavky GDPR. Trend v presadzovaní práva však naznačuje, že budú vyžadovať preukázateľné a overiteľné vymazanie. „Spustili sme algoritmus, ktorý pravdepodobne znížil vplyv dát“ pravdepodobne neuspokojí regulátorov zvyknutých na istotu príkazov DELETE v databázach.

Architektonické riešenie: Oddelenie uvažovania a dát

V spoločnosti Dweve sme si už skoro uvedomili, že strojové zabúdanie je pasca. Architektonický problém nemôžete vyriešiť algoritmickými záplatami. Riešením je navrhnúť systémy umelej inteligencie tak, aby problém vôbec nevznikol.

Náš prístup je založený na základnom architektonickom princípe: prísnom oddelení schopností uvažovania od osobných údajov. Model umelej inteligencie obsahuje inteligenciu (schopnosť uvažovať, analyzovať a generovať). Osobné údaje žijú v samostatných, spravovateľných úložiskách, kde ich možno riadne spravovať, auditovať a mazať.

Architektúra Dweve založená na súkromí Prísne oddelenie uvažovania (model) a údajov (úložisko) umožňuje skutočné dodržiavanie GDPR Požiadavka používateľa "Kde je moja objednávka?" Bezpečné úložisko údajov SQL / vektorová databáza VYMAZATEĽNÉ Kontextové okno Vkladanie za behu Dočasné (vymazané) Dweve Loom 456 sád obmedzení ŽIADNE OSOBNÉ ÚDAJE Kontext za behu (dočasná pracovná pamäť) Systém: Tu je záznam o zákazníkovi pre schmidt_42: [Objednávka č. DE-2024-8847, odoslaná 1. novembra, sledovanie: DHL-ABC123456]. Zákazník sa pýta: "Kde je moja objednávka?" Tento kontext existuje iba počas spracovania požiadavky a potom sa vymaže z pamäte. Vygenerovaná odpoveď Kontextové okno sa okamžite vymaže Žiadosť o vymazanie podľa článku 17 GDPR 1. Vymazať z SQL Okamžité, úplné 2. Model nezmenený Nikdy neobsahoval osobné údaje VYHOVUJE DO 30 SEKÚND Bez preškoľovania. Bez nákladov. Úplný auditný záznam.

Princíp 1: Modely založené na obmedzeniach bez osobných údajov

Základné modely Dweve sú postavené na Binary Constraint Discovery, nie na tradičnom hlbokom učení na osobných údajoch. Naše základné modely (1 937 algoritmov v Dweve Core a 456 množín obmedzení v Dweve Loom) trénujeme výhradne na neosobných zdrojoch:

  • Vedecké články a technická dokumentácia (verejná doména)
  • Repozitáre s otvoreným zdrojovým kódom (licencované)
  • Syntetické logické úlohy a logické hádanky
  • Anonymizované, agregované štatistické vzory
  • Formálne špecifikácie a štruktúrované znalostné bázy

Pred začiatkom akéhokoľvek tréningového procesu dôsledne filtrujeme osobné identifikovateľné informácie (PII). Naša sedemstupňová epistemologická pipeline v Dweve Spindle zahŕňa automatickú detekciu PII v rámci fáz Candidate a Extracted. Hierarchia 32 agentov zahŕňa špecializovaných agentov na identifikáciu a odstránenie osobných údajov skôr, než sa dostanú do znalostného systému.

Výsledkom sú modely, ktoré rozumejú jazyku, logike, uvažovaniu a doménovým znalostiam bez toho, aby obsahovali osobné informácie konkrétneho jednotlivca. Rozumejú konceptu „sťažnosti zákazníka" bez toho, aby vedeli, kto je konkrétny zákazník. Dokážu analyzovať spor o doručenie bez toho, aby niekedy videli adresu pána Schmidta.

Princíp 2: Injekcia kontextu za behu

Ak model neobsahuje osobné údaje, ako pomôže pánovi Schmidtovi s jeho konkrétnou otázkou o jeho konkrétnej objednávke?

Odpoveďou je injekcia kontextu za behu. Keď sa pán Schmidt opýta „Kde je moja objednávka?", náš systém:

  1. Autentifikuje a autorizuje požiadavku - Overí identitu pána Schmidta a jeho právo na prístup k týmto údajom.
  2. Dotazuje sa zabezpečeného dátového úložiska - Získa relevantné záznamy pána Schmidta z tradičnej databázy v súlade s GDPR (jeho nedávne objednávky, stav doručenia, čísla na sledovanie zásielky).
  3. Injektuje kontext do pracovnej pamäte - Umiestni získané údaje do kontextového okna modelu spolu s jeho otázkou.
  4. Generuje odpoveď - Model využíva svoje schopnosti uvažovania na analýzu poskytnutého kontextu a generovanie užitočnej odpovede.
  5. Vymaže kontext - Ihneď po vygenerovaní odpovede sa kontextové okno vyprázdni. Osobné údaje existovali v pamäti len niekoľko milisekúnd potrebných na spracovanie požiadavky.

Prompt sa v podstate stáva: „Tu je záznam o zákazníkovi: [štruktúrované údaje z databázy]. Zákazník sa pýta: ‚Kde je moja objednávka?' Poskytnite užitočnú odpoveď."

Model si pána Schmidta medzi jednotlivými reláciami „nepamätá". Nezhromažďuje o ňom žiadne poznatky. Každá interakcia je bezstavová. Osobné údaje pretekajú systémom ako voda potrubím, pričom sa dočasne dotknú systému uvažovania, ale nikdy sa doň neabsorbujú.

Princíp 3: Riadený životný cyklus znalostí

Dweve Spindle poskytuje správu znalostí na podnikovej úrovni s úplným riadením životného cyklu. Každá informácia vstupujúca do systému je sledovaná prostredníctvom našej sedemstupňovej epistemologickej pipeline:

  1. Candidate: Surová informácia identifikovaná a označená zdrojom, časovou pečiatkou a klasifikáciou údajov.
  2. Extracted: Štruktúrovaná informácia extrahovaná s detekciou PII.
  3. Analyzed: Rozložená na atómové fakty s klasifikáciou citlivosti.
  4. Connected: Prepojená so znalostným grafom s mapovaním vzťahov.
  5. Verified: Viaczdrojová validácia a potvrdenie presnosti.
  6. Certified: Zabezpečenie kvality s hodnotením spoľahlivosti.
  7. Canonical: Autoritatívny status s úplným audítorským záznamom.

Pri osobných údajoch tento proces zaručuje, že každá informácia má jasný pôvod, stanovenú dobu uchovávania a spôsob výmazu. Keď pán Schmidt požiada o vymazanie, vieme:

  • Identifikovať každý systém, v ktorom sa jeho údaje nachádzajú
  • Vykonať výmaz vo všetkých systémoch
  • Vygenerovať správu o zhode, ktorá presne ukáže, čo bolo vymazané, kedy a odkiaľ
  • Dokázať, že v žiadnych váhach modelu nezostali žiadne zvyšné údaje (pretože tam nikdy neboli)
Dweve Spindle: Riadenie vedomostí v 7 fázach pre súlad s GDPR Osobné údaje sa nikdy nedostanú do váh modelu. Úplný auditný záznam v každej fáze. 1. KANDIDÁT Detekcia PII Označiť osobné údaje 2. EXTRAHOVANÉ Izolácia PII Smerovať do zabezpečenej DB 3. ANALYZOVANÉ Klasifikácia Úroveň citlivosti 4. PREPOJENÉ Audit prepojení Mapa vzťahov 5. OVERENÉ Kontrola súladu Právny základ 6. CERTIFIKOVANÉ Zabezpečená kvalita Politika uchovávania 7. KANONICKÉ Úplný auditný záznam Cesta vymazania Tok osobných údajov (izolovaná cesta) Identifikované v 1. fáze PII označené Smerované v 2. fáze Do zabezpečeného úložiska Nikdy nevstúpi do tréningu modelu Prísne architektonické oddelenie Vymazateľné na požiadanie Plný súlad s GDPR Tok neosobných údajov (cesta tréningu modelu) Overené ako ne-PII Verejná doména, licencované Plný pipeline 7-fázové overenie Vstupuje do tréningu s obmedzeniami Binárne objavovanie obmedzení Váhy modelu Žiadna zodpovednosť GDPR Hierarchia 32 agentov Dweve Spindle zaisťuje, že osobné údaje sú identifikované, izolované a nikdy nevstúpia do tréningu modelu
Vyhovujúca architektúra oddeľuje vymazateľné osobné údaje od schopnosti uvažovania, takže výmaz zostáva dokázateľný.

Diferencované súkromie pre agregované učenie

Existujú legitímne prípady použitia, keď potrebujete naučiť sa vzorce z údajov, ktoré zahŕňajú osobné informácie. Nemocnica môže chcieť trénovať AI na detekciu skorých príznakov rakoviny z pacientskych skenov. Poisťovňa môže potrebovať modelovať rizikové vzorce z histórie poistných udalostí. Banka môže chcieť odhaľovať podvodné vzorce z transakčných údajov.

Pre tieto prípady Dweve implementuje diferencované súkromie (DP), zlatý štandard strojového učenia chrániaceho súkromie.

Diferencované súkromie je matematický rámec, ktorý poskytuje dokázateľné záruky súkromia. Počas procesu učenia pridávame do výpočtov kalibrovaný štatistický šum. Obmedzujeme vplyv každého jednotlivého údajového bodu, aby nemohol dominovať naučeným vzorcom.

Výsledkom je model, ktorý sa učí vzorce na úrovni populácie („Pacienti s charakteristikami X, Y, Z majú zvýšené riziko ochorenia W") bez toho, aby dokázal reprodukovať konkrétne údaje jednotlivca („Pacient Hans Mueller má genetický marker Z").

S diferencovaným súkromím vieme vypočítať matematický rozpočet súkromia nazývaný epsilon (ε). Táto hodnota kvantifikuje maximálny možný únik súkromia. Regulátorom môžeme dokázať: „Pravdepodobnosť opätovnej identifikácie ktoréhokoľvek jednotlivca z tohto modelu je ohraničená hodnotou ε, ktorá je pod regulačným prahom." Súkromie sa mení z vágneho prísľubu na matematickú záruku s formálnym dôkazom.

Tento prístup spĺňa zásadu GDPR „súkromie návrhom a štandardne" (článok 25). Ochrana súkromia nie je dodatočný nápad ani zaškrtávacie políčko. Je zabudovaná do matematických základov toho, ako sa systém učí.

Agregované učenie je znázornené ako cesta s rozpočtom na súkromie od citlivých záznamov k populačným vzorcom.

Konkurenčná výhoda v oblasti súladu

Mnohé spoločnosti, najmä tie so sídlom v jurisdikciách so slabšími ochranami súkromia, vnímajú GDPR ako bremeno. Súkromie považujú za nákladové stredisko, právnu prekážku, prekážku inovácií.

My to vidíme inak. Súlad s GDPR, ak sa robí správne, je konkurenčnou výhodou.

Dôvera: Zákazníci čoraz viac vnímajú, ako sa nakladá s ich údajmi. Preukázateľný záväzok k ochrane súkromia (nielen zásady ochrany osobných údajov skryté v drobnom písme, ale skutočné architektonické rozhodnutia, ktoré znemožňujú zneužitie) buduje dôveru, ktorá sa premieta do vernosti zákazníkov a ochoty zdieľať údaje.

Zníženie rizika: Pokuty podľa GDPR sú vysoké, ale reputačné škody z porušení ochrany súkromia môžu byť horšie. Spoločnosti, ktoré zabudujú súkromie do svojej architektúry, eliminujú celé kategórie rizík.

Lepšie systémy: Architektonické obmedzenia, ktoré umožňujú súkromie (oddelenie zodpovedností, explicitné toky údajov, audítorské stopy, správa životného cyklu), zároveň vedú k lepšie navrhnutým systémom. Sú udržiavateľnejšie, ľahšie sa v nich hľadajú chyby a ľahšie sa testujú. Súkromie a kvalita sa navzájom posilňujú.

Príprava na budúcnosť: Nariadenia o ochrane súkromia sa neustále sprísňujú. Akt EÚ o umelej inteligencii, ktorý nadobudne účinnosť v roku 2026, pridáva ďalšie požiadavky na systémy umelej inteligencie spracúvajúce osobné údaje. Spoločnosti, ktoré dnes vybudujú architektúru v súlade s ochranou súkromia, nebudú musieť svoje systémy zajtra prerábať.

Čo to znamená pre vašu organizáciu

Ak nasadzujete systémy umelej inteligencie, ktoré pracujú s osobnými údajmi, stojíte pred voľbou:

Možnosť 1: Dúfať v najlepšie. Nasaďte štandardné LLM, trénujte ich na údajoch zákazníkov a dúfajte, že regulátori nezaklopú. Dúfajte, že algoritmy na „zabúdanie“ strojov dozrejú skôr, než vás prichytia. Dúfajte, že pokuty zostanú len teóriou.

Toto je prístup, ktorý dnes väčšina dodávateľov umelej inteligencie používa. Je to tiež prístup, ktorý povedie k obrovským zlyhaniam v oblasti súladu, keď sa presadzovanie pravidiel zintenzívni.

Možnosť 2: Zabudovať súlad do architektúry. Nasaďte systémy umelej inteligencie navrhnuté od základov tak, aby rešpektovali životný cyklus údajov, udržiavali audítorské stopy a umožňovali skutočné vymazanie. Používajte modely, ktoré obsahujú inteligenciu bez toho, aby obsahovali osobné údaje. Implementujte diferenciálne súkromie pre akékoľvek agregované učenie, ktoré sa musí dotýkať osobných údajov.

Toto je prístup Dweve. Vyžaduje viac práce na začiatku, ale eliminuje celé kategórie právnych, reputačných a finančných rizík.

Cesta vpred

GDPR bola prijatá v roku 2018, ešte pred vznikom súčasnej generácie veľkých jazykových modelov. Tvorcovia nariadenia nemohli predvídať konkrétnu výzvu osobných údajov rozpustených do váh neurónových sietí.

Ale princípy, ktoré formulovali, zostávajú platné: jednotlivci majú základné práva na svoje osobné údaje, vrátane práva na ich vymazanie. Akýkoľvek systém umelej inteligencie, ktorý nedokáže rešpektovať tieto práva, je vo svojej podstate nevyhovujúci. Nezáleží na tom, aké pôsobivé sú schopnosti alebo aké cenné sú poznatky. Ak nemôžete údaje vymazať, porušujete zákon.

Spoločnosti, ktoré uspejú v ére umelej inteligencie, nie sú tie, ktoré zhromažďujú najviac údajov alebo trénujú najväčšie modely. Sú to tie, ktoré budujú najdôveryhodnejšie systémy. Systémy, ktoré vedia vysvetliť svoje rozhodnutia, rešpektujú práva používateľov a vedia preukázať súlad prostredníctvom architektúry, nie sľubov.

Dweve buduje umelú inteligenciu, ktorá rešpektuje práva na údaje už od návrhu. Naša architektúra Binary Constraint Discovery zaisťuje, že osobné údaje sa nikdy nedostanú do váh modelu. Naša platforma na správu znalostí Spindle poskytuje kompletnú správu životného cyklu s úplnými auditnými záznamami. Naše implementácie diferenciálneho súkromia umožňujú agregované učenie s matematickými zárukami súkromia.

Ak sa vaša organizácia zaoberá priesečníkom umelej inteligencie a právnych predpisov o ochrane súkromia, ak potrebujete možnosti umelej inteligencie bez zodpovednosti podľa GDPR, ak chcete budovať dôveru zákazníkov preukázateľnou ochranou súkromia, mali by sme sa porozprávať.

Právo byť zabudnutý nie je voliteľné. Je to zákon. A so správnou architektúrou je dosiahnuteľné.

Cesta vpred vníma súlad s GDPR ako architektúru dôvery, nie ako právnu záplatu.