AI izskaidrojamība: atverot melno kasti

Mākslīgais intelekts pieņem lēmumus. Bet vai tas spēj tos izskaidrot? Lūk, kāpēc izskaidrojamība ir svarīga un kā mēs padarām MI caurskatāmu.

AI izskaidrojamība: atverot melno kasti

Uzticības problēma

Mākslīgais intelekts noraida jūsu aizdevuma pieteikumu. Kāpēc? "Modelis noteica, ka esat augsta riska klients." Tas nav izskaidrojums. Tas ir paziņojums.

MI iesaka operāciju. Kāpēc? "Neironu tīkls prognozēja pozitīvu iznākumu." Ko tas redzēja? Kuri faktori bija svarīgi? Klusums.

Uzticībai nepieciešama sapratne. Kad MI nespēj sevi izskaidrot, uzticība zūd. Izskaidrojamība nav greznība. Tā ir nepieciešamība.

Ko izskaidrojamība patiesībā nozīmē

Izskaidrojamība ir spēja saprast, kāpēc MI pieņēma konkrētu lēmumu. Ne tikai to, kāds lēmums bija. Bet arī pamatojumu, kas aiz tā stāv.

Izskaidrojuma līmeņi:

  • Globālais izskaidrojums: Kā modelis darbojas kopumā? Kādus modeļus tas izmanto? Kopējā uzvedība.
  • Lokālais izskaidrojums: Kāpēc tieši šī prognoze? Tieši šim ievaddatu kopumam? Individuāls lēmums.
  • Kontrfaktuālais izskaidrojums: Kam būtu jāmainās, lai rezultāts būtu citāds? Ja jūsu ienākumi būtu X, nevis Y, lēmums mainītos.
  • Cēloņsakarību izskaidrojums: Kuras pazīmes izraisīja lēmumu? Ne tikai korelējošas. Patiesi cēloņsakarīgas.

Dažādām lietojumprogrammām nepieciešami dažādi izskaidrojumi. Medicīniskajai diagnozei nepieciešama cēloņsakarība. Aizdevumu lēmumiem nepieciešami kontrfaktuāli. Auditam nepieciešama globāla sapratne.

Izskaidrojamība nav viena universāla atbilde; dažādiem lēmumiem nepieciešami dažādi "kāpēc" veidi.

Kāpēc izskaidrojamība ir svarīga

Ne akadēmiska ziņkāre. Praktiska nepieciešamība:

  • Uzticība un ieviešana: Cilvēki uzticas tam, ko saprot. Melnās kastes MI saskaras ar pretestību. Ārsti neizmantos diagnostikas MI, ko nevar pārbaudīt. Tiesneši nepaļausies uz sodu algoritmiem, kurus nevar izskaidrot. Izskaidrojamība ļauj ieviest MI.
  • Atkļūdošana un uzlabošana: Kad MI neizdodas, kāpēc? Bez izskaidrojumiem atkļūdošana nav iespējama. "Modelis ir 85% precīzs" nenorāda, kur rodas 15% kļūdu. Izskaidrojumi atklāj kļūdu veidus. Ļauj veikt mērķtiecīgus uzlabojumus.
  • Normatīvā atbilstība: VDAR paredz tiesības uz izskaidrojumu. ES MI akts pieprasa pārredzamību. Noteikumi nosaka izskaidrojamību. Nav izvēles iespējas. Juridiska prasība.
  • Neobjektivitātes atklāšana: Neizskaidrojams MI var būt neobjektīvs. Slēpta diskriminācija. Bez izskaidrojumiem to nevar atklāt. Nevar novērst. Izskaidrojamība atklāj, kad rase, dzimums vai citi aizsargāti atribūti ietekmē lēmumus.
  • Drošība un uzticamība: Kritiskās sistēmas pieprasa pārbaudi. Medicīna, finanses, autonomie transportlīdzekļi. "Uzticieties man" nav pietiekami. Izskaidrojumi ļauj veikt pārbaudi. Drošība prasa pārredzamību.
  • Zinātniskie atklājumi: MI atrod modeļus, kurus cilvēki nepamana. Bet kādus modeļus? Neizskaidrojams MI ir zinātnisks strupceļš. No tā nevar mācīties. Izskaidrojamība pārvērš MI par zinātnisku instrumentu.
Kad iemesls ir redzams, uzticēšanās, atkļūdošana, atbilstība, neobjektivitātes pārbaudes, drošība un atklājumi var ieslēgties.

Melnās kastes problēma

Kāpēc neironu tīklus ir grūti izskaidrot?

  • Miljardiem parametru: Lieli valodas modeļi: 175 miljardi parametru. Katrs ir skaitlis. Kopā tie kodē modeļus. Bet kurš parametrs ko dara? Neiespējami pateikt. Atsevišķi parametri ir bezjēdzīgi. Nozīme ir tikai kolektīvai uzvedībai.
  • Izkliedēti attēlojumi: Jēdzieni nav lokalizēti. "Kaķis" netiek glabāts vienā neironā. Tas ir izkliedēts tūkstošiem neironu. Aktivācijas modeļi, nevis atsevišķas vienības. Jaunas īpašības. Grūti norādīt uz "kaķa detektoru".
  • Nelineāras transformācijas: Neironu tīkli ir nelineāru funkciju kompozīcijas. Ievade → 1. slānis (nelineārs) → 2. slānis (nelineārs) → ... → Izvade. Sekot matemātikai cauri simtiem slāņu? Neiespējami.
  • Nav simboliskās spriešanas: Tīkli neizmanto noteikumus. Nav "ja-tad" loģikas. Tikai skaitliskas transformācijas. No skaitliskām darbībām nevar izvilkt loģiskus skaidrojumus. Mehānisms būtiski atšķiras no cilvēka spriešanas.

Tāpēc neironu tīkli ir "melnās kastes". Ne tāpēc, ka mēs kaut ko slēpjam. Bet tāpēc, ka iekšējais mehānisms pretojas interpretācijai.

Izskaidrojamības metodes

Pastāv metodes, kā atvērt melno kasti:

Pazīmju nozīmīgums (SHAP, LIME):

Kuras ievades pazīmes ietekmēja lēmumu? SHAP piešķir nozīmīguma rādītājus. "Vecums veicināja +15 riska rādītājam. Ienākumi veicināja -10." Lokāls skaidrojums.

LIME lokāli izveido vienkāršu modeli. Aproksimē sarežģītu modeli ar interpretējamu. Lineārā regresija. Lēmumu koks. Saproti aproksimāciju.

Ierobežojums: Parāda korelāciju, nevis cēloņsakarību. Augsta korelācija nenozīmē cēloņsakarību.

Uzmanības vizualizācija:

Transformieriem vizualizē uzmanību. Uz kuriem vārdiem modelis pievērsās? Uzmanības kartes to parāda. "Modelis pievērsās vārdam 'ne' , klasificējot noskaņojumu kā negatīvu."

Palīdz saprast. Bet uzmanība nav skaidrojums. Modelis var pievērsties nesvarīgiem vārdiem. Vai izmantot informāciju bez pievēršanās.

Nozīmīguma kartes:

Attēliem izceļ svarīgus pikseļus. "Šie pikseļi noteica klasifikāciju." Balstīts uz gradientiem. Parāda, kur modelis skatās.

Problēma: Nozīmīguma kartes var būt trokšņainas. Jutīgas pret nesvarīgām pazīmēm. Ne vienmēr uzticamas.

  • Konceptu aktivācijas vektori (CAV): Pārbauda, vai modelis izmanto cilvēkam saprotamus jēdzienus. "Vai modelis izmanto 'svītras', klasificējot zebras?" CAV mēra jēdziena klātbūtni. Semantiski skaidrojumi.
  • Lēmumu koki kā tuvinājumi: Apmāca lēmumu koku, lai atdarinātu neironu tīklu. Koks ir interpretējams. "Ja pazīme X > slieksnis, tad prognozē Y." Sarežģīta modeļa aptuvens skaidrojums.
  • Kontrfaktuāli skaidrojumi: "Ja ievade mainītos uz X, izvade būtu Y." Parāda nepieciešamās minimālās izmaiņas. "Ja ienākumi būtu €50k, nevis €40k, aizdevums tiktu apstiprināts." Rīcību veicinoši skaidrojumi.

Katra metode sniedz daļēju ieskatu. Neviena metode neizskaidro visu. Apvieno vairākas pieejas.

Pēc būtības interpretējami modeļi

Daži modeļi ir izskaidrojami pēc konstrukcijas:

  • Lēmumu koki: Seko zariem. "Ja vecums > 30 UN ienākumi > €50k, apstiprini aizdevumu." Skaidra loģika. Ideāls skaidrojums. Bet ierobežota izteiksmes spēja. Sarežģītus modeļus ir grūti.
  • Lineārie modeļi: Pazīmju svērtā summa. "Risks = 0,3×vecums + 0,5×parāds - 0,7×ienākumi." Koeficienti parāda nozīmīgumu. Interpretējams. Bet pieņem linearitāti. Reālā pasaule nav lineāra.
  • Uz noteikumiem balstītas sistēmas: Skaidri noteikumi. "Ja simptoms A un simptoms B, tad slimība C." Pilnīga caurskatāmība. Bet prasa manuālu noteikumu izveidi. Nesniedzas līdz sarežģītām jomām.
  • Vispārinātie aditīvie modeļi (GAM): Nelineāru funkciju summa. Elastīgāki par lineāriem. Joprojām interpretējami. Katras pazīmes devumu var vizualizēt. Līdzsvars starp izteiksmes spēju un interpretējamību.

Pastāv kompromiss: interpretējami modeļi ir mazāk spēcīgi. Spēcīgi modeļi ir mazāk interpretējami. Izvēle ir atkarīga no prioritātēm.

Dweve izskaidrojamības pieeja

Bināro ierobežojumu sistēmas piedāvā iedzimtu izskaidrojamību:

  • Skaidras ierobežojumu ķēdes: Katrs lēmums izsekojams līdz aktivizētajiem ierobežojumiem. "Ierobežojumi C1, C2, C5 aktivizēti → secinājums Y." Pilnīgs audita pieraksts. Nav slēptu aprēķinu.
  • 100% izskaidrojamība: Atšķirībā no tuvināšanas metodēm (SHAP, LIME), ierobežojumu skaidrojumi ir precīzi. Nav statistiska tuvinājuma. Faktiskais lēmuma ceļš. "Šie ierobežojumi izraisīja šo lēmumu" ir burtiska patiesība.
  • Cilvēkam saprotami ierobežojumi: Ierobežojumi ir loģiskas attiecības. "Ja A UN B, tad C." Nav skaitlisku svaru. Loģiski noteikumi. Cilvēki loģiku saprot dabiski.
  • Kontrfaktuālu ģenerēšana: Precīzi zini, ko mainīt. "Ierobežojums C2 neizdevās. Maini pazīmi X, lai izpildītu C2." Tieša, rīcību veicinoša atgriezeniskā saite. Bez tuvinājumiem.
  • Nav melnās kastes slāņa: Viss ir caurskatāms. Binārās darbības (XNOR, popcount) ir vienkāršas. Ierobežojumu saskaņošana ir skaidra. Nav noslēpumainu transformāciju. Tīra loģika.

Šī ir arhitektoniska izskaidrojamība. Nevis skaidrojums, kas pievienots pēc tam. Skaidrojums ir mehānisma būtība.

Precizitātes un izskaidrojamības kompromiss

Ideāla izskaidrojamība bieži nozīmē mazāku precizitāti:

  • Vienkārši modeļi: Ļoti izskaidrojami. Mazāk precīzi. Lēmumu koki nevar uztvert sarežģītus modeļus, ko spēj neironu tīkli.
  • Sarežģīti modeļi: Precīzāki. Mazāk izskaidrojami. Dziļā mācīšanās sasniedz jaunākās tehnoloģijas līmeni. Bet ir necaurredzama.
  • Vidējais ceļš: GAM, reti lineārie modeļi, sekli neironu tīkli. Līdzsvaro abus. Nav labākie nevienā.

Izvēle ir atkarīga no jomas:

  • Augstas nozīmes lēmumi: Dodiet priekšroku izskaidrojamībai. Medicīniskās diagnozes. Tiesu spriedumi. Kriminālsodi. Skaidrojums ir obligāts. Neliels precizitātes zudums ir pieņemams.
  • Zemas nozīmes lietojumi: Dodiet priekšroku precizitātei. Ieteikumu sistēmas. Reklāmu mērķēšana. Meklēšanas ranžēšana. Izskaidrojamība ir patīkama, bet ne kritiska.
  • Regulētas nozares: Izskaidrojamība ir noteikta likumā. Nav izvēles. Modelim jābūt interpretējamam. GDPR un ES Mākslīgā intelekta akts pieprasa pārredzamību.

Ideāli: gan precizitāte, gan izskaidrojamība. Pētniecība attīstās. Atšķirība samazinās. Taču kompromiss saglabājas.

Kompromiss nav abstrakts; nozares konteksts nosaka, cik tālu slīdnis jāpavirza uz izskaidrojamību.

Izskaidrojamības nākotne

Kurp tas virzās?

  • Labākas tuvināšanas metodes: Precīzāki melno kastu skaidrojumi. SHAP uzlabojumi. Jaunas vizualizācijas metodes. Tuvāk patiesajam stāvoklim.
  • Dabiski interpretējama dziļā mācīšanās: Neironu tīkli, kas veidoti izskaidrojamībai. Uzmanības mehānismi. Modulāras arhitektūras. Spriešana atdalīta no uztveres.
  • Normatīvās prasības: Izskaidrojamība ir obligāta. ES Mākslīgā intelekta akts. Citi noteikumi seko. Piespiež arhitektūras izmaiņas. Tirgus pieprasa pārredzamību.
  • Cilvēka un MI skaidrojumu dialogs: Interaktīvi skaidrojumi. Pajautājiet, kāpēc. Saņemiet atbildi. Iedziļinieties. Pakāpeniska izpratne. Nevis statiska izvade.
  • Cēloņsakarību skaidrojumi: Tālāk par korelāciju. Patiesa cēloņsakarība. Kas izraisīja šo lēmumu? Ne tikai tas, kas korelēja. Patiesa izpratne.
  • Pārbaudīti skaidrojumi: Formāla verifikācija. Matemātiski pierādāmi skaidrojumi. Matemātiskas garantijas. Kritiskām lietojumprogrammām.

Tendence ir skaidra: pārredzamība ir obligāta. Melnās kastes kļūst nepieņemamas. Izskaidrojamība pāriet no patīkamas iespējas uz obligātu prasību.

Kas jums jāatceras

  • 1. Izskaidrojamība nozīmē saprast, kāpēc. Ne tikai ko. Bet gan pamatojumu. Mehānismu. Pilnīgu caurskatāmību.
  • 2. Pastāv vairāki līmeņi. Globāls, lokāls, kontrfaktuāls, cēlonisks. Dažādām lietojumprogrammām nepieciešami dažādi skaidrojumi.
  • 3. Melnās kastes pretojas skaidrošanai. Miljardiem parametru. Izkliedēti attēlojumi. Nelineāras transformācijas. Pēc būtības necaurredzamas.
  • 4. Paņēmieni palīdz. SHAP, LIME, uzmanības vizualizācija, nozīmīguma kartes. Aptuveni skaidrojumi. Labāk nekā nekas.
  • 5. Pastāv pēc būtības interpretējami modeļi. Lēmumu koki, lineāri modeļi, noteikumi. Pēc konstrukcijas caurskatāmi. Mazāk jaudīgi, bet izskaidrojami.
  • 6. Dweve nodrošina iedzimtu izskaidrojamību. Ierobežojumu ķēdes. 100% caurskatāmība. Loģiski noteikumi. Arhitektoniski, nevis aptuveni.
  • 7. Pastāv kompromisi. Precizitāte pret izskaidrojamību. Izvēlies, ņemot vērā likmes. Regulējums arvien vairāk atbalsta caurskatāmību.
Galvenā atziņa ir kontrolsaraksts: izvēlies pareizo skaidrojuma līmeni, paņēmienu, modeli, ķēdi un riska slieksni.

Būtība

Uzticēšanās prasa sapratni. AI, ko nevaram izskaidrot, ir AI, kam nevaram uzticēties. Īpaši kritisku lēmumu gadījumā. Medicīnas. Finanšu. Tiesību. Izskaidrojamība nav izvēles jautājums.

Pašreizējais AI pārsvarā ir melnā kaste. Pastāv paņēmieni, kā ieskatīties iekšā. SHAP, LIME, uzmanības kartes. Palīdz, bet aptuveni. Nav īsta caurskatāmība.

Pēc būtības interpretējamas sistēmas piedāvā īstu izskaidrojamību. Lēmumu koki. Noteikumu sistēmas. Bināri ierobežojumi. Pēc konstrukcijas caurskatāmas. Apzinies kompromisus. Mazāk elastības, vairāk sapratnes.

Regulējums virza uz caurskatāmību. VDAR tiesības uz paskaidrojumu. ES AI akta prasības. Juridiskas prasības. Tirgus pieprasījums. Melnās kastes kļūst nepieņemamas.

Nākotne prasa abus: precizitāti UN izskaidrojamību. Pētniecība attīstās. Arhitektūras pilnveidojas. Mērķis ir AI, kas darbojas labi un pilnībā izskaidro sevi.

Pagaidām izvēlies gudri. Izproti savas prioritātes. Augstas likmes? Dod priekšroku izskaidrojamībai. Zemas likmes? Maksimizē precizitāti. Bet vienmēr apzinies kompromisu. Caurskatāmība ir uzticēšanās.

Vēlies pilnībā izskaidrojamu AI? Iepazīsti Dweve Loom un Nexus. 100% izskaidrojamība, izmantojot binārus ierobežojumus. Katrs lēmums izsekojams līdz loģiskiem noteikumiem. Pilnīga caurskatāmība. Nekādu aptuvenību. Nekādu melno kastu. Tāds AI, ko vari saprast, pārbaudīt un kam vari uzticēties.