Dirbtinio intelekto sauga: ką ji iš tikrųjų reiškia ir kodėl ji jums svarbi

Štai ką iš tikrųjų reiškia dirbtinio intelekto sauga.

Dirbtinio intelekto sauga: ką ji iš tikrųjų reiškia ir kodėl ji jums svarbi

Tikroji saugumo problema

Dirbtinio intelekto saugumas. Šis terminas kelia vaizdinius apie žudančius robotus. Skynet. Terminatoriaus scenarijus. Mokslinės fantastikos baimės.

Tai nėra tikroji problema. Ne šiandien. Ne dar daug metų.

Tikrosios dirbtinio intelekto saugumo problemos yra kasdienės. Praktinės. Vykstančios dabar pat. Šališki įdarbinimo algoritmai. Klaidingos medicininės diagnozės. Savavaldžiai automobiliai, priimantys klaidingus sprendimus per sekundės dalį. Tai ne mokslinė fantastika. Tai šiandienos realybė.

Suprasdami, ką dirbtinio intelekto saugumas iš tikrųjų reiškia, galėsite įvertinti DI sistemas. Reikalaukite geresnių. Naudokitės jomis saugiai.

Kas iš tikrųjų yra dirbtinio intelekto saugumas

Dirbtinio intelekto saugumas reiškia užtikrinti, kad DI sistemos elgtųsi taip, kaip numatyta. Darytų tai, ko norime. Nedarytų to, ko nenorime. Skamba paprastai. Taip nėra.

Saugi DI architektūra Paaiškinamumas Atsekami samprotavimo keliai Atsparumo testavimas Kraštiniai atvejai ir priešiškos įvestys Žmogaus priežiūra Peržiūros ir perrašymo galimybė Nuolatinis stebėjimas Realaus laiko šališkumo ir nuokrypių aptikimas Nesaugi DI architektūra Juodoji dėžė Paaiškinimas neįmanomas Trapus Sugenda su nepažįstamomis įvestimis Be priežiūros Automatizuoti sprendimai Paleisk ir tikėkis Be nuolatinio vertinimo

Trys pagrindiniai iššūkiai:

  • 1. Specifikacija: Apibrėžti, ko iš tikrųjų norime. Pasirodo, tiksliai apibrėžti „gerą elgesį" yra sunku. Žmogiškosios vertybės yra sudėtingos. Priklauso nuo konteksto. Kartais prieštaringos.
  • 2. Atsparumas: Dirbtinis intelektas, veikiantis teisingai visose situacijose. Ne tik mokymo scenarijuose. Ribiniai atvejai. Priešiškos įvestys. Realaus pasaulio netvarka. DI dažnai žlunga būtent ten, kur tai svarbiausia.
  • 3. Derinimas: DI tikslai atitinka žmogiškuosius tikslus. Ne žaidimas sistema. Ne optimizavimas pagal taisyklės raidę, pažeidžiant jos dvasią. Tikras derinimas su žmogaus ketinimais.

Suklyskite nors vienoje iš šių sričių, ir DI padarys žalos. Net turėdami gerų ketinimų. Net su pažangiomis technologijomis.

Europos reguliuotojai tai supranta puikiai. ES DI aktas klasifikuoja DI sistemas pagal rizikos lygį: minimalų, ribotą, aukštą ir nepriimtiną. Aukštos rizikos sistemoms (medicinos prietaisams, kritinei infrastruktūrai, teisėsaugai, sprendimams dėl įdarbinimo) taikomi griežti reikalavimai. Paaiškinamumas nėra pasirinkimas. Atsparumo testavimas nėra derėtinas. Žmogaus priežiūra nėra malonus priedas. Tai įstatymas. Amerikos įmonės, kurios tai atranda sunkiai, dabar tai vadina „reguliavimo našta". Europos įmonės tai vadina „pagrindine inžinerijos atsakomybe".

Saugumas nėra vienas valdiklis. Specifikacija, atsparumas ir derinimas turi praeiti pro tuos pačius aukštos rizikos vartus.

Kodėl dabartinis DI nėra saugus (nuoširdi tiesa)

Šiuolaikinis DI turi esminių saugumo problemų:

Juodosios dėžės problema:

Negalite matyti, kas viduje. Neuroniniai tinklai yra nepermatomi. Milijardai svorių. Jokios žmogui suprantamos logikos. Modelis veikia (arba ne). Negalite matyti, kodėl.

Tai reiškia: negalite patikrinti saugumo. Negalite audituoti sprendimų. Negalite ištaisyti konkrečių problemų be perkvalifikavimo. Išsamiai testuojate ir tikitės, kad veiks gamyboje. Tai ne saugumas. Tai optimizmas.

Įsivaizduokite olandų statybos inžinierių, siūlantį pylimą, kurio skaičiavimai yra „patikėkite manimi, neuroninis tinklas sako, kad jis atlaikys". Arba vokiečių automobilių inžinierių, sertifikuojantį stabdžius su „mes jį išmokėme su milijonais pavyzdžių". TÜV juos išvarytų iš pastato juokais. Vis dėlto būtent taip diegiame DI panašiai kritiniams sprendimams: medicininei diagnostikai, autonominiam vairavimui, finansinės rizikos vertinimui. Tikėjimu pagrįstas požiūris į inžineriją, kurį europiečiai atsisakė prieš šimtmečius, sugrįžo, pervadintas „mašininiu mokymusi".

Priklausomybė nuo mokymo duomenų:

DI mokosi iš pavyzdžių. Jei pavyzdžiai yra šališki, DI yra šališkas. Jei pavyzdžiai yra neišsamūs, DI turi aklųjų zonų. Jei pavyzdžiai yra klaidingi, DI yra klaidingas.

Šiukšlės į vidų, šiukšlės į išorę. Tačiau saugai kritinėse sistemose „šiukšlės" reiškia žalą. Šališki sprendimai dėl paskolų. Nesąžiningi atsisakymai įdarbinti. Klaidingos medicininės diagnozės.

Trapumas:

AI excels on familiar inputs. Fails spectacularly on unfamiliar ones. Small changes in input cause massive changes in output. This is adversarial vulnerability.

Add imperceptible noise to an image. The model misclassifies completely. This isn't theoretical. It's tested. Proven. Reproducible. Current AI is fragile.

No Common Sense:

AI has no understanding. No world model. No common sense. It pattern matches. Sometimes brilliantly. Sometimes catastrophically wrong.

Ask it impossible things, it tries anyway. Ask it harmful things, it might comply. It doesn't understand. It just processes inputs.

This leads to spectacular failures that would be funny if they weren't deployed in critical systems. Medical AI confidently diagnosing patients with diseases that don't exist because the symptom pattern matched training data. Autonomous vehicles stopping for mailboxes painted to look like stop signs, technically correct pattern recognition, catastrophically wrong understanding. Legal AI citing completely fabricated case law because the citation format matched what it learned. Ask a three-year-old if you can breathe underwater, they'll say no. Ask current AI, it might generate a convincing essay explaining underwater breathing techniques, no understanding that it's physically impossible, just pattern matching from science fiction it was trained on.

Real-world safety failures

These aren't hypotheticals. They happened:

  • Autonomous Vehicle Crashes: AI failed to recognize pedestrians in certain conditions. Lighting. Clothing. Context. People died. The AI optimized for average cases, failed on edge cases.
  • Facial Recognition Bias: Higher error rates for women and minorities. Why? Training data was predominantly white males. Bias in data became bias in decisions. Real-world discrimination automated.
  • Medical AI Errors: AI recommending wrong treatments. Missing diagnoses. Why? Trained on data from specific hospitals. Didn't generalize to different populations or conditions. Optimization for metrics, not patient outcomes.
  • Content Moderation Failures: AI removing legitimate content. Missing harmful content. Context matters. Nuance matters. AI struggles with both. Censorship and abuse, automated.

In each case, the AI did what it was trained to do. The training was insufficient. The robustness was lacking. The specification was wrong. Safety failures.

European examples hit closer to home. The Netherlands' tax authority used AI to detect childcare benefit fraud: the algorithm flagged thousands of innocent families, many from immigrant backgrounds, leading to financial ruin for some. No explanation provided. No recourse available. The Dutch government ultimately paid €30,000 compensation per family, and the entire cabinet resigned. In France, an AI system used for university admissions was found to discriminate based on surnames, explicitly coded preferences that happened to correlate with ethnic origin. Both cases: the AI worked exactly as designed. The design was the problem.

Įvykiai skiriasi, bet modelis kartojasi: blogi duomenys, trapi konteksto samprata, neteisingi tikslai ir silpnos teisių gynimo priemonės.

Kas iš tikrųjų daro dirbtinį intelektą saugų

Saugumui reikia kelių lygmenų. Jokio vieno sprendimo:

Paaiškinamumas:

Turėtumėte matyti, kodėl DI priėmė sprendimą. Ne tik „suaktyvėjo neuroninis tinklas“. Tikrąsias priežastis. Atsekamą logiką. Audituojamus veiksmus.

Taisyklėmis grindžiamos sistemos čia padeda. Kiekvienas sprendimas atitinka aiškias taisykles. Galite atsekti samprotavimo kelią. Patikrinti teisingumą. Audituoti sprendimus.

Atsparumo testavimas:

Testuokite ne tik mokymo duomenimis. Priešiškais pavyzdžiais. Kraštiniais atvejais. Stresiniais testais. Jei sistema lūžta, sutaisykite ją prieš diegimą. Ne po žalos.

Kur įmanoma, formalus patikrinimas. Matematiniai elgsenos įrodymai. Šiuo metu taikymo sritis ribota, bet plečiasi.

Europos sertifikavimo įstaigos reikalauja tokio griežtumo. TÜV nesertifikuos autonominių sistemų be išsamaus atsparumo testavimo visais įmanomais scenarijais. Prancūzijos CNIL reikalauja poveikio duomenų apsaugai vertinimų prieš diegiant DI. Italijos Garante reikalauja algoritminių auditų automatizuotų sprendimų priėmimui. Tai ne biurokratija, o sukaupta patirtis. Europa yra mačiusi pakankamai tiltų griūčių, pastatų avarijų ir pramoninių nelaimių, kad suprastų, jog „dažniausiai veikia“ saugai kritinėse sistemose nepakanka. Tie patys standartai dabar taikomi ir DI.

Žmogaus priežiūra:

DI siūlo. Žmogus sprendžia. Ypač kai sprendimai susiję su didele rizika. Medicininė diagnozė, paskolos patvirtinimas, teismo sprendimai. Žmogaus dalyvavimas procese yra privalomas.

Ne „DI nusprendžia, o žmogus tik prideda antspaudą“. Žmogus iš tikrųjų peržiūri. Turi priemonių suprasti. Gali pakeisti sprendimą.

Europos finansų reguliuotojai tai suprato skaudžiai per 2008 m. krizę: automatizuotos prekybos sistemos, kuriose žmogaus priežiūros buvo per mažai, sukėlė staigius kainų šuolius. Dabar ES finansų reglamentai reikalauja prasmingos žmogaus priežiūros automatizuotiems sprendimams. „Prasminga“ reiškia, kad žmogus turi pakankamai informacijos, pakankamai laiko ir pakankamai įgaliojimų iš tikrųjų įsikišti. Žmogus, kuris kas tris sekundes spusteli „patvirtinti“ DI paskolų sprendimus, nėra priežiūra, o teatras. Europos reguliuotojai tai tikrina: audituoja sprendimų laiką, peržiūrų dažnį ir tai, ar žmonės turi realių priemonių suprasti DI samprotavimus. Priežiūra, kuri negali užkirsti kelio problemoms, nėra priežiūra.

Laipsniškas diegimas:

Nedieginkite visur iš karto. Pradėkite nuo mažo. Stebėkite atidžiai. Plėskite palaipsniui. Pastebėkite problemas anksti, kol rizika dar maža.

A/B testavimas. Kanarų diegimai. Laipsniškas išleidimas. Programinės įrangos inžinerijos praktikos, pritaikytos DI saugai.

Nuolatinis stebėjimas:

DI gamyboje reikalauja nuolatinio stebėjimo. Veiklos metrika. Klaidų dažnis. Šališkumo patikros. Nuokrypio aptikimas.

Valdymo skydeliai realiuoju laiku. Automatiniai įspėjimai. Greitas reagavimas į problemas. Sauga nėra vienkartinis dalykas. Ji yra nuolatinė.

Dvejetainės apribojimų sistemos ir sauga

Skirtingos dirbtinio intelekto architektūros pasižymi skirtingomis saugos savybėmis:

  • Neuroniniai tinklai (slankiojo kablelio): Nepermatomi. Sunkiai patikrinami. Trapumo problemos. Pažeidžiamumas priešiškoms atakoms. Sauga užtikrinama atliekant daugybę testų ir tikintis geriausio.
  • Apribojimais pagrįstos sistemos (pvz., Dweve Loom): Skaidrios. Aiškūs apribojimai. Atsekamas samprotavimas. Kiekvienas sprendimas atitinka logikos taisykles. Audituojamos pagal pačią jų prigimtį.

Tai neišsprendžia visų saugos problemų. Tačiau paaiškinamumas labai padeda. Galite matyti, kodėl buvo priimti sprendimai. Patikrinti, ar apribojimai yra teisingi. Ištaisyti konkrečias problemas be visiško perkvalifikavimo.

Dvejetainės operacijos užtikrina determinizmą. Tie patys įvesties duomenys, tie patys rezultatai. Atkuriama. Testuojama. Patikrinama.

Ką galite padaryti (praktiniai žingsniai)

Kaip dirbtinį intelektą naudojantis ar jo veikiamas asmuo:

  • 1. Reikalaukite paaiškinamumo: Klauskite, kodėl dirbtinis intelektas priėmė sprendimą. Jei jie negali paaiškinti, tai yra įspėjamasis signalas.
  • 2. Patikrinkite šališkumo testavimą: Ar dirbtinis intelektas buvo išbandytas su įvairiomis populiacijomis? Koks klaidų dažnis skirtingoms grupėms?
  • 3. Ieškokite žmogiškos priežiūros: Ar žmonės peržiūri sprendimus? Ar jie turi realią galią juos pakeisti?
  • 4. Supraskite apribojimus: Kokiose situacijose žinoma, kad dirbtinis intelektas suklysta? Ar jos yra dokumentuotos? Ar apie jas informuojama?
  • 5. Įsitikinkite laipsnišku diegimu: Ar tai buvo diegiama atsargiai? Ar iš karto visur vienu metu?
  • 6. Stebėkite problemas: Ar vykdoma nuolatinė stebėsena? Kaip greitai reaguojama į problemas?
  • 7. Reguliavimo reikalavimų laikymasis: Ar tai atitinka reguliavimo standartus (ES dirbtinio intelekto aktas ir kt.)? Ar yra atskaitomybė?

Jūs turite galią. Pasinaudokite ja. Reikalaukite saugaus dirbtinio intelekto. Nepriimkite atsakymo „pasitikėkite mumis, tai dirbtinis intelektas“.

Praktinė dirbtinio intelekto sauga prasideda tada, kai kiekvienas pasitikėjimo teiginys tampa dalyku, kurį galite patikrinti.

Ekonominė nesaugaus dirbtinio intelekto kaina

Saugos nesėkmės yra ne tik etinės problemos; jos yra finansinės katastrofos. Europos įmonės to išmoko brangiai.

Tiesioginės išlaidos:

Nyderlandų vaiko priežiūros išmokų skandalas mokesčių mokėtojams kainavo daugiau nei 1 mlrd. eurų kompensacijų. „Air France“ susidūrė su 800 000 eurų bauda, kai jų veido atpažinimo įlaipinimo sistema diskriminavo keleivius. Vokietijos sveikatos draudikai sumokėjo milijonus baudų, kai dirbtiniu intelektu pagrįsti sprendimai dėl išmokų pažeidė medicinos privatumo taisykles.

Tai nėra kraštiniai atvejai. Taip nutinka, kai diegiate dirbtinį intelektą be saugos patikros.

Prarastos galimybės:

Britų bankai atsisakė DI paskolų sistemų po šališkumo skandalų: metų trukmės plėtra, milijoninės investicijos, viskas išmesta, nes sauga nebuvo prioritetas nuo pat pradžių. Ispanijos ligoninės nutraukė diagnostinio DI naudojimą, kai auditoriai negalėjo patikrinti sprendimų priėmimo procesų. Švedijos valstybinės įstaigos atšaukė automatizavimo planus, negalėdamos įrodyti atitikties BDAR.

Kurti du kartus (vieną kartą neteisingai, kitą teisingai) kainuoja brangiau nei iš pradžių sukurti teisingai. Europos viešųjų pirkimų specialistai tai supranta. Amerikos rizikos kapitalo investuotojai to dar mokosi.

Reguliavimo baudos:

Už ES DI akto pažeidimus gresia baudos iki 35 mln. eurų arba 7 % metinės pasaulinės apyvartos, priklausomai nuo to, kuri suma didesnė. BDAR jau parodė Europos pasirengimą vykdyti priežiūrą: vien 2023 m. skirtos 1,6 mlrd. eurų baudų. Įmonės, laikančios DI saugą pasirenkamu dalyku, dabar supranta, kad ji yra privaloma.

Matematika paprasta: investuoti į saugą iš anksto kainuoja mažiau nei taisyti padarinius vėliau. Europos įmonės to išmoko per skaudžią patirtį. Dabar jos to reikalauja nuo pat pradžių.

Kultūriniai požiūriai į DI saugą

Europos ir Amerikos požiūriai į DI saugą iš esmės skiriasi ne tik reguliavimu, bet ir inžinerijos filosofija.

Silicio slėnio požiūris:

Veik greitai, laužyk dalykus, tobulink. Pirma diek, problemas taisyk vėliau. Sauga yra funkcija, kurią pridedi pasiekęs produkto ir rinkos atitiktį. Priimtinas gedimų dažnis yra toks, kokį vartotojai pakęs. Inovacijų greitis svarbesnis už kruopščią patikrą. Prašyk atleidimo, ne leidimo.

Tai tinka interneto programoms. Paspaudei ne tą mygtuką, perkrauk puslapį. O medicininė diagnostika? Savavaldės transporto priemonės? Finansiniai sprendimai, turintys įtakos žmonių gyvenimams? Laužyti dalykus reiškia pakenkti žmonėms.

Europos inžinerijos požiūris:

Matuok du kartus, kirpk vieną kartą. Tikrink prieš diegdamas. Sauga yra architektūrinė, ne pasirenkama. Priimtiną gedimų dažnį lemia rizika, o ne vartotojų pakantumas. Kruopšti patikra įgalina tvarią inovaciją. Leidimas nėra biurokratija; tai atskaitomybė.

Tai kyla iš šimtmečius trukusios fizinės inžinerijos. Griaunantys tiltai. Sugendantys pastatai. Kenkiantys medicininiai gydymo būdai. Europos inžinerijos kultūra šias pamokas išmoko per tragišką patirtį. Tie patys principai dabar taikomi skaitmeninėms sistemoms.

Ironija:

Amerikos įmonės dažnai perkelia DI sistemas, kad atitiktų Europos standartus, ir tada atranda, kad saugesnė versija veikia geriau visame pasaulyje. Paaiškinamas DI nėra tik reguliavimo reikalavimas; jis padeda greičiau nustatyti ir ištaisyti problemas. Tvirtas testavimas pagauna klaidas anksčiau nei vartotojai. Žmogaus priežiūra užkerta kelią grandininėms nesėkmėms.

Sauga nėra inovacijų priešingybė. Būtent ji įgalina tvarią inovaciją. Europiečiai šios idėjos nesugalvojo; jie tiesiog ją prisiminė, kai Silicio slėnis pamiršo.

Praktiniai keliai į saugesnes DI sistemas

Perėjimas nuo nesaugaus prie saugaus DI reikalauja konkrečių techninių pokyčių, o ne tik politikos:

Architektūros parinkimas pagal riziką:

Nustokite naudoti tą pačią architektūrą viskam. Didelės svarbos sprendimams reikia patikrinamų sistemų. Medicininė diagnostika, finansiniai sprendimai, savavaldės transporto priemonės: joms reikia paaiškinamo, audituojamo DI. Taisyklėmis pagrįstos sistemos, simbolinis samprotavimas, hibridiniai metodai, jungiantys neuroninius tinklus su loginėmis taisyklėmis.

Mažos rizikos programos (turinio rekomendacijos, vaizdo filtrai, žaidimų DI) gali pakęsti „juodąsias dėžes“. Tačiau Europos medicinos priemonių reglamentas aiškiai reikalauja, kad programinė įranga, priimanti diagnostinius sprendimus, turi būti paaiškinama. Rinkitės architektūrą pagal gedimo pasekmes.

Priešiškas raudonosios komandos testavimas:

Prieš diegiant, pasamdykite žmones, kurie bandytų sulaužyti jūsų DI. Ne saugumo tyrėjus, o tikrus srities ekspertus, kurie supranta, kaip sistema bus naudojama ir piktnaudžiaujama. Europos bankai dabar reikalauja priešiško DI kredito sistemų testavimo prieš reguliavimo patvirtinimą. Vokietijos automobilių įmonės samdo priešiškus testuotojus, kurie mėnesius praleidžia ieškodami kraštinių atvejų, su kuriais autonominės sistemos nesusidoroja.

Tai nėra brangu, palyginti su gedimais po diegimo. Vienas raudonosios komandos testavimo mėnuo kainuoja mažiau nei viena reguliavimo baudų diena ar vienas ieškinys dėl DI sukeltos žalos.

Laipsniškas galimybių diegimas:

Pradėkite nuo DI pagalbos, o ne DI autonomijos. Siūlykite, nespręskite. Rodykite samprotavimus, reikalaukite žmogaus patvirtinimo. Didinkite autonomiją tik įrodę saugumą kiekviename lygmenyje.

Danijos ligoninės diegia diagnostinį DI būtent taip: pirmiausia kaip antrosios nuomonės įrankį, vėliau kaip pirminį atrankos įrankį tik mažos rizikos atvejams, galiausiai kaip autonominį diagnostikos įrankį konkrečioms patvirtintoms būklėms. Kiekvienas žingsnis įrodomas kaip saugus prieš plečiant taikymo sritį. Palyginkite su sistemomis, kurios iš karto diegiamos su visa autonomija: gedimai yra nuspėjami.

Privalomi saugumo auditai:

Išoriniai auditai, o ne vidiniai testavimai. Europos reguliuotojai vis dažniau reikalauja trečiųjų šalių DI auditų didelės rizikos sistemoms. Austrijos duomenų apsaugos institucija įpareigoja atlikti algoritminio poveikio vertinimus prieš diegimą. Prancūzijos sertifikavimo įstaigos audituoja DI sprendimų priėmimą viešosiose paslaugose.

Nepriklausomi auditoriai randa problemas, kurių vidaus komandos nepastebi. Ne dėl nekompetencijos, tiesiog šviežios akys ir jokio organizacinio spaudimo paskelbti, kad viskas saugu.

Galiojimo pabaigos sąlygos DI sistemoms:

DI sistemos neturėtų veikti neribotą laiką be pakartotinio patvirtinimo. Duomenys keičiasi. Populiacijos kinta. Atsiranda kraštinių atvejų. Europos viešųjų pirkimų sutartyse vis dažniau įtraukiami privalomi pakartotinio patvirtinimo laikotarpiai: kas 12-24 mėnesius įrodykite, kad sistema vis dar veikia teisingai, arba ji bus išjungta.

Tai užkerta kelią „įdiegta ir pamiršta" problemai, kai DI sistemos, optimizuotos 2020 metų duomenims, vis dar priima sprendimus 2025 metais su nuspėjamai prastais rezultatais.

DI saugumo ateitis

Saugumo tyrimai yra aktyvūs. Tobulėja. Kelios kryptys:

  • Konstitucinis DI: DI mokymas su aiškiomis taisyklėmis. Konstituciniai elgesio apribojimai. Ne tik mokymasis iš pavyzdžių.
  • Mechanistinis interpretuojamumas: Neuroninių tinklų supratimas gilesniu lygmeniu. Ne tik įvestys ir išvestys. Vidiniai mechanizmai. Dar ankstyva stadija, bet perspektyvu.
  • Formalusis patikrinimas: Matematiniai DI elgesio įrodymai. Kol kas ribota taikymo sritis. Pamažu plečiasi. Auksinis standartas saugumo garantijoms.
  • Priešiškas mokymas: Mokymas su priešiškais pavyzdžiais. Modelių atsparumo manipuliacijoms didinimas. Nuolatinės ginklavimosi varžybos, bet pažanga reali.
  • DI saugumo standartai: IEEE, ISO, vyriausybinės įstaigos. DI saugumo standartų kūrimas. Atitiktis tampa privaloma.
  • Europos DI saugumo tyrimai: Europos institucijos pirmauja saugumą pirmiausia teikiančiame DI. CLAIRE (Confederation of Laboratories for Artificial Intelligence Research in Europe) aiškiai teikia pirmenybę patikimam DI, o ne našumo etalonams. Vokietijos tyrimų institutai orientuojasi į sertifikuojamą DI: sistemas, kurių saugumą galima įrodyti, o ne tik išbandyti. Prancūzijos INRIA kuria formaliai patikrintą mašininį mokymąsi. Olandijos universitetai tiria į šališkumą atsižvelgiančius algoritmus pagal dizainą. Kiti prioritetai nei Silicio slėnio „judėk greitai ir laužyk daiktus". Europos požiūris: judėkite atsargiai ir įrodykite, kad veikia.

Saugumas gerėja. Tačiau diegimas dažnai lenkia saugumą. Šis atotrūkis kelia susirūpinimą.

Europos reguliavimo požiūris, reikalaujantis saugumo prieš diegimą, o ne atsiprašymo po padarytos žalos, atspindi iš esmės kitokią filosofiją. Amerikos technologijų įmonės ES dirbtinio intelekto aktą laikė kliūtimi inovacijoms. Europos inžinieriai jį laikė to įteisinimu, kas turėjo būti įprasta praktika nuo pat pradžių. Skirtumas tarp inžinerijos ir verslumo: inžinieriai nevažiuos tiltu, kurio keliamoji galia 10 tonų, su 11 tonų sunkvežimiu, kad ir kaip užtikrintai jaustųsi.

Ateitis naudinga tik tada, kai saugumo tyrimai įveikia diegimo atotrūkį, kol rizika dar nespėjo išaugti.

Ką reikia įsiminti

  • 1. Dirbtinio intelekto saugumas yra apie realias, dabartines problemas. Ne mokslinę fantastiką. Šališkumas, klaidos, trapumas. Vyksta dabar.
  • 2. Dabartinis DI nėra savaime saugus. Juodosios dėžės. Priklausomas nuo duomenų. Trapus. Be sveiko proto. Saugumui reikia aktyvios inžinerijos.
  • 3. Saugumui reikia kelių lygmenų. Paaiškinamumas, testavimas, priežiūra, stebėsena. Nėra vieno sprendimo. Gynyba į gylį.
  • 4. Architektūra svarbi saugumui. Skaidrios sistemos įgalina patikrą. Dvejetainiai apribojimai užtikrina determinizmą. Rinkitės architektūrą pagal naudojimo atvejį.
  • 5. Galite reikalauti saugesnio DI. Užduokite klausimų. Reikalaukite paaiškinimų. Tikrinkite, ar yra priežiūra. Pasinaudokite savo, kaip vartotojo ar kliento, galia.
  • 6. Saugumas yra nuolatinis, ne vienkartinis. Nuolatinė stebėsena. Greitas reagavimas. Prisitaikantis tobulinimas. Niekada „baigta“.
  • 7. Pažanga vyksta. Aktyvūs tyrimai. Atsirandantys standartai. Tačiau diegimas dažnai lenkia saugumą. Būkite budrūs.

Esmė

Dirbtinio intelekto saugumas nėra apie robotų valdovų prevenciją. Tai apie tai, kad šiandieninės DI sistemos veiktų teisingai, sąžiningai ir skaidriai. Žalos prevencija, ne mokslinė fantastika.

Dabartinis DI turi realių saugumo problemų. Nepermatomumas. Šališkumas. Trapumas. Jie sukelia realią žalą. Tikriems žmonėms. Dabar pat.

Saugesnis DI yra įmanomas. Per geresnį testavimą. Paaiškinamas architektūras. Žmogaus priežiūrą. Nuolatinę stebėseną. Tai inžinerija, ne magija.

Skirtingi požiūriai turi skirtingas saugumo savybes. Apribojimais pagrįstos sistemos užtikrina skaidrumą. Neuroniniai tinklai užtikrina pajėgumą. Rinkitės pagal saugumo reikalavimus, ne tik pagal našumą.

Jūs turite galią. Reikalaukite saugumo. Reikalaukite paaiškinamumo. Reikalaukite priežiūros. Nepriimkite nepermatomų sistemų sprendimams, nuo kurių priklauso daug. Saugumas per atskaitomybę.

AI ateitis priklauso nuo saugumo užtikrinimo. Ne našumo. Našumas jau įspūdingas. Saugumas atsilieka. Uždarykite šią spragą, ir AI tampa tikrai vertinga. Palikite šią spragą, ir AI lieka rizika.

Europos reguliuotojai sukūrė šiuos saugumo reikalavimus ne tam, kad apsaugotų Europos įmones; jie juos sukūrė tam, kad apsaugotų Europos piliečius. Tačiau atsirado įdomus šalutinis poveikis: įmonės, kuriančios AI pagal Europos saugumo standartus, atrado, kad jų sistemos veikia geriau visur. Paaiškinami sprendimai, kuriuos vartotojai supranta ir kuriais pasitiki. Tvirtos sistemos, kurios susidoroja su kraštiniais atvejais. Audituojamas samprotavimas, kuris pagauna klaidas prieš diegimą. Pasirodo, saugumas ir kokybė stipriai koreliuoja.

AI pramonė susiduria su pasirinkimu: priešintis saugumo reikalavimams kaip našiai reguliacijai arba priimti juos kaip inžinerinę gerąją praktiką. Europos įmonės tą pasirinkimą jau padarė. Amerikos įmonės mokosi, kartais per milijardines reguliacines baudas, kartais per katastrofiškas nesėkmes, o kartais ir tiesiog skaitydamos inžinerinę literatūrą iš pramonės šakų, kurios saugumą išsprendė prieš dešimtmečius.

Saugumas nėra apie AI baimę. Tai apie tai, kad AI būtų verta naudoti. Sistemos, kuriomis galite pasitikėti. Sprendimai, kuriuos galite patikrinti. Technologija, kuri padeda nepakenkdama. Tai ne reguliacinė našta; tai pati AI kūrimo prasmė.

Norite iš prigimties saugesnio AI? Išbandykite Dweve Loom. Dvejetainiai apribojimai užtikrina aiškų, audituojamą samprotavimą. Kiekvienas sprendimas atsekamas per logines taisykles. Deterministinis elgesys. Tokia AI rūšis, kurioje saugumas nėra paskesnė mintis, tai architektūrinė savybė.