Zināšanu grafiki: kā mākslīgais intelekts sakārto to, ko zina
Zināšanu problēma
Mākslīgais intelekts zina daudz. Patiešām, ļoti daudz. Faktus. Saistības. Modeļus. Terabaitus informācijas.
Taču zināt nav pietiekami. Svarīga ir organizācija. Tas, kā strukturējat zināšanas, nosaka, ko ar tām varat darīt. Atrast tās. Savienot tās. Spriest par tām.
Zināšanu grafiki to atrisina. Tie ir veids, kā viedākās mākslīgā intelekta sistēmas organizē to, ko tās zina. Izprotot tos, jūs saprotat mūsdienu mākslīgo intelektu.
Kas īsti ir zināšanu grafiki
Zināšanu grafiks ir entitāšu un saistību tīkls. Ne tradicionāla datubāze. Ne hierarhisks koks. Grafs. Mezgli, ko savieno šķautnes. Saistības ir skaidras.
Struktūra:
Entitātes (mezgli): Lietas. Cilvēki. Jēdzieni. Jebkas, kas pastāv vai ko var aprakstīt.
Piemēri: "Alberts Einšteins", "Relativitātes teorija", "Nobela prēmija", "1921"
Saistības (šķautnes): Kā entitātes savienojas. Nozīme rodas no savienojumiem, nevis izolācijas.
Piemēri: "Einšteins" → (izstrādāja) → "Relativitātes teorija"
"Einšteins" → (ieguva) → "Nobela prēmija"
"Nobela prēmija" → (gads) → "1921"
Rekvizīti: Entitāšu vai saistību atribūti. Papildu detaļas.
Piemēri: Einstein.birthdate = "1879-03-14"
Nobel Prize.field = "Physics"
Tas arī viss. Entitātes, saistības, rekvizīti. Vienkārša struktūra. Spēcīgs attēlojums.
Šeit ir vizuāls piemērs:
Kāpēc grafi pārspēj tradicionālās datubāzes
Tradicionālās datubāzes: tabulas un rindas. Fiksēta shēma. Stingra struktūra. Attiecības ir neveiklas.
Zināšanu grafi: elastīgi, attiecību pirmie, dabiski tiek galā ar sarežģītību.
Dabiska attiecību attēlošana:
Relāciju datubāzē, lai atrastu "Kuri ir Einšteina kolēģi, kas arī ieguvuši Nobela prēmiju?", nepieciešami vairāki JOIN. Sarežģīts vaicājums. Lēns.
Zināšanu grafā: seko attiecībām. Einšteins → (kolēģis) → Persona → (ieguvis) → Nobela prēmija. Dabiska pārvietošanās. Ātri.
Elastīga shēma:
Relāciju datubāzes: shēma jādefinē jau sākumā. Jaunu entītiju tipu vai attiecību pievienošana nozīmē shēmas izmaiņas. Migrācijas. Sāpes.
Zināšanu grafi: mezglus un šķautnes var pievienot jebkurā laikā. Shēma attīstās dabiski. Jauni attiecību tipi? Vienkārši pievieno tos. Migrācija nav nepieciešama.
Semantiskā nozīme:
Tabulas neiekodē nozīmi. Svešā atslēga ir tikai skaitlis. Nozīme nāk no lietojumprogrammas koda.
Grafa šķautnēm ir semantiski apzīmējumi. "worked_with", "inspired_by", "contradicts". Pati attiecība nes nozīmi. Vaicājama. Saprotama.
Labāks sarežģītiem vaicājumiem:
"Atrodi visus cilvēkus, kas strādājuši ar kādu, ar ko strādājis Einšteins" (2 soļu kolēģu attiecība). Triviāli grafā. Murgaini JOIN SQL.
Jebkurš datubāzes administrators, kurš rakstījis septiņu tabulu JOIN, lai atbildētu uz vienkāršu attiecību jautājumu, saprot šīs sāpes. SQL tika izstrādāts grāmatvedībai, nevis "parādi man visus, kas atrodas trīs soļu attālumā no šīs personas". Šis vaicājums kļūst par rekursīvu murgu ar pagaidu tabulām un radošiem lāstiem.
Grafi izceļas ar attiecību bagātiem vaicājumiem. Datubāzes izceļas ar agregācijām un transakcijām. Dažādi rīki dažādiem darbiem.
Kā mākslīgais intelekts izmanto zināšanu grafus
Zināšanu grafi nodrošina daudzas mākslīgā intelekta spējas:
Atbilžu sniegšana uz jautājumiem:
Lietotājs jautā: "Kurš ieguva Nobela prēmiju fizikā 1921. gadā?"
MI vaicā zināšanu grafam: Nobela prēmija → (gads) → 1921 → (joma) → Fizika → (ieguvis) → Einšteins
Atbilde: "Alberts Einšteins"
Tieša meklēšana caur attiecībām. Nav nepieciešams apstrādāt katru dokumentu par Einšteinu. Grafs iekodē atbildi.
Ieteikumu sistēmas:
"Cilvēki, kuriem patika X, patika arī Y" kļūst par grafa traversēšanu. Lietotājs → (patika) → Vienums → (patika arī) → Citi lietotāji → (patika) → Citi vienumi
Amazon, Netflix, Spotify visi izmanto zināšanu grafus. Produkti, lietotāji, preferences kā virsotnes. Pirkumi, skatījumi, vērtējumi kā šķautnes. Ieteikumi ir grafu vaicājumi.
Meklēšanas uzlabošana:
Google zināšanu grafs nodrošina šos informācijas lodziņus. Sameklē "Einšteins" un redzi dzimšanas datumu, sasniegumus, saistītās personas. Tas nav nokasīts teksts. Tās ir strukturētas zināšanas.
Grafs nodrošina semantisko meklēšanu. Ne tikai atslēgvārdu atbilstību. Izpratni par entitātēm un attiecībām. "Kas ir Einšteina sieva?" saprot, ka "sieva" ir attiecība, Einšteins ir entitāte. Grafa traversēšana atrod atbildi.
Spriešana un secināšana:
Zināšanu grafiki nodrošina loģisko spriešanu. Ja A → (apakšklase) → B un B → (apakšklase) → C, tad A → (apakšklase) → C. Transitivā spriešana. Automātiska jaunu zināšanu secināšana no esošajām.
Medicīniskie zināšanu grafiki: simptoms → (norāda uz) → slimība → (ārstē ar) → zāles. Diagnostiskā spriešana caur grafa traversēšanu.
Skaidrojamība:
Kāpēc AI pieņēma šo lēmumu? Izseko caur zināšanu grafiku. Kuri fakti tika izmantoti? Kuras attiecības? Ceļš caur grafiku parāda spriešanu. Skaidrojams AI caur redzamu zināšanu struktūru.
Eiropas regulatoriem tas īpaši patīk. ES AI akts pieprasa skaidrojamību augsta riska sistēmām. "Mūsu modelis pieņēma šo lēmumu, jo..." kam seko varbūtību sadalījums, neapmierinās regulatīvās prasības. "Šeit ir precīzs ceļš caur mūsu zināšanu grafiku, kas parāda, kuri fakti noveda pie šī secinājuma" apmierina. Grafa traversēšana nodrošina revīzijas pēdas. VDAR 22. pants pieprasa jēgpilnu informāciju par automatizētas lēmumu pieņemšanas loģiku: zināšanu grafiki padara to triviālu.
Zināšanu grafiku veidošana
Zināšanu grafa izveide nav triviāla:
- Entitāšu ieguve: Identificē entitātes tekstā. Nosaukto entitāšu atpazīšana (NER). "Alberts Einšteins" ir persona. "Nobela prēmija" ir apbalvojums. "1921" ir gads. Iegūsti entitātes no nestrukturētiem datiem.
- Attiecību ieguve: Identificē, kā entitātes ir saistītas. "Einšteins ieguva Nobela prēmiju" → Einšteins → (ieguva) → Nobela prēmija. Dabiskās valodas apstrāde nosaka attiecības. Ne vienmēr perfekti. Pastāv neskaidrības.
- Entitāšu saskaņošana: Viena entitāte, dažādi nosaukumi. "Einšteins", "A. Einšteins", "Alberts Einšteins". Visi ir viena persona. Apvieno virsotnes. Noņem dublikātus. Entitāšu saskaņošana ir būtiska un sarežģīta.
- Zināšanu integrācija: Vairāki avoti, vienas entitātes. Vikipēdija saka vienu. Enciklopēdija saka citu. Atrisini konfliktus. Nosaki patiesību. Piešķir ticamības rādītājus. Integrācija ir nepārtraukta.
- Shēmas dizains: Kādi entitāšu veidi pastāv? Kādi attiecību veidi? Īpašības? Ir nepieciešama zināma struktūra. Ontoloģijas to nosaka. Bet pietiekami elastīgas, lai attīstītos.
Lielu zināšanu grafu veidošana (miljardiem virsotņu) ir nopietna inženierija. Google zināšanu grafs satur simtiem miljardu faktu par miljardiem entitāšu. Šāds mērogs prasa sadalītas sistēmas.
Eiropas DBpedia projekts, kas radies Vācijas universitātēs, demonstrē daudzvalodu sarežģītību. Viena entitāte, divdesmit četras oficiālās ES valodas. "Albert Einstein" kļūst par "Albert Einstein" (vācu), "Albert Einstein" (franču, tāda pati pareizrakstība, cita izruna), "Άλμπερτ Αϊνστάιν" (grieķu). Entitāšu saskaņošana starp valodām ir grūtāka, nekā amerikāņi, kas veido tikai angļu valodas sistēmas, apzinās. Eiropas zināšanu grafiki ar šo sarežģītību tiek galā pēc noklusējuma: tā nav izvēle, tā ir darbības realitāte.
Zināšanu grafu vaicāšana
Īpašas vaicājumu valodas grafiem:
Cypher (Neo4j):
Rakstu atbilstības sintakse. ASCII māksla grafu rakstiem.
Piemērs: MATCH (einstein:Person {name: "Albert Einstein"})-[:WON]->(prize:Award)
RETURN prize.name
Atrod visas balvas, ko Einšteins ieguva. Raksts apraksta grafa struktūru. Vaicājums atbilst rakstam.
SPARQL (RDF grafiem):
Semantiskā tīmekļa standarts. Trīskāršu raksti.
Piemērs: SELECT ?prize WHERE { :Einstein :won ?prize . ?prize :type :NobelPrize }
Līdzīga koncepcija. Cita sintakse. Veic vaicājumus semantiskā tīmekļa datiem.
Grafa pārlūkošana:
Programmatiska pārvietošanās pa grafu. Sāc no mezgla. Seko šķautnēm. Apkopo rezultātus. Elastīgāk nekā vaicājumu valodas. Pilnīga algoritmiska kontrole.
Grafu datubāzes optimizē šos vaicājumus. Indeksēšana. Kešošana. Izkliedēta izpilde. Miljardiem mezglu, vaicājumi sekundes daļās. Ja viss izdarīts pareizi.
Zināšanu grafi Dweve
Mēs plaši izmantojam zināšanu grafus:
- Semantiskais zināšanu tīkls: Fakti tiek glabāti kā grafa mezgli. Attiecības ir skaidras. Uzticamības rādītāji uz šķautnēm. Pretrunu atrisināšana, analizējot grafu. Vairāki avoti, pretrunīgi fakti? Grafa struktūra palīdz tos atrisināt.
- Izkliedētais zināšanu grafs (Loom): Attiecību kartēšana petabaita mērogā. Neo4j dzinējs. Izkliedēts pa mezgliem. Spēja apstrādāt triljoniem mezglu. Grafa pārlūkošanas optimizācija. Vieda priekšielādēšana. Tas nav rotaļu mērogs. Tā ir ražošanas infrastruktūra.
- Starpmodāļu zināšanu saplūšana: Zināšanas no dažādiem modāļiem (teksts, attēli, strukturēti dati) tiek integrētas kopīgā grafā. Tas pats objekts parādās attēlā un tekstā? Sapludini mezglus. Apvieno zināšanas. Neviendabīgi avoti, vienota reprezentācija.
- Zināšanu grafu dzinējs (Nexus): Dinamiska uz grafiem balstīta zināšanu reprezentācija. Agenti veic vaicājumus grafam, lai iegūtu informāciju. Spriešana, pārvietojoties pa grafu. Attiecības vada lēmumu pieņemšanu. Zināšanu grafs ir atmiņas sistēma.
Ne tikai krātuve. Aktīvs spriešanas pamats. Grafa struktūra IR zināšanu organizācija.
Izaicinājumi ar zināšanu grafiem
Spēcīgi, bet ne ideāli:
- Pilnīgums: Zināšanu grafiki nekad nav pilnīgi. Vienmēr trūkst entītiju. Trūkst attiecību. Pastāv robi. Ar nezināmo jātiek galā godīgi.
- Kvalitāte: Iegūtajās zināšanās ir kļūdas. Nepareizas entītijas. Nepareizas attiecības. Ticamības rādītāji palīdz. Taču troksnis paliek. Validācija ir nepārtraukta.
- Mērogs: Miljardiem mezglu. Triljoniem šķautņu. Uzglabāšana ir pārvaldāma. Vaicājumi šādā mērogā ir sarežģīti. Nepieciešamas sadalītas sistēmas. Sarežģītība pieaug.
- Laika dinamika: Zināšanas mainās. Fakti noveco. Attiecības attīstās. Zināšanu versēšana ir sarežģīta. Ar laiku saistīti grafiki palīdz, bet palielina sarežģītību.
- Neskaidrība: "Mercury" ir planēta vai elements? Konteksts novērš neskaidrību. Taču grafikos bieži trūkst konteksta. Entītiju saskaņošana nekad nav perfekta.
- Spriešanas ierobežojumi: Grafiku struktūra ļauj veikt zināmu spriešanu. Taču loģika ir ierobežota. Varbūtību spriešana ir sarežģīta. Cēloņsakarību spriešana ir vēl sarežģītāka. Grafiki attēlo, nevis dziļi spriež.
- Datu suverenitāte: Eiropas organizācijas saskaras ar unikāliem izaicinājumiem. GDPR aizliedz noteiktu datu pārsūtīšanu ārpus ES. Zināšanu grafiki ar personas datu mezgliem jāveido, ievērojot jurisdikciju robežas. Nevar vienkārši replicēt uz globālo mākoni. Nepieciešama lokāla vai tikai ES ietvaros veikta mitināšana. Amerikas uzņēmumi, kas veido centralizētus zināšanu grafikus, to atklāj dārgā veidā, saņemot regulatīvus sodus.
Neskatoties uz izaicinājumiem, zināšanu grafiki joprojām ir labākā struktūra organizētām zināšanām lielā mērogā.
Zināšanu grafiku nākotne
Kur tas virzās?
- Automātiskā izveide: Labāka entītiju un attiecību ieguve. Precīzāk. Lielāks pārklājums. Mazāka cilvēka iejaukšanās. AI pati veido savus zināšanu grafus no neapstrādātiem datiem.
- Dinamiska atjaunināšana: Zināšanu grafu atjaunināšana reāllaikā. Notiek jaunumi. Grafiks atjauninās. Nepārtraukta zināšanu atsvaidzināšana. Vienmēr aktuāli.
- Varbūtību grafiki: Šķautnes ar varbūtībām. Nenoteiktas attiecības. Uzticamības izplatīšana. Bēza spriešana pār grafa struktūru.
- Laika grafiki: Laika apzināšanās. "Toreiz bija patiesi. Tagad nav." Vēsturiska spriešana. Nākotnes prognozēšana. Grafa evolūcijas izsekošana.
- Multimodāli grafiki: Mezgli ir attēli, audio, video, teksts. Attiecības šķērso modalitātes. Vienota zināšanu bāze neatkarīgi no avota formāta.
- Federatīvi grafiki: Vairākas organizācijas, atsevišķi grafiki. Vaicājumi pāri organizāciju robežām. Privātuma ievērošana. Izplatītas zināšanas bez centralizācijas. Eiropas Gaia-X iniciatīva ir šādas pieejas piemērs: federatīva datu infrastruktūra, kurā organizācijas saglabā suverenitāti pār savām zināšanām, vienlaikus nodrošinot pārrobežu vaicājumus. Amerikas tehnoloģiju giganti dod priekšroku centralizētiem grafiem, kurus tie kontrolē. Eiropieši dod priekšroku federatīviem grafiem, kas saglabā neatkarību. Dažādas filozofijas par zināšanu īpašumtiesībām.
Zināšanu grafiki ir infrastruktūra AI izpratnei. Jo labāks grafiks, jo gudrāka AI.
Kas jums jāatceras
- 1. Grafi ir entītijas un attiecības. Mezgli un šķautnes. Struktūra ietver nozīmi. Attiecības ir pirmšķirīgas.
- 2. Labāki par datubāzēm attiecību gadījumā. Dabiska pārvietošanās. Elastīga shēma. Semantiskās šķautnes. Izcili savienotu datu apstrādē.
- 3. Nodrošina daudzas mākslīgā intelekta iespējas. Atbilžu meklēšana, ieteikumi, meklēšana, spriešana, izskaidrojamība. Grafi to visu nodrošina.
- 4. Izveide prasa entītiju ieguvi, saskaņošanu un integrāciju. Ne automātiski. Inženiertehnisks izaicinājums. Bet tā vērts.
- 5. Grafiem ir īpašas vaicājumu valodas. Cypher, SPARQL, programmatiska pārvietošanās. Rakstu atpazīšana, nevis SQL.
- 6. Izaicinājumi pastāv. Pilnīgums, kvalitāte, mērogs, laika dinamika, neskaidrība. Kompromisi, nevis pilnība.
- 7. Nākotne ir automātiska, dinamiska, varbūtiska. Labāka izveide. Atjauninājumi reāllaikā. Nenoteiktības apstrāde. Attīstība turpinās.
Būtība
Zināšanu grafi ir tas, kā mākslīgais intelekts organizē to, ko tas zina. Ne plakani faili. Ne relāciju tabulas. Grafu struktūra, kas atspoguļo to, kā zināšanas patiesībā savienojas.
Priekšrocības ir skaidras: dabiska attiecību atspoguļošana, elastīga shēma, semantiskā nozīme, jaudīgi vaicājumi. Zināšanas kā savienots tīkls, nevis izolēti fakti.
Reālas mākslīgā intelekta sistēmas tās izmanto. Google zināšanu grafs. Amazon produktu grafs. Facebook sociālais grafs. Netflix ieteikumu grafs. Ne akadēmiski kuriozi. Produkcijas infrastruktūra.
To izveide ir sarežģīta. Entītiju ieguve. Attiecību identificēšana. Dublikātu noņemšana. Integrācija. Kvalitātes kontrole. Mēroga izaicinājumi. Bet vērtība attaisno piepūli.
Mākslīgā intelekta nākotne ir atkarīga no labākas zināšanu organizācijas. Ne tikai vairāk datu. Labāk strukturēti dati. Zināšanu grafi nodrošina šo struktūru. Grafs IR zināšanas.
Izprast zināšanu grafus nozīmē saprast, kā domā mākslīgais intelekts. Ne neironu aktivācijas. Strukturētas zināšanas. Skaidras attiecības. Spriešana caur savienojumiem. Tā ir inteliģenta informācijas organizācija.
Vēlaties zināšanu grafu infrastruktūru? Iepazīstiet Dweve semantisko zināšanu tīklu. Triljonu mezglu apstrāde. Izkliedēta grafu krātuve. Daudzmodāla zināšanu apvienošana. Ar ticamības līmeni novērtētas attiecības. Tāds zināšanu grafs, kas mērogojas līdz reālām mākslīgā intelekta lietojumprogrammām.