Znalostné grafy: ako AI usporadúva to, čo vie

Google ich používa. Amazon ich používa. Znalostné grafy poháňajú najinteligentnejšie systémy AI. Tu je návod, ako fungujú a prečo sú dôležité.

Znalostné grafy: ako AI usporadúva to, čo vie

Problém vedomostí

AI vie veľa. Naozaj veľa. Fakty. Vzťahy. Vzorce. Terabajty informácií.

Ale vedieť nestačí. Dôležité je usporiadanie. Ako štruktúrujete vedomosti určuje, čo s nimi môžete robiť. Nájsť ich. Spojiť ich. Uvažovať o nich.

Znalostné grafy to riešia. Takto si najinteligentnejšie systémy AI organizujú to, čo vedia. Pochopenie ich vám pomôže pochopiť modernú AI.

Čo sú znalostné grafy v skutočnosti

Znalostný graf je sieť entít a vzťahov. Nie tradičná databáza. Nie hierarchický strom. Graf. Uzly spojené hranami. Vzťahy explicitné.

Štruktúra:

Entity (Uzly): Veci. Ľudia. Koncepty. Čokoľvek, čo existuje alebo sa dá opísať.

Príklady: "Albert Einstein", "Teória relativity", "Nobelova cena", "1921"

Vzťahy (Hrany): Ako sú entity prepojené. Význam pochádza zo spojení, nie z izolácie.

Príklady: "Einstein" → (vyvinul) → "Teória relativity"

"Einstein" → (získal) → "Nobelova cena"

"Nobelova cena" → (rok) → "1921"

Vlastnosti: Atribúty entít alebo vzťahov. Dodatočné podrobnosti.

Príklady: Einstein.birthdate = "1879-03-14"

Nobel Prize.field = "Physics"

To je všetko. Entity, vzťahy, vlastnosti. Jednoduchá štruktúra. Výkonná reprezentácia.

Tu je vizuálny príklad:

Einstein (Osoba) Teória relativity Nobelova cena 1921 vypracoval získal rok dátum narodenia: 1879-03-14 odbor: Fyzika Štruktúra znalostného grafu Uzly = entity | Šípky = vzťahy | Text nižšie = vlastnosti
Kompromis v časti „What knowledge graphs actually are“ ukazuje, kde hodnota uniká alebo kde sa vracia kontrola.

Prečo grafy porážajú tradičné databázy

Tradičné databázy: tabuľky a riadky. Pevná schéma. Rigídna štruktúra. Vzťahy sú nepraktické.

Grafy znalostí: flexibilné, zamerané na vzťahy, prirodzene zvládajú komplexnosť.

Prirodzené znázornenie vzťahov:

V relačnej databáze si otázka „Kto sú Einsteinovi kolegovia, ktorí tiež získali Nobelovu cenu?“ vyžaduje viacero JOINov. Komplexný dopyt. Pomalý.

V grafe znalostí: nasledujte vzťahy. Einstein → (kolega) → Osoba → (získal) → Nobelova cena. Prirodzené prechádzanie. Rýchle.

Flexibilná schéma:

Relačné databázy: schému definujete vopred. Pridanie nových typov entít alebo vzťahov znamená zmeny schémy. Migrácie. Bolesť.

Grafy znalostí: uzly a hrany pridávate kedykoľvek. Schéma sa vyvíja prirodzene. Nové typy vzťahov? Stačí ich pridať. Migrácia nie je potrebná.

Sémantický význam:

Tabuľky nezakódujú význam. Cudzí kľúč je len číslo. Význam pochádza z aplikačného kódu.

Hrany grafu majú sémantické označenia. „worked_with“, „inspired_by“, „contradicts“. Samotný vzťah nesie význam. Dá sa dopytovať. Dá sa pochopiť.

Lepšie pre komplexné dopyty:

„Nájdite všetkých ľudí, ktorí pracovali s niekým, s kým pracoval Einstein“ (vzťah kolegu na dva kroky). Triviálne v grafe. Nočná mora JOINov v SQL.

Každý správca databázy, ktorý napísal JOIN cez sedem tabuliek, aby odpovedal na jednoduchú otázku o vzťahu, pozná tú bolesť. SQL bol navrhnutý pre účtovníctvo, nie pre „ukáž mi všetkých do troch stupňov odlúčenia od tejto osoby“. Taký dopyt sa zmení na rekurzívnu nočnú moru s dočasnými tabuľkami a kreatívnym nadávaním.

Grafy vynikajú pri dopytoch zameraných na vzťahy. Databázy vynikajú pri agregáciách a transakciách. Rôzne nástroje pre rôzne úlohy.

Ako AI využíva grafy znalostí

Grafy znalostí poháňajú mnohé schopnosti AI:

Odpovedanie na otázky:

Používateľ sa pýta: „Kto získal Nobelovu cenu za fyziku v roku 1921?“

AI dopytuje graf znalostí: Nobelova cena → (rok) → 1921 → (odbor) → Fyzika → (získal) → Einstein

Odpoveď: „Albert Einstein“

Priame vyhľadávanie cez vzťahy. Netreba spracúvať každý dokument o Einsteinovi. Graf zakóduje odpoveď.

Odporúčacie systémy:

„Ľudia, ktorým sa páčilo X, sa páčilo aj Y“ sa stáva prechodom grafom. Používateľ → (páčilo sa) → Položka → (páčilo sa aj) → Ďalší používatelia → (páčilo sa) → Ďalšie položky

Amazon, Netflix, Spotify všetci používajú znalostné grafy. Produkty, používatelia, preferencie ako uzly. Nákupy, zobrazenia, hodnotenia ako hrany. Odporúčania sú grafové dotazy.

Rozšírenie vyhľadávania:

Znalostný graf Googlu poháňa tie informačné boxy. Vyhľadajte „Einstein“ a uvidíte dátum narodenia, úspechy, súvisiace osoby. To nie je zoškrabaný text. Je to štruktúrované poznanie.

Graf umožňuje sémantické vyhľadávanie. Nielen zhoda kľúčových slov. Pochopenie entít a vzťahov. „Kto je Einsteinova manželka?“ rozumie, že „manželka“ je vzťah a Einstein je entita. Prechod grafom nájde odpoveď.

Uvažovanie a inferencia:

Znalostné grafy umožňujú logické uvažovanie. Ak A → (podtrieda) → B a B → (podtrieda) → C, potom A → (podtrieda) → C. Tranzitívne uvažovanie. Automatická inferencia nových poznatkov z existujúcich.

Medicínske znalostné grafy: symptóm → (naznačuje) → choroba → (liečená) → liek. Diagnostické uvažovanie prostredníctvom prechodu grafom.

Vysvetliteľnosť:

Prečo AI urobila toto rozhodnutie? Prejdite cez znalostný graf. Ktoré fakty boli použité? Ktoré vzťahy? Cesta grafom ukazuje uvažovanie. Vysvetliteľná AI prostredníctvom viditeľnej štruktúry poznania.

Európski regulátori to obzvlášť oceňujú. Zákon EÚ o AI vyžaduje vysvetliteľnosť pre systémy s vysokým rizikom. „Náš model urobil toto rozhodnutie, pretože...“ nasledované rozdelením pravdepodobnosti nesplní regulačné požiadavky. „Tu je presná cesta cez náš znalostný graf ukazujúca, ktoré fakty viedli k tomuto záveru“ to spĺňa. Prechod grafom poskytuje audítorské stopy. Článok 22 GDPR vyžaduje zmysluplné informácie o logike automatizovaného rozhodovania: znalostné grafy to robia triviálnym.

Budovanie znalostných grafov

Vytvorenie znalostného grafu nie je triviálne:

  • Extrakcia entít: Identifikujte entity v texte. Rozpoznávanie pomenovaných entít (NER). „Albert Einstein“ je osoba. „Nobelova cena“ je ocenenie. „1921“ je rok. Extrahujte entity z neštruktúrovaných údajov.
  • Extrakcia vzťahov: Identifikujte, ako entity súvisia. „Einstein získal Nobelovu cenu“ → Einstein → (získal) → Nobelova cena. Spracovanie prirodzeného jazyka určuje vzťahy. Nie vždy dokonalé. Existuje nejednoznačnosť.
  • Rozlišovanie entít: Rovnaká entita, rôzne názvy. „Einstein“, „A. Einstein“, „Albert Einstein“. Všetko tá istá osoba. Spojte uzly. Odstráňte duplicity. Rozlišovanie entít je kľúčové a náročné.
  • Integrácia poznatkov: Viacero zdrojov, rovnaké entity. Wikipedia hovorí jedno. Encyklopédia hovorí iné. Riešte konflikty. Určte pravdu. Priraďte skóre spoľahlivosti. Integrácia je priebežná.
  • Návrh schémy: Aké typy entít existujú? Aké typy vzťahov? Vlastnosti? Je potrebná určitá štruktúra. Ontológie to definujú. Ale dostatočne flexibilné na vývoj.

Budovanie veľkých znalostných grafov (miliardy uzlov) je vážne inžinierstvo. Znalostný graf Googlu obsahuje stovky miliárd faktov naprieč miliardami entít. Takáto mierka vyžaduje distribuované systémy.

Európsky projekt DBpedia, pochádzajúci z nemeckých univerzít, demonštruje mnohojazyčnú zložitosť. Rovnaká entita, dvadsaťštyri úradných jazykov EÚ. „Albert Einstein“ sa stáva „Albert Einstein“ (po nemecky), „Albert Einstein“ (po francúzsky, rovnaký pravopis, iná výslovnosť), „Άλμπερτ Αϊνστάιν“ (po grécky). Rozlišovanie entít naprieč jazykmi je ťažšie, než si Američania budujúci anglické systémy uvedomujú. Európske znalostné grafy zvládajú túto zložitosť štandardne: nie je to voliteľné, je to prevádzková realita.

"Building knowledge graphs" je slučka: pozorovať, rozhodnúť, konať a znova testovať.

Dopytovanie grafov znalostí

Špeciálne dopytovacie jazyky pre grafy:

Cypher (Neo4j):

Syntax na porovnávanie vzorov. ASCII art pre vzory grafov.

Príklad: MATCH (einstein:Person {name: "Albert Einstein"})-[:WON]->(prize:Award)

RETURN prize.name

Nájde všetky ocenenia, ktoré Einstein získal. Vzor opisuje štruktúru grafu. Dopyt sa zhoduje so vzorom.

SPARQL (RDF grafy):

Štandard sémantického webu. Vzory trojíc.

Príklad: SELECT ?prize WHERE { :Einstein :won ?prize . ?prize :type :NobelPrize }

Podobný koncept. Iná syntax. Dopytuje dáta sémantického webu.

Prechádzanie grafom:

Programové prechádzanie grafom. Začnite v uzle. Sledujte hrany. Zbierajte výsledky. Flexibilnejšie ako dopytovacie jazyky. Plná algoritmická kontrola.

Grafové databázy tieto dopyty optimalizujú. Indexovanie. Kešovanie. Distribuované vykonávanie. Miliardy uzlov, dopyt v zlomkoch sekundy. Ak sa to urobí správne.

Grafy znalostí v Dweve

Grafy znalostí používame vo veľkej miere:

  • Sémantická sieť znalostí: Fakty uložené ako uzly grafu. Vzťahy explicitné. Skóre spoľahlivosti na hranách. Riešenie rozporov analýzou grafu. Viacero zdrojov, protichodné fakty? Štruktúra grafu pomáha ich vyriešiť.
  • Distribuovaný graf znalostí (Loom): Mapovanie vzťahov v petabajtovej mierke. Backend Neo4j. Distribuované naprieč uzlami. Spracovanie biliónov uzlov. Optimalizácia prechádzania grafom. Inteligentné prednačítavanie. Toto nie je hračkárska mierka. Toto je produkčná infraštruktúra.
  • Krosmodálna fúzia znalostí: Znalosti z rôznych modalít (text, obrázky, štruktúrované dáta) integrované v zdieľanom grafe. Rovnaká entita sa objaví v obrázku aj texte? Spojte uzly. Fúzujte znalosti. Heterogénne zdroje, jednotná reprezentácia.
  • Engine grafu znalostí (Nexus): Dynamická reprezentácia znalostí založená na grafe. Agenti dopytujú graf pre informácie. Uvažovanie prechádzaním grafu. Vzťahy usmerňujú rozhodovanie. Graf znalostí je pamäťový systém.

Nie len úložisko. Aktívny substrát na uvažovanie. Štruktúra grafu JE organizácia znalostí.

Výzvy s grafmi znalostí

Výkonné, ale nie dokonalé:

  • Úplnosť: Znalostné grafy nie sú nikdy úplné. Vždy chýbajú entity. Chýbajúce vzťahy. Medzery existujú. Treba s neznámym narábať elegantne.
  • Kvalita: Extrahované znalosti obsahujú chyby. Nesprávne entity. Nesprávne vzťahy. Skóre spoľahlivosti pomáha. Ale šum zostáva. Validácia je nepretržitá.
  • Rozsah: Miliardy uzlov. Bilióny hrán. Ukladanie je zvládnuteľné. Dopytovanie vo veľkom rozsahu je náročné. Vyžadujú sa distribuované systémy. Zložitosť rastie.
  • Časová dynamika: Znalosti sa menia. Fakty zastarávajú. Vzťahy sa vyvíjajú. Verzionovanie znalostí je zložité. Grafy citlivé na čas pomáhajú, ale pridávajú zložitosť.
  • Nejednoznačnosť: „Merkúr“ planéta alebo prvok? Kontext rozlišuje. Ale grafom často chýba kontext. Rozlíšenie entít nie je nikdy dokonalé.
  • Obmedzenia uvažovania: Štruktúra grafu umožňuje určité uvažovanie. Ale logika je obmedzená. Pravdepodobnostné uvažovanie je náročné. Kauzálne uvažovanie je náročnejšie. Grafy reprezentujú, nie hlboko uvažujú.
  • Dátová suverenita: Európske organizácie čelia jedinečným výzvam. GDPR zakazuje určité prenosy dát mimo EÚ. Znalostné grafy s uzlami osobných údajov musia rešpektovať jurisdikčné hranice. Nemožno ich len replikovať do globálneho cloudu. Vyžaduje sa lokálne alebo výhradne európske hostovanie. Americké spoločnosti budujúce centralizované znalostné grafy to zistia draho, prostredníctvom regulačných pokút.

Napriek výzvam zostávajú znalostné grafy najlepšou štruktúrou pre organizované znalosti vo veľkom rozsahu.

„Challenges with knowledge graphs“ sa stávajú konkrétnymi, keď sú viditeľné vrstvy ovládania.

Budúcnosť znalostných grafov

Kam to smeruje?

  • Automatická konštrukcia: Lepšia extrakcia entít a vzťahov. Presnejšie. Vyššie pokrytie. Menej ľudského zásahu. AI si vytvára vlastné znalostné grafy z nespracovaných dát.
  • Dynamická aktualizácia: Aktualizácie znalostných grafov v reálnom čase. Stane sa novinka. Graf sa aktualizuje. Priebežné obnovovanie znalostí. Vždy aktuálne.
  • Pravdepodobnostné grafy: Hrany s pravdepodobnosťami. Neisté vzťahy. Propagácia spoľahlivosti. Bayesovské uvažovanie nad štruktúrou grafu.
  • Temporálne grafy: Znalosti citlivé na čas. „Vtedy to platilo. Teraz už nie.“ Historické uvažovanie. Predikcia budúcnosti. Sledovanie vývoja grafu.
  • Multimodálne grafy: Uzly sú obrázky, zvuk, video, text. Vzťahy prekračujú modality. Jednotné znalosti bez ohľadu na formát zdroja.
  • Federované grafy: Viacero organizácií, samostatné grafy. Dopytovanie naprieč organizačnými hranicami. Rešpektovanie súkromia. Distribuované znalosti bez centralizácie. Iniciatíva Gaia-X v Európe je príkladom tohto prístupu: federovaná dátová infraštruktúra, kde si organizácie zachovávajú suverenitu nad svojimi znalosťami a zároveň umožňujú cezhraničné dopytovanie. Americkí technologickí giganti uprednostňujú centralizované grafy, ktoré kontrolujú. Európania uprednostňujú federované grafy, ktoré zachovávajú nezávislosť. Rozdielne filozofie o vlastníctve znalostí.

Znalostné grafy sú infraštruktúrou pre porozumenie AI. Čím lepší graf, tým múdrejšia AI.

Priestor okolo „The future of knowledge graphs“ sa zmenšuje, keď sa stretnú pravidlá, vyhľadávanie a dôkazy.

Čo si potrebujete zapamätať

  • 1. Grafy sú entity a vzťahy. Uzly a hrany. Štruktúra kóduje význam. Vzťahy sú prvotriedne.
  • 2. Lepšie ako databázy pre vzťahy. Prirodzené prechádzanie. Flexibilná schéma. Sémantické hrany. Vynikajú pri prepojených dátach.
  • 3. Podporujú mnohé schopnosti AI. Odpovedanie na otázky, odporúčania, vyhľadávanie, uvažovanie, vysvetliteľnosť. Grafy to všetko umožňujú.
  • 4. Budovanie vyžaduje extrakciu entít, rezolúciu, integráciu. Nie je to automatické. Inžinierska výzva. Ale stojí to za to.
  • 5. Špeciálne dotazovacie jazyky pre grafy. Cypher, SPARQL, programové prechádzanie. Zhoda vzorov, nie SQL.
  • 6. Výzvy existujú. Úplnosť, kvalita, škálovanie, časová dynamika, nejednoznačnosť. Kompromisy, nie dokonalosť.
  • 7. Budúcnosť je automatická, dynamická, pravdepodobnostná. Lepšia konštrukcia. Aktualizácie v reálnom čase. Spracovanie neistoty. Vývoj pokračuje.

Spodný riadok

Znalostné grafy sú spôsob, akým AI organizuje to, čo vie. Nie ploché súbory. Nie relačné tabuľky. Štruktúra grafu, ktorá zrkadlí, ako sa znalosti skutočne prepájajú.

Výhody sú jasné: prirodzená reprezentácia vzťahov, flexibilná schéma, sémantický význam, výkonné dotazy. Znalosti ako prepojená sieť, nie izolované fakty.

Skutočné systémy AI ich používajú. Znalostný graf Googlu. Produktový graf Amazonu. Sociálny graf Facebooku. Odporúčací graf Netflixu. Nie akademické kuriozity. Produkčná infraštruktúra.

Ich budovanie je náročné. Extrakcia entít. Identifikácia vzťahov. Deduplikácia. Integrácia. Kontrola kvality. Výzvy škálovania. Ale hodnota ospravedlňuje úsilie.

Budúcnosť AI závisí od lepšej organizácie znalostí. Nie len viac dát. Lepšie štruktúrované dáta. Znalostné grafy poskytujú túto štruktúru. Graf JE znalosť.

Porozumieť znalostným grafom znamená porozumieť tomu, ako AI myslí. Nie neurónové aktivácie. Štruktúrované znalosti. Explicitné vzťahy. Uvažovanie cez prepojenia. To je inteligentná organizácia informácií.

Chcete infraštruktúru znalostných grafov? Preskúmajte sémantickú znalostnú sieť Dweve. Spracovanie biliónov uzlov. Distribuované úložisko grafov. Multi-modálna fúzia znalostí. Vzťahy s hodnotením spoľahlivosti. Taký znalostný graf, ktorý sa škáluje na skutočné aplikácie AI.