Znalostní grafy: jak AI uspořádává to, co ví

Google je používá. Amazon je používá. Znalostní grafy pohánějí ty nejchytřejší AI systémy. Jak fungují a proč na nich záleží.

Znalostní grafy: jak AI uspořádává to, co ví

Problém znalostí

AI ví hodně. Opravdu hodně. Fakta. Vztahy. Vzorce. Terabajty informací.

Ale vědět nestačí. Důležité je uspořádání. To, jak znalosti strukturujete, určuje, co s nimi můžete dělat. Najít je. Propojit je. Uvažovat o nich.

Tento problém řeší znalostní grafy. Tak si nejchytřejší AI systémy organizují to, co vědí. Když jim porozumíte, porozumíte i moderní AI.

Co znalostní grafy skutečně jsou

Znalostní graf je síť entit a vztahů. Není to tradiční databáze. Není to hierarchický strom. Je to graf. Uzly propojené hranami. Vztahy explicitní.

Struktura:

Entity (uzly): Věci. Lidé. Pojmy. Cokoli, co existuje nebo lze popsat.

Příklady: „Albert Einstein", „Teorie relativity", „Nobelova cena", „1921"

Vztahy (hrany): Jak spolu entity souvisejí. Význam pramení ze spojení, ne z izolace.

Příklady: „Einstein" → (vytvořil) → „Teorie relativity"

„Einstein" → (získal) → „Nobelova cena"

„Nobelova cena" → (rok) → „1921"

Vlastnosti: Atributy entit nebo vztahů. Doplňující podrobnosti.

Příklady: Einstein.datum_narození = „1879-03-14"

Nobelova_cena.oblast = „Fyzika"

A to je vše. Entity, vztahy, vlastnosti. Jednoduchá struktura. Mocná reprezentace.

Zde je vizuální příklad:

Einstein (Osoba) Teorie relativity Nobelova cena 1921 vytvořil získal rok datum narození: 1879-03-14 obor: Fyzika Struktura znalostního grafu Uzly = entity | Šipky = vztahy | Text níže = vlastnosti
Kompromis v „What knowledge graphs actually are" spočívá v tom, kde hodnota uniká nebo se vrací kontrola.

Proč grafy porážejí tradiční databáze

Tradiční databáze: tabulky a řádky. Pevné schéma. Rigidní struktura. Vztahy jsou neohrabané.

Znalostní grafy: flexibilní, na prvním místě vztahy, přirozeně zvládají složitost.

Přirozená reprezentace vztahů:

V relační databázi vyžaduje zjištění „Kdo jsou Einsteinovi kolegové, kteří také získali Nobelovu cenu?" několik operací JOIN. Složitý dotaz. Pomalý.

Ve znalostním grafu: sledujte vztahy. Einstein → (kolega) → Osoba → (získal) → Nobelova cena. Přirozené procházení. Rychlé.

Flexibilní schéma:

Relační databáze: definujte schéma předem. Přidání nových typů entit nebo vztahů znamená změny schématu. Migrace. Bolest.

Znalostní grafy: přidávejte uzly a hrany kdykoli. Schéma se přirozeně vyvíjí. Nové typy vztahů? Stačí je přidat. Žádná migrace není nutná.

Sémantický význam:

Tabulky nezakódují význam. Cizí klíč je jen číslo. Význam pochází z aplikačního kódu.

Hrany grafu mají sémantické štítky. „worked_with", „inspired_by", „contradicts". Samotný vztah nese význam. Dotazovatelný. Srozumitelný.

Lepší pro složité dotazy:

„Najděte všechny lidi, kteří pracovali s někým, s kým pracoval Einstein" (vztah kolegy na dva kroky). V grafu triviální. V SQL noční můra plná operací JOIN.

Každý správce databází, který někdy napsal JOIN přes sedm tabulek, aby odpověděl na jednoduchou otázku o vztahu, chápe tu bolest. SQL bylo navrženo pro účetnictví, ne pro „ukaž mi všechny do tří stupňů odloučení od tohoto člověka". Takový dotaz se stává rekurzivní noční můrou zahrnující dočasné tabulky a kreativní nadávky.

Grafy vynikají u dotazů náročných na vztahy. Databáze vynikají u agregací a transakcí. Různé nástroje pro různé úkoly.

Jak AI využívá znalostní grafy

Znalostní grafy pohánějí mnoho schopností AI:

Odpovídání na otázky:

Uživatel se ptá: „Kdo získal Nobelovu cenu za fyziku v roce 1921?"

AI se dotazuje znalostního grafu: Nobelova cena → (rok) → 1921 → (obor) → Fyzika → (získal) → Einstein

Odpověď: „Albert Einstein"

Přímé vyhledávání prostřednictvím vztahů. Není třeba zpracovávat každý dokument o Einsteinovi. Graf odpověď zakóduje.

Doporučovací systémy:

„Lidé, kterým se líbilo X, se líbilo také Y" se stává procházkou grafem. Uživatel → (líbilo se) → Položka → (líbilo se také) → Další uživatelé → (líbilo se) → Další položky

Amazon, Netflix i Spotify používají znalostní grafy. Produkty, uživatelé a preference jako uzly. Nákupy, zhlédnutí a hodnocení jako hrany. Doporučení jsou dotazy do grafu.

Vylepšení vyhledávání:

Znalostní graf od Googlu pohání ty informační boxy. Vyhledejte „Einstein" a uvidíte datum narození, úspěchy a související osoby. To není seškrábaný text. To jsou strukturované znalosti.

Graf umožňuje sémantické vyhledávání. Nejen shodu klíčových slov. Porozumění entitám a vztahům. „Kdo je Einsteinova manželka?" rozumí tomu, že „manželka" je vztah a Einstein je entita. Procházka grafem najde odpověď.

Uvažování a odvozování:

Znalostní grafy umožňují logické uvažování. Pokud A → (podtřída) → B a B → (podtřída) → C, pak A → (podtřída) → C. Tranzitivní uvažování. Automatické odvozování nových znalostí z existujících.

Lékařské znalostní grafy: příznak → (naznačuje) → nemoc → (léčí se) → lék. Diagnostické uvažování prostřednictvím procházky grafem.

Vysvětlitelnost:

Proč se AI rozhodla právě takto? Projděte znalostní graf. Která fakta byla použita? Které vztahy? Cesta grafem ukazuje uvažování. Vysvětlitelná AI díky viditelné struktuře znalostí.

Evropští regulátoři to oceňují obzvlášť. Akt EU o umělé inteligenci vyžaduje vysvětlitelnost u systémů s vysokým rizikem. „Náš model se rozhodl takto..." následované rozdělením pravděpodobnosti nesplní regulační požadavky. „Zde je přesná cesta naším znalostním grafem ukazující, která fakta vedla k tomuto závěru" ano. Procházka grafem poskytuje auditní stopy. Článek 22 GDPR vyžaduje smysluplné informace o logice automatizovaného rozhodování: znalostní grafy to usnadňují.

Budování znalostních grafů

Vytvoření znalostního grafu není triviální:

  • Extrakce entit: Identifikace entit v textu. Rozpoznávání pojmenovaných entit (NER). „Albert Einstein" je osoba. „Nobelova cena" je ocenění. „1921" je rok. Extrahujte entity z nestrukturovaných dat.
  • Extrakce vztahů: Identifikace toho, jak entity spolu souvisí. „Einstein získal Nobelovu cenu" → Einstein → (získal) → Nobelova cena. Zpracování přirozeného jazyka určuje vztahy. Ne vždy dokonale. Existuje nejednoznačnost.
  • Rozlišování entit: Stejná entita, různá jména. „Einstein", „A. Einstein", „Albert Einstein". Všichni stejná osoba. Slučte uzly. Odstraňte duplicity. Rozlišování entit je zásadní a obtížné.
  • Integrace znalostí: Více zdrojů, stejné entity. Wikipedie říká jednu věc. Encyklopedie říká jinou. Vyřešte konflikty. Určete pravdu. Přiřaďte skóre spolehlivosti. Integrace je průběžná.
  • Návrh schématu: Jaké typy entit existují? Jaké typy vztahů? Vlastnosti? Je potřeba určitá struktura. To definují ontologie. Ale dostatečně flexibilní, aby se mohla vyvíjet.

Budování velkých znalostních grafů (miliardy uzlů) je seriózní inženýrství. Znalostní graf od Googlu obsahuje stovky miliard faktů napříč miliardami entit. Takové měřítko vyžaduje distribuované systémy.

Evropský projekt DBpedia, pocházející z německých univerzit, ukazuje mnohojazyčnou složitost. Stejná entita, čtyřiadvacet úředních jazyků EU. „Albert Einstein" se stává „Albert Einstein" (německy), „Albert Einstein" (francouzsky, stejný pravopis, jiná výslovnost), „Άλμπερτ Αϊνστάιν" (řecky). Rozlišování entit napříč jazyky je obtížnější, než si Američané budující anglickojazyčné systémy uvědomují. Evropské znalostní grafy tuto složitost řeší standardně: není to volitelné, je to provozní realita.

"Building knowledge graphs" je smyčka: pozoruj, rozhodni, jednej a znovu testuj.

Dotazování znalostních grafů

Speciální dotazovací jazyky pro grafy:

Cypher (Neo4j):

Syntaxe pro porovnávání vzorů. ASCII art pro vzory grafů.

Příklad: MATCH (einstein:Person {name: "Albert Einstein"})-[:WON]->(prize:Award)

RETURN prize.name

Najde všechna ocenění, která Einstein získal. Vzor popisuje strukturu grafu. Dotaz odpovídá vzoru.

SPARQL (RDF grafy):

Standard pro sémantický web. Vzory trojic.

Příklad: SELECT ?prize WHERE { :Einstein :won ?prize . ?prize :type :NobelPrize }

Podobný koncept. Jiná syntaxe. Dotazuje se na data sémantického webu.

Procházení grafů:

Programové procházení grafu. Začni v uzlu. Následuj hrany. Shromažďuj výsledky. Flexibilnější než dotazovací jazyky. Plná algoritmická kontrola.

Grafové databáze tyto dotazy optimalizují. Indexování. Ukládání do mezipaměti. Distribuované zpracování. Miliardy uzlů, dotazy v řádu milisekund. Když se to udělá správně.

Znalostní grafy v Dweve

Znalostní grafy používáme ve velkém:

  • Sémantická znalostní síť: Fakta uložená jako uzly grafu. Vztahy explicitní. Skóre spolehlivosti na hranách. Řešení rozporů pomocí analýzy grafu. Více zdrojů, konfliktní fakta? Struktura grafu pomáhá to vyřešit.
  • Distribuovaný znalostní graf (Loom): Mapování vztahů v měřítku petabajtů. Backend Neo4j. Distribuováno napříč uzly. Schopnost zpracování bilionů uzlů. Optimalizace procházení grafů. Inteligentní přednačítání. Tohle není hračka. Tohle je produkční infrastruktura.
  • Křížová fúze znalostí: Znalosti z různých modalit (text, obrázky, strukturovaná data) integrované do sdíleného grafu. Stejná entita se objeví v obrázku i textu? Slouč uzly. Spoj znalosti. Heterogenní zdroje, jednotná reprezentace.
  • Engine znalostních grafů (Nexus): Dynamická reprezentace znalostí založená na grafech. Agenti se dotazují grafu na informace. Uvažování prostřednictvím procházení grafů. Vztahy řídí rozhodování. Znalostní graf je paměťový systém.

Ne jen úložiště. Aktivní substrát pro uvažování. Struktura grafu JE organizací znalostí.

Výzvy se znalostními grafy

Výkonné, ale ne dokonalé:

  • Úplnost: Znalostní grafy nejsou nikdy úplné. Vždy chybí entity. Chybí vztahy. Existují mezery. Je třeba s neznámým zacházet elegantně.
  • Kvalita: Extrahované znalosti obsahují chyby. Chybné entity. Chybné vztahy. Pomáhají skóre spolehlivosti. Ale šum zůstává. Validace je průběžná.
  • Škálovatelnost: Miliardy uzlů. Biliony hran. Ukládání je zvládnutelné. Dotazování ve velkém měřítku je náročné. Jsou nutné distribuované systémy. Složitost roste.
  • Časová dynamika: Znalosti se mění. Fakta zastarávají. Vztahy se vyvíjejí. Verzování znalostí je složité. Grafy citlivé na čas pomáhají, ale přidávají složitost.
  • Ambiguity: „Merkur“ planeta nebo prvek? Kontext rozlišuje. Ale grafům často chybí kontext. Rozlišení entit není nikdy dokonalé.
  • Limity uvažování: Struktura grafu umožňuje určité uvažování. Ale logika je omezená. Pravděpodobnostní uvažování je náročné. Kauzální uvažování je ještě náročnější. Grafy reprezentují, ale nehluboce uvažují.
  • Suverenita dat: Evropské organizace čelí jedinečným výzvám. GDPR zakazuje určité přenosy dat mimo EU. Znalostní grafy s uzly osobních údajů musí respektovat jurisdikční hranice. Nelze je jen tak replikovat do globálního cloudu. Vyžadováno je hostování na místě nebo pouze v EU. Americké společnosti budující centralizované znalostní grafy na to přijdou draze, prostřednictvím regulačních pokut.

Navzdory výzvám zůstávají znalostní grafy nejlepší strukturou pro organizované znalosti ve velkém měřítku.

„Challenges with knowledge graphs“ se stávají konkrétními, když jsou viditelné řídicí vrstvy.

Budoucnost znalostních grafů

Kam to směřuje?

  • Automatická konstrukce: Lepší extrakce entit a vztahů. Přesnější. Vyšší pokrytí. Méně lidských zásahů. AI si sama vytváří znalostní grafy z nezpracovaných dat.
  • Dynamická aktualizace: Aktualizace znalostních grafů v reálném čase. Stane se událost. Graf se aktualizuje. Průběžné obnovování znalostí. Vždy aktuální.
  • Pravděpodobnostní grafy: Hrany s pravděpodobnostmi. Nejisté vztahy. Šíření spolehlivosti. Bayesovské uvažování nad strukturou grafu.
  • Časové grafy: Znalosti s ohledem na čas. „Tehdy to platilo. Teď už ne." Historické uvažování. Předpovídání budoucnosti. Sledování vývoje grafu.
  • Multimodální grafy: Uzly jsou obrázky, zvuk, video, text. Vztahy procházejí napříč modalitami. Jednotné znalosti bez ohledu na formát zdroje.
  • Federované grafy: Více organizací, oddělené grafy. Dotazování napříč organizačními hranicemi. Respektování soukromí. Distribuované znalosti bez centralizace. Iniciativa Gaia-X v Evropě tento přístup dokládá: federovaná datová infrastruktura, kde si organizace zachovávají suverenitu nad svými znalostmi a zároveň umožňují přeshraniční dotazování. Američtí technologičtí giganti preferují centralizované grafy, které ovládají. Evropané preferují federované grafy, které zachovávají nezávislost. Různé filozofie ohledně vlastnictví znalostí.

Znalostní grafy jsou infrastrukturou pro porozumění AI. Čím lepší graf, tím chytřejší AI.

Prostor kolem „The future of knowledge graphs" se zmenšuje, když se setkají pravidla, vyhledávání a důkazy.

Co si zapamatovat

  • 1. Grafy jsou entity a vztahy. Uzly a hrany. Struktura nese význam. Vztahy jsou prvotřídní.
  • 2. Lepší než databáze pro vztahy. Přirozené procházení. Flexibilní schéma. Sémantické hrany. Vynikají u propojených dat.
  • 3. Podporují mnoho schopností AI. Odpovídání na otázky, doporučování, vyhledávání, uvažování, vysvětlitelnost. Grafy to vše umožňují.
  • 4. Budování vyžaduje extrakci entit, rozlišení a integraci. Není to automatické. Inženýrská výzva. Ale stojí to za to.
  • 5. Speciální dotazovací jazyky pro grafy. Cypher, SPARQL, programové procházení. Porovnávání vzorů, ne SQL.
  • 6. Výzvy existují. Úplnost, kvalita, měřítko, časová dynamika, nejednoznačnost. Kompromisy, ne dokonalost.
  • 7. Budoucnost je automatická, dynamická, pravděpodobnostní. Lepší konstrukce. Aktualizace v reálném čase. Práce s nejistotou. Vývoj pokračuje.

Závěr

Znalostní grafy jsou způsob, jakým AI organizuje to, co ví. Ne ploché soubory. Ne relační tabulky. Grafová struktura, která zrcadlí, jak se znalosti skutečně propojují.

Výhody jsou jasné: přirozená reprezentace vztahů, flexibilní schéma, sémantický význam, výkonné dotazy. Znalosti jako propojená síť, ne izolovaná fakta.

Skutečné systémy AI je používají. Znalostní graf od Googlu. Produktový graf od Amazonu. Sociální graf od Facebooku. Doporučovací graf od Netflixu. Ne akademické kuriozity. Produkční infrastruktura.

Jejich budování je náročné. Extrakce entit. Identifikace vztahů. Deduplikace. Integrace. Kontrola kvality. Problémy s měřítkem. Ale hodnota ospravedlňuje to úsilí.

Budoucnost AI závisí na lepší organizaci znalostí. Ne jen na větším množství dat. Lépe strukturovaná data. Znalostní grafy tuto strukturu poskytují. Graf JE znalost.

Porozumět znalostním grafům znamená porozumět tomu, jak AI přemýšlí. Ne neuronové aktivace. Strukturované znalosti. Explicitní vztahy. Uvažování skrze propojení. To je inteligentní organizace informací.

Chcete infrastrukturu pro znalostní grafy? Prozkoumejte sémantickou znalostní síť Dweve. Zpracování bilionů uzlů. Distribuované úložiště grafů. Multimodální fúze znalostí. Vztahy s hodnocením spolehlivosti. Takový znalostní graf, který škáluje na skutečné aplikace AI.