Ako AI mení všetko na čísla: embeddings

AI nerozumie slovám ani obrázkom. Pracuje s číslami. Embeddingy preklenú túto priepasť. Tu je návod.

Ako AI mení všetko na čísla: embeddings

Problém s číslami

Počítače pracujú s číslami. Len s číslami. Neurónové siete? Rovnako. Len matematika s číslami.

Ale svet nie sú čísla. Slová. Obrázky. Zvuky. Koncepty. Ako to AI spracúva?

Embeddings. Premieňajú všetko na čísla spôsobom, ktorý zachováva význam. Kľúčový koncept. Je základom celej modernej AI.

Čo vlastne sú embeddings

Embedding je hustý vektor čísel reprezentujúci niečo.

Slovný embedding: „cat" sa stane [0.2, -0.5, 0.8, ...] (stovky čísel).

Obrázkový embedding: fotografia sa stane [0.1, 0.9, -0.3, ...] (tisíce čísel).

Čísla nie sú náhodné. Sú naučené tak, aby zachytávali význam. Podobné veci dostávajú podobné embeddings. Odlišné veci dostávajú odlišné embeddings.

To je kľúč: podobnosť vo význame sa stáva podobnosťou v číslach. Matematické operácie s embeddings odzrkadľujú sémantické vzťahy.

Embeddings komprimujú slová a obrázky do naučených súradníc, kde blízke čísla stále nesú blízky význam.

Prečo potrebujeme embeddings

Slová by ste mohli reprezentovať ako one-hot vektory. „Cat" = [1,0,0,...,0]. „Dog" = [0,1,0,...,0]. Jedinečné číslo pre každé slovo.

Problém: nezachytáva sa žiadny vzťah. „Cat" a „dog" sú rovnako odlišné ako „cat" a „airplane". Všetky vektory sú ortogonálne. Žiadny sémantický význam.

Embeddings to riešia. „Cat" a „dog" dostávajú podobné embeddings (obe sú zvieratá). „Cat" a „airplane" dostávajú odlišné embeddings. Podobnosť vo vektorovom priestore odzrkadľuje podobnosť vo význame.

Teraz matematické operácie dávajú zmysel. Aritmetika s embeddings zodpovedá uvažovaniu o význame.

Ako sa embeddings učia

Embeddings nie sú ručne vytvorené. Učia sa z dát.

Slovné embeddings (prístup Word2Vec):

Natrénujte neurónovú sieť na jednoduchej úlohe: predpovedať kontextové slová z cieľového slova. Alebo naopak.

Príklad: veta „The cat sat on the mat." Pre cieľové slovo „cat" predpovedajte „the", „sat", „on".

Sieť sa učí: aby dobre predpovedala kontext, musí reprezentovať podobné slová podobne. „Cat" a „dog" sa vyskytujú v podobných kontextoch. Dostávajú podobné embeddings.

Embeddings sú vedľajší produkt. Nie cieľ úlohy. Ale zachytávajú sémantický význam.

Moderný prístup (transformers):

Embeddings sa učia ako súčasť väčšieho modelu. Jazykový model predpovedá ďalšie slovo. Obrázkový model klasifikuje objekty. Embeddings vznikajú ako vnútorné reprezentácie.

Sú kontextové. To isté slovo dostáva odlišné embeddings v odlišných kontextoch. „Bank" (finančný) verzus „bank" (riečny) dostávajú odlišné reprezentácie.

Sémantický priestor

Embeddings vytvárajú geometrický priestor, kde význam je geometria.

  • Podobnosť = Blízkosť: Podobné koncepty sa zhlukujú. Zvieratá sa zhlukujú. Vozidlá sa zhlukujú. Abstraktné koncepty sa zhlukujú. Vzdialenosť meria podobnosť.
  • Vzťahy = Smery: Známy príklad: kráľ - muž + žena ≈ kráľovná

Vektorová aritmetika zachytáva vzťahy. Smer od „muž" k „kráľ" (od pohlavia k panovníctvu) je podobný smeru od „žena" k „kráľovná".

Analógie sa stávajú vektorovými operáciami. Neuveriteľné, ale funguje to.

Rozmery = Atribúty:

Každý rozmer zachytáva nejaký atribút. Jeden rozmer môže byť „živosť" (živé vs. neživé). Ďalší môže byť „veľkosť". Ďalší „abstraktnosť".

Stovky rozmerov zachytávajú stovky atribútov. V kombinácii reprezentujú význam.

Sémantický priestor mení význam na geografiu: zhluky ukazujú podobnosť, šípky ukazujú vzťahy, osi držia atribúty.

Rôzne typy embeddingov

  • Slovné embeddingy: Slová na vektory. Word2Vec, GloVe, FastText. Základ NLP.
  • Vetné embeddingy: Celé vety na vektory. Zachytávajú význam celých viet, nielen slov. Používajú sa na sémantické vyhľadávanie.
  • Obrázkové embeddingy: Obrázky na vektory. CNN prvky. Výstupy vision transformerov. Umožňujú vyhľadávanie obrázkov, porovnávanie podobnosti.
  • Multimodálne embeddingy: Rôzne modality do rovnakého priestoru. Text a obrázky získavajú porovnateľné embeddingy. Toto robí CLIP. Umožňuje krížové vyhľadávanie naprieč modalitami.
  • Grafové embeddingy: Uzly v grafoch na vektory. Zachytávajú štruktúru siete. Používajú sa v sociálnych sieťach, znalostných grafoch.
Rôzne rodiny embeddingov sú samostatné vstupné doky, ktoré napájajú rovnaký druh vektorového stroja.

Ako sa embeddingy používajú

  • Vyhľadávanie podobnosti: Nájdenie podobných položiek. Najbližší susedia v priestore vektorov. Vyhľadávače, odporúčacie systémy.
  • Klasifikácia: Použitie vektorov ako funkcií na klasifikáciu. Sémantické funkcie, nie surové dáta. Lepšia generalizácia.
  • Zhlukovanie: Zoskupenie podobných položiek. K-means na vektoroch. Modelovanie tém, segmentácia zákazníkov.
  • Prenosové učenie: Použitie vektorov z veľkého modelu na malú úlohu. Prenos predtrénovaných znalostí. Bežné vo vision a NLP.
  • Generovanie s rozšíreným vyhľadávaním: Vloženie otázok a dokumentov. Vyhľadanie relevantných dokumentov. Poskytnutie jazykovému modelu. Faktické odpovede AI.

Binárne vektory (Efektívna alternatíva)

Tradičné vektory: vektory s pohyblivou rádovou čiarkou. 32 bitov na dimenziu. Veľká pamäťová stopa.

Binárne vektory: 1 bit na dimenziu. Každá dimenzia je +1 alebo -1. 32× menej pamäte.

Ako fungujú:

Vektory sa naučia normálne. Potom sa binarizujú: kladné dimenzie sa stanú +1, záporné -1.

Podobnosť: namiesto skalárneho súčinu sa používa Hammingova vzdialenosť alebo XNOR-popcount. Oveľa rýchlejšie.

Kompromisy:

Stráca sa určitá presnosť. Ale pri mnohých úlohách na tom nezáleží. Vyhľadávanie a hľadanie najbližšieho suseda fungujú s binárnymi vektormi dobre.

Zisk: obrovská rýchlosť a pamäťová efektívnosť. Nasadenie na okrajových zariadeniach. Rýchle spracovanie miliárd vektorov.

Prístup spoločnosti Dweve:

Obmedzenia sú binárne vzory. Inherentne binárne vektory. 65 536-bitové hypervektory. Efektívne ukladanie, rýchle operácie.

Porovnávanie vzorov cez XNOR a popcount. Podobnosť cez počítanie zhôd. Binárne až do základov.

Na dimenziách záleží

Koľko dimenzií? Viac nie je vždy lepšie.

Príliš málo dimenzií: Nedokážu zachytiť komplexnosť. Rôzne koncepty sa zrážajú. Strácajú sa dôležité rozdiely.

Príliš veľa dimenzií: Výpočtové náklady. Využitie pamäte. Preučenie. Prekliatie dimenzionality (vo vysokých dimenziách sa všetko stáva rovnako vzdialené).

Typické veľkosti:

Vektory slov: 100-300 dimenzií

Vektory viet: 384-1024 dimenzií

Vektory obrázkov: 512-2048 dimenzií

Binárne hypervektory: 1024-65536 bitov (pre robustné vlastnosti)

Voľba závisí od komplexnosti úlohy a výpočtového rozpočtu.

Čo si potrebujete zapamätať

  • 1. Vektory konvertujú všetko na čísla. Slová, obrázky, koncepty sa stávajú vektormi. Umožňuje spracovanie AI.
  • 2. Význam sa stáva geometriou. Podobné koncepty dostávajú podobné vektory. Vzdialenosť meria podobnosť. Smery zachytávajú vzťahy.
  • 3. Naučené z dát, nie ručne vytvorené. Neurónové siete sa učia vektory ako súčasť tréningu. Vzory v dátach určujú reprezentáciu.
  • 4. Umožňujú sémantické operácie. Matematika na vektoroch odráža uvažovanie o význame. Vektorová aritmetika robí analógie.
  • 5. Viac typov pre rôzne dáta. Slová, vety, obrázky, grafy. Každý má špecializované metódy vektorovania.
  • 6. Binárne vektory ponúkajú efektívnosť. 1 bit na dimenziu namiesto 32. Obrovské pamäťové a rýchlostné zisky. Funguje pre mnohé úlohy.
  • 7. Dimensionalita je kompromis. Viac dimenzií zachytáva viac komplexnosti. Ale stojí výpočtové zdroje. Potrebná rovnováha.
Binárne vektory prechádzajú cez zlievareň: ponechajte znamienko, spočítajte zhody a získajte späť pamäť a rýchlosť.

Zrátané a podčiarknuté

Vďaka vektorom AI preklenuje priepasť medzi ľudskými pojmami a strojovým výpočtom. Všetko zmysluplné sa premieňa na vektory v priestore, kde podobnosť významu znamená podobnosť geometrie.

Nejde len o reprezentáciu. Je to základ modernej AI. Vyhľadávanie, odporúčania, generovanie, porozumenie. Všetko sa spolieha na vektory.

Vektory nie sú ľubovoľné. Sú naučené tak, aby zachytávali sémantickú štruktúru. Geometria odráža význam. Matematické operácie zodpovedajú uvažovaniu.

Binárne vektory ukazujú, že na sémantický význam nepotrebujete pohyblivú rádovú čiarku. Jednobitové reprezentácie fungujú. Efektívne. Vo veľkom. Nasadené kdekoľvek.

Porozumieť vektorom znamená porozumieť tomu, ako AI vidí svet. Nie ako slová alebo obrázky. Ako vektory vo viacrozmernom priestore, kde význam je matematika.

Chcete efektívne vektory? Preskúmajte hypervektorový prístup Dweve. 65 536-bitové binárne vzory. Podobnosť založená na XNOR. Sémantický význam v binárnom priestore. Reprezentácia, ktorá funguje rýchlosťou hardvéru.