Pozornostní mechanismy: jak AI rozhoduje, co je důležité

Pozornost změnila AI. Ale co to vlastně je? Jak fungují mechanismy pozornosti a proč změnily vše.

Pozornostní mechanismy: jak AI rozhoduje, co je důležité

Vývoj, který nikdo nepředvídal

V roce 2017 změnil článek s názvem „Attention Is All You Need" významně oblast umělé inteligence. Ne díky nějaké exotické nové matematice. Díky jednoduché myšlence: nechte model rozhodnout, co je důležité.

Mechanismy pozornosti. Zní to abstraktně. Ve skutečnosti jsou přímočaré. A umožnily vznik ChatGPT, generátorů obrázků i všech moderních nástrojů umělé inteligence, které používáte.

Pochopení pozornosti vám pomůže pochopit moderní umělou inteligenci. Pojďme si to rozebrat.

Problém, který pozornost řeší

Starší umělá inteligence (rekurentní sítě) zpracovávala vstupy sekvenčně. Slovo po slově. Udržovala skrytý stav. Informace proudily lineárně.

Problém: dlouhé sekvence degradovaly. Informace ze začátku na konci vybledly. Model „zapomněl" raný kontext. To omezovalo, co umělá inteligence dokázala.

Tento problém vyřešila pozornost. Jednoduchý koncept: podívejte se na všechny vstupy současně. Určete, které části jsou důležité pro které výstupy. Příslušně je zvažte.

Žádné sekvenční zpracování. Žádná degradace informací. Plný kontext je vždy k dispozici. Revoluční.

Pozornost odstraňuje rekurentní úzké hrdlo: aktuální token může prozkoumat celou větu, místo aby zdědil vybledlý souhrn.

Co pozornost ve skutečnosti dělá

Pozornost je vážený průměr. To je vše.

Máte vstupy. Chcete zpracovat jeden z nich. Ale správný způsob zpracování závisí na všech ostatních vstupech. Pozornost zjistí, jak moc každý vstup přispívá ke zpracování toho aktuálního.

Příklad: Překlad

Překládáme „The cat sat on the mat" do francouzštiny. Při překladu slova „sat", která anglická slova jsou nejdůležitější?

„The" záleží trochu (rod). „Cat" záleží hodně (podmět). „Sat" záleží nejvíce (samotné slovo). „On" záleží částečně (kontext). Ostatní méně.

Pozornost tyto váhy vypočítá. Poté kombinuje vstupy podle těchto vah. Vážený průměr vám dá nejlepší reprezentaci pro překlad slova „sat".

Udělejte to pro každé slovo. V každé vrstvě. To je pozornost.

Pro jedno cílové slovo je pozornost váženou směsí hodnot: „cat" a „sat" dominují, zatímco okolní slova stále přispívají kontextem.

Jak pozornost skutečně funguje

Tři kroky: Dotaz, Klíč, Hodnota. Zní to složitě. Není.

Krok 1: Vytvořte dotazy, klíče a hodnoty

Pro každý vstup vytvořte tři vektory:

- Dotaz: „Co hledám?"

- Klíč: „Co nabízím?"

- Hodnota: „Tady jsou mé skutečné informace"

Jsou to jen lineární transformace vstupu. Násobení matic. Nic přepychového.

Krok 2: Vypočítejte váhy pozornosti

Pro každý dotaz ho porovnejte se všemi klíči. Skalární součin měří podobnost. Podobný dotaz a klíč = vysoké skóre. Odlišné = nízké skóre.

Aplikujte softmax. Převede skóre na pravděpodobnosti. Nyní máte váhy pozornosti. Jejich součet je 1.

Krok 3: Vážený průměr hodnot

Použijte váhy pozornosti k zprůměrování hodnot. Vysoká váha = větší vliv. Nízká váha = menší vliv.

Výsledek: nová reprezentace pro každý vstup, ovlivněná všemi ostatními vstupy, vážená podle relevance.

To je pozornost. Podobnost dotazu a klíče určuje váhy. Váhy kombinují hodnoty. Hotovo.

Sebepozornost vs. křížová pozornost

Dva typy pozornosti slouží různým účelům:

Sebepozornost:

Vstupy si všímají samy sebe. Každé slovo se dívá na všechna ostatní slova ve stejné větě. Určuje, která slova jsou důležitá pro pochopení každého slova.

Příklad: „Zvíře nepřešlo silnici, protože bylo příliš unavené." Na co odkazuje „ono"? Sebepozornost to zjistí tím, že se silně zaměří na „zvíře".

Křížová pozornost:

Jedna sekvence si všímá jiné. Překlad: francouzská slova si všímají anglických slov. Popis obrázků: slova popisu si všímají oblastí obrázku.

Různé sekvence. Dotazy z jedné, klíče a hodnoty z druhé. Propojuje různé modality nebo jazyky.

Pozornost s více hlavami (více perspektiv)

Jedna hlava pozornosti = jedna perspektiva. Více hlav = více perspektiv současně.

Místo jedné sady dotazů, klíčů a hodnot vytvoříte sad více. Každá hlava se učí jiné vzorce.

Hlava 1 se může učit syntaktické vztahy (podmět a přísudek). Hlava 2 se může učit sémantické vztahy (významy slov). Hlava 3 se může učit poziční vzorce.

Spojte všechny hlavy. Teď máte na stejné vstupy více perspektiv. Bohatší reprezentace. Lepší porozumění.

Transformátory obvykle používají 8 až 16 hlav. Každá hlava má velikost 1/8 nebo 1/16 plné dimenze modelu. Výpočetní náklady zůstávají zvládnutelné.

Výpočetní náklady

Pozornost je mocná. Také drahá.

Složitost: O(n²)

Každý vstup si všímá každého jiného vstupu. Pro n vstupů to znamená n² porovnání. Kvadratická složitost.

Zdvojnásobte délku sekvence a výpočet se zčtyřnásobí. Proto jsou kontextová okna omezená. Nejen kvůli paměti. Výpočet exploduje.

Příklad:

1 000 tokenů: 1 milion operací

10 000 tokenů: 100 milionů operací

100 000 tokenů: 10 miliard operací

Pozornost je úzkým hrdlem pro dlouhé kontexty. Různé techniky (řídká pozornost, lineární pozornost) se to snaží řešit. V nejlepším případě částečná řešení.

Proč pozornost změnila všechno

Před pozorností: sekvenční zpracování, omezený kontext, degradace informací.

Po pozornosti: paralelní zpracování, plný kontext, žádná degradace.

To umožnilo:

  • Lepší jazykové modely: Dokážou porozumět dlouhým dokumentům. Žádné omezení kontextu ze sekvenčního zpracování. BERT, GPT, všechny používají pozornost.
  • Lepší překlad: Mohou se zaměřit na relevantní slova zdrojového jazyka. Bez ohledu na to, jak daleko jsou. Kvalita se výrazně zlepšila.
  • Vision Transformers: Pozornost funguje na obrazových výřezech. Konkurují CNN v mnoha úlohách. Jednotná architektura pro vidění i jazyk.
  • Multimodální modely: Text si všímá obrázků. Obrázky si všímají textu. Porozumění napříč modalitami. CLIP, DALL-E, všechny používají pozornost.

Pozornost je základ moderní umělé inteligence. Všechno na ní staví.

Průlom spočíval v architektonickém znovupoužití: jakmile byl plný kontext paralelní, mohly jazykové, překladové, vizuální a multimodální systémy sdílet stejnou dráhu.

Pozornost v architektuře Dweve

Tradiční pozornost je založená na pohyblivé řádové čárce. Nákladná. Ale tento koncept se uplatňuje i v systémech založených na omezeních.

PAP (Permuted Agreement Popcount):

Naše verze pozornosti pro binární vzory. Místo skalárních součinů používáme XNOR a popcount. Místo softmax používáme statistické meze.

Stejný koncept: určit, které vzory jsou důležité. Jiná implementace: binární operace místo pohyblivé řádové čárky.

Výsledek: výběr podobný pozornosti za zlomek výpočetních nákladů. Které experty jsou relevantní? To určuje PAP. Efektivně.

Co si zapamatovat

  • 1. Pozornost je vážené průměrování. Určete relevanci, vážte vstupy podle ní, zkombinujte. Jednoduchý koncept, silné výsledky.
  • 2. Mechanismus dotaz-klíč-hodnota. Dotaz se ptá, klíče odpovídají, hodnoty poskytují informace. Podobnost určuje váhy.
  • 3. Sebepozornost vs. křížová pozornost. Sebepozornost: vstupy věnují pozornost samy sobě. Křížová: jedna sekvence věnuje pozornost jiné.
  • 4. Více hlav zachycuje více perspektiv. Různé hlavy se učí různé vzory. Dohromady poskytují bohaté porozumění.
  • 5. Výpočetní náklady jsou O(n²). Kvadratická složitost omezuje délku kontextu. Úzké hrdlo pro dlouhé sekvence.
  • 6. Pozornost umožnila moderní umělou inteligenci. Transformery, GPT, BERT, vision transformery. Vše je postaveno na pozornosti.
  • 7. Existují binární alternativy. PAP poskytuje výběr podobný pozornosti pomocí binárních operací. Stejný koncept, jiná implementace.
PAP zachovává myšlenku výběru podle relevance z pozornosti, ale nahrazuje skalární součiny a softmax binární shodou a statistickými mezemi.

Závěr

Pozornost je nejdůležitější inovace umělé inteligence posledního desetiletí. Jednoduchá myšlenka: nechte model rozhodnout, co je důležité. Hluboký dopad: umožnila každý moderní systém umělé inteligence, který používáte.

Není to kouzlo. Je to vážené průměrování založené na naučené podobnosti. Párování dotazu a klíče určuje váhy. Váhy kombinují hodnoty. Opakujte pro každý vstup, každou vrstvu.

Výpočetní náklady jsou reálné. O(n²) omezuje, jak dlouhé sekvence mohou být. Ale v těchto mezích poskytuje pozornost bezprecedentní schopnost porozumět kontextu.

Porozumět pozornosti znamená porozumět moderní architektuře umělé inteligence. Vše ostatní staví na tomto základu. Zvládněte toto a zbytek bude dávat smysl.

Chcete efektivní výběr podobný pozornosti? Prozkoumejte mechanismus PAP od Dweve. Binární porovnávání vzorů se statistickými mezemi. Výběr expertů za zlomek nákladů tradiční pozornosti. Takové určování relevance, které funguje ve velkém měřítku.