Figyelemmechanizmusok: hogyan dönti el az MI, mi a fontos

A figyelem forradalmasította a mesterséges intelligenciát. De mi is valójában? Íme, hogyan működnek a figyelemmechanizmusok, és miért változtattak meg mindent.

Figyelemmechanizmusok: hogyan dönti el az MI, mi a fontos

A fejlesztés, amelyre senki sem számított

2017-ben egy "Attention Is All You Need" című tanulmány jelentősen megváltoztatta a mesterséges intelligenciát. Nem valamilyen egzotikus új matematikával. Egy egyszerű ötlettel: hagyni, hogy a modell döntse el, mi a fontos.

Figyelemmechanizmusok. Elvontnak hangzanak. Valójában egyszerűek. És ezek tették lehetővé a ChatGPT-t, a képgenerátorokat, minden modern MI-t, amit használsz.

A figyelem megértése segít megérteni a modern MI-t. Bontsuk le.

A probléma, amelyet a figyelem megold

A régi MI (rekurrens hálózatok) szekvenciálisan dolgozta fel a bemeneteket. Szóról szóra. Rejtett állapotot fenntartva. Az információ lineárisan áramlott.

Probléma: a hosszú sorozatok romlottak. Az elejéről származó információ a végére elhalványult. A modell "elfelejtette" a korai kontextust. Ez korlátozta, hogy mire volt képes az MI.

A figyelem ezt megoldotta. Egyszerű koncepció: nézd az összes bemenetet egyszerre. Határozd meg, mely részek mely kimenetekhez fontosak. Súlyozd őket ennek megfelelően.

Nincs szekvenciális feldolgozás. Nincs információromlás. A teljes kontextus mindig elérhető. Forradalmi.

A figyelem megszünteti a rekurrens szűk keresztmetszetet: az aktuális token az egész mondatot vizsgálhatja, ahelyett, hogy egy elhalványult összegzést örökölne.

Mit csinál valójában a figyelem

A figyelem súlyozott átlagolás. Ennyi.

Vannak bemeneteid. Feldolgozni akarod az egyiket. De a feldolgozás helyes módja az összes többi bemenettől függ. A figyelem kitalálja, hogy az egyes bemenetek mennyire fontosak az aktuális feldolgozásához.

Példa: Fordítás

Lefordítani "The cat sat on the mat" kifejezést franciára. Amikor a "sat" szót fordítod, mely angol szavak számítanak a leginkább?

A "The" egy kicsit számít (nem). A "Cat" nagyon számít (alany). A "Sat" a legfontosabb (maga a szó). Az "On" valamennyire számít (kontextus). A többi kevésbé.

A figyelem kiszámítja ezeket a súlyokat. Majd kombinálja a bemeneteket e súlyok szerint. A súlyozott átlag adja a legjobb reprezentációt a "sat" fordításához.

Tedd ezt minden szóra. Minden rétegben. Ez a figyelem.

Egy cél szó esetén a figyelem súlyozott értékkeverék: a "cat" és a "sat" dominál, míg a környező szavak továbbra is kontextust adnak.

Hogyan működik valójában a figyelem

Három lépés: Query, Key, Value. Bonyolultnak hangzik. Pedig nem az.

1. lépés: Query-k, Key-k és Value-k létrehozása

Minden bemenethez hozz létre három vektort:

- Query: "Mit keresek?"

- Key: "Mit kínálok?"

- Value: "Itt a tényleges információm"

Ezek csak a bemenet lineáris transzformációi. Mátrixszorzások. Semmi különös.

2. lépés: Figyelem-súlyok kiszámítása

Minden query-hez hasonlítsd össze az összes key-jel. A skaláris szorzat méri a hasonlóságot. Hasonló query és key = magas pontszám. Különböző = alacsony pontszám.

Alkalmazd a softmaxot. A pontszámokat valószínűségekké alakítja. Most megvannak a figyelem-súlyok. Összegük 1.

3. lépés: A Value-k súlyozott átlaga

Használd a figyelem-súlyokat a value-k átlagolásához. Magas súly = nagyobb befolyás. Alacsony súly = kisebb befolyás.

Eredmény: új reprezentáció minden bemenethez, amelyet az összes többi bemenet befolyásol, relevancia szerint súlyozva.

Ez a figyelem. A lekérdezés-kulcs hasonlóság határozza meg a súlyokat. A súlyok kombinálják az értékeket. Ennyi.

Önfigyelem vs. keresztfigyelem

Kétféle figyelem szolgál különböző célokat:

Önfigyelem:

A bemenetek önmagukra figyelnek. Minden szó a mondat összes többi szavára néz. Meghatározza, hogy mely szavak számítanak az egyes szavak megértéséhez.

Példa: „Az állat nem ment át az úton, mert túl fáradt volt." Mire utal az „ez"? Az önfigyelem ezt úgy fejti meg, hogy erősen az „állat"-ra figyel.

Keresztfigyelem:

Az egyik sorozat egy másikra figyel. Fordítás: a francia szavak az angol szavakra figyelnek. Képfeliratozás: a felirat szavai a képterületekre figyelnek.

Különböző sorozatok. A lekérdezések az egyikből, a kulcsok és az értékek a másikból. Különböző modalitásokat vagy nyelveket köt össze.

Többfejes figyelem (több nézőpont)

Egyetlen figyelemfej = egy nézőpont. Többfejes = egyszerre több nézőpont.

Egy lekérdezés/kulcs/érték halmaz helyett több halmazt hozunk létre. Minden fej más mintákat tanul meg.

Az 1. fej szintaktikai kapcsolatokat tanulhat (alany-állítmány). A 2. fej szemantikai kapcsolatokat tanulhat (szójelentések). A 3. fej pozicionális mintákat tanulhat.

Kombináljuk az összes fejet. Így több nézőpontod van ugyanazokra a bemenetekre. Gazdagabb reprezentáció. Jobb megértés.

A transzformerek jellemzően 8-16 fejet használnak. Minden fej a teljes modellméret 1/8-a vagy 1/16-a. A számítási költség kezelhető marad.

A számítási költség

A figyelem erőteljes. De drága is.

Komplexitás: O(n²)

Minden bemenet minden másik bemenetre figyel. n bemenet esetén ez n² összehasonlítás. Másodfokú komplexitás.

Kétszeres szekvenciahossz, négyszeres számítás. Ezért korlátozottak a kontextusablakok. Nem csak a memória. A számítás robbanásszerűen nő.

Példa:

1 000 token: 1 millió művelet

10 000 token: 100 millió művelet

100 000 token: 10 milliárd művelet

A figyelem a szűk keresztmetszet a hosszú kontextusoknál. Különféle technikák (ritka figyelem, lineáris figyelem) próbálják ezt kezelni. Legjobb esetben is részleges megoldások.

Miért változtatott meg mindent a figyelem

A figyelem előtt: szekvenciális feldolgozás, korlátozott kontextus, információromlás.

A figyelem után: párhuzamos feldolgozás, teljes kontextus, nincs romlás.

Ez lehetővé tette:

  • Javított nyelvi modellek: Megértik a hosszú dokumentumokat. Nincs kontextuskorlát a szekvenciális feldolgozásból. A BERT és a GPT mind figyelmet használ.
  • Javított fordítás: A releváns forrásnyelvi szavakra tud figyelni. Nem számít, milyen messze vannak egymástól. A minőség jelentősen javult.
  • Látás-transzformerek: A figyelem képfoltokon működik. Sok feladatban versenyképes a CNN-ekkel. Egységes architektúra a látáshoz és a nyelvhez.
  • Multimodális modellek: A szöveg a képekre figyel. A képek a szövegre figyelnek. Keresztmodális megértés. A CLIP és a DALL-E mind figyelmet használ.

A figyelem a modern MI alapja. Minden erre épül.

A áttörés az architekturális újrafelhasználás volt: miután a teljes kontextus párhuzamossá vált, a nyelvi, fordítási, látási és multimodális rendszerek ugyanazt a kifutópályát oszthatták meg.

A figyelem a Dweve architektúrájában

A hagyományos figyelem lebegőpontos. Drága. De a koncepció korlátalapú rendszerekre is alkalmazható.

PAP (Permuted Agreement Popcount):

A figyelem saját változatunk bináris mintákhoz. Pontszorzat helyett XNOR-t és popcountot használunk. Softmax helyett statisztikai korlátokat.

Ugyanaz a koncepció: meghatározni, mely minták számítanak. Más megvalósítás: bináris műveletek lebegőpontos helyett.

Eredmény: figyelemszerű szelekció a számítási költség töredékéért. Mely szakértők relevánsak? A PAP ezt határozza meg. Hatékonyan.

Amire Emlékezned Kell

  • 1. A figyelem súlyozott átlagolás. Relevancia meghatározása, a bemenetek súlyozása, kombinálás. Egyszerű koncepció, erőteljes eredmények.
  • 2. Query-Key-Value mechanizmus. A Query kérdez, a Key-ek válaszolnak, a Value-ök információt szolgáltatnak. A hasonlóság határozza meg a súlyokat.
  • 3. Önfigyelem vs. keresztfigyelem. Ön: a bemenetek önmagukra figyelnek. Kereszt: az egyik sorozat egy másikra figyel.
  • 4. A többfejes feldolgozás több nézőpontot ragad meg. A különböző fejek különböző mintákat tanulnak. Kombinálva gazdag megértést nyújtanak.
  • 5. A számítási költség O(n²). A négyzetes komplexitás korlátozza a kontextus hosszát. A szűk keresztmetszet hosszú sorozatoknál.
  • 6. A figyelem tette lehetővé a modern MI-t. Transformerek, GPT, BERT, látás-transformerek. Mind a figyelemre épül.
  • 7. Léteznek bináris alternatívák. A PAP figyelemszerű szelekciót biztosít bináris műveletekkel. Ugyanaz a koncepció, más megvalósítás.
A PAP megőrzi a figyelem relevanciaszelekciós gondolatát, de a pontszorzatot és a softmaxot bináris egyezésre és statisztikai korlátokra cseréli.

A Lényeg

A figyelem az elmúlt évtized legfontosabb MI-innovációja. Egyszerű gondolat: hagyni, hogy a modell döntse el, mi számít. Mélyreható hatás: lehetővé tette minden modern MI-rendszert, amelyet használsz.

Nem varázslat. Tanult hasonlóságon alapuló súlyozott átlagolás. A query-kulcs egyezés határozza meg a súlyokat. A súlyok kombinálják az értékeket. Ismételd meg minden bemenetnél, minden rétegnél.

A számítási költség valós. Az O(n²) korlátozza, milyen hosszúak lehetnek a sorozatok. De ezeken a határokon belül a figyelem példátlan képességet nyújt a kontextus megértésére.

A figyelem megértése a modern MI-architektúra megértését jelenti. Minden más erre az alapra épül. Sajátítsd el ezt, és a többi érthetővé válik.

Hatékony figyelemszerű szelekciót szeretnél? Fedezd fel a Dweve PAP mechanizmusát. Bináris mintailesztés statisztikai korlátokkal. Szakértőszelekció a hagyományos figyelem költségének töredékéért. Olyan relevanciameghatározás, amely méretekben is működik.