Figyelemmechanizmusok: hogyan dönti el az MI, mi a fontos
A fejlesztés, amelyre senki sem számított
2017-ben egy "Attention Is All You Need" című tanulmány jelentősen megváltoztatta a mesterséges intelligenciát. Nem valamilyen egzotikus új matematikával. Egy egyszerű ötlettel: hagyni, hogy a modell döntse el, mi a fontos.
Figyelemmechanizmusok. Elvontnak hangzanak. Valójában egyszerűek. És ezek tették lehetővé a ChatGPT-t, a képgenerátorokat, minden modern MI-t, amit használsz.
A figyelem megértése segít megérteni a modern MI-t. Bontsuk le.
A probléma, amelyet a figyelem megold
A régi MI (rekurrens hálózatok) szekvenciálisan dolgozta fel a bemeneteket. Szóról szóra. Rejtett állapotot fenntartva. Az információ lineárisan áramlott.
Probléma: a hosszú sorozatok romlottak. Az elejéről származó információ a végére elhalványult. A modell "elfelejtette" a korai kontextust. Ez korlátozta, hogy mire volt képes az MI.
A figyelem ezt megoldotta. Egyszerű koncepció: nézd az összes bemenetet egyszerre. Határozd meg, mely részek mely kimenetekhez fontosak. Súlyozd őket ennek megfelelően.
Nincs szekvenciális feldolgozás. Nincs információromlás. A teljes kontextus mindig elérhető. Forradalmi.
Mit csinál valójában a figyelem
A figyelem súlyozott átlagolás. Ennyi.
Vannak bemeneteid. Feldolgozni akarod az egyiket. De a feldolgozás helyes módja az összes többi bemenettől függ. A figyelem kitalálja, hogy az egyes bemenetek mennyire fontosak az aktuális feldolgozásához.
Példa: Fordítás
Lefordítani "The cat sat on the mat" kifejezést franciára. Amikor a "sat" szót fordítod, mely angol szavak számítanak a leginkább?
A "The" egy kicsit számít (nem). A "Cat" nagyon számít (alany). A "Sat" a legfontosabb (maga a szó). Az "On" valamennyire számít (kontextus). A többi kevésbé.
A figyelem kiszámítja ezeket a súlyokat. Majd kombinálja a bemeneteket e súlyok szerint. A súlyozott átlag adja a legjobb reprezentációt a "sat" fordításához.
Tedd ezt minden szóra. Minden rétegben. Ez a figyelem.
Hogyan működik valójában a figyelem
Három lépés: Query, Key, Value. Bonyolultnak hangzik. Pedig nem az.
1. lépés: Query-k, Key-k és Value-k létrehozása
Minden bemenethez hozz létre három vektort:
- Query: "Mit keresek?"
- Key: "Mit kínálok?"
- Value: "Itt a tényleges információm"
Ezek csak a bemenet lineáris transzformációi. Mátrixszorzások. Semmi különös.
2. lépés: Figyelem-súlyok kiszámítása
Minden query-hez hasonlítsd össze az összes key-jel. A skaláris szorzat méri a hasonlóságot. Hasonló query és key = magas pontszám. Különböző = alacsony pontszám.
Alkalmazd a softmaxot. A pontszámokat valószínűségekké alakítja. Most megvannak a figyelem-súlyok. Összegük 1.
3. lépés: A Value-k súlyozott átlaga
Használd a figyelem-súlyokat a value-k átlagolásához. Magas súly = nagyobb befolyás. Alacsony súly = kisebb befolyás.
Eredmény: új reprezentáció minden bemenethez, amelyet az összes többi bemenet befolyásol, relevancia szerint súlyozva.
Ez a figyelem. A lekérdezés-kulcs hasonlóság határozza meg a súlyokat. A súlyok kombinálják az értékeket. Ennyi.
Önfigyelem vs. keresztfigyelem
Kétféle figyelem szolgál különböző célokat:
Önfigyelem:
A bemenetek önmagukra figyelnek. Minden szó a mondat összes többi szavára néz. Meghatározza, hogy mely szavak számítanak az egyes szavak megértéséhez.
Példa: „Az állat nem ment át az úton, mert túl fáradt volt." Mire utal az „ez"? Az önfigyelem ezt úgy fejti meg, hogy erősen az „állat"-ra figyel.
Keresztfigyelem:
Az egyik sorozat egy másikra figyel. Fordítás: a francia szavak az angol szavakra figyelnek. Képfeliratozás: a felirat szavai a képterületekre figyelnek.
Különböző sorozatok. A lekérdezések az egyikből, a kulcsok és az értékek a másikból. Különböző modalitásokat vagy nyelveket köt össze.
Többfejes figyelem (több nézőpont)
Egyetlen figyelemfej = egy nézőpont. Többfejes = egyszerre több nézőpont.
Egy lekérdezés/kulcs/érték halmaz helyett több halmazt hozunk létre. Minden fej más mintákat tanul meg.
Az 1. fej szintaktikai kapcsolatokat tanulhat (alany-állítmány). A 2. fej szemantikai kapcsolatokat tanulhat (szójelentések). A 3. fej pozicionális mintákat tanulhat.
Kombináljuk az összes fejet. Így több nézőpontod van ugyanazokra a bemenetekre. Gazdagabb reprezentáció. Jobb megértés.
A transzformerek jellemzően 8-16 fejet használnak. Minden fej a teljes modellméret 1/8-a vagy 1/16-a. A számítási költség kezelhető marad.
A számítási költség
A figyelem erőteljes. De drága is.
Komplexitás: O(n²)
Minden bemenet minden másik bemenetre figyel. n bemenet esetén ez n² összehasonlítás. Másodfokú komplexitás.
Kétszeres szekvenciahossz, négyszeres számítás. Ezért korlátozottak a kontextusablakok. Nem csak a memória. A számítás robbanásszerűen nő.
Példa:
1 000 token: 1 millió művelet
10 000 token: 100 millió művelet
100 000 token: 10 milliárd művelet
A figyelem a szűk keresztmetszet a hosszú kontextusoknál. Különféle technikák (ritka figyelem, lineáris figyelem) próbálják ezt kezelni. Legjobb esetben is részleges megoldások.
Miért változtatott meg mindent a figyelem
A figyelem előtt: szekvenciális feldolgozás, korlátozott kontextus, információromlás.
A figyelem után: párhuzamos feldolgozás, teljes kontextus, nincs romlás.
Ez lehetővé tette:
- Javított nyelvi modellek: Megértik a hosszú dokumentumokat. Nincs kontextuskorlát a szekvenciális feldolgozásból. A BERT és a GPT mind figyelmet használ.
- Javított fordítás: A releváns forrásnyelvi szavakra tud figyelni. Nem számít, milyen messze vannak egymástól. A minőség jelentősen javult.
- Látás-transzformerek: A figyelem képfoltokon működik. Sok feladatban versenyképes a CNN-ekkel. Egységes architektúra a látáshoz és a nyelvhez.
- Multimodális modellek: A szöveg a képekre figyel. A képek a szövegre figyelnek. Keresztmodális megértés. A CLIP és a DALL-E mind figyelmet használ.
A figyelem a modern MI alapja. Minden erre épül.
A figyelem a Dweve architektúrájában
A hagyományos figyelem lebegőpontos. Drága. De a koncepció korlátalapú rendszerekre is alkalmazható.
PAP (Permuted Agreement Popcount):
A figyelem saját változatunk bináris mintákhoz. Pontszorzat helyett XNOR-t és popcountot használunk. Softmax helyett statisztikai korlátokat.
Ugyanaz a koncepció: meghatározni, mely minták számítanak. Más megvalósítás: bináris műveletek lebegőpontos helyett.
Eredmény: figyelemszerű szelekció a számítási költség töredékéért. Mely szakértők relevánsak? A PAP ezt határozza meg. Hatékonyan.
Amire Emlékezned Kell
- 1. A figyelem súlyozott átlagolás. Relevancia meghatározása, a bemenetek súlyozása, kombinálás. Egyszerű koncepció, erőteljes eredmények.
- 2. Query-Key-Value mechanizmus. A Query kérdez, a Key-ek válaszolnak, a Value-ök információt szolgáltatnak. A hasonlóság határozza meg a súlyokat.
- 3. Önfigyelem vs. keresztfigyelem. Ön: a bemenetek önmagukra figyelnek. Kereszt: az egyik sorozat egy másikra figyel.
- 4. A többfejes feldolgozás több nézőpontot ragad meg. A különböző fejek különböző mintákat tanulnak. Kombinálva gazdag megértést nyújtanak.
- 5. A számítási költség O(n²). A négyzetes komplexitás korlátozza a kontextus hosszát. A szűk keresztmetszet hosszú sorozatoknál.
- 6. A figyelem tette lehetővé a modern MI-t. Transformerek, GPT, BERT, látás-transformerek. Mind a figyelemre épül.
- 7. Léteznek bináris alternatívák. A PAP figyelemszerű szelekciót biztosít bináris műveletekkel. Ugyanaz a koncepció, más megvalósítás.
A Lényeg
A figyelem az elmúlt évtized legfontosabb MI-innovációja. Egyszerű gondolat: hagyni, hogy a modell döntse el, mi számít. Mélyreható hatás: lehetővé tette minden modern MI-rendszert, amelyet használsz.
Nem varázslat. Tanult hasonlóságon alapuló súlyozott átlagolás. A query-kulcs egyezés határozza meg a súlyokat. A súlyok kombinálják az értékeket. Ismételd meg minden bemenetnél, minden rétegnél.
A számítási költség valós. Az O(n²) korlátozza, milyen hosszúak lehetnek a sorozatok. De ezeken a határokon belül a figyelem példátlan képességet nyújt a kontextus megértésére.
A figyelem megértése a modern MI-architektúra megértését jelenti. Minden más erre az alapra épül. Sajátítsd el ezt, és a többi érthetővé válik.
Hatékony figyelemszerű szelekciót szeretnél? Fedezd fel a Dweve PAP mechanizmusát. Bináris mintailesztés statisztikai korlátokkal. Szakértőszelekció a hagyományos figyelem költségének töredékéért. Olyan relevanciameghatározás, amely méretekben is működik.