Uzmanības mehānismi: kā mākslīgais intelekts izlemj, kam pievērst uzmanību

Uzmanība revolucionizēja mākslīgo intelektu. Bet kas tā īsti ir? Lūk, kā darbojas uzmanības mehānismi un kāpēc tie mainīja visu.

Uzmanības mehānismi: kā mākslīgais intelekts izlemj, kam pievērst uzmanību

Attīstība, Kuru Neviens Neredzēja Nākam

2017. gadā raksts "Attention Is All You Need" būtiski mainīja mākslīgo intelektu. Ne ar kādu eksotisku jaunu matemātiku. Ar vienkāršu ideju: ļaut modelim pašam izlemt, kas ir svarīgs.

Uzmanības mehānismi. Izklausās abstrakti. Patiesībā tie ir vienkārši. Un tie ļāva izveidot ChatGPT, attēlu ģeneratorus, visu mūsdienu mākslīgo intelektu, ko lietojat.

Izprotot uzmanību, jūs saprotat mūsdienu mākslīgo intelektu. Aplūkosim to tuvāk.

Problēma, Kuru Atrisina Uzmanība

Vecais mākslīgais intelekts (rekurentie tīkli) apstrādāja ievades secīgi. Vārdu pa vārdam. Uzturot slēpto stāvokli. Informācija plūda lineāri.

Problēma: garas secības degradējās. Informācija no sākuma izbalēja līdz beigām. Modelis "aizmirsa" agrīno kontekstu. Tas ierobežoja mākslīgā intelekta iespējas.

Uzmanība to atrisināja. Vienkāršs jēdziens: aplūkot visas ievades vienlaikus. Noteikt, kuras daļas ir svarīgas kurām izvadēm. Attiecīgi tās svērt.

Nav secīgas apstrādes. Nav informācijas degradācijas. Pilns konteksts vienmēr pieejams. Revolucionāri.

Uzmanība novērš rekurento sašaurinājumu: pašreizējais tokens var aplūkot visu teikumu, nevis mantot izbalējušu kopsavilkumu.

Ko Uzmanība Patiesībā Dara

Uzmanība ir svērtā vidējā vērtība. Tas arī viss.

Jums ir ievades. Vēlaties apstrādāt vienu no tām. Bet pareizais apstrādes veids ir atkarīgs no visām pārējām ievadēm. Uzmanība nosaka, cik ļoti katra ievade ir svarīga pašreizējās apstrādei.

Piemērs: tulkošana

Tulkojot "The cat sat on the mat" franču valodā. Tulkojot "sat", kuri angļu vārdi ir vissvarīgākie?

"The" ir svarīgs nedaudz (dzimte). "Cat" ir ļoti svarīgs (subjekts). "Sat" ir vissvarīgākais (pats vārds). "On" ir svarīgs daļēji (konteksts). Pārējie mazāk.

Uzmanība aprēķina šos svarus. Pēc tam apvieno ievades atbilstoši šiem svariem. Svērtā vidējā vērtība sniedz labāko attēlojumu "sat" tulkošanai.

Dariet to katram vārdam. Katram slānim. Tā ir uzmanība.

Vienam mērķa vārdam uzmanība ir svērts vērtību sajaukums: "cat" un "sat" dominē, bet apkārtējie vārdi joprojām sniedz kontekstu.

Kā Uzmanība Patiesībā Strādā

Trīs soļi: Query, Key, Value. Izklausās sarežģīti. Tā nav.

1. solis: izveidojiet vaicājumus, atslēgas un vērtības

Katrai ievadei izveidojiet trīs vektorus:

- Query: "Ko es meklēju?"

- Key: "Ko es piedāvāju?"

- Value: "Lūk, mana faktiskā informācija"

Tās ir tikai lineāras ievades transformācijas. Matricu reizināšanas. Nekas īpašs.

2. solis: aprēķiniet uzmanības svarus

Katram vaicājumam salīdziniet to ar visām atslēgām. Punktu reizinājums mēra līdzību. Līdzīgs vaicājums un atslēga = augsts rezultāts. Atšķirīgi = zems rezultāts.

Pielietojiet softmax. Pārvērš rezultātus varbūtībās. Tagad jums ir uzmanības svari. To summa ir 1.

3. solis: vērtību svērtā vidējā vērtība

Izmantojiet uzmanības svarus, lai aprēķinātu vērtību vidējo. Augsts svars = lielāka ietekme. Zems svars = mazāka ietekme.

Rezultāts: jauns attēlojums katrai ievadei, kas veidots, ņemot vērā visas pārējās ievades, svērts pēc atbilstības.

That's attention. Query-key similarity determines weights. Weights combine values. Done.

Self-Attention vs Cross-Attention

Two types of attention serve different purposes:

Self-Attention:

Inputs attend to themselves. Each word looks at all other words in the same sentence. Determines which words matter for understanding each word.

Example: "The animal didn't cross the street because it was too tired." What does "it" refer to? Self-attention figures this out by attending to "animal" strongly.

Cross-Attention:

One sequence attends to another. Translation: French words attend to English words. Image captioning: caption words attend to image regions.

Different sequences. Queries from one, keys and values from another. Connects different modalities or languages.

Multi-Head Attention (Multiple Perspectives)

Single attention head = one perspective. Multi-head = multiple perspectives simultaneously.

Instead of one set of queries/keys/values, create multiple sets. Each head learns different patterns.

Head 1 might learn syntactic relationships (subject-verb). Head 2 might learn semantic relationships (word meanings). Head 3 might learn positional patterns.

Combine all heads. Now you have multiple perspectives on the same inputs. Richer representation. Better understanding.

Transformers typically use 8-16 heads. Each head is 1/8 or 1/16 the size of full model dimension. Computational cost stays manageable.

The Computational Cost

Attention is powerful. Also expensive.

Complexity: O(n²)

Every input attends to every other input. For n inputs, that's n² comparisons. Quadratic complexity.

Double the sequence length, quadruple the computation. This is why context windows are limited. Not just memory. Computation explodes.

Example:

1,000 tokens: 1 million operations

10,000 tokens: 100 million operations

100,000 tokens: 10 billion operations

Attention is the bottleneck for long contexts. Various techniques (sparse attention, linear attention) try to address this. Partial solutions at best.

Why Attention Changed Everything

Before attention: sequential processing, limited context, information degradation.

After attention: parallel processing, full context, no degradation.

This enabled:

  • Improved Language Models: Can understand long documents. No context limit from sequential processing. BERT, GPT, all use attention.
  • Improved Translation: Can attend to relevant source words. No matter how far apart. Quality improved substantially.
  • Vision Transformers: Attention works on image patches. Competitive with CNNs for many tasks. Unified architecture for vision and language.
  • Multimodal Models: Text attends to images. Images attend to text. Cross-modal understanding. CLIP, DALL-E, all use attention.

Attention is the foundation of modern AI. Everything builds on it.

The breakthrough was architectural reuse: once full context was parallel, language, translation, vision and multimodal systems could share the same runway.

Attention in Dweve's Architecture

Tradicionālā uzmanība balstās uz peldošā komata skaitļiem. Dārgi. Taču koncepcija attiecas arī uz ierobežojumos balstītām sistēmām.

PAP (Permuted Agreement Popcount):

Mūsu uzmanības versija bināriem modeļiem. Punktu reizinājumu vietā izmantojam XNOR un popcount. Softmax vietā izmantojam statistiskās robežas.

Tā pati koncepcija: noteikt, kuri modeļi ir svarīgi. Cita ieviešana: binārās darbības peldošā komata vietā.

Rezultāts: uzmanībai līdzīga atlase par daļu no aprēķinu izmaksām. Kuri eksperti ir būtiski? PAP to nosaka. Efektīvi.

Kas jāatceras

  • 1. Uzmanība ir svērtais vidējais. Nosaki būtiskumu, attiecīgi svēr ievades, apvieno. Vienkārša koncepcija, spēcīgi rezultāti.
  • 2. Vaicājuma-atslēgas-vērtības mehānisms. Vaicājums jautā, atslēgas atbild, vērtības sniedz informāciju. Līdzība nosaka svarus.
  • 3. Pašuzmanība pret krustuzmanību. Pašuzmanība: ievades pievērš uzmanību pašas sev. Krustuzmanība: viena secība pievērš uzmanību citai.
  • 4. Vairākas galvas uztver vairākas perspektīvas. Dažādas galvas apgūst dažādus modeļus. Apvienotas tās sniedz bagātīgu izpratni.
  • 5. Aprēķinu izmaksas ir O(n²). Kvadrātiskā sarežģītība ierobežo konteksta garumu. Tā ir pudeļu kakls garām secībām.
  • 6. Uzmanība ļāva attīstīties mūsdienu mākslīgajam intelektam. Transformeri, GPT, BERT, redzes transformeri. Viss balstās uz uzmanību.
  • 7. Pastāv bināras alternatīvas. PAP nodrošina uzmanībai līdzīgu atlasi ar binārām darbībām. Tā pati koncepcija, cita ieviešana.
PAP saglabā uzmanības būtiskuma atlases ideju, bet punktu reizinājumu un softmax vietā izmanto bināro saskaņu un statistiskās robežas.

Būtība

Uzmanība ir vissvarīgākā mākslīgā intelekta inovācija pēdējā desmitgadē. Vienkārša ideja: ļauj modelim izlemt, kam ir nozīme. Dziļa ietekme: tā ļāva darboties visām mūsdienu mākslīgā intelekta sistēmām, ko lieto.

Tas nav burvju triks. Tas ir svērtais vidējais, kas balstās uz apgūto līdzību. Vaicājuma un atslēgas saskaņošana nosaka svarus. Svari apvieno vērtības. Atkārto katram ievades elementam, katram slānim.

Aprēķinu izmaksas ir reālas. O(n²) ierobežo secību garumu. Taču šajās robežās uzmanība nodrošina nepieredzētu spēju izprast kontekstu.

Izprast uzmanību nozīmē izprast mūsdienu mākslīgā intelekta arhitektūru. Viss pārējais balstās uz šī pamata. Apgūsti šo, un pārējais kļūst skaidrs.

Vēlies efektīvu uzmanībai līdzīgu atlasi? Iepazīsti Dweve PAP mehānismu. Binārā modeļu saskaņošana ar statistiskām robežām. Ekspertu atlase par daļu no tradicionālās uzmanības izmaksām. Tāda būtiskuma noteikšana, kas darbojas lielā mērogā.