Iegulšanas: kā mākslīgais intelekts visu pārvērš skaitļos

AI nesaprot vārdus vai attēlus. Tas strādā ar skaitļiem. Iegultnes (embeddings) pārvar šo plaisu. Lūk, kā.

Iegulšanas: kā mākslīgais intelekts visu pārvērš skaitļos

Skaitļu problēma

Datori strādā ar skaitļiem. Tikai ar skaitļiem. Neironu tīkli? Tāpat. Tikai matemātika ar skaitļiem.

Bet pasaule nav skaitļi. Vārdi. Attēli. Skaņas. Jēdzieni. Kā mākslīgais intelekts to apstrādā?

Iegultnes. Tās pārvērš visu skaitļos tā, ka nozīme tiek saglabāta. Būtisks jēdziens. Tas ir pamatā visam mūsdienu mākslīgajam intelektam.

Kas īsti ir iegultnes

Iegultne ir blīvs skaitļu vektors, kas attēlo kaut ko.

Vārdu iegultne: "cat" kļūst par [0.2, -0.5, 0.8, ...] (simtiem skaitļu).

Attēlu iegultne: fotogrāfija kļūst par [0.1, 0.9, -0.3, ...] (tūkstošiem skaitļu).

Skaitļi nav nejauši. Tie ir apgūti, lai uztvertu nozīmi. Līdzīgām lietām ir līdzīgas iegultnes. Atšķirīgām lietām ir atšķirīgas iegultnes.

Tā ir atslēga: nozīmes līdzība kļūst par skaitļu līdzību. Matemātiskās darbības ar iegultnēm atspoguļo semantiskās attiecības.

Iegultnes saspiež vārdus un attēlus apgūtās koordinātēs, kur tuvu esošie skaitļi joprojām nes tuvu nozīmi.

Kāpēc mums vajadzīgas iegultnes

Vārdus varētu attēlot kā one-hot vektorus. "Cat" = [1,0,0,...,0]. "Dog" = [0,1,0,...,0]. Katram vārdam unikāls skaitlis.

Problēma: netiek uztvertas attiecības. "Cat" un "dog" atšķiras tikpat ļoti kā "cat" un "airplane". Visi vektori ir ortogonāli. Nav semantiskas nozīmes.

Iegultnes to atrisina. "Cat" un "dog" iegūst līdzīgas iegultnes (abi ir dzīvnieki). "Cat" un "airplane" iegūst atšķirīgas iegultnes. Līdzība vektoru telpā atspoguļo nozīmes līdzību.

Tagad matemātiskās darbības ir jēgpilnas. Aritmētika ar iegultnēm atbilst spriešanai par nozīmi.

Kā tiek apgūtas iegultnes

Iegultnes nav veidotas ar roku. Tās tiek apgūtas no datiem.

Vārdu iegultnes (Word2Vec pieeja):

Apmāciet neironu tīklu vienkāršam uzdevumam: paredzēt konteksta vārdus no mērķa vārda. Vai otrādi.

Piemērs: teikums "The cat sat on the mat." Mērķa vārdam "cat" paredziet "the", "sat", "on".

Tīkls mācās: lai labi paredzētu kontekstu, tam līdzīgi vārdi jāattēlo līdzīgi. "Cat" un "dog" parādās līdzīgos kontekstos. Tie iegūst līdzīgas iegultnes.

Iegultnes ir blakusprodukts. Nevis uzdevuma mērķis. Bet tās uztver semantisko nozīmi.

Mūsdienu pieeja (Transformeri):

Iegultnes tiek apgūtas kā daļa no lielāka modeļa. Valodas modelis paredz nākamo vārdu. Attēlu modelis klasificē objektus. Iegultnes rodas kā iekšējie attēlojumi.

Tās ir kontekstuālas. Viens un tas pats vārds dažādos kontekstos iegūst atšķirīgas iegultnes. "Bank" (finanšu) pret "bank" (upe) iegūst atšķirīgus attēlojumus.

Semantiskā telpa

Iegultnes veido ģeometrisku telpu, kur nozīme ir ģeometrija.

  • Līdzība = tuvums: Līdzīgi jēdzieni grupējas kopā. Dzīvnieki grupējas. Transportlīdzekļi grupējas. Abstrakti jēdzieni grupējas. Attālums mēra līdzību.
  • Attiecības = virzieni: Slavens piemērs: king - man + woman ≈ queen

Vektoru aritmētika uztver attiecības. Virziens no "man" līdz "king" (dzimums līdz karaliskumam) ir līdzīgs virzienam no "woman" līdz "queen."

Analoģijas kļūst par vektoru darbībām. Prātu satriecoši, bet tas darbojas.

Dimensijas = atribūti:

Katra dimensija uztver kādu atribūtu. Viena dimensija varētu būt "dzīvīgums" (dzīvs pret nedzīvu). Cita varētu būt "lielums." Vēl cita "abstraktums."

Simtiem dimensiju uztver simtiem atribūtu. Apvienojot, tās atspoguļo nozīmi.

Semantiskā telpa pārvērš nozīmi ģeogrāfijā: kopas parāda līdzību, bultiņas parāda attiecības, asis satur atribūtus.

Dažādi iegulšanas veidi

  • Vārdu iegulšana: Vārdi vektoros. Word2Vec, GloVe, FastText. NLP pamats.
  • Teikumu iegulšana: Veseli teikumi vektoros. Uztver pilnu teikumu nozīmi, ne tikai vārdus. Izmanto semantiskajā meklēšanā.
  • Attēlu iegulšana: Attēli vektoros. CNN pazīmes. Vīzijas transformatoru izvades. Ļauj veikt attēlu meklēšanu, līdzības salīdzināšanu.
  • Multimodālā iegulšana: Dažādi modalitātes veidi vienā telpā. Teksts un attēli iegūst salīdzināmas iegulšanas. CLIP to dara. Ļauj veikt starpmodālu meklēšanu.
  • Grafu iegulšana: Grafu mezgli vektoros. Uztver tīkla struktūru. Izmanto sociālajos tīklos, zināšanu grafos.
Dažādas iegulšanas saimes ir atsevišķas ievades ostas, kas baro viena veida vektoru mehānismu.

Kā tiek izmantota iegulšana

  • Līdzības meklēšana: Atrodiet līdzīgus vienumus. Tuvākie kaimiņi iegulšanas telpā. Meklētājprogrammas, ieteikumu sistēmas.
  • Klasifikācija: Izmantojiet iegulšanas kā pazīmes klasifikācijai. Semantiskās pazīmes, nevis neapstrādāti dati. Labāka vispārināšana.
  • Klasterizācija: Grupējiet līdzīgus vienumus. K-vidējais uz iegulšanām. Tēmu modelēšana, klientu segmentācija.
  • Pārnese mācīšanās: Izmantojiet iegulšanas no liela modeļa mazā uzdevumā. Iepriekš apgūtās zināšanas tiek pārnestas. Bieži sastopama datorredzē un NLP.
  • Izguves papildinātā ģenerēšana: Iegulstiet vaicājumus un dokumentus. Izgūstiet atbilstošos dokumentus. Nododiet tos valodas modelim. Uz faktiem balstītas AI atbildes.

Binārās iegulšanas (efektīvā alternatīva)

Tradicionālās iegulšanas: peldošā komata vektori. 32 biti uz dimensiju. Liels atmiņas nospiedums.

Binārās iegulšanas: 1 bits uz dimensiju. Katra dimensija ir +1 vai -1. 32× mazāk atmiņas.

Kā tās darbojas:

Iegulšanas tiek apgūtas parastā veidā. Pēc tam tās binarizē: pozitīvās dimensijas kļūst par +1, negatīvās par -1.

Līdzība: punktu reizinājuma vietā izmantojiet Haminga attālumu vai XNOR-popcount. Daudz ātrāk.

Kompromisi:

Zaudējat daļu precizitātes. Bet daudziem uzdevumiem tam nav nozīmes. Izguve un tuvākā kaimiņa meklēšana ar binārajām iegulšanām darbojas labi.

Ieguvums: ievērojams ātrums un atmiņas efektivitāte. Ieviešana uz perifērijas ierīcēm. Ātra miljardiem vektoru apstrāde.

Dweve pieeja:

Ierobežojumi ir bināri modeļi. Pēc būtības binārās iegulšanas. 65 536 bitu hipervektori. Efektīva glabāšana, ātras darbības.

Modeļu saskaņošana, izmantojot XNOR un popcount. Līdzība, skaitot sakritības. Binārs visā ceļā uz leju.

Dimensiju skaitam ir nozīme

Cik dimensiju? Vairāk ne vienmēr nozīmē labāk.

Pārāk maz dimensiju: Nevar uztvert sarežģītību. Dažādi jēdzieni saduras. Zaudējat svarīgas atšķirības.

Pārāk daudz dimensiju: Aprēķinu izmaksas. Atmiņas patēriņš. Pārmācīšanās. Dimensiju lāsts (augstās dimensijās viss kļūst vienādā attālumā).

Tipiski izmēri:

Vārdu iegulšanas: 100-300 dimensijas

Teikumu iegulšanas: 384-1024 dimensijas

Attēlu iegulšanas: 512-2048 dimensijas

Binārie hipervektori: 1024-65536 biti (stabilām īpašībām)

Izvēle ir atkarīga no uzdevuma sarežģītības un aprēķinu budžeta.

Kas jums jāatceras

  • 1. Iegulšanas pārvērš visu skaitļos. Vārdi, attēli, jēdzieni kļūst par vektoriem. Ļauj veikt AI apstrādi.
  • 2. Nozīme kļūst par ģeometriju. Līdzīgi jēdzieni iegūst līdzīgus vektorus. Attālums mēra līdzību. Virzieni atspoguļo attiecības.
  • 3. Apgūtas no datiem, nevis roku darbs. Neironu tīkli apgūst iegulšanas apmācības laikā. Datu modeļi nosaka attēlojumu.
  • 4. Ļauj veikt semantiskas darbības. Matemātika ar vektoriem atspoguļo spriešanu par nozīmi. Vektoru aritmētika veic analoģijas.
  • 5. Vairāki veidi dažādiem datiem. Vārdi, teikumi, attēli, grafi. Katram ir specializētas iegulšanas metodes.
  • 6. Binārās iegulšanas piedāvā efektivitāti. 1 bits uz dimensiju, nevis 32. Ievērojami atmiņas un ātruma ieguvumi. Darbojas daudziem uzdevumiem.
  • 7. Dimensiju skaits ir kompromiss. Vairāk dimensiju uztver vairāk sarežģītības. Bet prasa aprēķinu resursus. Nepieciešams līdzsvars.
Binārie iedarinājumi vektoru izlaiž cauri lietuvei: patur zīmi, saskaiti sakritības un atgūsti atmiņu un ātrumu.

Būtība

Iedarinājumi ir tas, kā mākslīgais intelekts pārvar plaisu starp cilvēku jēdzieniem un mašīnu aprēķiniem. Viss nozīmīgais tiek pārveidots vektoros telpā, kur nozīmes līdzība kļūst par ģeometrijas līdzību.

Tas nav tikai attēlojums. Tas ir mūsdienu mākslīgā intelekta pamats. Meklēšana, ieteikumi, ģenerēšana, sapratne. Viss balstās uz iedarinājumiem.

Vektori nav patvaļīgi. Tie ir apgūti, lai uztvertu semantisko struktūru. Ģeometrija atspoguļo nozīmi. Matemātiskās darbības atbilst spriešanai.

Binārie iedarinājumi parāda, ka semantiskai nozīmei nav vajadzīga peldošā komata precizitāte. 1 bita attēlojumi darbojas. Efektīvi. Jebkurā mērogā. Ieviešami jebkur.

Izprast iedarinājumus nozīmē saprast, kā mākslīgais intelekts redz pasauli. Nevis kā vārdus vai attēlus. Bet kā vektorus augstas dimensijas telpā, kur nozīme ir matemātika.

Vēlaties efektīvus iedarinājumus? Iepazīstiet Dweve hipervektoru pieeju. 65 536 bitu bināri modeļi. Uz XNOR balstīta līdzība. Semantiskā nozīme binārajā telpā. Tāds attēlojums, kas darbojas aparatūras ātrumā.