Pamćenje u umjetnoj inteligenciji: kako modeli pamte (i zašto zaboravljaju)
Iluzija pamćenja
Razgovarate s ChatGPT-jem. On pamti što ste rekli prije tri poruke. Odgovara suvislo. Održava kontekst. Čini se da ima pamćenje.
Nema ga. Ne zapravo. Ne na način na koji mislite.
Pamćenje umjetne inteligencije temeljno se razlikuje od ljudskog pamćenja. Razumijevanje kako zapravo funkcionira, što može, a što ne može, važno je. Jer ograničenja su stvarna. I često iznenađujuća.
Što je pamćenje umjetne inteligencije zapravo
Modeli umjetne inteligencije nemaju trajno pamćenje poput ljudi. Imaju parametre (težine) naučene tijekom treniranja te kontekstne prozore za obradu ulaznih podataka.
To je sve. Dvije vrste "pamćenja", obje potpuno različite od biološkog pamćenja:
1. Parametarsko pamćenje (težine):
Tijekom treniranja model uči obrasce. Ti se obrasci kodiraju u milijardama težina. To je parametarsko pamćenje. Znanje ugrađeno u strukturu modela.
Primjer: jezični model "zna" da je "Pariz glavni grad Francuske" jer se taj obrazac pojavio u podacima za treniranje. Znanje je kodirano u težinama. Nije pohranjeno kao tekst. Nije dostupno kao činjenica. Samo... kodirano kao obrasci aktivacije.
2. Kontekstno pamćenje (ulaz):
Kada koristite model, dajete mu ulaz. Model obrađuje taj ulaz. Za konverzacijsku umjetnu inteligenciju cijela vaša povijest razgovora dio je ulaza. To je kontekstno pamćenje.
Model se ne sjeća vaših prethodnih poruka. Vi (ili aplikacija) dajete ih ponovno uz svaku novu poruku. Model svaki put sve obrađuje ispočetka. Izgleda kao pamćenje. Zapravo je ponavljanje.
Kontekstni prozori (ograničenje pamćenja)
Kontekstno pamćenje ima strogo ograničenje: veličinu kontekstnog prozora.
Modeli mogu obraditi samo fiksnu količinu tokena odjednom. GPT-4: 8K ili 32K tokena. Claude: 100K tokena. Llama: 4K-8K tokena.
Kada prijeđete kontekstni prozor, model doslovno ne može vidjeti ranije informacije. Nestale su. Zaboravljene. Ne zato što je model zaboravio, nego zato što ne mogu stati u ulaz.
Što to praktično znači:
Dugi razgovori na kraju premaše prozor. Umjetna inteligencija "zaboravi" početak. Proturječi si. Gubi kontekst. Nije greška. Temeljno arhitektonsko ograničenje.
Aplikacije to rješavaju skraćivanjem starih poruka. Sažimanjem. Ili ih jednostavno odbacuju. Vaš razgovor djeluje neprekinuto. Ispod površine informacije se neprestano odbacuju.
Učinkovitost pamćenja (binarno naspram pomičnog zareza)
Korištenje pamćenja je važno. Osobito na rubnim uređajima. Binarne mreže mijenjaju jednadžbu:
Modeli s pomičnim zarezom:
Svaka težina: 16 bita (FP16) standard je za modernu umjetnu inteligenciju. Milijarde težina. Izračunajte:
1 milijarda parametara × 16 bita = 2 GB samo za težine. Plus aktivacije. Plus stanje optimizatora tijekom treniranja. Pamćenje eksplodira.
Za zaključivanje i dalje trebate 2 GB za model s 1 milijardom parametara u FP16 formatu. Rubni uređaji imaju poteškoća. Telefoni to ne mogu podnijeti. Kompresija je nužna.
Binarni modeli:
Svaka težina: 1 bit. Doslovno. 16 puta manje memorije od FP16.
1 milijarda parametara × 1 bit = 125 MB. Lako stane na telefone. Ugrađene uređaje. IoT. Učinkovitost memorije omogućuje implementaciju posvuda.
Pristup tvrtke Dweve:
Binarno pohranjivanje ograničenja. Svako je ograničenje binarni uzorak. Ogromno znanje u sićušnom memorijskom otisku. Loomovih 456 skupova ograničenja specijaliziranih za pojedina područja stane u radnu memoriju standardnog hardvera.
Ne zato što smo pametno komprimirali. Zato što je binarna reprezentacija temeljno učinkovitija za logičke odnose.
Što trebate zapamtiti
- 1. AI memorija nije ljudska memorija. Težine kodiraju uzorke. Kontekstni prozori obrađuju ulaze. Ni jedno ni drugo ne funkcionira poput biološke memorije.
- 2. Kontekstni prozori imaju stroga ograničenja. Modeli doslovno ne mogu vidjeti izvan svog prozora. Informacije se odbacuju. Razgovori se skraćuju.
- 3. Učinkovitost memorije uvelike varira. FP16: 2 GB po milijardi parametara. Binarno: 125 MB. Razlika od 16 puta. Omogućuje ili onemogućuje implementaciju.
- 4. "Pamćenje" je često iluzija. Aplikacije pružaju povijest razgovora. Sustavi za dohvat pronalaze činjenice. Model samo obrađuje ono što mu se da.
- 5. Različite arhitekture, različita memorija. Transformatori: istodobni kontekst. RNN-ovi: sekvencijalno stanje. Sustavi ograničenja: diskretni odnosi.
Zaključak
AI memorija nije ništa poput ljudske memorije. Mi pamtimo neprekidno, ažuriramo fleksibilno, dohvaćamo pouzdano. AI ima parametre i kontekstne prozore. To je sve.
Iluzija pamćenja proizlazi iz pametnog inženjeringa. Aplikacije ponovno pružaju kontekst. Sustavi za dohvat pronalaze činjenice. Pretraživanja baza podataka maskirana kao prisjećanje.
Razumijevanje toga pomaže vam učinkovito raditi s AI-jem. Poznavanje ograničenja. Rad unutar njih. Ne očekivati pamćenje poput ljudskog od temeljno drugačijih sustava.
Binarne mreže nude učinkovitost memorije. Sustavi ograničenja nude bolju izolaciju znanja. Ali ni jedno ne rješava temeljni problem: AI memorija je arhitektonska, a ne kognitivna. Parametri i prozori, a ne neuroni i sinapse.
Želite AI učinkovit u memoriji? Istražite Dweve Loom. Binarna reprezentacija ograničenja. 456 skupova specijaliziranih za pojedina područja u radnoj memoriji. Diskretni logički odnosi. Vrsta kodiranja znanja koja poštuje memorijska ograničenja.