Az AI memóriája: hogyan emlékeznek a modellek (és miért felejtenek)

Így emlékeznek az AI-rendszerek, és miért számít ez.

Az AI memóriája: hogyan emlékeznek a modellek (és miért felejtenek)

A memória illúziója

Beszélgetsz a ChatGPT-vel. Emlékszik arra, amit három üzenettel korábban mondtál. Összefüggően válaszol. Fenntartja a kontextust. Úgy tűnik, van memóriája.

Pedig nincs. Nem igazán. Nem úgy, ahogy gondolod.

Az AI-memória alapjaiban különbözik az emberi memóriától. Fontos megérteni, hogyan működik valójában, mire képes és mire nem. Mert a korlátok valósak. És gyakran meglepőek.

Mi az AI-memória valójában

Az AI-modelleknek nincs tartós memóriájuk, mint az embereknek. Vannak paramétereik (súlyaik), amelyeket a tanítás során sajátítanak el, és van kontextusablakuk a bemenetek feldolgozásához.

Ennyi. Kétféle „memória", mindkettő teljesen különbözik a biológiai memóriától:

1. Paraméteres memória (a súlyok):

A tanítás során a modell mintázatokat tanul. Ezek a mintázatok milliárdnyi súlyban kódolódnak. Ez a paraméteres memória. A modell szerkezetébe égetett tudás.

Példa: Egy nyelvi modell „tudja", hogy „Párizs Franciaország fővárosa", mert ez a mintázat szerepelt a tanítóadatokban. A tudás a súlyokban van kódolva. Nem szövegként tárolódik. Nem lekérhető tényként. Csak... aktivációs mintázatokként van kódolva.

2. Kontextusmemória (a bemenet):

Amikor használod a modellt, bemenetet adsz meg. A modell feldolgozza ezt a bemenetet. A beszélgetéses AI esetében a teljes beszélgetési előzményed a bemenet része. Ez a kontextusmemória.

A modell nem emlékszik a korábbi üzeneteidre. Te (vagy az alkalmazás) adod meg őket újra minden egyes új üzenettel. A modell minden alkalommal frissen dolgozza fel a dolgokat. Memóriának tűnik. Valójában ismétlés.

Az AI-memória tanult súlyokra és újraküldött kontextusra bomlik; egyik sem emberi jellegű visszaemlékezés.

Kontextusablakok (a memóriakorlát)

A kontextusmemóriának kemény korlátja van: a kontextusablak mérete.

A modellek egyszerre csak rögzített mennyiségű tokent tudnak feldolgozni. GPT-4: 8K vagy 32K token. Claude: 100K token. Llama: 4K-8K token.

Amint túlléped a kontextusablakot, a modell szó szerint nem látja a korábbi információkat. Eltűnt. Elfelejtődött. Nem azért, mert a modell elfelejtette, hanem mert nem fér bele a bemenetbe.

Mit jelent ez a gyakorlatban:

A hosszú beszélgetések végül túllépik az ablakot. Az AI „elfelejti" az elejét. Ellentmond önmagának. Elveszíti a kontextust. Nem hiba. Alapvető architekturális korlát.

Az alkalmazások úgy kezelik ezt, hogy csonkolják a régi üzeneteket. Összegzik őket. Vagy egyszerűen eldobják. A beszélgetésed folyamatosnak tűnik. A felszín alatt azonban folyamatosan dobálódnak el információk.

A kontextusablak kemény keret: amikor a beszélgetés már nem fér bele, a korábbi tokenek eltűnnek a közvetlen látókörből.

Memóriahatékonyság (bináris vs. lebegőpontos)

A memóriahasználat számít. Különösen a peremeszközökön. A bináris hálózatok megváltoztatják az egyenletet:

Lebegőpontos modellek:

Minden súly: 16 bit (FP16) a modern AI szabványa. Milliárdnyi súly. Számolj utána:

1 milliárd paraméter × 16 bit = 2 GB csak a súlyokra. Plusz az aktivációk. Plusz az optimalizáló állapota a tanítás során. A memóriaigény az egekbe szökik.

Az inferenciához továbbra is 2 GB szükséges egy 1B paraméteres FP16 modellhez. A peremhálózati eszközök küzdenek. A telefonok nem bírják. A tömörítés elengedhetetlen.

Bináris modellek:

Minden súly: 1 bit. Szó szerint. 16× kevesebb memória, mint az FP16.

1 milliárd paraméter × 1 bit = 125 MB. Könnyedén elfér a telefonokon. Beágyazott eszközökön. IoT. A memóriahatékonyság lehetővé teszi a telepítést mindenhol.

A Dweve-megközelítés:

Bináris kényszertárolás. Minden kényszer egy bináris minta. Hatalmas tudás apró memórialábon. A Loom 456 doménspecifikus kényszerkészlete elfér a munkamemóriában szabványos hardveren.

Nem azért, mert okosan tömörítettünk. Hanem azért, mert a bináris reprezentáció alapvetően hatékonyabb a logikai kapcsolatok számára.

Amire Emlékezned Kell

  • 1. Az AI memóriája nem emberi memória. A súlyok mintákat kódolnak. A kontextusablakok feldolgozzák a bemeneteket. Egyik sem úgy működik, mint a biológiai memória.
  • 2. A kontextusablakoknak kemény korlátai vannak. A modellek szó szerint nem látnak túl az ablakukon. Az információk eldobódnak. A beszélgetések csonkolódnak.
  • 3. A memóriahatékonyság rendkívül változó. FP16: 2 GB milliárd paraméterenként. Bináris: 125 MB. 16× különbség. Lehetővé teszi vagy megakadályozza a telepítést.
  • 4. Az „emlékezés" gyakran illúzió. Az alkalmazások biztosítják a beszélgetési előzményeket. A keresőrendszerek lekérdezik a tényeket. A modell csak feldolgozza, amit kap.
  • 5. Különböző architektúrák, különböző memória. Transzformerek: egyidejű kontextus. RNN-ek: szekvenciális állapot. Kényszerrendszerek: diszkrét kapcsolatok.
Az FP16 és a bináris tárolás nem apró implementációs döntés; a lábnyom határozza meg, hogy a telepítés elfér-e az eszközön.

A Lényeg

Az AI memóriája semmiben sem hasonlít az emberi memóriára. Mi folyamatosan emlékezünk, rugalmasan frissítünk, megbízhatóan idézünk fel. Az AI-nak paraméterei és kontextusablakai vannak. Ennyi.

A memória illúziója okos mérnöki munkából fakad. Az alkalmazások újra biztosítják a kontextust. A keresőrendszerek lekérdezik a tényeket. Az adatbázis-lekérdezések felidézésnek álcázzák magukat.

Ennek megértése segít hatékonyan dolgozni az AI-jal. Ismerni a korlátokat. Azokon belül dolgozni. Nem elvárni az emberszerű memóriát alapvetően különböző rendszerektől.

A bináris hálózatok memóriahatékonyságot kínálnak. A kényszerrendszerek jobb tudásizolációt. De egyik sem oldja meg az alapvető problémát: az AI memóriája architekturális, nem kognitív. Paraméterek és ablakok, nem neuronok és szinapszisok.

Szeretnél memóriahatékony AI-t? Fedezd fel a Dweve Loomot. Bináris kényszerreprezentáció. 456 doménspecifikus készlet a munkamemóriában. Diszkrét logikai kapcsolatok. Az a fajta tudáskódolás, amely tiszteletben tartja a memóriakorlátokat.

A felidézés érzése általában a modell körüli összehangolásból fakad: kontextus, keresés, adatbázisok és egy friss prompt.