Pamäť v AI: ako si modely pamätajú (a prečo zabúdajú)

AI nemá pamäť ako my. Ale potrebuje si pamätať kontext. Tu je návod, ako rôzne systémy umelej inteligencie pracujú s pamäťou a prečo je to dôležité.

Pamäť v AI: ako si modely pamätajú (a prečo zabúdajú)

Ilúzia pamäte

Chatujete s ChatGPT. Pamätá si, čo ste povedali pred tromi správami. Odpovedá súvisle. Udržiava kontext. Zdá sa, že má pamäť.

Nemá. Nie naozaj. Nie tak, ako si myslíte.

Pamäť umelej inteligencie je zásadne odlišná od ľudskej pamäte. Pochopenie toho, ako naozaj funguje, čo dokáže a čo nedokáže, je dôležité. Pretože obmedzenia sú reálne. A často prekvapivé.

Čo je pamäť umelej inteligencie v skutočnosti

Modely umelej inteligencie nemajú trvalú pamäť ako ľudia. Majú parametre (váhy) naučené počas tréningu a kontextové okná na spracovanie vstupov.

To je všetko. Dva typy „pamäte", oba úplne odlišné od biologickej pamäte:

1. Parametrická pamäť (váhy):

Počas tréningu sa model učí vzorce. Tieto vzorce sú zakódované v miliardách váh. Toto je parametrická pamäť. Vedomosti vstavané do štruktúry modelu.

Príklad: Jazykový model „vie", že „Paríž je hlavné mesto Francúzska", pretože sa tento vzorec objavil v tréningových dátach. Vedomosť je zakódovaná vo váhach. Nie je uložená ako text. Nedá sa vyvolať ako fakt. Len... zakódovaná ako vzorce aktivácie.

2. Kontextová pamäť (vstup):

Keď model používate, poskytujete mu vstup. Model tento vstup spracuje. Pri konverzačnej umelej inteligencii je celá vaša história konverzácie súčasťou vstupu. Toto je kontextová pamäť.

Model si vaše predchádzajúce správy nepamätá. Vy (alebo aplikácia) ich poskytnete znova pri každej novej správe. Model spracuje všetko zakaždým nanovo. Vyzerá to ako pamäť. V skutočnosti je to opakovanie.

Pamäť umelej inteligencie sa delí na natrénované váhy a znovu zasielaný kontext; ani jedno nie je spomínanie v ľudskom zmysle.

Kontextové okná (limit pamäte)

Kontextová pamäť má tvrdý limit: veľkosť kontextového okna.

Modely dokážu naraz spracovať iba pevný počet tokenov. GPT-4: 8K alebo 32K tokenov. Claude: 100K tokenov. Llama: 4K-8K tokenov.

Keď prekročíte kontextové okno, model už doslova nevidí skoršie informácie. Sú preč. Zabudnuté. Nie preto, že by model zabudol, ale preto, že sa nezmestia do vstupu.

Čo to znamená v praxi:

Dlhé konverzácie nakoniec okno prekročia. AI „zabudne" začiatok. Protirečí si. Stráca kontext. Nie je to chyba. Je to zásadné architektonické obmedzenie.

Aplikácie to riešia skracovaním starých správ. Ich sumarizáciou. Alebo ich jednoducho zahadzujú. Vaša konverzácia pôsobí plynulo. Pod povrchom sa informácie neustále zahadzujú.

Kontextové okno je pevný rám: keď sa konverzácia prestane zmestiteľná, skoršie tokeny zmiznú z priameho pohľadu.

Efektívnosť pamäte (binárne vs. pohyblivá rádová čiarka)

Využitie pamäte je dôležité. Obzvlášť na okrajových zariadeniach. Binárne siete menia rovnicu:

Modely s pohyblivou rádovou čiarkou:

Každá váha: 16 bitov (FP16) je štandard pre modernú AI. Miliardy váh. Spočítajte si to:

1 miliarda parametrov × 16 bitov = 2 GB len na váhy. Plus aktivácie. Plus stav optimalizátora počas tréningu. Pamäť exploduje.

Na inferenciu stále potrebujete 2 GB pre model FP16 s 1 miliardou parametrov. Edge zariadenia majú problém. Telefóny to nezvládnu. Kompresia je nevyhnutná.

Binárne modely:

Každá váha: 1 bit. Doslova. 16× menej pamäte ako FP16.

1 miliarda parametrov × 1 bit = 125 MB. Ľahko sa zmestí do telefónov. Vstavané zariadenia. IoT. Pamäťová efektívnosť umožňuje nasadenie všade.

Prístup Dweve:

Binárne ukladanie obmedzení. Každé obmedzenie je binárny vzor. Obrovské znalosti v malej pamäťovej stope. 456 doménovo špecializovaných sád obmedzení Loom sa zmestí do pracovnej pamäte na štandardnom hardvéri.

Nie preto, že sme šikovne komprimovali. Pretože binárna reprezentácia je pre logické vzťahy zásadne efektívnejšia.

Čo si treba zapamätať

  • 1. Pamäť AI nie je ľudská pamäť. Váhy kódujú vzory. Kontextové okná spracúvajú vstupy. Ani jedno nefunguje ako biologická pamäť.
  • 2. Kontextové okná majú pevné limity. Modely doslova nevidia za svoje okno. Informácie sa zahadzujú. Konverzácie sa skracujú.
  • 3. Pamäťová efektívnosť sa výrazne líši. FP16: 2 GB na miliardu parametrov. Binárne: 125 MB. 16× rozdiel. Umožňuje alebo znemožňuje nasadenie.
  • 4. „Zapamätanie" je často ilúzia. Aplikácie poskytujú históriu konverzácie. Vyhľadávacie systémy získavajú fakty. Model len spracúva to, čo dostane.
  • 5. Rôzne architektúry, rôzna pamäť. Transformery: simultánny kontext. RNN: sekvenčný stav. Systémy obmedzení: diskrétne vzťahy.
FP16 a binárne ukladanie nie sú drobné implementačné rozhodnutia; stopa rozhoduje o tom, či sa nasadenie zmestí do zariadenia.

Zrátané a podčiarknuté

Pamäť AI sa vôbec nepodobá ľudskej pamäti. My si pamätáme nepretržite, flexibilne aktualizujeme, spoľahlivo si vybavujeme. AI má parametre a kontextové okná. To je všetko.

Ilúzia pamäte pochádza z šikovného inžinierstva. Aplikácie znovu poskytujú kontext. Vyhľadávacie systémy získavajú fakty. Databázové vyhľadávania sa tvária ako vybavovanie.

Pochopenie tohto vám pomôže efektívne pracovať s AI. Poznať limity. Pracovať v ich rámci. Neočakávať ľudskú pamäť od zásadne odlišných systémov.

Binárne siete ponúkajú pamäťovú efektívnosť. Systémy obmedzení ponúkajú lepšiu izoláciu znalostí. Ale ani jedno nerieši základný problém: pamäť AI je architektonická, nie kognitívna. Parametre a okná, nie neuróny a synapsie.

Chcete pamäťovo efektívnu AI? Preskúmajte Dweve Loom. Binárna reprezentácia obmedzení. 456 doménovo špecializovaných sád v pracovnej pamäti. Diskrétne logické vzťahy. Také kódovanie znalostí, ktoré rešpektuje pamäťové obmedzenia.

Pocit vybavovania zvyčajne pochádza z orchestrovania okolo modelu: kontext, vyhľadávanie, databázy a nový prompt.