Kif il-memorja fl-AI: kif il-mudelli jiftakru (u għaliex jinsiew)
L-Illużjoni tal-Memorja
Tkellem ma' ChatGPT. Jiftakar dak li għedt tliet messaġġi ilu. Iwiegħeb b'mod koerenti. Iżomm il-kuntest. Jidher li għandu memorja.
M'għandux. Mhux verament. Mhux kif taħseb int.
Il-memorja tal-AI hija fundamentalment differenti mill-memorja tal-bniedem. Li tifhem kif taħdem verament, x'tista' tagħmel u x'ma tistax, huwa importanti. Għax il-limitazzjonijiet huma reali. U spiss sorprendenti.
X'inhi Verament il-Memorja tal-AI
Il-mudelli tal-AI m'għandhomx memorja persistenti bħall-bnedmin. Għandhom parametri (piżijiet) li jitgħallmu waqt it-taħriġ, u għandhom twieqi ta' kuntest għall-ipproċessar tal-inputs.
Dak biss. Żewġ tipi ta' "memorja," it-tnejn kompletament differenti mill-memorja bijoloġika:
1. Memorja Parametrika (Il-Piżijiet):
Waqt it-taħriġ, il-mudell jitgħallem mudelli ta' informazzjoni. Dawk il-mudelli jiġu kkodifikati f'biljuni ta' piżijiet. Din hija l-memorja parametrika. Għarfien inkorporat fl-istruttura tal-mudell.
Eżempju: Mudell tal-lingwa "jaf" li "Pariġi hija l-kapitali ta' Franza" għax dak il-mudell deher fid-dejta tat-taħriġ. L-għarfien huwa kkodifikat fil-piżijiet. Mhux maħżun bħala test. Mhux irkuprat bħala fatt. Sempliċement... ikkodifikat bħala mudelli ta' attivazzjoni.
2. Memorja tal-Kuntest (L-Input):
Meta tuża l-mudell, tipprovdi input. Il-mudell jipproċessa dak l-input. Għall-AI konversazzjonali, l-istorja kollha tal-konversazzjoni tiegħek hija parti mill-input. Dik hija l-memorja tal-kuntest.
Il-mudell ma jiftakarx il-messaġġi preċedenti tiegħek. Int (jew l-applikazzjoni) tipprovdihom mill-ġdid ma' kull messaġġ ġdid. Il-mudell jipproċessa kollox mill-ġdid kull darba. Jidher bħal memorja. Fir-realtà, huwa ripetizzjoni.
Twieqi tal-Kuntest (Il-Limitu tal-Memorja)
Il-memorja tal-kuntest għandha limitu iebes: id-daqs tat-tieqa tal-kuntest.
Il-mudelli jistgħu jipproċessaw biss ammont fiss ta' tokens f'daqqa. GPT-4: 8K jew 32K tokens. Claude: 100K tokens. Llama: 4K-8K tokens.
Hekk kif taqbeż it-tieqa tal-kuntest, il-mudell litteralment ma jistax jara informazzjoni aktar bikrija. Tisparixxi. Minsija. Mhux għax il-mudell nesa, imma għax ma tistax tidħol fl-input.
Xi Jfisser Dan Prattikament:
Konversazzjonijiet twal eventwalment jaqbżu t-tieqa. L-AI "tinsa" l-bidu. Tikkontradixxi lilha nnifisha. Titlef il-kuntest. Mhux bug. Limitazzjoni arkitettonika fundamentali.
L-applikazzjonijiet jimmaniġġjaw dan billi jaqtgħu messaġġi qodma. Jissintetizzawhom. Jew sempliċement jitfgħuhom. Il-konversazzjoni tiegħek tħossha kontinwa. Taħt il-wiċċ, l-informazzjoni qed tintrema kontinwament.
Effiċjenza tal-Memorja (Binarju vs. Punt F'wiċċ l-Ilma)
L-użu tal-memorja huwa importanti. Speċjalment fuq apparati edge. In-netwerks binarji jibdlu l-ekwazzjoni:
Mudelli b'Punt F'wiċċ l-Ilma:
Kull piż: 16-il bit (FP16) huwa standard għall-AI moderna. Biljuni ta' piżijiet. Agħmel il-matematika:
Biljun parametru × 16-il bit = 2GB biss għall-piżijiet. Plus attivazzjonijiet. Plus l-istat tal-ottimizzatur waqt it-taħriġ. Il-memorja tisplodi.
Għall-inferenza, xorta għandek bżonn 2GB għal mudell FP16 ta' parametru 1B. Apparat edge jitħabat. Il-mowbajls ma jifilħux. Il-kompressjoni hija meħtieġa.
Mudelli Binarji:
Kull piż: bit 1. Letteralment. 16× inqas memorja minn FP16.
Biljun parametru × bit 1 = 125MB. Jidħol faċilment fuq il-mowbajls. Apparat embedded. IoT. L-effiċjenza tal-memorja tippermetti l-iskjerament kullimkien.
L-Approċċ ta' Dweve:
Ħażna ta' restrizzjonijiet binarji. Kull restrizzjoni hija mudell binarju. Għarfien massiv fi footprint żgħir ta' memorja. Is-settijiet ta' restrizzjonijiet speċjalizzati fid-dominju ta' Loom, 456 minnhom, jidħlu fil-memorja ta' ħidma fuq hardware standard.
Mhux għax ikkompressajna b'mod intelliġenti. Għax ir-rappreżentazzjoni binarja hija fundamentalment aktar effiċjenti għal relazzjonijiet loġiċi.
Dak li Għandek Bżonn Tiftakar
- 1. Il-memorja tal-AI mhijiex il-memorja tal-bniedem. Il-piżijiet jikkodifikaw mudelli. It-twieqi tal-kuntest jipproċessaw l-inputs. L-ebda waħda ma taħdem bħall-memorja bijoloġika.
- 2. It-twieqi tal-kuntest għandhom limiti iebsa. Il-mudelli litteralment ma jistgħux jaraw lil hinn mit-tieqa tagħhom. L-informazzjoni tintrema. Il-konversazzjonijiet jinqatgħu.
- 3. L-effiċjenza tal-memorja tvarja bil-kbir. FP16: 2GB għal kull biljun parametru. Binarju: 125MB. Differenza ta' 16×. Tippermetti jew tipprevjeni l-iskjerament.
- 4. Li "tiftakar" ħafna drabi huwa illużjoni. L-applikazzjonijiet jipprovdu l-istorja tal-konversazzjoni. Is-sistemi ta' rkupru jġibu l-fatti. Il-mudell biss jipproċessa dak li jingħatalu.
- 5. Arkitetturi differenti, memorja differenti. Transformers: kuntest simultanju. RNNs: stat sekwenzjali. Sistemi ta' restrizzjonijiet: relazzjonijiet diskreti.
Il-Qofol
Il-memorja tal-AI mhix xejn bħall-memorja tal-bniedem. Aħna niftakru kontinwament, naġġornaw b'mod flessibbli, nirkupraw b'mod affidabbli. L-AI għandha parametri u twieqi tal-kuntest. Dik hija.
L-illużjoni tal-memorja ġejja minn inġinerija intelliġenti. L-applikazzjonijiet jerġgħu jipprovdu l-kuntest. Is-sistemi ta' rkupru jġibu l-fatti. Tiftix fid-databases li jippretendi li huwa tifkir.
Li tifhem dan jgħinek taħdem mal-AI b'mod effettiv. Li tkun taf il-limiti. Taħdem fi ħdanhom. Li ma tistenax memorja bħall-bniedem minn sistemi fundamentalment differenti.
In-netwerks binarji joffru effiċjenza tal-memorja. Is-sistemi ta' restrizzjonijiet joffru iżolament aħjar tal-għarfien. Iżda l-ebda waħda ma ssolvi l-problema fundamentali: il-memorja tal-AI hija arkitettonika, mhux konjittiva. Parametri u twieqi, mhux newroni u sinapsi.
Trid AI effiċjenti fil-memorja? Esplora Dweve Loom. Rappreżentazzjoni ta' restrizzjonijiet binarji. 456 sett speċjalizzati fid-dominju fil-memorja ta' ħidma. Relazzjonijiet loġiċi diskreti. It-tip ta' kodifikazzjoni tal-għarfien li jirrispetta l-limiti tal-memorja.