Għaliex kulħadd juża GPUs għall-AI (u għaliex dan jista’ jinbidel)

Il-GPUs jiddominaw l-AI. Imma għaliex? U huma verament meħtieġa? Hawn il-verità onesta dwar CPU vs GPU għal xogħol tal-AI.

Għaliex kulħadd juża GPUs għall-AI (u għaliex dan jista’ jinbidel)

L-ossessjoni tal-GPU

Kellem lil ħadd dwar it-tmexxija tal-AI u jgħidulek: "Għandek bżonn GPU. Il-CPUs huma bil-mod wisq. Kulħadd juża GPUs."

U għandhom raġun. Fil-biċċa l-kbira. Il-GPUs jiddominaw l-AI għal raġunijiet tajbin. Iżda l-istorja mhix daqshekk sempliċi.

Il-fehim ta' għaliex rebħu l-GPUs, f'xiex huma tassew tajbin il-CPUs, u għaliex il-bilanċ jista' jkun qed jinbidel, huwa importanti. Speċjalment jekk inti qed tħallas il-kontijiet. Jew il-kontijiet tal-fornitur tal-elettriku tiegħek. Jew qed tistaqsi għaliex iċ-ċentru tad-dejta tiegħek għandu bżonn is-substazzjoni tal-elettriku tiegħu stess.

L-għerf konvenzjonali jgħid: in-netwerks newrali b'punt li jvarja għandhom bżonn parallelizmu massiv, il-GPUs jipprovdu parallelizmu massiv, għalhekk jirbħu l-GPUs. Iżda dik hija biss nofs l-istorja. In-nofs l-ieħor jinvolvi dak li jiġri meta tbiddel il-matematika.

X'inhuma tassew il-CPUs u l-GPUs

Nibdew mill-baŜi:

CPU (Central Processing Unit):

Il-moħħ tal-kompjuter tiegħek. Imfassal għal kompiti ta' skop ġenerali. Imexxi s-sistema operattiva tiegħek. Iftaħ il-fajls. Jimmaniġġja l-memorja. Jeżegwixxi l-programmi. Jagħmel ftit minn kollox.

Il-CPUs moderni għandhom 8-64 qalba. Kull qalba hija qawwija. Tista' timmaniġġja loġika kumplessa. Fergħat. Kompiti sekwenzjali. Eċċellenti biex tagħmel affarijiet differenti malajr. Aħseb f'CPU bħala tim żgħir ta' inġiniera tas-sengħa ħafna, kull wieħed jista' jsolvi problemi kumplessi b'mod indipendenti.

GPU (Graphics Processing Unit):

Oriġinarjament mibni għall-grafika. Ir-rendering ta' xenarji 3D jeħtieġ l-istess matematika sempliċi fuq miljuni ta' pixels simultanjament. Il-GPUs jeċċellaw f'dan: operazzjonijiet sempliċi, parallelizmu massiv.

Il-GPUs moderni għandhom eluf ta' qlub. Kull qalba hija aktar sempliċi minn qalba ta' CPU. Iżda eluf minnhom jaħdmu flimkien? Rata ta' ħidma komputazzjonali enormi għal kompiti paralleli. Aħseb f'GPU bħala art ta' fabbrika b'eluf ta' ħaddiema, kull wieħed jagħmel kompitu sempliċi wieħed malajr ħafna.

Dik hija d-differenza fundamentali: il-CPUs huma ġeneralisti versatili. Il-GPUs huma proċessuri paralleli speċjalizzati.

Hawnhekk hawn paragun viżwali:

CPU: Ftit Qlub Qawwija Qalba 1 Qalba 2 Qalba 3 Qalba 4 Qalba 5 Qalba 6 Qalba 7 Qalba 8 Kompiti kumplessi, fergħat, loġika GPU: Eluf ta' Qlub Sempliċi Eluf ta' qlub Operazzjonijiet sempliċi u paralleli Prestazzjoni fuq xogħol tal-AI: Punt li jvarja: il-GPU tirbaħ 20-100× Operazzjonijiet binarji: il-CPU kompetittiva jew aktar mgħaġġla
Il-CPUs u l-GPUs huma mibnija għal forom differenti ta' xogħol: ftit qlub ġenerali b'saħħithom kontra eluf ta' korsiji sempliċi u ripetuti.

Għaliex il-GPUs jiddominaw l-AI

Il-piż tax-xogħol tal-AI, speċjalment in-netwerks newrali, huwa parallel b'mod imbarazzanti. Hawn għaliex il-GPUs jirbħu:

Multiplikazzjoni tal-matriċi kullimkien:

In-netwerks newrali huma l-aktar multiplikazzjonijiet ta' matriċi. Immoltiplika l-input bil-piżijiet. Miljuni ta' multiplikazzjonijiet. Kollha indipendenti. Perfetti għall-ipproċessar parallel.

GPU: Agħmel il-multiplikazzjonijiet kollha fl-istess ħin fuq eluf ta' qlub. Mgħaġġel.

CPU: Agħmel il-multiplikazzjonijiet b'mod sekwenzjali jew fuq qlub limitati. Ħafna aktar bil-mod.

Eżempju: Saff wieħed f'mudell lingwistiku kbir jista' jimmoltiplika matriċi ta' 1024×4096 b'matriċi ta' 4096×1024. Dak huwa aktar minn 4 biljun operazzjoni ta' multiplikazzjoni u żieda. Fuq GPU b'qlub tat-tensor, dan jieħu millisekondi. Fuq CPU, sekondi. Id-distakk huwa enormi.

L-istess operazzjoni, data differenti:

Kull newron jagħmel l-istess operazzjoni: multiplikazzjoni u żieda. Biss b'data differenti. Dan jissejjaħ SIMD (Single Instruction, Multiple Data). Il-GPUs huma mibnija għal dan.

GPU: Istruzzjoni waħda mxandra lill-eluf ta' qlub. Kull wieħed japplikaha għal data differenti. Effiċjenti.

CPU: Jista' jagħmel SIMD b'istruzzjonijiet vettorjali (AVX-512), iżda biss fuq wisa' żgħira (8-16 operazzjoni). Ma jiskalawx bħall-GPUs.

Huwa bħal li tagħti l-istess riċetta lil elf kok kontra tmien kokijiet. L-elf kok jispiċċaw id-dixxijiet tagħhom fl-istess ħin. It-tmien kokijiet iridu jaħdmu f'lottijiet. Matematika sempliċi.

Wisa' tal-memorja:

L-AI teħtieġ li ċċaqlaq ammonti enormi ta' data. Biljuni ta' piżijiet. Biljuni ta' attivazzjonijiet. Il-wisa' tal-memorja jimpurta.

GPU: Arkitettura tal-memorja ottimizzata. Memorja b'wisa' għolja (HBM). Imfassla għal piżijiet ta' xogħol intensivi fid-data. Mijiet ta' GB/s.

CPU: Wisa' tal-memorja aktar baxxa. Ottimizzat għal-latenza, mhux għall-throughput. Għexieren ta' GB/s.

Aħseb fiha bħal pajpijiet tal-ilma. Il-GPUs għandhom pajpijiet enormi li jistgħu jiċċaqilqu ammonti vasti ta' data malajr. Il-CPUs għandhom pajpijiet idjaq ottimizzati għal aċċess rapidu għal ammonti iżgħar ta' data. Għat-tsunami ta' data tal-AI, trid il-pajpijiet akbar.

Hardware speċjalizzat:

Il-GPUs moderni għandhom qlub tat-tensor. Hardware speċifikament għall-multiplikazzjoni tal-matriċi. Estremament veloċi għall-piżijiet ta' xogħol tal-AI.

L-NVIDIA A100, pereżempju, jagħti sa 624 TFLOPS ta' prestazzjoni FP16 bil-qlub tat-tensor tat-tielet ġenerazzjoni tiegħu. L-H200 imur saħansitra ogħla b'memorja HBM3e mtejba. Dawn mhumiex biss veloċi; huma mibnija apposta għall-operazzjonijiet eżatti li n-netwerks newrali jeħtieġu.

Il-CPUs huma għal skop ġenerali. L-ebda hardware speċjalizzat tal-AI (l-aktar). Jagħmlu kollox sew, imma xejn eċċezzjonali.

Għan-netwerks newrali tradizzjonali b'operazzjonijiet b'punt li jvarja, il-GPUs huma 10-100× aktar veloċi mill-CPUs. Id-distakk huwa reali.

In-netwerks newrali tradizzjonali huma l-aktar matematika ta' matriċi ripetuta. Huwa għalhekk li l-korsiji tal-GPU jiddominaw it-taħriġ b'punt li jvarja u l-inferenza ta' mudelli kbar.

F'xiex huma tassew tajbin il-CPUs

Il-CPUs mhumiex inutli għall-AI. Huma eċċellenti f'affarijiet differenti:

Loġika kumplessa u fergħat:

Il-CPUs jimmaniġġjaw tajjeb il-loġika kondizzjonali. Jekk-inkella. Dikjarazzjonijiet switch. Kontroll tal-fluss kumpless. Il-GPUs ibatu ma' dan. Il-fergħat jikkawżaw diverġenza, u joqtlu l-paralleliżmu.

Għal kompiti tal-AI b'ħafna loġika kondizzjonali, il-CPUs jistgħu jikkompetu.

Immaġina GPU b'eluf ta' cores jipprova jeżegwixxi mogħdijiet ta' kodiċi differenti. Nofs il-cores iridu jmorru xellug, nofs iridu jmorru lemin. Il-GPU jrid jeżegwixxi ż-żewġ mogħdijiet u jaħbi r-riżultati. Ħela. CPU sempliċiment jeżegwixxi l-mogħdija li għandu bżonn. Effiċjenti għal-loġika ta' fergħat.

Inferenza b'latency baxx:

Għal mudelli żgħar b'rekwiżiti stretti ta' latency, il-CPUs jirbħu. L-ebda overhead ta' trasferiment tad-data. L-ebda inizjalizzazzjoni tal-GPU. Eżekuzzjoni immedjata biss.

Apparati edge, sistemi f'ħin reali, applikazzjonijiet interattivi. L-inferenza fuq CPU hija prattika.

It-trasferiment PCIe waħdu jista' jżid 1-10 millisekondi. Għal mudell li jaħdem f'2 millisekondi, dak l-overhead huwa inaċċettabbli. Il-CPUs jeżegwixxu immedjatament. Żero latency ta' trasferiment. Dan jimpurta għal applikazzjonijiet reattivi.

Operazzjonijiet integri u binarji:

Il-CPUs huma eċċellenti fil-matematika integra. Operazzjonijiet ta' bits. Operazzjonijiet loġiċi. Dawn huma operazzjonijiet fundamentali tal-CPU, ottimizzati matul għexieren ta' snin.

Għal netwerks newrali binarji jew mudelli kwantizzati b'numri integri, id-distakk bejn CPU u GPU jonqos b'mod drammatiku.

Il-gates XNOR ilhom fil-CPUs mill-bidu tagħhom. L-għadd ta' bits (popcount) huwa istruzzjoni ta' ċiklu wieħed fuq CPUs moderni. Dawn l-operazzjonijiet huma tant fundamentali li l-inġiniera tas-silikon ottimizzawhom bla waqfien. Meta l-mudell tal-AI tiegħek juża dawn l-operazzjonijiet primittivi minflok il-multiplikazzjoni-addizzjoni b'punt li jvarja, f'daqqa waħda l-għexieren ta' snin ta' ottimizzazzjoni tal-CPU jiswew aktar mill-cores paralleli tal-GPU.

Disponibbiltà ġenerali:

Kull apparat għandu CPU. Mhux kull apparat għandu GPU. Għal skjerament kullimkien, il-CPUs huma l-unika għażla universali.

Telefowns, apparati IoT, sistemi integrati. L-inferenza fuq CPU ħafna drabi hija l-unika għażla.

L-Ewropa għandha rekwiżiti stretti ta' residenza tad-data taħt il-GDPR. It-tħaddim tal-AI lokalment fuq CPUs jevita d-dipendenzi fuq il-cloud u l-kumplikazzjonijiet ta' trasferiment tad-data transkonfinali. It-telefon tal-utent tiegħek diġà għandu CPU. L-ebda ħardwer addizzjonali meħtieġ. L-ebda data ma titlaq mill-apparat. Konformità lesta.

Il-bidla kbira tan-netwerks newrali binarji

Hawnhekk isir interessanti. Tiftakar dawk l-operazzjonijiet binarji li l-CPUs huma tajbin fihom?

In-netwerks newrali binarji jużaw XNOR u popcount minflok il-multiplikazzjoni-addizzjoni b'punt li jvarja. Dawn huma operazzjonijiet nattivi tal-CPU. Estremament veloċi fuq CPUs.

Il-matematika hija eleganti: minflok timmultiplika numri b'punt li jvarja ta' 32-bit, tqabbel valuri ta' bit wieħed b'XNOR, imbagħad tgħodd il-bits li jaqblu b'popcount. L-istess tqabbil loġiku, implimentazzjoni ferm aktar sempliċi. U l-CPUs ilhom jagħmlu dan mis-snin sebgħin.

Prestazzjoni tal-CPU b'netwerks binarji:

Għal netwerks binarji, il-CPUs jistgħu jaqblu jew jaqbżu l-prestazzjoni tal-GPU. Għaliex?

XNOR u popcount huma rħas fuq CPUs. 6 transisters għal XNOR. Operazzjonijiet ta' ċiklu wieħed. L-ebda overhead ta' punt li jvarja.

Il-GPUs huma ottimizzati għal punt li jvarja. Il-cores tensor tagħhom ma jgħinux fl-operazzjonijiet binarji. L-ispeċjalizzazzjoni ssir limitazzjoni.

Huwa bħal li ġġib karozza tal-Formula Wieħed għal tiġrija rally. Ċertament, hija veloċi fuq binarji lixxi. Imma meta t-terren jinbidel, il-magna speċjalizzata tbati waqt li l-karozza rally versatili teċċella. L-operazzjonijiet binarji biddlu t-terren.

L-approċċ ta' Dweve:

Is-sistema Loom tagħna taħdem b'mod sinifikanti aktar malajr fuq CPUs meta mqabbla ma' mudelli transformer fuq GPUs. Mhux għax għandna maġija. Għax operazzjonijiet binarji jaqblu aħjar mal-CPUs milli l-aritmetika b'punt li jvarja taqbel magħhom.

XNOR-popcount huwa dak li l-CPUs kienu ddisinjati biex jagħmlu. Operazzjonijiet loġiċi. Għadd ta' bits. Mgħaġġel.

Dan mhux teoretiku. Huwa li jista' jitkejjel. Netwerks binarji jibdlu fundamentalment l-ekwazzjoni tal-ħardwer. Meta tista' tattiva biss 4-8 speċjalisti ta' dominju minn 456 għażla disponibbli billi tuża restrizzjonijiet binarji, u kull speċjalista ta' dominju huwa 64-128MB ta' regoli loġiċi puri, il-CPUs jimmaniġġjaw dan b'mod brillanti. L-ebda aritmetika b'punt li jvarja meħtieġa. Biss operazzjonijiet ta' bits veloċi u effiċjenti.

Konsum tal-enerġija (l-ispiża moħbija)

Il-prestazzjoni mhix kollox. Il-konsum tal-enerġija jimpurta. Speċjalment fl-Ewropa, fejn l-ispejjeż tal-enerġija huma għoljin u r-regolamenti tas-sostenibbiltà huma stretti.

Konsum tal-enerġija tal-GPU:

GPUs AI ta' livell għoli jikkunsmaw 300-700 watt. Taħt tagħbija, kontinwament. Għal sigħat jew jiem waqt it-taħriġ.

Ċentri tad-dejta mimlija GPUs jikkunsmaw megawatts. Ammont ta' elettriku ta' impjanti tal-enerġija. Rekwiżiti enormi ta' tkessiħ. L-ispiża operattiva hija massiva.

Proċessuri AI futuri huma proġettati li jikkunsmaw sa 15,360 watt kull wieħed. Dik mhix żball ta' kitba. Ħmistax-il kilowatt. Għal kull ċippa. Ikollok bżonn soluzzjonijiet eżotiċi ta' tkessiħ u infrastruttura ddedikata tal-enerġija. Id-Direttiva tal-UE dwar l-Effiċjenza tal-Enerġija tirrikjedi li ċ-ċentri tad-dejta kklassifikati 'l fuq minn 500 kilowatt jirrappurtaw il-konsum tal-enerġija. B'GPUs bħal dawn, tilħaq dak il-limitu malajr.

Konsum tal-enerġija tal-CPU:

CPUs moderni jikkunsmaw 50-150 watt taħt tagħbijiet ta' AI. Ħafna inqas minn GPUs.

Għall-inferenza, speċjalment għall-iskjerament fil-periferija, l-effiċjenza tal-enerġija timpurta. Ħajja tal-batterija. Limiti termali. Spejjeż operattivi.

AMD reċentement ħabbret li kisbet titjib ta' effiċjenza tal-enerġija fuq skala ta' rack ta' 20× għal sistemi AI sal-2030, li jaqbeż it-tendenzi tal-industrija b'kważi 3×. Iżda anki b'dawn it-titjibiet, il-GPUs jibqgħu jikkunsmaw ħafna enerġija meta mqabbla mal-CPUs għal ħafna tagħbijiet ta' xogħol.

Vantaġġ tal-operazzjonijiet binarji:

Operazzjonijiet binarji jikkunsmaw ħafna inqas enerġija mill-aritmetika b'punt li jvarja. Ċirkwiti aktar sempliċi. Inqas attività ta' swiċċjar. Inqas enerġija għal kull operazzjoni.

Fuq CPUs b'netwerks binarji: tnaqqis ta' 96% fil-konsum tal-enerġija meta mqabbel ma' netwerks b'punt li jvarja fuq GPUs. L-istess kompitu. Frazzjoni tal-enerġija.

Dan jimpurta għas-sostenibbiltà. Għall-ispejjeż operattivi. Għar-restrizzjonijiet tal-iskjerament. Meta l-ispejjeż tal-elettriku Ewropej huma fost l-ogħla globalment, it-tħaddim ta' AI fuq CPUs b'operazzjonijiet binarji mhux biss huwa effiċjenti; huwa ekonomikament sensibbli. Il-kontabilist tiegħek japprezza l-kontijiet tal-enerġija aktar baxxi. L-uffiċjal tas-sostenibbiltà tiegħek japprezza l-impronta tal-karbonju mnaqqsa.

Kunsiderazzjonijiet tal-ispiża (ir-realtà tan-negozju)

Il-ħardwer jiswa l-flus. Ejja nkunu speċifiċi:

  • Spejjeż tal-GPU: GPUs AI ta' livell għoli jiswew għexieren ta' eluf għal kull unità. Il-kiri ta' ċentru tad-dejta jvarja iżda jiżdied malajr. It-taħriġ ta' mudelli kbar jeħtieġ mijiet ta' GPUs għal ġimgħat. Il-kont jilħaq miljuni.
  • Spejjeż tal-CPU: CPUs ta' livell għoli jiswew eluf, mhux għexieren ta' eluf. Ħafna orħos. Diġà f'kull server. L-ebda xiri addizzjonali ta' ħardwer meħtieġ.
  • TCO (Spiża Totali tas-Sjieda): GPUs jeħtieġu spiża tal-ħardwer flimkien mal-konsum tal-enerġija flimkien mat-tkessiħ flimkien ma' infrastruttura speċjalizzata. TCO għoli.

CPUs: Spiża tal-ħardwer aktar baxxa flimkien ma' enerġija aktar baxxa flimkien ma' infrastruttura standard. TCO aktar baxx.

Għall-inferenza fuq skala, speċjalment b'netwerks binarji, il-CPUs jistgħu jkunu aktar kosteffettivi. Id-distakk fil-prestazzjoni jingħalaq, id-distakk fl-ispiża jikber favur il-CPU.

Hawn eżempju prattiku: Tmexxi inferenza għal miljun talba kuljum. Fuq GPUs b'mudelli b'punt li jvarja, jista' jkollok bżonn servers GPUs dedikati, infrastruttura ta' tkessiħ, u baġits kbar ta' enerġija. Fuq CPUs b'netwerks binarji, tista' tuża l-infrastruttura eżistenti tas-server, tkessiħ standard, u frazzjoni tal-enerġija. L-istess kapaċitajiet, ekonomija ferm differenti.

Il-kumpaniji Ewropej jiffaċċjaw konsiderazzjoni addizzjonali: sovranità tal-hardware. Il-biċċa l-kbira tal-GPUs AI ta' livell għoli jiġu minn manifatturi Amerikani. Id-dipendenza fuq il-katina tal-provvista toħloq riskji. Il-CPUs joffru aktar għażliet ta' sorsi diversi, inklużi manifatturi Ewropej. Meta t-tensjonijiet ġeopolitiċi jaffettwaw il-provvisti taċ-ċipep, li jkollok alternattivi jgħodd.

Netwerks binarji jibdlu l-adattament tal-magna: XNOR u popcount jimxu l-inferenza lejn operazzjonijiet li l-CPUs diġà jesegwixxu b'mod effiċjenti.

Meta tuża liema

L-għażla t-tajba tiddependi mill-każ tiegħek:

Uża GPUs meta:

Taħriġ ta' mudelli kbar b'punt li jvarja. Il-prestazzjoni hija kritika. Il-baġit jippermetti. L-enerġija mhix ristretta. Arkitetturi tradizzjonali ta' netwerks newrali.

Il-GPUs jisbqu hawnhekk. Ebda dubju. Jekk qed tħarreġ mudell transformer ta' 70 biljun parametru, il-GPUs huma ħabib tiegħek. L-arkitettura parallela tagħhom u t-tensor cores jagħmluhom l-għażla ovvja għal multiplikazzjonijiet massivi ta' matriċi b'punt li jvarja.

Uża CPUs meta:

Tmexxi inferenza fit-tarf. L-enerġija hija limitata. L-ispiża timporta. Ir-rekwiżiti ta' latenza huma stretti. Mudelli binarji jew kwantizzati. Skjerament kullimkien.

Il-CPUs jagħmlu sens. Spiss l-unika għażla.

Ikkunsidra wkoll CPUs meta jkollok bżonn konformità mal-GDPR b'ipproċessar lokali, meta qed tiskjera fuq hardware divers mingħajr disponibbiltà ta' GPUs, meta l-effiċjenza tal-enerġija timporta aktar mill-throughput mhux ipproċessat, jew meta qed tuża netwerks newrali binarji li jisfruttaw il-qawwiet tal-CPUs.

L-approċċ ibridu:

Iħarreġ fuq GPUs (jekk tuża punt li jvarja). Ippjegahom fuq CPUs (b'verżjonijiet binarji/kwantizzati). L-aħjar taż-żewġ dinjiet.

Jew iħarreġ netwerks binarji fuq CPUs mill-bidu. Aqbeż il-GPUs għal kollox. Dan huwa l-approċċ ta' Dweve.

M'hemm l-ebda tweġiba universali. Id-dogma li "għandek bżonn GPU" tinjora n-nuqqas ta' sfumatura. Il-workload tiegħek, l-ambjent ta' skjerament, il-vinkoli tal-baġit, u l-għażliet arkitettonali kollha jgħoddu. Ħu deċiżjoni infurmata, mhux waħda riflessiva.

Il-futur (evoluzzjoni tal-hardware)

Il-pajsaġġ tal-hardware qed jinbidel:

Ċipep AI speċjalizzati:

TPUs (Google). Neural engines (Apple). ASICs customizzati. Ottimizzati għal workloads AI speċifiċi. La CPU pura u lanqas GPU pura.

Dawn jistgħu jiddominaw niċeċ speċifiċi. Iżda l-CPUs u l-GPUs jibqgħu ta' użu ġenerali. U ċ-ċipep speċjalizzati jiġu b'riskji ta' lock-in tal-fornitur. Meta Google tikkontrolla t-TPUs u Apple tikkontrolla n-neural engines, inti tiddependi fuq il-pjanijiet direzzjonali u l-ipprezzar tagħhom. Il-kumpaniji Ewropej għandhom jikkunsidraw dawn l-implikazzjonijiet ta' sovranità.

Estensjonijiet AI tal-CPU:

Intel AMX (Advanced Matrix Extensions). ARM SVE2. Estensjonijiet vettorjali RISC-V. CPUs li jżidu istruzzjonijiet speċifiċi għall-AI.

Id-distakk CPU-GPU għall-AI qed jitnaqqas. Speċjalment għal operazzjonijiet sħaħ u binarji.

Dawn l-estensjonijiet iġibu aċċelerazzjoni tal-multiplikazzjoni tal-matriċi direttament fil-CPUs. Mhux qawwija daqs GPUs dedikati għal punt li jvarja, iżda biżżejjed għal ħafna workloads. U jiġu standard, mingħajr bżonn ta' hardware addizzjonali.

Arkitetturi effiċjenti fl-enerġija:

Hekk kif jogħlew l-ispejjeż tal-enerġija, l-effiċjenza tiswa aktar mill-prestazzjoni mhux ipproċessata. Operazzjonijiet binarji. Ċipep newromorfiċi. Kompjuters analogiċi.

Il-futur jiffavorixxi l-effiċjenza. CPUs b'operazzjonijiet binarji jaqblu ma' din it-tendenza aħjar minn GPUs li jikkunsmaw ħafna enerġija b'punti li jvarjaw.

Il-prezzijiet tal-enerġija Ewropej u r-regolamenti tas-sostenibbiltà jaċċelleraw dan il-bidla. Meta tkun qed tħallas rati għoljin għall-elettriku u tiffaċċja mandati ta' tnaqqis tal-karbonju, l-effiċjenza mhix għażla. Hija obbligatorja. Hardware li jagħmel aktar b'inqas enerġija jirbaħ.

Tkabbir tal-edge computing:

AI qed timxi mill-cloud għall-edge. Telefowns. Karozzi. Apparat tal-IoT. Dawn għandhom CPUs, mhux GPUs.

AI effiċjenti fuq CPUs issir obbligatorja, mhux għażla.

L-Att dwar l-AI tal-UE jenfasizza l-ipproċessar lokali għal ċerti applikazzjonijiet. Edge computing b'AI bbażata fuq CPUs jallinja perfettament ma' dawn ir-rekwiżiti regolatorji. Id-dejta tibqa' lokali. L-ipproċessar isir lokalment. Il-konformità hija aktar sempliċi.

Numri ta' prestazzjoni fid-dinja reali

Ejjew inkunu speċifiċi b'kejl attwali:

Netwerks newrali b'punti li jvarjaw:

GPU: 100-300 TFLOPS (triljun operazzjonijiet b'punti li jvarjaw kull sekonda). Mudelli ta' livell għoli bħall-A100 jilħqu 624 TFLOPS għal FP16. L-H200 il-ġdid imbotta saħansitra ogħla.

CPU: 1-5 TFLOPS

Rebbieħ: GPU (20-100× aktar mgħaġġel)

Id-distakk huwa innegabbli. Għal netwerks newrali tradizzjonali, GPUs jiddominaw. Dan huwa għaliex kulħadd assuma li għandek bżonn GPUs għall-AI. Għal għaxar snin, kellhom raġun.

Netwerks newrali binarji:

GPU: Limitata min-nuqqas ta' hardware speċjalizzat. Juża INT8 jew kernels personalizzati. Forsi 10-30× aktar mgħaġġel mill-CPU għal operazzjonijiet binarji.

CPU: XNOR u popcount huma nattivi. Estremament mgħaġġla. Parallel fuq cores b'AVX-512.

Rebbieħ: CPU tista' taqbel jew taqbeż il-GPU (Dweve Loom: 40× aktar mgħaġġel fuq CPU vs transformers fuq GPU)

Din il-bidla mhix maġija. Hija matematika li tiltaqa' mad-disinn tal-hardware. Operazzjonijiet binarji jilagħbu mal-qawwiet tal-CPU bl-istess mod li l-multiplikazzjoni b'punti li jvarjaw tilgħab mal-qawwiet tal-GPU.

Latenza:

GPU: Spejjeż ta' trasferiment PCIe. 1-10ms biss għall-moviment tad-dejta.

CPU: L-ebda spejjeż ta' trasferiment. Inferenza ta' inqas minn millisekonda possibbli.

Rebbieħ: CPU għal applikazzjonijiet ta' latenzi baxxi

Dawk l-ispejjeż PCIe huma fissi. L-ebda ammont ta' ottimizzazzjoni ma jeliminahom. Għal applikazzjonijiet f'ħin reali fejn kull millisekonda tgħodd, CPUs jirbħu bid-disinn.

Effiċjenza tal-enerġija (operazzjonijiet għal kull watt):

GPU: ~500-1000 GFLOPS/W (punti li jvarjaw)

CPU: ~100-200 GFLOPS/W (punti li jvarjaw)

Rebbieħ: GPU għal punti li jvarjaw

Operazzjonijiet binarji jibdlu dan:

CPU b'operazzjonijiet binarji: 10-50× aħjar ops/watt mill-GPU b'punti li jvarjaw

Rebbieħ: CPU b'operazzjonijiet binarji

Meta l-ispejjeż tal-elettriku Ewropej ikunu 3-4× ogħla minn dawk fl-Istati Uniti, dawn id-differenzi fl-effiċjenza jittraduċu direttament fi spejjeż operattivi. Il-każ tan-negozju għal AI bbażata fuq CPUs isir konvinċenti malajr.

Dak li għandek bżonn tiftakar

Jekk ma tieħu xejn ieħor minn dan, ftakar:

  • 1. Il-GPU jiddominaw l-AI b'punt mobbli. Parallelitiżmu fil-multiplikazzjoni tal-matriċi. Tensor cores speċjalizzati. 20-100× aktar mgħaġġla mill-CPU għal netwerks newrali tradizzjonali. Għal xogħol b'punt mobbli, huma l-għażla ċara.
  • 2. Il-CPU jisbqu f'affarijiet differenti. Loġika kumplessa. Latenza baxxa. Operazzjonijiet binarij/integer. Disponibbiltà universali. Ipproċessar lokali konformi mal-GDPR.
  • 3. In-netwerks binarij jibdlu l-ekwazzjoni. XNOR u popcount huma operazzjonijiet nattivi tal-CPU. Il-CPU jistgħu jaqblu jew jaqbżu l-prestazzjoni tal-GPU għal AI binarja. Il-bidla matematika tiffavorixxi l-arkitettura tal-CPU.
  • 4. Il-konsum tal-enerġija qed isir dejjem aktar importanti. GPU: 300-700W illum, sa 15,360W proġettati. CPU: 50-150W. Operazzjonijiet binarij: tnaqqis ta' 96% fil-konsum. Bl-ispejjeż tal-enerġija Ewropej u l-mandati tas-sostenibbiltà, l-effiċjenza mhix għażla.
  • 5. L-ispiża mhix biss il-hardware. Enerġija. Tkessiħ. Infrastruttura. Sovranità tal-katina tal-provvista. It-TCO jgħodd. Il-CPU spiss ikunu orħos għall-inferenza fuq skala kbira, speċjalment b'netwerks binarij.
  • 6. Agħżel abbażi tax-xogħol, mhux tad-duttrina. Taħriġ ta' mudelli kbar b'punt mobbli? GPU. Inferenza fil-periferija? CPU. Netwerks binarij? CPU. Konformità mal-GDPR? CPU. Approċċi ibridi jaħdmu wkoll.
  • 7. Il-futur jiffavorixxi l-effiċjenza. Edge computing. Spejjeż tal-enerġija li qed jogħlew. Regolamenti tal-UE dwar is-sostenibbiltà. Rekwiżiti tal-AI Act. Arkitetturi li jiffavorixxu l-CPU qed jogħlew, mhux jonqsu.
Il-proċessur it-tajjeb jiddependi fuq il-forma tax-xogħol, il-baġit tal-enerġija, il-latenza, l-ispiża totali, il-post tad-deploy, u l-vinċoli tas-sovranità.

Il-qofol

Il-GPU rebħu l-ewwel rawnd tal-AI għax in-netwerks newrali kienu ddisinjati għal operazzjonijiet b'punt mobbli u parallelitiżmu massiv. Il-GPU nbnew eżattament għal dak. Deċennju ta' dominanza ħoloq is-suppożizzjoni li l-AI teħtieġ GPU. Għal xogħol b'punt mobbli, dan jibqa' minnu.

Imma l-AI qed tevolvi. Netwerks binarij. Kwantizzazzjoni integer. Arkitetturi effiċjenti. Dawn jiffavorixxu l-CPU. Il-pedamenti matematiċi nbidlu, u magħhom, il-hardware ottimali.

In-narrattiva li "għandek bżonn GPU" hija skaduta għal ħafna każijiet ta' użu. Inferenza fil-periferija? Netwerks binarij? Deploy sensittiv għall-ispiża? Konformità mal-GDPR? Il-CPU huma kompetittivi. Spiss superjuri.

Il-pajsaġġ tal-hardware qed jinbidel. Ċipep speċjalizzati qed joħorġu. Estensjonijiet tal-AI għall-CPU qed jaslu. Il-monopolju tal-GPU qed jintemm. Il-kumpaniji Ewropej għandhom vantaġġi partikolari f'din il-bidla: regolamenti stretti tal-protezzjoni tad-dejta jiffavorixxu l-ipproċessar lokali tal-CPU, l-ispejjeż għoljin tal-enerġija jippremjaw l-effiċjenza, u t-tħassib dwar is-sovranità tal-hardware jibbenefika minn sorsi diversi tal-CPU.

Li tifhem x'jagħmel tajjeb kull proċessur jgħinek tagħżel b'mod korrett. Mhux abbażi tal-hype. Abbażi tar-rekwiżiti attwali tiegħek. Prestazzjoni, enerġija, spiża, vinċoli tad-deploy, konformità regolatorja.

Il-GPU għadhom jiddominaw it-taħriġ ta' mudelli kbar b'punt mobbli. Imma l-inferenza? Id-deploy? L-edge computing? Il-bilanċ qed jinbidel. U l-operazzjonijiet binarij fuq il-CPU qed imexxu dik il-bidla. Id-deċennju li jmiss tal-AI mhux se jixbah lil dak li għadda. Il-hardware li deher essenzjali jista' jkun fakultattiv. Il-hardware li deher insuffiċjenti jista' jkun ideali.

L-għażla tiegħek mhix GPU jew CPU. Hija li tifhem liema xogħol jaqbel ma' liema hardware. U dejjem aktar, dak il-fehim qed jipponta lejn il-CPU għal aktar każijiet ta' użu milli tissuġġerixxi l-għerf konvenzjonali.

Tixtieq tara l-AI ottimizzata għall-CPU waqt li taħdem? Esplora Dweve Loom. Raġunament b'vinkoli binarji fuq CPUs standard. 40× aktar mgħaġġel minn mudelli transformer fuq GPUs. Tnaqqis ta' 96% fil-konsum tal-enerġija. Konformi mal-GDPR mid-disinn. It-tip ta' AI li taħdem mal-hardware li diġà għandek. Mibnija fl-Ewropa għall-ħtiġijiet Ewropej.