Zakaj staviti vse na NVIDIA je strateško tveganje
Past pasti monokulture
Predstavljajte si, da bi 95 % svetovnih avtomobilov lahko delovalo le na določeno vrsto bencina, ki ga prodaja natanko eno podjetje. Predstavljajte si, da bi se rafinerija tega podjetja nahajala na geološko nestabilnem otoku. Predstavljajte si, da bi morali vsi drugi proizvajalci avtomobilov svoje motorje oblikovati tako, da bi ustrezali tej posebni mešanici goriva.
Če bi imelo to podjetje težave v proizvodnji, bi cene dvignilo za 400 % ali če bi blokada odrezala otok od sveta, bi se svetovno gospodarstvo ustavilo. Prevoz bi prenehal.
To zveni kot distopična znanstvena fantastika, a to je natanko resničnost industrije umetne inteligence danes.
Leta 2025 približno 95 % usposabljanja umetne inteligence in vrhunskega sklepanja poteka na grafičnih procesorjih, ki jih proizvaja eno podjetje: NVIDIA. Celoten svetovni sklad umetne inteligence (od ogrodij PyTorch do načrtov hlajenja podatkovnih centrov) je optimiziran za arhitekturo podjetja NVIDIA. Industrija je zasvojena s sistemom CUDA, lastniško programsko platformo podjetja NVIDIA.
NVIDIA je sijajno podjetje. Zgradili so neverjetno tehnologijo. Toda ta monokultura je strateška mora. Ustvarja eno samo točko odpovedi (SPOF) za celotno prihodnost človeške inteligence.
Strukturno pomanjkanje
Vsi smo doživeli pomanjkanje H100 v letih 2023 in 2024. Zagonska podjetja so na strojno opremo čakala 12 mesecev. Vlade so kopičile čipe kot zlate palice. Cena računske moči je strmoglavo narasla.
To ni bila le začasna motnja v dobavni verigi. Šlo je za strukturno ozko grlo. Proizvodnja teh čipov je odvisna od izjemno zapletenega postopka, imenovanega CoWoS (Chip-on-Wafer-on-Substrate) napredno pakiranje, ki ga večinoma izvaja TSMC na Tajvanu. Zmogljivost za izdelavo teh paketov je omejena. Zakoni fizike so omejeni.
Če vaša strategija umetne inteligence temelji na dostopu do najnovejšega, najboljšega NVIDIA čipa, stavite preživetje svojega podjetja na dobavno verigo, ki je ne obvladujete, za izdelek, ki se proda najvišjemu ponudniku.
Jarek CUDA
Prava zaklenjenost ni v strojni opremi, temveč v programski opremi. CUDA je jezik umetne inteligence. 15 let so se raziskovalci in študenti učili pisati jedra CUDA. Knjižnice so optimizirane za CUDA. Če poskušate zagnati standardno kodo umetne inteligence na kartici AMD ali pospeševalniku Intel, pogosto vstopite v svet težav: pokvarjene odvisnosti, manjkajoča jedra in slaba zmogljivost.
Ta »CUDA jarek« drži tekmece zunaj. Zagotavlja, da tudi če AMD zgradi čip, ki je hitrejši in cenejši (kar so tudi storili), ga nihče ne kupi, ker programska oprema preprosto »ne deluje«.
Filozofija Dweve: Deluj povsod
Pri Dweve smo se že zgodaj odločili radikalno. Pogledali smo past CUDA in rekli: »Ne.«
Odločili smo se, da ne bomo napisali niti ene vrstice CUDA. Ne bomo postali odvisni od lastniškega strojnega sklada.
Namesto tega smo svoj sklad zgradili na odprtih standardih. Uporabljamo Vulkan (grafični API, ki deluje na vsem, od telefonov Android do strežnikov Linux). Uporabljamo OpenCL. Uporabljamo SPIR-V. Zanašamo se na vmesne predstavitve (IR), kot je MLIR (večnivojska vmesna predstavitev).
Toda prava skrivna sestavina ni samo API; je matematika.
Ker naše binarne nevronske mreže (BNN) temeljijo na preprostih celoštevilskih operacijah (XNOR in POPCNT) namesto na zapletenem množenju matrik s plavajočo vejico, nismo vezani na posebna »tenzorska jedra«, ki jih dobro obvlada le NVIDIA.
Tenzorska jedra so specializirane strojne enote, zasnovane za učinkovito izvajanje matematike s 16-bitno plavajočo vejico. Če vaš algoritem temelji na FP16, potrebujete tenzorsko jedro. Če vaš algoritem temelji na 1-bitni logiki, ga ne potrebujete. Potrebujete le osnovna digitalna logična vrata.
Ta arhitekturna svoboda nam omogoča učinkovito delovanje na osupljivo raznoliki strojni opremi:
1. AMD ROCm
AMD-jevi Instinct GPE-ji ponujajo ogromno surove računske moči in pomnilniške pasovne širine na dolar. Pri delu s plavajočo vejico je bil programski sklad (ROCm) zgodovinsko šibka točka. Toda pri naših binarnih obremenitvah prevajamo neposredno v ISA (arhitekturo nabora ukazov). Zaobidemo nezanesljive knjižnice. Na AMD-jevi strojni opremi modeli Dweve letijo.
2. Procesorji Intel (AVX-512)
Vsi spregledajo skromni procesor. Toda sodobni procesorji Intel Xeon imajo nabor ukazov, imenovan AVX-512. Procesorju omogoča obdelavo 512 bitov podatkov v enem ciklu. Za binarno nevronsko mrežo to pomeni 512 nevronov, obdelanih v trenutku. Visoko zmogljivo sklepanje lahko izvajamo na običajnih strežnikih, ki jih podjetja že imajo. GPE ni potreben.
3. RISC-V
RISC-V je arhitektura strojne opreme prihodnosti z odprto kodo. Kar je Linux pomenil za operacijske sisteme, RISC-V pomeni za čipe. Delujemo izvorno na pospeševalnikih RISC-V. To je ključnega pomena za Evropo in države v razvoju, ki želijo zgraditi lastno domačo čipno industrijo, neodvisno od ameriških izvoznih omejitev.
4. FPGA (programirljiva logična polja)
To je najbolj vznemirljiva meja. FPGA je čip, ki je »prazen list« in ga je mogoče v milisekundah na novo povezati. Ker naše mreže uporabljajo preprosta logična vrata, lahko čip fizično povežemo tako, da ustreza strukturi nevronske mreže. Podatki tečejo skozi čip kot voda po ceveh, brez vsakršnega dodatnega bremena. To zagotavlja izjemno nizko zakasnitev (mikrosekunde) in izjemno energetsko učinkovitost.
Strateška odpornost in suverenost
Za naše stranke (zlasti vlade, obrambne agencije in ponudnike kritične infrastrukture) je ta neodvisnost od strojne opreme izjemno pomembna funkcija.
Pomeni, da niso ujeti v sankcije. Če geopolitična kriza prekine dostop do ameriških čipov, lahko svoje modele Dweve poganjajo na evropskih čipih ali široko dostopnem starejšem siliciju. Imajo »načrt B«.
Pomeni, da imajo pogajalsko moč. Niso odvisni od muhavosti cen enega samega prodajalca. Če NVIDIA zviša cene, lahko preklopijo na AMD ali specializirane ASIC-e, ne da bi morali znova pisati svojo programsko opremo.
Pomeni tudi dolgo življenjsko dobo. NVIDIA H100 bo čez 3 leta zastarel. V industrijskih okoljih (vlaki, tovarne, elektrarne) mora oprema zdržati 20 let. Generični FPGA ali običajni procesor bo uporaben desetletja. Gradimo programsko opremo, ki spoštuje življenjski cikel fizičnega sveta.
Obdobje po GPE
Verjamemo, da je prevlada splošnonamenskih grafičnih procesorjev (GPGPU) za umetno inteligenco zgodovinska anomalija. Bili so pravo orodje za fazo prototipiranja umetne inteligence, ker so bili prilagodljivi in dostopni. Toda ko umetna inteligenca vstopa v fazo uvajanja, bomo priča kambrijski eksploziji specializirane strojne opreme.
Priča bomo analognemu računalništvu. Optičnemu računalništvu. Nevromorfnemu računalništvu. Računalništvu v pomnilniku. Te arhitekture so vse v osnovi nezdružljive s sistemom CUDA. Zahtevajo nov programski sklad.
Z ločitvijo naše programske opreme od strojnega monopola že danes je Dweve pripravljen na prihodnost. Ne gradimo le za čipe leta 2025; gradimo za fiziko leta 2035.
Želite umetno inteligenco, ki deluje pod vašimi pogoji, ne pod pogoji podjetja NVIDIA? Arhitektura Dweve, neodvisna od strojne opreme, vam daje strateško svobodo, nadzor nad stroški in suvereno odpornost. Kontaktirajte nas in odkrijte, kako lahko naše binarne nevronske mreže delujejo na strojni opremi, ki jo že imate, ali na odprtem siliciju prihodnosti.