Hardverska agnostičnost: Zašto je kladiti se isključivo na NVIDIA-u strateški rizik

Svijet je ovisan o CUDA-i. No lanac opskrbe s jednim dobavljačem jedna je točka kvara. Evo zašto Dweve radi na svemu: AMD, Intel, RISC-V i FPGA.

Hardverska agnostičnost: Zašto je kladiti se isključivo na NVIDIA-u strateški rizik

Zamka monokulture

Zamislite da 95% svjetskih automobila može voziti isključivo na određenu vrstu benzina koju prodaje točno jedna tvrtka. Zamislite da se rafinerija te tvrtke nalazi na geološki nestabilnom otoku. Zamislite da svaki drugi proizvođač automobila mora dizajnirati svoje motore tako da odgovaraju toj specifičnoj mješavini goriva.

Kad bi ta tvrtka imala proizvodni kvar, ili podigla cijene za 400%, ili ako bi blokada odsjekla otok, globalno gospodarstvo bi stalo. Prijevoz bi prestao.

To zvuči kao distopijska fantastika, ali to je točna stvarnost industrije umjetne inteligencije danas.

U 2025. godini, otprilike 95% AI treninga i vrhunskog zaključivanja odvija se na GPU-ovima koje proizvodi jedna tvrtka: NVIDIA. Cijeli globalni AI stog (od PyTorch okvira do dizajna hlađenja podatkovnih centara) optimiziran je za NVIDIA-inu arhitekturu. Industrija je ovisna o CUDA-i, NVIDIA-inoj vlasničkoj softverskoj platformi.

NVIDIA je briljantna tvrtka. Izgradili su nevjerojatnu tehnologiju. Ali ova monokultura je strateška noćna mora. Ona stvara jednu točku kvara (SPOF) za cijelu budućnost ljudske inteligencije.

Tržište AI hardvera: monokultura naspram raznolikostiTrenutna industrija (NVIDIA ovisnost)95%NVIDIA CUDAJedna točka kvaraOpskrbni lanac, cijene, izvozne kontroleDweve pristup (agnostički)AMDIntelRISC-VFPGACPUStrateška otpornostIzbor dobavljača, pregovori o cijeni, suverenitetBinarne neuronske mreže ne trebaju Tensor Cores: rade na osnovnoj digitalnoj logici
Rizici u "The Monoculture Trap" postaju upravljivi kada dobiju imena i vlasnike.

Strukturalna nestašica

Svi smo prošli kroz nestašice H100 čipova 2023. i 2024. godine. Startupi su čekali 12 mjeseci na hardver. Vlade su gomilale čipove poput zlatnih poluga. Cijena računalne snage je naglo porasla.

To nije bio samo privremeni poremećaj u opskrbnom lancu. Bio je to strukturalni uski grlo. Proizvodnja tih čipova oslanja se na nevjerojatno složen proces naprednog pakiranja koji se zove CoWoS (Chip-on-Wafer-on-Substrate), a koji primarno provodi TSMC na Tajvanu. Kapacitet za izradu tih paketa je ograničen. Zakoni fizike su ograničeni.

Ako se vaša AI strategija oslanja na pristup najnovijem, najboljem NVIDIA čipu, kladite se na opstanak svoje tvrtke u opskrbnom lancu kojim ne upravljate, za proizvod koji se prodaje onome tko ponudi najviše.

Kompromis u "The Structural Shortage" je mjesto gdje vrijednost curi ili se kontrola vraća.

CUDA jarak

Prava zarobljenost nije u hardveru, nego u softveru. CUDA je jezik umjetne inteligencije. Već 15 godina istraživači i studenti uče pisati CUDA jezgre. Biblioteke su optimizirane za CUDA. Ako pokušate pokrenuti standardni AI kod na AMD kartici ili Intel akceleratoru, često ulazite u svijet muke: pokvarene ovisnosti, nedostajuće jezgre i loše performanse.

Ovaj „CUDA jarak" drži konkurenciju podalje. Osigurava da, čak i ako AMD izradi čip koji je brži i jeftiniji (a jest), nitko ga ne kupuje jer softver jednostavno ne „radi".

Dweve filozofija: radi svugdje

U Dweveu smo rano donijeli radikalnu odluku. Pogledali smo CUDA zamku i rekli: „Ne."

Odlučili smo da nećemo napisati nijedan redak CUDA koda. Nećemo preuzeti ovisnost o vlasničkom hardverskom stogu.

Umjesto toga, izgradili smo naš stog na otvorenim standardima. Koristimo Vulkan (grafički API koji radi na svemu, od Android telefona do Linux poslužitelja). Koristimo OpenCL. Koristimo SPIR-V. Oslanjamo se na međuprikaze (IR) poput MLIR-a (Multi-Level Intermediate Representation).

Ali prava tajna nije samo API; to je matematika.

Zašto binarne neuronske mreže razbijaju CUDA ovisnostTradicionalno duboko učenjeFP16/FP32 množenje matricaZahtijeva: Tensor jezgreSamo ih NVIDIA dobro radiBinarne neuronske mreže1-bitne XNOR + POPCNT operacijeZahtijeva: osnovnu digitalnu logikuDostupno na SVIJ hardveruDweve hardverski ciljeviAMD ROCmIzravna ISA kompilacijaNajbolji $/performanseIntel AVX-512512 neurona/ciklusGPU nije potrebanRISC-VSilikon otvorenog kodaEuropska suverenostFPGAμs latencijaKrajnja učinkovitost

Budući da se naše binarne neuronske mreže (BNN) oslanjaju na jednostavne cjelobrojne operacije (XNOR i POPCNT) umjesto na složena množenja matrica s pomičnim zarezom, nismo vezani uz specifične "Tensor jezgre" koje samo NVIDIA dobro radi.

Tensor jezgre specijalizirani su hardverski moduli dizajnirani za ubrzavanje 16-bitne matematike s pomičnim zarezom. Ako se vaš algoritam oslanja na FP16, trebate Tensor jezgru. Ako se vaš algoritam oslanja na 1-bitnu logiku, ne trebate je. Trebate samo osnovne digitalne logičke sklopove.

Ta arhitektonska sloboda omogućuje nam učinkovit rad na zadivljujućoj raznolikosti hardvera:

1. AMD ROCm

AMD-ovi Instinct GPU-ovi nude ogromnu sirovu računalnu snagu i memorijsku propusnost po dolaru. Za radna opterećenja s pomičnim zarezom, softverski stog (ROCm) povijesno je bio slaba točka. No za naša binarna radna opterećenja, kompiliramo izravno u ISA (arhitekturu skupa instrukcija). Zaobilazimo nepouzdane biblioteke. Na AMD hardveru, Dweve modeli rade munjevito.

2. Intel CPU-ovi (AVX-512)

Svi zanemaruju skromni CPU. No moderni Intel Xeon procesori imaju skup instrukcija nazvan AVX-512. On omogućuje CPU-u obradu 512 bita podataka u jednom ciklusu. Za binarnu neuronsku mrežu, to znači 512 neurona obrađenih trenutačno. Možemo pokretati inferenciju visokih performansi na standardnim poslužiteljima koje tvrtke već posjeduju. GPU nije potreban.

3. RISC-V

RISC-V je open-source hardverska arhitektura budućnosti. Ono što je Linux bio operativnim sustavima, RISC-V je čipovima. Radimo nativno na RISC-V akceleratorima. To je ključno za Europu i zemlje u razvoju koje žele izgraditi vlastitu domaću industriju čipova neovisnu o američkim izvoznim kontrolama.

4. FPGA-ovi (programibilna poljska vrata)

Ovo je najuzbudljivija granica. FPGA je čip "praznog platna" koji se može ponovno ožičiti u milisekundama. Budući da naše mreže koriste jednostavna logička vrata, možemo fizički ožičiti čip tako da odgovara strukturi neuronske mreže. Podaci teku kroz čip poput vode kroz cijevi, bez ikakvog dodatnog opterećenja. To pruža iznimno nisku latenciju (mikrosekunde) i izuzetnu energetsku učinkovitost.

"The Dweve Philosophy: Run Everywhere" postaje konkretna kada su kontrolni slojevi vidljivi.

Strateška otpornost i suverenitet

Za naše kupce (posebno vlade, obrambene agencije i pružatelje kritične infrastrukture) ova hardverska agnostičnost je ključna značajka.

To znači da nisu zaključani sankcijama. Ako geopolitička kriza prekine pristup američkim čipovima, mogu pokretati svoje Dweve modele na europskim čipovima ili široko dostupnom naslijeđenom siliciju. Imaju "Plan B."

To znači da imaju pregovaračku moć. Nisu ovisni o hirovima cijena jednog dobavljača. Ako NVIDIA podigne cijene, mogu prijeći na AMD ili specijalizirane ASIC-ove bez ponovnog pisanja softvera.

To također znači dugovječnost. NVIDIA H100 bit će zastario za 3 godine. U industrijskim okruženjima (vlakovi, tvornice, elektrane) oprema mora trajati 20 godina. Generički FPGA ili standardni CPU bit će upotrebljivi desetljećima. Gradimo softver koji poštuje životni ciklus fizičkog svijeta.

"Strateška otpornost i suverenitet" je petlja: promatraj, odluči, djeluj i ponovno testiraj.

Era nakon GPU-a

Vjerujemo da je dominacija univerzalnog GPU-a (GPGPU) za umjetnu inteligenciju povijesna anomalija. Bio je pravi alat za fazu izrade prototipa umjetne inteligencije jer je bio fleksibilan i dostupan. No kako umjetna inteligencija ulazi u fazu implementacije, svjedočit ćemo kambrijskoj eksploziji specijaliziranog hardvera.

Vidjet ćemo analogno računalstvo. Optičko računalstvo. Neuromorfno računalstvo. Računalstvo u memoriji. Sve su te arhitekture u osnovi nekompatibilne s CUDA-om. Zahtijevaju novi softverski stog.

Odvajanjem našeg softvera od hardverskog monopola danas, Dweve je pripremljen za budućnost sutra. Ne gradimo samo za čipove 2025.; gradimo za fiziku 2035.

Želite umjetnu inteligenciju koja radi pod vašim uvjetima, a ne NVIDIA-inim? Dweveova hardverski agnostična arhitektura daje vam stratešku slobodu, kontrolu troškova i suverenu otpornost. Kontaktirajte nas kako biste otkrili kako naše binarne neuronske mreže mogu raditi na hardveru koji već posjedujete ili na otvorenom siliciju budućnosti.