Aparatūras neatkarība: kāpēc likt visu uz NVIDIA ir stratēģisks risks

Pasaule ir atkarīga no CUDA. Taču viena piegādātāja ķēde ir viena vājā vieta. Lūk, kāpēc Dweve darbojas visur: AMD, Intel, RISC-V un FPGA.

Aparatūras neatkarība: kāpēc likt visu uz NVIDIA ir stratēģisks risks

Monokultūras slazds

Iedomājieties, ka 95% pasaules automašīnu varētu darboties tikai ar vienu konkrētu benzīna veidu, ko pārdod tieši viens uzņēmums. Iedomājieties, ka šī uzņēmuma rūpnīca atrodas uz ģeoloģiski nestabilas salas. Iedomājieties, ka katram citam autoražotājam nāktos konstruēt savus dzinējus tā, lai tie atbilstu šim konkrētajam degvielas maisījumam.

Ja šim uzņēmumam rastos ražošanas traucējumi, vai tas paaugstinātu cenas par 400%, vai ja blokāde nogrieztu salu, globālā ekonomika apstātos. Transports pārstātu darboties.

Tas izklausās pēc distopiskas fantastikas, taču tieši tāda šodien ir mākslīgā intelekta nozares realitāte.

2025. gadā aptuveni 95% AI apmācības un augstas veiktspējas secinājumu veikšanas notiek uz GPU, ko ražo viens uzņēmums: NVIDIA. Viss globālais AI tehnoloģiju slānis (sākot no PyTorch ietvariem līdz datu centru dzesēšanas risinājumiem) ir optimizēts NVIDIA arhitektūrai. Nozare ir atkarīga no CUDA, NVIDIA patentētās programmatūras platformas.

NVIDIA ir izcils uzņēmums. Viņi radīja neticamas tehnoloģijas. Taču šī monokultūra ir stratēģisks murgs. Tā rada vienu atteices punktu (SPOF) visai cilvēka intelekta nākotnei.

AI aparatūras tirgus: monokultūra pret daudzveidībuPašreizējā nozare (NVIDIA piesaiste)95%NVIDIA CUDAViens atteices punktsPiegādes ķēde, cenas, eksporta kontroleDweve pieeja (neitrāla)AMDIntelRISC-VFPGACPUStratēģiskā noturībaPiegādātāja izvēle, cenu sarunas, suverenitāteBinārie neironu tīkli neprasa Tensor Core: tie darbojas uz pamata digitālās loģikas
Riski sadaļā "The Monoculture Trap" kļūst pārvaldāmi, tiklīdz tiem ir nosaukumi un īpašnieki.

Strukturālais trūkums

Mēs visi esam piedzīvojuši H100 trūkumu 2023. un 2024. gadā. Jaunuzņēmumi gaidīja aparatūru 12 mēnešus. Valdības krāja mikroshēmas kā zelta stieņus. Skaitļošanas jaudas cenas strauji pieauga.

Tas nebija tikai īslaicīgs piegādes ķēdes traucējums. Tas bija strukturāls sastrēgums. Šo mikroshēmu ražošana balstās uz ārkārtīgi sarežģītu procesu, ko sauc par CoWoS (Chip-on-Wafer-on-Substrate) progresīvo iepakošanu, ko galvenokārt veic TSMC Taivānā. Šo iepakojumu ražošanas jauda ir ierobežota. Fizikas likumi ir ierobežoti.

Ja jūsu MI stratēģija ir atkarīga no piekļuves jaunākajai un labākajai NVIDIA mikroshēmai, jūs liekat likmes uz sava uzņēmuma izdzīvošanu uz piegādes ķēdi, kuru jūs nekontrolējat, produktam, kas tiek izsolīts augstākajam solītājam.

Kompromiss sadaļā "The Structural Shortage" ir vieta, kur vērtība aizplūst vai atgriežas kontrole.

CUDA aizsarggrāvis

Patiesā piesaiste nav aparatūra; tā ir programmatūra. CUDA ir MI valoda. 15 gadus pētnieki un studenti ir mācījušies rakstīt CUDA kodolus. Bibliotēkas ir optimizētas CUDA. Ja mēģināt palaist standarta MI kodu uz AMD kartes vai Intel paātrinātāja, bieži vien nonākat sāpju pasaulē: salauztas atkarības, trūkstoši kodoli un slikta veiktspēja.

Šī "CUDA grāvis" neļauj konkurentiem iekļūt tirgū. Tā nodrošina, ka pat tad, ja AMD izveido ātrāku un lētāku mikroshēmu (un tā arī ir noticis), neviens to nepērk, jo programmatūra vienkārši "nestrādā".

Dweve filozofija: darboties visur

Mēs Dweve jau pašā sākumā pieņēmām radikālu lēmumu. Mēs paskatījāmies uz CUDA slazdu un teicām: "Nē."

Mēs nolēmām, ka nerakstīsim nevienu CUDA koda rindiņu. Mēs nepaļausimies uz patentētu aparatūras kopu.

Tā vietā mēs izveidojām savu kopu uz atvērtiem standartiem. Mēs izmantojam Vulkan (grafikas API, kas darbojas visur, sākot no Android tālruņiem līdz Linux serveriem). Mēs izmantojam OpenCL. Mēs izmantojam SPIR-V. Mēs paļaujamies uz starpposma attēlojumiem (IR), piemēram, MLIR (daudzlīmeņu starpposma attēlojums).

Bet īstā slepenā sastāvdaļa nav tikai API; tā ir matemātika.

Kāpēc binārie neironu tīkli lauž CUDA piesaistiTradicionālā dziļā mācīšanāsFP16/FP32 matricas reizināšanaPrasības: Tensor CoreTikai NVIDIA tos labi protBinārie neironu tīkli1 bitu XNOR + POPCNT darbībasPrasības: pamata digitālā loģikaPieejams VISĀ aparatūrāDweve aparatūras mērķiAMD ROCmTieša ISA kompilācijaLabākā cenas/veiktspējas attiecībaIntel AVX-512512 neironi/ciklāGPU nav nepieciešamaRISC-VAtvērtā koda silīcijsEiropas suverenitāteFPGAμs latentumsMaksimāla efektivitāte

Tā kā mūsu binārie neironu tīkli (BNN) balstās uz vienkāršām veselu skaitļu darbībām (XNOR un POPCNT), nevis sarežģītām peldošā komata matricas reizināšanām, mēs neesam piesaistīti konkrētajiem "Tensor Core" blokiem, kurus tikai NVIDIA labi prot.

Tensor Core ir specializētas aparatūras vienības, kas paredzētas 16 bitu peldošā komata aprēķinu paātrināšanai. Ja jūsu algoritms balstās uz FP16, jums ir nepieciešams Tensor Core. Ja jūsu algoritms balstās uz 1 bitu loģiku, tas nav vajadzīgs. Jums pietiek ar pamata digitālās loģikas vārtiem.

Šī arhitektūras brīvība ļauj mums efektīvi darboties uz pārsteidzoši daudzveidīgas aparatūras:

1. AMD ROCm

AMD Instinct GPU piedāvā milzīgu neapstrādātu skaitļošanas jaudu un atmiņas joslas platumu par katru dolāru. Peldošā komata darba slodzēm programmatūras steks (ROCm) vēsturiski ir bijis vājais punkts. Taču mūsu binārajām darba slodzēm mēs kompilējam tieši uz ISA (instrukciju kopas arhitektūru). Mēs apejam neuzticamās bibliotēkas. Uz AMD aparatūras Dweve modeļi strādā ļoti ātri.

2. Intel CPU (AVX-512)

Visi ignorē pieticīgo CPU. Taču mūsdienu Intel Xeon procesoriem ir instrukciju kopa ar nosaukumu AVX-512. Tā ļauj procesoram apstrādāt 512 bitus datu vienā ciklā. Binārajam neironu tīklam tas nozīmē 512 neironu, kas tiek apstrādāti uzreiz. Mēs varam nodrošināt augstas veiktspējas secinājumu izpildi uz standarta serveriem, kas uzņēmumiem jau pieder. Nav nepieciešams GPU.

3. RISC-V

RISC-V ir nākotnes atvērtā koda aparatūras arhitektūra. Tā ir mikroshēmām tas, kas Linux bija operētājsistēmām. Mēs strādājam natively uz RISC-V paātrinātājiem. Tas ir ļoti svarīgi Eiropai un jaunattīstības valstīm, kuras vēlas veidot savu vietējo mikroshēmu nozari neatkarīgi no ASV eksporta kontroles.

4. FPGA (lauka programmējamās vārtu matricas)

Šī ir aizraujošākā robeža. FPGA ir "tukša audekla" mikroshēma, kuru var pārprogrammēt milisekundēs. Tā kā mūsu tīkli izmanto vienkāršus loģiskos vārtus, mēs varam fiziski savienot mikroshēmu, lai tā atbilstu neironu tīkla struktūrai. Dati plūst caur mikroshēmu kā ūdens pa caurulēm, bez jebkādas papildu slodzes. Tas nodrošina ārkārtīgi zemu latentumu (mikrosekundēs) un izcilu energoefektivitāti.

"The Dweve Philosophy: Run Everywhere" kļūst konkrēta, kad ir redzami vadības slāņi.

Stratēģiskā noturība un suverenitāte

Mūsu klientiem (īpaši valdībām, aizsardzības aģentūrām un kritiskās infrastruktūras nodrošinātājiem) šī aparatūras neatkarība ir ļoti svarīga funkcija.

Tas nozīmē, ka viņi nav atkarīgi no sankcijām. Ja ģeopolitiskā krīze pārtrauc piekļuvi ASV mikroshēmām, viņi var palaist savus Dweve modeļus uz Eiropas mikroshēmām vai plaši pieejamām vecākām mikroshēmām. Viņiem ir "B plāns".

Tas nozīmē, ka viņiem ir sarunu spēks. Viņi nav pakļauti viena pārdevēja cenu kaprīzēm. Ja NVIDIA paaugstina cenas, viņi var pāriet uz AMD vai specializētām ASIC bez programmatūras pārrakstīšanas.

Tas nozīmē arī ilgmūžību. NVIDIA H100 būs novecojusi pēc 3 gadiem. Rūpnieciskajā vidē (vilcienos, rūpnīcās, spēkstacijās) iekārtām jākalpo 20 gadus. Vispārējas nozīmes FPGA vai standarta CPU būs izmantojamas gadu desmitiem. Mēs veidojam programmatūru, kas respektē fiziskās pasaules dzīves ciklu.

"Strategic Resilience and Sovereignty" ir cilpa: novēro, izvēlies, rīkojies un pārbaudi vēlreiz.

Laikmets pēc GPU

Mēs uzskatām, ka vispārējas nozīmes GPU (GPGPU) dominance mākslīgā intelekta jomā ir vēsturiska anomālija. Tas bija piemērots rīks mākslīgā intelekta prototipēšanas fāzei, jo tas bija elastīgs un pieejams. Taču, mākslīgajam intelektam ieejot ieviešanas fāzē, mēs redzēsim specializētas aparatūras kembrija sprādzienu.

Mēs redzēsim analogo skaitļošanu. Optisko skaitļošanu. Neiromorfo skaitļošanu. Skaitļošanu atmiņā. Šīs arhitektūras visas ir fundamentāli nesaderīgas ar CUDA. Tām ir nepieciešama jauna programmatūras steks.

Atdalot mūsu programmatūru no aparatūras monopola jau šodien, Dweve ir nākotnes drošs rītdienai. Mēs neveidojam risinājumus tikai 2025. gada mikroshēmām; mēs veidojam risinājumus 2035. gada fizikai.

Vēlaties mākslīgo intelektu, kas darbojas pēc jūsu noteikumiem, nevis NVIDIA noteikumiem? Dweve aparatūras neatkarīgā arhitektūra sniedz jums stratēģisku brīvību, izmaksu kontroli un suverēnu noturību. Sazinieties ar mums, lai uzzinātu, kā mūsu binārie neironu tīkli var darboties uz aparatūras, kas jums jau pieder, vai uz rītdienas atvērtā silīcija.