Aparatūras neatkarība: kāpēc likt visu uz NVIDIA ir stratēģisks risks
Monokultūras slazds
Iedomājieties, ka 95% pasaules automašīnu varētu darboties tikai ar vienu konkrētu benzīna veidu, ko pārdod tieši viens uzņēmums. Iedomājieties, ka šī uzņēmuma rūpnīca atrodas uz ģeoloģiski nestabilas salas. Iedomājieties, ka katram citam autoražotājam nāktos konstruēt savus dzinējus tā, lai tie atbilstu šim konkrētajam degvielas maisījumam.
Ja šim uzņēmumam rastos ražošanas traucējumi, vai tas paaugstinātu cenas par 400%, vai ja blokāde nogrieztu salu, globālā ekonomika apstātos. Transports pārstātu darboties.
Tas izklausās pēc distopiskas fantastikas, taču tieši tāda šodien ir mākslīgā intelekta nozares realitāte.
2025. gadā aptuveni 95% AI apmācības un augstas veiktspējas secinājumu veikšanas notiek uz GPU, ko ražo viens uzņēmums: NVIDIA. Viss globālais AI tehnoloģiju slānis (sākot no PyTorch ietvariem līdz datu centru dzesēšanas risinājumiem) ir optimizēts NVIDIA arhitektūrai. Nozare ir atkarīga no CUDA, NVIDIA patentētās programmatūras platformas.
NVIDIA ir izcils uzņēmums. Viņi radīja neticamas tehnoloģijas. Taču šī monokultūra ir stratēģisks murgs. Tā rada vienu atteices punktu (SPOF) visai cilvēka intelekta nākotnei.
Strukturālais trūkums
Mēs visi esam piedzīvojuši H100 trūkumu 2023. un 2024. gadā. Jaunuzņēmumi gaidīja aparatūru 12 mēnešus. Valdības krāja mikroshēmas kā zelta stieņus. Skaitļošanas jaudas cenas strauji pieauga.
Tas nebija tikai īslaicīgs piegādes ķēdes traucējums. Tas bija strukturāls sastrēgums. Šo mikroshēmu ražošana balstās uz ārkārtīgi sarežģītu procesu, ko sauc par CoWoS (Chip-on-Wafer-on-Substrate) progresīvo iepakošanu, ko galvenokārt veic TSMC Taivānā. Šo iepakojumu ražošanas jauda ir ierobežota. Fizikas likumi ir ierobežoti.
Ja jūsu MI stratēģija ir atkarīga no piekļuves jaunākajai un labākajai NVIDIA mikroshēmai, jūs liekat likmes uz sava uzņēmuma izdzīvošanu uz piegādes ķēdi, kuru jūs nekontrolējat, produktam, kas tiek izsolīts augstākajam solītājam.
CUDA aizsarggrāvis
Patiesā piesaiste nav aparatūra; tā ir programmatūra. CUDA ir MI valoda. 15 gadus pētnieki un studenti ir mācījušies rakstīt CUDA kodolus. Bibliotēkas ir optimizētas CUDA. Ja mēģināt palaist standarta MI kodu uz AMD kartes vai Intel paātrinātāja, bieži vien nonākat sāpju pasaulē: salauztas atkarības, trūkstoši kodoli un slikta veiktspēja.
Šī "CUDA grāvis" neļauj konkurentiem iekļūt tirgū. Tā nodrošina, ka pat tad, ja AMD izveido ātrāku un lētāku mikroshēmu (un tā arī ir noticis), neviens to nepērk, jo programmatūra vienkārši "nestrādā".
Dweve filozofija: darboties visur
Mēs Dweve jau pašā sākumā pieņēmām radikālu lēmumu. Mēs paskatījāmies uz CUDA slazdu un teicām: "Nē."
Mēs nolēmām, ka nerakstīsim nevienu CUDA koda rindiņu. Mēs nepaļausimies uz patentētu aparatūras kopu.
Tā vietā mēs izveidojām savu kopu uz atvērtiem standartiem. Mēs izmantojam Vulkan (grafikas API, kas darbojas visur, sākot no Android tālruņiem līdz Linux serveriem). Mēs izmantojam OpenCL. Mēs izmantojam SPIR-V. Mēs paļaujamies uz starpposma attēlojumiem (IR), piemēram, MLIR (daudzlīmeņu starpposma attēlojums).
Bet īstā slepenā sastāvdaļa nav tikai API; tā ir matemātika.
Tā kā mūsu binārie neironu tīkli (BNN) balstās uz vienkāršām veselu skaitļu darbībām (XNOR un POPCNT), nevis sarežģītām peldošā komata matricas reizināšanām, mēs neesam piesaistīti konkrētajiem "Tensor Core" blokiem, kurus tikai NVIDIA labi prot.
Tensor Core ir specializētas aparatūras vienības, kas paredzētas 16 bitu peldošā komata aprēķinu paātrināšanai. Ja jūsu algoritms balstās uz FP16, jums ir nepieciešams Tensor Core. Ja jūsu algoritms balstās uz 1 bitu loģiku, tas nav vajadzīgs. Jums pietiek ar pamata digitālās loģikas vārtiem.
Šī arhitektūras brīvība ļauj mums efektīvi darboties uz pārsteidzoši daudzveidīgas aparatūras:
1. AMD ROCm
AMD Instinct GPU piedāvā milzīgu neapstrādātu skaitļošanas jaudu un atmiņas joslas platumu par katru dolāru. Peldošā komata darba slodzēm programmatūras steks (ROCm) vēsturiski ir bijis vājais punkts. Taču mūsu binārajām darba slodzēm mēs kompilējam tieši uz ISA (instrukciju kopas arhitektūru). Mēs apejam neuzticamās bibliotēkas. Uz AMD aparatūras Dweve modeļi strādā ļoti ātri.
2. Intel CPU (AVX-512)
Visi ignorē pieticīgo CPU. Taču mūsdienu Intel Xeon procesoriem ir instrukciju kopa ar nosaukumu AVX-512. Tā ļauj procesoram apstrādāt 512 bitus datu vienā ciklā. Binārajam neironu tīklam tas nozīmē 512 neironu, kas tiek apstrādāti uzreiz. Mēs varam nodrošināt augstas veiktspējas secinājumu izpildi uz standarta serveriem, kas uzņēmumiem jau pieder. Nav nepieciešams GPU.
3. RISC-V
RISC-V ir nākotnes atvērtā koda aparatūras arhitektūra. Tā ir mikroshēmām tas, kas Linux bija operētājsistēmām. Mēs strādājam natively uz RISC-V paātrinātājiem. Tas ir ļoti svarīgi Eiropai un jaunattīstības valstīm, kuras vēlas veidot savu vietējo mikroshēmu nozari neatkarīgi no ASV eksporta kontroles.
4. FPGA (lauka programmējamās vārtu matricas)
Šī ir aizraujošākā robeža. FPGA ir "tukša audekla" mikroshēma, kuru var pārprogrammēt milisekundēs. Tā kā mūsu tīkli izmanto vienkāršus loģiskos vārtus, mēs varam fiziski savienot mikroshēmu, lai tā atbilstu neironu tīkla struktūrai. Dati plūst caur mikroshēmu kā ūdens pa caurulēm, bez jebkādas papildu slodzes. Tas nodrošina ārkārtīgi zemu latentumu (mikrosekundēs) un izcilu energoefektivitāti.
Stratēģiskā noturība un suverenitāte
Mūsu klientiem (īpaši valdībām, aizsardzības aģentūrām un kritiskās infrastruktūras nodrošinātājiem) šī aparatūras neatkarība ir ļoti svarīga funkcija.
Tas nozīmē, ka viņi nav atkarīgi no sankcijām. Ja ģeopolitiskā krīze pārtrauc piekļuvi ASV mikroshēmām, viņi var palaist savus Dweve modeļus uz Eiropas mikroshēmām vai plaši pieejamām vecākām mikroshēmām. Viņiem ir "B plāns".
Tas nozīmē, ka viņiem ir sarunu spēks. Viņi nav pakļauti viena pārdevēja cenu kaprīzēm. Ja NVIDIA paaugstina cenas, viņi var pāriet uz AMD vai specializētām ASIC bez programmatūras pārrakstīšanas.
Tas nozīmē arī ilgmūžību. NVIDIA H100 būs novecojusi pēc 3 gadiem. Rūpnieciskajā vidē (vilcienos, rūpnīcās, spēkstacijās) iekārtām jākalpo 20 gadus. Vispārējas nozīmes FPGA vai standarta CPU būs izmantojamas gadu desmitiem. Mēs veidojam programmatūru, kas respektē fiziskās pasaules dzīves ciklu.
Laikmets pēc GPU
Mēs uzskatām, ka vispārējas nozīmes GPU (GPGPU) dominance mākslīgā intelekta jomā ir vēsturiska anomālija. Tas bija piemērots rīks mākslīgā intelekta prototipēšanas fāzei, jo tas bija elastīgs un pieejams. Taču, mākslīgajam intelektam ieejot ieviešanas fāzē, mēs redzēsim specializētas aparatūras kembrija sprādzienu.
Mēs redzēsim analogo skaitļošanu. Optisko skaitļošanu. Neiromorfo skaitļošanu. Skaitļošanu atmiņā. Šīs arhitektūras visas ir fundamentāli nesaderīgas ar CUDA. Tām ir nepieciešama jauna programmatūras steks.
Atdalot mūsu programmatūru no aparatūras monopola jau šodien, Dweve ir nākotnes drošs rītdienai. Mēs neveidojam risinājumus tikai 2025. gada mikroshēmām; mēs veidojam risinājumus 2035. gada fizikai.
Vēlaties mākslīgo intelektu, kas darbojas pēc jūsu noteikumiem, nevis NVIDIA noteikumiem? Dweve aparatūras neatkarīgā arhitektūra sniedz jums stratēģisku brīvību, izmaksu kontroli un suverēnu noturību. Sazinieties ar mums, lai uzzinātu, kā mūsu binārie neironu tīkli var darboties uz aparatūras, kas jums jau pieder, vai uz rītdienas atvērtā silīcija.