Technologinė nepriklausomybė: kodėl viską statyti ant NVIDIA yra strateginė rizika
Monokultūros spąstai
Įsivaizduokite, jei 95 % pasaulio automobilių galėtų važiuoti tik tam tikros rūšies benzinu, kurį parduotų tik viena įmonė. Įsivaizduokite, kad šios įmonės naftos perdirbimo gamykla būtų geologiškai nestabilioje saloje. Įsivaizduokite, kad visi kiti automobilių gamintojai turėtų pritaikyti savo variklius būtent šiam degalų mišiniui.
Jei toje įmonėje įvyktų gamybos sutrikimas, ji padidintų kainas 400 % arba blokada atkirstų salą, pasaulio ekonomika sustotų. Transportas nutrūktų.
Tai skamba kaip distopinė fantastika, tačiau būtent tokia yra dabartinė dirbtinio intelekto pramonės realybė.
2025 m. maždaug 95 % dirbtinio intelekto mokymo ir aukščiausios klasės išvadų atliekama naudojant vienos įmonės NVIDIA gaminamus GPU. Visa pasaulinė dirbtinio intelekto technologijų grandinė (nuo PyTorch sistemų iki duomenų centrų aušinimo sprendimų) yra optimizuota NVIDIA architektūrai. Pramonė yra priklausoma nuo CUDA, NVIDIA patentuotos programinės įrangos platformos.
NVIDIA yra puiki įmonė. Jie sukūrė neįtikėtiną technologiją. Tačiau ši monokultūra yra strateginis košmaras. Ji sukuria vieną gedimo tašką (SPOF) visai žmonijos intelekto ateičiai.
Struktūrinis trūkumas
Visi išgyvenome H100 trūkumą 2023 ir 2024 metais. Startuoliai laukė aparatinės įrangos 12 mėnesių. Vyriausybės kaupė lustus kaip aukso luitus. Skaičiavimo galios kainos šovė į viršų.
Tai nebuvo tik laikinas tiekimo grandinės sutrikimas. Tai buvo struktūrinė kliūtis. Šių lustų gamyba priklauso nuo nepaprastai sudėtingo proceso, vadinamo CoWoS (Chip-on-Wafer-on-Substrate) pažangiuoju pakavimu, kurį daugiausia vykdo TSMC Taivane. Tokių paketų gamybos pajėgumai yra riboti. Fizikos dėsniai yra riboti.
Jei jūsų DI strategija priklauso nuo prieigos prie naujausio, geriausio NVIDIA lusto, jūs statote savo įmonės išlikimą ant tiekimo grandinės, kurios nekontroliuojate, dėl produkto, kuris parduodamas aukščiausią kainą pasiūliusiam.
CUDA griovys
Tikrasis įstrigimas nėra aparatinė įranga; tai programinė įranga. CUDA yra DI kalba. 15 metų tyrėjai ir studentai mokėsi rašyti CUDA branduolius. Bibliotekos yra optimizuotos CUDA. Jei bandysite paleisti standartinį DI kodą AMD kortelėje arba Intel greitintuve, dažnai pateksite į kančios pasaulį: sulaužytos priklausomybės, trūkstami branduoliai ir prastas našumas.
This "CUDA Moat" keeps competitors out. It ensures that even if AMD builds a chip that is faster and cheaper (which they have), nobody buys it because the software doesn't just "work."
The Dweve Philosophy: Run Everywhere
At Dweve, we made a radical decision early on. We looked at the CUDA trap and we said: "No."
We decided that we would not write a single line of CUDA. We would not take a dependency on a proprietary hardware stack.
Instead, we built our stack on open standards. We use Vulkan (the graphics API that runs on everything from Android phones to Linux servers). We use OpenCL. We use SPIR-V. We rely on intermediate representations (IRs) like MLIR (Multi-Level Intermediate Representation).
But the real secret sauce isn't just the API; it's the math.
Kadangi mūsų dvejetainiai neuroniniai tinklai (BNN) remiasi paprastomis sveikųjų skaičių operacijomis (XNOR ir POPCNT), o ne sudėtinga slankiojo kablelio matricų daugyba, nesame priklausomi nuo konkrečių „Tensor Cores“, kuriuos gerai išmano tik NVIDIA.
„Tensor Cores“ yra specializuoti aparatinės įrangos blokai, sukurti itin spartiam 16 bitų slankiojo kablelio skaičiavimui. Jei jūsų algoritmas priklauso nuo FP16, jums reikia „Tensor Core“. Jei jūsų algoritmas priklauso nuo 1 bito logikos, jo nereikia. Jums pakanka pagrindinių skaitmeninės logikos vartų.
Ši architektūrinė laisvė leidžia mums efektyviai veikti su įvairiausia aparatine įranga:
1. AMD ROCm
„AMD" Instinct GPU siūlo didžiulę skaičiavimo galią ir atminties pralaidumą už kiekvieną dolerį. Atlikdami slankiojo kablelio operacijas, programinės įrangos paketas (ROCm) istoriškai buvo silpnoji vieta. Tačiau mūsų dvejetainių darbo krūvių atveju kompiliuojame tiesiogiai į ISA (instrukcijų rinkinio architektūrą). Mes aplenkiame nepatikimas bibliotekas. Naudojant „AMD" aparatinę įrangą, „Dweve" modeliai veikia itin greitai.
2. „Intel" procesoriai (AVX-512)
Visi ignoruoja kuklų procesorių. Tačiau šiuolaikiniai „Intel Xeon" procesoriai turi instrukcijų rinkinį, vadinamą AVX-512. Jis leidžia procesoriui apdoroti 512 bitų duomenų per vieną ciklą. Dvejetainiam neuroniniam tinklui tai reiškia, kad 512 neuronų apdorojama akimirksniu. Mes galime vykdyti didelio našumo išvadas standartiniuose serveriuose, kuriuos įmonės jau turi. GPU nereikia.
3. RISC-V
RISC-V yra atvirojo kodo aparatinės įrangos architektūra ateityje. Ji lustams yra tai, kas „Linux" buvo operacinėms sistemoms. Mes veikiame natyviai RISC-V greitintuvuose. Tai labai svarbu Europai ir besivystančioms šalims, kurios nori sukurti savo vidaus lustų pramonę, nepriklausomą nuo JAV eksporto kontrolės.
4. FPGA (lauke programuojamų vartų matricos)
Tai pati įdomiausia sritis. FPGA yra „tuščios drobės" lustas, kurį galima perkonfigūruoti per milisekundes. Kadangi mūsų tinklai naudoja paprastus loginius vartus, galime fiziškai sujungti lustą taip, kad jis atitiktų neuroninio tinklo struktūrą. Duomenys teka per lustą kaip vanduo vamzdžiais, be jokių papildomų sąnaudų. Tai užtikrina itin mažą delsą (mikrosekundes) ir ypatingą energijos vartojimo efektyvumą.
Strateginis atsparumas ir suverenumas
Mūsų klientams (ypač vyriausybėms, gynybos agentūroms ir kritinės infrastruktūros teikėjams) šis aparatinės įrangos neutralumas yra itin svarbi funkcija.
Tai reiškia, kad jie nėra įstrigę dėl sankcijų. Jei geopolitinė krizė nutrauktų prieigą prie amerikietiškų lustų, jie galėtų paleisti savo „Dweve" modelius europietiškuose lustuose arba plačiai prieinamuose senesnės kartos silicio lustuose. Jie turi „planą B".
Tai reiškia, kad jie turi derybinę galią. Jie nepriklauso nuo vieno pardavėjo kainų užgaidų. Jei „NVIDIA" pakeltų kainas, jie galėtų pereiti prie „AMD" arba specializuotų ASIC, neperrašydami savo programinės įrangos.
Tai taip pat reiškia ilgaamžiškumą. „NVIDIA H100" pasens per 3 metus. Pramoninėse aplinkose (traukiniai, gamyklos, elektrinės) įranga turi tarnauti 20 metų. Įprastas FPGA arba standartinis procesorius tarnaus dešimtmečius. Mes kuriame programinę įrangą, kuri gerbia fizinio pasaulio gyvavimo ciklą.
Era po GPU
Manome, kad bendrosios paskirties GPU (GPGPU) dominavimas dirbtinio intelekto srityje yra istorinė anomalija. Tai buvo tinkamas įrankis DI prototipų kūrimo fazei, nes buvo lankstus ir prieinamas. Tačiau DI įžengus į diegimo fazę, pamatysime kambro sprogimą specializuotos aparatinės įrangos srityje.
Pamatysime analoginį skaičiavimą. Optinį skaičiavimą. Neuromorfinį skaičiavimą. Skaičiavimą atmintyje. Šios architektūros yra iš esmės nesuderinamos su CUDA. Jos reikalauja naujo programinės įrangos kamino.
Atrišdami savo programinę įrangą nuo aparatinės įrangos monopolijos šiandien, Dweve užtikriname ateities perspektyvą. Kuriame ne tik 2025 metų lustams; kuriame 2035 metų fizikai.
Norite DI, kuris veiktų jūsų sąlygomis, o ne NVIDIA? „Dweve“ aparatinės įrangos nepriklausoma architektūra suteikia strateginę laisvę, kaštų kontrolę ir suverenų atsparumą. Susisiekite su mumis, kad sužinotumėte, kaip mūsų dvejetainiai neuroniniai tinklai gali veikti su aparatine įranga, kurią jau turite, arba su atviru rytojaus siliciu.