Hardvér bez ohľadu na výrobcu: Prečo staviť všetko na NVIDIA je strategické riziko

Svet je závislý od CUDA. No dodávateľský reťazec s jediným dodávateľom je jediným bodom zlyhania. Preto Dweve beží na čomkoľvek: AMD, Intel, RISC-V a FPGA.

Hardvér bez ohľadu na výrobcu: Prečo staviť všetko na NVIDIA je strategické riziko

Pasca monokultúry

Predstavte si, že 95 % áut na svete by mohlo jazdiť len na špecifický druh benzínu, ktorý predáva presne jedna spoločnosť. Predstavte si, že rafinéria tejto spoločnosti sa nachádza na geologicky nestabilnom ostrove. Predstavte si, že každý iný výrobca áut by musel navrhnúť svoje motory tak, aby vyhovovali tejto konkrétnej zmesi paliva.

Ak by táto spoločnosť mala výrobný problém, alebo zvýšila ceny o 400 %, alebo ak by blokáda odrezala ostrov, globálna ekonomika by sa zastavila. Doprava by prestala fungovať.

To znie ako dystopická fikcia, ale je to presná realita odvetvia umelej inteligencie dnes.

V roku 2025 sa približne 95 % tréningu umelej inteligencie a špičkovej inferencie odohráva na GPU, ktoré vyrába jedna spoločnosť: NVIDIA. Celý globálny zásobník umelej inteligencie (od frameworkov PyTorch až po návrhy chladenia dátových centier) je optimalizovaný pre architektúru NVIDIA. Odvetvie je závislé od CUDA, proprietárnej softvérovej platformy NVIDIA.

NVIDIA je skvelá spoločnosť. Vybudovali neuveriteľnú technológiu. Ale táto monokultúra je strategická nočná mora. Vytvára jediný bod zlyhania (SPOF) pre celú budúcnosť ľudskej inteligencie.

Trh s AI hardvérom: monokultúra verzus diverzitaSúčasný priemysel (závislosť na NVIDIA)95%NVIDIA CUDAJediný bod zlyhaniaDodávateľský reťazec, ceny, exportné kontrolyPrístup Dweve (agnostický)AMDIntelRISC-VFPGACPUStrategická odolnosťVýber dodávateľa, vyjednávanie cien, suverenitaBinárne neurónové siete nepotrebujú Tensor Cores: fungujú na základnej digitálnej logike
Riziká v "The Monoculture Trap" sa stávajú zvládnuteľnými, keď majú mená a vlastníkov.

Štrukturálny nedostatok

Všetci sme si prešli nedostatkom H100 v rokoch 2023 a 2024. Startupy čakali na hardvér 12 mesiacov. Vlády hromadili čipy ako zlaté tehličky. Cena výpočtového výkonu raketovo vzrástla.

Nebol to len dočasný výpadok dodávateľského reťazca. Bol to štrukturálny úzky profil. Výroba týchto čipov závisí od neuveriteľne zložitého procesu nazývaného CoWoS (Chip-on-Wafer-on-Substrate) pokročilé balenie, ktoré primárne vykonáva TSMC na Taiwane. Kapacita na výrobu týchto balení je obmedzená. Zákony fyziky sú obmedzené.

Ak vaša stratégia AI závisí od prístupu k najnovšiemu a najlepšiemu čipu od NVIDIA, stávkujete prežitie svojej spoločnosti na dodávateľský reťazec, ktorý nekontrolujete, na produkt, ktorý sa predáva tomu, kto ponúkne najviac.

Kompromis v "The Structural Shortage" je miestom, kde uniká hodnota alebo sa vracia kontrola.

Priekopa CUDA

Skutočné uzamknutie nie je hardvér, ale softvér. CUDA je jazyk AI. Už 15 rokov sa výskumníci a študenti učia písať jadrá CUDA. Knižnice sú optimalizované pre CUDA. Ak sa pokúsite spustiť štandardný kód AI na karte AMD alebo akcelerátore Intel, často sa ocitnete vo svete bolesti: rozbité závislosti, chýbajúce jadrá a slabý výkon.

Tento „CUDA moat“ drží konkurenciu vonku. Zabezpečuje, že aj keby AMD postavilo čip, ktorý je rýchlejší a lacnejší (čo aj urobilo), nikto si ho nekúpi, pretože softvér jednoducho „nefunguje“.

Filozofia Dweve: Bež všade

V Dweve sme sa už na začiatku rozhodli radikálne. Pozreli sme sa na pascu CUDA a povedali sme si: „Nie.“

Rozhodli sme sa, že nenapíšeme ani jeden riadok CUDA. Nechceme byť závislí od proprietárneho hardvérového stacku.

Namiesto toho sme postavili náš stack na otvorených štandardoch. Používame Vulkan (grafické API, ktoré beží na všetkom od Android telefónov po Linux servery). Používame OpenCL. Používame SPIR-V. Spoliehame sa na medzireprezentácie (IR) ako MLIR (Multi-Level Intermediate Representation).

Ale skutočné tajomstvo nie je len v API; je v matematike.

Prečo binárne neurónové siete rušia uzamknutie na CUDATradičné hlboké učenieNásobenie matíc FP16/FP32Vyžaduje: Tensor CoresDobre ich zvláda len NVIDIABinárne neurónové sieteOperácie XNOR + POPCNT s 1 bitomVyžaduje: Základnú digitálnu logikuDostupné na VŠETKOM hardvériHardvérové ciele DweveAMD ROCmPriama kompilácia do ISANajlepší pomer cena/výkonIntel AVX-512512 neurónov/cyklusGPU netrebaRISC-VOpen source kremíkEurópska suverenitaFPGALatencia μsMaximálna efektivita

Keďže naše binárne neurónové siete (BNN) sa spoliehajú na jednoduché celočíselné operácie (XNOR a POPCNT) namiesto zložitého násobenia matíc s pohyblivou rádovou čiarkou, nie sme odkázaní na špecifické „Tensor Cores“, ktoré dobre zvláda len NVIDIA.

Tensor Cores sú špecializované hardvérové jednotky navrhnuté na zvládnutie matematiky s 16-bitovou pohyblivou rádovou čiarkou. Ak váš algoritmus závisí od FP16, potrebujete Tensor Core. Ak váš algoritmus závisí od 1-bitovej logiky, nepotrebujete ho. Potrebujete len základné digitálne logické hradlá.

Táto architektonická sloboda nám umožňuje efektívne bežať na ohromujúcej rozmanitosti hardvéru:

1. AMD ROCm

GPU Instinct od AMD ponúkajú obrovský surový výpočtový výkon a pamäťovú priepustnosť za každý dolár. Pri výpočtoch s pohyblivou rádovou čiarkou bol softvérový balík (ROCm) historicky slabým miestom. Ale pri našich binárnych výpočtoch kompilujeme priamo do ISA (Instruction Set Architecture). Obchádzame nespoľahlivé knižnice. Na hardvéri AMD modely Dweve letia.

2. CPU Intel (AVX-512)

Každý ignoruje skromný CPU. Ale moderné procesory Intel Xeon majú inštrukčnú sadu nazývanú AVX-512. Umožňuje procesoru spracovať 512 bitov dát v jednom cykle. Pre binárnu neurónovú sieť to znamená 512 neurónov spracovaných okamžite. Vysokovýkonnú inferenciu vieme spustiť na štandardných serveroch, ktoré firmy už vlastnia. GPU nie je potrebné.

3. RISC-V

RISC-V je open-source hardvérová architektúra budúcnosti. Je pre čipy tým, čím bol Linux pre operačné systémy. Bežíme natívne na akcelerátoroch RISC-V. To je kľúčové pre Európu a rozvojové krajiny, ktoré chcú vybudovať vlastný domáci čipový priemysel nezávislý od amerických exportných kontrol.

4. FPGA (Field Programmable Gate Arrays)

Toto je najvzrušujúcejšia hranica. FPGA je čip ako „prázdne plátno", ktorý sa dá prepojiť za milisekundy. Keďže naše siete používajú jednoduché logické hradlá, vieme čip fyzicky zapojiť tak, aby zodpovedal štruktúre neurónovej siete. Dáta pretekajú čipom ako voda potrubím, s nulovou réžiou. To prináša extrémne nízku latenciu (mikrosekundy) a extrémnu energetickú účinnosť.

„The Dweve Philosophy: Run Everywhere" sa stáva konkrétnou, keď sú riadiace vrstvy viditeľné.

Strategická odolnosť a suverenita

Pre našich zákazníkov (najmä vlády, obranné agentúry a poskytovateľov kritickej infraštruktúry) je táto hardvérová agnostickosť kľúčovou funkciou.

Znamená to, že nie sú uzamknutí sankciami. Ak geopolitická kríza preruší prístup k americkým čipom, môžu spustiť svoje modely Dweve na európskych čipoch alebo na široko dostupnom staršom kremíku. Majú „plán B".

Znamená to, že majú vyjednávaciu silu. Nie sú odkázaní na rozmary cien jedného dodávateľa. Ak NVIDIA zvýši ceny, môžu prejsť na AMD alebo špecializované ASIC bez prepisovania softvéru.

Znamená to aj dlhú životnosť. NVIDIA H100 bude zastaraná o 3 roky. V priemyselnom prostredí (vlaky, továrne, elektrárne) musí zariadenie vydržať 20 rokov. Všeobecný FPGA alebo štandardný CPU bude použiteľný celé desaťročia. Vytvárame softvér, ktorý rešpektuje životný cyklus fyzického sveta.

„Strategická odolnosť a suverenita“ je slučka: pozorovať, rozhodnúť, konať a znova testovať.

Éra po GPU

Veríme, že dominancia univerzálnych GPU (GPGPU) pre AI je historickou anomáliou. Boli správnym nástrojom pre fázu prototypovania AI, pretože boli flexibilné a dostupné. Ale keď AI vstupuje do fázy nasadzovania, uvidíme kambrickú explóziu špecializovaného hardvéru.

Uvidíme analógové výpočty. Optické výpočty. Neuromorfné výpočty. Výpočty v pamäti. Tieto architektúry sú všetky zásadne nekompatibilné s CUDA. Vyžadujú si nový softvérový zásobník.

Oddelením nášho softvéru od hardvérového monopolu už dnes je Dweve pripravený na budúcnosť. Nestaviame len pre čipy roku 2025; staviame pre fyziku roku 2035.

Chcete AI, ktorá beží podľa vašich pravidiel, nie podľa pravidiel NVIDIA? Hardvérovo agnostická architektúra Dweve vám dáva strategickú slobodu, kontrolu nákladov a suverénnu odolnosť. Kontaktujte nás a zistite, ako môžu naše binárne neurónové siete bežať na hardvéri, ktorý už vlastníte, alebo na otvorenom kremíku budúcnosti.