Hardware Agnosticism: Proč je sázka všeho na NVIDIA strategickým rizikem
Past na monokulturu
Představte si, že 95 % světových automobilů by mohlo jezdit pouze na specifický typ benzínu prodávaný jedinou společností. Představte si, že by se rafinerie této společnosti nacházela na geologicky nestabilním ostrově. Představte si, že by každý jiný výrobce automobilů musel navrhovat své motory tak, aby odpovídaly této konkrétní směsi paliva.
Kdyby tato společnost měla výrobní problém, nebo zvýšila ceny o 400 %, nebo kdyby blokáda odřízla ostrov, globální ekonomika by se zastavila. Doprava by ustala.
To zní jako dystopická fikce, ale je to přesná realita odvětví umělé inteligence dneška.
V roce 2025 probíhá zhruba 95 % trénování AI a špičkové inference na GPU vyráběných jednou společností: NVIDIA. Celý globální zásobník AI (od frameworků PyTorch po návrhy chlazení datacenter) je optimalizován pro architekturu NVIDIA. Odvětví je závislé na CUDA, proprietární softwarové platformě NVIDIA.
NVIDIA je skvělá společnost. Vybudovali neuvěřitelnou technologii. Ale tato monokultura je strategickou noční můrou. Vytváří jediný bod selhání (SPOF) pro celou budoucnost lidské inteligence.
Strukturální nedostatek
Všichni jsme si prošli nedostatkem H100 v letech 2023 a 2024. Startupy čekaly na hardware 12 měsíců. Vlády hromadily čipy jako zlaté cihly. Cena výpočetního výkonu prudce vzrostla.
Nebyl to jen dočasný problém v dodavatelském řetězci. Byl to strukturální úzký profil. Výroba těchto čipů závisí na neuvěřitelně složitém procesu zvaném CoWoS (Chip-on-Wafer-on-Substrate) pokročilé balení, které primárně provádí TSMC na Tchaj-wanu. Kapacita pro výrobu těchto balení je omezená. Fyzikální zákony jsou omezené.
Pokud vaše strategie pro AI závisí na přístupu k nejnovějšímu a nejlepšímu čipu NVIDIA, sázíte přežití své společnosti na dodavatelský řetězec, který neovládáte, pro produkt, který je vydražen tomu, kdo nabídne nejvíc.
Příkop CUDA
Skutečné uzamčení není hardware; je to software. CUDA je jazykem AI. Patnáct let se výzkumníci a studenti učí psát jádra CUDA. Knihovny jsou optimalizované pro CUDA. Pokud se pokusíte spustit standardní kód AI na kartě AMD nebo akcelerátoru Intel, často vstoupíte do světa bolesti: rozbité závislosti, chybějící jádra a špatný výkon.
Tento „CUDA příkop" drží konkurenty venku. Zajišťuje, že i kdyby AMD postavilo čip, který je rychlejší a levnější (a oni to udělali), nikdo si ho nekoupí, protože software prostě „nefunguje".
Filozofie Dweve: Běh všude
Ve Dweve jsme se na začátku rozhodli radikálně. Podívali jsme se na past CUDA a řekli jsme si: „Ne."
Rozhodli jsme se, že nenapíšeme jediný řádek CUDA. Nechtěli jsme se stát závislými na proprietárním hardwarovém stacku.
Místo toho jsme náš stack postavili na otevřených standardech. Používáme Vulkan (grafické API, které běží na všem od telefonů s Androidem po linuxové servery). Používáme OpenCL. Používáme SPIR-V. Spoléháme na mezilehlé reprezentace (IR), jako je MLIR (Multi-Level Intermediate Representation).
Ale skutečné tajemství není jen v API; je v matematice.
Protože naše binární neuronové sítě (BNN) spoléhají na jednoduché celočíselné operace (XNOR a POPCNT) místo složitého násobení matic s plovoucí desetinnou čárkou, nejsme vázáni na specifické „Tensor Cores“, které dobře zvládá jen NVIDIA.
Tensor Cores jsou specializované hardwarové jednotky navržené pro zvládání matematiky s 16bitovou plovoucí desetinnou čárkou. Pokud váš algoritmus spoléhá na FP16, potřebujete Tensor Core. Pokud váš algoritmus spoléhá na 1bitovou logiku, nepotřebujete. Stačí vám jen základní digitální logické hradla.
Tato architektonická svoboda nám umožňuje efektivně běžet na ohromující rozmanitosti hardwaru:
1. AMD ROCm
GPU Instinct od AMD nabízejí obrovský surový výpočetní výkon a paměťovou propustnost za každou utracenou korunu. U úloh s pohyblivou řádovou čárkou byl software (ROCm) historicky slabým místem. Ale u našich binárních úloh kompilujeme přímo do ISA (Instruction Set Architecture). Obcházíme nespolehlivé knihovny. Na hardwaru AMD modely Dweve sviští.
2. CPU Intel (AVX-512)
Všichni přehlížejí skromný procesor. Ale moderní procesory Intel Xeon mají instrukční sadu zvanou AVX-512. Ta umožňuje procesoru zpracovat 512 bitů dat v jediném cyklu. U binární neuronové sítě to znamená 512 neuronů zpracovaných okamžitě. Vysoce výkonnou inferenci můžeme spouštět na běžných serverech, které firmy už vlastní. GPU není potřeba.
3. RISC-V
RISC-V je open-source hardwarová architektura budoucnosti. Je k čipům tím, čím byl Linux k operačním systémům. Na akcelerátorech RISC-V běžíme nativně. To je klíčové pro Evropu a rozvojové země, které chtějí vybudovat vlastní domácí čipový průmysl nezávislý na amerických exportních kontrolách.
4. FPGA (Field Programmable Gate Arrays)
Tohle je nejzajímavější hranice. FPGA je čip jako „prázdné plátno", který lze přepojit během milisekund. Protože naše sítě používají jednoduchá logická hradla, můžeme čip fyzicky zapojit tak, aby odpovídal struktuře neuronové sítě. Data protékají čipem jako voda potrubím, s nulovou režií. To přináší extrémně nízkou latenci (mikrosekundy) a extrémní energetickou účinnost.
Strategická odolnost a suverenita
Pro naše zákazníky (zejména vlády, obranné agentury a poskytovatele kritické infrastruktury) je tato hardwarová agnosticita zabijáckou funkcí.
Znamená to, že nejsou uzamčeni sankcemi. Pokud geopolitická krize přeruší přístup k americkým čipům, mohou své modely Dweve spouštět na evropských čipech nebo na široce dostupném starším křemíku. Mají „plán B".
Znamená to, že mají vyjednávací sílu. Nejsou vydáni napospas cenovým rozmarům jediného dodavatele. Pokud NVIDIA zvýší ceny, mohou přejít na AMD nebo specializovaná ASIC bez přepisování softwaru.
Znamená to také dlouhou životnost. NVIDIA H100 bude za 3 roky zastaralá. V průmyslovém prostředí (vlaky, továrny, elektrárny) musí zařízení vydržet 20 let. Obecné FPGA nebo běžný CPU bude použitelný po celá desetiletí. Vytváříme software, který respektuje životní cyklus fyzického světa.
Éra po GPU
Věříme, že dominance univerzálních GPU (GPGPU) pro AI je historickou anomálií. Byly tím správným nástrojem pro fázi prototypování AI, protože byly flexibilní a dostupné. Jak ale AI vstupuje do fáze nasazení, uvidíme kambrickou explozi specializovaného hardwaru.
Uvidíme analogové počítání. Optické počítání. Neuromorfní počítání. Počítání v paměti. Tyto architektury jsou všechny zásadně nekompatibilní s CUDA. Vyžadují nový softwarový zásobník.
Tím, že náš software odpoutáváme od hardwarového monopolu už dnes, je Dweve připraven na budoucnost. Nebudujeme jen pro čipy roku 2025; budujeme pro fyziku roku 2035.
Chcete AI, která běží podle vašich pravidel, ne podle pravidel NVIDIA? Hardwarově agnostická architektura Dweve vám dává strategickou svobodu, kontrolu nad náklady a suverénní odolnost. Kontaktujte nás a zjistěte, jak mohou naše binární neuronové sítě běžet na hardwaru, který už vlastníte, nebo na otevřeném křemíku zítřka.