Hardverfüggetlenség: Miért kockázat, ha mindent az NVIDIA-ra teszünk

A világ CUDA-függő. De az egyetlen beszállítóra épülő ellátási lánc egyetlen meghibásodási pont. Íme, miért fut a Dweve bármilyen platformon: AMD, Intel,...

Hardverfüggetlenség: Miért kockázat, ha mindent az NVIDIA-ra teszünk

The Monoculture Trap

Imagine if 95% of the world's cars could only run on a specific type of gasoline sold by exactly one company. Imagine that this company's refinery was located on a geologically unstable island. Imagine that every other car manufacturer had to design their engines to match this specific fuel blend.

If that company had a production glitch, or raised prices by 400%, or if a blockade cut off the island, the global economy would grind to a halt. Transportation would cease.

This sounds like a dystopian fiction, but it is the precise reality of the Artificial Intelligence industry today.

In 2025, roughly 95% of AI training and high-end inference happens on GPUs manufactured by one company: NVIDIA. The entire global AI stack (from the PyTorch frameworks to the datacenter cooling designs) is optimized for NVIDIA's architecture. The industry is addicted to CUDA, NVIDIA's proprietary software platform.

NVIDIA is a brilliant company. They built incredible technology. But this monoculture is a strategic nightmare. It creates a Single Point of Failure (SPOF) for the entire future of human intelligence.

AI-hardverpiac: monokultúra vs. sokszínűségJelenlegi iparág (NVIDIA-bezártság)95%NVIDIA CUDAEgyetlen meghibásodási pontEllátási lánc, árazás, exportkorlátozásokA Dweve megközelítése (gyártófüggetlen)AMDIntelRISC-VFPGACPUStratégiai ellenálló képességGyártóválasztás, ártárgyalás, szuverenitásA bináris neurális hálózatoknak nincs szükségük Tensor Core-okra: alapvető digitális logikán futnak
A "The Monoculture Trap" kockázatai kezelhetővé válnak, amint nevet és gazdát kapnak.

A strukturális hiány

Mindannyian átéltük a 2023-as és 2024-es H100-hiányt. Az induló vállalkozások 12 hónapot vártak a hardverre. A kormányok úgy halmozták fel a chipeket, mint az aranyrudakat. A számítási kapacitás ára az egekbe szökött.

Ez nem csupán átmeneti ellátási lánc probléma volt. Strukturális szűk keresztmetszetről beszélünk. Ezen chipek gyártása egy rendkívül összetett, CoWoS (Chip-on-Wafer-on-Substrate) nevű fejlett csomagolási eljáráson alapul, amelyet elsősorban a tajvani TSMC végez. Az ilyen csomagok előállítási kapacitása véges. A fizika törvényei végesek.

Ha az AI-stratégiája azon múlik, hogy hozzáférjen a legújabb, legjobb NVIDIA chiphez, akkor a vállalata túlélését egy olyan ellátási láncra teszi fel, amelyet nem irányít, olyan termék esetében, amelyet a legtöbbet ígérőnek árvereznek el.

A "The Structural Shortage" kapcsán az az érdek, hogy hol szivárog az érték, vagy hol tér vissza az irányítás.

A CUDA-árok

A valódi bezártság nem a hardverből fakad, hanem a szoftverből. A CUDA az AI nyelve. 15 éve kutatók és diákok tanulnak CUDA-magokat írni. A könyvtárak CUDA-ra vannak optimalizálva. Ha szabványos AI-kódot próbál futtatni egy AMD-kártyán vagy egy Intel-gyorsítón, gyakran a fájdalmak világába csöppen: törött függőségek, hiányzó magok és gyenge teljesítmény.

Ez a „CUDA-árok" távol tartja a versenytársakat. Biztosítja, hogy még ha az AMD épít is egy gyorsabb és olcsóbb chipet (amit meg is tett), senki sem veszi meg, mert a szoftver nem csak úgy „működik".

A Dweve filozófia: fuss mindenhol

A Dweve-nél korán hoztunk egy radikális döntést. Megnéztük a CUDA-csapdát, és azt mondtuk: „Nem."

Elhatároztuk, hogy egyetlen sor CUDA-t sem írunk. Nem vállalunk függőséget egy zárt hardveres technológiai környezettől.

Ehelyett nyílt szabványokra építettük a technológiánkat. A Vulkan-t használjuk (a grafikus API-t, amely mindenen fut, az Androidos telefonoktól a Linuxos szerverekig). OpenCL-t használunk. SPIR-V-t használunk. Támaszkodunk köztes reprezentációkra (IR), mint az MLIR (többszintű köztes reprezentáció).

De az igazi titkos összetevő nem csak az API; hanem a matematika.

Miért töri meg a bináris neurális hálózatok a CUDA bezártságátHagyományos mélytanulásFP16/FP32 mátrixszorzásIgényel: Tensor Core egységekEzt csak az NVIDIA tudja jólBináris neurális hálózatok1 bites XNOR + POPCNT műveletekIgényel: alapvető digitális logikátMinden hardveren elérhetőDweve hardvercélokAMD ROCmKözvetlen ISA fordításLegjobb ár/teljesítményIntel AVX-512512 neuron/ciklusGPU nélkül is működikRISC-VNyílt forráskódú szilíciumEurópai szuverenitásFPGAμs késleltetésVégső hatékonyság

Mivel a bináris neurális hálózataink (BNN) egyszerű egész számú műveletekre (XNOR és POPCNT) támaszkodnak a bonyolult lebegőpontos mátrixszorzások helyett, nem vagyunk kiszolgáltatva azoknak a speciális „Tensor Core” egységeknek, amelyeket csak az NVIDIA tud jól.

A Tensor Core egységek speciális hardvermodulok, amelyeket a 16 bites lebegőpontos számítások felgyorsítására terveztek. Ha az algoritmusod FP16-ra épül, Tensor Core egységre van szükséged. Ha az algoritmusod 1 bites logikára épül, nincs rá szükséged. Csak alapvető digitális logikai kapukra van szükséged.

Ez az architekturális szabadság lehetővé teszi, hogy lenyűgözően sokféle hardveren működjünk hatékonyan:

1. AMD ROCm

Az AMD Instinct GPU-k hatalmas nyers számítási teljesítményt és memóriasávszélességet kínálnak dolláronként. Lebegőpontos számítási feladatoknál a szoftververem (ROCm) történelmileg a gyenge pont volt. De a bináris számítási feladatainknál közvetlenül az ISA-ra (Instruction Set Architecture, utasításkészlet-architektúra) fordítunk. Megkerüljük a megbízhatatlan könyvtárakat. AMD hardveren a Dweve modellek szárnyalnak.

2. Intel CPU-k (AVX-512)

Mindenki figyelmen kívül hagyja a szerény CPU-t. De a modern Intel Xeon processzorok rendelkeznek egy AVX-512 nevű utasításkészlettel. Ez lehetővé teszi, hogy a CPU egyetlen ciklus alatt 512 bit adatot dolgozzon fel. Egy bináris neurális hálózatnál ez 512 neuron azonnali feldolgozását jelenti. Nagy teljesítményű következtetést futtathatunk olyan szabványos szervereken, amelyekkel a vállalatok már rendelkeznek. GPU nélkül.

3. RISC-V

A RISC-V a jövő nyílt forráskódú hardverarchitektúrája. Úgy viszonyul a chipekhez, mint a Linux az operációs rendszerekhez. Natívan futunk RISC-V gyorsítókon. Ez kulcsfontosságú Európa és a fejlődő országok számára, amelyek saját hazai chipipart szeretnének építeni, függetlenül az amerikai exportellenőrzésektől.

4. FPGA-k (Field Programmable Gate Arrays, programozható logikai kapuk tömbjei)

Ez a legizgalmasabb határterület. Az FPGA egy „üres vászon" chip, amely ezredmásodpercek alatt újrahuzalozható. Mivel a hálózataink egyszerű logikai kapukat használnak, fizikailag is huzalozhatjuk a chipet úgy, hogy az illeszkedjen a neurális hálózat szerkezetéhez. Az adat úgy áramlik át a chipen, mint a víz a csöveken, nulla többletterheléssel. Ez rendkívül alacsony késleltetést (mikroszekundumokat) és kiemelkedő energiahatékonyságot eredményez.

„The Dweve Philosophy: Run Everywhere" akkor válik kézzelfoghatóvá, amikor a vezérlőrétegek láthatóvá válnak.

Stratégiai ellenálló képesség és szuverenitás

Ügyfeleink számára (különösen kormányok, védelmi ügynökségek és kritikus infrastruktúra-szolgáltatók) ez a hardverfüggetlenség kiemelkedő tulajdonság.

Azt jelenti, hogy nincsenek szankciókhoz láncolva. Ha egy geopolitikai válság elvágja a hozzáférést az amerikai chipekhez, a Dweve modelljeiket európai chipeken vagy széles körben elérhető régebbi szilíciumon futtathatják. Van egy „B tervük".

Azt jelenti, hogy tárgyalási erejük van. Nincsenek kiszolgáltatva egyetlen szállító árazási szeszélyeinek. Ha az NVIDIA árat emel, válthatnak AMD-re vagy speciális ASIC-ekre anélkül, hogy át kellene írniuk a szoftverüket.

Hosszú élettartamot is jelent. Egy NVIDIA H100 három év múlva elavult lesz. Ipari környezetben (vonatok, gyárak, erőművek) a berendezéseknek 20 évig kell működniük. Egy általános FPGA vagy egy szabványos CPU évtizedekig használható marad. Olyan szoftvert építünk, amely tiszteletben tartja a fizikai világ életciklusát.

A „Strategic Resilience and Sovereignty” egy hurok: megfigyelés, döntés, cselekvés, majd újabb teszt.

A GPU utáni korszak

Meggyőződésünk, hogy az általános célú GPU (GPGPU) dominanciája a mesterséges intelligencia területén történelmi anomália. A megfelelő eszköz volt az MI prototípus-fázisához, mert rugalmas és elérhető volt. De ahogy az MI belép a bevezetési szakaszba, a speciális hardverek kambriumi robbanását fogjuk látni.

Látni fogjuk az analóg számítástechnikát, az optikai számítástechnikát, a neuromorf számítástechnikát és a memórián belüli számítástechnikát. Ezek az architektúrák alapvetően összeegyeztethetetlenek a CUDA-val. Új szoftververemre van szükségük.

Azáltal, hogy szoftverünket ma leválasztjuk a hardvermonopóliumról, a Dweve felkészült a jövőre. Nem csak a 2025-ös chipekre építünk; a 2035-ös fizikára építünk.

Szeretné, ha az MI a saját feltételei szerint működne, nem az NVIDIA-é szerint? A Dweve hardverfüggetlen architektúrája stratégiai szabadságot, költségkontrollt és szuverén ellenálló képességet biztosít. Vegye fel velünk a kapcsolatot, hogy megtudja, hogyan futhatnak bináris neurális hálózataink a már meglévő hardverén vagy a jövő nyílt szilíciumán.