Hårdvaruagnosticism: Varför att satsa allt på NVIDIA är en strategisk risk
Monokulturfällan
Tänk dig att 95 % av världens bilar bara kunde köras på en specifik typ av bensin som såldes av exakt ett företag. Tänk dig att detta företags raffinaderi låg på en geologiskt instabil ö. Tänk dig att alla andra biltillverkare var tvungna att konstruera sina motorer för att matcha just denna bränsleblandning.
Om det företaget fick ett produktionsproblem, eller höjde priserna med 400 %, eller om en blockad skar av ön, skulle världsekonomin stanna av. Transporterna skulle upphöra.
Detta låter som dystopisk fiktion, men det är den exakta verkligheten för den artificiella intelligensindustrin idag.
Under 2025 sker ungefär 95 % av AI-träning och avancerad inferens på GPU:er tillverkade av ett enda företag: NVIDIA. Hela den globala AI-stacken (från PyTorch-ramverken till datacenterkylningsdesignen) är optimerad för NVIDIAs arkitektur. Branschen är beroende av CUDA, NVIDIAs proprietära mjukvaruplattform.
NVIDIA är ett lysande företag. De byggde otrolig teknik. Men denna monokultur är en strategisk mardröm. Den skapar en enda felpunkt (SPOF) för hela den mänskliga intelligensens framtid.
Den strukturella bristen
Vi har alla upplevt H100-bristen under 2023 och 2024. Nystartade företag väntade 12 månader på hårdvara. Regeringar hamstrade chipp som guld tackor. Priset på beräkningskraft sköt i höjden.
Detta var inte bara en tillfällig störning i leveranskedjan. Det var en strukturell flaskhals. Tillverkningen av dessa chipp bygger på en otroligt komplex process som kallas CoWoS (Chip-on-Wafer-on-Substrate) avancerad paketering, som främst utförs av TSMC i Taiwan. Kapaciteten att bygga dessa paket är ändlig. Fysikens lagar är ändliga.
Om din AI-strategi bygger på att få tillgång till det senaste och bästa NVIDIA-chippet, satsar du ditt företags överlevnad på en leveranskedja du inte kontrollerar, för en produkt som auktioneras ut till högstbjudande.
CUDA-graven
Den verkliga inlåsningen är inte hårdvaran; det är mjukvaran. CUDA är AI:ns språk. I 15 år har forskare och studenter lärt sig att skriva CUDA-kärnor. Bibliotek är optimerade för CUDA. Om du försöker köra standard AI-kod på ett AMD-kort eller en Intel-accelerator hamnar du ofta i en värld av smärta: trasiga beroenden, saknade kärnor och dålig prestanda.
Denna "CUDA-mur" håller konkurrenter ute. Den säkerställer att även om AMD bygger ett chip som är snabbare och billigare (vilket de har gjort), så köper ingen det, eftersom mjukvaran inte bara "fungerar".
Dweve-filosofin: Kör överallt
På Dweve fattade vi ett radikalt beslut tidigt. Vi tittade på CUDA-fällan och sa: "Nej."
Vi bestämde att vi inte skulle skriva en enda rad CUDA. Vi skulle inte ta ett beroende på en proprietär hårdvarustack.
Istället byggde vi vår stack på öppna standarder. Vi använder Vulkan (grafik-API:t som kör på allt från Android-telefoner till Linux-servrar). Vi använder OpenCL. Vi använder SPIR-V. Vi förlitar oss på mellanrepresentationer (IR) som MLIR (Multi-Level Intermediate Representation).
Men den verkliga hemligheten är inte bara API:t; det är matematiken.
Eftersom våra binära neurala nätverk (BNN) förlitar sig på enkla heltalsoperationer (XNOR och POPCNT) i stället för komplexa flyttalsmatrismultiplikationer, är vi inte bundna till de specifika "Tensor-kärnor" som endast NVIDIA gör bra.
Tensor-kärnor är specialiserade hårdvaruenheter utformade för att krossa 16-bitars flyttalsmatematik. Om din algoritm förlitar sig på FP16 behöver du en Tensor-kärna. Om din algoritm förlitar sig på 1-bitars logik behöver du det inte. Du behöver bara grundläggande digitala logikgrindar.
Denna arkitektoniska frihet gör att vi kan köra effektivt på en imponerande mångfald av hårdvara:
1. AMD ROCm
AMDs Instinct-GPU:er erbjuder enorm rå beräkningskraft och minnesbandbredd per krona. För flyttalsarbetsbelastningar har programvarustacken (ROCm) historiskt sett varit den svaga punkten. Men för våra binära arbetsbelastningar kompilerar vi direkt till ISA (Instruction Set Architecture). Vi kringgår de opålitliga biblioteken. På AMD-hårdvara presterar Dweve-modeller exceptionellt bra.
2. Intel-CPU:er (AVX-512)
Alla ignorerar den ödmjuka processorn. Men moderna Intel Xeon-processorer har en instruktionsuppsättning som kallas AVX-512. Den gör att processorn kan bearbeta 512 bitar data i en enda cykel. För ett binärt neuralt nätverk innebär det att 512 neuroner bearbetas omedelbart. Vi kan köra högpresterande inferens på standardservrar som företag redan äger. Ingen GPU krävs.
3. RISC-V
RISC-V är framtidens öppna hårdvaruarkitektur. För kretsar är den vad Linux var för operativsystem. Vi kör nativt på RISC-V-acceleratorer. Detta är avgörande för Europa och utvecklingsländer som vill bygga egna inhemska chipindustrier oberoende av USA:s exportkontroller.
4. FPGA:er (Field Programmable Gate Arrays)
Detta är den mest spännande frontlinjen. En FPGA är ett "blankt blad"-chip som kan kopplas om på millisekunder. Eftersom våra nätverk använder enkla logiska grindar kan vi fysiskt koppla chippet så att det matchar det neurala nätverkets struktur. Data flödar genom chippet som vatten genom rör, utan något overhead. Detta ger extremt låg latens (mikrosekunder) och extrem energieffektivitet.
Strategisk motståndskraft och suveränitet
För våra kunder (särskilt regeringar, försvarsmyndigheter och leverantörer av kritisk infrastruktur) är denna hårdvaruagnosticism en avgörande funktion.
Det innebär att de inte är låsta av sanktioner. Om en geopolitisk kris skär av tillgången till amerikanska chip kan de köra sina Dweve-modeller på europeiska chip eller allmänt tillgänglig äldre kiselteknik. De har en "Plan B".
Det innebär att de har förhandlingskraft. De är inte bundna till en enda leverantörs prispåhitt. Om NVIDIA höjer priserna kan de byta till AMD eller specialiserade ASIC:er utan att skriva om sin programvara.
Det innebär också långsiktighet. En NVIDIA H100 kommer att vara föråldrad om 3 år. I industriella miljöer (tåg, fabriker, kraftverk) behöver utrustning hålla i 20 år. En generisk FPGA eller en standardprocessor kommer att vara funktionsduglig i decennier. Vi bygger programvara som respekterar den fysiska världens livscykel.
Tiden efter GPU
Vi menar att den allmänna GPU:ns (GPGPU) dominans inom AI är en historisk avvikelse. Den var rätt verktyg för AI:s prototypfas, eftersom den var flexibel och tillgänglig. Men när AI går in i driftsättningsfasen kommer vi att se en kambrisk explosion av specialiserad hårdvara.
Vi kommer att se analog beräkning. Optisk beräkning. Neuromorf beräkning. Beräkning i minnet. Dessa arkitekturer är alla fundamentalt inkompatibla med CUDA. De kräver en ny programvarustack.
Genom att frikoppla vår programvara från hårdvarumonopolet idag är Dweve framtidssäkrad för morgondagen. Vi bygger inte bara för 2025 års chipp; vi bygger för 2035 års fysik.
Vill du ha AI som körs på dina villkor, inte NVIDIAs? Dweves hårdvaruagnostiska arkitektur ger dig strategisk frihet, kostnadskontroll och suverän motståndskraft. Kontakta oss för att upptäcka hur våra binära neurala nätverk kan köras på den hårdvara du redan äger, eller på morgondagens öppna kisel.