Dweve

Pourquoi miser uniquement sur NVIDIA est un risque stratégique

Le monde est accro à CUDA. Mais une chaîne d'approvisionnement à fournisseur unique est un point de défaillance unique. Voici pourquoi Dweve fonctionne...

Pourquoi miser uniquement sur NVIDIA est un risque stratégique

Le piège de la monoculture

Imaginez si 95 % des voitures dans le monde ne pouvaient fonctionner qu'avec un type spécifique d'essence vendu par une seule entreprise. Imaginez que la raffinerie de cette entreprise soit située sur une île géologiquement instable. Imaginez que tous les autres constructeurs automobiles doivent concevoir leurs moteurs pour correspondre à ce mélange de carburant spécifique.

Si cette entreprise avait un problème de production, ou augmentait ses prix de 400 %, ou si un blocus coupait l'île du reste du monde, l'économie mondiale s'arrêterait net. Les transports cesseraient.

Cela ressemble à une fiction dystopique, mais c'est la réalité précise de l'industrie de l'intelligence artificielle aujourd'hui.

En 2025, environ 95 % de l'entraînement de l'IA et de l'inférence haut de gamme se fait sur des GPU fabriqués par une seule entreprise : NVIDIA. Toute la pile mondiale de l'IA (des frameworks PyTorch aux conceptions de refroidissement des centres de données) est optimisée pour l'architecture de NVIDIA. L'industrie est dépendante de CUDA, la plateforme logicielle propriétaire de NVIDIA.

NVIDIA est une entreprise brillante. Ils ont construit une technologie incroyable. Mais cette monoculture est un cauchemar stratégique. Elle crée un point de défaillance unique (SPOF) pour tout l'avenir de l'intelligence humaine.

Marché du matériel IA : monoculture ou diversitéIndustrie actuelle (verrouillage NVIDIA)95%NVIDIA CUDAPoint de défaillance uniqueChaîne d'approvisionnement, prix, contrôles à l'exportationApproche Dweve (agnostique)AMDIntelRISC-VFPGACPURésilience stratégiqueChoix du fournisseur, négociation des prix, souverainetéLes réseaux de neurones binaires n'ont pas besoin de Tensor Cores : ils fonctionnent sur une logique numérique de base
Les risques du « piège de la monoculture » deviennent gérables une fois qu'ils ont un nom et un propriétaire.

La pénurie structurelle

Nous avons tous vécu les pénuries de H100 de 2023 et 2024. Les startups ont attendu 12 mois pour obtenir du matériel. Les gouvernements ont thésaurisé les puces comme des lingots d'or. Le prix du calcul a grimpé en flèche.

Ce n'était pas qu'un simple problème temporaire de chaîne d'approvisionnement. C'était un goulot d'étranglement structurel. La fabrication de ces puces repose sur un processus incroyablement complexe appelé conditionnement avancé CoWoS (Chip-on-Wafer-on-Substrate), principalement réalisé par TSMC à Taïwan. La capacité de produire ces conditionnements est limitée. Les lois de la physique sont limitées.

Si votre stratégie d'IA repose sur l'accès à la toute dernière puce NVIDIA, vous pariez la survie de votre entreprise sur une chaîne d'approvisionnement que vous ne contrôlez pas, pour un produit vendu aux enchères au plus offrant.

Le compromis du « goulot d'étranglement structurel » est l'endroit où la valeur fuit ou où le contrôle revient.

La forteresse CUDA

Le véritable verrouillage ne vient pas du matériel, mais du logiciel. CUDA est le langage de l'IA. Depuis 15 ans, chercheurs et étudiants apprennent à écrire des noyaux CUDA. Les bibliothèques sont optimisées pour CUDA. Si vous essayez d'exécuter du code d'IA standard sur une carte AMD ou un accélérateur Intel, vous entrez souvent dans un monde de douleur : dépendances cassées, noyaux manquants et performances médiocres.

Ce « fossé CUDA » tient les concurrents à distance. Il garantit que même si AMD fabrique une puce plus rapide et moins chère (ce qu'elle a fait), personne ne l'achète, car le logiciel ne « fonctionne » pas simplement.

La philosophie Dweve : fonctionner partout

Chez Dweve, nous avons pris une décision radicale dès le début. Nous avons examiné le piège CUDA et nous avons dit : « Non. »

Nous avons décidé de ne pas écrire une seule ligne de CUDA. Nous ne voulions pas dépendre d'une pile matérielle propriétaire.

À la place, nous avons bâti notre pile sur des normes ouvertes. Nous utilisons Vulkan (l'API graphique qui fonctionne sur tout, des téléphones Android aux serveurs Linux). Nous utilisons OpenCL. Nous utilisons SPIR-V. Nous nous appuyons sur des représentations intermédiaires (IR) comme MLIR (représentation intermédiaire multi-niveaux).

Mais le vrai secret ne réside pas seulement dans l'API ; c'est dans les mathématiques.

Pourquoi les réseaux de neurones binaires brisent le verrouillage CUDAApprentissage profond traditionnelMultiplication de matrices FP16/FP32Nécessite : Tensor CoresSeul NVIDIA les maîtrise bienRéseaux de neurones binairesOpérations XNOR + POPCNT sur 1 bitNécessite : logique numérique de baseDisponible sur TOUT matérielCibles matérielles DweveAMD ROCmCompilation ISA directeMeilleur rapport qualité/prixIntel AVX-512512 neurones/cycleAucun GPU requisRISC-VSilicium open sourceSouveraineté européenneFPGALatence μsEfficacité ultime

Parce que nos réseaux de neurones binaires (BNN) reposent sur des opérations entières simples (XNOR et POPCNT) plutôt que sur des multiplications de matrices à virgule flottante complexes, nous ne dépendons pas des « Tensor Cores » spécifiques que seul NVIDIA maîtrise bien.

Les Tensor Cores sont des unités matérielles spécialisées conçues pour écraser les calculs en virgule flottante 16 bits. Si votre algorithme repose sur FP16, vous avez besoin d’un Tensor Core. Si votre algorithme repose sur la logique 1 bit, vous n’en avez pas besoin. Vous avez simplement besoin de portes logiques numériques de base.

Cette liberté architecturale nous permet de fonctionner efficacement sur une étonnante diversité de matériels :

AMD ROCm

Les GPU Instinct d'AMD offrent une puissance de calcul brute et une bande passante mémoire exceptionnelles pour leur prix. Pour les charges de travail en virgule flottante, la pile logicielle (ROCm) a historiquement été le point faible. Mais pour nos charges de travail binaires, nous compilons directement vers l'ISA (Instruction Set Architecture). Nous contournons les bibliothèques peu fiables. Sur le matériel AMD, les modèles Dweve sont fulgurants.

2. Processeurs Intel (AVX-512)

Tout le monde ignore le modeste processeur. Mais les processeurs Intel Xeon modernes disposent d'un jeu d'instructions appelé AVX-512. Il permet au processeur de traiter 512 bits de données en un seul cycle. Pour un réseau de neurones binaires, cela représente 512 neurones traités instantanément. Nous pouvons exécuter une inférence haute performance sur des serveurs standard que les entreprises possèdent déjà. Aucun GPU requis.

RISC-V

RISC-V est l'architecture matérielle open source de l'avenir. C'est pour les puces ce que Linux a été pour les systèmes d'exploitation. Nous fonctionnons nativement sur les accélérateurs RISC-V. C'est crucial pour l'Europe et les pays en développement qui souhaitent bâtir leur propre industrie nationale de puces, indépendante des contrôles à l'exportation américains.

4. FPGA (Field Programmable Gate Arrays)

C'est la frontière la plus passionnante. Un FPGA est une puce « toile vierge » qui peut être recâblée en quelques millisecondes. Comme nos réseaux utilisent des portes logiques simples, nous pouvons physiquement câbler la puce pour qu'elle corresponde à la structure du réseau de neurones. Les données traversent la puce comme l'eau dans des tuyaux, sans aucun surcoût. Cela offre une latence ultra-faible (microsecondes) et une efficacité énergétique extrême.

« The Dweve Philosophy: Run Everywhere » devient concret lorsque les couches de contrôle sont visibles.

Résilience stratégique et souveraineté

Pour nos clients (en particulier les gouvernements, les agences de défense et les fournisseurs d'infrastructures critiques), cette agnosticité matérielle est une fonctionnalité décisive.

Cela signifie qu'ils ne sont pas prisonniers des sanctions. Si une crise géopolitique coupe l'accès aux puces américaines, ils peuvent exécuter leurs modèles Dweve sur des puces européennes ou sur du silicium hérité largement disponible. Ils ont un « plan B ».

Cela signifie qu'ils ont un pouvoir de négociation. Ils ne sont pas à la merci des caprices tarifaires d'un seul fournisseur. Si NVIDIA augmente ses prix, ils peuvent passer à AMD ou à des ASIC spécialisés sans réécrire leur logiciel.

Cela signifie aussi la longévité. Un NVIDIA H100 sera obsolète dans 3 ans. Dans les environnements industriels (trains, usines, centrales électriques), les équipements doivent durer 20 ans. Un FPGA générique ou un processeur standard restera utilisable pendant des décennies. Nous créons des logiciels qui respectent le cycle de vie du monde physique.

« Strategic Resilience and Sovereignty » est une boucle : observer, choisir, agir, puis tester à nouveau.

L'ère post-GPU

Nous pensons que la domination du GPU à usage général (GPGPU) pour l'IA est une anomalie historique. C'était le bon outil pour la phase de prototypage de l'IA, car il était flexible et disponible. Mais à mesure que l'IA entre dans la phase de déploiement, nous assisterons à une explosion cambrienne de matériel spécialisé.

Nous verrons le calcul analogique. Le calcul optique. Le calcul neuromorphique. Le calcul en mémoire. Ces architectures sont toutes fondamentalement incompatibles avec CUDA. Elles nécessitent une nouvelle pile logicielle.

En découplant notre logiciel du monopole matériel aujourd'hui, Dweve est préparé pour demain. Nous ne construisons pas seulement pour les puces de 2025 ; nous construisons pour la physique de 2035.

Vous voulez une IA qui fonctionne selon vos conditions, pas celles de NVIDIA ? L'architecture indépendante du matériel de Dweve vous offre une liberté stratégique, une maîtrise des coûts et une résilience souveraine. Contactez-nous pour découvrir comment nos réseaux de neurones binaires peuvent fonctionner sur le matériel que vous possédez déjà, ou sur le silicium ouvert de demain.