Perché scommettere tutto su NVIDIA è un rischio strategico
La trappola della monocultura
Immagina se il 95% delle auto del mondo potesse funzionare solo con un tipo specifico di benzina venduto da un'unica azienda. Immagina che la raffineria di questa azienda si trovasse su un'isola geologicamente instabile. Immagina che ogni altro produttore di auto dovesse progettare i propri motori per adattarsi a questa specifica miscela di carburante.
Se quell'azienda avesse un problema di produzione, o aumentasse i prezzi del 400%, o se un blocco navale isolasse l'isola, l'economia globale si fermerebbe. I trasporti cesserebbero.
Sembra una finzione distopica, ma è la realtà precisa dell'industria dell'intelligenza artificiale oggi.
Nel 2025, circa il 95% dell'addestramento dell'IA e dell'inferenza ad alte prestazioni avviene su GPU prodotte da un'unica azienda: NVIDIA. L'intero stack globale dell'IA (dai framework PyTorch ai progetti di raffreddamento dei data center) è ottimizzato per l'architettura di NVIDIA. L'industria è dipendente da CUDA, la piattaforma software proprietaria di NVIDIA.
NVIDIA è un'azienda brillante. Hanno costruito una tecnologia incredibile. Ma questa monocultura è un incubo strategico. Crea un punto unico di guasto (SPOF) per l'intero futuro dell'intelligenza umana.
La carenza strutturale
Abbiamo tutti vissuto le carenze di H100 del 2023 e del 2024. Le startup hanno aspettato 12 mesi per l'hardware. I governi hanno accumulato chip come lingotti d'oro. Il prezzo del calcolo computazionale è salito alle stelle.
Non era solo un problema temporaneo della catena di approvvigionamento. Era un collo di bottiglia strutturale. La produzione di questi chip si basa su un processo incredibilmente complesso chiamato packaging avanzato CoWoS (Chip-on-Wafer-on-Substrate), eseguito principalmente da TSMC a Taiwan. La capacità di costruire questi package è limitata. Le leggi della fisica sono limitate.
Se la tua strategia di IA dipende dall'accesso al chip NVIDIA più recente e potente, stai scommettendo la sopravvivenza della tua azienda su una catena di approvvigionamento che non controlli, per un prodotto che viene assegnato al miglior offerente.
Il fossato di CUDA
Il vero lock-in non è l'hardware; è il software. CUDA è il linguaggio dell'IA. Per 15 anni, ricercatori e studenti hanno imparato a scrivere kernel CUDA. Le librerie sono ottimizzate per CUDA. Se provi a eseguire codice IA standard su una scheda AMD o su un acceleratore Intel, spesso entri in un mondo di dolore: dipendenze rotte, kernel mancanti e prestazioni scadenti.
Questo "fossato CUDA" tiene fuori i concorrenti. Garantisce che, anche se AMD costruisse un chip più veloce ed economico (cosa che ha fatto), nessuno lo comprerebbe, perché il software non funziona "e basta".
La filosofia Dweve: funziona ovunque
In Dweve abbiamo preso una decisione radicale fin dall'inizio. Abbiamo guardato alla trappola di CUDA e abbiamo detto: "No."
Abbiamo deciso che non avremmo scritto una sola riga di CUDA. Non avremmo creato una dipendenza da uno stack hardware proprietario.
Invece, abbiamo costruito il nostro stack su standard aperti. Usiamo Vulkan (l'API grafica che funziona su qualsiasi cosa, dai telefoni Android ai server Linux). Usiamo OpenCL. Usiamo SPIR-V. Ci affidiamo a rappresentazioni intermedie (IR) come MLIR (Multi-Level Intermediate Representation).
Ma il vero ingrediente segreto non è solo l'API: è la matematica.
Poiché le nostre reti neurali binarie (BNN) si basano su semplici operazioni intere (XNOR e POPCNT) anziché su complesse moltiplicazioni di matrici in virgola mobile, non dipendiamo dai cosiddetti "Tensor Core" che solo NVIDIA gestisce bene.
I Tensor Core sono unità hardware specializzate progettate per gestire al meglio i calcoli in virgola mobile a 16 bit. Se il tuo algoritmo si basa su FP16, hai bisogno di un Tensor Core. Se il tuo algoritmo si basa su logica a 1 bit, non ne hai bisogno. Ti servono solo porte logiche digitali di base.
Questa libertà architetturale ci consente di operare in modo efficiente su una straordinaria varietà di hardware:
1. AMD ROCm
Le GPU Instinct di AMD offrono una potenza di calcolo grezza e una larghezza di banda di memoria enormi per ogni dollaro speso. Per i carichi di lavoro in virgola mobile, lo stack software (ROCm) è stato storicamente il punto debole. Ma per i nostri carichi di lavoro binari, compiliamo direttamente in ISA (Instruction Set Architecture). Evitiamo le librerie inaffidabili. Su hardware AMD, i modelli Dweve volano.
2. CPU Intel (AVX-512)
Tutti ignorano la modesta CPU. Ma i moderni processori Intel Xeon hanno un set di istruzioni chiamato AVX-512. Consente alla CPU di elaborare 512 bit di dati in un singolo ciclo. Per una rete neurale binaria, significa 512 neuroni elaborati all'istante. Possiamo eseguire inferenze ad alte prestazioni su server standard che le aziende già possiedono. Nessuna GPU richiesta.
3. RISC-V
RISC-V è l'architettura hardware open source del futuro. È per i chip ciò che Linux è stato per i sistemi operativi. Eseguiamo nativamente su acceleratori RISC-V. Questo è cruciale per l'Europa e per le nazioni in via di sviluppo che vogliono costruire le proprie industrie di chip domestiche, indipendenti dai controlli sulle esportazioni degli Stati Uniti.
4. FPGA (Field Programmable Gate Arrays)
Questa è la frontiera più entusiasmante. Un FPGA è un chip "tela bianca" che può essere riconfigurato in millisecondi. Poiché le nostre reti usano semplici porte logiche, possiamo cablare fisicamente il chip per rispecchiare la struttura della rete neurale. I dati scorrono attraverso il chip come acqua nei tubi, con zero overhead. Questo garantisce latenza ultrabassa (microsecondi) ed estrema efficienza energetica.
Resilienza Strategica e Sovranità
Per i nostri clienti (soprattutto governi, agenzie di difesa e fornitori di infrastrutture critiche) questo agnosticismo hardware è una caratteristica vincente.
Significa che non sono bloccati dalle sanzioni. Se una crisi geopolitica interrompe l'accesso ai chip americani, possono eseguire i loro modelli Dweve su chip europei o su silicio legacy ampiamente disponibile. Hanno un "Piano B".
Significa che hanno potere negoziale. Non sono soggetti ai capricci dei prezzi di un singolo fornitore. Se NVIDIA alza i prezzi, possono passare ad AMD o a ASIC specializzati senza riscrivere il loro software.
Significa anche longevità. Una NVIDIA H100 sarà obsoleta in 3 anni. In contesti industriali (treni, fabbriche, centrali elettriche) le apparecchiature devono durare 20 anni. Un FPGA generico o una CPU standard saranno utilizzabili per decenni. Costruiamo software che rispetta il ciclo di vita del mondo fisico.
L'era post-GPU
Crediamo che il dominio della GPU per uso generale (GPGPU) nell'AI sia un'anomalia storica. È stato lo strumento giusto per la fase di prototipazione dell'AI, perché era flessibile e disponibile. Ma mentre l'AI entra nella fase di implementazione, assisteremo a un'esplosione cambriana di hardware specializzato.
Vedremo il calcolo analogico. Il calcolo ottico. Il calcolo neuromorfico. Il calcolo in memoria. Queste architetture sono tutte fondamentalmente incompatibili con CUDA. Richiedono un nuovo stack software.
Separando il nostro software dal monopolio hardware di oggi, Dweve è a prova di futuro per domani. Non stiamo costruendo solo per i chip del 2025; stiamo costruendo per la fisica del 2035.
Vuoi un'AI che funzioni alle tue condizioni, non a quelle di NVIDIA? L'architettura hardware-agnostica di Dweve ti offre libertà strategica, controllo dei costi e resilienza sovrana. Contattaci per scoprire come le nostre reti neurali binarie possono funzionare sull'hardware che già possiedi, o sul silicio aperto di domani.