Laitteistoriippumattomuus: Miksi kaiken panostaminen NVIDIAan on strateginen riski

Maailma on riippuvainen CUDA:sta. Mutta yhden toimittajan toimitusketju on yksi piste, jossa kaikki voi kaatua. Siksi Dweve toimii millä tahansa: AMD,...

Laitteistoriippumattomuus: Miksi kaiken panostaminen NVIDIAan on strateginen riski

Monokulttuurin ansa

Kuvittele, että 95 % maailman autoista voisi kulkea vain tietyntyyppisellä bensiinillä, jota myy täsmälleen yksi yritys. Kuvittele, että tämän yrityksen jalostamo sijaitsisi geologisesti epävakaalla saarella. Kuvittele, että jokaisen muun autonvalmistajan olisi suunniteltava moottorinsa vastaamaan tätä tiettyä polttoaineseosta.

Jos yrityksellä olisi tuotantohäiriö, se nostaisi hintoja 400 %, tai jos saarto katkaisisi yhteydet saarelle, maailmantalouden pyörät pysähtyisivät. Liikenne lakkaisi.

Tämä kuulostaa dystooppiselta fiktiolta, mutta se on täsmälleen tekoälyteollisuuden todellisuus tänään.

Vuonna 2025 noin 95 % tekoälyn koulutuksesta ja huippuluokan päätelmistä tapahtuu yhden yrityksen, NVIDIA:n, valmistamilla GPU:illa. Koko globaali tekoälypino (PyTorch-kehyksistä datakeskusten jäähdytyssuunnitteluun) on optimoitu NVIDIA:n arkkitehtuurille. Ala on riippuvainen CUDA:sta, NVIDIA:n omasta ohjelmistoalustasta.

NVIDIA on loistava yritys. He rakensivat uskomatonta teknologiaa. Mutta tämä monokulttuuri on strateginen painajainen. Se luo yhden vikapisteen (SPOF) koko ihmisälyn tulevaisuudelle.

Tekoälylaitteistomarkkinat: Monokulttuuri vs. monimuotoisuusNykyinen toimiala (NVIDIA-lukkiutuma)95%NVIDIA CUDAYksi piste, jossa kaikki voi kaatuaToimitusketju, hinnoittelu, vientivalvontaDweven lähestymistapa (valmistajariippumaton)AMDIntelRISC-VFPGACPUStrateginen sietokykyValmistajan valinta, hintaneuvottelu, suvereniteettiBinaariset neuroverkot eivät tarvitse Tensor Coreja: ne toimivat perusdigitaalilogiikalla
The Monoculture Trap -osiossa kuvatut riskit muuttuvat hallittaviksi, kun niillä on nimet ja omistajat.

Rakenteellinen pula

Olemme kaikki eläneet vuosien 2023 ja 2024 H100-pulasta. Startupit odottivat laitteistoja 12 kuukautta. Hallitukset hamstrasivat siruja kuin kultaharkkoja. Laskennan hinta nousi pilviin.

Tämä ei ollut vain väliaikainen toimitusketjun häiriö. Se oli rakenteellinen pullonkaula. Näiden sirujen valmistus perustuu uskomattoman monimutkaiseen prosessiin, jota kutsutaan CoWoS (Chip-on-Wafer-on-Substrate) -edistyneeksi pakkaamiseksi, ja jota tekee pääasiassa TSMC Taiwanissa. Näiden pakettien valmistuskapasiteetti on rajallinen. Fysiikan lait ovat rajallisia.

Jos tekoälystrategiasi perustuu siihen, että saat käyttöösi uusimman ja parhaan NVIDIA-sirun, lyöt vetoa yrityksesi selviytymisestä toimitusketjun varassa, jota et hallitse, tuotteen varassa, joka huutokaupataan korkeimmalle tarjoajalle.

The Structural Shortage -osion kompromissi määrittää, missä arvo katoaa tai hallinta palaa.

CUDA-vallihauta

Varsinainen lukkiutuma ei ole laitteisto vaan ohjelmisto. CUDA on tekoälyn kieli. Tutkijat ja opiskelijat ovat 15 vuoden ajan oppineet kirjoittamaan CUDA-ytimiä. Kirjastot on optimoitu CUDA:lle. Jos yrität ajaa tavallista tekoälykoodia AMD-kortilla tai Intel-kiihdyttimellä, joudut usein tuskan maailmaan: rikkinäisiä riippuvuuksia, puuttuvia ytimiä ja heikkoa suorituskykyä.

Tämä "CUDA-vallihauta" pitää kilpailijat ulkona. Se varmistaa, että vaikka AMD rakentaisikin sirun, joka on nopeampi ja halvempi (kuten se on tehnyt), kukaan ei osta sitä, koska ohjelmisto ei vain "toimi".

Dweven filosofia: Toimii kaikkialla

Meillä Dwevessä teimme radikaalin päätöksen jo varhain. Katsoimme CUDA-ansaa ja sanoimme: "Ei."

Päätimme, että emme kirjoittaisi yhtäkään riviä CUDAa. Emme ottaisi riippuvuutta omistettuun laitteistopinoon.

Sen sijaan rakensimme pinomme avoimien standardien varaan. Käytämme Vulkania (grafiikkarajapinta, joka toimii kaikessa Android-puhelimista Linux-palvelimiin). Käytämme OpenCL:ää. Käytämme SPIR-V:tä. Luotamme välitysesityksiin (IR), kuten MLIR:ään (Multi-Level Intermediate Representation).

Mutta todellinen salainen kastike ei ole pelkkä rajapinta; se on matematiikka.

Miksi binääriset neuroverkot murtavat CUDA-sitoutumisenPerinteinen syväoppiminenFP16/FP32-matriisikertolaskuVaatii: Tensor Core -ytimetVain NVIDIA hoitaa nämä hyvinBinääriset neuroverkot1-bittiset XNOR- ja POPCNT-operaatiotVaatii: PerusdigitaalilogiikkaaSaatavilla KAIKESSA laitteistossaDweven laitteistokohteetAMD ROCmSuora ISA-käännösParas hinta/tehoIntel AVX-512512 neuronia/sykliEi GPU:ta tarvitaRISC-VAvoimen lähdekoodin piiEurooppalainen omavaraisuusFPGAμs viiveÄärimmäinen tehokkuus

Koska binääriset neuroverkkomme (BNN) perustuvat yksinkertaisiin kokonaislukuoperaatioihin (XNOR ja POPCNT) monimutkaisten liukulukumatriisikertolaskujen sijaan, emme ole riippuvaisia tietyistä "Tensor Core" -ytimistä, jotka vain NVIDIA osaa hyvin.

Tensor Core -ytimet ovat erikoistuneita laitteistoyksiköitä, jotka on suunniteltu murskaamaan 16-bittistä liukulukumatematiikkaa. Jos algoritmisi perustuu FP16:een, tarvitset Tensor Core -ytimen. Jos algoritmisi perustuu 1-bittiseen logiikkaan, et tarvitse. Tarvitset vain perusdigitaalilogiikkaportteja.

Tämä arkkitehtoninen vapaus mahdollistaa tehokkaan toiminnan hämmästyttävän monipuolisella laitteistolla:

1. AMD ROCm

AMD:n Instinct-näytönohjaimet tarjoavat valtavan raakalaskentatehon ja muistikaistan jokaista dollaria kohden. Liukulukukuormille ohjelmistopino (ROCm) on ollut historiallisesti heikko lenkki. Mutta binäärisille kuormillemme käännämme suoraan ISA:ksi (Instruction Set Architecture). Kierrämme epävakaat kirjastot. AMD-laitteistolla Dweve-mallit huutavat.

2. Intel-suorittimet (AVX-512)

Kaikki sivuuttavat vaatimattoman suorittimen. Mutta nykyaikaisissa Intel Xeon -prosessoreissa on käskykanta nimeltä AVX-512. Se mahdollistaa suorittimen käsittelevän 512 bittiä dataa yhdessä syklissä. Binääriseen neuroverkkoon se tarkoittaa 512 neuronia käsiteltynä välittömästi. Voimme suorittaa korkean suorituskyvyn päättelyä tavallisilla palvelimilla, jotka yritykset jo omistavat. Näytönohjainta ei tarvita.

3. RISC-V

RISC-V on tulevaisuuden avoimen lähdekoodin laitteistoarkkitehtuuri. Se on siruille sitä, mitä Linux oli käyttöjärjestelmille. Toimimme natiivisti RISC-V-kiihdyttimillä. Tämä on ratkaisevaa Euroopalle ja kehittyville maille, jotka haluavat rakentaa omia kotimaisia piiteollisuudenalojaan riippumattomina Yhdysvaltojen vientivalvonnasta.

4. FPGA-piirit (Field Programmable Gate Arrays)

Tämä on jännittävin rajapinta. FPGA on "tyhjä kangas" -siru, joka voidaan kytkeä uudelleen millisekunneissa. Koska verkkomme käyttävät yksinkertaisia logiikkaportteja, voimme fyysisesti kytkeä sirun vastaamaan neuroverkon rakennetta. Data virtaa sirun läpi kuin vesi putkissa, ilman ylimääräistä kuormitusta. Tämä tuottaa erittäin matalan viiveen (mikrosekunteja) ja äärimmäisen energiatehokkuuden.

"The Dweve Philosophy: Run Everywhere" muuttuu konkreettiseksi, kun ohjauskerrokset ovat näkyvissä.

Strateginen kestävyys ja suvereniteetti

Asiakkaillemme (erityisesti hallituksille, puolustusvirastoille ja kriittisen infrastruktuurin tarjoajille) tämä laitteistoriippumattomuus on ratkaiseva ominaisuus.

Se tarkoittaa, etteivät he ole pakotteiden lukitsemia. Jos geopoliittinen kriisi katkaisee pääsyn amerikkalaisiin siruihin, he voivat ajaa Dweve-mallejaan eurooppalaisilla siruilla tai laajalti saatavilla olevalla vanhemmalla piillä. Heillä on "varasuunnitelma".

Se tarkoittaa, että heillä on neuvotteluvoimaa. He eivät ole yhden toimittajan hinnoittelun oikkujen armoilla. Jos NVIDIA nostaa hintoja, he voivat vaihtaa AMD:hen tai erikoistuneisiin ASIC-piireihin kirjoittamatta ohjelmistoaan uusiksi.

Se tarkoittaa myös pitkäikäisyyttä. NVIDIA H100 vanhenee kolmessa vuodessa. Teollisissa ympäristöissä (junat, tehtaat, voimalaitokset) laitteiden on kestettävä 20 vuotta. Yleiskäyttöinen FPGA tai tavallinen suoritin pysyy käyttökelpoisena vuosikymmeniä. Rakennamme ohjelmistoa, joka kunnioittaa fyysisen maailman elinkaarta.

"Strateginen resilienssi ja suvereniteetti" on silmukka: tarkkaile, valitse, toimi ja testaa uudelleen.

GPGPU-jälkeinen aikakausi

Uskomme, että yleiskäyttöisen GPGPU:n (General Purpose GPU) valta-asema tekoälyssä on historiallinen poikkeama. Se oli oikea työkalu tekoälyn prototyyppivaiheeseen, koska se oli joustava ja saatavilla. Mutta kun tekoäly siirtyy käyttöönottovaiheeseen, tulemme näkemään erikoistuneen laitteiston kambrikäännöksen.

Tulemme näkemään analogista laskentaa. Optista laskentaa. Neuromorfista laskentaa. Muistiin perustuvaa laskentaa. Nämä arkkitehtuurit ovat kaikki pohjimmiltaan yhteensopimattomia CUDA:n kanssa. Ne vaativat uuden ohjelmistopino.

Irrottamalla ohjelmistomme laitteistomonopolista jo tänään, Dweve on tulevaisuudenkestävä huomiselle. Emme rakenna vain vuoden 2025 siruille; rakennamme vuoden 2035 fysiikalle.

Haluatko tekoälyn, joka toimii sinun ehdoillasi, ei NVIDIA:n? Dweven laitteistoriippumaton arkkitehtuuri antaa sinulle strategisen vapauden, kustannushallinnan ja suvereenin resilienssin. Ota yhteyttä ja selvitä, miten binaariset neuroverkkomme voivat toimia laitteistolla, jonka jo omistat, tai huomisen avoimella piillä.