Ena platforma, 1.930 algoritmov, vsi backendi: kako smo zgradili celoten sklad za diskretno umetno inteligenco

Vaš razvojni sklad za umetno inteligenco je pokvarjen. PyTorch za raziskave, TensorFlow za uvajanje, CUDA za NVIDIA, ROCm za AMD, ločena orodja za mobilne...

Ena platforma, 1.930 algoritmov, vsi backendi: kako smo zgradili celoten sklad za diskretno umetno inteligenco

Problem razdrobljenosti

Vaše razvojno okolje za umetno inteligenco je razdrobljeno.

Prototipe izdelujete v PyTorchu, ker ga raziskovalci preferirajo. Uvajate s TensorFlowom, ker produkcijske ekipe želijo Googlova orodja. Pišete CUDA jedra za NVIDIA grafične procesorje. Prenesete na ROCm za AMD strojno opremo. Vse prepišete za mobilne naprave s TensorFlow Lite ali Core ML. Uporabljate ONNX za pretvorbo med ogrodji ter upate, da se nič ne pokvari. Vzdržujete ločene zbirke kode za oblak, rob in brskalnik.

Deset različnih orodij. Na tisoče odvisnosti. Nočne more z združljivostjo različic. Prekinitvene spremembe v vsakem ciklu izdaje.

Posodobite PyTorch? Upajte, da se vaša različica CUDA ujema. Želite uvajati na AMD? Prepišite svoja jedra. Potrebujete sklepanje v brskalniku? Začnite znova z WebAssembly. Prehajate z NVIDIA na AMD grafične procesorje? Vso srečo pri prenosu te zbirke kode. Uvajate na FPGA? Naučite se povsem drugega orodnega niza.

Ta razdrobljenost ni naključje. Je naravni rezultat tega, da vsako ogrodje optimizira za svoj specifični primer uporabe, medtem ko ignorira medsebojno združljivost. PyTorch odlično deluje pri raziskavah, a uvajanje obravnava kot naknadno misel. TensorFlow cilja na produkcijo, a raziskovalna izkušnja je boleča. CUDA vas zaklene na NVIDIA strojno opremo. Vsako orodje reši en problem, medtem ko ustvari tri nove.

Obstaja boljša pot.

Dweve Core: Celovita platforma za diskretno umetno inteligenco

Dweve Core je enotna platforma za gradnjo diskretnih nevronskih mrež z natančnostjo od binarne do 8-bitne. Ni še eno ogrodje. Je popolna zamenjava za vaš razdrobljeni sklad.

Ena namestitev. En API. Ena zbirka kode. Samodejno uvajanje na CPU, GPU, FPGA, WebAssembly, kamor koli morate zagnati.

Evo, kaj pomeni popolno:

1.930 algoritmov, ki pokrivajo vsako operacijo, ki jo potrebujete:

  • 415 primitivov: Atomske operacije, kot so XNOR, popcount, manipulacija bitov, kvantizacija, pretvorba med formati
  • 500 jeder: Optimizirane sestavljene operacije za pogoste vzorce
  • 191 plasti: Popolni gradniki nevronskih mrež (konvolucija, gosta plast, normalizacija, aktivacija, pozornost)
  • 674 algoritmov: Visokoravenjske metode, vključno s transformacijami, postopki učenja, evolucijskim iskanjem, destilacijo znanja
  • 30 pripomočkov za interoperabilnost: Neobvezni mostovi s plavajočo vejico za hibridne pristope
  • 120 arhitektur modelov: Vnaprej optimizirane predloge mrež od ResNet do Transformer

To ni podmnožica. To je matematična popolnost. Analizirali smo vsako pomembno arhitekturo nevronskih mrež in zgradili vsako operacijo, ki jo potrebujejo, optimizirano za diskretno računanje iz prvih principov.

6 zaledij s samodejnim prevajanjem:

  • SIMD CPU: Ročno optimizirana jedra za x86 in ARM s samodejnim zaznavanjem ISA (SSE2, AVX2, AVX-512, NEON, SVE/SVE2)
  • CUDA: Optimizacija za NVIDIA GPU z primitivi na ravni niti in uporabo Tensor Cores
  • Rust-HDL: Neposredna sinteza FPGA in ASIC iz opisov algoritmov
  • WebAssembly: Sklepanje v brskalniku s podporo SIMD128 za obdelavo na napravi, skladno z GDPR
  • ROCm: Optimizacija za AMD GPU z operacijami na ravni wavefront
  • Metal: Optimizacija za Apple Silicon z uporabo enotnega pomnilniškega arhitektura

6 širin bitov s prilagodljivo natančnostjo:

  • Binarno (1-bit): največja učinkovitost s 16-kratno kompresijo v primerjavi s FP16
  • Ternarno: {-1, 0, +1} z izrecno redkostjo
  • 2-bitno: štiri ravni za uravnoteženo kompresijo
  • 3-bitno: osem ravni za plasti, občutljive na kakovost
  • 4-bitno: šestnajst ravni, ki se približajo kakovosti FP16
  • 8-bitno: skoraj polna natančnost za kritične operacije

Platforma med učenjem prek izbire na podlagi gradientov spozna optimalno bitno širino za vsako plast. Ne hevristike. Ne ugibanje. Dejanska optimizacija, ki temelji na tem, kako natančnost izboljšuje dodana ločljivost.

Adaptive Multi-Bit Quantization: Layer-specific precision allocation
Sklad 1.930 algoritmov ni ohlapen seznam funkcij; je urejena zbirka primitivov, jeder, plasti, metod, mostov in predlog modelov.

Zapiši enkrat, zaženi povsod

Platforma uporablja deklarativni API v Rustu. Opisete, kaj želite, prevajalnik pa ugotovi, kako to optimalno izvesti na vaši ciljni strojni opremi.

Primer definicije omrežja:

let model = NetworkBuilder::new()
    .input(BinaryTensor::new([1024, 784]))
    .dense(784, 512, activation=BinaryActivation::Sign)
    .dense(512, 256, activation=BinaryActivation::Sign)
    .output(256, 10)
    .build();

To je vse. To zapišete enkrat, prevajalnik pa samodejno ustvari optimizirane izvedbe za vsako zaledje.

Ceviewna cevovod deluje na štirih ravneh:

Raven 1: IR nevronskega omrežja - Vaš opis omrežja na visoki ravni se razčleni v računski graf z operacijami, podatkovnim tokom in hiperparametri.

Raven 2: Optimizacija grafa - Standardni prevajalski prehodi odstranijo mrtvo kodo, združijo konstante, odpravijo podvojene izraze in združijo zaporedne operacije. Gosta plast, ki ji sledita paketna normalizacija in aktivacija, postane eno združeno jedro, ki vhod naloži enkrat in ustvari končni izhod.

Raven 3: Narečje BitOps - Graf se spusti na bitne operacije, izrecno tipizirane z natančnostjo. Ta vmesna predstavitev je neodvisna od strojne opreme, a blizu dejanskim strojnim operacijam. Zgrajena na infrastrukturi MLIR (Multi-Level Intermediate Representation) za industrijsko optimizacijo.

Raven 4: Spust na strojno opremo - Končno generiranje kode ustvari izvedbe, specifične za platformo. Za AVX-512 bitne operacije postanejo navodila VPXORQ in VPOPCNTQ. Za CUDA postanejo intrinsiki na ravni niti s poravnanim dostopom do pomnilnika. Za FPGA postanejo vrata XNOR in seštevalna drevesa, sintetizirana v Verilog.

Write once, deploy everywhere with optimal performance

Ista izvorna koda med razvojem teče na procesorju vašega prenosnika, v produkciji se namesti na oblačne GPE in se prevede za FPGA za deterministično sklepanje v realnem času. Brez prevajanja. Brez prenašanja. Brez kode, specifične za platformo.

Zgrajeno za stranke, da gradijo z njim

Dweve Core poganja Dweve Loom, naš sistem za sklepanje na podlagi omejitev. A ni samo za nas. Je popolna platforma za vsakogar, ki gradi diskretna nevronska omrežja.

You can build:

  • Custom architectures using the 191 layer types and 674 algorithms
  • Domain-specific models optimized for your exact requirements
  • Hybrid approaches mixing discrete and continuous computation via the 30 interop utilities
  • Novel training methods using evolutionary search, knowledge distillation, or custom gradient estimators

The platform provides:

Complete training infrastructure: Six straight-through estimator variants for binary/ternary gradient flow. Binary-aware optimizers that maintain full-precision weights internally while binarizing for forward passes. Automatic bit-width selection through gradient-based optimization. Progressive multi-stage distillation from FP32 through INT8, INT4, ternary, to binary.

Automatic hardware optimization: Runtime detection of CPU capabilities (CPUID on x86, system registers on ARM) and automatic dispatch to fastest available SIMD implementation. GPU kernel variants selected based on warp size, shared memory, and register count. FPGA synthesis with automatic pipeline register insertion based on timing constraints.

Flexible quantization: Symmetric and asymmetric quantization with per-tensor, per-channel, or per-group scales. Dynamic quantization with runtime range detection or static quantization with pre-computed scales from calibration data. MSE-optimal and KL-divergence-based scale computation for minimal accuracy loss.

The customer writes one model while the compiler routes it into CPU, GPU, FPGA, browser, AMD, and Apple targets.

Why discrete computation matters

Traditional neural networks compute everything in 16-bit or 32-bit floating point, then make discrete decisions at the end. We operate directly in discrete space from binary to 8-bit, eliminating intermediate continuous computation.

This isn't simple quantization of existing models. The framework is architected from first principles around discrete operations:

Hardware reality: Modern processors consist of billions of transistors in two states. An XNOR gate requires 6 transistors. A 32-bit floating-point multiplier requires thousands and consumes orders of magnitude more energy. Discrete operations align with hardware fundamentals.

Memory efficiency: Binary weights pack 64 values per 64-bit word. A ResNet-50 with 25.6 million parameters occupies 3.1MB in binary versus 50MB in FP16. The entire model fits in CPU L3 cache (typical: 36-64MB). You become compute-bound instead of memory-bound.

Deployment flexibility: Small models enable on-device inference. No cloud dependency. No network latency. No data privacy concerns. Process sensitive information entirely on user devices without ever transmitting to servers.

The complete algorithm matrix

The platform provides comprehensive coverage across three dimensions: algorithms, backends, and bit-widths.

Fundamental operations (415 primitives):

  • 46 bitnih operacij: logična vrata, manipulacija, premiki, štetje, iskanje
  • 16 operacij s polji: izvleček, vstavljanje, pakiranje, razprševanje, zbiranje, ustvarjanje mask
  • 25 redukcij: logični AND/OR/XOR, aritmetična vsota/produkt, glasovanje in soglasje
  • 17 mer razdalje: Hammingova, Jaccardova, Dice, Tanimoto, kosinusna, Manhattanska, Evklidska
  • 12 operacij prepletanja: 2- do 4-smerno prepletanje, Mortonove in Hilbertove krivulje za zapolnjevanje prostora
  • 44 aritmetičnih operacij: seštevanje, odštevanje, množenje, deljenje, operacije s fiksno vejico
  • 39 transformacij: Walsh-Hadamardova, FFT, DCT, NTT, valčki (Haar, Daubechies, CDF97)
  • 11 zgoščevalnih funkcij: SHA-256, Blake3, xxHash, MinHash, SimHash, zgoščevanje, občutljivo na lokalnost
  • 22 generatorjev naključnih števil: LFSR, Mersenne Twister, ChaCha20, Sobolova zaporedja
  • 15 kvantizacij: simetrična, asimetrična, po tenzorju, po kanalu, izračun merila
  • 30 binarnih matematičnih operacij: XNOR-popcount, ternarno kodiranje, posodobitve uteži, operacije z gradienti
  • 48 pretvorb formatov: pretvorbe FP32/FP16/FP8/INT8/INT4/INT2 v vseh smereh
  • 42 operacij s fiksno vejico: aritmetika, transcendentne funkcije, nasičenje pri vseh širinah bitov

Sestavljene operacije (500 jeder):

Optimizirana jedra, ki združujejo primitive za pogoste vzorce. Različice množenja matrik (standardno, transponirano, blokovno). Vrste konvolucij (2D, 3D, globinske, grupirane, razširjene). Normalizacija (paketna, plastna, grupna, instančna). Aktivacijske funkcije (znak, trdi tanh, delno linearna). Mehanizmi pozornosti (samo-pozornost, navzkrižna pozornost, z več glavami). Združevanje (maksimalno, povprečno, stohastično).

Mrežne plasti (191 plasti):

Popolni gradniki za sestavljanje mrež. Goste plasti z binarnimi, ternarnimi in večbitnimi utežmi. Konvolucijske plasti z vsemi pogostimi različicami. Ponavljajoče se plasti (LSTM, GRU z binarnimi vrati). Plast pozornosti (skalirani pikčasti produkt, z več glavami, relativni položaj). Normalizacijske plasti s statistiko paketov in naučenimi parametri. Preostale povezave z usklajevanjem dimenzij.

Algoritmi na visoki ravni (674 algoritmov):

Popolne metode za usposabljanje, sklepanje in optimizacijo. Destilacija znanja s postopnim večstopenjskim izboljševanjem. Evolucijsko odkrivanje omejitev z genetskim programiranjem. Iskanje arhitekture nevronskih mrež za diskretne mreže. Ocene gradientov (neposredne, obrezane, prilagodljive, z zagonom, s hiperomrežjem). Optimizatorji (BinaryAdam, TernaryAdam, prilagodljiva kvantizacija). Porazdeljeno usposabljanje z agregacijo, odporno na bizantinske napake.

Diskretno računanje je pomembno, ker natančnost postane proračun po plasteh namesto privzete plavajoče vejice povsod.

Globina implementacije zaledja

Vsak algoritem obstaja v več optimiziranih različicah za vsako zaledje. Ne gre za generične implementacije. Koda, specifična za strojno opremo, ki izkorišča vsako arhitekturno funkcijo.

CPU SIMD: SSE2 zagotavlja univerzalno združljivost z x86-64 (vsak procesor od leta 2001). AVX2 prinaša 4-8× pospešek na Haswellu in novejših (2013+). AVX-512 doseže 10-16× z registri mask za predikacijo in VPTERNLOG za poljubno 3-vhodno logično funkcijo. NEON prinaša 3-4× pospešek vsem procesorjem ARMv8, vključno z mobilnimi in Apple Silicon. SVE/SVE2 zagotavlja kodo, neodvisno od dolžine vektorjev, ki samodejno izkorišča širše vektorje na novejši strojni opremi.

CUDA: Primitivi na ravni warpov organizirajo 32 niti, ki izvajajo usklajeno. Vsaka nit obdela 32 binarnih vrednosti, zapakiranih v uint32. Celoten warp vzporedno obdela 1.024 binarnih vrednosti. Strojne intrinsike vključujejo __popc za štetje populacije, __ballot_sync za glasovanje warpov in __shfl_sync za hitro komunikacijo brez deljene pomnilnika. Združen dostop do pomnilnika zagotavlja izkoriščenost pasovne širine. Uporaba Tensor Core za matrične operacije tudi z binarnimi podatki.

Rust-HDL: Neposredna strojna sinteza iz opremljenega Rust koda. Ogrodje samodejno generira Verilog/VHDL. Binarne XNOR-popcount operacije se preslikajo v XNOR vrata (kombinatorična logika, nič zakasnitve širjenja) ter seštevalna drevesa. Pipeline registri se vstavijo samodejno na podlagi časovnih omejitev. Sinteza za FPGA (Xilinx, Intel) in ASIC.

WebAssembly: SIMD128 zagotavlja 128-bitne vektorske operacije v vseh sodobnih brskalnikih (Chrome 91+, Firefox 89+, Safari 16.4+). Operacije vključujejo v128.and/or/xor za bitno logiko in i8x16.popcnt za štetje populacije. V kombinaciji z Web Workers za večnitnost in SharedArrayBuffer za deljeni pomnilnik dosega 60-80 % zmogljivosti domačega CPU. Obdelava v brskalniku na napravi omogoča skladnost z GDPR brez nalaganja na strežnik.

ROCm: Optimizacija na ravni wavefrontov za AMD arhitekture s 64 nitmi na wavefront (dvakrat več kot NVIDIA-inih 32). Vsaka nit obdela 32 binarnih vrednosti, kar pomeni 2.048 vrednosti na wavefront. Podobne intrinsike kot CUDA z __builtin_popcount, __ballot in ds_swizzle. Programski model je dovolj podoben, da lahko razvijalci CUDA takoj pišejo ROCm kodo.

Metal: Optimizacija za Apple Silicon z uporabo poenotene pomnilniške arhitekture, kjer CPU in GPU delita fizični RAM s koherenco predpomnilnika. Odpravlja stroške kopiranja podatkov. Binarne operacije izkoriščajo Appleova lastna matrična jedra. M3 Max Neural Engine dosega 50-80 TOPS pri binarni inferenci z uporabo namenskih pospeševalnikov, vgrajenih v SoC.

Česa ne delamo (in zakaj je osredotočenost pomembna)

Pomembno je pojasniti: ne delamo vsega. Osredotočenost omogoča odličnost.

Brez inferenc s plavajočo vejico: Izključno diskretno računanje od binarnega do 8-bitnega. Če potrebujete FP32/FP16/BFloat16 za uvajanje, namesto tega uporabite PyTorch ali JAX. Optimiziramo izključno za diskretne operacije, kar omogoča specializacije, ki so nemogoče z mešano plavajočo vejico. Ne morete biti odlični v vsem. Izbrali smo diskretno umetno inteligenco in optimizirali brez milosti.

Brez dinamičnih inferenčnih grafov: Modeli se za uvajanje prevedejo v statične grafe. Usposabljanje podpira dinamično računanje (nujno za raziskovalno prilagodljivost), vendar je produkcijska inferenca statična. To omogoča optimizacijo vnaprej: fuzijo jeder v celotnem omrežju, optimizacijo razporeditve pomnilnika z znanimi oblikami tenzorjev in vstavljanje navodil za predhodno nalaganje s predvidljivimi vzorci dostopa.

Osredotočena priprava podatkov: Zagotavljamo 8 specializiranih algoritmov za pripravo vhodov nevronskih mrež (normalizacija, prilagodljivo skaliranje, naučena kvantizacija, binarna augmentacija), ne pa splošnonamenskega ETL. Za cevovode inženiringa značilk in nalaganje podatkov uporabite obstoječa orodja (Pandas, Polars, DuckDB). Odlični smo pri inferenci diskretnih nevronskih mrež od binarnega do 8-bitnega. Ne nadomeščamo vašega celotnega podatkovnega sklada.

To niso omejitve. To je osredotočenost. Z omejitvijo obsega na diskretne nevronske mreže s statičnimi inferenčnimi grafi dosegamo globino optimizacije, ki je celovita ogrodja ne morejo doseči.

Gradnja na Dweve Core

Platforma je pripravljena za uporabo. Diskretne nevronske mreže lahko začnete graditi že danes.

Celotno orodje:

  • Deklarativni API: Rust DSL z NetworkBuilder za definicijo modela
  • Infrastruktura prevajalnika: cevovod optimizacije na osnovi MLIR s štirimi ravnmi IR
  • Ogrodje za usposabljanje: šest različic STE, optimizatorji, ki upoštevajo binarne vrednosti, samodejna izbira širine bitov
  • Generatorji kode za zaledje: C z intrinsiki za CPU, jedra CUDA/HIP za GPU, Verilog za FPGA
  • Orodja za uvajanje: izvoz v ONNX, Core ML, TensorFlow Lite ali samostojne binarne datoteke

Primer poteka dela:

1. Določite svoje omrežje z NetworkBuilder
2. Usposabljajte z optimizatorji, ki upoštevajo binarne vrednosti, in s prilagodljivo izbiro širine bitov
3. Prevedite za ciljno strojno opremo s samodejno izbiro zaledja
4. Uvedite kot optimizirano binarno datoteko ali izvozite v standardno obliko
5. Zaženite kjer koli: v oblačnih strežnikih, na robnih napravah, v brskalnikih, na FPGA

Ena platforma. Ena zbirka kode. Vsako zaledje. Popolna diskretna umetna inteligenca.

Nehajte usklajevati deset ogrodij. Nehajte prepisovati kodo za vsako ciljno okolje uvajanja. Nehajte se bojevati z združljivostjo različic. Zgradite enkrat na Dweve Core in uvajajte povsod.


Dweve Core poganja Dweve Loom, naš sistem za sklepanje na podlagi omejitev, ki bo izdan leta 2026. Ogrodje izvaja celoten sklad 1.930 algoritmov na 6 zaledjih s prilagodljivo večbitno kvantizacijo od binarne do 8-bitne. Razvila ga je nizozemska inženirska ekipa v treh letih razvoja.

Gradnja na Dweve Core deluje, ker klop ohranja orodja za nevronska omrežja v notranjosti, splošno razpršeno programsko opremo pa pušča zunaj.