Egy platform, 1 930 algoritmus, minden háttérrendszer: így építettük fel a diszkrét AI teljes stackjét

Az AI-fejlesztési stacked szétesett. PyTorch a kutatáshoz, TensorFlow az élesítéshez, CUDA az NVIDIA-hoz, ROCm az AMD-hez, külön eszközök mobilos, FPGA-s és...

Egy platform, 1 930 algoritmus, minden háttérrendszer: így építettük fel a diszkrét AI teljes stackjét

A fragmentáltság problémája

Az Ön AI-fejlesztői környezete fragmentált.

PyTorch-ban prototipizál, mert a kutatók ezt kedvelik. TensorFlow-val telepít, mert a termelési csapatok a Google eszközeit akarják. CUDA kernelokat ír NVIDIA GPU-khoz. ROCm-re portol AMD hardverekhez. Mindent újraír mobilos környezetre TensorFlow Lite vagy Core ML segítségével. ONNX-et használ a keretrendszerek közötti konverzióhoz, remélve, hogy semmi nem törik el. Külön kódbázisokat tart fenn felhőhöz, élhez és böngészős telepítéshez.

Tíz különböző eszköz. Több ezer függőség. Verziókompatibilitási rémálmok. Törő változások minden kiadási ciklusban.

Frissíti a PyTorch-ot? Remélje, hogy a CUDA-verziója egyezik. AMD-re szeretne telepíteni? Írja újra a kerneljeit. Böngészős következtetésre van szüksége? Kezdje elölről WebAssembly-vel. NVIDIA-ról AMD GPU-kra vált? Sok szerencsét a kódbázis portolásához. FPGA-ra telepít? Tanuljon meg egy teljesen más eszközláncot.

Ez a fragmentáltság nem véletlen. Ez a természetes következménye annak, hogy minden keretrendszer a saját konkrét felhasználási esetére optimalizál, miközben figyelmen kívül hagyja az együttműködést. A PyTorch kiváló a kutatásban, de a telepítést utólagos gondolatként kezeli. A TensorFlow a termelést célozza, de a kutatási élmény fájdalmas. A CUDA az NVIDIA hardveréhez láncolja Önt. Minden eszköz egy problémát old meg, miközben három továbbit hoz létre.

Van jobb út is.

Dweve Core: A teljes platform a diszkrét AI-hoz

A Dweve Core egy egységes platform diszkrét neurális hálózatok építéséhez bináris és 8 bites pontosság között. Ez nem egy újabb keretrendszer. Ez a fragmentált stack teljes helyettesítője.

Egy telepítés. Egy API. Egy kódbázis. Automatikus telepítés CPU-ra, GPU-ra, FPGA-ra, WebAssembly-re, bárhová, ahol futtatnia kell.

Íme, mit jelent a teljes:

1 930 algoritmus, amely lefedi minden műveletet, amire szüksége van:

  • 415 primitív: Atomos műveletek, mint az XNOR, popcount, bitmanipuláció, kvantálás, konverzió formátumok között
  • 500 kernel: Optimalizált összetett műveletek gyakori mintákhoz
  • 191 réteg: Teljes neurális hálózati építőelemek (konvolúció, sűrű, normalizáció, aktiváció, figyelem)
  • 674 algoritmus: Magas szintű módszerek, beleértve a transzformációkat, tanítási eljárásokat, evolúciós keresést, tudásdesztillációt
  • 30 interop segédprogram: Opcionális lebegőpontos hidak hibrid megközelítésekhez
  • 120 modellarchitektúra: Előre optimalizált hálózati sablonok a ResNet-ektől a Transformer-ekig

Ez nem egy részhalmaz. Ez matematikai teljesség. Elemeztünk minden jelentős neurális hálózati architektúrát, és felépítettünk minden műveletet, amelyre szükségük van, diszkrét számításra optimalizálva az első elvekből.

6 háttérrendszer automatikus fordítással:

  • SIMD CPU: Kézzel optimalizált kernelek x86-hoz és ARM-hez automatikus ISA-felismeréssel (SSE2, AVX2, AVX-512, NEON, SVE/SVE2)
  • CUDA: NVIDIA GPU-optimalizálás warp-szintű primitívekkel és Tensor Core kihasználással
  • Rust-HDL: Közvetlen FPGA- és ASIC-szintézis algoritmusleírásokból
  • WebAssembly: Böngészőalapú következtetés SIMD128 támogatással GDPR-kompatibilis eszközön történő feldolgozáshoz
  • ROCm: AMD GPU-optimalizálás wavefront-szintű műveletekkel
  • Metal: Apple Silicon-optimalizálás egységes memóriaarchitektúra használatával

6 bitszélesség adaptív pontossággal:

  • Bináris (1 bites): Maximális hatékonyság, 16-szoros tömörítés az FP16-hoz képest
  • Háromértékű: {-1, 0, +1} explicit ritkasággal
  • 2 bites: Négy szint a kiegyensúlyozott tömörítéshez
  • 3 bites: Nyolc szint a minőségérzékeny rétegekhez
  • 4 bites: Tizenhat szint, megközelítve az FP16 minőségét
  • 8 bites: Közel teljes pontosság a kritikus műveletekhez

A platform a képzés során, gradiens alapú kiválasztással tanulja meg az optimális bitszélességet rétegenként. Nem heurisztika. Nem találgatás. Valódi optimalizálás azon az elven, hogy a pontosság hogyan javul a nagyobb felbontással.

Adaptív többbites kvantálás: rétegspecifikus pontossági allokáció
Az 1 930 algoritmusból álló verem nem laza funkciólista; hanem primitívek, kernelek, rétegek, metódusok, hidak és modellsablonok rendezett szekrénye.

Írd meg egyszer, futtasd bárhol

A platform deklaratív Rust API-t használ. Leírod, mit szeretnél, a fordító pedig kitalálja, hogyan futtassa optimálisan a célhardveren.

Példa hálózatdefiníció:

let model = NetworkBuilder::new()
    .input(BinaryTensor::new([1024, 784]))
    .dense(784, 512, activation=BinaryActivation::Sign)
    .dense(512, 256, activation=BinaryActivation::Sign)
    .output(256, 10)
    .build();

Ennyi. Írd meg egyszer, és a fordító automatikusan optimalizált implementációkat generál minden háttérrendszerhez.

A fordítási folyamat négy szinten keresztül működik:

1. szint: Neurális hálózati IR - A magas szintű hálózatleírásod számítási gráffá elemződik, műveletekkel, adatfolyammal és hiperparaméterekkel.

2. szint: Gráfoptimalizálás - A szabványos fordítói lépések eltávolítják a holt kódot, összevonják a konstansokat, deduplikálják a kifejezéseket, és egyesítik a szekvenciális műveleteket. A sűrű réteget, amelyet batch normalizáció és aktiváció követ, egyetlen egyesített kernel váltja fel, amely egyszer tölti be a bemenetet, és közvetlenül a végső kimenetet állítja elő.

3. szint: BitOps dialektus - A gráf bitszintű műveletekre redukálódik, explicit pontossági típusokkal. Ez a köztes reprezentáció hardverfüggetlen, de közel áll a tényleges gépi műveletekhez. Az MLIR (Multi-Level Intermediate Representation) infrastruktúrára épül az ipari szintű optimalizáció érdekében.

4. szint: Hardverre történő leszállítás - A végső kódgenerálás platformspecifikus implementációkat hoz létre. AVX-512 esetén a bitműveletek VPXORQ és VPOPCNTQ utasításokká válnak. CUDA esetén warp-szintű intrinsicekké válnak, koherens memóriaeléréssel. FPGA esetén XNOR kapukká és összeadófákká válnak, amelyek Verilog-ra szintetizálódnak.

Írd meg egyszer, futtasd bárhol optimális teljesítménnyel

Ugyanaz a forráskód fut a laptop CPU-don fejlesztés közben, felhőbeli GPU-kra települ éles környezetben, és FPGA-kra fordul determinisztikus valós idejű következtetéshez. Nincs fordítás. Nincs portolás. Nincs platformspecifikus kód.

Ügyfeleknek építve, hogy építhessenek vele

A Dweve Core a Dweve Loom-ot, a kényszeralapú következtető rendszerünket hajtja. De nem csak nekünk való. Teljes platform bárki számára, aki diszkrét neurális hálózatokat épít.

You can build:

  • Custom architectures using the 191 layer types and 674 algorithms
  • Domain-specific models optimized for your exact requirements
  • Hybrid approaches mixing discrete and continuous computation via the 30 interop utilities
  • Novel training methods using evolutionary search, knowledge distillation, or custom gradient estimators

The platform provides:

Complete training infrastructure: Six straight-through estimator variants for binary/ternary gradient flow. Binary-aware optimizers that maintain full-precision weights internally while binarizing for forward passes. Automatic bit-width selection through gradient-based optimization. Progressive multi-stage distillation from FP32 through INT8, INT4, ternary, to binary.

Automatic hardware optimization: Runtime detection of CPU capabilities (CPUID on x86, system registers on ARM) and automatic dispatch to fastest available SIMD implementation. GPU kernel variants selected based on warp size, shared memory, and register count. FPGA synthesis with automatic pipeline register insertion based on timing constraints.

Flexible quantization: Symmetric and asymmetric quantization with per-tensor, per-channel, or per-group scales. Dynamic quantization with runtime range detection or static quantization with pre-computed scales from calibration data. MSE-optimal and KL-divergence-based scale computation for minimal accuracy loss.

The customer writes one model while the compiler routes it into CPU, GPU, FPGA, browser, AMD, and Apple targets.

Why discrete computation matters

Traditional neural networks compute everything in 16-bit or 32-bit floating point, then make discrete decisions at the end. We operate directly in discrete space from binary to 8-bit, eliminating intermediate continuous computation.

This isn't simple quantization of existing models. The framework is architected from first principles around discrete operations:

Hardware reality: Modern processors consist of billions of transistors in two states. An XNOR gate requires 6 transistors. A 32-bit floating-point multiplier requires thousands and consumes orders of magnitude more energy. Discrete operations align with hardware fundamentals.

Memory efficiency: Binary weights pack 64 values per 64-bit word. A ResNet-50 with 25.6 million parameters occupies 3.1MB in binary versus 50MB in FP16. The entire model fits in CPU L3 cache (typical: 36-64MB). You become compute-bound instead of memory-bound.

Deployment flexibility: Small models enable on-device inference. No cloud dependency. No network latency. No data privacy concerns. Process sensitive information entirely on user devices without ever transmitting to servers.

The complete algorithm matrix

The platform provides comprehensive coverage across three dimensions: algorithms, backends, and bit-widths.

Fundamental operations (415 primitives):

  • 46 bitművelet: logikai kapuk, manipuláció, eltolások, számlálás, keresés
  • 16 mezőművelet: kinyerés, elhelyezés, csomagolás, szétszórás, összegyűjtés, maszkkészítés
  • 25 redukció: logikai ÉS/VAGY/KIZÁRÓ VAGY, aritmetikai összeg/szorzat, szavazás és konszenzus
  • 17 távolságmetrika: Hamming, Jaccard, Dice, Tanimoto, koszinusz, Manhattan, euklideszi
  • 12 összefésülési művelet: 2-utas és 4-utas összefésülés, Morton- és Hilbert-térkitöltő görbék
  • 44 aritmetika: összeadás, kivonás, szorzás, osztás, fixpontos műveletek
  • 39 transzformáció: Walsh-Hadamard, FFT, DCT, NTT, wavelet (Haar, Daubechies, CDF97)
  • 11 hash-elés: SHA-256, Blake3, xxHash, MinHash, SimHash, lokalitásérzékeny hash-elés
  • 22 véletlenszám-generálás: LFSR, Mersenne Twister, ChaCha20, Sobol-sorozatok
  • 15 kvantálás: szimmetrikus, aszimmetrikus, tenzoronkénti, csatornánkénti, léptékszámítás
  • 30 bináris matematika: XNOR-popcount, háromértékű kódolás, súlyfrissítések, gradiensműveletek
  • 48 formátumkonverzió: FP32/FP16/FP8/INT8/INT4/INT2 konverziók minden irányban
  • 42 fixpontos művelet: aritmetika, transzcendens függvények, telítés minden bitszélességen

Összetett műveletek (500 kernel):

Optimalizált kernelek, amelyek az alapszintű műveleteket gyakori minták szerint kombinálják. Mátrixszorzás-változatok (standard, transzponált, blokkolt). Konvolúciótípusok (2D, 3D, mélységi, csoportos, dilatált). Normalizáció (batch, layer, group, instance). Aktivációs függvények (előjel, kemény tanh, szakaszonként lineáris). Figyelemmechanizmusok (önfigyelem, keresztfigyelem, többfejes). Pooling (max, átlag, sztochasztikus).

Hálózati rétegek (191 réteg):

Teljes építőelemek hálózatok felépítéséhez. Sűrű rétegek bináris, háromértékű és többbites súlyokkal. Konvolúciós rétegek az összes gyakori változattal. Rekurrens rétegek (LSTM, GRU bináris kapukkal). Figyelemrétegek (skálázott pontszorzat, többfejes, relatív pozíció). Normalizációs rétegek batch-statisztikákkal és tanult paraméterekkel. Maradékösszeköttetések dimenzióillesztéssel.

Magas szintű algoritmusok (674 algoritmus):

Teljes módszerek tanításhoz, következtetéshez és optimalizáláshoz. Tudásdesztilláció progresszív, többszakaszos finomítással. Evolúciós megszorítás-felfedezés genetikus programozással. Neurális architektúra-keresés diszkrét hálózatokhoz. Gradiensbecslők (áthatoló, csonkolt, adaptív, momentum, hiperhálózat). Optimalizálók (BinaryAdam, TernaryAdam, adaptív kvantálás). Elosztott tanítás bizánci-robusztus aggregációval.

A diszkrét számítás azért számít, mert a pontosság rétegenkénti keretté válik, nem pedig mindenhol lebegőpontos alapértelmezéssé.

A háttérrendszer megvalósításának mélysége

Minden algoritmus háttérrendszerenként több optimalizált változatban létezik. Nem általános megvalósítások. Hardverspecifikus kód, amely minden architekturális jellemzőt kihasznál.

CPU SIMD: Az SSE2 univerzális x86-64 kompatibilitást biztosít (minden 2001 óta gyártott processzor). Az AVX2 4-8-szoros gyorsulást nyújt Haswell és újabb processzorokon (2013+). Az AVX-512 10-16-szoros gyorsulást ér el maszkregiszterekkel az előjelzéshez és VPTERNLOG-gal bármely 3 bemenetű logikai függvényhez. A NEON 3-4-szeres gyorsulást hoz minden ARMv8 processzorra, beleértve a mobileszközöket és az Apple Silicon-t. Az SVE/SVE2 vektorhossz-független kódot biztosít, amely automatikusan kihasználja a szélesebb vektorokat az újabb hardvereken.

CUDA: A warp-szintű primitívek 32, egymással szinkronban futó szálat szerveznek. Minden szál 32, uint32-ben tárolt bináris értéket dolgoz fel. Egy teljes warp 1 024 bináris értéket dolgoz fel párhuzamosan. A hardveres intrinsicek közé tartozik a __popc a populációs számláláshoz, a __ballot_sync a warp-szavazáshoz, valamint a __shfl_sync a gyors kommunikációhoz megosztott memória nélkül. Az egyesített memóriaelérés biztosítja a sávszélesség kihasználását. A Tensor Core kihasználása mátrixműveletekhez bináris adatokkal is.

Rust-HDL: Közvetlen hardverszintézis annotált Rust kódból. A keretrendszer automatikusan generál Verilog/VHDL kódot. A bináris XNOR-popcount műveletek XNOR kapukra (kombinációs logika, nulla terjedési késleltetés) és összeadófákra képeződnek le. A pipeline regiszterek automatikusan kerülnek beszúrásra az időzítési korlátok alapján. Szintetizál FPGA-kra (Xilinx, Intel) és ASIC-ekre egyaránt.

WebAssembly: A SIMD128 128 bites vektorműveleteket biztosít minden modern böngészőben (Chrome 91+, Firefox 89+, Safari 16.4+). A műveletek közé tartozik a v128.and/or/xor a bitenkénti logikához és az i8x16.popcnt a populációs számláláshoz. A Web Workers-szel kombinálva több szálon fut, a SharedArrayBuffer pedig megosztott memóriát biztosít, így a natív CPU-teljesítmény 60-80%-át éri el. Az eszközön futó böngészős következtetés GDPR-konform feldolgozást tesz lehetővé szerverre feltöltés nélkül.

ROCm: Wavefront-szintű optimalizálás AMD architektúrákhoz, wavefrontonként 64 szállal (kétszerese az NVIDIA 32-ének). Minden szál 32 bináris értéket dolgoz fel, így wavefrontonként 2 048 értéket. A CUDA-hoz hasonló intrinsicek: __builtin_popcount, __ballot és ds_swizzle. A programozási modell annyira hasonló, hogy a CUDA-fejlesztők azonnal tudnak ROCm kódot írni.

Metal: Apple Silicon optimalizálás egyesített memóriaarchitektúrával, ahol a CPU és a GPU fizikai RAM-ot oszt meg gyorsítótár-koherenciával. Kiküszöböli az adatmásolási többletterhelést. A bináris műveletek az Apple egyedi mátrixmotorjait használják. Az M3 Max Neural Engine 50-80 TOPS teljesítményt nyújt bináris következtetésnél a SoC-be épített dedikált gyorsítók segítségével.

Mit nem csinálunk (és miért fontos a fókusz)

Fontos tisztázni: nem csinálunk mindent. A fókusz teszi lehetővé a kiválóságot.

Nincs lebegőpontos következtetés: Kizárólag diszkrét számítás bináristól 8 bitig. Ha FP32/FP16/BFloat16 kell éles környezethez, használj PyTorch-ot vagy JAX-et. Kizárólag diszkrét műveletekre optimalizálunk, ami olyan specializációkat tesz lehetővé, amelyek vegyes pontosságú lebegőpontos számítással lehetetlenek. Nem lehetsz mindenben kiváló. Mi a diszkrét AI-t választottuk, és kíméletlenül optimalizáltunk.

Nincs dinamikus következtetési gráf: A modellek statikus gráfokká fordulnak éles környezethez. A tanítás támogatja a dinamikus számítást (szükséges a kutatási rugalmassághoz), de az éles következtetés statikus. Ez lehetővé teszi az előre történő optimalizálást: kernel-fúzió a teljes hálózaton, memóriaelrendezés-optimalizálás ismert tenzorméretekkel, prefetch utasítások beszúrása kiszámítható hozzáférési mintákkal.

Célzott adat-előfeldolgozás: 8 speciális algoritmust biztosítunk a neurális hálózati bemenetek előkészítéséhez (normalizálás, adaptív skálázás, tanult kvantálás, bináris augmentáció), nem pedig általános célú ETL-t. A feature engineering folyamatokhoz és adatbetöltéshez használd a meglévő eszközöket (Pandas, Polars, DuckDB). Kiválóak vagyunk a diszkrét neurális hálózati következtetésben bináristól 8 bitig. Nem váltjuk le a teljes adatstacket.

Ezek nem korlátok. Ezek fókusz. Azzal, hogy a hatókört diszkrét neurális hálózatokra és statikus következtetési gráfokra szűkítjük, olyan optimalizálási mélységet érünk el, amelyet az átfogó keretrendszerek nem tudnak felülmúlni.

Építés a Dweve Core-ra

A platform használatra kész. Már ma elkezdheted építeni a diszkrét neurális hálózatokat.

Teljes eszközkészlet:

  • Deklaratív API: Rust DSL a NetworkBuilderrel a modell definiálásához
  • Fordító infrastruktúra: MLIR-alapú optimalizációs folyamat négy IR-szinttel
  • Tanítási keretrendszer: Hat STE-változat, bináris-tudatos optimalizálók, automatikus bitszélesség-választás
  • Háttérrendszer-kódgenerátorok: C intrinsicekkel CPU-hoz, CUDA/HIP kernel GPU-hoz, Verilog FPGA-hoz
  • Telepítési eszközök: Export ONNX, Core ML, TensorFlow Lite vagy önálló bináris formátumba

Példa munkafolyamat:

1. Definiálja a hálózatát a NetworkBuilderrel
2. Tanítson bináris-tudatos optimalizálókkal adaptív bitszélesség-választással
3. Fordítson célhardverre automatikus háttérrendszer-választással
4. Telepítsen optimalizált binárisként vagy exportáljon szabványos formátumba
5. Futtassa bárhol: felhőszervereken, élvonalbeli eszközökön, böngészőkben, FPGA-ken

Egy platform. Egy kódbázis. Minden háttérrendszer. Teljes diszkrét AI.

Ne zsonglőrködjön tíz keretrendszerrel. Ne írja át a kódot minden telepítési célhoz. Ne küzdjön a verziókompatibilitással. Építsen egyszer a Dweve Core-on, és telepítsen mindenhová.


A Dweve Core a Dweve Loomot, a 2026-ban megjelenő kényszeralapú következtető rendszerünket hajtja. A keretrendszer a teljes, 1 930 algoritmusból álló veremet valósítja meg 6 háttérrendszeren, adaptív többbites kvantálással bináristól 8 bitig. Egy holland mérnökcsapat építette három év fejlesztés alatt.

A Dweve Core-ra építés azért működik, mert a bench a neurális hálózati eszközláncot bent tartja, az általános célú szétszórtságot pedig kint hagyja.