Pjattaforma waħda, 1,930 algoritmi, kull backend: kif bnejna l-istack sħiħ għal AI diskreta

L-istack tal-iżvilupp tal-AI tiegħek mhux qed jaħdem. PyTorch għar-riċerka, TensorFlow għall-użu, CUDA għal NVIDIA, ROCm għal AMD, għodod separati għal...

Pjattaforma waħda, 1,930 algoritmi, kull backend: kif bnejna l-istack sħiħ għal AI diskreta

Il-problema tal-frammentazzjoni

L-ambjent tal-iżvilupp tal-AI tiegħek huwa frammentat.

Inti tipprototipa f'PyTorch għax ir-riċerkaturi jippreferuh. Inti tiddeplojja b'TensorFlow għax it-timijiet tal-produzzjoni jridu l-għodod ta' Google. Inti tikteb kernels CUDA għall-GPUs ta' NVIDIA. Inti tipporta għal ROCm għall-ħardwer ta' AMD. Inti terġa' tikteb kollox għall-mowbajl billi tuża TensorFlow Lite jew Core ML. Inti tuża ONNX biex tikkonverti bejn il-frameworks, bit-tama li xejn ma jinkiser. Inti żżomm codebases separati għad-deployjar fil-cloud, fil-edge, u fil-browser.

Għaxar għodod differenti. Eluf ta' dipendenzi. Ħmarillel ta' kompatibbiltà tal-verżjonijiet. Bidliet li jkissru kollox f'kull ċiklu ta' rilaxx.

Taġġorna PyTorch? Ittama li l-verżjoni tal-CUDA tiegħek taqbel. Trid tiddeplojja fuq AMD? Erġa' ikteb il-kernels tiegħek. Għandek bżonn inferenza fil-browser? Ibda mill-ġdid b'WebAssembly. Qed taqleb minn GPUs ta' NVIDIA għal AMD? Ix-xorti t-tajba biex tipporta dak il-codebase. Qed tiddeplojja fuq FPGAs? Tgħallem toolchain kompletament differenti.

Din il-frammentazzjoni mhix inċident. Hija r-riżultat naturali ta' kull framework li jottimizza għall-każ ta' użu speċifiku tiegħu waqt li jinjora l-interoperabbiltà. PyTorch jeċċella fir-riċerka imma jittratta d-deployjar bħala ħsieb ta' wara. TensorFlow jimira l-produzzjoni imma l-esperjenza tar-riċerka hija ta' uġigħ. CUDA jissakkrek fil-ħardwer ta' NVIDIA. Kull għodda ssolvi problema waħda waqt li toħloq tlieta oħrajn.

Hemm mod aħjar.

Dweve Core: Il-pjattaforma kompleta għal AI diskreta

Dweve Core hija pjattaforma unifikata għall-bini ta' networks newrali diskreti minn preċiżjoni binarja sa 8-bit. Mhix framework ieħor. Hija sostituzzjoni kompleta għall-istack frammentat tiegħek.

Installazzjoni waħda. API waħda. Codebase wieħed. Deployjar awtomatiku għal CPU, GPU, FPGA, WebAssembly, kull fejn għandek bżonn tmexxi.

Hawn xi tfisser kompleta:

1,930 algoritmi li jkopru kull operazzjoni li għandek bżonn:

  • 415 primittivi: Operazzjonijiet atomiċi bħal XNOR, popcount, manipulazzjoni tal-bits, kwantizzazzjoni, konverżjoni bejn formati
  • 500 kernel: Operazzjonijiet komposti ottimizzati għal mudelli komuni
  • 191 saffi: Blokki kompluti ta' bini ta' networks newrali (konvoluzzjoni, dens, normalizzazzjoni, attivazzjoni, attenzjoni)
  • 674 algoritmi: Metodi ta' livell għoli inklużi trasformazzjonijiet, proċeduri ta' taħriġ, tfittxija evoluzzjonarja, distillazzjoni tal-għarfien
  • 30 utilitajiet ta' interoperabbiltà: Pontijiet fakultattivi b'punt li jvarja għal approċċi ibridi
  • 120 arkitetturi ta' mudelli: Mudelli ta' networks pre-ottimizzati minn ResNets sa Transformers

Dan mhux subsett. Huwa kompletezza matematika. Aħna analizzajna kull arkitettura ewlenija ta' networks newrali u bnejna kull operazzjoni li jeħtieġu, ottimizzata għall-komputazzjoni diskreta mill-prinċipji fundamentali.

6 backends b'kompilazzjoni awtomatika:

  • SIMD CPU: Kernels ottimizzati bl-idejn għal x86 u ARM b'sejbien awtomatiku tal-ISA (SSE2, AVX2, AVX-512, NEON, SVE/SVE2)
  • CUDA: Ottimizzazzjoni tal-GPU ta' NVIDIA b'primitivi fil-livell tal-warp u utilizzazzjoni ta' Tensor Core
  • Rust-HDL: Sinteżi diretta ta' FPGA u ASIC minn deskrizzjonijiet ta' algoritmi
  • WebAssembly: Inferenza fil-browser b'appoġġ għal SIMD128 għal ipproċessar fuq l-apparat konformi mal-GDPR
  • ROCm: Ottimizzazzjoni tal-GPU ta' AMD b'operazzjonijiet fil-livell tal-wavefront
  • Metal: Ottimizzazzjoni ta' Apple Silicon bl-użu ta' arkitettura ta' memorja unifikata

6 wisa' ta' bits b'preċiżjoni adattiva:

  • Binarju (1-bit): Effiċjenza massima b'kompressjoni ta' 16× meta mqabbel ma' FP16
  • Ternarju: {-1, 0, +1} b'sparsità espliċita
  • 2-bit: Erba' livelli għal kompressjoni bilanċjata
  • 3-bit: Tmien livelli għal saffi sensittivi għall-kwalità
  • 4-bit: Sittax-il livell li joqorbu lejn il-kwalità ta' FP16
  • 8-bit: Kważi preċiżjoni sħiħa għal operazzjonijiet kritiċi

Il-pjattaforma titgħallem il-wisa' ottimali tal-bit għal kull saff waqt it-taħriġ permezz ta' għażla bbażata fuq il-gradjent. Mhux euristiċi. Mhux raden. Ottimizzazzjoni attwali bbażata fuq kif l-eżattezza titjieb bi preċiżjoni miżjuda.

Adaptive Multi-Bit Quantization: Layer-specific precision allocation
L-istakk ta' 1,930 algoritmu mhuwiex lista laxka ta' karatteristiċi; huwa kabinett ordnat ta' primittivi, kernels, saffi, metodi, pontijiet, u mudelli ta' templates.

Ikteb darba, skjerja kullimkien

Il-pjattaforma tuża API Rust deklarattiva. Inti tiddeskrivi dak li trid, u l-kompilatur jifhem kif imexxih b'mod ottimali fuq il-ħardwer fil-mira tiegħek.

Eżempju ta' definizzjoni ta' netwerk:

let model = NetworkBuilder::new()
    .input(BinaryTensor::new([1024, 784]))
    .dense(784, 512, activation=BinaryActivation::Sign)
    .dense(512, 256, activation=BinaryActivation::Sign)
    .output(256, 10)
    .build();

Dak hu. Ikteb dan darba, u l-kompilatur awtomatikament jiġġenera implimentazzjonijiet ottimizzati għal kull backend.

Il-pipeline tal-kompilazzjoni jaħdem permezz ta' erba' livelli:

Livell 1: IR tan-Netwerk Newrali - Id-deskrizzjoni tan-netwerk ta' livell għoli tiegħek tiġi pparsata fi graff komputazzjonali b'operazzjonijiet, fluss ta' dejta, u iperparametri.

Livell 2: Ottimizzazzjoni tal-Graff - Passi standard tal-kompilatur jeliminaw kodiċi mejjet, jikkonsolidaw kostanti, jiddeduplikaw espressjonijiet, u jgħaqqdu operazzjonijiet sekwenzjali. Saff dens segwit minn normalizzazzjoni tal-lott u attivazzjoni jsir kernel magħqud wieħed li jillowdja l-input darba u jipproduċi l-output finali.

Livell 3: Djalett BitOps - Il-graff jinżel għal operazzjonijiet fil-livell tal-bit ittajpjati b'mod espliċitu bil-preċiżjoni. Din ir-rappreżentazzjoni intermedja hija indipendenti mill-ħardwer iżda qrib l-operazzjonijiet attwali tal-magna. Mibnija fuq l-infrastruttura MLIR (Multi-Level Intermediate Representation) għal ottimizzazzjoni ta' livell industrijali.

Livell 4: Tnaqqis għall-Ħardwer - Il-ġenerazzjoni finali tal-kodiċi tipproduċi implimentazzjonijiet speċifiċi għall-pjattaforma. Għal AVX-512, l-operazzjonijiet tal-bit isiru istruzzjonijiet VPXORQ u VPOPCNTQ. Għal CUDA, isiru intrinsici fil-livell tal-warp b'aċċess tal-memorja kkoalesjat. Għal FPGA, isiru gradi XNOR u siġar tal-additur sintetizzati f'Verilog.

Write once, deploy everywhere with optimal performance

L-istess kodiċi sors jimxi fuq il-CPU tal-laptop tiegħek waqt l-iżvilupp, jiskjerja fuq GPUs tal-cloud fil-produzzjoni, u jikkompila għal FPGAs għal inferenza deterministika f'ħin reali. L-ebda traduzzjoni. L-ebda porting. L-ebda kodiċi speċifiku għall-pjattaforma.

Mibni biex il-klijenti jibnu bih

Dweve Core jħaddem Dweve Loom, is-sistema tagħna ta' raġunament ibbażat fuq il-vinkoli. Imma mhux biss għalina. Hija pjattaforma sħiħa għal kull min qed jibni netwerks newrali diskreti.

Tista' tibni:

  • Arkitetturi personalizzati billi tuża t-191 tip ta' saff u l-674 algoritmu
  • Mudelli speċifiċi għad-dominju ottimizzati għar-rekwiżiti eżatti tiegħek
  • Approċċi ibridi li jħalltu komputazzjoni diskreta u kontinwa permezz tal-30 għodda ta' interoperabbiltà
  • Metodi ġodda ta' taħriġ billi tuża tfittxija evoluzzjonarja, distillazzjoni tal-għarfien, jew stimaturi tal-gradjent personalizzati

Il-pjattaforma tipprovdi:

Infrastruttura kompleta ta' taħriġ: Sitt varjanti ta' stimatur straight-through għall-fluss tal-gradjent binarju/ternarju. Ottimizzaturi konxji tal-binarju li jżommu piżijiet ta' preċiżjoni sħiħa internament filwaqt li jibinarizzaw għall-passi 'l quddiem. Għażla awtomatika tal-wisa' tal-bit permezz ta' ottimizzazzjoni bbażata fuq il-gradjent. Distillazzjoni progressiva f'diversi stadji minn FP32 permezz ta' INT8, INT4, ternarju, għal binarju.

Ottimizzazzjoni awtomatika tal-hardware: Sejbien fil-ħin tal-eżekuzzjoni tal-kapaċitajiet tal-CPU (CPUID fuq x86, reġistri tas-sistema fuq ARM) u dispatcher awtomatiku għall-implimentazzjoni SIMD l-aktar veloċi disponibbli. Varjanti tal-kernel tal-GPU magħżula abbażi tad-daqs tal-warp, memorja kondiviża, u numru ta' reġistri. Sinteżi tal-FPGA b'inserzjoni awtomatika ta' reġistri tal-pipeline ibbażata fuq restrizzjonijiet ta' ħin.

Kwantizzazzjoni flessibbli: Kwantizzazzjoni simmetrika u asimmetrika bi skali għal kull tensor, għal kull kanal, jew għal kull grupp. Kwantizzazzjoni dinamika b'sejbien tal-firxa fil-ħin tal-eżekuzzjoni jew kwantizzazzjoni statika bi skali kkalkulati minn qabel minn dejta ta' kalibrazzjoni. Kalkolu tal-iskala ottimali MSE u bbażat fuq id-divergenza KL għal telf minimu ta' preċiżjoni.

Il-klijent jikteb mudell wieħed filwaqt li l-kompilatur jidderieġih lejn il-miri CPU, GPU, FPGA, browser, AMD, u Apple.

Għaliex il-komputazzjoni diskreta hija importanti

In-netwerks newrali tradizzjonali jikkomputaw kollox f'punt li jvarja ta' 16-bit jew 32-bit, u mbagħad jieħdu deċiżjonijiet diskreti fl-aħħar. Aħna naħdmu direttament fi spazju diskret minn binarju għal 8-bit, u neliminaw il-komputazzjoni kontinwa intermedja.

Dan mhux sempliċi kwantizzazzjoni ta' mudelli eżistenti. Il-framework huwa arkitetturat mill-ewwel prinċipji madwar operazzjonijiet diskreti:

Realtà tal-hardware: Il-proċessuri moderni jikkonsistu f'biljuni ta' transisters fi żewġ stati. Bieb XNOR jeħtieġ 6 transisters. Multiplikatur b'punt li jvarja ta' 32-bit jeħtieġ eluf u jikkonsma ordnijiet ta' kobor aktar enerġija. L-operazzjonijiet diskreti jallinjaw mal-fundamenti tal-hardware.

Effiċjenza tal-memorja: Il-piżijiet binarji jippakkjaw 64 valur għal kull kelma ta' 64-bit. ResNet-50 b'25.6 miljun parametru jokkupa 3.1MB fil-binarju meta mqabbel ma' 50MB f'FP16. Il-mudell kollu joqgħod fil-cache L3 tal-CPU (tipikament: 36-64MB). Issir marbut mal-komputazzjoni minflok mal-memorja.

Flessibbiltà ta' skjerament: Mudelli żgħar jippermettu inferenza fuq l-apparat. L-ebda dipendenza fuq il-cloud. L-ebda latenza tan-netwerk. L-ebda tħassib dwar il-privatezza tad-dejta. Ipproċessa informazzjoni sensittiva kompletament fuq l-apparati tal-utenti mingħajr qatt ma tittrażmetti lis-servers.

Il-matriċi kompleta tal-algoritmi

Il-pjattaforma tipprovdi kopertura komprensiva fi tliet dimensjonijiet: algoritmi, backends, u wisgħat tal-bit.

Operazzjonijiet fundamentali (415 primittivi):

  • 46 operazzjonijiet bit: gradi loġiċi, manipulazzjoni, ċaqliq, għadd, tiftix
  • 16 operazzjonijiet fuq il-kampi: estrazzjoni, depożitu, ippakkjar, tixrid, ġbir, ħolqien ta' maskri
  • 25 riduzzjonijiet: AND/OR/XOR loġiċi, somma/prodott aritmetiċi, votazzjoni u kunsens
  • 17 metriċi ta' distanza: Hamming, Jaccard, Dice, Tanimoto, cosine, Manhattan, Euclidean
  • 12 operazzjonijiet ta' interleaving: interleave minn 2 sa 4 direzzjonijiet, kurvi li jimlew l-ispazju Morton u Hilbert
  • 44 aritmetika: żieda, tnaqqis, multiplikazzjoni, diviżjoni, operazzjonijiet b'punt fiss
  • 39 trasformazzjonijiet: Walsh-Hadamard, FFT, DCT, NTT, wavelets (Haar, Daubechies, CDF97)
  • 11 hashing: SHA-256, Blake3, xxHash, MinHash, SimHash, hashing sensittiv għal-lokalità
  • 22 ġenerazzjoni ta' numri każwali: LFSR, Mersenne Twister, ChaCha20, sekwenzi Sobol
  • 15 kwantizzazzjoni: simmetrika, asimmetrika, għal kull tensor, għal kull kanal, kalkolu tal-iskala
  • 30 matematika binarja: XNOR-popcount, kodifikazzjoni ternarja, aġġornamenti tal-piżijiet, operazzjonijiet tal-gradjenti
  • 48 konverżjonijiet ta' format: konverżjonijiet FP32/FP16/FP8/INT8/INT4/INT2 fid-direzzjonijiet kollha
  • 42 operazzjonijiet b'punt fiss: aritmetika, funzjonijiet traskendenti, saturazzjoni fil-wisa' kollha tal-bits

Operazzjonijiet komposti (500 kernel):

Kernel ottimizzati li jgħaqqdu l-primitivi għal mudelli komuni. Varjanti ta' multiplikazzjoni ta' matriċi (standard, trasposta, bil-blokki). Tipi ta' konvoluzzjoni (2D, 3D, depthwise, grouped, dilated). Normalizzazzjoni (batch, layer, group, instance). Funzjonijiet ta' attivazzjoni (sign, hard tanh, lineari biċċiet). Mekkaniżmi ta' attenzjoni (self-attention, cross-attention, multi-head). Pooling (max, average, stochastic).

Saffi tan-netwerk (191 saff):

Blokki kompluti ta' bini għall-kostruzzjoni ta' netwerks. Saffi densi b'piżijiet binarji, ternarji, u b'ħafna bits. Saffi konvoluzzjonali bil-varjanti komuni kollha. Saffi rikorrenti (LSTM, GRU b'gradi binarji). Saffi ta' attenzjoni (scaled dot-product, multi-head, pożizzjoni relattiva). Saffi ta' normalizzazzjoni bi statistika tal-batch u parametri mgħallma. Konnessjonijiet residwali bit-tqabbil tad-dimensjonijiet.

Algoritmi ta' livell għoli (674 algoritmu):

Metodi kompluti għat-taħriġ, l-inferenza, u l-ottimizzazzjoni. Distillazzjoni tal-għarfien b'raffinament progressiv f'diversi stadji. Skoperta evoluzzjonarja ta' restrizzjonijiet bi programmar ġenetiku. Tiftix fl-arkitettura newrali għal netwerks diskreti. Stmaturi tal-gradjenti (straight-through, clipped, adaptive, momentum, hypernetwork). Ottimizzaturi (BinaryAdam, TernaryAdam, kwantizzazzjoni adattiva). Taħriġ distribwit b'aggregazzjoni robusta kontra l-Byzantine.

Il-komputazzjoni diskreta hija importanti għaliex il-preċiżjoni ssir baġit saff b'saff minflok default b'punt li jvarja kullimkien.

Fond tal-implimentazzjoni tal-backend

Kull algoritmu jeżisti f'diversi varjanti ottimizzati għal kull backend. Mhux implimentazzjonijiet ġeneriċi. Kodiċi speċifiku għall-hardware li jisfrutta kull karatteristika arkitettonika.

CPU SIMD: SSE2 jipprovdi kompatibbiltà universali x86-64 (kull proċessur mill-2001). AVX2 jagħti aċċelerazzjoni ta' 4-8× fuq Haswell u aktar ġodda (2013+). AVX-512 jilħaq 10-16× b'reġistri tal-maskri għall-predikazzjoni u VPTERNLOG għal kwalunkwe funzjoni Booleana b'3 inputs. NEON iġib aċċelerazzjoni ta' 3-4× lill-proċessuri ARMv8 kollha inklużi mobbli u Apple Silicon. SVE/SVE2 jipprovdi kodiċi agnostiku għat-tul tal-vettur li awtomatikament juża vetturi usa' fuq hardware aktar ġdid.

CUDA: Primittivi fil-livell tal-warp jorganizzaw 32 thread li jeżegwixxu f'sinkronija. Kull thread jipproċessa 32 valur binarju ppakkjati f'uint32. Warp sħiħ jipproċessa 1,024 valur binarju b'mod parallel. Intrinsics tal-hardware jinkludu __popc għall-għadd tal-popolazzjoni, __ballot_sync għall-votazzjoni tal-warp, __shfl_sync għal komunikazzjoni rapida mingħajr memorja kondiviża. Aċċess koalizzat tal-memorja jiżgura utilizzazzjoni tal-bandwidth. Utilizzazzjoni tat-Tensor Core għal operazzjonijiet tal-matriċi anki b'dejta binarja.

Rust-HDL: Sinteżi diretta tal-hardware minn kodiċi Rust annotat. Il-framework jiġġenera Verilog/VHDL awtomatikament. Operazzjonijiet binarji XNOR-popcount jimmappjaw għal gradi XNOR (loġika kombinatorja, żero dewmien ta' propagazzjoni) flimkien ma' siġar ta' adders. Reġistri tal-pipeline jiddaħħlu awtomatikament abbażi ta' restrizzjonijiet ta' timing. Jissintetizza kemm għal FPGAs (Xilinx, Intel) kif ukoll għal ASICs.

WebAssembly: SIMD128 jipprovdi operazzjonijiet ta' vetturi ta' 128-bit fil-browsers moderni kollha (Chrome 91+, Firefox 89+, Safari 16.4+). L-operazzjonijiet jinkludu v128.and/or/xor għal loġika bitwise u i8x16.popcnt għall-għadd tal-popolazzjoni. Flimkien ma' Web Workers għal multi-threading u SharedArrayBuffer għal memorja kondiviża, jikseb 60-80% tal-prestazzjoni nattiva tal-CPU. Inferenza fil-browser fuq l-apparat tippermetti proċessar konformi mal-GDPR mingħajr uploads għas-server.

ROCm: Ottimizzazzjoni fil-livell tal-wavefront għal arkitetturi AMD b'64 thread għal kull wavefront (id-doppju tat-32 ta' NVIDIA). Kull thread jipproċessa 32 valur binarju għal 2,048 valur għal kull wavefront. Intrinsics simili għal CUDA b'__builtin_popcount, __ballot, u ds_swizzle. Il-mudell tal-programmazzjoni huwa qrib biżżejjed li żviluppaturi tal-CUDA jistgħu jiktbu kodiċi ROCm immedjatament.

Metal: Ottimizzazzjoni ta' Apple Silicon billi tintuża arkitettura ta' memorja unifikata fejn il-CPU u l-GPU jaqsmu RAM fiżika b'koerenza tal-cache. Telimina l-ispiża tal-ikkupjar tad-dejta. Operazzjonijiet binarji jisfruttaw il-magni tal-matriċi personalizzati ta' Apple. M3 Max Neural Engine jagħti 50-80 TOPS fuq inferenza binarja billi juża aċċeleraturi ddedikati mibnija fis-SoC.

Dak li ma nagħmlux (u għaliex il-fokus jimpurta)

Importanti li niċċaraw: ma nagħmlux kollox. Il-fokus jippermetti l-eċċellenza.

L-ebda inferenza b'punt li jvarja: Kalkolu diskret biss minn binarju għal 8-bit. Jekk għandek bżonn FP32/FP16/BFloat16 għad-deploy, uża PyTorch jew JAX minflok. Aħna nottimizzaw esklussivament għal operazzjonijiet diskreti, li jippermettu speċjalizzazzjonijiet impossibbli b'punt li jvarja b'preċiżjoni mħallta. Ma tistax tkun eċċellenti f'kollox. Aħna għażilna AI diskreta u ottimizzajna bla ħniena.

L-ebda graff dinamiku ta' inferenza: Il-mudelli jiġu kkompilati fi graffs statiċi għad-deploy. It-taħriġ jappoġġa kalkolu dinamiku (meħtieġ għall-flessibbiltà tar-riċerka), iżda l-inferenza tal-produzzjoni hija statika. Dan jippermetti ottimizzazzjoni minn qabel: fużjoni tal-kernel madwar in-netwerk kollu, ottimizzazzjoni tal-format tal-memorja b'forom ta' tensuri magħrufa, inserzjoni ta' istruzzjonijiet ta' prefetch b'mudelli ta' aċċess prevedibbli.

Preproċessar iffokat tad-dejta: Aħna nipprovdu 8 algoritmi speċjalizzati għat-tħejjija tal-input tan-netwerks newrali (normalizzazzjoni, skaljar adattiv, kwantizzazzjoni mgħallma, awgmentazzjoni binarja), mhux ETL ta' skop ġenerali. Għal pipelines ta' inġinerija tal-karatteristiċi u tagħbija tad-dejta, uża l-għodod eżistenti (Pandas, Polars, DuckDB). Aħna eċċellenti fl-inferenza tan-netwerks newrali diskreti minn binarju għal 8-bit. M'aħniex qed nissostitwixxu l-istack kollu tad-dejta tiegħek.

Dawn mhumiex limitazzjonijiet. Huma fokus. Billi nirrestrinġu l-ambitu għal netwerks newrali diskreti b'graffs ta' inferenza statiċi, niksbu fond ta' ottimizzazzjoni li frameworks komprensivi ma jistgħux jaqblu miegħu.

Nibnu fuq Dweve Core

Il-pjattaforma hija lesta biex tintuża. Tista' tibda tibni netwerks newrali diskreti llum.

Toolchain komplut:

  • API Dikjarattiva: DSL tar-Rust b'NetworkBuilder għad-definizzjoni tal-mudell
  • Infrastruttura tal-kompilatur: Pipeline ta' ottimizzazzjoni bbażat fuq MLIR b'erba' livelli ta' IR
  • Qafas ta' taħriġ: Sitt varjanti ta' STE, ottimizzaturi konxji tal-binarju, għażla awtomatika tal-wisa' tal-bits
  • Ġeneraturi tal-kodiċi tal-backend: C b'intrinsics għall-CPU, kernels CUDA/HIP għall-GPU, Verilog għall-FPGA
  • Għodod ta' skjerament: Esportazzjoni lejn ONNX, Core ML, TensorFlow Lite, jew binarji standalone

Eżempju ta' fluss tax-xogħol:

1. Iddefinixxi n-netwerk tiegħek billi tuża NetworkBuilder
2. Ħarreġ billi tuża ottimizzaturi konxji tal-binarju b'għażla adattiva tal-wisa' tal-bits
3. Ikkompila għall-hardware fil-mira b'għażla awtomatika tal-backend
4. Skjera bħala binarju ottimizzat jew esporta f'format standard
5. Ħaddem kullimkien: servers tal-cloud, apparat edge, browsers, FPGAs

Pjattaforma waħda. Codebase waħda. Kull backend. AI diskreta kompleta.

Ieqaf iddawwar għaxar frameworks. Ieqaf tikteb il-kodiċi mill-ġdid għal kull mira ta' skjerament. Ieqaf tiġġieled il-kompatibbiltà tal-verżjonijiet. Ibni darba fuq Dweve Core u skjera kullimkien.


Dweve Core jagħti s-setgħa lil Dweve Loom, is-sistema ta' raġunament ibbażata fuq il-vinkli tagħna li qed titnieda fl-2026. Il-qafas jimplimenta l-istack sħiħ ta' 1,930 algoritmu fuq 6 backends b'kwantizzazzjoni multi-bit adattiva minn binarju sa 8-bit. Mibni minn tim ta' inġiniera Olandiżi fuq tliet snin ta' żvilupp.

Il-bini fuq Dweve Core jaħdem għax il-bench iżomm it-toolchain tan-netwerk newrali ġewwa u jħalli barra l-isprawl ta' użu ġenerali.