Μία πλατφόρμα, 1.930 αλγόριθμοι, κάθε backend: πώς φτιάξαμε την πλήρη στοίβα για διακριτή AI

Ένα στοίβα ανάπτυξης AI που είναι χαλασμένη. PyTorch για έρευνα, TensorFlow για ανάπτυξη, CUDA για NVIDIA, ROCm για AMD, ξεχωριστά εργαλεία για κινητά, FPGA...

Μία πλατφόρμα, 1.930 αλγόριθμοι, κάθε backend: πώς φτιάξαμε την πλήρη στοίβα για διακριτή AI

Το πρόβλημα του κατακερματισμού

Το περιβάλλον ανάπτυξης τεχνητής νοημοσύνης σου είναι κατακερματισμένο.

Κάνεις πρωτότυπα σε PyTorch επειδή οι ερευνητές το προτιμούν. Κάνεις ανάπτυξη με TensorFlow επειδή οι ομάδες παραγωγής θέλουν τα εργαλεία της Google. Γράφεις πυρήνες CUDA για GPU της NVIDIA. Κάνεις μεταφορά σε ROCm για υλικό της AMD. Ξαναγράφεις τα πάντα για κινητά χρησιμοποιώντας TensorFlow Lite ή Core ML. Χρησιμοποιείς ONNX για μετατροπή μεταξύ πλαισίων, ελπίζοντας ότι τίποτα δεν θα χαλάσει. Διατηρείς ξεχωριστούς κώδικες για ανάπτυξη σε cloud, σε συσκευές άκρου και σε περιηγητή.

Δέκα διαφορετικά εργαλεία. Χιλιάδες εξαρτήσεις. Εφιάλτες συμβατότητας εκδόσεων. Αλλαγές που σπάνε τα πάντα σε κάθε κύκλο έκδοσης.

Ενημερώνεις το PyTorch; Ελπίζεις να ταιριάζει η έκδοση CUDA σου. Θέλεις να αναπτύξεις σε AMD; Ξαναγράφεις τους πυρήνες σου. Χρειάζεσαι συμπερασμούς στον περιηγητή; Ξεκινάς από την αρχή με WebAssembly. Αλλάζεις από GPU NVIDIA σε AMD; Καλή τύχη με τη μεταφορά αυτού του κώδικα. Αναπτύσσεις σε FPGA; Μαθαίνεις ένα εντελώς διαφορετικό σύνολο εργαλείων.

Αυτός ο κατακερματισμός δεν είναι τυχαίος. Είναι το φυσικό αποτέλεσμα κάθε πλαισίου να βελτιστοποιείται για τη συγκεκριμένη περίπτωση χρήσης του ενώ αγνοεί τη διαλειτουργικότητα. Το PyTorch υπερέχει στην έρευνα αλλά αντιμετωπίζει την ανάπτυξη ως εκ των υστέρων σκέψη. Το TensorFlow στοχεύει στην παραγωγή αλλά η ερευνητική εμπειρία είναι επώδυνη. Το CUDA σε κλειδώνει στο υλικό της NVIDIA. Κάθε εργαλείο λύνει ένα πρόβλημα ενώ δημιουργεί τρία ακόμα.

Υπάρχει καλύτερος τρόπος.

Dweve Core: Η ολοκληρωμένη πλατφόρμα για διακριτή τεχνητή νοημοσύνη

Το Dweve Core είναι μια ενοποιημένη πλατφόρμα για τη δημιουργία διακριτών νευρωνικών δικτύων με ακρίβεια από δυαδική έως 8 bit. Δεν είναι άλλο ένα πλαίσιο. Είναι μια πλήρης αντικατάσταση για τη διάσπαρτη στοίβα σου.

Μία εγκατάσταση. Ένα API. Ένας κώδικας. Αυτόματη ανάπτυξη σε CPU, GPU, FPGA, WebAssembly, οπουδήποτε χρειάζεται να τρέξεις.

Να τι σημαίνει ολοκληρωμένο:

1.930 αλγόριθμοι που καλύπτουν κάθε λειτουργία που χρειάζεσαι:

  • 415 βασικές λειτουργίες: Ατομικές λειτουργίες όπως XNOR, popcount, χειρισμός bit, κβαντοποίηση, μετατροπή μεταξύ μορφών
  • 500 πυρήνες: Βελτιστοποιημένες σύνθετες λειτουργίες για κοινά μοτίβα
  • 191 επίπεδα: Πλήρη δομικά στοιχεία νευρωνικών δικτύων (συνέλιξη, πυκνό, κανονικοποίηση, ενεργοποίηση, προσοχή)
  • 674 αλγόριθμοι: Μέθοδοι υψηλού επιπέδου που περιλαμβάνουν μετασχηματισμούς, διαδικασίες εκπαίδευσης, εξελικτική αναζήτηση, απόσταξη γνώσης
  • 30 βοηθητικά εργαλεία διαλειτουργικότητας: Προαιρετικές γέφυρες κινητής υποδιαστολής για υβριδικές προσεγγίσεις
  • 120 αρχιτεκτονικές μοντέλων: Προβελτιστοποιημένα πρότυπα δικτύων από ResNet έως Transformers

Αυτό δεν είναι υποσύνολο. Είναι μαθηματική πληρότητα. Αναλύσαμε κάθε σημαντική αρχιτεκτονική νευρωνικού δικτύου και δημιουργήσαμε κάθε λειτουργία που απαιτούν, βελτιστοποιημένη για διακριτό υπολογισμό από πρώτες αρχές.

6 υποσυστήματα με αυτόματη μεταγλώττιση:

  • SIMD CPU: Χειροκίνητα βελτιστοποιημένοι πυρήνες για x86 και ARM με αυτόματη ανίχνευση ISA (SSE2, AVX2, AVX-512, NEON, SVE/SVE2)
  • CUDA: Βελτιστοποίηση για GPU NVIDIA με βασικές λειτουργίες σε επίπεδο warp και χρήση Tensor Core
  • Rust-HDL: Άμεση σύνθεση FPGA και ASIC από περιγραφές αλγορίθμων
  • WebAssembly: Συμπερασμοί στον περιηγητή με υποστήριξη SIMD128 για επεξεργασία στη συσκευή σύμφωνη με τον GDPR
  • ROCm: Βελτιστοποίηση για GPU AMD με λειτουργίες σε επίπεδο wavefront
  • Metal: Βελτιστοποίηση για Apple Silicon με χρήση ενοποιημένης αρχιτεκτονικής μνήμης

6 πλάτη bit με προσαρμοστική ακρίβεια:

  • Δυαδικό (1 bit): Μέγιστη απόδοση με συμπίεση 16× σε σύγκριση με FP16
  • Τριαδικό: {-1, 0, +1} με ρητή αραιότητα
  • 2 bit: Τέσσερα επίπεδα για ισορροπημένη συμπίεση
  • 3 bit: Οκτώ επίπεδα για επίπεδα ευαίσθητα στην ποιότητα
  • 4 bit: Δεκαέξι επίπεδα που πλησιάζουν την ποιότητα FP16
  • 8 bit: Σχεδόν πλήρης ακρίβεια για κρίσιμες λειτουργίες

Η πλατφόρμα μαθαίνει το βέλτιστο εύρος bit ανά επίπεδο κατά τη διάρκεια της εκπαίδευσης μέσω επιλογής με βάση την κλίση. Όχι ευρετικοί κανόνες. Όχι εικασίες. Πραγματική βελτιστοποίηση με βάση το πώς βελτιώνεται η ακρίβεια με την πρόσθετη ακρίβεια.

Adaptive Multi-Bit Quantization: Layer-specific precision allocation
Η στοίβα των 1.930 αλγορίθμων δεν είναι μια χαλαρή λίστα χαρακτηριστικών· είναι ένα ταξινομημένο ερμάριο από πρωτόγονα, πυρήνες, επίπεδα, μεθόδους, γέφυρες και πρότυπα μοντέλων.

Γράψτε μία φορά, αναπτύξτε παντού

Η πλατφόρμα χρησιμοποιεί μια δηλωτική διεπαφή Rust. Περιγράφετε τι θέλετε και ο μεταγλωττιστής βρίσκει πώς να το εκτελέσει βέλτιστα στο υλικό-στόχο σας.

Παράδειγμα ορισμού δικτύου:

let model = NetworkBuilder::new()
    .input(BinaryTensor::new([1024, 784]))
    .dense(784, 512, activation=BinaryActivation::Sign)
    .dense(512, 256, activation=BinaryActivation::Sign)
    .output(256, 10)
    .build();

Αυτό είναι όλο. Το γράφετε μία φορά και ο μεταγλωττιστής δημιουργεί αυτόματα βελτιστοποιημένες υλοποιήσεις για κάθε υποδομή.

Η διαδικασία μεταγλώττισης λειτουργεί σε τέσσερα επίπεδα:

Επίπεδο 1: Ενδιάμεση αναπαράσταση νευρωνικού δικτύου - Η περιγραφή του δικτύου υψηλού επιπέδου αναλύεται σε ένα υπολογιστικό γράφημα με λειτουργίες, ροή δεδομένων και υπερπαραμέτρους.

Επίπεδο 2: Βελτιστοποίηση γραφήματος - Τυπικά περάσματα μεταγλωττιστή εξαλείφουν τον νεκρό κώδικα, διπλώνουν σταθερές, αφαιρούν διπλότυπες εκφράσεις και συντήκουν διαδοχικές λειτουργίες. Ένα πυκνό επίπεδο που ακολουθείται από κανονικοποίηση παρτίδας και ενεργοποίηση γίνεται ένας ενιαίος συγχωνευμένος πυρήνας που φορτώνει την είσοδο μία φορά και παράγει το τελικό αποτέλεσμα.

Επίπεδο 3: Διάλεκτος BitOps - Το γράφημα υποβιβάζεται σε λειτουργίες επιπέδου bit με ρητή σήμανση ακρίβειας. Αυτή η ενδιάμεση αναπαράσταση είναι ανεξάρτητη από το υλικό αλλά κοντά στις πραγματικές λειτουργίες μηχανής. Βασίζεται στην υποδομή MLIR (Multi-Level Intermediate Representation) για βελτιστοποίηση βιομηχανικής κλίμακας.

Επίπεδο 4: Υποβιβασμός σε υλικό - Η τελική δημιουργία κώδικα παράγει υλοποιήσεις ειδικές για την πλατφόρμα. Για AVX-512, οι λειτουργίες bit γίνονται εντολές VPXORQ και VPOPCNTQ. Για CUDA, γίνονται ενδογενείς λειτουργίες σε επίπεδο warp με συνεκτική πρόσβαση στη μνήμη. Για FPGA, γίνονται πύλες XNOR και δέντρα αθροιστών που συντίθενται σε Verilog.

Write once, deploy everywhere with optimal performance

Ο ίδιος πηγαίος κώδικας εκτελείται στην CPU του φορητού σας κατά την ανάπτυξη, αναπτύσσεται σε GPU στο cloud στην παραγωγή και μεταγλωττίζεται σε FPGA για ντετερμινιστικό συμπέρασμα σε πραγματικό χρόνο. Χωρίς μετάφραση. Χωρίς μεταφορά. Χωρίς κώδικα ειδικό για πλατφόρμα.

Φτιαγμένο για να το χρησιμοποιούν οι πελάτες

Το Dweve Core τροφοδοτεί το Dweve Loom, το σύστημά μας συλλογιστικής με περιορισμούς. Αλλά δεν είναι μόνο για εμάς. Είναι μια πλήρης πλατφόρμα για οποιονδήποτε κατασκευάζει διακριτά νευρωνικά δίκτυα.

Μπορείτε να δημιουργήσετε:

  • Προσαρμοσμένες αρχιτεκτονικές χρησιμοποιώντας τους 191 τύπους επιπέδων και τους 674 αλγορίθμους
  • Μοντέλα ειδικού πεδίου βελτιστοποιημένα για τις ακριβείς απαιτήσεις σας
  • Υβριδικές προσεγγίσεις που συνδυάζουν διακριτό και συνεχή υπολογισμό μέσω των 30 βοηθητικών εργαλείων διαλειτουργικότητας
  • Νέες μεθόδους εκπαίδευσης με εξελικτική αναζήτηση, απόσταξη γνώσης ή προσαρμοσμένους εκτιμητές κλίσης

Η πλατφόρμα παρέχει:

Πλήρης υποδομή εκπαίδευσης: Έξι παραλλαγές εκτιμητών σταθερής διαδρομής για ροή κλίσης δυαδικής/τριαδικής ακρίβειας. Βελτιστοποιητές με επίγνωση δυαδικής αναπαράστασης που διατηρούν εσωτερικά βάρη πλήρους ακρίβειας ενώ τα μετατρέπουν σε δυαδικά για τα εμπρόσθια περάσματα. Αυτόματη επιλογή πλάτους bit μέσω βελτιστοποίησης βάσει κλίσης. Προοδευτική απόσταξη πολλαπλών σταδίων από FP32 σε INT8, INT4, τριαδική και δυαδική ακρίβεια.

Αυτόματη βελτιστοποίηση υλικού: Ανίχνευση δυνατοτήτων CPU κατά τον χρόνο εκτέλεσης (CPUID σε x86, καταχωρητές συστήματος σε ARM) και αυτόματη δρομολόγηση στην ταχύτερη διαθέσιμη υλοποίηση SIMD. Παραλλαγές πυρήνων GPU που επιλέγονται βάσει μεγέθους warp, κοινόχρηστης μνήμης και αριθμού καταχωρητών. Σύνθεση FPGA με αυτόματη εισαγωγή καταχωρητών αγωγού βάσει περιορισμών χρονισμού.

Ευέλικτη κβάντιση: Συμμετρική και ασύμμετρη κβάντιση με κλίμακες ανά τανυστή, ανά κανάλι ή ανά ομάδα. Δυναμική κβάντιση με ανίχνευση εύρους κατά τον χρόνο εκτέλεσης ή στατική κβάντιση με προϋπολογισμένες κλίμακες από δεδομένα βαθμονόμησης. Υπολογισμός κλίμακας βέλτιστου MSE και βάσει απόκλισης KL για ελάχιστη απώλεια ακρίβειας.

Ο πελάτης γράφει ένα μοντέλο και ο μεταγλωττιστής το δρομολογεί σε στόχους CPU, GPU, FPGA, προγράμματος περιήγησης, AMD και Apple.

Γιατί έχει σημασία ο διακριτός υπολογισμός

Τα παραδοσιακά νευρωνικά δίκτυα υπολογίζουν τα πάντα σε κινητή υποδιαστολή 16 ή 32 bit και λαμβάνουν διακριτές αποφάσεις μόνο στο τέλος. Εμείς λειτουργούμε απευθείας στον διακριτό χώρο, από τα δυαδικά έως τα 8 bit, εξαλείφοντας τον ενδιάμεσο συνεχή υπολογισμό.

Αυτό δεν είναι απλή κβάντιση υπαρχόντων μοντέλων. Το πλαίσιο έχει σχεδιαστεί εξ αρχής γύρω από διακριτές λειτουργίες:

Πραγματικότητα υλικού: Οι σύγχρονοι επεξεργαστές αποτελούνται από δισεκατομμύρια τρανζίστορ σε δύο καταστάσεις. Μια πύλη XNOR απαιτεί 6 τρανζίστορ. Ένας πολλαπλασιαστής κινητής υποδιαστολής 32 bit απαιτεί χιλιάδες και καταναλώνει κατά τάξεις μεγέθους περισσότερη ενέργεια. Οι διακριτές λειτουργίες ευθυγραμμίζονται με τα θεμελιώδη χαρακτηριστικά του υλικού.

Αποδοτικότητα μνήμης: Τα δυαδικά βάρη συσκευάζουν 64 τιμές ανά λέξη 64 bit. Ένα ResNet-50 με 25,6 εκατομμύρια παραμέτρους καταλαμβάνει 3,1MB σε δυαδική μορφή έναντι 50MB σε FP16. Ολόκληρο το μοντέλο χωρά στην κρυφή μνήμη L3 της CPU (τυπικά: 36-64MB). Γίνεστε υπολογιστικά δεσμευμένοι αντί για δεσμευμένοι από τη μνήμη.

Ευελιξία ανάπτυξης: Τα μικρά μοντέλα επιτρέπουν συμπερασμούς εντός της συσκευής. Καμία εξάρτηση από το cloud. Καθόλου καθυστέρηση δικτύου. Καθόλου ανησυχίες για την προστασία δεδομένων. Επεξεργαστείτε ευαίσθητες πληροφορίες εξ ολοκλήρου στις συσκευές των χρηστών χωρίς ποτέ να τις μεταδώσετε σε διακομιστές.

Ο πλήρης πίνακας αλγορίθμων

Η πλατφόρμα παρέχει πλήρη κάλυψη σε τρεις διαστάσεις: αλγορίθμους, παρασκηνιακά συστήματα και πλάτη bit.

Θεμελιώδεις λειτουργίες (415 πρωτόγονες λειτουργίες):

  • 46 δυαδικές πράξεις: λογικές πύλες, χειρισμός, ολισθήσεις, μέτρηση, εύρεση
  • 16 πράξεις πεδίων: εξαγωγή, τοποθέτηση, συσκευασία, διασπορά, συγκέντρωση, δημιουργία μάσκας
  • 25 αναγωγές: λογικό AND/OR/XOR, αριθμητικό άθροισμα/γινόμενο, ψηφοφορία και συναίνεση
  • 17 μετρικές απόστασης: Hamming, Jaccard, Dice, Tanimoto, συνημίτονο, Manhattan, Ευκλείδεια
  • 12 πράξεις διαπλοκής: διαπλοκή 2 έως 4 κατευθύνσεων, καμπύλες πλήρωσης χώρου Morton και Hilbert
  • 44 αριθμητικές πράξεις: πρόσθεση, αφαίρεση, πολλαπλασιασμός, διαίρεση, πράξεις σταθερής υποδιαστολής
  • 39 μετασχηματισμοί: Walsh-Hadamard, FFT, DCT, NTT, κυματίδια (Haar, Daubechies, CDF97)
  • 11 συναρτήσεις κατακερματισμού: SHA-256, Blake3, xxHash, MinHash, SimHash, κατακερματισμός με ευαισθησία τοποθεσίας
  • 22 γεννήτριες τυχαίων αριθμών: LFSR, Mersenne Twister, ChaCha20, ακολουθίες Sobol
  • 15 κβαντισμοί: συμμετρικός, ασύμμετρος, ανά τανυστή, ανά κανάλι, υπολογισμός κλίμακας
  • 30 δυαδικά μαθηματικά: XNOR-popcount, τριαδική κωδικοποίηση, ενημερώσεις βαρών, πράξεις κλίσης
  • 48 μετατροπές μορφών: μετατροπές FP32/FP16/FP8/INT8/INT4/INT2 προς όλες τις κατευθύνσεις
  • 42 πράξεις σταθερής υποδιαστολής: αριθμητική, υπερβατικές συναρτήσεις, κορεσμός σε όλα τα πλάτη bit

Σύνθετες πράξεις (500 πυρήνες):

Βελτιστοποιημένοι πυρήνες που συνδυάζουν βασικές πράξεις για συνηθισμένα πρότυπα. Παραλλαγές πολλαπλασιασμού πινάκων (τυπικός, με μεταφορά, σε μπλοκ). Τύποι συνέλιξης (2D, 3D, ανά βάθος, ομαδοποιημένη, με διαστολή). Κανονικοποίηση (κατά παρτίδα, κατά στρώμα, κατά ομάδα, κατά παρουσία). Συναρτήσεις ενεργοποίησης (πρόσημο, σκληρή tanh, τμηματικά γραμμική). Μηχανισμοί προσοχής (αυτοπροσοχή, διασταυρούμενη προσοχή, πολλαπλής κεφαλής). Συνένωση (μέγιστη, μέση, στοχαστική).

Επίπεδα δικτύου (191 επίπεδα):

Πλήρη δομικά στοιχεία για την κατασκευή δικτύων. Πυκνά επίπεδα με δυαδικά, τριαδικά και πολλαπλών bit βάρη. Συνελικτικά επίπεδα με όλες τις συνηθισμένες παραλλαγές. Επαναλαμβανόμενα επίπεδα (LSTM, GRU με δυαδικές πύλες). Επίπεδα προσοχής (βαθμωτό γινόμενο, πολλαπλής κεφαλής, σχετική θέση). Επίπεδα κανονικοποίησης με στατιστικά παρτίδας και εκπαιδευόμενες παραμέτρους. Υπολειμματικές συνδέσεις με αντιστοίχιση διαστάσεων.

Αλγόριθμοι υψηλού επιπέδου (674 αλγόριθμοι):

Πλήρεις μέθοδοι για εκπαίδευση, εξαγωγή συμπερασμάτων και βελτιστοποίηση. Απόσταξη γνώσης με σταδιακή βελτίωση πολλαπλών σταδίων. Εξελικτική ανακάλυψη περιορισμών με γενετικό προγραμματισμό. Αναζήτηση αρχιτεκτονικής νευρωνικών δικτύων για διακριτά δίκτυα. Εκτιμητές κλίσης (άμεσης διέλευσης, με αποκοπή, προσαρμοστικοί, με ορμή, υπερδικτύου). Βελτιστοποιητές (BinaryAdam, TernaryAdam, προσαρμοστικός κβαντισμός). Κατανεμημένη εκπαίδευση με συγκέντρωση ανθεκτική σε βυζαντινά σφάλματα.

Ο διακριτός υπολογισμός έχει σημασία επειδή η ακρίβεια γίνεται προϋπολογισμός ανά επίπεδο αντί για προεπιλογή κινητής υποδιαστολής παντού.

Βάθος υλοποίησης υποσυστήματος

Κάθε αλγόριθμος υπάρχει σε πολλαπλές βελτιστοποιημένες παραλλαγές ανά υποσύστημα. Όχι γενικές υλοποιήσεις. Κώδικας ειδικός για το υλικό που αξιοποιεί κάθε αρχιτεκτονικό χαρακτηριστικό.

CPU SIMD: Το SSE2 παρέχει καθολική συμβατότητα x86-64 (κάθε επεξεργαστής από το 2001). Το AVX2 προσφέρει επιτάχυνση 4-8× σε Haswell και νεότερους (2013+). Το AVX-512 φτάνει σε 10-16× με καταχωρητές μάσκας για κατηγοριοποίηση και VPTERNLOG για οποιαδήποτε τριών εισόδων Boolean συνάρτηση. Το NEON προσφέρει επιτάχυνση 3-4× σε όλους τους επεξεργαστές ARMv8, συμπεριλαμβανομένων κινητών και Apple Silicon. Το SVE/SVE2 παρέχει κώδικα ανεξάρτητο από το μήκος διανύσματος που αξιοποιεί αυτόματα ευρύτερα διανύσματα σε νεότερο υλικό.

CUDA: Τα βασικά στοιχεία σε επίπεδο warp οργανώνουν 32 νήματα που εκτελούνται σε συγχρονισμένη λειτουργία. Κάθε νήμα επεξεργάζεται 32 δυαδικές τιμές συσκευασμένες σε uint32. Ολόκληρο το warp επεξεργάζεται 1.024 δυαδικές τιμές παράλληλα. Τα ενσωματωμένα στοιχεία υλικού περιλαμβάνουν __popc για καταμέτρηση πληθυσμού, __ballot_sync για ψηφοφορία warp, __shfl_sync για γρήγορη επικοινωνία χωρίς κοινόχρηστη μνήμη. Η συνεκτική πρόσβαση μνήμης εξασφαλίζει αξιοποίηση του εύρους ζώνης. Αξιοποίηση Tensor Core για λειτουργίες πινάκων ακόμη και με δυαδικά δεδομένα.

Rust-HDL: Άμεση σύνθεση υλικού από σχολιασμένο κώδικα Rust. Το πλαίσιο δημιουργεί αυτόματα Verilog/VHDL. Οι δυαδικές λειτουργίες XNOR-popcount αντιστοιχίζονται σε πύλες XNOR (συνδυαστική λογική, μηδενική καθυστέρηση διάδοσης) συν δέντρα προσθετών. Οι καταχωρητές σωλήνωσης εισάγονται αυτόματα βάσει περιορισμών χρονισμού. Συντίθεται τόσο σε FPGA (Xilinx, Intel) όσο και σε ASIC.

WebAssembly: Το SIMD128 παρέχει λειτουργίες διανυσμάτων 128-bit σε όλα τα σύγχρονα προγράμματα περιήγησης (Chrome 91+, Firefox 89+, Safari 16.4+). Οι λειτουργίες περιλαμβάνουν v128.and/or/xor για λογική bit και i8x16.popcnt για καταμέτρηση πληθυσμού. Σε συνδυασμό με Web Workers για πολυνηματική επεξεργασία και SharedArrayBuffer για κοινόχρηστη μνήμη, επιτυγχάνεται το 60-80% της απόδοσης του εγγενούς CPU. Η συμπερασματολογία στο πρόγραμμα περιήγησης επιτρέπει επεξεργασία συμβατή με GDPR χωρίς μεταφόρτωση σε διακομιστή.

ROCm: Βελτιστοποίηση σε επίπεδο wavefront για αρχιτεκτονικές AMD με 64 νήματα ανά wavefront (διπλάσια από τα 32 της NVIDIA). Κάθε νήμα επεξεργάζεται 32 δυαδικές τιμές, δηλαδή 2.048 τιμές ανά wavefront. Παρόμοια βασικά στοιχεία με την CUDA, με __builtin_popcount, __ballot και ds_swizzle. Το μοντέλο προγραμματισμού είναι αρκετά κοντά ώστε οι προγραμματιστές CUDA να γράφουν άμεσα κώδικα ROCm.

Metal: Βελτιστοποίηση για Apple Silicon με ενοποιημένη αρχιτεκτονική μνήμης, όπου CPU και GPU μοιράζονται φυσική RAM με συνοχή κρυφής μνήμης. Εξαλείφεται το κόστος αντιγραφής δεδομένων. Οι δυαδικές λειτουργίες αξιοποιούν τις προσαρμοσμένες μηχανές πινάκων της Apple. Το Neural Engine του M3 Max προσφέρει 50-80 TOPS σε δυαδική συμπερασματολογία, χρησιμοποιώντας αποκλειστικούς επιταχυντές ενσωματωμένους στο SoC.

Τι δεν κάνουμε (και γιατί η εστίαση έχει σημασία)

Σημαντικό να διευκρινιστεί: δεν κάνουμε τα πάντα. Η εστίαση επιτρέπει την αριστεία.

Καμία συμπερασματολογία κινητής υποδιαστολής: Μόνο διακριτός υπολογισμός από δυαδικό έως 8-bit. Αν χρειάζεστε FP32/FP16/BFloat16 για ανάπτυξη, χρησιμοποιήστε PyTorch ή JAX. Βελτιστοποιούμε αποκλειστικά για διακριτές λειτουργίες, επιτρέποντας εξειδικεύσεις αδύνατες με μικτή ακρίβεια κινητής υποδιαστολής. Δεν μπορείς να είσαι άριστος σε όλα. Επιλέξαμε τη διακριτή τεχνητή νοημοσύνη και βελτιστοποιήσαμε αδίστακτα.

Καθόλου δυναμικά γραφήματα συμπερασματολογίας: Τα μοντέλα μεταγλωττίζονται σε στατικά γραφήματα για ανάπτυξη. Η εκπαίδευση υποστηρίζει δυναμικό υπολογισμό (απαραίτητο για ευελιξία στην έρευνα), αλλά η συμπερασματολογία παραγωγής είναι στατική. Αυτό επιτρέπει βελτιστοποίηση εκ των προτέρων: συγχώνευση πυρήνων σε ολόκληρο το δίκτυο, βελτιστοποίηση διάταξης μνήμης με γνωστά σχήματα τανυστών, εισαγωγή εντολών προφόρτωσης με προβλέψιμα μοτίβα πρόσβασης.

Εστιασμένη προεπεξεργασία δεδομένων: Παρέχουμε 8 εξειδικευμένους αλγορίθμους για προετοιμασία εισόδου νευρωνικών δικτύων (κανονικοποίηση, προσαρμοστική κλιμάκωση, εκμάθηση κβαντισμού, δυαδική επαύξηση), όχι γενικής χρήσης ETL. Για αγωγούς μηχανικής χαρακτηριστικών και φόρτωση δεδομένων, χρησιμοποιήστε υπάρχοντα εργαλεία (Pandas, Polars, DuckDB). Είμαστε άριστοι στη διακριτή συμπερασματολογία νευρωνικών δικτύων από δυαδικό έως 8-bit. Δεν αντικαθιστούμε ολόκληρη τη στοίβα δεδομένων σας.

Αυτά δεν είναι περιορισμοί. Είναι εστίαση. Περιορίζοντας το πεδίο σε διακριτά νευρωνικά δίκτυα με στατικά γραφήματα συμπερασματολογίας, επιτυγχάνουμε βάθος βελτιστοποίησης που τα ολοκληρωμένα πλαίσια δεν μπορούν να φτάσουν.

Χτίζοντας πάνω στο Dweve Core

Η πλατφόρμα είναι έτοιμη προς χρήση. Μπορείτε να αρχίσετε να χτίζετε διακριτά νευρωνικά δίκτυα σήμερα.

Πλήρης εργαλειοθήκη:

  • Δηλωτικό API: Rust DSL με NetworkBuilder για τον ορισμό μοντέλων
  • Υποδομή μεταγλωττιστή: Αγωγός βελτιστοποίησης βασισμένος σε MLIR με τέσσερα επίπεδα IR
  • Πλαίσιο εκπαίδευσης: Έξι παραλλαγές STE, δυαδικοί βελτιστοποιητές, αυτόματη επιλογή πλάτους bit
  • Γεννήτριες κώδικα υποστήριξης: C με intrinsics για CPU, πυρήνες CUDA/HIP για GPU, Verilog για FPGA
  • Εργαλεία ανάπτυξης: Εξαγωγή σε ONNX, Core ML, TensorFlow Lite ή αυτόνομα εκτελέσιμα

Παράδειγμα ροής εργασίας:

1. Ορίστε το δίκτυό σας χρησιμοποιώντας το NetworkBuilder
2. Εκπαιδεύστε με δυαδικούς βελτιστοποιητές και προσαρμοστική επιλογή πλάτους bit
3. Μεταγλωττίστε για το υλικό-στόχο με αυτόματη επιλογή υποστήριξης
4. Αναπτύξτε ως βελτιστοποιημένο δυαδικό ή εξάγετε σε τυπική μορφή
5. Εκτελέστε οπουδήποτε: διακομιστές cloud, συσκευές άκρου, προγράμματα περιήγησης, FPGA

Μία πλατφόρμα. Ένας κώδικας. Κάθε υποστήριξη. Πλήρες διακριτό AI.

Σταματήστε να διαχειρίζεστε δέκα πλαίσια. Σταματήστε να ξαναγράφετε κώδικα για κάθε στόχο ανάπτυξης. Σταματήστε να παλεύετε με τη συμβατότητα εκδόσεων. Δημιουργήστε μία φορά στο Dweve Core και αναπτύξτε παντού.


Το Dweve Core τροφοδοτεί το Dweve Loom, το σύστημα συλλογισμού βάσει περιορισμών που κυκλοφορεί το 2026. Το πλαίσιο υλοποιεί την πλήρη στοίβα 1.930 αλγορίθμων σε 6 υποστηρίξεις με προσαρμοστική κβάντιση πολλαπλών bit από δυαδικό έως 8 bit. Δημιουργήθηκε από ολλανδική ομάδα μηχανικών σε τρία χρόνια ανάπτυξης.

Η δημιουργία στο Dweve Core λειτουργεί επειδή το bench κρατά τον αγωγό νευρωνικών δικτύων εντός και αφήνει εκτός τη γενική εξάπλωση.