Γιατί το να ποντάρεις τα πάντα στην NVIDIA είναι στρατηγικός κίνδυνος
Η παγίδα της μονοκαλλιέργειας
Φανταστείτε ότι το 95% των αυτοκινήτων στον κόσμο μπορούσε να λειτουργήσει μόνο με ένα συγκεκριμένο τύπο βενζίνης που πωλείται από μία και μόνο εταιρεία. Φανταστείτε ότι το διυλιστήριο αυτής της εταιρείας βρισκόταν σε ένα γεωλογικά ασταθές νησί. Φανταστείτε ότι κάθε άλλος κατασκευαστής αυτοκινήτων έπρεπε να σχεδιάσει τους κινητήρες του ώστε να ταιριάζουν με αυτό το συγκεκριμένο μείγμα καυσίμου.
Αν αυτή η εταιρεία είχε ένα πρόβλημα στην παραγωγή, ή ανέβαζε τις τιμές κατά 400%, ή αν ένας αποκλεισμός απομόνωνε το νησί, η παγκόσμια οικονομία θα σταματούσε απότομα. Οι μεταφορές θα έπαυαν να λειτουργούν.
Αυτό ακούγεται σαν δυστοπική φαντασία, αλλά είναι η ακριβής πραγματικότητα της βιομηχανίας Τεχνητής Νοημοσύνης σήμερα.
Το 2025, περίπου το 95% της εκπαίδευσης και της υψηλής απόδοσης εξαγωγής συμπερασμάτων στην ΤΝ πραγματοποιείται σε GPU που κατασκευάζονται από μία εταιρεία: τη NVIDIA. Ολόκληρη η παγκόσμια στοίβα ΤΝ (από τα πλαίσια PyTorch έως τα σχέδια ψύξης των κέντρων δεδομένων) είναι βελτιστοποιημένη για την αρχιτεκτονική της NVIDIA. Η βιομηχανία είναι εθισμένη στην CUDA, την ιδιόκτητη πλατφόρμα λογισμικού της NVIDIA.
Η NVIDIA είναι μια εξαιρετική εταιρεία. Δημιούργησαν απίστευτη τεχνολογία. Αλλά αυτή η μονοκαλλιέργεια είναι ένας στρατηγικός εφιάλτης. Δημιουργεί ένα ενιαίο σημείο αστοχίας (SPOF) για ολόκληρο το μέλλον της ανθρώπινης νοημοσύνης.
Η Δομική Έλλειψη
Όλοι έχουμε ζήσει τις ελλείψεις H100 του 2023 και του 2024. Οι νεοφυείς επιχειρήσεις περίμεναν 12 μήνες για υλικό. Οι κυβερνήσεις αποθήκευαν τσιπ σαν χρυσές ράβδους. Η τιμή της υπολογιστικής ισχύος εκτοξεύτηκε.
Αυτό δεν ήταν απλώς ένα προσωρινό πρόβλημα στην εφοδιαστική αλυσίδα. Ήταν ένα δομικό σημείο συμφόρησης. Η κατασκευή αυτών των τσιπ βασίζεται σε μια εξαιρετικά πολύπλοκη διαδικασία που ονομάζεται CoWoS (Chip-on-Wafer-on-Substrate) προηγμένη συσκευασία, που εκτελείται κυρίως από την TSMC στην Ταϊβάν. Η δυνατότητα κατασκευής αυτών των συσκευασιών είναι πεπερασμένη. Οι νόμοι της φυσικής είναι πεπερασμένοι.
Αν η στρατηγική σας για την AI βασίζεται στην απόκτηση πρόσβασης στο πιο πρόσφατο και καλύτερο τσιπ της NVIDIA, στοιχηματίζετε την επιβίωση της εταιρείας σας σε μια εφοδιαστική αλυσίδα που δεν ελέγχετε, για ένα προϊόν που δημοπρατείται στον πλειοδότη.
Το Χαντάκι της CUDA
Το πραγματικό κλείδωμα δεν είναι το υλικό, είναι το λογισμικό. Η CUDA είναι η γλώσσα της AI. Για 15 χρόνια, ερευνητές και φοιτητές έχουν μάθει να γράφουν πυρήνες CUDA. Οι βιβλιοθήκες είναι βελτιστοποιημένες για CUDA. Αν προσπαθήσετε να εκτελέσετε τυπικό κώδικα AI σε μια κάρτα AMD ή σε έναν επιταχυντή της Intel, συχνά μπαίνετε σε έναν κόσμο πόνου: σπασμένες εξαρτήσεις, χαμένοι πυρήνες και κακή απόδοση.
Αυτό το «χαντάκι CUDA» κρατάει έξω τους ανταγωνιστές. Εξασφαλίζει ότι ακόμα κι αν η AMD φτιάξει ένα τσιπ που είναι ταχύτερο και φθηνότερο (που το έχει κάνει), κανείς δεν το αγοράζει, επειδή το λογισμικό δεν «δουλεύει» απλώς.
Η φιλοσοφία της Dweve: Να τρέχει παντού
Στη Dweve, πήραμε μια ριζική απόφαση από νωρίς. Κοιτάξαμε την παγίδα CUDA και είπαμε: «Όχι».
Αποφασίσαμε ότι δεν θα γράφαμε ούτε μία γραμμή CUDA. Δεν θα εξαρτιόμασταν από μια ιδιόκτητη στοίβα υλικού.
Αντίθετα, χτίσαμε τη στοίβα μας πάνω σε ανοιχτά πρότυπα. Χρησιμοποιούμε Vulkan (το API γραφικών που τρέχει παντού, από τηλέφωνα Android μέχρι διακομιστές Linux). Χρησιμοποιούμε OpenCL. Χρησιμοποιούμε SPIR-V. Βασιζόμαστε σε ενδιάμεσες αναπαραστάσεις (IR) όπως το MLIR (Multi-Level Intermediate Representation).
Αλλά το πραγματικό μυστικό δεν είναι μόνο το API· είναι τα μαθηματικά.
Επειδή τα Δυαδικά Νευρωνικά Δίκτυα (BNNs) βασίζονται σε απλές ακέραιες πράξεις (XNOR και POPCNT) αντί για πολύπλοκους πολλαπλασιασμούς πινάκων κινητής υποδιαστολής, δεν εξαρτόμαστε από τα συγκεκριμένα «Tensor Cores» που μόνο η NVIDIA κάνει καλά.
Τα Tensor Cores είναι εξειδικευμένες μονάδες υλικού σχεδιασμένες να εκτελούν ταχύτατα μαθηματικά κινητής υποδιαστολής 16-bit. Αν ο αλγόριθμός σας βασίζεται σε FP16, χρειάζεστε ένα Tensor Core. Αν ο αλγόριθμός σας βασίζεται σε λογική 1-bit, δεν χρειάζεστε. Χρειάζεστε μόνο βασικές ψηφιακές πύλες λογικής.
Αυτή η αρχιτεκτονική ελευθερία μας επιτρέπει να λειτουργούμε αποδοτικά σε μια εντυπωσιακή ποικιλία υλικού:
1. AMD ROCm
Οι κάρτες Instinct της AMD προσφέρουν τεράστια ακατέργαστη υπολογιστική ισχύ και εύρος ζώνης μνήμης ανά δολάριο. Για φόρτους εργασίας κινητής υποδιαστολής, η στοίβα λογισμικού (ROCm) ήταν ιστορικά το αδύνατο σημείο. Αλλά για τους δυαδικούς φόρτους εργασίας μας, μεταγλωττίζουμε απευθείας σε ISA (Αρχιτεκτονική Συνόλου Εντολών). Παρακάμπτουμε τις αναξιόπιστες βιβλιοθήκες. Σε υλικό της AMD, τα μοντέλα Dweve πετούν.
2. Επεξεργαστές Intel (AVX-512)
Όλοι αγνοούν τον ταπεινό επεξεργαστή. Αλλά οι σύγχρονοι επεξεργαστές Intel Xeon διαθέτουν ένα σύνολο εντολών που ονομάζεται AVX-512. Αυτό επιτρέπει στον επεξεργαστή να επεξεργάζεται 512 bit δεδομένων σε έναν μόνο κύκλο. Για ένα Δυαδικό Νευρωνικό Δίκτυο, αυτό σημαίνει 512 νευρώνες που επεξεργάζονται άμεσα. Μπορούμε να εκτελούμε υψηλής απόδοσης συμπερασμούς σε τυπικούς διακομιστές που οι εταιρείες ήδη κατέχουν. Δεν απαιτείται GPU.
3. RISC-V
Το RISC-V είναι η αρχιτεκτονική υλικού ανοιχτού κώδικα του μέλλοντος. Είναι για τα τσιπ ό,τι ήταν το Linux για τα λειτουργικά συστήματα. Τρέχουμε εγγενώς σε επιταχυντές RISC-V. Αυτό είναι κρίσιμο για την Ευρώπη και τις αναπτυσσόμενες χώρες που θέλουν να αναπτύξουν τις δικές τους εγχώριες βιομηχανίες τσιπ, ανεξάρτητες από τους ελέγχους εξαγωγών των ΗΠΑ.
4. FPGA (Επιτόπια Προγραμματιζόμενες Πύλες)
Αυτό είναι το πιο συναρπαστικό σύνορο. Ένα FPGA είναι ένα τσιπ «λευκού καμβά» που μπορεί να επανακαλωδιωθεί σε χιλιοστά του δευτερολέπτου. Επειδή τα δίκτυά μας χρησιμοποιούν απλές λογικές πύλες, μπορούμε να καλωδιώσουμε φυσικά το τσιπ ώστε να ταιριάζει με τη δομή του νευρωνικού δικτύου. Τα δεδομένα ρέουν μέσα στο τσιπ σαν νερό μέσα από σωλήνες, με μηδενική επιβάρυνση. Αυτό προσφέρει εξαιρετικά χαμηλή καθυστέρηση (μικροδευτερόλεπτα) και ακραία ενεργειακή απόδοση.
Στρατηγική Ανθεκτικότητα και Κυριαρχία
Για τους πελάτες μας (ειδικά κυβερνήσεις, υπηρεσίες άμυνας και παρόχους κρίσιμων υποδομών), αυτή η αδιαφορία για το υλικό είναι ένα καθοριστικό χαρακτηριστικό.
Σημαίνει ότι δεν είναι εγκλωβισμένοι από κυρώσεις. Αν μια γεωπολιτική κρίση κόψει την πρόσβαση σε αμερικανικά τσιπ, μπορούν να τρέξουν τα μοντέλα Dweve τους σε ευρωπαϊκά τσιπ ή σε ευρέως διαθέσιμο παλαιότερο πυρίτιο. Έχουν ένα «Σχέδιο Β».
Σημαίνει ότι έχουν διαπραγματευτική δύναμη. Δεν εξαρτώνται από τις ιδιοτροπίες τιμολόγησης ενός μόνο προμηθευτή. Αν η NVIDIA αυξήσει τις τιμές, μπορούν να στραφούν στην AMD ή σε εξειδικευμένα ASIC χωρίς να ξαναγράψουν το λογισμικό τους.
Σημαίνει επίσης μακροζωία. Ένα NVIDIA H100 θα είναι ξεπερασμένο σε 3 χρόνια. Σε βιομηχανικά περιβάλλοντα (τρένα, εργοστάσια, σταθμοί παραγωγής ενέργειας), ο εξοπλισμός πρέπει να διαρκέσει 20 χρόνια. Ένα γενικής χρήσης FPGA ή ένας τυπικός επεξεργαστής θα είναι επισκευάσιμος για δεκαετίες. Χτίζουμε λογισμικό που σέβεται τον κύκλο ζωής του φυσικού κόσμου.
Η Εποχή Μετά το GPU
Πιστεύουμε ότι η κυριαρχία της Γενικής Χρήσης GPU (GPGPU) για την τεχνητή νοημοσύνη είναι μια ιστορική ανωμαλία. Ήταν το σωστό εργαλείο για τη φάση πρωτοτυποποίησης της τεχνητής νοημοσύνης, επειδή ήταν ευέλικτο και διαθέσιμο. Αλλά καθώς η τεχνητή νοημοσύνη μπαίνει στη φάση ανάπτυξης, θα δούμε μια έκρηξη εξειδικευμένου υλικού ανάλογη της Καμβρίου.
Θα δούμε Αναλογική Υπολογιστική. Οπτική Υπολογιστική. Νευρομορφική Υπολογιστική. Υπολογιστική Εντός Μνήμης. Αυτές οι αρχιτεκτονικές είναι όλες θεμελιωδώς ασύμβατες με το CUDA. Απαιτούν μια νέα στοίβα λογισμικού.
Αποσυνδέοντας το λογισμικό μας από το μονοπώλιο υλικού σήμερα, η Dweve είναι προετοιμασμένη για το μέλλον. Δεν χτίζουμε μόνο για τα τσιπ του 2025· χτίζουμε για τη φυσική του 2035.
Θέλετε τεχνητή νοημοσύνη που τρέχει με τους δικούς σας όρους, όχι με αυτούς της NVIDIA; Η αρχιτεκτονική της Dweve που είναι ανεξάρτητη από το υλικό σας δίνει στρατηγική ελευθερία, έλεγχο κόστους και κυρίαρχη ανθεκτικότητα. Επικοινωνήστε μαζί μας για να ανακαλύψετε πώς τα Δυαδικά Νευρωνικά Δίκτυά μας μπορούν να τρέξουν στο υλικό που ήδη κατέχετε ή στο ανοιχτό πυρίτιο του αύριο.