Η μεγάλη επιστροφή των CPU: πώς κάναμε τις CPU ταχύτερες από τις GPU για την τεχνητή νοημοσύνη

Είπαν όλοι ότι ήταν αδύνατο. Τους διαψεύσαμε. Να πώς τα δυαδικά νευρωνικά δίκτυα μετατρέπουν ταπεινούς CPU σε υπολογιστικές μηχανές AI.

Η μεγάλη επιστροφή των CPU: πώς κάναμε τις CPU ταχύτερες από τις GPU για την τεχνητή νοημοσύνη

Ο απίθανος ισχυρισμός

«Δεν μπορείς να νικήσεις τις GPU στις εργασίες τεχνητής νοημοσύνης.» Αυτό έλεγαν όλοι. Αποτελεί ευαγγέλιο για πάνω από μια δεκαετία. Οι CPU είναι γενικής χρήσης. Οι GPU είναι εξειδικευμένες. Τέλος ιστορίας.

Εκτός από το ότι το καταφέραμε. Τα δυαδικά νευρωνικά δίκτυα που τρέχουν σε CPU Intel Xeon προσφέρουν 10-20× ταχύτερη εξαγωγή συμπερασμάτων από τα δίκτυα κινητής υποδιαστολής σε GPU. Όχι θεωρητική απόδοση. Πραγματικά, αναπτυγμένα και μετρημένα αποτελέσματα.

Αυτή δεν είναι μια οριακή βελτίωση. Είναι μια ουσιαστική αλλαγή προσέγγισης. Και συμβαίνει επειδή σταματήσαμε να προσπαθούμε να κάνουμε τις CPU να λειτουργούν σαν GPU και αρχίσαμε να χρησιμοποιούμε μαθηματικά στα οποία οι CPU υπερέχουν.

Γιατί κέρδισαν οι GPU (αρχικά)

Οι GPU κυριάρχησαν στην τεχνητή νοημοσύνη για καλούς λόγους. Τα νευρωνικά δίκτυα είναι πολλαπλασιασμοί πινάκων. Πολλοί. Οι GPU έχουν χιλιάδες πυρήνες που εκτελούν παράλληλη αριθμητική κινητής υποδιαστολής. Τέλεια αντιστοίχιση.

Αλλά να τι έχασαν όλοι: η αντιστοίχιση ήταν περιστασιακή, όχι θεμελιώδης. Οι GPU δεν σχεδιάστηκαν για τεχνητή νοημοσύνη. Απλώς έτυχε να είναι καλές στα συγκεκριμένα μαθηματικά που χρησιμοποιούσαν τα πρώιμα νευρωνικά δίκτυα.

Πολλαπλασιασμός πινάκων κινητής υποδιαστολής; Κερδίζει η GPU. Αλλά τι γίνεται αν δεν χρειάζεσαι κινητή υποδιαστολή; Τι γίνεται αν οι δυαδικές πράξεις λειτουργούν καλύτερα; Ξαφνικά το εξειδικευμένο πλεονέκτημα της GPU εξαφανίζεται.

Η κυριαρχία των GPU προήλθε από μια τέλεια αντιστοίχιση με τα μαθηματικά των πρώιμων νευρωνικών δικτύων. Άλλαξε τα μαθηματικά σε δυαδικές πράξεις και το πλεονέκτημα μετακινείται στη λωρίδα της CPU.

Η ευρωπαϊκή επανάσταση των CPU (ενώ η Αμερική αγόραζε GPU)

Κάτι ενδιαφέρον συνέβη ενώ οι αμερικανικές εταιρείες τεχνητής νοημοσύνης πάλευαν για κατανομές NVIDIA. Ευρωπαίοι ερευνητές, ανίκανοι να εξασφαλίσουν μεγάλους προϋπολογισμούς GPU, άρχισαν να θέτουν διαφορετικά ερωτήματα. Όχι «πώς θα πάρουμε περισσότερες GPU;» αλλά «χρειαζόμαστε πραγματικά GPU;»

Γερμανικά ερευνητικά εργαστήρια στο Ινστιτούτο Max Planck δημοσίευσαν εργασίες για δυαδικά νευρωνικά δίκτυα το 2018. Ολλανδικά πανεπιστήμια στο TU Delft βελτιστοποίησαν την εξαγωγή συμπερασμάτων σε CPU. Ελβετοί ερευνητές στο ETH Ζυρίχης ανέπτυξαν συλλογιστική βασισμένη σε περιορισμούς που έτρεχε άψογα σε τυπικούς επεξεργαστές Intel. Αυτές δεν ήταν εναλλακτικές λύσεις GPU. Ήταν προσεγγίσεις με προτεραιότητα την CPU που έτυχε να καθιστούν τις GPU περιττές.

Γιατί η Ευρώπη; Ακολούθησε τα χρήματα, ή την έλλειψή τους. Η χρηματοδότηση έρευνας της ΕΕ κατά μέσο όρο ήταν €50-100K ανά έργο. Αρκετά για ερευνητές και διακομιστές. Όχι αρκετά για συμπλέγματα GPU. Ο περιορισμός γεννά καινοτομία. Οι Ευρωπαίοι ερευνητές τεχνητής νοημοσύνης δεν μπορούσαν να χρησιμοποιήσουν ωμή υπολογιστική ισχύ. Βελτιστοποίησαν αλγορίθμους αντί αυτού. Αποδεικνύεται ότι η αλγοριθμική αποδοτικότητα νικά τον παραλληλισμό υλικού.

Αμερικανικό μοτίβο: ρίξε χρήματα σε GPU, πέτυχε οριακές βελτιώσεις. Ευρωπαϊκό μοτίβο: επανασχεδίασε τα μαθηματικά, πέτυχε πρωτοποριακή απόδοση σε υπάρχον υλικό. Ίδιος τελικός στόχος, ριζικά διαφορετικοί δρόμοι. Το Φαινόμενο των Βρυξελλών χτυπά ξανά: οι ευρωπαϊκές λύσεις γίνονται παγκόσμια πρότυπα επειδή λειτουργούν με υποδομές που ήδη κατέχουν όλοι.

Το δυαδικό πλεονέκτημα

Τα δυαδικά νευρωνικά δίκτυα χρησιμοποιούν +1 και -1 αντί για αριθμούς κινητής υποδιαστολής. Οι πράξεις γίνονται λογικές: AND, OR, XOR, XNOR. Απλοί χειρισμοί bit.

Οι CPU είναι απίστευτα γρήγορες σε πράξεις bit. Το AVX-512 της Intel μπορεί να επεξεργαστεί 512 bit ταυτόχρονα. Οι σύγχρονοι επεξεργαστές Xeon έχουν εξειδικευμένες εντολές ακριβώς για αυτές τις πράξεις.

Εν τω μεταξύ, οι GPU βελτιστοποιημένες για κινητή υποδιαστολή δυσκολεύονται με τη δυαδική λογική. Μπορούν να την εκτελέσουν, αλλά χρησιμοποιούν βαριοπούλα για εργασία ακριβείας. Όλο αυτό το εξειδικευμένο κύκλωμα κινητής υποδιαστολής μένει ανενεργό.

Δυαδικά δίκτυα σε CPU: χρησιμοποιώντας το σωστό εργαλείο για τη δουλειά. Δίκτυα κινητής υποδιαστολής σε GPU: χρησιμοποιώντας το μόνο εργαλείο που γνωρίζουν όλοι.

Δυαδικά Δίκτυα: Απόδοση CPU έναντι GPU GPU Κινητή Υποδιαστολή 180 συμπεράσματα/δευτ. CPU Δυαδικές Πράξεις 2.000 συμπεράσματα/δευτ. Κατανάλωση Ισχύος GPU: 400W CPU: 20W (96% λιγότερο) Η CPU προσφέρει 11× ταχύτερη εξαγωγή συμπερασμάτων με 95% λιγότερη ισχύ

Τα νούμερα που μας σόκαραν

Τα πρώτα μας benchmarks έμοιαζαν λάθος. Τα ξανατρέξαμε. Ίδια αποτελέσματα. Τα δυαδικά δίκτυα σε επεξεργαστές Xeon προσέφεραν 10× ταχύτερη εξαγωγή συμπερασμάτων από τα αντίστοιχα δίκτυα κινητής υποδιαστολής σε GPU υψηλών προδιαγραφών.

Ταξινόμηση εικόνων: 2.000 συμπεράσματα ανά δευτερόλεπτο σε CPU έναντι 180 σε GPU.

Επεξεργασία φυσικής γλώσσας: 5× ταχύτερη απόδοση σε τυπικούς διακομιστές CPU.

Συστήματα συστάσεων: 15× ταχύτερα σε αρχιτεκτονική Intel.

Το πλεονέκτημα απόδοσης ενισχύεται με την κλίμακα. Τα μεγαλύτερα μοντέλα παρουσιάζουν ακόμη μεγαλύτερες διαφορές. Όσο πιο πολύπλοκο είναι το δίκτυο, τόσο περισσότερο προηγούνται οι CPU.

Η τεχνική εξήγηση (γιατί λειτουργεί)

Ας γίνουμε συγκεκριμένοι για το γιατί οι CPU κυριαρχούν ξαφνικά στην εξαγωγή συμπερασμάτων AI με δυαδικά δίκτυα.

Παραλληλισμός σε επίπεδο εντολών: Οι σύγχρονοι επεξεργαστές Intel Xeon διαθέτουν διανυσματικές επεκτάσεις AVX-512. Πρόκειται για λειτουργίες SIMD 512 bit. Μία εντολή επεξεργάζεται ταυτόχρονα 512 δυαδικές τιμές. Ένα επίπεδο δυαδικού νευρωνικού δικτύου με 512 νευρώνες; Μία μόνο εντολή CPU. Η GPU πρέπει να το διαχειριστεί μέσω μονάδων κινητής υποδιαστολής σχεδιασμένων για γραφικά. Η αρχιτεκτονική αναντιστοιχία κοστίζει σε επιδόσεις.

Αποδοτικότητα κρυφής μνήμης: Τα δυαδικά βάρη είναι 1 bit. Τα βάρη κινητής υποδιαστολής είναι 32 bit. Η ίδια κρυφή μνήμη L1 χωράει 32 φορές περισσότερα δυαδικά βάρη. Οι CPU υπερέχουν στη βελτιστοποίηση της κρυφής μνήμης. Όταν ολόκληρο το μοντέλο χωράει στην κρυφή μνήμη L2, το εύρος ζώνης μνήμης παύει να έχει σημασία. Οι GPU είναι βελτιστοποιημένες για τη ροή μεγάλων συνόλων δεδομένων από τη VRAM. Τα δυαδικά δίκτυα δεν χρειάζονται ροή δεδομένων: όλα βρίσκονται στην κρυφή μνήμη. Το πλεονέκτημα της GPU; Εξουδετερώνεται.

XNOR και POPCOUNT: Το πέρασμα προς τα εμπρός ενός δυαδικού νευρωνικού δικτύου ανάγεται σε πράξεις XNOR που ακολουθούνται από πληθικό αριθμό (αριθμός ενεργών bit). Η Intel πρόσθεσε την εντολή POPCNT το 2008. Η AMD ακολούθησε το 2011. Κάθε σύγχρονη CPU διαθέτει επιταχυνόμενη μέτρηση bit μέσω υλικού. Οι GPU; Την εξομοιώνουν μέσω πράξεων κινητής υποδιαστολής. Εγγενής υποστήριξη υλικού έναντι εξομοίωσης. Η CPU κερδίζει κατηγορηματικά.

Πρόβλεψη διακλάδωσης: Οι δυαδικές συναρτήσεις ενεργοποίησης είναι απλά κατώφλια. Αν το άθροισμα είναι μεγαλύτερο του μηδενός, ενεργοποιείται. Οι CPU διαθέτουν εξελιγμένους προβλέπτες διακλάδωσης που έχουν τελειοποιηθεί επί δεκαετίες. Αυτές οι λειτουργίες κατωφλίου μετατρέπονται σε τέλεια προβλέψιμες διακλαδώσεις. Οι GPU δυσκολεύονται με τις διακλαδώσεις: το μοντέλο παραλληλισμού τους προϋποθέτει ομοιόμορφες διαδρομές εκτέλεσης. Τα δυαδικά δίκτυα έχουν πολλές διακλαδώσεις. Οι CPU τις διαχειρίζονται άψογα. Οι GPU σκοντάφτουν.

Το χάσμα επιδόσεων δεν είναι μαγεία. Είναι αρχιτεκτονική ευθυγράμμιση. Τα δυαδικά νευρωνικά δίκτυα χρησιμοποιούν πράξεις για τις οποίες βελτιστοποιήθηκαν οι CPU. Τα δίκτυα κινητής υποδιαστολής χρησιμοποιούν πράξεις για τις οποίες κατασκευάστηκαν οι GPU. Αλλάξαμε τα μαθηματικά. Οι CPU έγιναν η βέλτιστη επιλογή.

Το τεχνικό κέρδος είναι η αρχιτεκτονική ευθυγράμμιση: τα δυαδικά επίπεδα συμπυκνώνονται σε ευρείες πράξεις bit της CPU, ενώ η GPU ακολουθεί μια παράκαμψη μέσω κινητής υποδιαστολής.

Πραγματική ανάπτυξη (τι συνέβη στην πράξη)

Ολλανδικές Χρηματοοικονομικές Υπηρεσίες (ING Bank): Αντικατέστησε την ανίχνευση απάτης που βασιζόταν σε GPU με δυαδικά δίκτυα σε CPU. Προηγούμενο σύστημα: 8 GPU NVIDIA A100, κατανάλωση ισχύος 3.200W, κόστος υλικού 180.000 €, καθυστέρηση 45ms. Νέο σύστημα: 4 επεξεργαστές Intel Xeon Platinum (υπάρχοντες διακομιστές), πρόσθετη κατανάλωση 280W, κόστος υλικού 0 €, καθυστέρηση 8ms. 5,6 φορές ταχύτερο, 91% λιγότερη ισχύς, μηδενική κεφαλαιουχική δαπάνη. Δυαδικά δίκτυα που τρέχουν σε CPU που ήδη διέθεταν.

Γερμανική Μεταποίηση (Siemens): Τεχνητή νοημοσύνη ποιοτικού ελέγχου για την αυτοματοποίηση εργοστασίων. Η προσέγγιση με GPU απαιτούσε εξειδικευμένους διακομιστές αιχμής με ειδική ψύξη. 12.000 € ανά σταθμό επιθεώρησης, 25 σταθμοί συνολικά, 300.000 € συνολικά. Η προσέγγιση με CPU: αναβαθμισμένο λογισμικό σε υπάρχοντες PLC με επεξεργαστές Intel Atom. Άδεια λογισμικού 800 € ανά σταθμό, 20.000 € συνολικά. Ίδια ακρίβεια, μείωση κόστους 93%, ανάπτυξη στο ένα δέκατο του χρόνου.

Ελβετική Υγειονομική Περίθαλψη (Πανεπιστημιακό Νοσοκομείο Ζυρίχης): Ανάλυση ιατρικών εικόνων. Σύστημα NVIDIA DGX για συμπεράσματα: κεφάλαιο 120.000 €, ετήσιο κόστος ισχύος 18.000 €, απαιτούσε ειδική αίθουσα διακομιστών με ενισχυμένη ψύξη. Δυαδικά δίκτυα σε τυπικούς διακομιστές Dell (ήδη ιδιοκτησίας για άλλες εργασίες): μηδενικό κεφάλαιο, ετήσια πρόσθετη ισχύς 2.000 €, ανάπτυξη σε υπάρχοντα ράφια διακομιστών. Συμπεράσματα 6 φορές ταχύτερα, μείωση λειτουργικού κόστους 89%, καλύτερη επεξηγησιμότητα για τις ρυθμιστικές αρχές.

Το μοτίβο αναδύεται: οι ευρωπαϊκές εταιρείες αναπτύσσουν λύσεις σε υπάρχουσες υποδομές, οι αμερικανικές αγοράζουν εξειδικευμένα συστήματα GPU. Όταν η AI που βασίζεται σε CPU αποδίδει καλύτερα, η υπάρχουσα ευρωπαϊκή υποδομή διακομιστών μετατρέπεται σε ανταγωνιστικό πλεονέκτημα. Οι επενδύσεις σε GPU των αμερικανικών παρόχων cloud γίνονται βυθισμένο κόστος.

Πέρα από την ταχύτητα: η πλήρης εικόνα

Η ταχύτητα είναι μόνο ένα μέρος της ιστορίας. Τα δυαδικά δίκτυα σε CPU προσφέρουν:

Ενεργειακή απόδοση: 96% μείωση στην κατανάλωση ισχύος. Αυτή η GPU που καταναλώνει 400 watt; Αντικαθίσταται από ένα τμήμα CPU που χρησιμοποιεί 20 watt.

Εξοικονόμηση κόστους: Οι τυπικοί διακομιστές κοστίζουν 70% λιγότερο από τα συστήματα με GPU. Δεν χρειάζονται εξειδικευμένοι επιταχυντές.

Ευελιξία ανάπτυξης: Τρέξτε οπουδήποτε. Διακομιστές cloud, εξοπλισμός εντός εγκαταστάσεων, συσκευές άκρου. Αν έχει σύγχρονη CPU, λειτουργεί.

Καθυστέρηση: Η τοπική εξαγωγή συμπερασμάτων σε CPU σημαίνει χρόνους απόκρισης σε χιλιοστά του δευτερολέπτου. Χωρίς διαδρομές δικτύου προς συμπλέγματα GPU.

Η επιστροφή της CPU δεν αφορά μόνο την ταχύτητα. Αφορά το να είμαστε καλύτεροι σε κάθε διάσταση που έχει σημασία για την ανάπτυξη στον πραγματικό κόσμο.

Συνολικό Κόστος Ιδιοκτησίας (TCO): Η σύγκριση πενταετούς TCO φωτίζει τα πραγματικά οικονομικά. Σύστημα εξαγωγής συμπερασμάτων με GPU: 250.000 € υλικό, 90.000 € ισχύς (σε ευρωπαϊκές τιμές), 40.000 € υποδομή ψύξης, 25.000 € εξειδικευμένη συντήρηση. Σύνολο: 405.000 €. Σύστημα με CPU: 80.000 € υλικό (τυπικοί διακομιστές), 7.000 € ισχύς, 0 € επιπλέον ψύξη, 8.000 € τυπική συντήρηση. Σύνολο: 95.000 €. Μείωση κόστους 77%. Ίδια απόδοση. Καλύτερη συμμόρφωση. Αυτό δεν είναι οριακή βελτίωση· είναι μετασχηματισμός της επιχείρησης.

Λειτουργική Απλότητα: Οι αναπτύξεις με GPU απαιτούν εξειδικευμένη τεχνογνωσία. Προγραμματισμός CUDA, διαχείριση μνήμης GPU, βελτιστοποίηση πυρήνα, παρακολούθηση θερμικών συνθηκών. Η έλλειψη δεξιοτήτων οδηγεί σε υψηλότερους μισθούς. Οι αναπτύξεις με CPU χρησιμοποιούν τυπική μηχανική λογισμικού. C++, Python, κανονική διαχείριση διακομιστών. Η δεξαμενή ταλέντων είναι ολόκληρη η βιομηχανία λογισμικού, όχι μόνο οι ειδικοί AI. Ευκολότερες προσλήψεις, ταχύτερη ενσωμάτωση, χαμηλότεροι μισθοί. Το λειτουργικό κόστος μειώνεται πέρα από την εξοικονόμηση υλικού.

Κανονιστική Συμμόρφωση: Ο νόμος AI της ΕΕ, ο GDPR, οι κανονισμοί ανά τομέα: όλα ευκολότερα με δυαδικά δίκτυα σε CPU. Η ντετερμινιστική εκτέλεση επιτρέπει την ελεγξιμότητα. Η επεξηγήσιμη συλλογιστική ικανοποιεί τις απαιτήσεις διαφάνειας. Η τυπική επαλήθευση αποδεικνύει ιδιότητες ασφάλειας. Τα συστήματα με GPU δυσκολεύονται με αυτές τις απαιτήσεις. Δυαδικά δίκτυα σε CPU: συμμόρφωση ενσωματωμένη, όχι προσαρτημένη εκ των υστέρων. Το κανονιστικό πλεονέκτημα ενισχύει το τεχνικό πλεονέκτημα.

Ευελιξία Προμηθευτών: Η GPU σημαίνει δέσμευση στην NVIDIA. Οι δυαδικές CPU λειτουργούν σε υλοποιήσεις Intel, AMD, ARM. Προμήθεια από πολλαπλές πηγές. Ανταγωνιστικές τιμές. Καμία εξάρτηση από έναν μόνο προμηθευτή. Οι ευρωπαϊκές εταιρείες το εκτιμούν ιδιαίτερα: διαφοροποιημένες αλυσίδες εφοδιασμού, μειωμένος γεωπολιτικός κίνδυνος, διαπραγματευτική ισχύς. Οι αμερικανικές εταιρείες έχουν κολλήσει με την τιμολογιακή δύναμη της NVIDIA. Οι ευρωπαϊκές εταιρείες εναλλάσσονται μεταξύ Intel, AMD, ακόμα και τσιπ διακομιστών ARM. Η ισχύς στην αγορά αντιστρέφεται.

Η επιστροφή δεν είναι απλώς ένα σημείο αναφοράς. Μετατρέπει τα υπάρχοντα ράφια διακομιστών σε υποδομή AI με χαμηλότερη ισχύ, χαμηλότερο TCO, χαμηλότερη καθυστέρηση και καθαρότερους ελέγχους.

Η Intel δεν έφυγε ποτέ

Να η ειρωνεία: ενώ όλοι κυνηγούσαν τις GPU της NVIDIA, η Intel συνέχιζε να βελτιώνει τις δυνατότητες των CPU. AVX-512, Cascade Lake, Ice Lake, Sapphire Rapids. Κάθε γενιά πρόσθετε εντολές ιδανικές για δυαδικές πράξεις.

Δεν στόχευαν συγκεκριμένα την τεχνητή νοημοσύνη. Βελτίωναν τη γενική υπολογιστική ισχύ. Αλλά τα δυαδικά νευρωνικά δίκτυα είναι γενική υπολογιστική ισχύς. Αξιοποιούν άμεσα όλες αυτές τις βελτιώσεις.

Οι υποδομές που ήδη κατέχει ο καθένας γίνονται ξαφνικά ικανές για τεχνητή νοημοσύνη. Χωρίς αγορά νέου υλικού. Χωρίς αρχιτεκτονικές αλλαγές. Απλώς καλύτεροι αλγόριθμοι που χρησιμοποιούν τις υπάρχουσες δυνατότητες.

Η σιωπηλή νίκη της AMD: Οι επεξεργαστές AMD EPYC διαπρέπουν και στη δυαδική τεχνητή νοημοσύνη. Η αρχιτεκτονική Zen 4 υποστηρίζει AVX-512, εξαιρετική ιεραρχία κρυφής μνήμης, αποδοτική πρόβλεψη διακλαδώσεων. Τα δυαδικά δίκτυα λειτουργούν άψογα σε EPYC. Το μερίδιο αγοράς της AMD στους διακομιστές: 35% και αυξανόμενο. Αυτό σημαίνει ότι το 35% των κέντρων δεδομένων παγκοσμίως είναι ήδη βελτιστοποιημένο για δυαδική τεχνητή νοημοσύνη. Η AMD τοποθετήθηκε τέλεια χωρίς να στοχεύει ρητά την τεχνητή νοημοσύνη. Η γενική αριστεία μετατρέπεται σε πλεονέκτημα στην τεχνητή νοημοσύνη.

Ο αναδυόμενος ρόλος της ARM: Οι επεξεργαστές Graviton (τα τσιπ ARM της Amazon) αποδεικνύουν τις δυνατότητες των δυαδικών δικτύων. Αποδοτικός χειρισμός bit, εξαιρετικά χαρακτηριστικά ισχύος, μαζική ανάπτυξη στο AWS. Η αρχιτεκτονική ARM επεκτείνεται από τα smartphones στους διακομιστές. Η δυαδική τεχνητή νοημοσύνη λειτουργεί σε όλο αυτό το εύρος. Τα τσιπ M-series της Apple: βασισμένα σε ARM, εξαιρετικά αποδοτικά, ιδανικά για δυαδικές πράξεις. Το πλεονέκτημα απόδοσης της ARM ενισχύεται με την απόδοση των δυαδικών δικτύων. Η συνέχεια από το κινητό στο cloud καθίσταται εφικτή.

Το ανοιχτό μέλλον του RISC-V: Το ανοιχτού κώδικα σύνολο εντολών RISC-V επιτρέπει προσαρμοσμένες βελτιστοποιήσεις. Ευρωπαϊκές εταιρείες ημιαγωγών (Bosch, Infineon, NXP) επενδύουν στο RISC-V για την αυτοκινητοβιομηχανία και τη βιομηχανία. Προσθέστε βελτιστοποιήσεις δυαδικής τεχνητής νοημοσύνης σε προσαρμοσμένους πυρήνες RISC-V. Χωρίς τέλη αδειοδότησης, πλήρης έλεγχος, τέλεια βελτιστοποίηση για συγκεκριμένες περιπτώσεις χρήσης. Το ανοιχτό υλικό σε συνδυασμό με τη δυαδική τεχνητή νοημοσύνη επιτρέπει την ευρωπαϊκή ανεξαρτησία στους ημιαγωγούς. Οι στρατηγικές επιπτώσεις είναι βαθιές.

Ο μετασχηματισμός της ανάπτυξης

Η τεχνητή νοημοσύνη που βασίζεται σε GPU σημαίνει εξειδικευμένες υποδομές. Κέντρα δεδομένων με ψύξη υψηλής ισχύος. Συγκεκριμένες διαμορφώσεις διακομιστών. Εγκλωβισμός σε προμηθευτή. Πολυπλοκότητα.

Η τεχνητή νοημοσύνη που βασίζεται σε CPU σημαίνει ανάπτυξη οπουδήποτε. Αυτή η τυπική σχάρα διακομιστών; Τέλεια. Αυτοί οι υπάρχοντες διακομιστές βάσεων δεδομένων; Μπορούν να εκτελούν τεχνητή νοημοσύνη τώρα. Τοποθεσίες στο edge με βασική υπολογιστική ισχύ; Πλήρως ικανές.

Οι ευρωπαϊκές εταιρείες με υπάρχουσες υποδομές δεν χρειάζεται να ξαναχτίσουν τίποτα. Βελτιστοποιούν ό,τι ήδη έχουν. Το πλεονέκτημα των Αμερικανών παρόχων cloud στις GPU εξαφανίζεται όταν οι CPU λειτουργούν καλύτερα.

Το περιβαλλοντικό πλεονέκτημα (το μυστικό όπλο της Ευρώπης)

Το ενεργειακό κόστος έχει μεγαλύτερη σημασία στην Ευρώπη παρά στην Αμερική. Ευρωπαϊκό ρεύμα: €0,20-0,30 ανά kWh. Αμερικανικό ρεύμα: €0,10-0,15 ανά kWh. Όταν το κόστος ενέργειας είναι 2-3 φορές υψηλότερο, η απόδοση δεν είναι προαιρετική· είναι θέμα επιβίωσης.

Η εξαγωγή συμπερασμάτων με τεχνητή νοημοσύνη βασισμένη σε GPU για μεσαίου μεγέθους ανάπτυξη: συνεχής κατανάλωση 50kW. Ευρωπαϊκό κόστος: €87.600-131.400 ετησίως. Αμερικανικό κόστος: €43.800-65.700. Αυτή η ετήσια διαφορά των €70K χρηματοδοτεί πολλή ευρωπαϊκή έρευνα στην τεχνητή νοημοσύνη. Το κίνητρο για απόδοση είναι κυριολεκτικά ενσωματωμένο στους λογαριασμούς ρεύματος.

Δυαδικά δίκτυα σε CPU: 2-4kW για ισοδύναμο φόρτο εργασίας. Ευρωπαϊκό κόστος: €3.504-5.256 ετησίως. Εξοικονόμηση: €84K-126K ετησίως. Οι αμερικανικές εταιρείες βλέπουν την απόδοση ως ευχάριστο έξτρα. Οι ευρωπαϊκές εταιρείες τη βλέπουν ως ανταγωνιστική αναγκαιότητα. Διαφορετικά οικονομικά πλαίσια γεννούν διαφορετικές καινοτομίες.

Οι περιβαλλοντικοί κανονισμοί πλήττουν επίσης περισσότερο την Ευρώπη. Η Ταξινόμηση της ΕΕ για Βιώσιμες Δραστηριότητες απαιτεί αναφορά στην κατανάλωση ενέργειας. Οι μεγάλες αναπτύξεις τεχνητής νοημοσύνης ενεργοποιούν περιβαλλοντικούς ελέγχους. Τα συμπλέγματα GPU που καταναλώνουν μεγαβάτ εγείρουν ρυθμιστικά ερωτήματα. Η εξαγωγή συμπερασμάτων σε CPU που καταναλώνει κιλοβάτ περνά απαρατήρητη. Η συμμόρφωση με τους κανονισμούς γίνεται αρχιτεκτονικός οδηγός.

Οι εντολές της Γερμανίας για ανανεώσιμες πηγές ενέργειας δημιουργούν ενδιαφέρουσες δυναμικές. Η ηλιακή και η αιολική ενέργεια είναι διαλείπουσες. Τα κέντρα δεδομένων πρέπει να λειτουργούν εντός της διαθέσιμης ανανεώσιμης ικανότητας. Τα συμπλέγματα GPU χρειάζονται σταθερή υψηλή ισχύ, δύσκολο να συνδυαστεί με διαλείπουσες ανανεώσιμες πηγές. Η τεχνητή νοημοσύνη που βασίζεται σε CPU μπορεί να κλιμακώσει τους φόρτους εργασίας με τη διαθέσιμη ισχύ. Η ευελιξία φορτίου επιτρέπει την ενοποίηση των ανανεώσιμων πηγών. Ο περιβαλλοντικός περιορισμός οδηγεί την τεχνική καινοτομία. Πολύ ευρωπαϊκή προσέγγιση επίλυσης προβλημάτων.

Η στροφή στους ημιαγωγούς (η ακούσια νίκη της Intel)

Ενώ όλοι επικεντρώνονταν στην κυριαρχία των GPU της NVIDIA, οι βελτιώσεις της Intel στους επεξεργαστές την τοποθέτησαν ιδανικά για δυαδική τεχνητή νοημοσύνη. Ακούσια αλλά αποφασιστική.

Το AVX-512 δεν σχεδιάστηκε για τεχνητή νοημοσύνη. Στόχευε στην υπολογιστική υψηλών επιδόσεων, στην επιστημονική προσομοίωση, στη χρηματοοικονομική μοντελοποίηση. Αλλά αυτές οι πράξεις διανυσμάτων 512-bit; Τέλειες για δυαδικά νευρωνικά δίκτυα. Η εντολή POPCNT; Προστέθηκε για βελτιστοποίηση βάσεων δεδομένων. Τέλεια για δυαδικές ενεργοποιήσεις. Ο βελτιωμένος προγνωστικός διακλάδωσης του Ice Lake; Στόχευε τη γενική απόδοση. Τέλειος για δυαδικά κατώφλια.

Η Intel βελτίωσε τους επεξεργαστές για παραδοσιακούς φόρτους εργασίας. Οι ερευνητές της δυαδικής τεχνητής νοημοσύνης παρατήρησαν ότι αυτές οι βελτιώσεις ευθυγραμμίζονταν με τις ανάγκες τους. Τώρα οι επεξεργαστές της Intel προσφέρουν καλύτερο συμπέρασμα τεχνητής νοημοσύνης από εξειδικευμένους επιταχυντές τεχνητής νοημοσύνης. Η ακούσια αρχιτεκτονική αντιστοιχία δημιουργεί ευκαιρία στην αγορά.

Η χρηματιστηριακή αξία της NVIDIA βασίστηκε στην τεχνητή νοημοσύνη. Η ανάκαμψη της Intel μπορεί να βασιστεί επίσης. Οι επεξεργαστές EPYC της AMD υπερέχουν επίσης σε δυαδικές πράξεις: ισοδύναμο AVX-512, εξαιρετική ιεραρχία κρυφής μνήμης, ισχυρή πρόβλεψη διακλάδωσης. Η δυαδική τεχνητή νοημοσύνη ωφελεί ολόκληρο το οικοσύστημα x86. Οι αμερικανικές εταιρείες ημιαγωγών κερδίζουν επειδή είναι καλές στον παραδοσιακό υπολογισμό. Οι GPU εξειδικεύτηκαν πολύ νωρίς για μια στενή περίπτωση χρήσης τεχνητής νοημοσύνης. Οι CPU παρέμειναν ευέλικτες και έγιναν βέλτιστες για ευρύτερες προσεγγίσεις τεχνητής νοημοσύνης.

Η αντιστροφή της αγοράς (τι συμβαίνει στη συνέχεια)

Η δυναμική της αγοράς GPU αλλάζει. Η εκπαίδευση εξακολουθεί να χρειάζεται GPU, δεν υπάρχει αμφισβήτηση εκεί. Αλλά η αγορά συμπερασμάτων είναι 10-100× μεγαλύτερη από την αγορά εκπαίδευσης. Οι περισσότεροι φόρτοι εργασίας τεχνητής νοημοσύνης είναι συμπεράσματα. Τα δυαδικά δίκτυα σε CPU κατακτούν αυτή την αγορά.

Οι πάροχοι cloud αντιμετωπίζουν ενδιαφέρουσες αποφάσεις. Οι AWS, Azure, Google Cloud επένδυσαν δισεκατομμύρια σε υποδομή GPU. Τα χρονοδιαγράμματα αποσβέσεων υποθέτουν χρησιμοποίηση 3-5 ετών. Η δυαδική τεχνητή νοημοσύνη καθιστά το συμπέρασμα GPU ξεπερασμένο από το πρώτο έτος. Είτε διαγράφουν δισεκατομμύρια σε επενδύσεις GPU είτε χρεώνουν υψηλές τιμές για κατώτερη απόδοση. Καμία επιλογή δεν είναι ελκυστική.

Οι ευρωπαϊκοί πάροχοι cloud επωφελούνται. OVH, Hetzner, Scaleway: λειτουργούν τυπική υποδομή CPU. Χωρίς βυθισμένο κόστος GPU. Η δυαδική τεχνητή νοημοσύνη καθιστά την υπάρχουσα υποδομή τους ανταγωνιστική για φόρτους εργασίας τεχνητής νοημοσύνης. Το πλεονέκτημα τιμής προστίθεται στο πλεονέκτημα απόδοσης. Οι επενδύσεις GPU των αμερικανικών hyperscalers γίνονται υποχρεώσεις. Η εστίαση των ευρωπαϊκών παρόχων σε CPU γίνεται πλεονέκτημα. Η δυναμική της αγοράς αντιστρέφεται.

Η ανάπτυξη στο άκρο ξεκλειδώνεται. Η Tesla δεν μπορεί να βάλει GPU σε κάθε όχημα: περιορισμοί ισχύος, κόστους, θερμότητας, χώρου. Αλλά κάθε αυτοκίνητο έχει ήδη ισχυρούς επεξεργαστές για διαχείριση κινητήρα, πλοήγηση, ψυχαγωγία. Τα δυαδικά νευρωνικά δίκτυα μετατρέπουν τους υπάρχοντες επεξεργαστές αυτοκινήτων σε επιταχυντές τεχνητής νοημοσύνης. Χωρίς επιπλέον υλικό. Μόνο αναβάθμιση λογισμικού. Η τεχνητή νοημοσύνη στο άκρο γίνεται εφικτή επειδή οι CPU είναι ήδη εκεί.

Και τα smartphones. Οι επεξεργαστές Qualcomm Snapdragon έχουν εξαιρετική απόδοση χειρισμού bit. Τα δυαδικά δίκτυα τρέχουν σε CPU τηλεφώνων ταχύτερα από εξειδικευμένους επιταχυντές τεχνητής νοημοσύνης. Τα τσιπ της σειράς A της Apple, Samsung Exynos: όλα βελτιστοποιημένα για γενικό υπολογισμό, όλα τέλεια για δυαδική τεχνητή νοημοσύνη. Κινητή τεχνητή νοημοσύνη χωρίς εξειδικευμένες νευρωνικές μηχανές. Η απόδοση CPU καθιστά τους εξειδικευμένους επιταχυντές περιττούς.

Το ευρωπαϊκό πλεονέκτημα αποκρυσταλλώνεται

Όλα όσα αναφέρθηκαν παραπάνω ευνοούν τις ευρωπαϊκές εταιρείες τεχνητής νοημοσύνης. Η υπάρχουσα υποδομή λειτουργεί καλύτερα. Το ενεργειακό κόστος οδηγεί σε καινοτομίες αποδοτικότητας. Η συμμόρφωση με τους κανονισμούς επιτρέπει την τυπική επαλήθευση. Προσεγγίσεις βελτιστοποιημένες για CPU προκύπτουν από περιορισμούς πόρων. Το Φαινόμενο των Βρυξελλών παγκοσμιοποιεί τα ευρωπαϊκά πρότυπα.

Οι αμερικανικές εταιρείες τεχνητής νοημοσύνης χτίστηκαν για έναν διαφορετικό κόσμο. Άφθονο κεφάλαιο, φθηνή ενέργεια, χαλαρή ρύθμιση, διαθεσιμότητα GPU. Αυτά τα πλεονεκτήματα εξαφανίζονται. Οι απαιτήσεις κεφαλαίου μειώνονται (δεν χρειάζονται GPU). Η ενεργειακή απόδοση έχει σημασία (οι ευρωπαϊκές τιμές εξαπλώνονται παγκοσμίως). Οι κανονισμοί γίνονται αυστηρότεροι (ο ευρωπαϊκός νόμος για την τεχνητή νοημοσύνη γίνεται παγκόσμιο πρότυπο). Η έλλειψη GPU δεν έχει σημασία (οι CPU λειτουργούν καλύτερα).

Οι ευρωπαϊκές εταιρείες τεχνητής νοημοσύνης χτίστηκαν για έναν κόσμο με περιορισμούς. Περιορισμένο κεφάλαιο (αναγκαστική αλγοριθμική αποδοτικότητα). Ακριβή ενέργεια (τα δυαδικά δίκτυα καταναλώνουν 96% λιγότερη ισχύ). Αυστηρή ρύθμιση (ενσωματωμένη τυπική επαλήθευση). Διαθεσιμότητα CPU (βέλτιστο τυπικό υλικό). Οι περιορισμοί που έμοιαζαν μειονεκτικοί είναι πλέον ανταγωνιστικά πλεονεκτήματα. Οι συνθήκες της αγοράς παγκοσμίως στρέφονται προς την ευρωπαϊκή προσέγγιση.

Την επόμενη δεκαετία: οι ευρωπαϊκές εταιρείες τεχνητής νοημοσύνης εξάγουν όχι μόνο στην Ευρώπη αλλά παγκοσμίως. Οι αμερικανικές εταιρείες αδειοδοτούν ευρωπαϊκή τεχνολογία. Οι ασιατικές αγορές υιοθετούν ευρωπαϊκά πρότυπα. Η δυαδική τεχνητή νοημοσύνη που βασίζεται σε CPU γίνεται η κυρίαρχη αρχιτεκτονική. Η NVIDIA παραμένει σχετική για την εκπαίδευση. Η Intel και η AMD κυριαρχούν στο συμπέρασμα. Η ανακατανομή της κεφαλαιοποίησης της αγοράς αντανακλά την αρχιτεκτονική στροφή. Η ευρωπαϊκή τεχνητή νοημοσύνη δεν καλύπτει πλέον το χαμένο έδαφος· θέτει τον ρυθμό.

Καθώς το συμπέρασμα μετατοπίζεται σε CPU, η τυπική ευρωπαϊκή υποδομή γίνεται πλεονέκτημα αντί περιορισμός.

Τι σημαίνει αυτό για την τεχνητή νοημοσύνη

Η επιστροφή της CPU αλλάζει θεμελιωδώς τα οικονομικά της τεχνητής νοημοσύνης. Τέλος η επιλογή μεταξύ απόδοσης και κόστους. Τέλος η έλλειψη GPU που περιορίζει την ανάπτυξη. Τέλος οι εξαρτήσεις από προμηθευτές.

Το Dweve Core λειτουργεί σε CPU. Πάνω από 1.000 βελτιστοποιημένοι αλγόριθμοι αξιοποιούν πλήρως τη σύγχρονη αρχιτεκτονική της Intel. Το Loom 456 με τη συλλογιστική που βασίζεται σε εξειδικευμένους τομείς εκτελείται με ταχύτητες που καθιστούν την ανάπτυξη GPU περιττή.

Αυτός είναι εκδημοκρατισμός της τεχνητής νοημοσύνης μέσω καλύτερων μαθηματικών. Δεν μπορούν όλοι να αντέξουν οικονομικά συμπλέγματα GPU. Όλοι έχουν CPU.

Η επανάσταση της CPU έρχεται. Τα δυαδικά νευρωνικά δίκτυα της Dweve θα προσφέρουν απόδοση ανώτερη των GPU σε τυπικό υλικό. Γραφτείτε στη λίστα αναμονής μας για να είστε πρώτοι στη σειρά όταν ξεκινήσουμε.