Γιατί όλοι χρησιμοποιούν GPU για τεχνητή νοημοσύνη (και γιατί μπορεί να αλλάξει)

Γιατί οι GPU κυριαρχούν στην τεχνητή νοημοσύνη; Και είναι πραγματικά απαραίτητες; Η αλήθεια για CPU και GPU σε φόρτους εργασίας AI.

Γιατί όλοι χρησιμοποιούν GPU για τεχνητή νοημοσύνη (και γιατί μπορεί να αλλάξει)

Η εμμονή με τις GPU

Μίλησε με οποιονδήποτε για την εκτέλεση τεχνητής νοημοσύνης και θα σου πει: «Χρειάζεσαι GPU. Οι CPU είναι πολύ αργές. Όλοι χρησιμοποιούν GPU».

Και έχουν δίκιο. Κυρίως. Οι GPU κυριαρχούν στην τεχνητή νοημοσύνη για καλούς λόγους. Αλλά η ιστορία δεν είναι τόσο απλή.

Το να κατανοήσεις γιατί κέρδισαν οι GPU, τι κάνουν πραγματικά καλά οι CPU και γιατί η ισορροπία μπορεί να αλλάζει, έχει σημασία. Ειδικά αν πληρώνεις εσύ τους λογαριασμούς. Ή τους λογαριασμούς του παρόχου ηλεκτρικής ενέργειας. Ή αναρωτιέσαι γιατί το κέντρο δεδομένων σου χρειάζεται δικό του υποσταθμό ισχύος.

Η κοινή αντίληψη είναι η εξής: τα νευρωνικά δίκτυα κινητής υποδιαστολής χρειάζονται μαζικό παραλληλισμό, οι GPU παρέχουν μαζικό παραλληλισμό, άρα οι GPU κερδίζουν. Αλλά αυτή είναι μόνο η μισή ιστορία. Το άλλο μισό αφορά το τι συμβαίνει όταν αλλάξεις τα μαθηματικά.

Τι είναι πραγματικά οι CPU και οι GPU

Ας ξεκινήσουμε με τα βασικά:

CPU (Κεντρική Μονάδα Επεξεργασίας):

Ο εγκέφαλος του υπολογιστή σου. Σχεδιασμένη για εργασίες γενικού σκοπού. Τρέχει το λειτουργικό σου σύστημα. Ανοίγει αρχεία. Διαχειρίζεται τη μνήμη. Εκτελεί προγράμματα. Κάνει λίγο από όλα.

Οι σύγχρονες CPU έχουν 8-64 πυρήνες. Κάθε πυρήνας είναι ισχυρός. Μπορεί να χειριστεί πολύπλοκη λογική. Διακλαδώσεις. Ακολουθιακές εργασίες. Εξαιρετικές στο να κάνουν διαφορετικά πράγματα γρήγορα. Σκέψου μια CPU ως μια μικρή ομάδα άριστα καταρτισμένων μηχανικών, όπου ο καθένας μπορεί να λύσει πολύπλοκα προβλήματα ανεξάρτητα.

GPU (Μονάδα Επεξεργασίας Γραφικών):

Αρχικά κατασκευάστηκε για γραφικά. Η απόδοση τρισδιάστατων σκηνών απαιτεί την ίδια απλή μαθηματική πράξη σε εκατομμύρια pixel ταυτόχρονα. Οι GPU υπερέχουν σε αυτό: απλές λειτουργίες, μαζικός παραλληλισμός.

Οι σύγχρονες GPU έχουν χιλιάδες πυρήνες. Κάθε πυρήνας είναι απλούστερος από έναν πυρήνα CPU. Αλλά χιλιάδες από αυτούς να δουλεύουν μαζί; Τεράστια υπολογιστική απόδοση για παράλληλες εργασίες. Σκέψου μια GPU ως ένα εργοστάσιο με χιλιάδες εργάτες, όπου ο καθένας κάνει μια απλή εργασία πολύ γρήγορα.

Αυτή είναι η θεμελιώδης διαφορά: οι CPU είναι ευέλικτοι γενικιστές. Οι GPU είναι εξειδικευμένοι παράλληλοι επεξεργαστές.

Ορίστε μια οπτική σύγκριση:

CPU: Λίγοι Ισχυροί Πυρήνες Πυρήνας 1 Πυρήνας 2 Πυρήνας 3 Πυρήνας 4 Πυρήνας 5 Πυρήνας 6 Πυρήνας 7 Πυρήνας 8 Πολύπλοκες εργασίες, διακλαδώσεις, λογική GPU: Χιλιάδες Απλοί Πυρήνες Χιλιάδες πυρήνες Απλές παράλληλες πράξεις Απόδοση σε φόρτους εργασίας AI: Κινητής υποδιαστολής: το GPU κερδίζει 20-100× Δυαδικές πράξεις: το CPU είναι ανταγωνιστικό ή ταχύτερο
Οι CPU και οι GPU είναι φτιαγμένες για διαφορετικά είδη εργασίας: λίγοι ισχυροί γενικοί πυρήνες έναντι χιλιάδων απλών επαναλαμβανόμενων λωρίδων.

Γιατί οι GPU κυριαρχούν στην τεχνητή νοημοσύνη

Τα φορτία εργασίας της τεχνητής νοημοσύνης, ειδικά τα νευρωνικά δίκτυα, είναι εξαιρετικά παράλληλα. Να γιατί κερδίζουν οι GPU:

Πολλαπλασιασμός πινάκων παντού:

Τα νευρωνικά δίκτυα είναι κυρίως πολλαπλασιασμοί πινάκων. Πολλαπλασιάζεις την είσοδο με τα βάρη. Εκατομμύρια πολλαπλασιασμοί. Όλοι ανεξάρτητοι. Ιδανικοί για παράλληλη επεξεργασία.

GPU: Κάνει όλους τους πολλαπλασιασμούς ταυτόχρονα σε χιλιάδες πυρήνες. Γρήγορα.

CPU: Κάνει τους πολλαπλασιασμούς διαδοχικά ή σε περιορισμένους πυρήνες. Πολύ πιο αργά.

Παράδειγμα: Ένα μόνο επίπεδο σε ένα μεγάλο γλωσσικό μοντέλο μπορεί να πολλαπλασιάσει έναν πίνακα 1024×4096 με έναν πίνακα 4096×1024. Αυτό είναι πάνω από 4 δισεκατομμύρια πράξεις πολλαπλασιασμού-πρόσθεσης. Σε μια GPU με πυρήνες tensor, αυτό διαρκεί χιλιοστά του δευτερολέπτου. Σε μια CPU, δευτερόλεπτα. Η διαφορά είναι τεράστια.

Ίδια πράξη, διαφορετικά δεδομένα:

Κάθε νευρώνας κάνει την ίδια πράξη: πολλαπλασιασμό-πρόσθεση. Απλώς με διαφορετικά δεδομένα. Αυτό ονομάζεται SIMD (Single Instruction, Multiple Data). Οι GPU είναι φτιαγμένες για αυτό.

GPU: Μία εντολή μεταδίδεται σε χιλιάδες πυρήνες. Ο καθένας την εφαρμόζει σε διαφορετικά δεδομένα. Αποδοτικό.

CPU: Μπορεί να κάνει SIMD με διανυσματικές εντολές (AVX-512), αλλά μόνο σε μικρά πλάτη (8-16 πράξεις). Δεν κλιμακώνεται όπως οι GPU.

Είναι σαν να δίνεις την ίδια συνταγή σε χίλιους μάγειρες έναντι οκτώ. Οι χίλιοι μάγειρες τελειώνουν τα πιάτα τους ταυτόχρονα. Οι οκτώ πρέπει να δουλέψουν σε παρτίδες. Απλά μαθηματικά.

Εύρος ζώνης μνήμης:

Η τεχνητή νοημοσύνη χρειάζεται να μετακινεί τεράστιες ποσότητες δεδομένων. Δισεκατομμύρια βάρη. Δισεκατομμύρια ενεργοποιήσεις. Το εύρος ζώνης μνήμης έχει σημασία.

GPU: Βελτιστοποιημένη αρχιτεκτονική μνήμης. Μνήμη υψηλού εύρους ζώνης (HBM). Σχεδιασμένη για φορτία εργασίας με ένταση δεδομένων. Εκατοντάδες GB/s.

CPU: Χαμηλότερο εύρος ζώνης μνήμης. Βελτιστοποιημένη για καθυστέρηση, όχι για απόδοση. Δεκάδες GB/s.

Σκέψου το σαν σωλήνες νερού. Οι GPU έχουν τεράστιους σωλήνες που μπορούν να μετακινήσουν μεγάλες ποσότητες δεδομένων γρήγορα. Οι CPU έχουν στενότερους σωλήνες βελτιστοποιημένους για γρήγορη πρόσβαση σε μικρότερες ποσότητες δεδομένων. Για το τσουνάμι δεδομένων της τεχνητής νοημοσύνης, θέλεις τους μεγαλύτερους σωλήνες.

Εξειδικευμένο υλικό:

Οι σύγχρονες GPU έχουν πυρήνες tensor. Υλικό ειδικά για πολλαπλασιασμό πινάκων. Εξαιρετικά γρήγορο για φορτία εργασίας τεχνητής νοημοσύνης.

Η NVIDIA A100, για παράδειγμα, προσφέρει έως και 624 TFLOPS απόδοσης FP16 με τους πυρήνες tensor τρίτης γενιάς. Η H200 φτάνει ακόμα πιο ψηλά με βελτιωμένη μνήμη HBM3e. Αυτές δεν είναι απλώς γρήγορες· είναι κατασκευασμένες για τις ακριβείς πράξεις που χρειάζονται τα νευρωνικά δίκτυα.

Οι CPU είναι γενικής χρήσης. Χωρίς εξειδικευμένο υλικό τεχνητής νοημοσύνης (ως επί το πλείστον). Κάνουν τα πάντα αρκετά καλά, τίποτα εξαιρετικό.

Για παραδοσιακά νευρωνικά δίκτυα με πράξεις κινητής υποδιαστολής, οι GPU είναι 10-100× ταχύτερες από τις CPU. Η διαφορά είναι πραγματική.

Τα παραδοσιακά νευρωνικά δίκτυα είναι κυρίως επαναλαμβανόμενα μαθηματικά πινάκων. Γι' αυτό οι λωρίδες των GPU κυριαρχούν στην εκπαίδευση κινητής υποδιαστολής και στο συμπέρασμα μεγάλων μοντέλων.

Σε τι είναι πραγματικά καλές οι CPU

Οι CPU δεν είναι άχρηστες για την τεχνητή νοημοσύνη. Υπερέχουν σε διαφορετικά πράγματα:

Πολύπλοκη λογική και διακλάδωση:

Οι CPU διαχειρίζονται καλά τη λογική υπό συνθήκη. If-then-else. Εντολές switch. Πολύπλοκη ροή ελέγχου. Οι GPU δυσκολεύονται με αυτό. Η διακλάδωση προκαλεί απόκλιση, σκοτώνοντας τον παραλληλισμό.

Για εργασίες τεχνητής νοημοσύνης με πολλή λογική υπό συνθήκη, οι CPU μπορούν να ανταγωνιστούν.

Φανταστείτε μια GPU με χιλιάδες πυρήνες να προσπαθεί να εκτελέσει διαφορετικές διαδρομές κώδικα. Οι μισοί πυρήνες θέλουν να πάνε αριστερά, οι μισοί δεξιά. Η GPU πρέπει να εκτελέσει και τις δύο διαδρομές και να αποκρύψει τα αποτελέσματα. Σπατάλη. Μια CPU απλώς εκτελεί τη διαδρομή που χρειάζεται. Αποδοτική για λογική διακλάδωσης.

Συμπερασμός χαμηλής καθυστέρησης:

Για μικρά μοντέλα με αυστηρές απαιτήσεις καθυστέρησης, οι CPU κερδίζουν. Χωρίς γενικά έξοδα μεταφοράς δεδομένων. Χωρίς αρχικοποίηση GPU. Άμεση εκτέλεση.

Συσκευές άκρου, συστήματα πραγματικού χρόνου, διαδραστικές εφαρμογές. Ο συμπερασμός με CPU είναι πρακτικός.

Μόνο η μεταφορά PCIe μπορεί να προσθέσει 1-10 χιλιοστά του δευτερολέπτου. Για ένα μοντέλο που τρέχει σε 2 χιλιοστά του δευτερολέπτου, αυτό το γενικό κόστος είναι απαράδεκτο. Οι CPU εκτελούν άμεσα. Μηδενική καθυστέρηση μεταφοράς. Αυτό έχει σημασία για εφαρμογές που ανταποκρίνονται άμεσα.

Ακέραιες και δυαδικές πράξεις:

Οι CPU είναι εξαιρετικές στα μαθηματικά ακεραίων. Πράξεις bit. Λογικές πράξεις. Αυτές είναι θεμελιώδεις πράξεις CPU, βελτιστοποιημένες επί δεκαετίες.

Για δυαδικά νευρωνικά δίκτυα ή μοντέλα με κβάντιση ακεραίων, το χάσμα CPU-GPU μειώνεται δραματικά.

Οι πύλες XNOR υπάρχουν στους CPU από την αρχή τους. Η μέτρηση bit (popcount) είναι εντολή ενός κύκλου στους σύγχρονους CPU. Αυτές οι πράξεις είναι τόσο θεμελιώδεις που οι μηχανικοί πυριτίου τις βελτιστοποίησαν αδυσώπητα. Όταν το μοντέλο τεχνητής νοημοσύνης σας χρησιμοποιεί αυτές τις βασικές πράξεις αντί για πολλαπλασιασμό-πρόσθεση κινητής υποδιαστολής, ξαφνικά οι δεκαετίες βελτιστοποίησης των CPU μετρούν περισσότερο από τους παράλληλους πυρήνες των GPU.

Γενική διαθεσιμότητα:

Κάθε συσκευή έχει CPU. Δεν έχει κάθε συσκευή GPU. Για ανάπτυξη παντού, οι CPU είναι η μόνη καθολική επιλογή.

Τηλέφωνα, συσκευές IoT, ενσωματωμένα συστήματα. Ο συμπερασμός με CPU είναι συχνά η μόνη επιλογή.

Η Ευρώπη έχει αυστηρές απαιτήσεις εδαφικής διαμονής δεδομένων βάσει GDPR. Η εκτέλεση τεχνητής νοημοσύνης τοπικά σε CPU αποφεύγει τις εξαρτήσεις από το νέφος και τις περιπλοκές διασυνοριακής μεταφοράς δεδομένων. Το τηλέφωνο του χρήστη σας έχει ήδη CPU. Δεν χρειάζεται επιπλέον υλικό. Κανένα δεδομένο δεν φεύγει από τη συσκευή. Συμμόρφωση τακτοποιημένη.

Ο δυαδικός νευρωνικός αλλαγέας παιχνιδιών

Εδώ γίνεται ενδιαφέρον. Θυμάστε εκείνες τις δυαδικές πράξεις στις οποίες είναι καλοί οι CPU;

Τα δυαδικά νευρωνικά δίκτυα χρησιμοποιούν XNOR και popcount αντί για πολλαπλασιασμό-πρόσθεση κινητής υποδιαστολής. Αυτές είναι εγγενείς πράξεις CPU. Εξαιρετικά γρήγορες στους CPU.

Τα μαθηματικά είναι κομψά: αντί να πολλαπλασιάζετε αριθμούς κινητής υποδιαστολής 32 bit, συγκρίνετε τιμές 1 bit με XNOR και μετά μετράτε τα ταιριαστά bit με popcount. Η ίδια λογική σύγκριση, πολύ απλούστερη υλοποίηση. Και οι CPU το κάνουν αυτό από τη δεκαετία του 1970.

Απόδοση CPU με δυαδικά δίκτυα:

Για δυαδικά δίκτυα, οι CPU μπορούν να φτάσουν ή να ξεπεράσουν την απόδοση των GPU. Γιατί;

Το XNOR και το popcount είναι φθηνά στους CPU. 6 τρανζίστορ για XNOR. Πράξεις ενός κύκλου. Χωρίς γενικά έξοδα κινητής υποδιαστολής.

Οι GPU είναι βελτιστοποιημένες για κινητή υποδιαστολή. Οι πυρήνες τανυστών τους δεν βοηθούν στις δυαδικές πράξεις. Η εξειδίκευση γίνεται περιορισμός.

Είναι σαν να φέρνεις αυτοκίνητο Formula One σε αγώνα ράλι. Σίγουρα, είναι γρήγορο σε ομαλές πίστες. Αλλά όταν αλλάζει το έδαφος, το εξειδικευμένο αγωνιστικό μηχάνημα δυσκολεύεται ενώ το ευέλικτο αυτοκίνητο ράλι υπερέχει. Οι δυαδικές πράξεις άλλαξαν το έδαφος.

Η προσέγγιση Dweve:

Το σύστημά μας Loom τρέχει σημαντικά πιο γρήγορα σε CPUs σε σύγκριση με τα μοντέλα μετασχηματιστών σε GPUs. Όχι επειδή έχουμε μαγεία. Επειδή οι δυαδικές πράξεις ταιριάζουν καλύτερα στις CPUs από ό,τι ταιριάζουν οι πράξεις κινητής υποδιαστολής.

Το XNOR-popcount είναι αυτό για το οποίο σχεδιάστηκαν οι CPUs. Λογικές πράξεις. Μέτρηση bit. Γρήγορα.

Αυτό δεν είναι θεωρητικό. Είναι μετρήσιμο. Τα δυαδικά δίκτυα αλλάζουν θεμελιωδώς την εξίσωση του υλικού. Όταν μπορείτε να ενεργοποιήσετε μόνο 4-8 εξειδικευμένους τομείς από 456 διαθέσιμες επιλογές χρησιμοποιώντας δυαδικούς περιορισμούς, και κάθε εξειδικευμένος τομέας είναι 64-128MB καθαρών λογικών κανόνων, οι CPUs το διαχειρίζονται άριστα. Δεν χρειάζεται αριθμητική κινητής υποδιαστολής. Μόνο γρήγορες, αποδοτικές πράξεις bit.

Κατανάλωση ενέργειας (το κρυφό κόστος)

Η απόδοση δεν είναι το παν. Η κατανάλωση ενέργειας έχει σημασία. Ειδικά στην Ευρώπη, όπου το ενεργειακό κόστος είναι υψηλό και οι κανονισμοί βιωσιμότητας είναι αυστηροί.

Κατανάλωση GPU:

Οι υψηλής τεχνολογίας GPUs τεχνητής νοημοσύνης καταναλώνουν 300-700 watt. Υπό φορτίο, συνεχώς. Για ώρες ή ημέρες κατά τη διάρκεια της εκπαίδευσης.

Τα κέντρα δεδομένων γεμάτα με GPUs καταναλώνουν μεγαβάτ. Ηλεκτρική ενέργεια αντίστοιχη σταθμών παραγωγής. Τεράστιες απαιτήσεις ψύξης. Το λειτουργικό κόστος είναι τεράστιο.

Οι μελλοντικοί επεξεργαστές τεχνητής νοημοσύνης προβλέπεται να καταναλώνουν έως και 15.360 watt ο καθένας. Δεν είναι τυπογραφικό λάθος. Δεκαπέντε κιλοβάτ. Ανά τσιπ. Θα χρειαστείτε εξειδικευμένες λύσεις ψύξης και αποκλειστική υποδομή ισχύος. Η Οδηγία της ΕΕ για την Ενεργειακή Απόδοση απαιτεί από τα κέντρα δεδομένων με ισχύ άνω των 500 κιλοβάτ να αναφέρουν την κατανάλωση ενέργειας. Με τέτοιες GPUs, θα φτάσετε γρήγορα αυτό το όριο.

Κατανάλωση CPU:

Οι σύγχρονες CPUs καταναλώνουν 50-150 watt υπό φορτία τεχνητής νοημοσύνης. Πολύ λιγότερο από τις GPUs.

Για το συμπέρασμα, ειδικά στην ανάπτυξη στο άκρο του δικτύου, η ενεργειακή απόδοση έχει σημασία. Διάρκεια μπαταρίας. Θερμικά όρια. Λειτουργικά κόστη.

Η AMD ανακοίνωσε πρόσφατα την επίτευξη 20× βελτίωσης ενεργειακής απόδοσης σε επίπεδο rack για συστήματα τεχνητής νοημοσύνης έως το 2030, ξεπερνώντας τις τάσεις του κλάδου κατά σχεδόν 3×. Αλλά ακόμη και με αυτές τις βελτιώσεις, οι GPUs παραμένουν ενεργοβόρες σε σύγκριση με τις CPUs για πολλά φορτία εργασίας.

Πλεονέκτημα δυαδικών πράξεων:

Οι δυαδικές πράξεις καταναλώνουν πολύ λιγότερη ενέργεια από την κινητή υποδιαστολή. Απλούστερα κυκλώματα. Λιγότερη δραστηριότητα μεταγωγής. Χαμηλότερη ενέργεια ανά πράξη.

Σε CPUs με δυαδικά δίκτυα: 96% μείωση ισχύος σε σύγκριση με δίκτυα κινητής υποδιαστολής σε GPUs. Ίδια εργασία. Κλάσμα της ενέργειας.

Αυτό έχει σημασία για τη βιωσιμότητα. Για τα λειτουργικά κόστη. Για τους περιορισμούς ανάπτυξης. Όταν το κόστος ηλεκτρικής ενέργειας στην Ευρώπη είναι από τα υψηλότερα παγκοσμίως, η εκτέλεση τεχνητής νοημοσύνης σε CPUs με δυαδικές πράξεις δεν είναι απλώς αποδοτική· είναι οικονομικά λογική. Ο λογιστής σας θα εκτιμήσει τους χαμηλότερους λογαριασμούς ρεύματος. Ο υπεύθυνος βιωσιμότητας θα εκτιμήσει το μειωμένο αποτύπωμα άνθρακα.

Ζητήματα κόστους (η επιχειρηματική πραγματικότητα)

Το υλικό κοστίζει χρήματα. Ας είμαστε συγκεκριμένοι:

  • Κόστη GPU: Οι υψηλής τεχνολογίας GPUs τεχνητής νοημοσύνης κοστίζουν δεκάδες χιλιάδες ανά μονάδα. Η ενοικίαση κέντρου δεδομένων ποικίλλει αλλά αθροίζεται γρήγορα. Η εκπαίδευση μεγάλων μοντέλων απαιτεί εκατοντάδες GPUs για εβδομάδες. Ο λογαριασμός φτάνει τα εκατομμύρια.
  • Κόστη CPU: Οι υψηλής τεχνολογίας CPUs κοστίζουν χιλιάδες, όχι δεκάδες χιλιάδες. Πολύ φθηνότερες. Ήδη σε κάθε διακομιστή. Δεν χρειάζεται αγορά πρόσθετου υλικού.
  • TCO (Συνολικό Κόστος Ιδιοκτησίας): Οι GPUs απαιτούν κόστος υλικού συν κατανάλωση ενέργειας συν ψύξη συν εξειδικευμένη υποδομή. Υψηλό TCO.

CPUs: Χαμηλότερο κόστος υλικού συν χαμηλότερη ισχύς συν τυπική υποδομή. Χαμηλότερο TCO.

Για συμπέρασμα σε κλίμακα, ειδικά με δυαδικά δίκτυα, οι CPUs μπορούν να είναι πιο οικονομικές. Το χάσμα απόδοσης κλείνει, το χάσμα κόστους διευρύνεται υπέρ των CPUs.

Ορίστε ένα πρακτικό παράδειγμα: η εκτέλεση συμπερασμάτων για ένα εκατομμύριο αιτήματα την ημέρα. Σε GPU με μοντέλα κινητής υποδιαστολής, μπορεί να χρειαστείτε αποκλειστικούς διακομιστές GPU, υποδομή ψύξης και σημαντικούς προϋπολογισμούς ενέργειας. Σε CPU με δυαδικά δίκτυα, μπορείτε να χρησιμοποιήσετε την υπάρχουσα υποδομή διακομιστών, τυπική ψύξη και ένα κλάσμα της ενέργειας. Ίδιες δυνατότητες, εντελώς διαφορετικά οικονομικά.

Οι ευρωπαϊκές εταιρείες αντιμετωπίζουν ένα επιπλέον ζήτημα: την κυριαρχία του υλικού. Οι περισσότερες GPU υψηλής τεχνολογίας για AI προέρχονται από Αμερικανούς κατασκευαστές. Οι εξαρτήσεις στην εφοδιαστική αλυσίδα δημιουργούν κινδύνους. Οι CPU προσφέρουν περισσότερες επιλογές προμήθειας, συμπεριλαμβανομένων Ευρωπαίων κατασκευαστών. Όταν οι γεωπολιτικές εντάσεις επηρεάζουν τις προμήθειες τσιπ, το να έχεις εναλλακτικές έχει σημασία.

Τα δυαδικά δίκτυα αλλάζουν την καταλληλότητα του μηχανήματος: οι πράξεις XNOR και popcount μετακινούν το συμπέρασμα προς λειτουργίες που οι CPU ήδη εκτελούν αποδοτικά.

Πότε να χρησιμοποιήσετε τι

Η σωστή επιλογή εξαρτάται από την περίπτωση χρήσης σας:

Χρησιμοποιήστε GPU όταν:

Εκπαιδεύετε μεγάλα μοντέλα κινητής υποδιαστολής. Η απόδοση είναι κρίσιμη. Ο προϋπολογισμός το επιτρέπει. Η ισχύς δεν είναι περιορισμένη. Παραδοσιακές αρχιτεκτονικές νευρωνικών δικτύων.

Οι GPU υπερέχουν εδώ. Χωρίς αμφιβολία. Αν εκπαιδεύετε ένα μοντέλο μετασχηματιστή με 70 δισεκατομμύρια παραμέτρους, οι GPU είναι ο φίλος σας. Η παράλληλη αρχιτεκτονική και οι πυρήνες τανυστών τις καθιστούν την προφανή επιλογή για μαζικούς πολλαπλασιασμούς πινάκων κινητής υποδιαστολής.

Χρησιμοποιήστε CPU όταν:

Εκτελείτε συμπεράσματα στο άκρο του δικτύου. Η ισχύς είναι περιορισμένη. Το κόστος έχει σημασία. Οι απαιτήσεις καθυστέρησης είναι αυστηρές. Δυαδικά ή κβαντισμένα μοντέλα. Ανάπτυξη παντού.

Οι CPU έχουν νόημα. Συχνά είναι η μόνη επιλογή.

Εξετάστε επίσης τις CPU όταν χρειάζεστε συμμόρφωση με τον GDPR με τοπική επεξεργασία, όταν αναπτύσσετε σε ποικίλο υλικό χωρίς διαθεσιμότητα GPU, όταν η ενεργειακή απόδοση έχει μεγαλύτερη σημασία από την ακατέργαστη απόδοση ή όταν χρησιμοποιείτε δυαδικά νευρωνικά δίκτυα που αξιοποιούν τα πλεονεκτήματα των CPU.

Η υβριδική προσέγγιση:

Εκπαιδεύστε σε GPU (αν χρησιμοποιείτε κινητή υποδιαστολή). Αναπτύξτε σε CPU (χρησιμοποιώντας δυαδικές/κβαντισμένες εκδόσεις). Το καλύτερο και των δύο κόσμων.

Ή εκπαιδεύστε δυαδικά δίκτυα σε CPU από την αρχή. Παραλείψτε εντελώς τις GPU. Αυτή είναι η προσέγγιση της Dweve.

Δεν υπάρχει καθολική απάντηση. Το δόγμα «χρειάζεσαι GPU» αγνοεί τις αποχρώσεις. Ο φόρτος εργασίας σας, το περιβάλλον ανάπτυξης, οι περιορισμοί προϋπολογισμού και οι αρχιτεκτονικές επιλογές έχουν όλα σημασία. Πάρτε μια τεκμηριωμένη απόφαση, όχι μια αντανακλαστική.

Το μέλλον (εξέλιξη υλικού)

Το τοπίο του υλικού αλλάζει:

Εξειδικευμένα τσιπ AI:

TPU (Google). Νευρωνικοί κινητήρες (Apple). Προσαρμοσμένα ASIC. Βελτιστοποιημένα για συγκεκριμένους φόρτους εργασίας AI. Ούτε καθαρές CPU ούτε καθαρές GPU.

Αυτά μπορεί να κυριαρχήσουν σε συγκεκριμένες θέσεις. Αλλά οι CPU και οι GPU παραμένουν γενικής χρήσης. Και τα εξειδικευμένα τσιπ συνοδεύονται από κινδύνους κλειδώματος προμηθευτή. Όταν η Google ελέγχει τα TPU και η Apple ελέγχει τους νευρωνικούς κινητήρες, εξαρτάστε από τους οδικούς χάρτες και τις τιμές τους. Οι ευρωπαϊκές εταιρείες θα πρέπει να εξετάσουν αυτές τις επιπτώσεις κυριαρχίας.

Επεκτάσεις AI σε CPU:

Intel AMX (Advanced Matrix Extensions). ARM SVE2. Επεκτάσεις διανυσμάτων RISC-V. CPU που προσθέτουν οδηγίες ειδικές για AI.

Το χάσμα CPU-GPU για το AI μειώνεται. Ειδικά για ακέραιες και δυαδικές πράξεις.

Αυτές οι επεκτάσεις φέρνουν επιτάχυνση πολλαπλασιασμού πινάκων απευθείας στις CPU. Όχι τόσο ισχυρές όσο οι αποκλειστικές GPU για κινητή υποδιαστολή, αλλά επαρκείς για πολλούς φόρτους εργασίας. Και διατίθενται στάνταρ, χωρίς επιπλέον υλικό.

Ενεργειακά αποδοτικές αρχιτεκτονικές:

Καθώς το κόστος ενέργειας αυξάνεται, η αποδοτικότητα έχει μεγαλύτερη σημασία από την ακατέργαστη απόδοση. Δυαδικές πράξεις. Νευρομορφικά τσιπ. Αναλογική υπολογιστική.

Το μέλλον ευνοεί την αποδοτικότητα. Οι CPU με δυαδικές πράξεις ταιριάζουν καλύτερα σε αυτή την τάση από ό,τι οι ενεργοβόρες πράξεις κινητής υποδιαστολής των GPU.

Οι ευρωπαϊκές τιμές ενέργειας και οι κανονισμοί βιωσιμότητας επιταχύνουν αυτή τη στροφή. Όταν πληρώνεις υψηλές τιμές για το ρεύμα και αντιμετωπίζεις υποχρεώσεις μείωσης των εκπομπών άνθρακα, η αποδοτικότητα δεν είναι προαιρετική. Είναι υποχρεωτική. Το υλικό που κάνει περισσότερα με λιγότερη ενέργεια κερδίζει.

Ανάπτυξη του edge computing:

Η τεχνητή νοημοσύνη μετακινείται από το cloud στο edge. Κινητά. Αυτοκίνητα. Συσκευές IoT. Αυτές έχουν CPU, όχι GPU.

Η αποδοτική τεχνητή νοημοσύνη σε CPU γίνεται υποχρεωτική, όχι προαιρετική.

Ο ευρωπαϊκός κανονισμός για την τεχνητή νοημοσύνη (AI Act) δίνει έμφαση στην τοπική επεξεργασία για ορισμένες εφαρμογές. Το edge computing με τεχνητή νοημοσύνη βασισμένη σε CPU ευθυγραμμίζεται απόλυτα με αυτές τις κανονιστικές απαιτήσεις. Τα δεδομένα παραμένουν τοπικά. Η επεξεργασία γίνεται τοπικά. Η συμμόρφωση είναι απλούστερη.

Πραγματικά νούμερα απόδοσης

Ας γίνουμε συγκεκριμένοι με πραγματικές μετρήσεις:

Νευρωνικά δίκτυα κινητής υποδιαστολής:

GPU: 100-300 TFLOPS (τρισεκατομμύρια πράξεις κινητής υποδιαστολής ανά δευτερόλεπτο). Μοντέλα υψηλών προδιαγραφών όπως το A100 φτάνουν τα 624 TFLOPS για FP16. Το νεότερο H200 φτάνει ακόμα πιο ψηλά.

CPU: 1-5 TFLOPS

Νικητής: GPU (20-100× ταχύτερη)

Το χάσμα είναι αναμφισβήτητο. Για τα παραδοσιακά νευρωνικά δίκτυα, οι GPU κυριαρχούν. Γι' αυτό όλοι υπέθεταν ότι χρειάζεσαι GPU για την τεχνητή νοημοσύνη. Για μια δεκαετία, είχαν δίκιο.

Δυαδικά νευρωνικά δίκτυα:

GPU: Περιορίζεται από την έλλειψη εξειδικευμένου υλικού. Χρησιμοποιεί INT8 ή προσαρμοσμένους πυρήνες. Ίσως 10-30× ταχύτερη από CPU για δυαδικές πράξεις.

CPU: Οι XNOR και popcount είναι εγγενείς. Εξαιρετικά γρήγορες. Παράλληλες σε όλους τους πυρήνες με AVX-512.

Νικητής: Η CPU μπορεί να φτάσει ή να ξεπεράσει την GPU (Dweve Loom: 40× ταχύτερη σε CPU σε σύγκριση με transformers σε GPU)

Αυτή η αντιστροφή δεν είναι μαγεία. Είναι τα μαθηματικά που συναντούν τον σχεδιασμό υλικού. Οι δυαδικές πράξεις αξιοποιούν τα πλεονεκτήματα της CPU με τον ίδιο τρόπο που ο πολλαπλασιασμός κινητής υποδιαστολής αξιοποιεί τα πλεονεκτήματα της GPU.

Καθυστέρηση:

GPU: Επιβάρυνση μεταφοράς μέσω PCIe. 1-10ms μόνο για τη μετακίνηση δεδομένων.

CPU: Μηδενική επιβάρυνση μεταφοράς. Δυνατή η εξαγωγή συμπερασμάτων σε λιγότερο από ένα χιλιοστό του δευτερολέπτου.

Νικητής: CPU για εφαρμογές χαμηλής καθυστέρησης

Αυτή η επιβάρυνση του PCIe είναι σταθερή. Καμία βελτιστοποίηση δεν την εξαλείφει. Για εφαρμογές πραγματικού χρόνου όπου κάθε χιλιοστό του δευτερολέπτου μετράει, οι CPU κερδίζουν εκ σχεδιασμού.

Ενεργειακή απόδοση (πράξεις ανά βατ):

GPU: ~500-1000 GFLOPS/W (κινητής υποδιαστολής)

CPU: ~100-200 GFLOPS/W (κινητής υποδιαστολής)

Νικητής: GPU για κινητή υποδιαστολή

Οι δυαδικές πράξεις αλλάζουν αυτό:

CPU με δυαδικές πράξεις: 10-50× καλύτερες πράξεις ανά βατ από GPU με κινητή υποδιαστολή

Νικητής: CPU με δυαδικές πράξεις

Όταν το κόστος ηλεκτρικής ενέργειας στην Ευρώπη είναι 3-4× υψηλότερο από ό,τι στις ΗΠΑ, αυτές οι διαφορές απόδοσης μεταφράζονται άμεσα σε λειτουργικό κόστος. Η επιχειρηματική υπόθεση για τεχνητή νοημοσύνη βασισμένη σε CPU γίνεται πειστική γρήγορα.

Τι πρέπει να θυμάσαι

Αν δεν κρατήσεις τίποτα άλλο από αυτό, θυμήσου:

  • 1. Οι GPU κυριαρχούν στην κινητή υποδομή τεχνητής νοημοσύνης. Παραλληλισμός πολλαπλασιασμού πινάκων. Εξειδικευμένοι πυρήνες τανυστών. 20-100× ταχύτερες από τις CPU για παραδοσιακά νευρωνικά δίκτυα. Για φόρτους εργασίας κινητής υποδιαστολής, είναι η προφανής επιλογή.
  • 2. Οι CPU υπερέχουν σε διαφορετικά πράγματα. Πολύπλοκη λογική. Χαμηλή καθυστέρηση. Ακέραιες/δυαδικές πράξεις. Καθολική διαθεσιμότητα. Τοπική επεξεργασία συμβατή με GDPR.
  • 3. Τα δυαδικά δίκτυα αλλάζουν τα δεδομένα. Οι πράξεις XNOR και popcount είναι εγγενείς λειτουργίες των CPU. Οι CPU μπορούν να φτάσουν ή να ξεπεράσουν τις GPU σε επιδόσεις για δυαδική τεχνητή νοημοσύνη. Η μαθηματική μετατόπιση ευνοεί την αρχιτεκτονική των CPU.
  • 4. Η κατανάλωση ενέργειας έχει ολοένα μεγαλύτερη σημασία. GPU: 300-700W σήμερα, έως 15.360W προβλεπόμενα. CPU: 50-150W. Δυαδικές πράξεις: 96% μείωση ισχύος. Με το ενεργειακό κόστος στην Ευρώπη και τις επιταγές βιωσιμότητας, η αποδοτικότητα δεν είναι πολυτέλεια.
  • 5. Το κόστος δεν είναι μόνο το υλικό. Ισχύς. Ψύξη. Υποδομές. Κυριαρχία στην εφοδιαστική αλυσίδα. Το συνολικό κόστος ιδιοκτησίας έχει σημασία. Οι CPU είναι συχνά φθηνότερες για συμπερασματολογία σε κλίμακα, ειδικά με δυαδικά δίκτυα.
  • 6. Επιλέξτε βάσει φόρτου εργασίας, όχι δόγματος. Εκπαίδευση μεγάλων μοντέλων κινητής υποδιαστολής; GPU. Συμπερασματολογία στο άκρο; CPU. Δυαδικά δίκτυα; CPU. Συμμόρφωση GDPR; CPU. Οι υβριδικές προσεγγίσεις λειτουργούν επίσης.
  • 7. Το μέλλον ευνοεί την αποδοτικότητα. Υπολογιστική στο άκρο. Αυξανόμενο ενεργειακό κόστος. Κανονισμοί βιωσιμότητας της ΕΕ. Απαιτήσεις του AI Act. Οι αρχιτεκτονικές που ευνοούν τις CPU ανεβαίνουν, δεν παρακμάζουν.
Ο σωστός επεξεργαστής εξαρτάται από το σχήμα του φόρτου εργασίας, τον προϋπολογισμό ισχύος, την καθυστέρηση, το συνολικό κόστος, την τοποθεσία ανάπτυξης και τους περιορισμούς κυριαρχίας.

Η ουσία

Οι GPU κέρδισαν τον πρώτο γύρο της τεχνητής νοημοσύνης επειδή τα νευρωνικά δίκτυα σχεδιάστηκαν για πράξεις κινητής υποδιαστολής και μαζικό παραλληλισμό. Οι GPU κατασκευάστηκαν ακριβώς για αυτό. Μια δεκαετία κυριαρχίας δημιούργησε την υπόθεση ότι η τεχνητή νοημοσύνη απαιτεί GPU. Για φόρτους εργασίας κινητής υποδιαστολής, αυτό παραμένει αληθές.

Αλλά η τεχνητή νοημοσύνη εξελίσσεται. Δυαδικά δίκτυα. Ακέραια κβαντοποίηση. Αποδοτικές αρχιτεκτονικές. Αυτά ευνοούν τις CPU. Τα μαθηματικά θεμέλια άλλαξαν και μαζί τους το βέλτιστο υλικό.

Η αφήγηση «χρειάζεσαι GPU» είναι ξεπερασμένη για πολλές περιπτώσεις χρήσης. Συμπερασματολογία στο άκρο; Δυαδικά δίκτυα; Ανάπτυξη με ευαισθησία στο κόστος; Συμμόρφωση GDPR; Οι CPU είναι ανταγωνιστικές. Συχνά ανώτερες.

Το τοπίο του υλικού αλλάζει. Αναδύονται εξειδικευμένα τσιπ. Έρχονται επεκτάσεις τεχνητής νοημοσύνης στις CPU. Το μονοπώλιο των GPU τελειώνει. Οι ευρωπαϊκές εταιρείες έχουν ιδιαίτερα πλεονεκτήματα σε αυτή τη μετατόπιση: οι αυστηροί κανονισμοί προστασίας δεδομένων ευνοούν την τοπική επεξεργασία σε CPU, το υψηλό ενεργειακό κόστος ανταμείβει την αποδοτικότητα και οι ανησυχίες για κυριαρχία στο υλικό ωφελούν την ποικιλία προμήθειας CPU.

Η κατανόηση του τι κάνει καλά κάθε επεξεργαστής σάς βοηθά να επιλέξετε σωστά. Όχι βάσει διαφημιστικής εκστρατείας. Βάσει των πραγματικών σας απαιτήσεων. Επιδόσεις, ισχύς, κόστος, περιορισμοί ανάπτυξης, κανονιστική συμμόρφωση.

Οι GPU εξακολουθούν να κυριαρχούν στην εκπαίδευση μεγάλων μοντέλων κινητής υποδιαστολής. Αλλά η συμπερασματολογία; Η ανάπτυξη; Η υπολογιστική στο άκρο; Η ισορροπία μετατοπίζεται. Και οι δυαδικές πράξεις στις CPU οδηγούν αυτή τη μετατόπιση. Η επόμενη δεκαετία της τεχνητής νοημοσύνης δεν θα μοιάζει με την προηγούμενη. Το υλικό που φαινόταν απαραίτητο μπορεί να είναι προαιρετικό. Το υλικό που φαινόταν ανεπαρκές μπορεί να είναι ιδανικό.

Η επιλογή σας δεν είναι GPU ή CPU. Είναι η κατανόηση του ποιος φόρτος εργασίας ταιριάζει σε ποιο υλικό. Και όλο και περισσότερο, αυτή η κατανόηση δείχνει προς τις CPU για περισσότερες περιπτώσεις χρήσης από ό,τι υποδηλώνει η συμβατική σοφία.

Θέλετε να δείτε AI βελτιστοποιημένο για CPU στην πράξη; Εξερευνήστε το Dweve Loom. Δυαδικός συλλογισμός περιορισμών σε τυπικούς CPU. 40× ταχύτερο από μοντέλα μετασχηματιστών σε GPU. Μείωση ισχύος κατά 96%. Συμμορφώνεται με τον GDPR εξ ορισμού. Το είδος AI που λειτουργεί με το υλικό που ήδη διαθέτετε. Κατασκευασμένο στην Ευρώπη για τις ευρωπαϊκές απαιτήσεις.