Hardware Agnosticism: Защо залагането всичко на NVIDIA е стратегически риск
Капанът на монокултурата
Представете си, че 95% от колите в света могат да работят само с определен вид бензин, продаван от точно една компания. Представете си, че рафинерията на тази компания се намира на геоложки нестабилен остров. Представете си, че всеки друг производител на коли трябва да проектира двигателите си така, че да отговарят на тази конкретна горивна смес.
Ако тази компания има производствен проблем, или вдигне цените с 400%, или ако блокада откъсне острова, световната икономика ще спре. Транспортът ще престане.
Това звучи като дистопична фантастика, но това е точната реалност на индустрията за изкуствен интелект днес.
През 2025 г. приблизително 95% от обучението на ИИ и висококачественият извод се случват на GPU, произведени от една компания: NVIDIA. Целият глобален стек за ИИ (от рамките на PyTorch до проектите за охлаждане на центровете за данни) е оптимизиран за архитектурата на NVIDIA. Индустрията е пристрастена към CUDA, патентованата софтуерна платформа на NVIDIA.
NVIDIA е блестяща компания. Те създадоха невероятна технология. Но тази монокултура е стратегически кошмар. Тя създава единична точка на отказ (SPOF) за цялото бъдеще на човешкия интелект.
Структурният недостиг
Всички преминахме през недостига на H100 през 2023 и 2024 г. Стартъпи чакаха по 12 месеца за хардуер. Правителства трупаха чипове като златни кюлчета. Цената на изчислителната мощ скочи рязко.
Това не беше просто временен срив във веригата на доставки. Беше структурно тясно място. Производството на тези чипове разчита на изключително сложен процес, наречен CoWoS (Chip-on-Wafer-on-Substrate) усъвършенствано опаковане, изпълняван основно от TSMC в Тайван. Капацитетът за изграждане на тези опаковки е ограничен. Законите на физиката са ограничени.
Ако стратегията ви за ИИ разчита на достъп до най-новия и най-добър чип на NVIDIA, залагате оцеляването на компанията си на верига за доставки, която не контролирате, за продукт, който се продава на този, който предложи най-висока цена.
Ровът на CUDA
Истинското заключване не е хардуерът, а софтуерът. CUDA е езикът на ИИ. В продължение на 15 години изследователи и студенти се учат да пишат CUDA ядра. Библиотеките са оптимизирани за CUDA. Ако се опитате да пуснете стандартен ИИ код на карта на AMD или на ускорител на Intel, често попадате в свят на болка: счупени зависимости, липсващи ядра и слаба производителност.
This "CUDA Moat" keeps competitors out. It ensures that even if AMD builds a chip that is faster and cheaper (which they have), nobody buys it because the software doesn't just "work."
The Dweve Philosophy: Run Everywhere
At Dweve, we made a radical decision early on. We looked at the CUDA trap and we said: "No."
We decided that we would not write a single line of CUDA. We would not take a dependency on a proprietary hardware stack.
Instead, we built our stack on open standards. We use Vulkan (the graphics API that runs on everything from Android phones to Linux servers). We use OpenCL. We use SPIR-V. We rely on intermediate representations (IRs) like MLIR (Multi-Level Intermediate Representation).
But the real secret sauce isn't just the API; it's the math.
Тъй като нашите двоични невронни мрежи (BNN) разчитат на прости целочислени операции (XNOR и POPCNT), а не на сложни матрични умножения с плаваща запетая, ние не сме обвързани със специфичните „Tensor Cores“, които само NVIDIA владее добре.
Tensor Cores са специализирани хардуерни модули, предназначени да изпълняват бързо математика с 16-битова плаваща запетая. Ако алгоритъмът ви разчита на FP16, имате нужда от Tensor Core. Ако алгоритъмът ви разчита на 1-битова логика, нямате нужда от него. Просто ви трябват основни цифрови логически порти.
Тази архитектурна свобода ни позволява да работим ефективно на зашеметяващо разнообразие от хардуер:
1. AMD ROCm
GPU-тата Instinct на AMD предлагат огромна сурова изчислителна мощ и честотна лента на паметта за долар. За workloads с плаваща запетая софтуерният стек (ROCm) исторически е бил слабото място. Но за нашите бинарни workloads ние компилираме директно до ISA (Instruction Set Architecture). Заобикаляме нестабилните библиотеки. На хардуер на AMD моделите Dweve летят.
2. Intel CPUs (AVX-512)
Всички пренебрегват скромния CPU. Но модерните процесори Intel Xeon имат инструкционен набор, наречен AVX-512. Той позволява на процесора да обработва 512 бита данни в един цикъл. За бинарна невронна мрежа това означава 512 неврона, обработени мигновено. Можем да изпълняваме високопроизводителен inference на стандартни сървъри, които компаниите вече притежават. Не е необходим GPU.
3. RISC-V
RISC-V е архитектурата с отворен код на хардуера на бъдещето. Тя е за чиповете това, което Linux беше за операционните системи. Работим нативно на RISC-V ускорители. Това е от решаващо значение за Европа и развиващите се нации, които искат да изградят собствени местни чип индустрии, независими от американския експортен контрол.
4. FPGAs (Field Programmable Gate Arrays)
Това е най-вълнуващата граница. FPGA е чип като „празно платно", който може да бъде прекабелен за милисекунди. Тъй като нашите мрежи използват прости логически порти, можем физически да окабелим чипа, за да съответства на структурата на невронната мрежа. Данните преминават през чипа като вода през тръби, с нулев overhead. Това осигурява ултра-ниска латентност (микросекунди) и изключителна енергийна ефективност.
Стратегическа устойчивост и суверенитет
За нашите клиенти (особено правителства, отбранителни агенции и доставчици на критична инфраструктура) този хардуерен агностицизъм е убийствена функция.
Това означава, че не са заключени от санкции. Ако геополитическа криза прекъсне достъпа до американски чипове, те могат да стартират своите модели Dweve на европейски чипове или на широко достъпен стар кремък. Те имат „План Б".
Това означава, че имат договаряща сила. Те не са обвързани с капризите на ценообразуването на един доставчик. Ако NVIDIA вдигне цените, те могат да преминат към AMD или специализирани ASIC без да пренаписват софтуера си.
Това също означава дълготрайност. NVIDIA H100 ще бъде остарял след 3 години. В индустриални среди (влакове, фабрики, електроцентрали) оборудването трябва да издържи 20 години. Един стандартен FPGA или стандартен CPU ще бъде използваем в продължение на десетилетия. Ние изграждаме софтуер, който зачита жизнения цикъл на физическия свят.
Ерата след GPU
Вярваме, че доминацията на универсалния GPU (GPGPU) за AI е историческа аномалия. Той беше правилният инструмент за фазата на прототипиране на AI, защото беше гъвкав и наличен. Но когато AI навлезе във фазата на внедряване, ще видим взрив от специализиран хардуер.
Ще видим аналогови изчисления. Оптични изчисления. Невроморфни изчисления. Изчисления в паметта. Тези архитектури са фундаментално несъвместими с CUDA. Те изискват нов софтуерен стек.
Като отделяме софтуера си от хардуерния монопол днес, Dweve е подготвен за бъдещето. Ние не изграждаме само за чиповете на 2025 г.; изграждаме за физиката на 2035 г.
Искате AI, който работи при вашите условия, а не при тези на NVIDIA? Хардуерно агностичната архитектура на Dweve ви дава стратегическа свобода, контрол върху разходите и суверенна устойчивост. Свържете се с нас, за да откриете как нашите двоични невронни мрежи могат да работят на хардуера, който вече притежавате, или на отворения силиций на утрешния ден.