Litica troškova oblaka: zašto je rubni AI jedina ekonomska budućnost
Poslovni model dilera droge
U svijetu ilegalnih supstanci postoji poznata marketinška strategija: „Prva doza je besplatna.“ Navučete kupca na osjećaj, a onda, kad postane ovisan, počnete naplaćivati. I naplaćujete zauvijek.
To je, u osnovi, poslovni model današnjih pružatelja Cloud AI usluga.
Daju vam besplatne kredite. API-je čine nevjerojatno jednostavnima za integraciju. Samo nekoliko redaka Pythona: import openai. import anthropic. Djeluje čarobno. Izradite demo u jednom poslijepodnevu. Radi savršeno. Generiranje odgovora košta djelić centa. Vaši su investitori impresionirani. Vaš je tim uzbuđen. Budućnost se čini neograničenom.
A onda lansirate. Povećavate opseg. Svoju značajku pokretanu umjetnom inteligencijom puštate u rad za 100.000 korisnika. I odjednom udarite u Cloud cjenovni zid.
Vaš račun za AWS ili OpenAI više nije samo stavka u knjigama; on je vaša stopa potrošnje. Vidjeli smo startupe u kojima trošak AI inferencije premašuje prihod od pretplata korisnika. To je negativna bruto marža. U svijetu poslovne fizike to je crna rupa. To je poslovni model koji je mrtav već na startu, bez obzira na to koliko je tehnologija briljantna.
To nije teoretski problem. Događa se upravo sada, u cijelom startup ekosustavu umjetne inteligencije. Pitanje nije hoće li se vaši AI troškovi eksplodirati s povećanjem opsega. Pitanje je hoćete li uspjeti posložiti ekonomiku prije nego što vam ponestane zaletne piste.
Razumijevanje poreza na tokene
Da biste razumjeli zašto troškovi umjetne inteligencije u oblaku eksplodiraju, morate razumjeti kako funkcionira naplata. To nije poput tradicionalne softverske infrastrukture.
Usluge umjetne inteligencije u oblaku naplaćuju se po "tokenu". Token je otprilike jedna riječ ili dio riječi (u prosjeku oko 4 znaka). GPT-4o naplaćuje otprilike 2,50 USD po milijunu ulaznih tokena i 10 USD po milijunu izlaznih tokena. Claude 3.5 Sonnet naplaćuje 3 USD po milijunu ulaznih tokena i 15 USD po milijunu izlaznih tokena. Ti brojevi zvuče maleno dok ne napravite matematiku u velikom razmjeru.
Uzmite tipičnu interakciju s AI chatbotom. Korisnik postavi pitanje (možda 50 tokena). Vaš sistemski prompt, povijest razgovora i dohvaćeni kontekst dodaju još 2.000 tokena. AI generira odgovor od 300 tokena. To je ukupno 2.350 tokena po interakciji.
Uz 3 USD po milijunu ulaznih tokena i 15 USD po milijunu izlaznih tokena, ta pojedinačna interakcija košta otprilike:
- Trošak ulaza: 2.050 tokena x (3 USD / 1.000.000) = 0,00615 USD
- Trošak izlaza: 300 tokena x (15 USD / 1.000.000) = 0,0045 USD
- Ukupno po interakciji: ~0,01 USD
Jedan cent po interakciji. To zvuči beznačajno. Ali sada uzmite potrošačku aplikaciju u kojoj korisnici komuniciraju 20 puta dnevno. To je 0,20 USD po korisniku dnevno, odnosno 6 USD po korisniku mjesečno samo za troškove umjetne inteligencije.
Ako naplaćujete 9,99 USD mjesečno za svoj proizvod i plaćate 6 USD mjesečno za troškove umjetne inteligencije, ostaje vam 40% prihoda za sve ostalo: poslužitelje, propusnost, korisničku podršku, marketing, plaće inženjera i profit. To nije SaaS posao. To je u najboljem slučaju stroj koji pokriva troškove.
A postaje i gore. Teški korisnici (koji su često vaši najbolji kupci i najglasniji zagovornici) koštaju eksponencijalno više. Napredni korisnik koji obavlja 100 interakcija dnevno košta vas 30 USD mjesečno. Oni vam doslovno gube novac svaki mjesec dok ostaju pretplaćeni. Što više vole vaš proizvod, to brže prazne vaš bankovni račun.
Tradicionalno softversko čudo
Da biste shvatili koliko je model umjetne inteligencije u oblaku pokvaren, usporedite ga s tradicionalnom SaaS ekonomikom.
Netflix struji video za više od 230 milijuna pretplatnika. Granični trošak strujanja još jednog filma jednoj osobi više je praktički jednak nuli. Bitovi su već predmemorirani na CDN poslužiteljima. Propusnost je unaprijed plaćena u skupnim ugovorima. Dodavanje pretplatnika Netflix gotovo ništa ne košta nakon što je infrastruktura izgrađena.
To se naziva "operativna poluga". Tradicionalna softverska poduzeća imaju nevjerojatnu operativnu polugu jer se granični trošak opsluživanja dodatnih korisnika približava nuli. Zato softverske tvrtke mogu postići bruto marže od 80% i više i zašto ih investitori vole.
Ekonomika izgleda ovako:
Stvarni brojevi: studija slučaja
Prođimo kroz stvarne brojke tvrtke kojoj smo savjetovali (podaci su anonimizirani, ali omjeri su zadržani).
Riječ je bila o B2B alatu za produktivnost koji je naplaćivao 29 USD mjesečno po korisniku. Integrirali su značajke AI sažimanja i pomoći pri pisanju koje je pokretao GPT-4. U njihovom demo okruženju s 50 beta korisnika sve je izgledalo odlično. AI troškovi iznosili su 200 USD mjesečno. Prihod je bio 1.450 USD mjesečno. Zdrava bruto marža od 86 %.
Pokrenuli su proizvod. Šest mjeseci kasnije imali su 15.000 korisnika koji plaćaju. Prihod je bio 435.000 USD mjesečno. Impresivan rast. No njihov je račun za OpenAI iznosio 380.000 USD mjesečno. Bruto marža pala je na 12,6 %. Nakon što su platili poslužitelje, podršku i inženjering, gubili su novac na svakom novom korisniku.
Što je pošlo po zlu? Njihov prosječni korisnik slao je 40 AI zahtjeva dnevno (izgradili su dobar proizvod koji su ljudi doista koristili). Svaki je zahtjev u prosjeku imao 3.500 tokena s kontekstom. Po GPT-4 cijenama to je iznosilo otprilike 0,84 USD po korisniku dnevno, odnosno 25,20 USD po korisniku mjesečno.
Naplaćivali su 29 USD, a plaćali 25,20 USD AI troškova. Proizvod koji je u beta fazi izgledao kao 86 % bruto marže postao je katastrofa s 13 % bruto marže u velikom opsegu. I što su više korisnika stjecali, to je bilo gore.
To je Cloud Cost Cliff. To nije blaga padina. To je litica s koje sletite kada uspijete.
Edge AI inverzija: preokretanje CapExa i OpExa
Rješenje nije pregovarati o boljim cijenama s OpenAI-jem (iako to marginalno pomaže). Rješenje je temeljito restrukturirati mjesto na kojem se odvija računanje.
Edge AI preokreće ekonomski model. Umjesto da iznajmljujete inteligenciju po tokenu u oblaku, posjedujete inteligenciju na vlastitom hardveru. Umjesto operativnih troškova (OpEx) koji rastu s upotrebom, imate kapitalne troškove (CapEx) koje plaćate jednom.
Razmotrite usporedbu troškova za proizvođača pametnih uređaja:
Zašto Edge AI do sada nije bio izvediv
Ako je edge AI ekonomski toliko očito bolji, zašto ga svi već nisu prihvatili? Odgovor leži u tehničkim zahtjevima tradicionalnih AI modela.
Modeli klase GPT-4 zahtijevaju otprilike 1,8 bilijuna parametara pohranjenih kao brojevi s pomičnim zarezom od 32 bita. To je otprilike 7,2 terabajta težina modela. To ne možete smjestiti na rubni uređaj. Ne možete to pokrenuti na pametnom telefonu. Svakako to ne možete pokrenuti na mikrokontroleru od 4 dolara.
Model u oblaku postoji jer su modeli toliko veliki da ih može pokretati samo infrastruktura razmjera oblaka. Trebate H100 GPU-ove po 25.000 dolara svaki, klastere s tisućama njih i energetsku infrastrukturu malog grada da biste ih održali u radu.
Ovdje Dweveova arhitektura Binary Constraint Discovery mijenja sve.
Dweve ne koristi tradicionalne neuronske mreže s pomičnim zarezom. Koristimo binarne skupove ograničenja: izračun od 1 bita s bitovnim operatorima (XNOR, AND, OR, POPCNT). Ovo nije kompromis. To je temeljno drugačiji pristup strojnoj inteligenciji.
Prednosti su zapanjujuće:
- 32x kompresija: Gdje tradicionalni modeli koriste 32-bitne floatove, mi koristimo 1 bit. Isti logički kapacitet, 32x manji.
- 96% manje energije: Binarne operacije troše ~0,15 pikodžula naspram ~4,6 pikodžula za pomični zarez. Baterija traje dulje. Račun za struju je niži.
- Učinkovitost hardvera: Moderni CPU-ovi imaju visoko optimizirane instrukcije za binarne operacije. Naših 1.937 algoritama u Dweve Coreu posebno je dizajnirano za iskorištavanje SIMD instrukcija poput AVX-512 za masivni paralelizam.
- Dizajn usmjeren na rub: Dweve Loomovih 456 specijaliziranih skupova ograničenja ukupno iznosi otprilike 150GB komprimirano. Ali samo 4-8 domennih specijalista aktivira se po upitu, što znači da je aktivna radna memorija samo 256MB-1GB. To stane na pametni telefon. To stane na pametni zvučnik. To stane na industrijske rubne uređaje.
Po prvi put možete pokretati sofisticirano AI zaključivanje na rubnom hardveru bez žrtvovanja kvalitete. Ekonomika se prebacuje s OpExa na CapEx. Litica nestaje.
Dividenda latencije: Pobjeđivanje fizike
Osim ekonomike, postoji tvrdo ograničenje koje nikakav novac ne može riješiti: brzina svjetlosti.
Svjetlost putuje otprilike 300.000 kilometara u sekundi. Signal iz tvornice u Münchenu do podatkovnog centra u Virginiji i natrag prelazi otprilike 14.000 kilometara, što traje oko 47 milisekundi pri brzini svjetlosti. U praksi, s usmjeravanjem, prebacivanjem, čekanjem u redu i obradom, latencija povratnog puta obično iznosi 150-300 milisekundi.
Za mnoge aplikacije ova latencija je presudna prepreka:
- Industrijska robotika: Robotska ruka koja osjeti ljudskog radnika na svom putu ne može čekati 200ms da poslužitelj u oblaku obradi sliku i pošalje naredbu za zaustavljanje. Pri tipičnim brzinama robota, to kašnjenje znači da ruka prijeđe 20-50 centimetara prije nego što reagira. U aplikacijama kritičnima za sigurnost, AI mora odlučiti u manje od 10 milisekundi.
- Autonomna vozila: Automobil koji putuje 130 km/h prelazi 36 metara u sekundi. Povratno putovanje do oblaka od 200ms znači vožnju naslijepo od 7,2 metra. Na toj udaljenosti pješak može sići s rubnika. Motocikl može izaći. Fiziku ne zanima vaša arhitektura oblaka.
- Glasovna sučelja: Ljudi su nevjerojatno osjetljivi na vrijeme u razgovoru. Istraživanja pokazuju da pauze dulje od 200ms djeluju "sporo" ili "glupo." Prekidamo jedni druge, pričamo preko pauza. Glasovni asistenti temeljeni na oblaku djeluju neprirodno jer mrežna latencija stvara neugodne tišine.
- Igre i mediji u stvarnom vremenu: Igrači primjećuju latenciju iznad 20ms. Za igre poboljšane AI-jem, zaključivanje u oblaku jednostavno nije opcija. Iskustvo mora biti u stvarnom vremenu.
Edge AI radi brzinom silicija. Dweveova binarna inferencija može obraditi upite u mikrosekundama, a ne milisekundama. Nema mrežnog podrhtavanja, nema redova čekanja na poslužitelju, nema prekida WiFi veze, nema ograničenja broja API poziva. Za aplikacije u stvarnom vremenu, edge nije samo jeftiniji; to je jedina arhitektura koja funkcionira.
Privatnost kao ušteda
Postoji sekundarna, često zanemarena ekonomska prednost rubne umjetne inteligencije: ne morate uopće obrađivati korisničke podatke.
Podaci su odgovornost, a ne imovina. Kada pohranjujete korisničke podatke u oblaku, snosite višestruke troškove:
- Troškovi pohrane: Svaki glasovni zapis, svaki transkript chata, svaki dnevnik interakcije zauzima prostor. Troškovi S3 pohrane se zbrajaju. Troškovi sigurnosnih kopija ih umnožavaju.
- Troškovi propusnosti: Prijenos audio zapisa, video okvira ili senzorskih podataka u oblak troši propusnost. U velikim razmjerima propusnost je često najveći infrastrukturni trošak.
- Troškovi sigurnosti: Podaci privlače napadače. Trebate sigurnosne timove, testiranje penetracije, planove odgovora na incidente, programe nagrađivanja za pronalazak grešaka. Trebate cyber osiguranje, koje svake godine postaje sve skuplje.
- Troškovi usklađenosti: GDPR, CCPA, HIPAA i deseci drugih propisa zahtijevaju posebne postupke rukovanja podacima. Trebate odvjetnike, službenike za usklađenost, revizorske tragove, ugovore o obradi podataka. Jedno kršenje GDPR-a može koštati 4% globalnog prihoda.
- Rizik parničenja: Ako dođe do povrede korisničkih podataka, suočavate se s kolektivnim tužbama, regulatornim kaznama i štetom za ugled. Prosječni trošak povrede podataka u 2024. godini iznosio je 4,45 milijuna dolara.
S rubnom umjetnom inteligencijom podaci nikada ne napuštaju korisnikov uređaj. Nema što pohraniti, nema što osigurati, nema što povrijediti, nema što otkriti u sudskim postupcima. Teret usklađenosti dramatično se smanjuje. Najjeftiniji podaci za zaštitu su podaci kojih se nikada ne dotaknete.
Za aplikacije osjetljive na privatnost (zdravstvo, financije, dječji proizvodi), rubna umjetna inteligencija nije samo ekonomski izbor. Često je to jedini način za postizanje regulatorne usklađenosti uz razumne troškove.
Bijeg iz zamke najma
Veliki pružatelji usluga u oblaku (Amazon, Google, Microsoft) i tvrtke za AI API-je (OpenAI, Anthropic) imaju interes za održavanje postojećeg stanja. Njihovi poslovni modeli ovise o tome da unajmljujete umjesto da posjedujete.
Žele da vjerujete kako je umjetna inteligencija previše složena, previše masivna i previše sofisticirana da bi se pokretala na vašem vlastitom hardveru. Žele da vjerujete kako trebate njihove vlasničke modele na njihovim unajmljenim GPU-ovima. Marketiraju praktičnost: "Samo pozovite naš API! Mi se nosimo sa složenošću!"
Ono što vam ne govore jest da gradite cijeli svoj posao na njihovoj marži. Kada koristite umjetnu inteligenciju u oblaku, značajan dio vaše ekonomije jedinice preuzima pružatelj infrastrukture. Plaćate ih da posjeduju odnos s korisnikom dok vi radite marketing i podršku.
Što je još gore, stvarate ovisnost. Vaši upiti su prilagođeni njihovim modelima. Vaši korisnici očekuju njihovo ponašanje. Troškovi prelaska rastu. A onda, kada nemate alternative, cijene rastu.
To je zamka najma. To je ista dinamika koja je podigla troškove stanovanja u velikim gradovima: vlasnici posjeduju ključnu infrastrukturu, stanari plaćaju zauvijek, bogatstvo se prenosi s korisnika na vlasnike.
Rubna umjetna inteligencija razbija zamku najma. Kada posjedujete inteligenciju na vlastitom hardveru, posjedujete sposobnost. Ne plaćate najamninu. Gradite kapital. Svaki uređaj koji isporučite s rubnom umjetnom inteligencijom imovina je, a ne odgovornost.
Pristup tvrtke Dweve: binarna inteligencija za rubnu implementaciju
Dweveova platforma posebno je projektirana za implementaciju na rubu mreže. Naša arhitektura Binary Constraint Discovery postiže inteligenciju razine oblaka u veličinama kompatibilnima s rubom mreže.
Evo kako omogućujemo ekonomsku inverziju:
- Dweve Core: 1.937 algoritama optimiziranih za hardver u 6 kategorija i 132 odjeljka. Potpuna podrška za CPU (SSE2, AVX2, AVX-512, ARM NEON, ARM SVE), GPU (CUDA, ROCm, Metal, Vulkan), FPGA i WebAssembly. Vi birate hardver koji odgovara vašem BOM-u.
- Dweve Loom: 456 specijaliziranih skupova ograničenja s ultra-rijetkom aktivacijom. Samo 4-8 domena specijalista aktivira se po upitu. Zahtjev za radnom memorijom: 256MB-1GB. Puna funkcionalnost, otisak kompatibilan s rubom mreže.
- Binarna kompresija: 32x manja od ekvivalentnih modela s pomičnim zarezom. Mogućnost koja zahtijeva 7GB u tradicionalnom formatu stane u 220MB s našom binarnom reprezentacijom.
- Energetska učinkovitost: 96% manje energije po inferenciji. Vaš vijek trajanja baterije se produljuje. Vaši troškovi energije padaju. Vaši toplinski zahtjevi se smanjuju.
Pružamo kompletan alatni lanac: kvantizaciju modela, okvire za implementaciju na rubu mreže, SDK-ove za uređaje i kontinuiranu podršku za optimizaciju. Vi se usredotočite na izgradnju svog proizvoda. Mi se brinemo da AI odgovara vašem hardveru.
Koga se Ovo Tiče
Litica troškova oblaka pogađa svaku tvrtku koja gradi proizvode pokretane umjetnom inteligencijom. No neke kategorije suočavaju se s akutnijim pritiskom:
Proizvođači potrošačkog hardvera: Pametni zvučnici, nosivi uređaji, automatizacija doma, igračke. Riječ je o proizvodima s niskom maržom i velikim volumenom gdje 5 USD po uređaju za troškove oblaka može premašiti vašu cijelu profitnu maržu. Rubna umjetna inteligencija nije opcija. To je preživljavanje.
Industrijski IoT: Tvornice, logistika, poljoprivreda, energetika. Ove aplikacije zahtijevaju odgovor u stvarnom vremenu i ne mogu tolerirati ovisnost o mreži. Prekid rada oblaka ne smije zaustaviti vašu tvornicu. Skok latencije ne smije srušiti vaš dron. Rub je jedina arhitektura.
Automobilska industrija: ADAS, infotainment, upravljanje voznim parkom. Vozila rade u zonama bez povezivosti. Zahtijevaju vremena odziva kritična za sigurnost. Imaju životni vijek od 10-15 godina gdje se tekući troškovi oblaka katastrofalno povećavaju. Rub je obavezan.
Medicinski uređaji: Praćenje pacijenata, dijagnostički alati, terapijski uređaji. Propisi o privatnosti strogo ograničavaju rukovanje podacima u oblaku. Zahtjevi u stvarnom vremenu zahtijevaju lokalnu obradu. Zabrinutost za odgovornost zahtijeva dokazive i revizijske sustave. Rub je put usklađenosti.
B2B SaaS s intenzivnom upotrebom umjetne inteligencije: Svaki proizvod u kojem korisnici često komuniciraju s umjetnom inteligencijom suočava se s problemom kompresije marže. Ako vaši korisnici vole vaše AI značajke, koristit će ih stalno, a vaše će marže ispariti. Rubne ili hibridne arhitekture mogu vratiti ekonomsku održivost.
Prijelazni Put
Prijelaz s oblaka na rub nije prekidač preko noći. Zahtijeva planiranje, ali put je jasan:
- Provjerite svoje trenutne troškove: Točno razumite koliko plaćate po korisniku, po interakciji, po značajki. Većina tvrtki podcjenjuje svoje AI troškove jer su skriveni u agregiranim računima za oblak.
- Prepoznajte zadatke visoke učestalosti i niske složenosti: Ne treba sve GPT-4. Mnogi uobičajeni AI zadaci (klasifikacija namjere, izdvajanje entiteta, sažimanje kratkih tekstova) mogu se izvoditi na mnogo manjim modelima na rubu mreže.
- Krenite s hibridnim pristupom: Složene i rijetke zadatke zadržite u oblaku. Jednostavne i česte zadatke premjestite na rub mreže. To odmah poboljšava vašu maržu dok razvijate pune mogućnosti ruba.
- Izgradite mogućnosti ruba: Surađujte s tvrtkom Dweve na implementaciji optimiziranih modela na vašem ciljnom hardveru. Naš tim pomaže vam upravljati kompromisima između mogućnosti modela, hardverskih zahtjeva i latencije zaključivanja.
- Iterirajte: Kako mogućnosti ruba sazrijevaju, premještajte više radnih opterećenja iz oblaka na rub. Svaka migracija poboljšava vaše marže i smanjuje vašu ovisnost o oblaku.
Cilj nije nužno nula oblaka. Neki zadaci uvijek mogu imati koristi od modela na razini oblaka. Cilj je ekonomska održivost: struktura troškova u kojoj rast stvara profit umjesto gubitaka.
Budućnost pripada vlasništvu
Trenutno doba dominacije AI-ja u oblaku povijesna je anomalija. Postoji jer su prve generacije sposobnih AI modela bile prevelike za bilo što osim implementacije u oblaku. Kako tehnike optimizacije sazrijevaju, kako se specijalizirani hardver poboljšava, kako tvrtke poput Dweve predvode učinkovite arhitekture, ekonomija se nepovratno pomiče prema rubu.
Pobjednici u sljedećem desetljeću neće biti tvrtke koje plaćaju najveće račune za oblak. Bit će to tvrtke koje posjeduju svoju inteligenciju, koje su ugradile AI mogućnosti u svoje proizvode na razini hardvera, koje su Token Tax pretvorile u Edge Dividend.
Prestanite plaćati najam. Počnite graditi vlasništvo. Litica troškova oblaka dolazi za sve koji na njoj još uvijek stoje.
Dweve vam može pomoći da siđete s ruba prije nego što padnete. Naša binarno optimizirana AI platforma radi na rubnim uređajima s minimalnim hardverskim zahtjevima, eliminirajući Token Tax koji uništava marže. Pomažemo vam prijeći s vječnog najma oblaka na jednokratni CapEx, omogućujući poslovne modele koji se doista isplativo skaliraju.
Bilo da gradite IoT uređaje, industrijsku automatizaciju, potrošačku elektroniku ili softver poboljšan umjetnom inteligencijom, imamo alate, stručnost i dokazanu evidenciju implementacija kako bismo rubni AI učinili ekonomski održivim za vaš proizvod.
Najam je previsok. Vrijeme je za vlasništvo.