Prečo nudná infraštruktúra víťazí vo vážnej AI
Ukážka, ktorá vyzerala ako budúcnosť až do obeda
Najpresvedčivejšia AI ukážka, akú som kedy videl, zlyhala kvôli fronte. Nie model, nie prompt, nie vektorové vyhľadávanie, nie elegantný agentový graf, pri ktorom sa všetci v miestnosti naklonili dopredu. Fronta. Počas dopoludnia systém spracúval e-maily na podporu, nachádzal relevantné dokumenty, navrhoval odpovede, označoval neistotu a smeroval zložité prípady na človeka. Pôsobil pokojne a takmer nespravodlivo bystro. Na obed sa importná úloha zdvojnásobila, nadväzujúci e-mailový systém sa spomalil, opakované pokusy sa hromadili na ďalších opakovaných pokusoch a fronta sa začala správať ako zdvorilá dopravná zápcha s priloženými faktúrami.
O tretej bol model stále schopný. To bolo na tom urážlivé. Inteligencia nezmizla. Zmizlo potrubie. Správy sa spracúvali v nesprávnom poradí. Niektoré úlohy sa opakovali so zastaraným kontextom. Niekoľko duplicitných odpovedí čakalo na schválenie. Informačný panel ukazoval zelenú, pretože panel meral koncový bod modelu, nie prácu. Incident nebol filmový. Nikto nekopol do servera. Systém jednoducho odhalil, že múdra časť bola umiestnená na podlahe z kartónu a optimizmu.
Preto v serióznej AI víťazí nudná infraštruktúra. Seriózna AI nie je verzia, ktorá na pätnásť minút zapôsobí na miestnosť. Je to verzia, ktorá prežije zlý vstup, oneskorené závislosti, čiastočné výpadky, expirované poverenia, preťažené indexy, fronty na ľudskú kontrolu, nárasty nákladov, zmeny schém, regionálnu latenciu, audítorské požiadavky a pondelkové ráno. Model záleží. Samozrejme, že záleží. Ale model je len jeden komponent v systéme, ktorý musí posúvať prácu v čase bez toho, aby klamal o tom, čo sa stalo.
Odvetvie rado hovorí o inteligencii, akoby model bol produkt a všetko okolo neho len lešenie. V produkcii je lešenie často produktom. Identita rozhoduje, kto sa môže pýtať. Dátové kontrakty rozhodujú, čo systém smie vedieť. Vyhľadávanie rozhoduje, aké dôkazy sa dostanú k modelu. Fronty rozhodujú, či práca prichádza v obnoviteľnom poradí. Logy rozhodujú, či sa dá chyba vyšetriť. Vyhodnocovanie rozhoduje, či je zlepšenie skutočné. Rollback rozhoduje, či sa zlý release stane incidentom alebo poznámkou pod čiarou. Nič z toho nevyzerá pôsobivo v propagačnom videu. To hovorí v ich prospech.
Nuda neznamená jednoduchosť
Nudná infraštruktúra sa často zamieňa so základnou infraštruktúrou. Nie je to tak. Je to infraštruktúra, z ktorej boli prekvapenia odstránené návrhom, opakovaním a dôkazmi. Dobrá fronta je nudná, pretože má explicitné poradie, politiku opakovaných pokusov, deduplikáciu, časový limit viditeľnosti, spracovanie nedoručených správ a spätný tlak. Dobrá schéma je nudná, pretože je verzovaná, testovaná, zdokumentovaná a odmietnutá, keď je nesprávna. Dobrý log je nudný, pretože hovorí, čo sa stalo, spôsobom, ktorý sa dá spojiť s inými dôkazmi. Nuda nie je absencia myslenia. Je to myslenie, ktoré už zaplatilo nájom.
Systémy umelej inteligencie to potrebujú viac ako bežný softvér, pretože vnášajú neistotu do samotného jadra. Tradičnú službu možno často opísať deterministickými prechodmi. Komponent umelej inteligencie môže vrátiť pravdepodobnostnú odpoveď, zoradenú množinu možností, vygenerovaný text, extrahované pole, volanie nástroja alebo odmietnutie. Tento výstup potom musí vstúpiť do pracovného postupu, ktorý očakáva stavy, oprávnenia, termíny, úrovne služieb a zodpovednosť. Ak je infraštruktúra okolo modelu vágna, neistota modelu presakuje do prevádzky. Potom to ľudia nazývajú rizikom umelej inteligencie, hoci veľká časť z toho je v skutočnosti potrubie s problémami s dôverou.
Nudná infraštruktúra dáva pravdepodobnostným komponentom bezpečný tvar. Zachytáva výzvy, vstupy, získané dôkazy, verzie modelov, politiky, volania nástrojov, výstupy, ľudské rozhodnutia a následné účinky. Obmedzuje autoritu prostredníctvom identity a rozsahov. Považuje zlyhanie za stav, nie za prekvapenie. Oddeľuje návrh od akcie. Vyžaduje dôkazy, kým automatizácia zasiahne do dôležitého pracovného postupu. Zachováva dostatok kontextu na preskúmanie. Model môže byť stále kreatívny, neistý a občas nesprávny. Systém okolo neho nemusí zakaždým improvizovať.
Toto nie je proti inováciám. Je to to, čo umožňuje inováciám prežiť. Najrýchlejšie tímy, ktoré poznám, nie sú tie s najmenším počtom procesov. Sú to tie, ktorých procesy žijú v užitočných koľajach: lokálne testovacie sady, opakovateľné nasadenia, jasný rollback, známe dátové kontrakty, jednoduchá pozorovateľnosť a cesty preskúmania, ktoré nevyžadujú výbor na nájdenie správnej tabuľky. Pohybujú sa rýchlo, pretože bežné riziko má kam ísť. Ostatní to nazývame nudným len preto, že spoľahlivé veci nepredvádzajú sa pre pozornosť.
Model nie je operačný systém
Existuje opakujúca sa fantázia, že schopný model môže nahradiť infraštruktúru okolo seba. Dajte mu dostatok kontextu a bude smerovať, overovať, rozhodovať, monitorovať, vysvetľovať, opravovať a možno aj aktualizovať runbook, zatiaľ čo varí čaj. Fantázia je pochopiteľná, pretože modely sú flexibilné. Flexibilita je zvodná. Je tiež slabou náhradou za explicitné systémové hranice. Model môže pomôcť vybrať trasu. Nemal by byť jediným miestom, kde trasa existuje.
Keď tímy nechajú model absorbovať zodpovednosti infraštruktúry, vytvárajú skrytú politiku. Výzva hovorí, ktoré zdroje sú preferované. Výzva hovorí, kedy odmietnuť. Výzva hovorí, ktorý nástroj použiť. Výzva hovorí, ako spracovať chýbajúce polia. Výzva hovorí, čo sa považuje za riziko. Niektoré z toho môže byť v poriadku na prieskum. Vo výrobe sa skrytá politika stáva ťažko testovateľnou, verzovateľnou, auditovateľnou a spochybniteľnou. Dlhá výzva sa môže stať ústavou napísanou na obrúsku a uloženou v premennej prostredia. Toto je živý prístup k riadeniu, ale nie zrelý.
Seriózna AI oddeľuje uvažovanie od autority. Model môže navrhovať. Pracovný postup rozhoduje o tom, či má návrh dostatok dôkazov, či má používateľ povolenie, či je akcia reverzibilná, či musí človek schváliť a či sa náklady zmestia do rozpočtu. Model môže zhrnúť prípad. Systém prípadov rozhoduje o tom, či sa zhrnutie stane záznamom. Model môže zavolať nástroj. Brána nástrojov rozhoduje o tom, či je volanie povolené. Toto oddelenie nie je byrokracia. Je to spôsob, akým systém zostáva kontrolovateľný, keď je inteligencia nesprávna, neúplná alebo presvedčivá.
Čím je model schopnejší, tým dôležitejšie sú hranice. Slabý model zlyháva hlučne a často. Silný model môže zlyhať ticho, vierohodne a vo veľkom rozsahu. Dokáže napísať sebavedomé vysvetlenie pre nesprávny zdroj. Dokáže zavolať nástroj s vynikajúcou gramatikou. Dokáže zahladiť chýbajúce dôkazy spôsobom, ktorý upokojí operátora. Infraštruktúra preto musí byť tvrdohlavejšia ako model. Mala by vyžadovať potvrdenia, kontrolovať rozsahy, vynucovať limity a uchovávať záznamy, aj keď odpoveď znie nádherne rozumne.
Dátové kontrakty porazia dobré úmysly
Mnohé incidenty s AI začínajú malým nesúladom. Pole, ktoré bolo voliteľné, sa stane povinným. Časová pečiatka zmení časové pásmo. Dokumentový analyzátor začne označovať sekcie inak. Stavový kód získa novú hodnotu. Chýba jazyková značka. Identifikátor zákazníka príde v jednom toku hashovaný a v druhom čistý. Model dostane niečo dosť vierohodné na spracovanie a dosť nesprávne na to, aby to otrávilo výsledok. Dobré úmysly to nezachytia. Dátové kontrakty áno.
Dátový kontrakt nie je veľký filozofický objekt. Uvádza, aký tvar majú dáta, ktoré polia sú povinné, čo znamenajú hodnoty, ako sa menia verzie, aké prahy kvality platia, kto vlastní zdroj a čo sa stane, keď sa kontrakt poruší. V systémoch AI by kontrakty mali opisovať aj čerstvosť, pôvod, povolenia, význam značiek, politiku delenia na časti, model vloženia, rozsah vyhľadávania a pravidlá redakcie. Kontrakt je miesto, kde dáta prestávajú byť dojmami a stávajú sa dohodou.
Kontrakty sú dôležité, pretože modely sú tolerantné. Dokážu pochopiť neusporiadaný vstup. Táto tolerancia je užitočná na okraji a nebezpečná na hranici. Ak človek pošle nezvyčajnú otázku, tolerancia pomáha. Ak zdrojový kanál ticho zmení význam, tolerancia skryje poruchu. Systém by mal byť prísny na integračných hraniciach a flexibilný vo vrstve uvažovania. Obrátenie tohto vzoru vám dá krehkých používateľov a uvoľnené kanály, čo je efektívny spôsob, ako zbierať ospravedlnenia.
To isté platí pre výstup. Vygenerovaná odpoveď nestačí. Nadväzujúce systémy potrebujú štruktúrovaný stav: prijaté, odmietnuté, vyžaduje kontrolu, chýbajúce dôkazy, zablokované politikou, zlyhanie nástroja, prekročené náklady. Potrebujú kódy dôvodov, miery spoľahlivosti, odkazy na zdroje, verzie modelov a identifikátory na sledovanie. Ak komponent umelej inteligencie vydáva iba prózu, každý nadväzujúci spotrebiteľ sa stáva literárnym kritikom. To je nespravodlivé voči softvéru a zvyčajne aj voči literatúre.
Logy nie sú vedľajší produkt
Vo vážnej umelej inteligencii logy nie sú výfukové plyny. Sú súčasťou nervového systému produktu. Užitočný log spája zámer používateľa, povolenia, šablónu výzvy, získané dôkazy, verziu modelu, parametre, volania nástrojov, latenciu, náklady, výstup, ľudský zásah a nadväzujúcu akciu. Nemusí široko odhaľovať tajomstvá ani osobné údaje. Musí však zachovať dosť na to, aby odpovedal na dospelé otázky: prečo sa to stalo, kto to povolil, čo to videlo, čo sa zmenilo a ako zabránime tomu, aby sa to stalo znova.
Bez logov sa každý incident s umelou inteligenciou zmení na seansu. Ľudia sa zhromaždia okolo snímky obrazovky. Niekto si spomenie, že výzva sa minulý týždeň zmenila. Niekto iný povie, že index bol obnovený. Tretia osoba si myslí, že používateľ mohol mať inú rolu. Stránka so stavom dodávateľa modelu sa konzultuje s rituálnou vážnosťou. Nakoniec tím napíše vierohodný príbeh. Vierohodné príbehy sú užitočné v románoch. V prevádzke sú daňou za chýbajúce dôkazy.
Logovanie musí byť navrhnuté s ohľadom na súkromie a bezpečnosť, nie pridané ako nerozlišujúce zaznamenávanie. Citlivé výzvy môžu vyžadovať redakciu alebo hašovanie. Prístup k stopám by mal byť obmedzený. Uchovávanie by malo zodpovedať riziku. Niektoré údaje by sa do logov nemali dostať vôbec. Ale odmietať logovať, pretože logovanie je rizikové, je ako odmietať brzdy, pretože rýchlosť je nebezpečná. Správna odpoveď je kontrolované logovanie, nie prevádzková slepota.
Dobré logy tiež robia zlepšovanie čestným. Ak nová výzva zníži chyby na ručne vybranom súbore príkladov, ale zvýši ľudské zásahy v produkcii, systém by to mal ukázať. Ak zmena vyhľadávania zníži latenciu, ale zvýši zastarané citácie, systém by to mal ukázať. Ak upgrade modelu zníži náklady, ale zvýši odmietnutia pre určitý jazyk, systém by to mal ukázať. Vážna umelá inteligencia potrebuje menej snímok víťazstva a viac prepojených stôp.
Vyhodnocovanie je infraštruktúra
Vyhodnocovanie sa príliš často považuje za výskumnú činnosť, ktorá sa deje pred nasadením. Vo vážnej umelej inteligencii je infraštruktúrou. Beží nepretržite, viaže sa na vydania, vzorkuje produkciu, porovnáva verzie modelov, testuje vyhľadávanie, meria ľudské zásahy a sleduje regresie v skupinách, jazykoch, doménach a pracovných postupoch. Vyhodnocovanie je pamäťou systému o tom, čo znamená dobré. Bez neho sa zlepšovanie stáva vecou vkusu a vkus má vo zvyku súhlasiť s tým, kto prezentuje demo.
Hodnotiaca sada by nemala byť statickou trofejou. Mala by zahŕňať bežné prípady, náročné prípady, nedávne zlyhania, nepriateľské podnety, hranice politík, jazyky s nízkou podporou, okrajové dokumenty, zastarané záznamy, nejednoznačné otázky a príklady, kde je správnou odpoveďou odmietnutie. Mala by vedieť, ktorá metrika je dôležitá pre ktorý pracovný postup. Sumarizátor, klasifikátor, kódovací asistent, triediaci systém a vyhľadávací agent nezlyhávajú rovnakým spôsobom. Zaobchádzať s nimi ako s jedným benchmarkom prináša číslo a málo múdrosti.
Vyhodnocovanie si tiež vyžaduje správu údajov. Odkiaľ príklady pochádzajú. Sú povolené na toto použitie. Obsahujú citlivé informácie. Sú stále reprezentatívne. Kto ich označil. Ako sa riešili nezhody. Čo sa zmenilo od minulého mesiaca. Testovacia sada môže zastarať alebo sa skresliť ako ktorýkoľvek iný súbor údajov. Ak sa s hodnotiacim korpusom zaobchádza ako s posvätným, časom sa stane svätyňou starých predpokladov. Svätyne málokedy zachytia odchýlky vo výrobe.
Najdôležitejšie je, že vyhodnocovanie by malo byť prepojené s kontrolou vydávania. Model, podnet, vyhľadávací index, analyzátor, brána nástrojov alebo zmena politiky by nemali vstúpiť do výroby len preto, že sa zdajú byť lepšie. Mali by prejsť relevantnými testami, uviesť známe kompromisy a zanechať záznam. Niektoré zmeny sa oplatí nasadiť napriek regresiám, pretože sa zlepšia náklady, latencia, bezpečnosť alebo pokrytie. To je v poriadku. Seriózne inžinierstvo nie je absencia kompromisov. Je to odmietnutie objaviť ich náhodou.
Riadenie nákladov je spoľahlivosť
O nákladoch na AI sa často diskutuje vo financiách až potom, čo bola architektúra už emocionálne prijatá. To je neskoro. Náklady sú vlastnosťou behu. Ovplyvňujú spoľahlivosť, pretože drahé systémy sa pod tlakom správajú zvláštne. Tímy vypínajú logovanie, aby ušetrili peniaze. Znižujú kvalitu kontextu. Vynechávajú vyhodnocovanie. Vyhýbajú sa opakovaniam. Dávkovanie práce príliš agresívne. Nechávajú narastať backlogy. Skrývajú používanie. Náklady potom prestanú byť faktúrou a stanú sa konštrukčným obmedzením, ktoré sa tvári ako prekvapenie.
Seriózna AI infraštruktúra robí náklady viditeľnými na rovnakej úrovni ako latenciu a chyby. Každá požiadavka by mala mať rozpočet. Drahé volania nástrojov by mali byť ohraničené. Vyhľadávanie by sa malo vyhnúť tomu, aby na zodpovedanie otázky o jednom odseku prinieslo polovicu knižnice. Dlhý kontext by mal byť odôvodnený. Dávkové úlohy by mali mať kvóty a zrušenie. Agenti by mali mať limity krokov. Vyhodnocovanie by malo merať náklady na prijateľný výsledok, nielen náklady na token. Jednotkou, ktorá sa počíta, je užitočná práca, nie výpočtový konfety.
Riadenie nákladov tiež chráni bezpečnosť. Nekontrolovaná slučka agenta nie je len drahá. Môže opakovať akcie, posielať duplicitné správy, zamykať záznamy alebo bombardovať systém tretej strany. Proces vyhľadávania, ktorý indexuje všetko, môže vystaviť údaje nad rámec svojho účelu. Úloha sumarizácie, ktorá prechádza cez všetky dokumenty, môže vytvoriť odvodené záznamy s novými povinnosťami uchovávania. Rozpočtové hranice vynucujú jasnosť návrhu. Pýtajú sa, prečo systém robí danú vec a kedy by mal prestať. Stroje túto pomoc potrebujú. Nie sú známe dobrovoľnou zdržanlivosťou.
Nie je žiadna hanba optimalizovať pre bežný hardvér, menšie modely, ukladanie do vyrovnávacej pamäte, dávkovanie, predpočítanie a lokálnu inferenciu tam, kde je to vhodné. Seriózna AI sa nemeria tým, ako veľkolepo znie hardvér. Meria sa tým, či systém dokáže dodať požadovanú kvalitu v rámci nákladového limitu, ktorý mu umožní pokračovať v prevádzke. Skvelý model, ktorý je príliš drahý na pozorovanie, vyhodnocovanie a obnovu, nie je produkčný systém. Je to grantový návrh s API.
Ľudská kontrola nie je záplata na zlú infraštruktúru
Ľudská kontrola je potrebná v mnohých systémoch umelej inteligencie, najmä tam, kde rozhodnutia ovplyvňujú práva, peniaze, zdravie, bezpečnosť alebo dôveru. Kontrola sa však často používa ako smetisko pre všetko, čo infraštruktúra nezvládla: chýbajúce dôkazy, vágne pravidlá, nízka miera istoty, zlé smerovanie, duplicitné úlohy, nesprávne označenia a nejasné vlastníctvo. Potom vedúci vyhlásia, že v systéme je človek, akoby bol človek zázračným rozpúšťadlom. Človekom je zvyčajne pracovník s radom úloh, termínom a stoličkou pochybnej ergonomickej hodnoty.
Kontrola tiež potrebuje infraštruktúru. Kontrolóri potrebujú dôkazy, ktoré model videl, dôkazy, ktoré nevidel, použitú politiku, verziu modelu, kódy istoty a dôvodov, zdrojové dokumenty, možnosť opraviť štruktúrované polia a spôsob, ako vrátiť opravy späť do vyhodnocovacích a tréningových dát. Potrebujú limity pracovného zaťaženia. Potrebujú eskaláciu. Potrebujú audítorské záznamy. Potrebujú ochranu pred zaujatosťou automatizácie, keď sa plynulá odpoveď ticho zmení na postrčenie.
Dobrý kontrolný systém tiež rozlišuje medzi neistotou a rizikom. Niektoré prípady sú neisté, ale majú nízky vplyv a možno na ne odpovedať s výhradami. Niektoré sú isté, ale majú vysoký vplyv a napriek tomu vyžadujú schválenie. Niektoré majú nízku mieru istoty, pretože chýbajú dáta. Niektoré sú blokované politikou bez ohľadu na mieru istoty. Ak infraštruktúra všetko toto zhrnie do výzvy opýtať sa človeka, kontrolór sa stane zariadením na triedenie odpadu celého systému. Ľudia to dokážu robiť istý čas. Potom sa kvalita stane plánom personálneho obsadenia so slušným názvom.
Zmyslom nie je odstrániť ľudí. Je to dať im prácu, ktorá si zaslúži úsudok. Infraštruktúra nech zvláda poradie, balenie dôkazov, kontroly politiky, deduplikáciu, sledovanie termínov, zachytávanie spätnej väzby a prehrávanie. Ľudia nech riešia sporný význam, výnimky, súcit, vyjednávanie a zodpovednosť. Toto rozdelenie je úctivejšie voči človeku a bezpečnejšie pre systém. Zároveň znižuje starodávny firemný rituál riešenia architektúry počtom zamestnancov.
The quiet architecture of trust
Trust in AI is often presented as a communication problem. Explain the system better. Add a notice. Publish principles. Make the interface warmer. Those things can help, but users learn trust through behaviour. Does the system remember its limits. Does it refuse when evidence is missing. Does it show sources. Does it recover gracefully. Does it stop duplicate work. Does it let people challenge. Does it get better after mistakes. These are infrastructure behaviours before they are brand behaviours.
Tichá architektúra dôvery je postavená zo stabilných identifikátorov, jasných povolení, explicitných stavov, trvanlivých záznamov, otestovanej obnovy, reprezentatívneho vyhodnocovania, zrozumiteľného preskúmania a čestného odmietnutia. Používateľ väčšinu z toho nikdy neuvidí. Pocíti to, keď systém nestratí jeho prípad, keď má odvolanie dôkazy, keď sa oprava uchytí, keď sa zlý release vráti späť, alebo keď odpoveď povie, že to nevie, namiesto toho, aby si vymyslela malú operu.
Preto by seriózne AI tímy mali venovať viac času oceňovaniu nenápadných súčastí. Človek, ktorý zvládol idempotenciu, zachránil produkt pred duplicitnými akciami. Inžinier, ktorý trval na trace ID, zachránil preskúmanie incidentu. Správca dát, ktorý zablokoval neverzionovaný feed, zachránil model pred tichou ložou. Vedúci prevádzky, ktorý nacvičil rollback, zachránil víkend. Žiadny z nich sa neobjaví v keynote. Produkcia im to aj tak dlhuje.
Nudná infraštruktúra nie je nedostatok ambícií. Je to ambícia, ktorá počíta s tým, že ju budú používať skutoční ľudia v skutočných organizáciách za skutočných obmedzení. Model môže zostať tou intelektuálne najzaujímavejšou súčasťou. Nemal by byť jedinou serióznou. Inteligencia, ktorá sa nedá zaradiť do fronty, ohraničiť, sledovať, vyhodnotiť, vysvetliť a obnoviť, nie je pripravená na serióznu prácu. Je pripravená na demo, čo je iná a oveľa kratšia sezóna.
Ponaučenie
Nudná infraštruktúra víťazí v serióznej AI, pretože seriózna AI je z väčšej časti o dodržiavaní sľubov po tom, čo novinka opustí miestnosť. Sľub nie je, že každá odpoveď bude dokonalá. Sľub je, že systém bude poznať svoje vstupy, rešpektovať svoje limity, uchovávať dôkazy, usmerňovať neistotu, zotavovať sa z porúch, kontrolovať náklady a zlepšovať sa skúsenosťou. Tento sľub plnia fronty, schémy, záznamy, zmluvy, identity, vyhodnocovania, runbooky a plány rollbacku.
Dômyselný model je dôležitý. Je tiež náročný. Potrebuje čisté hranice, čerstvé dôkazy, ohraničené nástroje, trpezlivé vyhodnocovanie, kontrolované náklady a ľudí, ktorí dostávajú zmysluplnú prácu, nie zvyšky. Dajte mu tieto veci a môže sa stať užitočným. Odoprite mu ich a organizácia nakoniec zistí, že inteligencia bez infraštruktúry je len rýchlejší spôsob, ako vytvárať prácu pre prevádzku.
Demo, ktoré zlyhalo na obed, nezlyhalo preto, že budúcnosť bola nemožná. Zlyhalo preto, že budúcnosť stála na fronte, ktorú nikto nepovažoval za súčasť budúcnosti. To je tiché ponaučenie. V serióznej AI nie sú nudné súčasti vedľajšími postavami. Sú javiskom.