Prípad pre menšie, prísnejšie modely

Väčšie modely kupujú šírku, ale šírka nie je kontrola. Pre seriózne AI systémy sú menšie a prísnejšie modely často lepšími komponentmi, pretože sa dajú...

Prípad pre menšie, prísnejšie modely

Model, ktorý vedel príliš veľa

Prvým varovným signálom nebola havária. Havárie sú prinajmenšom úprimné. Varovným signálom bola krásna odpoveď na nesprávnu otázku. Tím vytvoril interného asistenta pre technickú podporu. Vedel čítať príručky k produktom, históriu tiketov, poznámky k vydaniam a malý balík pravidiel, ktorý vysvetľoval, čo môžu agenti zákazníkom sľubovať. Model bol veľký, plynulý a dostatočne sebavedomý na to, aby zasadacia miestnosť pôsobila dočasne moderne.

Počas pilotnej fázy dobre odpovedal na všeobecné otázky. Zhrnul dlhé tikety. Prekladal nahnevané zákaznícke texty do niečoho použiteľného. Našiel skryté súvislosti medzi príznakmi a predchádzajúcimi opravami. Potom prišla bežná otázka o záruke. Správna odpoveď závisela od troch úzkych faktov: regiónu produktu, predajného kanála a verzie firmvéru. Model našiel vierohodný odsek pravidiel, ignoroval tichú výnimku v poznámkach k vydaniu a napísal odpoveď, ktorá znela, akoby niekto pravdu vyžehlil, až kým nevyzerala úctyhodne. Nikto nežiadal poéziu. Potrebovali ohraničené rozhodnutie.

Oprava nespočívala vo zväčšení modelu. Oprava spočívala v tom, že časť systému sa zmenšila a sprísnila. Malý klasifikátor určoval záručnú cestu. Obmedzený extraktor vytiahol tri požadované fakty. Kontrola pravidiel odmietla prípad, ak niektorý fakt chýbal. Veľký model stále pomáhal písať záverečnú poznámku pre ľudí, ale už nevlastnil rozhodnutie. Výsledok bol menej efektný a oveľa lepší. Toto je bežný vzorec. Široký model je pôsobivý, kým práca nevyžaduje komponent, ktorý vie presne povedať, čo videl, čo sa rozhodol a kedy odmieta pokračovať.

Argument pre menšie a prísnejšie modely sa začína tu. Nie nostalgiou za starým softvérom a nie morálnou námietkou voči rozsahu. Veľké modely sú užitočné. Dokážu pokryť chaotický jazyk, prekladať zámer, zhrnúť dôkazy a dať ľuďom rýchlejší prístup k zložitému materiálu. Ale veľkosť prináša šírku. Automaticky neprináša kontrolu. Vážne systémy potrebujú komponenty, ktoré možno ohraničiť, vyhodnotiť, nasadiť, monitorovať a nahradiť bez toho, aby sa každý incident zmenil na filozofický seminár s logmi.

Široký model stále pomáha, ale záručný záväzok patrí menšiemu komponentu, ktorý vie skontrolovať tri fakty a odmietnuť prípad.

Prísnosť je funkcia, nie nálada

Prísnosť znie nepriateľsky, pretože si ju ľudia mýlia s hlúposťou. Striktný komponent nie je taký, ktorý zbytočne rozumie menej. Je to komponent, ktorému je zámerne dovolené robiť menej vecí. Môže akceptovať iba známu schému. Môže vydávať iba pevne stanovený súbor štítkov. Môže čítať iba pomenovaný balík dôkazov. Nesmie volať žiadne nástroje. Môže byť nútený vrátiť nedostatočné dôkazy namiesto improvizácie. Tieto obmedzenia nie sú trest. Sú tým, čo robí komponent použiteľným v systéme, kde naňho spoliehajú iné časti.

Softvérové inžinierstvo sa túto lekciu naučilo dávno predtým, než sa AI stala kategóriou obstarávania. Typy sú prísne. Obmedzenia databáz sú prísne. Konečné stavové automaty sú prísne. Riadenie prístupu je prísne. Platobný systém nežiada model, aby vyjadril svoje pocity o zostatkoch na účtoch. Peniaze reprezentuje presnými jednotkami, kontroluje oprávnenia, zaznamenáva stav a odmieta neplatné prechody. Práve vďaka prísnosti možno systém auditovať a opravovať. Chybové hlásenie sa vám nemusí páčiť, ale zvyčajne nájdete riadok, ktorý ho spôsobil. To nie je maličkosť.

Komponenty AI potrebujú rovnakú disciplínu, pretože sedia vo workflow, ktoré majú následky. Klasifikátor, ktorý si vyberá medzi refundáciou, výmenou, eskaláciou a zamietnutím, by nemal vymýšľať piaty stav nazvaný možno neskôr s úprimnou ľútosťou. Extraktor, ktorý číta zmluvu, by nemal vkladať vágny dátum do poľa termínu len preto, že text znel ako termín. Vyhľadávací model by nemal ticho prekročiť hranicu oprávnení len preto, že neďaleký dokument vyzeral užitočne. Prísnosť dáva zvyšku systému niečo pevné, čoho sa môže držať.

Užitočná otázka nie je, či je model inteligentný vo všeobecnosti. Užitočná otázka je, či má model správnu zmluvu pre danú úlohu. Aké vstupy môže vidieť. Aké výstupy môže produkovať. Ktorá neistota musí byť odhalená. Ktoré prípady musia byť odmietnuté. Ktoré dôkazy musia sprevádzať výsledok. Ktoré metriky dokazujú, že funguje. Menší model s jasnou zmluvou často porazí väčší model s hrdinským promptom, pretože zmluva prežije kontakt s prevádzkou.

Veľkosť kupuje šírku a šírka má účet

Veľké modely sú trénované na všeobecnosť. To je ich sila. Vedia prechádzať medzi doménami, zvládať nezvyčajné formulácie, odvodzovať kontext a produkovať plynulé odpovede, aj keď je vstup hrboľatý. Preto pôsobia magicky pri objavovaní. Človek sa môže opýtať voľne a napriek tomu dostane súvislú odpoveď. Súvislosť je užitočná. Je však aj nebezpečná, keď workflow potrebuje úzky záväzok.

Šírka má účet. Široký model má viac spôsobov, ako byť užitočne nesprávny. Môže importovať kontext z nesprávnej časti konverzácie. Môže zahladiť chýbajúce dôkazy. Môže odpovedať z predchádzajúcich vedomostí, keď systém chcel dôkaz založený na vyhľadávaní. Môže nasledovať vzor, ktorý vyzerá bežne, namiesto výnimky, ktorá platí. Môže vytvoriť vierohodný most cez medzeru, ktorá mala proces zastaviť. Výstup môže znieť lepšie práve preto, že model je dobrý v jazyku. To je výhodné pre demonštrácie a nevýhodné pre zodpovednosť.

Menšie modely znižujú časť tohto účtu tým, že zužujú priestor možného správania. Doménový klasifikátor s dvanástimi štítkami môže stále zlyhať, ale jeho zlyhanie je čitateľné. Obmedzený extraktor môže stále vynechať pole, ale chýbajúce pole možno spočítať. Malý rankingový model môže stále uprednostniť zastarané dôkazy, ale túto preferenciu možno testovať proti známemu korpusu. Toto sú inžinierske zlyhania, čo je výborná správa. Inžinierske zlyhania možno merať, rozpočtovať a opravovať. Mystické zlyhania si vyžadujú viac stretnutí.

Existuje aj kognitívny účet za tímy. Jediný široký model robí vlastníctvo nejasným. Kto vlastní zdôvodnenie záruk, formuláciu zhody, výber zdrojov, tón, odmietnutie a eskaláciu, ak to všetko žije v jednom prompte a na jednom koncovom bode. Keď sa niečo zmení, ktorá testovacia sada by sa mala spustiť. Keď používateľ spochybní výstup, ktorý komponent je vinný. Model sa stáva veľmi talentovanou skriňou, do ktorej bolo uložené každé inštitucionálne rozhodnutie. Nakoniec niekto otvorí dvere a vypadne z nich priečinok s politikami.

Šírka prináša užitočné pokrytie, ale vytvára aj viac ciest pre plynulé chyby a nejasnejšie vlastníctvo, keď sa niečo pokazí.

Menšie modely robia zlyhania viditeľnými

Viditeľnosť je dôležitá, pretože každý produkčný systém je nakoniec systémom na zisťovanie, čo sa pokazilo. Veľký model môže zlyhať spôsobmi, ktoré sa ťažko oddeľujú. Bol prompt nejednoznačný. Bolo vyhľadávanie zastarané. Model príliš zovšeobecnil. Bola inštrukcia politiky príliš nízko v kontexte. Podporovalo nastavenie dekódovania rôznorodosť tam, kde záležalo na konzistentnosti. Prišiel výsledok nástroja neskoro. Prepísala zábrana odpoveď. Každá možnosť môže byť skutočná. Preskúmanie incidentu sa stáva detektívkou s rozpočtovým kódom.

Menšie komponenty vytvárajú menšie otázky. Ak extraktor prehliadol nákupný kanál, preskúmajte extraktor. Ak klasifikátor zvolil refundáciu namiesto eskalácie, preskúmajte označenú množinu a prah. Ak overovač nezachytil nepodložené tvrdenie, pridajte vzor tvrdenia a pravidlo zdroja do hodnotenia overovača. To nerobí prácu triviálnou. Robí to prácu lokálnou. Lokálne je dobré. Lokálne znamená, že polomer výbuchu možno obsiahnuť a opravu možno testovať bez narušenia celej katedrály.

Prísne výstupy tiež vytvárajú lepšiu telemetriu. Model, ktorý vracia jeden z dvanástich stavov, možno sledovať v čase. Model, ktorý vracia štruktúrované polia, môže hlásiť chýbajúce hodnoty, nezhody, intervaly spoľahlivosti a drift. Model, ktorý odmieta, vám môže povedať prečo. Prozaická odpoveď môže obsahovať to všetko, ale potom každý downstream spotrebiteľ musí analyzovať vetu napísanú strojom, ktorý bol odmenený za to, že znel prirodzene. Takto sa monitorovací systém stáva knižným klubom.

Viditeľnosť zlyhaní mení kultúru. Tímy prestanú diskutovať o tom, či je AI dobrá, a začnú sa pýtať, ktorý komponent zlyhal za akej podmienky. To je zdravší argument. Môže viesť k novému výseku údajov, lepšiemu prahu, menšej množine dôkazov, prísnejšej schéme alebo stavu ľudského preskúmania. Premieňa úzkosť na údržbu. Údržba je menej glamourózna ako existenciálna debata, ale zvyčajne sa dodá pred obedom.

Rozhranie je polovica modelu

Keď ľudia porovnávajú modely, často porovnávajú váhy, parametre, benchmarky a rebríčky. Tie sú dôležité, ale v produkcii záleží rovnako na rozhraní. Rozhranie rozhoduje o tom, aké sľuby môže model dávať. Rozhranie s voľným textom pozýva na otvorené správanie. Štruktúrované rozhranie žiada kontrolovaný výsledok. Dekodér obmedzený gramatikou, schéma nástrojov, typovaný výstupný objekt alebo pevná množina štítkov môžu zmeniť prevádzkový charakter tej istej inteligencie.

Predstavte si model, ktorý číta faktúry. Ak vráti odsek s vysvetlením faktúry, tím stále musí extrahovať dodávateľa, daňové číslo, súčty riadkov, menu, dátum splatnosti a mieru spoľahlivosti. Ak vráti typovaný objekt s povinnými poľami, validácia môže prebehnúť okamžite. Ak dátum splatnosti chýba, objekt môže uviesť, že chýba. Ak súčty nesedia, overovač môže import odmietnuť. Model možno nebude taký zhovorčivý, ale účtovné oddelenie mu neplatí za šarm. Chcú, aby sa kniha prestala kývať.

Rozhrania tiež formujú trénovanie. Model trénovaný na pevné štítky možno vyhodnocovať podľa chýb v štítkoch. Model trénovaný na extrakciu polí možno vyhodnocovať podľa presnej zhody, správnosti rozpätí, chýbajúcich hodnôt a vymyslených hodnôt. Model trénovaný na tvorbu prózy si vyžaduje viac úsudku, viac rubrík a viac ľudskej kontroly. To môže byť vhodné pre niektoré úlohy. Je to plytvanie pre úlohy, kde je želaný výstup už štruktúrovaný. Prekvapivo veľa práce s umelou inteligenciou je len zadávanie údajov v zamatovom saku.

Menšie a prísnejšie modely preto nútia tímy premýšľať o tvare práce. Je to úloha klasifikácie, extrakcie, radenia, transformácie, overovania, plánovania alebo vysvetľovania. Potrebuje vôbec model, alebo by bolo lepšie pravidlo, riešiteľ, databázové obmedzenie alebo vyhľadávací index. Ktorá časť potrebuje porozumenie jazyka a ktorá časť potrebuje istotu. Tento rozklad nie je pedantský. Je to rozdiel medzi navrhovaním systému a prenajímaním úst.

Rozhranie mení prácu: próza žiada od ďalšieho systému, aby hádal, zatiaľ čo typovaný objekt robí chýbajúce polia a neúspešné kontroly viditeľnými.

Trénovacie dáta prestávajú byť divadelné

Všeobecné modely potrebujú obrovské a rôznorodé trénovacie súbory, pretože majú pokrývať obrovské a rôznorodé správanie. Úzko zamerané modely možno často zlepšiť menšími, lepšie označenými a relevantnejšími dátami. To znie menej veľkolepo, čo je ďalšia výhoda. Veľkoleposť nie je ukazovateľ kvality. Tisíc starostlivo preskúmaných príkladov pre klasifikátor poistných udalostí môže pre spoľahlivosť produkcie urobiť viac ako veľké dátové jazero, na ktoré bol pozvaný každý dokument a nikto nekontroloval zoznam hostí.

Menšie úlohy sprehľadňujú význam označení. Ak je označenie eskalovať, recenzenti môžu presne diskutovať o tom, ktoré podmienky eskaláciu odôvodňujú. Ak je pole dátum ukončenia zmluvy, recenzenti môžu definovať, ako narábať s klauzulami o obnovení, dodatkami, chýbajúcimi podpismi a konfliktnými dátumami. Ak je výstup odmietnutie povolenia, bezpečnostné a právne tímy môžu špecifikovať hranicu. To vytvára inštitucionálne poznatky ako vedľajší efekt návrhu modelu. Tím sa dozvie, čo daný proces znamená. To je nepríjemné len vtedy, ak organizácia radšej nechcela vedieť.

Úzke školenie tiež robí hodnotenie reprezentatívnejším. Testovacie sady môžete zostaviť okolo skutočných režimov zlyhania: chýbajúce polia, zastarané pravidlá, nepriateľské formulácie, regionálne výnimky, neobvyklé formátovanie, nízka spoľahlivosť a prípady, kde je odmietnutie správne. Môžete merať presnosť a úplnosť tam, kde na nich záleží. Môžete sa rozhodnúť, že falošné schválenie je desaťkrát horšie ako falošná eskalácia. Môžete nastaviť prahy podľa prevádzkových nákladov. Toto sú konkrétne rozhodnutia. Nie sú očarujúce, ale majú vzácnu vlastnosť, že sú užitočné.

Stále existuje miesto pre široké predtrénovanie a prenos. Malý prísny model môže sedieť na vrchole vložení z väčšieho modelu. Ohraničený jazykový model môže využívať všeobecné jazykové poznatky a zároveň generovať pevnú schému. Všeobecný model môže generovať kandidátov, ktorých prísny overovateľ kontroluje. Argument nie je o čistote. Argument je o umiestnení. Použite široké schopnosti tam, kde je potrebná šírka. Použite prísnosť tam, kde systém potrebuje záväzok.

Ekonómia je tichšia a lepšia

Náklady nie sú len faktúra za inferenciu. Náklady sú latencia, pamäť, energia, prevádzková zložitosť, úsilie pri hodnotení, záťaž pri recenzii, reakcia na incidenty a počet inžinierov potrebných na vysvetlenie, prečo sa utorok správal inak ako pondelok. Menšie modely môžu pomôcť vo všetkých týchto dimenziách. Môžu bežať bližšie k dátam. Môžu sa zmestiť na bežný hardvér. Môžu byť uložené v pamäti, kvantizované, dávkované alebo vložené do služby bez toho, aby sa nasadenie zmenilo na ceremóniu zahŕňajúcu tri kalendáre a rezerváciu kapacity.

Latencia mení správanie produktu. Ak klasifikátor vráti výsledok v milisekundách, môže byť súčasťou pracovného postupu bez toho, aby používateľ hľadel na spinner a prehodnocoval svoje kariérne voľby. Ak extraktor beží lokálne, citlivý materiál nemusí cestovať do vzdialenej služby kvôli jednoduchému vytiahnutiu poľa. Ak je overovateľ lacný, môže bežať na každom výstupe, nie len na vzorkách. Tieto detaily nie sú drobnosti. Rozhodujú o tom, či sa bezpečnostné a kvalitatívne kontroly skutočne používajú, alebo sa len obdivujú v architektonických diagramoch.

Prevádzkovo sa menšie modely ľahšie nahrádzajú. Tím môže natrénovať nový extraktor, spustiť ho proti starému, porovnať nezhody a nasadiť ho po častiach. Môže ponechať predchádzajúcu verziu dostupnú na prehratie. Môže pripojiť verziu modelu a prah ku každému rozhodnutiu. Obrovský univerzálny endpoint sa dá tiež verzovať, ale porovnanie sa často stáva nejasnejším, pretože sa naraz mení veľa správaní. Veľké súbory zmien sú miestom, kde sa dôvera mení na gradient v PowerPointe.

Existuje aj výhoda pri obstarávaní. Menšie prísne komponenty robia výmenu dodávateľov realistickejšou. Ak je zmluva známa schéma a známa hodnotiaca sada, tím môže porovnať implementácie. Ak je zmluva obrovská výzva plná skrytej politiky a osobnosti, zmena sa stáva rizikovou. Organizácia môže zistiť, že jej pracovný postup nie je poháňaný modelom, ale je s ním zamotaný. Zamotanie je romantické v románoch. V produkcii je to migračný plán so zubami.

Kde veľké modely stále patria

Nič z toho neznamená, že veľké modely treba odsunúť do výskumnej špajze. Sú vynikajúce v mnohých veciach. Sú užitočné na prieskum, návrhy, sumarizáciu, preklad, nejednoznačné vstupy od používateľov, pomoc s kódom a na úlohy, kde je želaný výstup skutočne otvorený. Vedia ľuďom pomôcť premýšľať o neznámom materiáli. Vedia generovať kandidátske vysvetlenia. Vedia premeniť chaotický prirodzený jazyk na štruktúrovanejšiu požiadavku. Môžu byť štedrými vstupnými dverami do prísnejšieho zadného úradu.

Chybou je nechať vstupné dvere, aby sa stali celou budovou. Veľký model môže interpretovať zámer, ale menší klasifikátor môže zvoliť pracovný postup. Veľký model môže navrhnúť odpoveď, ale overovač môže skontrolovať tvrdenia. Veľký model môže sumarizovať dokument, ale extraktor môže vyplniť regulované polia. Veľký model môže navrhnúť plán, ale politická brána môže rozhodnúť, ktoré kroky sú povolené. Široký model zostáva hodnotný. Len prestane predstierať, že je zdrojom všetkej autority.

Toto rozdelenie je tiež ohľaduplnejšie k používateľom. Ľudia nechcú vyjednávať s modelom o tom, či stav refundácie existuje. Chcú jasné výsledky, jasné dôkazy a cestu na odvolanie. Systém zostavený z prísnych komponentov sa vie vysvetliť v operačných pojmoch: tento zdroj bol použitý, toto pole chýbalo, táto hranica bola dosiahnutá, táto politika si vyžiadala preskúmanie. Takéto vysvetlenie môže byť menej očarujúce ako odsek plynulej empatie, ale je užitočnejšie, keď sú v hre peniaze, práva, bezpečnosť alebo dôvera.

Budúcnosť pravdepodobne nie je jeden model, ktorý vládne pracovnému postupu. Je to kompozícia modelov, pravidiel, riešičov, indexov, overovačov a ľudského preskúmania. Niektoré časti budú veľké a flexibilné. Niektoré budú maličké a neústupné. Umenie je vedieť, ktoré je ktoré. Dobrý inžinier by mal byť podozrievavý voči akejkoľvek architektúre, kde sa každý problém rieši zväčšovaním toho istého komponentu. To nie je dizajn. To je inflácia.

Prísny komponent sa môže pokojne zlepšovať, pretože jeho zmluva, dôkazy, hranice a režimy zlyhania zostávajú viditeľné naprieč vydaniami.

Prípad

Prípad pre menšie, prísnejšie modely nie je o tom, že malé je morálne nadradené. Je o tom, že mnohé hodnotné úlohy sú menšie, než pripúšťa náš súčasný modelový slovník. Zatrieď tento prípad. Extrahuj tieto polia. Zoraď tieto zdroje. Over toto tvrdenie. Odmietni bez dôkazov. Presmeruj na človeka. Zachovaj dôvod. Toto nie sú nižšie formy inteligencie. Sú to formy, vďaka ktorým sú väčšie systémy spoľahlivé.

Keď tímy začínajú od najväčšieho dostupného modelu, často odkladajú ťažké dizajnérske otázky. Aký je stavový priestor. Ktoré výstupy sú prípustné. Aké dôkazy sa vyžadujú. Čo znamená neistota. Kto nesie zodpovednosť za chybu. Ako sa komponent testuje. Kedy musí odmietnuť. Keď sa tieto otázky ignorujú, model ich preberie ako skrytú politiku. Skrytá politika môže fungovať pre pilotný projekt. V produkcii starne zle, zvyčajne v momente, keď niekto požiada o auditnú stopu.

Začať menšie núti otázky skôr. Pýta sa, či má problém známy tvar. Pýta sa, či prísne rozhranie môže niesť výsledok. Pýta sa, či model potrebuje široké jazykové schopnosti alebo úzky úsudok. Pýta sa, čo sa musí merať predtým, než sa udelí dôvera. Táto disciplína neznižuje ambície. Dáva ambíciám kostru. Bez nej sa systém môže stále hýbať, ale nikto by nemal stáť príliš blízko.

Menšie a prísnejšie modely sa ľahšie vlastnia. Sú lacnejšie na prevádzku, ľahšie sa vyhodnocujú, prehľadnejšie sa debugujú, bezpečnejšie sa komponujú a sú úprimnejšie o svojich limitoch. Nenahrádzajú široké modely všade. Robia široké modely užitočnými na miestach, kde užitočný znamená viac než plynulý. Vo vážnom AI inžinierstve je to rozdiel, ktorý sa počíta. Najlepší systém je málokedy ten s najväčším modelom na každom mieste. Je to ten, kde má každé miesto najmenší komponent, ktorý zvládne prácu, najprísnejšiu zmluvu, ktorá stále sedí na realitu, a dostatok dôkazov pre ďalšieho človeka, aby pochopil, čo sa stalo.