Benchmark je zmluva s menovateľom
Číslo, ktoré zabudlo na svoj menovateľ
Výsledok benchmarku môže byť meraný správne a napriek tomu odpovedať na nesprávnu otázku. Zvyčajným vinníkom nie je chybný časovač ani nečestný inžinier. Je ním menovateľ, ktorý zmizol medzi testovacím prostredím a prezentačným slajdom. „Dvakrát rýchlejší“ znie ako porovnanie, ale nehovorí, dvakrát rýchlejší pri akej práci, na ktorom stroji, s akým softvérom, za akej kvalitatívnej podmienky, voči akej základni alebo pre ktorých používateľov. Odstráňte tieto podmienky a výkonnostné číslo sa stane vylešteným fragmentom. Môže zostať numericky pravdivé. Už však kupujúcemu ani prevádzkovateľovi nepovie, čo môžu očakávať.
Menovateľ je práca, voči ktorej je výsledok vyjadrený. Pri priepustnosti je to dokončená práca a čas, za ktorý sa dokončenie počíta. Pri latencii je to definícia požiadavky, zahrnutá cesta a súbor pozorovaní. Pri presnosti je to označená množina, pravidlo označovania a posudzovaná jednotka. Pri energii je to hranica meraného systému a práca dodaná v rámci tejto hranice. Pri nákladoch je to obdobie nákladov, zahrnuté zdroje a objem užitočnej práce. Benchmark je čestný vtedy, keď jeho čitateľ a menovateľ cestujú spolu.
Preto sa benchmark najlepšie chápe ako zmluva. Zmluva pomenúva otázku, pracovné zaťaženie, rozsah, hardvér a softvér, metriku, základňu, neistotu a metódu, ktorou môže iná strana výsledok overiť. Zmluva môže byť úzka. Môže byť prieskumná. Môže byť užitočná len pre jedno nasadenie. Čím nemôže byť, je pôsobivé číslo, ktorého podmienky necháva čitateľa hádať. Hádanie je zlý spôsob prideľovania verejných peňazí a ešte horší spôsob navrhovania služby, ktorú musí niekto iný udržiavať pri živote.
Európsky zvyk zapisovať si definície je občas zosmiešňovaný ako byrokracia. Pri meraní sú definície tým, čo bráni tomu, aby sa z byrokracie stal folklór. Tabuľka benchmarku nie je administratívnou prílohou výsledku. Je jeho identifikačným preukazom.
Prečítajte si jednotku skôr ako titulok
Začnite jednotkou, ale nezastavte sa pri nej. Požiadavky za sekundu, tokeny za sekundu, milisekundy, jouly na dotaz, eurá za tisíc záznamov a percentuálne body vám všetko niečo povedia. Nič z toho vám nepovie, čo bol systém požiadaný urobiť. Výsledok 100 požiadaviek za sekundu môže opisovať malé požiadavky z vyrovnávacej pamäte alebo veľké nevyrovnávané požiadavky, ktoré zahŕňajú vyhľadávanie, validáciu a odovzdanie človeku. Latencia 20 milisekúnd môže pokrývať jediné jadro alebo celú rozhodovaciu cestu. Jednotka sú dvere. Pracovné zaťaženie je miestnosť za nimi.
Predpokladajme, že obstarávací slajd hovorí, že nová služba je o 40 percent rýchlejšia ako existujúca. Táto veta ešte nie je dôkazom. Potrebuje prinajmenšom operáciu, ktorá sa meria, veľkosť a rozdelenie vstupu, prácu vylúčenú z merania, súbežnosť, stav zahriatia, verzie softvéru, hardvér a základnú konfiguráciu. Potrebuje tiež kvalitatívnu podmienku. Ak rýchlejšia cesta vracia menej platných výsledkov, zahadzuje dlhé vstupy alebo preskakuje nákladný overovací krok, čitateľ bol zmenšený zmenou práce.
Toto nie je žiadosť o obrovskú tabuľku predtým, než niekto vôbec prehovorí. Je to žiadosť o identifikáciu niekoľkých polí, ktoré menia význam tvrdenia. Malý benchmark parsera môže potrebovať tvar záznamu, zdroj vstupu, politiku validácie, kompilátor a procesor. Benchmark inferencie môže potrebovať model, presnosť, dávku, scenár, cieľ kvality a hranicu výkonu. Fronta vo verejnom sektore môže potrebovať definíciu prípadu, servisné hodiny, pravidlo smerovania a cestu eskalácie. Polia sa líšia. Povinnosť pomenovať ich sa nelíši.
Je tu užitočná disciplína: napíšte výsledok ako vetu, ktorá prežije druhého čitateľa. „Pri tomto zaťažení a tejto požiadavke na kvalitu, na tomto systéme a verzii bola nameraná hodnota takáto, s takouto odchýlkou.“ Ak vetu nemožno dokončiť bez slov ako typický, najlepší, produkčný alebo reprezentatívny, metóda nie je hotová. Tieto slová môžu byť platné, ale potrebujú operačnú definíciu, nie vrelý tón.
Rozsah je súčasťou výsledku
Rozsah odpovedá na jednoduchú otázku: čo tento výsledok pokrýva a čo necháva mimo rámca? V hodnotení strojového učenia rozsah zahŕňa úlohu, dátový súbor, rozdelenie, jazyk, dĺžku vstupu, prevádzkový scenár a povolené implementačné voľby. V softvérovej službe zahŕňa trasu, dátové úložiská, sieť, vyrovnávaciu pamäť a prácu, ktorú downstream tím vykoná po tom, ako meraný koncový bod vráti odpoveď. Výsledok nameraný na jednej vrstve by sa nemal potichu stať sľubom o celej službe.
MLCommons to sprístupňuje vo svojej dokumentácii MLPerf Inference. Sprievodca podávaním prihlášok oddeľuje datacentrové a okrajové typy systémov, uvádza scenáre ako offline, server, interaktívny, single-stream a multi-stream a rozlišuje uzavretú divíziu od otvorenej divízie. Uzavretá divízia je určená na porovnanie jabĺk s jablkami s použitím rovnakého modelu a referenčného nastavenia. Otvorená divízia umožňuje voľby, ako je pretrénovanie alebo substitúcia modelu. Ani jedna nie je univerzálne správna divízia. Odpovedajú na rôzne otázky. Titulok, ktorý ich mieša, nie je široký pohľad. Je to kategorická chyba s vynikajúcou typografiou.
Rovnaká dokumentácia ukazuje, prečo benchmark potrebuje explicitnú stránku kvality. Uvedený záznam ResNet50 uvádza validačný súbor ImageNet-2012, jeho veľkosti dátového súboru a zoznamu vzoriek dotazov, referenčnú presnosť a obmedzenie latencie servera. Pre uvedený záznam ResNet50 stránka uvádza validačný súbor s 50 000 obrázkami, zoznam vzoriek dotazov s 1 024 položkami, referenčnú presnosť 76,46 percenta a obmedzenie latencie servera 15 ms. Tieto polia nie sú triviálnosťou pre ľudí, ktorí radi čítajú pravidlá. Vysvetľujú, čo mohla uvádzaná rýchlosť znamenať. Zmeňte dátový súbor, scenár alebo požiadavku na kvalitu a porovnanie sa zmenilo, aj keď názov modelu vyzerá povedome.
Európsky kupujúci by mal byť podozrievavý voči rozsahu, ktorý je naznačený označením produktu. „AI platforma“, „akcelerátor“ a „enterprise-grade“ nedefinujú prácu. Systém, ktorý je vynikajúci v ohraničenej operácii, môže byť presne to, čo služba potrebuje. Systém, ktorý tvrdí, že pokrýva všetko, mohol namerať takmer nič, čo sa podobá na službu. Úzka pravda je zdravšia ako univerzálna hmla.
Pokrytie mení význam
Pokrytie nie je poznámka pod čiarou o tom, či bola testovacia množina veľká. Opisuje, ktoré prípady a ktoré situácie vstupujú do merania. Benchmark môže pokrývať mnoho príkladov z jednej úzkej distribúcie a stále povedať málo o okrajoch, ktoré sú v prevádzke dôležité. Naopak, malá, starostlivo vybraná množina môže odhaliť dôležitý spôsob zlyhania bez toho, aby podporovala všeobecné tvrdenie o výkonnosti. Voľba je dizajnérske rozhodnutie. Musí byť takto aj prezentovaná.
Rámec OECD na charakterizáciu nástrojov hodnotenia AI je užitočný, pretože odmieta zredukovať hodnotenie na jedno skóre. Navrhuje 18 aspektov vrátane pokrytia, účelu, realizmu, validity, spoľahlivosti, transparentnosti a podmienok, za ktorých možno výsledky interpretovať. Pokrytie sa pýta, či hodnotenie predstavuje to, čo má merať. Účel rozlišuje benchmark určený na výskum od benchmarku určeného na posudzovanie zhody alebo iné použitie. Realizmus sa pýta, či ide o hračkársky problém, simulované alebo laboratórne prostredie, alebo o reálny život. Tieto rozlíšenia nerobia benchmark slabším. Robia jeho tvrdenie čitateľným.
Pokrytie zahŕňa aj prípady, ktoré hodnotenie vylučuje. Služba môže vykazovať priemernú latenciu po odstránení timeoutov. Klasifikátor môže vykazovať presnosť po vyradení nejednoznačných štítkov. Vyhľadávací systém môže počítať iba dopyty s aspoň jedným relevantným dokumentom. Obrazový pipeline môže preskočiť poškodené súbory. Každé vylúčenie môže byť obhájiteľné. Výsledok musí uviesť, čo bolo odstránené a prečo. Inak sa menovateľ potichu stane zoznamom prípadov, ktoré bolo vhodné dokončiť.
Tu sa menovateľ stáva politickým, ešte predtým, než niekto vysloví slovo politika. Zahrnutá populácia dostáva výhodu byť meraná. Vylúčená populácia dostáva príbeh o systéme, ktorý ju nemusí opisovať. Európske verejné inštitúcie to už poznajú z oficiálnej štatistiky. Kódex európskej štatistiky Eurostatu stanovuje 16 zásad a 84 ukazovateľov pre inštitucionálne prostredie, procesy a výstupy. Jeho rámec zabezpečenia kvality poskytuje metódy a nástroje, zatiaľ čo správy o kvalite informujú používateľov o tom, ako boli údaje zozbierané a validované. Odkaz pre AI nie je, že každý model sa musí stať štatistickým úradom. Je to, že číslo určené pre verejné rozhodnutia potrebuje viditeľný príbeh o produkcii a kvalite.
Presnosť nie je jedna brána
Tvrdenia o výkonnosti často spájajú rýchlosť s jediným číslom kvality a potom túto dvojicu považujú za úplnú. Kvalita je zvyčajne rodina otázok. Spĺňa výstup definíciu úlohy? Zachováva požadované obmedzenia? Zlyhá bezpečne, keď chýbajú dôkazy? Správa sa prijateľne naprieč relevantnou populáciou? Zostáva v rámci hranice kvality, kým je systém zaťažený? Rýchla odpoveď, ktorá nezvládne úlohu, nie je rýchlejšie riešenie. Je to iná záťaž, ktorá nosí rovnaké podstatné meno.
Štruktúra MLPerf je poučná, pretože jeho výkonnostné behy stoja vedľa validácie presnosti a požiadaviek špecifických pre model. Sprievodca odovzdávaním hovorí účastníkom, aby identifikovali divíziu, typ systému a scenár, spustili zamýšľaný benchmark, validovali presnosť proti prahom a potom pripravili skontrolované odovzdanie. Stránka benchmarku uvádza referenčnú presnosť a podmienky latencie alebo priepustnosti pre každú úlohu. Toto oddelenie je praktické. Udržiava systém od toho, aby vyhral stĺpec výkonnosti tým, že potichu stratí úlohu.
Presnosť sama potrebuje menovateľa. „Deväťdesiatosem percentná presnosť“ môže znamenať percento záznamov, tokenov, obrázkov, požiadaviek alebo rozhodnutí. Môže používať mikro alebo makro spriemerovanie. Môže počítať zdržanie sa ako chybu, ako bezpečné odmietnutie alebo ako nemeraný výsledok. Môže porovnávať so štítkami vytvorenými jedným recenzentom alebo viacerými. Karta benchmarku by mala uviesť jednotku, pravidlo štítkovania, agregáciu, spoľahlivosť alebo variabilitu a akýkoľvek prah, ktorý mení meranie na rozhodnutie o vydaní.
Nepoužívajte číslo kvality ako dekoratívne povolenie. Model môže spĺňať zverejnenú hranicu a napriek tomu byť nevhodný pre konkrétnu službu, pretože úloha, populácia alebo profil škody sa líši. Naopak, nižšie celkové skóre môže byť prijateľné pre nástroj na tvorbu návrhov, ktorý ponecháva človeka ako autora, zatiaľ čo rovnaké skóre je neprijateľné pre automatickú bránu. Kvalita je vzťah medzi výstupom, účelom a dôsledkom.
Čas nie je jedno číslo
Latencia sa často prezentuje, akoby systém mal jednu rýchlosť. Skutočné systémy majú rozdelenie. Prvá požiadavka môže zaplatiť náklady na spustenie. Vyrovnávacia pamäť môže zmeniť neskoršie požiadavky. Súbežní používatelia môžu súperiť o pamäť alebo databázové pripojenie. Dlhý vstup môže ísť inou cestou ako krátky. Priemer sa môže zlepšiť, zatiaľ čo chvost sa zhorší. Ak je chvost miestom, kde služba nestíha svoj termín, priemer je rozptýlenie s jednotkou.
Užitočná správa o latencii uvádza, čo bolo merané a ako boli pozorovania zhrnuté. Môže obsahovať medián, horné percentily, mieru časového limitu a počet požiadaviek. Mala by uviesť, či boli vylúčené zahrievacie požiadavky, či boli zahrnuté opakovania a či čas čakania alebo sieťový čas patrí do meranej cesty. Tieto voľby nie sú zameniteľné. Benchmark komponentu môže byť hodnotný, ale nesmie byť prezentovaný ako správanie od konca do konca.
Priepustnosť má podobnú pascu. Vysoká miera sa dá dosiahnuť dávkovaním práce, zvýšením súbežnosti alebo uvoľnením požiadavky na kvalitu. To môže byť presne správne pre offline úlohu. Môže to byť zbytočné pre interaktívnu službu, ktorá musí odpovedať na každú požiadavku v rámci termínu. Benchmark by mal uviesť scenár a prevádzkový bod a potom vysvetliť, čo by sa stalo, keď sa dopyt od neho vzdiali. Nie je hanba v úzkom prevádzkovom bode. Hanba je v predstieraní, že je celou mapou.
Čas má aj ľudskú stránku. Služba, ktorá odpovedá rýchlo, ale vytvára viac práce na kontrolu, opravu alebo odvolanie, môže byť z pohľadu inštitúcie pomalšia. Benchmark, ktorý zastaví stopky pred odovzdaním, môže spôsobiť, že meraný systém vyzerá svižne, zatiaľ čo skutočná služba hromadí front. Menovateľ by mal nasledovať prácu, kým sa nezodpovie položená otázka. Inak stopky merajú ostrov.
Hardvér a softvér sú súčasťou čitateľa
„Na serveri“ nie je reprodukovateľné prostredie. Generácia procesora, inštrukčná sada, akcelerátor, pamäť, úložisko, tepelný stav, výkonový limit, operačný systém, ovládač, kompilátor, runtime, knižnica a konfigurácia môžu všetky zmeniť výsledok. Rovnako aj formát modelu, nastavenie kvantizácie, veľkosť dávky, výber jadra alebo politika vlákien. Benchmark nemusí uvádzať každý kábel. Musí však identifikovať časti, ktoré môžu zmeniť meranie.
MLPerf nazýva úplné merané nastavenie systém pod testom a organizuje výsledky podľa typu systému a kategórie dostupnosti. Táto slovná zásoba je užitočná aj mimo MLPerf. Systém pod testom má hranicu. Hranica hovorí, ktorý hardvér a softvér sú zahrnuté, ktoré služby sú externé a ktorá práca je vynechaná. Hodnota výkonu meraná na stene má iný význam ako hodnota, ktorá počíta iba akcelerátor. Latencia meraná vo vnútri jadra má iný význam ako tá, ktorá zahŕňa plánovanie požiadaviek.
Verzie záležia, pretože benchmark je porovnanie medzi stavmi, nie nadčasová vlastnosť názvu produktu. Zaznamenajte verziu modelu alebo aplikácie, verzie závislostí, príznaky kompilátora, ovládač a firmvér tam, kde ovplyvňujú výsledok. Zaznamenajte konfiguráciu, ktorá vybrala backend alebo presnosť. Ak runtime vyberie iné jadro na inom počítači, je to súčasť výsledku, nie detail implementácie, ktorý sa má neskôr upratať.
Zverejnenie informácií o hardvéri nie je pozvánkou na premenu blogového príspevku na katalóg komponentov. Je to spôsob, ako zabrániť falošnej ekvivalencii. Kupujúci nemusí venovať pozornosť každému detailu, ak sa tvrdenie týka kompletnej služby. Musí však vedieť, či porovnanie zahŕňa rovnakú prácu, rovnakú presnosť, rovnakú vstupnú cestu a systém, ktorý sa dá skutočne získať a prevádzkovať v zamýšľanom európskom prostredí.
Základné porovnania sú sľuby
Základné porovnanie je referencia, ktorá dáva výsledku smer. Bez neho môže číslo opisovať systém, ale nie zlepšenie. Základné porovnanie musí odpovedať na rovnakú otázku za porovnateľných podmienok. Ak nová cesta používa novší kompilátor, iné rozdelenie vstupov alebo iný cieľ kvality, výsledok môže byť stále zaujímavý, ale porovnanie už nie je čisté. Povedzte, čo sa zmenilo. Čitateľ sa potom môže rozhodnúť, či je rozdiel užitočný.
Výber základného porovnania je akt interpretácie. Porovnajte s existujúcim riešením, ktoré používatelia skutočne používajú, s referenčnou implementáciou, s predchádzajúcim vydaním alebo s teoretickým limitom, a dozviete sa rôzne veci. Nový systém môže byť lepší ako referencia a horší ako služba, ktorú nahrádza. Môže byť rýchlejší v čistom teste a pomalší, keď sa zahrnú validácia a ukladanie. Benchmark by mal pomenovať základné porovnanie a vysvetliť, prečo odpovedá na prevádzkovú otázku.
Párové spustenia sú často informatívnejšie ako jedno víťazné kolo. Ponechajte pracovnú záťaž a definíciu vyhodnotenia nezmenené, zmeňte jeden podstatný faktor a zaznamenajte rozdiel. Ak sa mení viac faktorov naraz, opíšte porovnanie ako celok, nie pripisujte celý efekt jednej súčasti. Toto znie samozrejme, až kým sa v tom istom vydaní neobjaví upgrade, obnova dát a nová politika vyrovnávacej pamäte. Graf potom má jednu šípku a tri možné príčiny, čo je malá záhada, na ktorú nikto nemal rozpočet.
Základné porovnanie má aj dátum spotreby. Dátový kanál, dodávateľ, model, politika alebo hardvérová platforma sa môžu zmeniť. Porovnanie zostáva platné pre testované verzie a obdobie. Nemalo by sa znovu používať ako aktuálna záruka bez kontroly zmluvy. Tu sa oplatí história verzií. Nahradený výsledok nie je zlyhanie. Je to historické tvrdenie, ktorého podmienky by mali zostať viditeľné.
Neistota nie je ospravedlnenie
Každé meranie obsahuje variabilitu. Časť variability pochádza zo systému, časť z pracovnej záťaže a časť z procesu merania. Opakované spustenia ju môžu odhaliť, ale samotné opakovanie nevysvetlí príčinu. Teplá vyrovnávacia pamäť môže byť stabilná. Hlučný sused nemusí. Malá vyhodnocovacia množina môže produkovať širokú škálu hodnoverných výsledkov. Väčšia množina môže znížiť výberový šum, ale ponechať zaujatú populáciu nedotknutú. Neistota hovorí čitateľovi, ako ďaleko môže výsledok bezpečne cestovať.
Uveďte neistotu vo forme, ktorá zodpovedá tvrdeniu. Môže to byť rozsah naprieč opakovanými spusteniami, interval spoľahlivosti, štandardná chyba, rozdelenie latencie, analýza citlivosti alebo zoznam známych limitov. Nepridávajte interval spoľahlivosti len preto, že tabuľka vyzerá osamelo. Uveďte, čo sa opakovalo, čo sa držalo nezmenené a čo interval predstavuje a čo nie. Štatistický jazyk nie je kúzlo. Je to zmluva o variabilite.
Existuje druhý druh neistoty, ktorý čísla nedokážu odstrániť: neistota o tom, či meranie predstavuje zamýšľanú službu. Výsledok môže mať malú variabilitu medzi spusteniami a slabé pokrytie reálneho sveta. Benchmark môže byť dokonale reprodukovateľný v laboratóriu, ale chýbajú mu jazyky, vstupné formáty, pracovné režimy alebo dôsledky zlyhania nasadenia. Nízky šum merania nevytvára platnosť. Len robí nesprávnu otázku konzistentnejšie zodpovedanou.
Neistota by preto mala byť uvedená pri samotnom tvrdení, nie v zrieknutí sa na konci. Ak je hranica blízko nameranej hraničnej hodnoty, to je dôležité. Ak sa výsledok materiálne zmení pri inom zložení vstupov, to je dôležité. Ak energetická hranica nezahŕňa chladenie alebo prenos dát, to je dôležité. Úprimná veta môže byť menej triumfálna, ale dáva rozhodovateľovi niečo lepšie ako optimizmus: miesto pre opatrnosť.
Reprodukcia je reťaz, nie tlačidlo na stiahnutie
Reprodukovateľnosť sa často redukuje na zverejnenie kódu. Kód je dôležitý. Je to len jeden článok reťaze. Druhá strana potrebuje aj pracovnú záťaž alebo jej zákonný opis, verziu dát, konfiguráciu, prostredie, príkaz alebo testovací rámec, politiku náhodného stavu, pravidlo pre očakávaný výstup, súbor s výsledkami a metódu použitú na rozhodnutie, či sa beh zhoduje. Ak jeden článok chýba, druhá strana môže reprodukovať podobný experiment, nie ten vykázaný.
Reťaz by mala rozlišovať medzi presným prehratím a nezávislou replikáciou. Presné prehratie používa zachytený artefakt, stav, vstupy, konfiguráciu a cestu vykonania na overenie, či sa dá rovnaký beh zrekonštruovať. Nezávislá replikácia používa samostatne pripravené prostredie na testovanie, či výsledok prežije mimo pôvodného stroja alebo tímu. Obe sú hodnotné. Odpovedajú na rôzne otázky. Bitovo identický výsledok na zachytenom vstupe dokazuje silné tvrdenie o identite tohto behu. Nedokazuje, že živý svet zostane nezmenený.
Hodnotiaci rámec OECD uľahčuje videnie tohto rozdielu tým, že zaobchádza s účelom, realistickosťou, pokrytím a spoľahlivosťou ako so samostatnými aspektmi. Hodnotenie môže byť vynikajúce na regresné testovanie a slabé na odhad výkonnosti živej služby. Môže byť užitočné na výskum a nevhodné na posudzovanie zhody. Reprodukcia nevymaže účel. Pomáha čitateľovi overiť tvrdenie, ktoré metóda skutočne podporuje.
Pre dáta, ktoré nemožno zverejniť, zverejnite hranicu a cestu. Opíšte populáciu, proces výberu vzorky, metódu označovania, pravidlá vylúčenia a validačné kontroly. Poskytnite bezpečný balík na reprodukciu, ak je to možné, a vysvetlite, čo zostáva chránené. „Dáta sú dôverné“ je legitímna hranica, nie dokončená metóda. Čitateľ by mal byť stále schopný pochopiť, čo sa meralo a prečo by sa výsledok mal alebo nemal zovšeobecňovať.
Verejné inštitúcie by mali odmietnuť demonštračné divadlo
Verejné inštitúcie nemusia odmietať benchmarky. Musia odmietnuť benchmarky, ktoré nedokážu opísať svoj kontrakt. Vyleštená demonštrácia môže pomôcť výboru pochopiť možnosť. Nemôže nahradiť dôkazy o službe, ktorú musí inštitúcia prevádzkovať, o ľuďoch, ktorým slúži, a o zlyhaniach, ktoré musí opraviť. Tento rozdiel je dôležitý, pretože demo je optimalizované na krátke stretnutie, zatiaľ čo verejná služba sa hodnotí naprieč obdobiami, zmenami personálu, odvolaniami, údržbou a právom.
Pred kúpou požiadajte dodávateľa, aby definoval pracovnú záťaž v jazyku služby. Čo vstupuje do systému? Čo sa meria? Čo je vylúčené? Ktoré pravidlo kvality musí platiť? Ktorá ľudská rola kontroluje výsledok? Ako sa zisťuje odchýlka? Ako môže inštitúcia exportovať svoje dôkazy? Čo sa stane, keď sa zmení model, zdroj, dodávateľ alebo politika? Voči ktorej verzii sa porovnáva? Aká je cesta späť? Dodávateľ môže odpovedať na niektoré otázky zmluvou, na niektoré testom a na niektoré úprimným vymedzením hraníc. Takáto zmes je zdravšia ako odpoveď zložená výlučne z prídavných mien.
Nariadenie EÚ o umelej inteligencii vyjadruje tento bod právnym jazykom pre systémy s vysokým rizikom. Článok 15 vyžaduje primeranú úroveň presnosti, robustnosti a kybernetickej bezpečnosti so stálym výkonom v týchto ohľadoch počas celého životného cyklu. Benchmark nemôže sám o sebe preukázať celú právnu povinnosť. Môže podporiť časť dôkazov, ak sú jasné jeho rozsah, podmienky kvality a pozícia v životnom cykle. Považovať jedno skóre za súlad by bol ďalší chybný menovateľ. Právo pomenúva výsledok; inžinierstvo musí ukázať cestu.
Obstarávanie by sa malo tiež pýtať, kto vlastní benchmark po udelení zákazky. Test pripravený dodávateľom môže byť užitočný, ale inštitúcia potrebuje dostatok informácií na monitorovanie systému vo vlastnom kontexte. Potrebuje základnú hodnotu, ktorú možno znovu spustiť pri zmene verzie, cestu kontroly pri pohybe výsledkov a záznam rozhodnutí o prijateľnom výkone. Inak je prvý benchmark prijímacou skúškou a produkčný systém môže promovať bez ďalších otázok.
Vytvorte benchmarkovú kartu dostatočne malú na používanie
Dlhé metódy môžu byť potrebné. Nie sú vždy prvé, čo čitateľ potrebuje. Benchmarková karta je kompaktný index kontraktu. Môže stáť vedľa výsledku v správe, v registri hodnotení alebo v obstarávacom spise. Karta by mala uviesť otázku, pracovnú záťaž, rozsah, systém, metriku, požiadavku na kvalitu, základnú hodnotu, neistotu, spôsob reprodukcie, vlastníka a dátum vypršania alebo spúšťač zmeny. Podrobná metóda môže byť za ňou. Karta zabraňuje tomu, aby tvrdenie cestovalo osamote.
Dobré karty sú selektívne, nie preplnené. Zvýrazňujú polia, ktoré môžu zmeniť interpretáciu, a potom odkazujú na balík dôkazov. Karta o latencii môže zvýrazniť veľkosť vstupu, súbežnosť, percentil, zahrievanie, verziu a pravidlo časového limitu. Karta o energii môže zvýrazniť hranicu systému, pracovnú záťaž, merací prístroj, trvanie a vylúčenú infraštruktúru. Karta o presnosti môže zvýrazniť populáciu, pravidlo označovania, agregáciu, spôsob zdržania sa odpovede a závažnosť chýb. Spoločný tvar nie je pevná šablóna. Je to prísľub, že čitateľ nájde menovateľa.
Karta by mala označiť epistemický status. Je hodnota nameraná, odhadnutá, očakávaná, navrhovaná alebo ilustratívna? Je základná hodnota aktuálna? Je hodnotiaca sada pripravená, ale ešte nie spustená? Sú výsledky chránené, pretože testovací materiál obsahuje osobné údaje? Tieto označenia bránia tomu, aby sa metóda zamieňala za výsledok. Umožňujú tiež organizácii zverejňovať pokrok bez vytvárania falošného úspechu. Pripravený test je užitočná informácia. Nie je dôkazom, že systém ním prešiel.
Nakoniec priraďte karte vlastníka a pravidlo zmien. Výsledok bez vlastníka sa rozpadne na snímku. Výsledok bez pravidla zmien zostane na stene aj po tom, čo sa pracovná záťaž posunie. Vlastník nemusí číslo brániť naveky. Musí však povedať, kedy by sa tvrdenie malo znova spustiť, stiahnuť alebo zúžiť. Meranie sa stáva súčasťou prevádzky, keď má niekto právomoc udržiavať ho čestné.
Dva čestné spôsoby zverejnenia výsledku
Existujú dva bežné spôsoby publikovania. Prvým je prísne porovnanie. Stanoví úlohu, údaje, pravidlo kvality, hranicu systému a základnú hodnotu tak, aby čitateľ mohol porovnať alternatívy. Druhým je prieskumné meranie. Pýta sa, čo sa stane, keď sa zmení dizajn, pracovná záťaž alebo prostredie, a uvádza pozorovania s ich obmedzeniami. Prieskumná práca môže byť hodnotná skôr, než existuje prísny benchmark. Nemala by si však požičiavať jazyk výsledku zhody.
Prísne porovnania sú náročné, pretože robia rozdiely viditeľnými. Ak tím zmení model aj hardvér súčasne, môže byť nemožné výsledok pripísať. Ak je nová pracovná záťaž realistickejšia, ale už nezodpovedá základnej hodnote, tvrdenie by sa malo preformulovať ako nové meranie. Ak optimalizácia zrýchli výkon a zároveň zmení kvalitu výstupu, uveďte obe strany. Disciplína nemá brániť pokroku. Má zabrániť tomu, aby príbeh o pokroku vymazal podmienku, ktorá ho umožnila.
Prieskumné merania potrebujú vlastnú čestnosť. Povedzte, že vzorka je malá, že prostredie je dočasné, že pracovná záťaž je syntetická, že výsledok nebol nezávisle zopakovaný alebo že kontrola kvality je neúplná. Toto nie sú slabiny, ktoré treba skrývať až do vylešteného vydania. Sú to informácie, ktoré čitateľovi pomáhajú rozhodnúť sa, čo ďalej. Európska inžinierska kultúra nemusí predstierať, že každý test je konečný verdikt. Musí prestať nazývať otázku zodpovedanou skôr, než bol test prečítaný.
Obom režimom prospieva archív výsledkov. Uchovávajte staré definície, konfigurácie a výsledky identifikovateľné. Zaznamenávajte nahradenie namiesto vymazania minulosti. Zmenený benchmark môže byť správnym benchmarkom pre zmenenú službu, ale nemožno ho použiť na prepísanie významu starého výsledku. História verzií je pamäťou menovateľa.
Naša malá poznámka
V spoločnosti Dweve opisujeme Core pomocou vykonávacej bunky a zmluvy o determinizme. Užitočnou časťou tohto slovníka nie je názov produktu. Je to dôraz na to, že operácia nesie svoje numerické vyjadrenie, backend, inštrukčnú sadu, politiku odosielania a postoj k prehrávaniu ako súčasť hodnotenej cesty. To je rovnaký návyk, aký potrebuje benchmark: ponechajte podmienky pripojené k výsledku namiesto opisu výkonu, akoby sa vznášal nad systémom.
Toto je malá dizajnová poznámka, nie tvrdenie o externom nasadení alebo nameranom výsledku. Širšie ponaučenie nezávisí od Dweve. Či už je systém verejnou štatistickou službou, priemyselným regulátorom, jazykovým nástrojom alebo výskumným prototypom, číslo si získava dôveru tým, že pomenúva svoju prácu a svoje limity. Naša vlastná dokumentácia je jedným z miest, kde sa snažíme túto hranicu sprístupniť.
Menovateľ je časť, ktorá cestuje
Titulok benchmarku sa ľahko kopíruje. Menovateľ sa nesie ťažšie, a preto sa často necháva za sebou. Kupujúci skopíruje číslo priepustnosti do obchodného prípadu. Regulátor vidí skóre presnosti v spise. Inžinier porovnáva dva grafy z rôznych pracovných záťaží. Novinár zopakuje percento bez populácie. Každý čitateľ dostane číslo, ktoré stratilo zmluvu, ktorá mu dávala zmysel.
Oprava nie je zložitá, hoci si vyžaduje disciplínu. Pomenujte otázku. Definujte prácu. Uveďte rozsah a vylúčenia. Identifikujte systém a verzie. Vyberte metriku, ktorá zodpovedá službe. Udržiavajte základnú líniu. Merajte odchýlky. Zverejnite metódu aj dôkazy. Označte, čo zostáva neznáme. Priraďte tvrdeniu vlastníka a dôvod na jeho opätovné spustenie. Ak výsledok nepodporuje široké tvrdenie, zúžte ho.
Takto môže Európa odolávať divadelným ukážkam bez toho, aby sa stala alergickou na ambície. Verejná inštitúcia môže nakúpiť nové schopnosti a napriek tomu požadovať benchmark, ktorý rešpektuje službu. Výskumný tím môže zverejniť vzrušujúci výsledok a napriek tomu uviesť pracovné zaťaženie, ktoré ho vytvorilo. Dodávateľ môže ukázať rýchlu cestu a napriek tomu povedať, kde sa cesta končí. Úprimný rozsah nie je brzdou inovácie. Je povrchom cesty, po ktorom môže jazdiť ktokoľvek iný.
Benchmark je zmluva s menovateľom, pretože menovateľ nám hovorí, čo sa skutočne urobilo. Držte ho vedľa čísla. Výsledok bude menej magický, porovnateľnejší a oveľa užitočnejší. To je spravodlivá výmena. Systémy, na ktoré sa ľudia musia spoľahnúť, si zaslúžia čísla, ktoré prežijú pomalé čítanie.
Keď metrika putuje medzi svetmi
Čísla benchmarkov často opúšťajú tím, ktorý ich zmeral, a vstupujú do iného rozhodovacieho systému. Výskumník publikuje tabuľku. Produktový tím zmení jeden riadok na cieľ. Nákupné oddelenie zmení cieľ na zmluvu. Prevádzka zmení zmluvu na očakávanie úrovne služieb. Každý krok mení to, čo sa od čísla žiada. Pôvodný menovateľ môže byť stále prítomný v dokumente alebo repozitári, ale stal sa sociálne vzdialeným od rozhodnutia. Metrika potrebuje prekladovú poznámku vždy, keď prekročí túto hranicu.
Prekladová poznámka môže byť jednoduchá. Tento výsledok sa týka priepustnosti komponentov, nie dokončených prípadov. Tento údaj o presnosti používa pevný súbor označení, nie živé výsledky. Táto hodnota energie vylučuje chladiaci okruh dátového centra. Táto základná línia je referenčná implementácia, nie súčasná služba. Tieto vety zabránia tomu, aby sa užitočné meranie stalo zavádzajúcim sľubom. Tiež uľahčujú nesúhlas. Čitateľ môže spochybniť hranicu namiesto toho, aby sa hádal o tom, či číslo pôsobí pôsobivo.
Rôzne tímy môžu zámerne zvoliť rôznych menovateľov. Platformový tím sa môže zaujímať o prácu na joule. Vlastník služby sa môže zaujímať o dokončené rozhodnutia za hodinu personálu. Verejný orgán sa môže zaujímať o správne a vysvetliteľné výsledky pre definovanú populáciu a reakčný čas. Toto nie sú konkurenčné pravdy, ak je každá z nich pomenovaná. Problémy začínajú, keď sa najjednoduchší menovateľ môže vydávať za poslanie. Najrýchlejšie jadro automaticky nevytvára najlepšiu službu, rovnako ako najväčší testovací súbor automaticky nevytvára ten najrelevantnejší.
Pred opätovným použitím benchmarku sa opýtajte, čo sa zmenilo: pracovné zaťaženie, vlastník, dôsledok alebo časový horizont. Ak sa zmenilo čokoľvek z toho, zopakujte interpretáciu, aj keď je základné číslo nezmenené. Meranie nie je relikvia, ktorá sa prenáša medzi miestnosťami. Je to vzťah, ktorý treba obnoviť, keď sa miestnosť zmení.
Výsledok by mal vedieť, kedy vyprší
Výsledky majú užitočnú životnosť. Benchmark viazaný na verziu modelu, snímku zdroja alebo hardvérovú konfiguráciu sa stáva historickým, keď sa tieto podmienky zmenia. To nerobí starý výsledok nepravdivým. Mení to otázku, na ktorú môže odpovedať. Správa by mala uviesť, aká udalosť robí tvrdenie zastaraným: nový model, zmenený kompilátor, nové rozdelenie údajov, revidované pravidlo označovania, výmena hardvéru, zmena politiky alebo pozorovaný signál odchýlky. Pravidlo vypršania je malým kúskom inštitucionálnej pamäte.
Bez pravidla expirácie sa čísla hromadia ako kabáty na stoličke. Každé z nich tam technicky stále je a nikto nevie, ktoré patrí dnešku. Register výsledkov môže uchovávať celú históriu a zároveň označovať aktuálne porovnanie, nahradenú definíciu a dôvod opätovného spustenia. Samotné opätovné spustenie je potom bežná údržba, nie reakcia na krízu. Toto je obzvlášť dôležité pre verejné služby, kde výsledok môže prežiť tím, ktorý ho vytvoril.
Expirácia tiež chráni čestný pokrok. Ak nová pracovná záťaž odhalí, že predchádzajúci benchmark bol príliš úzky, organizácia môže zmenu zverejniť, zachovať starú metódu a vysvetliť novú hranicu. Nemusí brániť zastarané číslo ani predstierať, že staré číslo nikdy neexistovalo. Benchmark, ktorý možno zúžiť, nahradiť a pochopiť, je užitočnejší ako ten, ktorý musí zostať pôsobivý navždy.
Zdroje
- Rámec na charakterizáciu nástrojov hodnotenia výkonnosti AI, OECD, AI and the Future of Skills, Volume 2. Využil sa rámec kapitoly s 18 aspektmi vrátane pokrytia, účelu, realizmu, platnosti, spoľahlivosti a transparentnosti.
- Konštrukcia rámca na meranie schopností AI, OECD, AI and the Future of Skills. Využilo sa na dôkazoch založené, opatrné rámcovanie merania a limity súčasného pokrytia benchmarkov z kapitoly.
- Európsky štatistický kódex postupov, Eurostat. Využilo sa 16 zásad a 84 ukazovateľov Európskeho štatistického systému.
- Rámec zabezpečenia kvality, Eurostat. Využili sa metódy, nástroje a úloha osvedčených postupov rámca pri implementácii Kódexu postupov.
- Politika kvality Eurostatu, Eurostat. Využili sa štyri úrovne zabezpečenia kvality a úloha správ o kvalite a metadátach.
- Príručka pre podávanie MLPerf Inference, MLCommons. Využili sa typy systémov, scenáre, divízie, kontrola presnosti a kroky podávania.
- Dokumentácia benchmarkov MLPerf Inference, MLCommons. Využili sa publikované polia a príklady benchmarkov vrátane podmienok týkajúcich sa dátových súborov, kvality a latencie.
- Pracovná skupina MLPerf Inference, MLCommons. Využil sa účel spravodlivých a reprezentatívnych inferenčných benchmarkov a výzva reprodukovateľnosti naprieč hardvérom a softvérom.
- Nariadenie (EÚ) 2024/1689, Akt o umelej inteligencii, EUR-Lex. Využil sa článok 15 o presnosti, robustnosti, kybernetickej bezpečnosti a konzistentnosti životného cyklu.
- Dweve Core, Dweve. Verejné definície vykonávacej bunky a kontraktu determinizmu podporujú stručnú, zverejnenú poznámku Dweve.