Benchmark on kokkulepe nimetajaga

Jõudlusnäitajad on kasulikud vaid siis, kui koormus, ulatus, riistvara, kvaliteeditingimus, lähtetase ja määramatus jäävad numbri juurde.

Benchmark on kokkulepe nimetajaga

Arv, mis unustab oma nimetaja

Jõudlustesti tulemust saab mõõta õigesti ja see võib siiski vastata valele küsimusele. Tavaline süüdlane ei ole vigane taimer ega ebaaus insener. Süüdlane on nimetaja, mis kadus testikeskkonna ja esitlusslaidi vahel. „Kaks korda kiirem“ kõlab võrdlusena, kuid see ei ütle, kaks korda kiirem mille tegemisel, millisel masinal, millise tarkvaraga, millise kvaliteeditingimuse juures, millise lähtetaseme suhtes või milliste kasutajate jaoks. Eemaldage need tingimused ja jõudlusnumber muutub lihvitud killuks. See võib jääda numbriliselt tõeseks. Kuid see ei ütle enam ostjale ega operaatorile, mida nad oodata võivad.

Nimetaja on töö, mille suhtes tulemust väljendatakse. Läbilaskevõime puhul on see tehtud töö ja aeg, mille jooksul lõpetamist arvestatakse. Latentsusaja puhul on see päringu definitsioon, kaasatud tee ja vaatluste hulk. Täpsuse puhul on see märgistatud hulk, märgistuse reegel ja hinnatav ühik. Energia puhul on see mõõdetud süsteemi piir ja selles piiris tehtud töö. Kulu puhul on see kuluperiood, kaasatud ressursid ja kasuliku töö maht. Jõudlustest on aus, kui selle lugeja ja nimetaja liiguvad koos.

Seetõttu on kõige parem käsitleda jõudlustesti lepinguna. Leping nimetab küsimuse, töökoormuse, ulatuse, riistvara ja tarkvara, mõõdiku, lähtetaseme, määramatuse ja meetodi, mille abil saab teine osapool tulemust kontrollida. Leping võib olla kitsas. See võib olla uurimuslik. See võib olla kasulik ainult ühe juurutuse jaoks. Mida see olla ei saa, on muljetavaldav number, mille tingimused jäetakse lugeja oletada. Oletamine on halb viis avaliku raha jagamiseks ja veel halvem viis teenuse kujundamiseks, mida keegi teine peab elus hoidma.

Euroopa harjumust definitsioone kirja panna pilatakse vahel bürokraatiana. Mõõtmistöös on definitsioonid see osa, mis hoiab ära selle, et bürokraatiast saab rahvapärimus. Jõudlustesti tabel ei ole tulemuse halduslik lisa. See on tulemuse isikutunnistus.

Loe ühikut enne pealkirja

Alusta ühikust, kuid ära peatu seal. Päringut sekundis, märki sekundis, millisekundit, džauli päringu kohta, eurot tuhande kirje kohta ja protsendipunkti ütlevad sulle kõik midagi. Ükski neist ei ütle, mida süsteemil paluti teha. Tulemus 100 päringut sekundis võib kirjeldada väikeseid vahemälust päringuid või suuri vahemäluta päringuid, mis hõlmavad otsingut, valideerimist ja inimesele üleandmist. Latentsusaeg 20 millisekundit võib hõlmata ühte kernelit või tervet otsustusteed. Ühik on uks. Töökoormus on ruum selle taga.

Oletame, et hankeslaid ütleb, et uus teenus on olemasolevast 40 protsenti kiirem. See lause ei ole veel tõend. See vajab vähemalt ajastatavat toimingut, sisendi suurust ja jaotust, kellast välja jäetud tööd, samaaegsust, soojendusseisundit, tarkvaraversioone, riistvara ja lähtekonfiguratsiooni. See vajab ka kvaliteeditingimust. Kui kiirem tee tagastab vähem kehtivaid tulemusi, jätab pikad sisendid vahele või jätab vahele kalli kontrollimise sammu, on lugejat vähendatud töö muutmisega.

See ei ole nõue, et enne kui keegi rääkida saab, tuleb koostada tohutu tabel. See on nõue tuvastada need mõned väljad, mis muudavad väite tähendust. Väike parseri jõudlustest võib vajada kirje kuju, sisendallikat, valideerimispoliitikat, kompilaatorit ja protsessorit. Süvendi jõudlustest võib vajada mudelit, täpsust, partiid, stsenaariumit, kvaliteedieesmärki ja võimsuspiiri. Avaliku sektori järjekord võib vajada juhtumi definitsiooni, teenuse kella, marsruutimisreeglit ja eskaleerimisteed. Väljad erinevad. Kohustus need nimetada ei erine.

Siin on kasulik distsipliin: kirjuta tulemus lausena, mis peaks vastu ka teisele lugejale. „Selle töökoormuse ja kvaliteedinõude juures, sellel süsteemil ja versioonil oli mõõdetud väärtus selline, sellise varieeruvusega.“ Kui lauset ei saa lõpetada ilma selliste sõnadeta nagu tüüpiline, parim, tootmislaadne või esinduslik, pole meetod veel valmis. Need sõnad võivad olla õigustatud, kuid nad vajavad operatiivset määratlust, mitte sooja tooni.

Benchmarkikaart pole numberi ümber olev kaunistus. See on numberi lepingu kõige väiksem kasulik vorm.

Ulatus on osa tulemusest

Ulatus vastab lihtsale küsimusele: mida see tulemus hõlmab ja mis jääb raamist välja? Masinõppe hindamises hõlmab ulatus ülesannet, andmestikku, jaotust, keelt, sisendi pikkust, kasutusstsenaariumit ja lubatud teostusvalikuid. Tarkvarateenuse puhul hõlmab see marsruuti, andmeladusid, võrku, vahemälu ja tööd, mida allavoolu meeskond teeb pärast seda, kui mõõdetud lõpp-punkt on vastanud. Ühel kihil mõõdetud tulemus ei tohiks vaikselt muutuda lubaduseks kogu teenuse kohta.

MLCommons teeb selle nähtavaks oma MLPerf Inference dokumentatsioonis. Esitamisjuhend eristab andmekeskuse ja serva süsteemitüüpe, loetleb stsenaariume nagu offline, server, interaktiivne, ühevooluline ja mitmevooluline, ning eristab suletud jaotust avatud jaotusest. Suletud jaotus on mõeldud õunte-õunte vastu võrdluseks, kasutades sama mudelit ja võrdlusseadistust. Avatud jaotus lubab valikuid nagu ümberõpe või mudeli asendamine. Kumbki pole universaalselt õige jaotus. Nad vastavad erinevatele küsimustele. Pealkiri, mis need segamini ajab, pole lai vaade. See on kategooriaviga suurepärase tüpograafiaga.

Sama dokumentatsioon näitab, miks vajab benchmark selget kvaliteedipoolt. Loetletud ResNet50 kirje nimetab ImageNet-2012 valideerimiskomplekti, selle andmestiku ja päringuvalimi loendi suurusi, võrdlustäpsust ja serveri latentsuspiirangut. Loetletud ResNet50 kirje puhul annab leht valideerimiskomplekti 50 000 pildist, päringuvalimi loendi 1 024-st, võrdlustäpsuse 76,46 protsenti ja 15 ms serveri latentsuspiirangu. Need väljad pole tühiasi inimestele, kellele meeldib reegleid lugeda. Nad selgitavad, mida teatatud kiirusel lubati tähendada. Muuda andmestikku, stsenaariumit või kvaliteedinõuet ja võrdlus on muutunud, isegi kui mudeli nimi tundub tuttav.

Euroopa ostja peaks suhtuma kahtlusega ulatusse, mida tootesilt vihjab. „AI-platvorm“, „kiirendi“ ja „ettevõttekvaliteet“ ei määratle tööd. Süsteem, mis on suurepärane piiratud toimingus, võib olla täpselt see, mida teenus vajab. Süsteem, mis väidab, et katab kõike, võib olla mõõtnud peaaegu mitte midagi, mis sarnaneb teenusega. Kitsas tõde on tervislikum kui universaalne udu.

Katvus muudab tähendust

Katvus ei ole joonealune märkus selle kohta, kas testikomplekt oli suur. See kirjeldab, kelle juhtumid ja millised olukorrad mõõtmisse kaasatakse. Benchmark võib hõlmata palju näiteid ühest kitsast jaotusest ja öelda siiski vähe servajuhtumite kohta, mis tegelikus kasutuses olulised on. Seevastu väike, hoolikalt valitud komplekt võib paljastada olulise tõrkerežiimi, toetamata seejuures üldist jõudlusväidet. Valik on disainiotsus. Seda tuleb ka sellisena esitada.

OECD raamistik AI hindamisvahendite iseloomustamiseks on kasulik, sest see keeldub taandamast hindamist ühele skoorile. See pakub 18 tahku, sealhulgas katvus, eesmärk, realistlikkus, valiidsus, usaldusväärsus, läbipaistvus ja tingimused, mille korral tulemusi tõlgendada saab. Katvus küsib, kas hindamine esindab seda, mida see mõõta kavatseb. Eesmärk eristab teadustööks mõeldud benchmarki vastavuse või mõne muu kasutuse jaoks mõeldud benchmarkist. Realistlikkus küsib, kas keskkond on mänguasjaprobleem, simuleeritud või laborikeskkond või päriselu. Need eristused ei muuda benchmarki nõrgemaks. Need muudavad selle väite loetavaks.

Katvus hõlmab ka juhtumeid, mille hindamine välja jätab. Teenus võib teatada keskmisest latentsusest pärast aegumiste eemaldamist. Klassifikaator võib teatada täpsusest pärast mitmetähenduslike siltide kõrvalejätmist. Otsingusüsteem võib lugeda ainult päringuid, millel on vähemalt üks asjakohane dokument. Pilditöötlusahel võib rikutud failid vahele jätta. Iga väljajätmine võib olla põhjendatud. Tulemus peab ütlema, mis eemaldati ja miks. Muidu muutub nimetaja vaikselt nimekirjaks juhtumitest, mida oli mugav lõpule viia.

Siin muutub nimetaja poliitiliseks, isegi enne kui keegi sõna „poliitika“ kasutab. Kaasatud populatsioon saab mõõdetud olemise hüve. Välja jäetud populatsioon saab loo süsteemist, mis ei pruugi neid kirjeldada. Euroopa avalikud institutsioonid teavad seda juba ametlikust statistikast. Eurostati Euroopa statistikatava juhend sisaldab 16 põhimõtet ja 84 näitajat institutsionaalse keskkonna, protsesside ja väljundite kohta. Selle kvaliteeditagamise raamistik pakub meetodeid ja vahendeid, samas kui kvaliteediaruanded räägivad kasutajatele, kuidas andmeid koguti ja valideeriti. Sõnum AI jaoks ei ole see, et iga mudel peab muutuma statistikaametiks. See on see, et avalike otsuste jaoks mõeldud arv vajab nähtavat tootmis- ja kvaliteedilugu.

Täpsus ei ole üks värav

Jõudlusväited seovad sageli kiiruse ühe kvaliteedinumbriga ja kohtlevad seejärel paari terviklikuna. Kvaliteet on tavaliselt küsimuste perekond. Kas väljund vastab ülesande määratlusele? Kas see säilitab nõutud piirangud? Kas see ebaõnnestub ohutult, kui tõendid puuduvad? Kas see käitub asjakohase populatsiooni lõikes vastuvõetavalt? Kas see püsib kvaliteedipiiri sees, kui süsteem on koormatud? Kiire vastus, mis ülesannet ei täida, ei ole kiirem lahendus. See on teistsugune töökoormus, mis kannab sama nime.

MLPerfi struktuur on õpetlik, sest selle jõudluskatsed asuvad täpsuse valideerimise ja mudelipõhiste nõuete kõrval. Esitamisjuhend ütleb osalejatele, et nad tuvastaksid divisjoni, süsteemitüübi ja stsenaariumi, käivitaksid ettenähtud benchmarki, valideeriksid täpsuse läviväärtuste vastu ja koostaksid seejärel kontrollitud esituse. Benchmarki leht loetleb iga ülesande kohta võrdlustäpsuse ja latentsuse või läbilaskevõime tingimused. Eraldus on praktiline. See hoiab ära olukorra, kus süsteem võidab jõudluse veeru, kaotades vaikselt ülesande.

Täpsus ise vajab nimetajat. „98 protsenti täpne“ võib tähendada protsenti kirjetest, märkidest, piltidest, päringutest või otsustest. See võib kasutada mikro- või makrokeskmistamist. See võib lugeda hoidumise veaks, ohutuks keeldumiseks või mõõtmata tulemuseks. See võib võrrelda ühe või mitme hindaja loodud siltidega. Benchmarki kaart peaks nimetama ühiku, sildireegli, agregeerimise, usalduse või varieeruvuse ja kõik läviväärtused, mis muudavad mõõtmise väljalaskmisotsuseks.

Ärge kasutage kvaliteedinumbrit dekoratiivse loana. Mudel võib vastata avaldatud künnisele ja jääda siiski konkreetse teenuse jaoks sobimatuks, sest ülesanne, sihtrühm või kahjuprofiil on erinev. Vastupidi, madalam koondskoor võib olla vastuvõetav mustandi koostamise tööriista puhul, kus inimene jääb autoriks, samas kui sama skoor on vastuvõetamatu automaatse värava puhul. Kvaliteet on seos väljundi, eesmärgi ja tagajärje vahel.

Aeg ei ole üks number

Latentsust esitatakse sageli nii, nagu oleks süsteemil üks kiirus. Päris süsteemidel on jaotus. Esimene päring võib nõuda käivituskulu. Vahemälu võib hilisemaid päringuid muuta. Samaaegsed kasutajad võivad võistelda mälu või andmebaasiühenduse pärast. Pikk sisend võib minna teist teed kui lühike. Keskmine võib paraneda, samal ajal kui saba halveneb. Kui saba on see, kus teenus oma tähtajast mööda laseb, on keskmine tähelepanu kõrvale juhtiv arv ühikuga.

Kasulik latentsusaruanne ütleb, mida mõõdeti ja kuidas vaatlusi kokku võeti. See võib sisaldada mediaani, ülemisi protsentiile, ajalõpu määra ja päringute arvu. Selles tuleks öelda, kas soojenduspäringud jäeti välja, kas uuesti proovimised arvati sisse ja kas järjekorras ootamine või võrgu aeg kuulub mõõdetud teele. Need valikud ei ole omavahel asendatavad. Komponendi jõudlustest võib olla väärtuslik, kuid seda ei tohi esitada otsast lõpuni käitumisena.

Läbilaskevõimel on sarnane lõks. Kõrge määrani võib jõuda töö partiidena tegemise, samaaegsuse suurendamise või kvaliteedinõude leevendamise kaudu. See võib olla täpselt õige võrguühenduseta töö puhul. See võib olla kasutu interaktiivse teenuse puhul, mis peab igale päringule tähtaja jooksul vastama. Jõudlustest peaks kirjeldama stsenaariumi ja tööpunkti ning seejärel selgitama, mis juhtuks, kui nõudlus sellest eemaldub. Kitsas tööpunkt ei ole häbiasi. Häbiasi on teeselda, et see on kogu kaart.

Ajal on ka inimlik külg. Teenus, mis vastab kiiresti, kuid tekitab rohkem ülevaatuse, paranduse või edasikaebamise tööd, võib olla asutuse vaatevinklist aeglasem. Jõudlustest, mis peatab kella enne üleandmist, võib mõõdetud süsteemi näidata vilkana, samal ajal kui tegelik teenus kogub järjekorda. Nimetaja peaks järgima tööd seni, kuni esitatud küsimusele on vastatud. Muidu mõõdab stopper saart.

Riistvara ja tarkvara on lugeja osa

„Serveris" ei ole korratav keskkond. Protsessori põlvkond, käskude komplekt, kiirendi, mälu, salvestus, termiline olek, võimsuse piir, operatsioonisüsteem, draiver, kompilaator, käitusaeg, teek ja konfiguratsioon võivad kõik tulemust muuta. Samuti võivad seda teha mudeli vorming, kvantimisseade, partii suurus, tuuma valik või lõimede poliitika. Jõudlustest ei pea loetlema iga kaablit. Küll aga peab see tuvastama osad, mis võivad mõõtmist muuta.

MLPerf nimetab täielikku mõõdetud seadistust testitavaks süsteemiks ja korraldab tulemused süsteemi tüübi ja kättesaadavuse kategooria järgi. See sõnavara on kasulik ka väljaspool MLPerfi. Testitaval süsteemil on piir. Piir ütleb, milline riistvara ja tarkvara on kaasatud, millised teenused on välised ja milline töö on välja jäetud. Seinal mõõdetud võimsusnäitaja tähendab midagi muud kui näitaja, mis loeb ainult kiirendit. Tuuma sees mõõdetud latentsus tähendab midagi muud kui see, mis hõlmab päringu ajastamist.

Versioonid on olulised, sest jõudlustest on võrdlus olekute vahel, mitte tootenime ajatu omadus. Salvestage mudeli või rakenduse versioon, sõltuvuste versioonid, kompilaatori lipud, draiver ja püsivara, kui need tulemust mõjutavad. Salvestage konfiguratsioon, mis valis tagarakenduse või täpsuse. Kui käitusaeg valib teisel masinal teise tuuma, on see osa tulemusest, mitte rakenduse üksikasjast, mille saab hiljem korda teha.

Riistvara avalikustamine ei ole kutse muuta blogipostitus varuosade kataloogiks. See on viis vältida valet võrdväärsust. Ostja ei pea hoolima igast üksikasjast, kui väide puudutab terviklikku teenust. Küll aga peab ta teadma, kas võrdlus hõlmab sama tööd, sama täpsust, sama sisenditeed ja süsteemi, mida on tegelikult võimalik hankida ja käitada kavandatud Euroopa keskkonnas.

Algtasemed on lubadused

Algtase on võrdlus, mis annab tulemusele suuna. Ilma selleta võib arv kirjeldada süsteemi, kuid mitte paranemist. Algtase peab vastama samale küsimusele võrreldavates tingimustes. Kui uus tee kasutab uuemat kompilaatorit, teistsugust sisendjaotust või teistsugust kvaliteedieesmärki, võib tulemus olla endiselt huvitav, kuid võrdlus pole enam puhas. Öelge, mis muutus. Lugeja saab siis ise otsustada, kas erinevus on kasulik.

Algtaseme valik on tõlgendamisküsimus. Võrrelge tegelikult kasutatava olemasoleva süsteemiga, võrdlusrakendusega, eelmise versiooniga või teoreetilise piiriga ning saate teada erinevaid asju. Uus süsteem võib olla parem kui võrdlusrakendus ja halvem kui teenus, mida see asendab. See võib olla kiirem puhtal testil ja aeglasem, kui lisada valideerimine ja salvestus. Võrdlusuuring peaks nimetama algtaseme ja selgitama, miks see vastab operatiivsele küsimusele.

Paaritatud katsed on sageli informatiivsemad kui üksik võiduring. Hoidke töökoormus ja hindamismääratlus muutumatuna, muutke ühte olulist tegurit ja registreerige erinevus. Kui mitu tegurit muutuvad koos, kirjeldage võrdlust tervikpaketina, mitte ei omistage kogu mõju ühele komponendile. See kõlab ilmselgena, kuni uuendus, andmevärskendus ja uus vahemälupoliitika jõuavad samasse väljalaskesse. Graafikul on siis üks nool ja kolm võimalikku põhjust, mis on väike mõistatus, milleks keegi eelarvet ei pannud.

Algtasemel on ka kõlblikkusaeg. Andmevoog, tarnija, mudel, poliitika või riistvaraplatvorm võivad muutuda. Võrdlus kehtib testitud versioonide ja perioodi kohta. Seda ei tohiks uuesti kasutada praeguse garantiina ilma lepingut kontrollimata. Siin tasub versiooniajalugu end ära. Ületatud tulemus ei ole ebaõnnestumine. See on ajalooline väide, mille tingimused peaksid jääma nähtavaks.

Määramatus ei ole vabandus

Iga mõõtmine sisaldab varieeruvust. Osa varieeruvusest tuleneb süsteemist, osa töökoormusest ja osa mõõtmisprotsessist. Korduvad katsed võivad selle paljastada, kuid kordamine iseenesest ei selgita põhjust. Soe vahemälu võib olla stabiilne. Mürarikas naaber ei pruugi olla. Väike hindamisvalim võib anda laia valiku usutavaid tulemusi. Suurem valim võib vähendada valimimüra, jättes kallutatud populatsiooni puutumata. Määramatus ütleb lugejale, kui kaugele saab tulemus ohutult rännata.

Esitage määramatus väitele sobivas vormis. See võib olla vahemik korduvate katsete lõikes, usaldusvahemik, standardviga, latentsusaja jaotus, tundlikkusanalüüs või teadaolevate piirangute loend. Ärge lisage usaldusvahemikku sellepärast, et tabel näeb üksildane välja. Öelge, mida korrati, mida hoiti muutumatuna ja mida vahemik esindab ning mida mitte. Statistiline keel ei ole loits. See on leping varieeruvuse kohta.

On olemas ka teist liiki määramatus, mida arvud ei suuda eemaldada: määramatus selle kohta, kas mõõtmine esindab kavandatud teenust. Tulemusel võib olla väike katsetevaheline varieeruvus ja kehv katvus reaalses maailmas. Võrdlusuuring võib olla laboris täiuslikult korratav, kuid jätta vahele juurutuse keeled, sisendvormingud, vahetuste mustrid või rikke tagajärjed. Väike mõõtmismüra ei loo kehtivust. See muudab vaid vale küsimuse järjekindlamalt vastatuks.

Ebamäärasus peaks seetõttu asuma väite kõrval, mitte allosas olevas lahtiütluses. Kui läviväärtus on mõõdetud piiri lähedal, on see oluline. Kui tulemus muutub oluliselt erineva sisendite kombinatsiooni korral, on see oluline. Kui energiapiir jätab välja jahutuse või andmete liikumise, on see oluline. Aus lause võib olla vähem võidukas, kuid see annab otsustajale midagi paremat kui optimismi: koha, kuhu ettevaatus paigutada.

Reprodutseerimine on ahel, mitte allalaadimisnupp

Reprodutseeritavust taandatakse sageli koodi avaldamisele. Kood on oluline. See on vaid üks lüli ahelas. Teine osapool vajab ka töökoormust või selle seaduslikku kirjeldust, andmeversiooni, konfiguratsiooni, keskkonda, käsku või testimisraamistikku, juhuslikkuse poliitikat, eeldatava väljundi reeglit, tulemufaili ja meetodit, mille alusel otsustatakse, kas käitlus langeb kokku. Kui üks lüli puudub, võib teine osapool reprodutseerida sarnase katse, mitte aga teatatud katse.

Ahel peaks eristama täpset taasesitust sõltumatust reprodutseerimisest. Täpne taasesitus kasutab jäädvustatud artefakti, olekut, sisendeid, konfiguratsiooni ja täitmisteed, et kontrollida, kas sama käitlust on võimalik rekonstrueerida. Sõltumatu reprodutseerimine kasutab eraldi ettevalmistatud keskkonda, et testida, kas tulemus püsib väljaspool algset masinat või meeskonda. Mõlemad on väärtuslikud. Need vastavad erinevatele küsimustele. Bittide kaupa identne tulemus jäädvustatud sisendil tõestab tugevat identsusväidet selle käitluse kohta. See ei tõesta, et reaalne maailm jääb muutumatuks.

OECD hindamisraamistik muudab selle eristuse kergemini nähtavaks, käsitledes eesmärki, realistlikkust, katvust ja usaldusväärsust eraldi tahkudena. Hinnang võib olla suurepärane regressioonitestide jaoks ja kehv reaalajas teenuse jõudluse hindamiseks. See võib olla kasulik teadustööks ja sobimatu vastavushindamiseks. Reprodutseerimine ei kustuta eesmärki. See aitab lugejal kontrollida väidet, mida meetod tegelikult toetab.

Andmete puhul, mida ei saa avalikustada, avaldage piir ja tee. Kirjeldage populatsiooni, valimiprotsessi, märgendusmeetodit, välistamisreegleid ja valideerimiskontrolle. Võimaluse korral pakkuge ohutu reprodutseerimispakett ja selgitage, mis jääb kaitstuks. „Andmed on konfidentsiaalsed“ on seaduslik piir, mitte lõpetatud meetod. Lugeja peaks siiski suutma mõista, mida mõõdeti ja miks tulemust üldistada tuleks või ei peaks.

Reprodutseerimine ei ole nupp, millel on silt „käivita uuesti“. See on identiteetide ahel, mis võimaldab teisel meeskonnal väidet vaidlustada.

Avalikud institutsioonid peaksid keelduma demonstratsiooniteatrist

Avaliku sektori asutustel ei ole vaja hinnangualuseid tagasi lükata. Nad peavad keelduma hinnangualustest, mis ei suuda oma lepingut sõnastada. Lihvitud demonstratsioon võib aidata komiteel mõista võimalust. See ei saa asendada tõendeid teenuse kohta, mida asutus peab haldama, inimeste kohta, keda see teenindab, ja rikete kohta, mida see peab parandama. See eristus on oluline, sest demo on optimeeritud lühikeseks kohtumiseks, samas kui avalikku teenust hinnatakse aastaaegade, personalivahetuste, kaebuste, hoolduse ja seaduste lõikes.

Enne ostmist paluge tarnijal määratleda töökoormus teenuse keeles. Mis süsteemi siseneb? Mida mõõdetakse? Mis on välistatud? Milline kvaliteedireegel peab kehtima? Milline inimroll vaatab tulemuse üle? Kuidas triivi avastatakse? Kuidas saab asutus oma tõendid eksportida? Mis juhtub, kui mudel, allikas, tarnija või poliitika muutub? Millise versiooniga võrreldakse? Mis on tagasipööramise tee? Tarnija võib mõnele küsimusele vastata lepinguga, mõnele testiga ja mõnele ausa piiriga. See segu on tervislikum kui vastus, mis koosneb ainult omadussõnadest.

ELi AI-määrus esitab selle punkti juriidilises keeles kõrge riskiga süsteemide kohta. Artikkel 15 nõuab asjakohast täpsuse, vastupidavuse ja küberturvalisuse taset, kusjuures nendes aspektides peab olema järjepidev toimivus kogu elutsükli vältel. Hinnangualus ei saa iseenesest kehtestada kogu õiguslikku kohustust. See võib toetada osa tõenditest, kui selle ulatus, kvaliteeditingimused ja elutsükli positsioon on selged. Ühe skoori käsitlemine vastavusena oleks järjekordne nimetaja viga. Seadus nimetab tulemuse; inseneriteadus peab näitama teed.

Hankeprotsessis tuleks küsida ka seda, kellele hinnangualus pärast lepingu sõlmimist kuulub. Tarnija ettevalmistatud test võib olla kasulik, kuid asutus vajab piisavalt teavet, et jälgida süsteemi oma kontekstis. Ta vajab lähtetasemeid, mida saab versiooni muutudes uuesti käivitada, ülevaatusrada tulemuste muutumisel ja arvestust otsuste kohta, mis on tehtud vastuvõetava toimivuse osas. Vastasel juhul on esimene hinnangualus sisseastumiseksam ja tootmissüsteemil lubatakse lõpetada ilma täiendavate küsimusteta.

Tehke hinnangualuse kaart piisavalt väikeseks, et seda kasutada

Pikad meetodid võivad olla vajalikud. Need ei ole alati esimene asi, mida lugeja vajab. Hinnangualuse kaart on kompaktne register lepingu kohta. See võib asuda tulemuse kõrval aruandes, hindamisregistris või hankedokumendis. Kaart peaks nimetama küsimuse, töökoormuse, ulatuse, süsteemi, mõõdiku, kvaliteedinõude, lähtetaseme, määramatuse, reprodutseerimise tee, omaniku ja aegumise või muutuse käivitaja. Üksikasjalik meetod võib jääda selle taha. Kaart hoiab väite reisimast üksi.

Head kaardid on valivad, mitte ülerahvastatud. Need toovad esile väljad, mis võivad tõlgendust muuta, ja seejärel viitavad tõendite paketile. Latentsuskaart võib esile tuua sisendi suuruse, samaaegsuse, protsentiili, soojenemise, versiooni ja ajalõpu reegli. Energiakaart võib esile tuua süsteemi piiri, töökoormuse, mõõteseadme, kestuse ja välistatud infrastruktuuri. Täpsuskaart võib esile tuua populatsiooni, märgistuse reegli, agregeerimise, hoidumise käsitluse ja vea raskusastme. Ühine kuju ei ole fikseeritud mall. See on lubadus, et lugeja leiab nimetaja.

Kaart peaks märkima epistemilise staatuse. Kas väärtus on mõõdetud, hinnanguline, oodatud, kavandatud või illustreeriv? Kas lähtetase on ajakohane? Kas hindamiskomplekt on ette valmistatud, kuid veel käivitamata? Kas tulemused on kaitstud, kuna testmaterjal sisaldab isikuandmeid? Need sildid takistavad meetodi segiajamist tulemusega. Need võimaldavad ka organisatsioonil avaldada edusamme ilma edu võltsimata. Ettevalmistatud test on kasulik teave. See ei ole tõend, et süsteem selle läbis.

Lõpuks anna kaardile omanik ja muudatuste reegel. Tulemus ilma omanikuta laguneb slaidiks. Tulemus ilma muudatuste reeglita jääb seinale pärast seda, kui töökoormus on liikunud. Omanik ei pea numbrit igavesti kaitsma. Nad peavad ütlema, millal väide tuleks uuesti käivitada, tagasi võtta või kitsendada. Mõõtmine muutub operatsioonide osaks, kui kellelgi on volitus seda ausana hoida.

Kaks ausat viisi tulemuse avaldamiseks

Levinud on kaks avaldamisviisi. Esimene on range võrdlus. See fikseerib ülesande, andmed, kvaliteedireegli, süsteemi piiri ja lähtetaseme, et lugeja saaks alternatiive võrrelda. Teine on uurimuslik mõõtmine. See küsib, mis juhtub, kui disain, töökoormus või keskkond muutub, ja teatab tähelepanekutest koos nende piirangutega. Uurimuslik töö võib olla väärtuslik enne range võrdlusnäitaja olemasolu. See ei tohiks laenata vastavustulemuse keelt.

Ranged võrdlused on nõudlikud, sest need teevad erinevused nähtavaks. Kui meeskond muudab mudelit ja riistvara koos, võib tulemuse omistamine olla võimatu. Kui uus töökoormus on realistlikum, kuid ei ühti enam lähtetasemega, tuleks väide ümber sõnastada uue mõõtmisena. Kui optimeerimine parandab kiirust, muutes samal ajal väljundi kvaliteeti, teatage mõlemast küljest. Distsipliin ei ole edasimineku takistamine. See on selle takistamine, et edulugu kustutaks tingimuse, mis selle võimalikuks tegi.

Uurimuslikud mõõtmised vajavad oma ausust. Öelge, et valim on väike, et keskkond on esialgne, et töökoormus on sünteetiline, et tulemust ei ole iseseisvalt korratud või et kvaliteedikontroll on puudulik. Need ei ole nõrkused, mida peita kuni viimistletud väljalaskeni. Need on teave, mis aitab lugejal otsustada, mida edasi teha. Euroopa insenerikultuur ei pea teesklema, et iga test on lõplik otsus. See peab lõpetama küsimuse vastatuks nimetamise enne, kui test on läbi loetud.

Mõlemad viisid saavad kasu tulemuste arhiivist. Hoidke vanad määratlused, konfiguratsioonid ja tulemused tuvastatavatena. Registreerige asendamine, mitte kustutage minevikku. Muudetud võrdlusnäitaja võib olla õige võrdlusnäitaja muudetud teenuse jaoks, kuid seda ei saa kasutada vana tulemuse tähenduse ümberkirjutamiseks. Versiooniajalugu on nimetaja mälu.

Meie väike märkus

Dweve'is kirjeldame Core'i täitmisraku ja determinismilepinguga. Selle sõnavara kasulik osa ei ole tootenimi. See on nõue, et operatsioon kannab oma numbrilist esitust, taustsüsteemi, käskude komplekti, edastuspoliitikat ja taasesitusasendit osana hinnatavast teekonnast. See on sama harjumus, mida võrdlusnäitaja vajab: hoidke tingimused tulemuse küljes, mitte kirjeldage jõudlust nii, nagu see hõljuks süsteemi kohal.

See on väike disainimärkus, mitte väide välise juurutuse või mõõdetud tulemuse kohta. Laiem õppetund ei sõltu Dweve'ist. Olgu süsteem avalik statistiline teenus, tööstuslik kontroller, keeletööriist või uurimisprototüüp, number teenib usalduse, nimetades oma töö ja piirid. Meie enda dokumentatsioon on lihtsalt üks koht, kus proovime seda piiri selgesõnaliseks teha.

Nimetaja on osa, mis reisib

Võrdlusnäitaja pealkirja on lihtne kopeerida. Nimetajat on raskem kaasas kanda, mistõttu jäetakse see sageli maha. Ostja kopeerib läbilaskevõime arvu äriplaani. Regulaator näeb toimikus täpsusskoori. Insener võrdleb kahte diagrammi erinevatest töökoormustest. Ajakirjanik kordab protsenti ilma populatsioonita. Iga lugeja saab numbri, mis on kaotanud lepingu, mis selle tähenduslikuks tegi.

Remont pole keeruline, kuigi see nõuab distsipliini. Nimetage küsimus. Määratlege töö. Esitage ulatus ja välistused. Tuvastage süsteem ja versioonid. Valige mõõdik, mis vastab teenusele. Hoidke lähtetasemel. Mõõtke varieerumist. Avaldage meetod ja tõendid. Märkige, mis jääb teadmata. Andke väitele omanik ja põhjus selle uuesti käivitamiseks. Kui tulemus ei toeta laia väidet, tehke väide kitsamaks.

Nii saab Euroopa vastu seista demonstratsiooniteatrile, muutumata ambitsioonide suhtes allergiliseks. Avalik asutus saab osta uut võimekust ja nõuda siiski võrdlusuuringut, mis austab teenust. Teadusmeeskond saab avaldada põneva tulemuse ja esitada siiski töökoormuse, mis selle tekitas. Tarnija saab näidata kiiret teed ja öelda siiski, kus tee lõpeb. Aus ulatus ei ole pidur innovatsioonile. See on teekate, mis laseb kõigil teistel sõita.

Võrdlusuuring on leping nimetajaga, sest nimetaja ütleb meile, mida tegelikult tehti. Hoidke seda numbri kõrval. Tulemus muutub vähem maagiliseks, paremini võrreldavaks ja palju kasulikumaks. See on õiglane vahetus. Süsteemid, millele inimesed peavad lootma, väärivad numbreid, mis peavad vastu ka aeglasele lugemisele.

Kui mõõdik liigub maailmade vahel

Võrdlusuuringu numbrid lahkuvad sageli meeskonnast, kes need mõõtis, ja sisenevad teistsugusesse otsustussüsteemi. Teadlane avaldab tabeli. Tootemeeskond muudab ühe rea eesmärgiks. Hangete osakond muudab eesmärgi lepinguks. Operatsiooniosakond muudab lepingu teenusetaseme ootuseks. Iga samm muudab seda, mida numbrilt oodatakse. Algne nimetaja võib artiklis või hoidlas endiselt olemas olla, kuid see on otsusest sotsiaalselt kaugeks muutunud. Mõõdik vajab tõlkemärkust alati, kui see selle piiri ületab.

Tõlkemärkus võib olla lihtne. See tulemus puudutab komponentide läbilaskevõimet, mitte lõpetatud juhtumeid. See täpsusnäitaja kasutab fikseeritud märgendikomplekti, mitte reaalseid tulemusi. See energiaväärtus välistab andmekeskuse jahutuse piiri. See lähtetase on referentsrakendus, mitte olemasolev teenus. Need laused takistavad kasulikul mõõtmisel muutumast eksitavaks lubaduseks. Need muudavad ka erimeelsused lihtsamaks. Lugeja saab piiri vaidlustada, selle asemel et vaielda selle üle, kas number tundub muljetavaldav.

Erinevad meeskonnad võivad teadlikult valida erinevad nimetajad. Platvormimeeskond võib hoolida tööst džauli kohta. Teenuseomanik võib hoolida lõpetatud otsustest töötatud tunni kohta. Avalik asutus võib hoolida õigetest, selgitatavatest tulemustest kindlaks määratud elanikkonna ja reageerimisaja kohta. Need ei ole vastuolulised tõed, kui igaüks on nimetatud. Probleemid algavad siis, kui kõige lihtsamal nimetajal lubatakse missiooni asemel seista. Kiireim tuum ei tee automaatselt parimat teenust, nii nagu suurim testikomplekt ei tee automaatselt kõige asjakohasemat.

Enne võrdlusuuringu uuesti kasutamist küsige, mis on liikunud: töökoormus, omanik, tagajärg või ajahorisont. Kui mõni neist on liikunud, käivitage tõlgendus uuesti, isegi kui aluseks olev number on muutumatu. Mõõtmine ei ole reliikvia, mida ruumide vahel kanda. See on suhe, mida tuleb ruumi muutumisel uuendada.

Tulemus peaks teadma, millal aeguda

Tulemustel on kasulik eluiga. Võrdlusuuring, mis on seotud mudeliversiooni, allika hetktõmmise või riistvarakonfiguratsiooniga, muutub ajalooliseks, kui need tingimused muutuvad. See ei muuda vana tulemust valeks. See muudab küsimust, millele see vastata suudab. Aruanne peaks ütlema, milline sündmus muudab väite aegunuks: uus mudel, muudetud kompilaator, uus andmejaotus, muudetud märgendireegel, riistvara väljavahetamine, poliitikamuudatus või täheldatud triivi signaal. Aegumisreegel on väike osa institutsionaalsest mälust.

Ilma aegumisreeglita kuhjuvad numbrid nagu mantlid toolile. Igaüks neist on tehniliselt endiselt olemas ja keegi ei tea, milline neist kuulub tänasesse päeva. Tulemuste register võib säilitada täieliku ajaloo, märkides samal ajal ära praeguse võrdluse, asendatud määratluse ja uuesti käivitamise põhjuse. Uuesti käivitamine on siis tavapärane hooldus, mitte kriisile reageerimine. See on eriti oluline avalike teenuste puhul, kus tulemus võib elada üle seda loonud meeskonna.

Aegumine kaitseb ka ausat edasiminekut. Kui uus töökoormus näitab, et varasem võrdlusuuring oli liiga kitsas, saab organisatsioon muudatuse avaldada, vana meetodi säilitada ja uue piiri selgitada. Tal ei ole vaja kaitsta aegunud numbrit ega teeselda, et vana numbrit pole kunagi olnud. Võrdlusuuring, mida saab kitsendada, asendada ja mõista, on kasulikum kui selline, mis peab igavesti muljetavaldav jääma.

Allikad