Еталонът е договор със знаменател
Числото, което забравя знаменателя си
Резултат от бенчмарк може да е измерен правилно и пак да отговаря на грешен въпрос. Обичайният виновник не е дефектен таймер или нечестен инженер. Той е знаменателят, който е изчезнал между тестовата среда и слайда за презентацията. „Два пъти по-бързо“ звучи като сравнение, но не казва два пъти по-бързо при каква работа, на коя машина, с кой софтуер, при какво условие за качество, спрямо кой базов резултат или за кои потребители. Премахнете тези условия и числото за производителност се превръща в лъскав фрагмент. То може да остане числено вярно. Но вече не казва на купувача или оператора какво може да очаква.
Знаменателят е работата, спрямо която е изразен резултатът. За пропускателната способност това е завършената работа и времето, за което се отчита завършването. За латентността това е дефиницията на заявката, включеният път и съвкупността от наблюдения. За точността това е обозначеното множество, правилото за обозначаване и единицата, която се оценява. За енергията това е границата на измерваната система и работата, доставена в рамките на тази граница. За разходите това е периодът на отчитане, включените ресурси и обемът на полезната работа. Един бенчмарк е честен, когато числителят и знаменателят му пътуват заедно.
Ето защо бенчмаркът е най-добре да се третира като договор. Договорът назовава въпроса, натоварването, обхвата, хардуера и софтуера, показателя, базовия резултат, неопределеността и метода, по който друга страна би могла да провери резултата. Един договор може да е тесен. Може да е проучвателен. Може да е полезен само за едно внедряване. Това, което не може да бъде, е впечатляващо число, чиито условия са оставени читателят да отгатва. Отгатването е лош начин за разпределяне на публични средства и още по-лош начин за проектиране на услуга, която някой друг трябва да поддържа жив.
Европейският навик да се записват определения понякога е осмиван като бюрокрация. В измервателната работа определенията са частта, която спира бюрокрацията да се превърне във фолклор. Таблицата на бенчмарка не е административно приложение към резултата. Тя е личната карта на резултата.
Прочетете единицата, преди заглавието
Започнете с единицата, но не спирайте дотук. Заявки в секунда, токени в секунда, милисекунди, джаули на заявка, евро на хиляда записа и процентни пункта ви казват нещо. Нито една от тях не ви казва какво е било поискано от системата. Резултат от 100 заявки в секунда може да описва малки кеширани заявки или големи некeширани заявки, които включват извличане, валидиране и човешко предаване. Латентност от 20 милисекунди може да покрива едно ядро или цял път на вземане на решение. Единицата е врата. Натоварването е стаята зад нея.
Да предположим, че слайд за обществена поръчка казва, че нова услуга е с 40 процента по-бърза от съществуващата. Изречението все още не е доказателство. То се нуждае поне от операцията, която се измерва, размера и разпределението на входа, работата, изключена от часовника, паралелността, състоянието на загряване, версиите на софтуера, хардуера и базовата конфигурация. Нужно е и условието за качество. Ако по-бързият път връща по-малко валидни резултати, отхвърля дълги входове или пропуска скъпа стъпка за проверка, числителят е бил направен по-малък чрез промяна на работата.
Това не е искане за огромна таблица, преди някой да може да говори. Това е искане да се идентифицират няколкото полета, които променят значението на твърдението. Малък бенчмарк за парсер може да се нуждае от формата на записа, източника на входа, политиката за валидиране, компилатора и процесора. Бенчмарк за извод може да се нуждае от модела, точността, партидата, сценария, целта за качество и границата на мощността. Опашка в публичния сектор може да се нуждае от дефиницията на случая, служебния часовник, правилото за маршрутизиране и пътя за ескалация. Полетата са различни. Задължението да ги назовете не е.
Тук има полезна дисциплина: резултатът да се запише като изречение, което би устояло на втори читател. „При това натоварване и това изискване за качество, на тази система и версия, измерената стойност беше това, с това отклонение.“ Ако изречението не може да се завърши без думи като типичен, най-добър, близък до реалния или представителен, методът не е завършен. Тези думи могат да са валидни, но се нуждаят от оперативно определение, не от топъл тон.
Обхватът е част от резултата
Обхватът отговаря на прост въпрос: какво покрива този резултат и какво остава извън рамката? При оценката на машинно обучение обхватът включва задачата, набора от данни, разделението, езика, дължината на входа, сценария на работа и разрешените избори за реализация. При софтуерна услуга той включва маршрута, хранилищата за данни, мрежата, кеша и работата, която екип надолу по веригата извършва, след като измерената крайна точка върне отговор. Резултат, измерен на едно ниво, не бива тихо да се превърне в обещание за цялата услуга.
MLCommons прави това видимо в документацията си за MLPerf Inference. Ръководството за подаване разделя типовете системи за центрове за данни и за периферия, изброява сценарии като офлайн, сървърен, интерактивен, единичен поток и многопоточен, и разграничава затворено деление от отворено деление. Затвореното деление е предназначено за сравнение при равни условия с еднакъв модел и референтна настройка. Отвореното деление позволява избори като преобучаване или замяна на модела. Нито едното не е универсално правилното деление. Те отговарят на различни въпроси. Заглавие, което ги смесва, не е широк поглед. То е категорийна грешка с отлична типография.
Същата документация показва защо един бенчмарк се нуждае от изрична страна за качество. Изброен запис за ResNet50 посочва валидационния набор ImageNet-2012, неговите размери за набор от данни и списък с примерни заявки, референтна точност и ограничение за латентност на сървъра. За изброения запис за ResNet50 страницата дава валидационен набор от 50 000 изображения, списък с примерни заявки от 1 024, референтна точност от 76,46 процента и ограничение за латентност на сървъра от 15 ms. Тези полета не са дреболии за хора, които обичат да четат правила. Те обясняват какво е било позволено да означава отчетената скорост. Сменете набора от данни, сценария или изискването за качество и сравнението се е променило, дори ако името на модела изглежда познато.
Европейски купувач трябва да подозира обхват, който се подразбира от етикета на продукта. „AI платформа“, „ускорител“ и „клас за предприятия“ не определят работата. Система, която е отлична при ограничена операция, може да е точно това, от което се нуждае една услуга. Система, която твърди, че покрива всичко, може да е измерила почти нищо, което прилича на услугата. Тясната истина е по-здравословна от универсалната мъгла.
Покритието променя смисъла
Покритието не е бележка под линия за това дали тестовият набор е бил голям. То описва чии случаи и кои ситуации влизат в измерването. Един бенчмарк може да обхваща много примери от едно тясно разпределение и пак да казва малко за ръбовете, които имат значение в експлоатация. Обратно, малък, внимателно подбран набор може да разкрие важен режим на отказ, без да подкрепя общо твърдение за производителност. Изборът е дизайнерско решение. Той трябва да бъде заявен като такъв.
Рамката на ОИСР за характеризиране на инструментите за оценка на ИИ е полезна, защото отказва да сведе оценката до един резултат. Тя предлага 18 аспекта, включително покритие, цел, реализъм, валидност, надеждност, прозрачност и условията, при които резултатите могат да бъдат интерпретирани. Покритието пита дали оценката представя това, което възнамерява да измери. Целта разграничава бенчмарк, предназначен за изследвания, от такъв, предназначен за съответствие или друга употреба. Реализмът пита дали средата е играчка проблем, симулирана или лабораторна среда, или реален живот. Тези разграничения не правят бенчмарка по-слаб. Те правят твърдението му четливо.
Покритието включва и случаите, които оценката изключва. Услуга може да отчита средна латентност след премахване на таймаути. Класификатор може да отчита точност след отпадане на двусмислени етикети. Система за извличане може да брои само заявки с поне един релевантен документ. Конвейер за изображения може да пропуска повредени файлове. Всяко изключване може да бъде защитимо. Резултатът трябва да казва какво е премахнато и защо. В противен случай знаменателят тихо се превръща в списък от случаи, които са били удобни за довършване.
Тук знаменателят става политически, дори преди някой да използва думата политика. Включеното население получава ползата да бъде измерено. Изключеното население получава история за система, която може да не го описва. Европейските публични институции вече знаят това от официалната статистика. Европейският статистически кодекс на Евростат определя 16 принципа и 84 показателя за институционалната среда, процесите и резултатите. Неговата рамка за осигуряване на качеството предоставя методи и инструменти, докато докладите за качеството казват на потребителите как са събрани и валидирани данните. Посланието за ИИ не е, че всеки модел трябва да стане статистическа служба. То е, че число, предназначено за публични решения, се нуждае от видима история за производство и качество.
Точността не е една врата
Твърденията за производителност често съчетават скорост с едно число за качество и след това третират двойката като пълна. Качеството обикновено е семейство от въпроси. Отговаря ли резултатът на дефиницията на задачата? Запазва ли необходимите ограничения? Проваля ли се безопасно, когато липсват доказателства? Държи ли се приемливо върху съответното население? Остава ли в границата на качеството, докато системата е под товар? Бързият отговор, който не успява на задачата, не е по-бързо решение. Това е различно натоварване, носещо същото съществително.
Структурата на MLPerf е поучителна, защото нейните изпълнения за производителност стоят до валидиране на точността и специфични за модела изисквания. Ръководството за подаване казва на участниците да идентифицират дивизията, типа система и сценария, да стартират предвидения бенчмарк, да валидират точността спрямо прагове и след това да подготвят проверено подаване. Страницата на бенчмарка изброява референтна точност и условия за латентност или пропускателна способност за всяка задача. Разделението е практично. То не позволява на система да спечели колоната за производителност, като тихо губи задачата.
Самата точност се нуждае от знаменател. „Деветдесет и осем процента точност“ може да означава процент от записи, токени, изображения, заявки или решения. Може да използва микро или макро осредняване. Може да брои въздържанието като грешка, като безопасен отказ или като неизмерен резултат. Може да сравнява с етикети, създадени от един или няколко рецензенти. Картата на бенчмарка трябва да посочва единицата, правилото за етикетиране, агрегирането, увереността или вариацията и всеки праг, който превръща измерването в решение за пускане.
Не използвайте качествен показател като декоративно разрешително. Един модел може да отговаря на публикуван праг и въпреки това да е неподходящ за конкретна услуга, защото задачата, целевата група или профилът на вредите се различават. Обратно, по-нисък обобщен резултат може да е приемлив за инструмент за чернова, който оставя човека като автор, докато същият резултат е неприемлив за автоматична бариера. Качеството е отношение между резултата, целта и последствията.
Времето не е едно число
Закъснението често се представя така, сякаш системата има една скорост. Реалните системи имат разпределение. Първата заявка може да плати разходите за стартиране. Кешът може да промени следващите заявки. Едновременните потребители може да се конкурират за памет или за връзка с базата данни. Дългият вход може да поеме по различен път от краткия. Средната стойност може да се подобри, докато опашката се влоши. Ако опашката е мястото, където услугата пропуска срока си, средната стойност е разсейване с единица.
Полезният доклад за закъснение казва какво е измерено и как са обобщени наблюденията. Може да включва медиана, горни персентили, процент на изчакване и брой заявки. Трябва да посочва дали заявките за загряване са изключени, дали повторните опити са включени, и дали времето за опашка или мрежа принадлежи към измерения път. Тези избори не са взаимозаменяеми. Ориентирът за компонент може да е ценен, но не трябва да се представя като поведение от край до край.
Пропускателната способност има подобен капан. Висок процент може да се постигне чрез групова обработка на работа, увеличаване на паралелността или смекчаване на изискване за качество. Това може да е точно правилното за офлайн задача. Може да е безполезно за интерактивна услуга, която трябва да отговори на всяка заявка в срок. Ориентирът трябва да посочи сценария и работната точка, след което да обясни какво би се случило, когато търсенето се отдалечи от нея. Няма срам в тясна работна точка. Има срам в претенцията, че тя е цялата карта.
Времето има и човешка страна. Услуга, която отговаря бързо, но създава повече работа по преглед, корекция или обжалване, може да е по-бавна от гледна точка на институцията. Ориентир, който спира часовника преди предаването, може да направи измерената система да изглежда бърза, докато действителната услуга трупа опашка. Знаменателят трябва да следва работата, докато зададеният въпрос получи отговор. В противен случай хронометърът измерва остров.
Хардуерът и софтуерът са част от числителя
„На сървър“ не е възпроизводима среда. Поколението на процесора, наборът от инструкции, ускорителят, паметта, хранилището, термичното състояние, ограничението на мощността, операционната система, драйверът, компилаторът, средата за изпълнение, библиотеката и конфигурацията могат да променят резултата. Същото важи и за формата на модела, настройката за квантуване, размера на партидата, избора на ядро или политиката за нишки. Ориентирът не трябва да изброява всеки кабел. Той трябва да посочи частите, които могат да променят измерването.
MLPerf нарича пълната измерена конфигурация система под тест и организира резултатите по тип система и категория наличност. Този речник е полезен и извън MLPerf. Системата под тест има граница. Границата показва кои хардуер и софтуер са включени, кои услуги са външни и коя работа е пропусната. Стойността на мощността, измерена на контакта, има различно значение от стойност, която отчита само ускорител. Закъснението, измерено вътре в ядрото, има различно значение от това, което включва планирането на заявки.
Версиите имат значение, защото ориентирът е сравнение между състояния, а не вечно свойство на име на продукт. Запишете версията на модела или приложението, версиите на зависимостите, флаговете на компилатора, драйвера и фърмуера, където те влияят на резултата. Запишете конфигурацията, която е избрала бекенд или точност. Ако средата за изпълнение избере различно ядро на друга машина, това е част от резултата, а не детайл от внедряването, който да се прикрие по-късно.
Разкриването на хардуера не е покана да превърнете публикация в блог в каталог с части. То е начин да се предотврати фалшива еквивалентност. Купувачът не е длъжен да се интересува от всяка инструкция, ако твърдението се отнася до цялостна услуга. Той обаче трябва да знае дали сравнението включва същата работа, същата точност, същия път на входните данни и система, която действително може да бъде получена и експлоатирана в предвидената европейска среда.
Базовите линии са обещания
Базовата линия е сравнението, което задава посока на резултата. Без нея едно число може да описва система, но не и подобрение. Базовата линия трябва да отговаря на същия въпрос при сравними условия. Ако новият път използва по-нов компилатор, различно разпределение на входните данни или различна цел за качество, резултатът може все още да е интересен, но сравнението вече не е чисто. Кажете какво се е променило. Читателят тогава може да прецени дали разликата е полезна.
Изборът на базова линия е акт на интерпретация. Сравнете с действащата система, която потребителите реално използват, с референтна реализация, с предишна версия или с теоретична граница, и ще научите различни неща. Нова система може да е по-добра от референтната и по-лоша от услугата, която замества. Може да е по-бърза при чист тест и по-бавна, след като се включат валидирането и съхранението. Бенчмаркът трябва да посочи базовата линия и да обясни защо тя отговаря на оперативния въпрос.
Сдвоените изпълнения често са по-информативни от единична победна обиколка. Задръжте натоварването и дефиницията за оценка фиксирани, променете един съществен фактор и запишете разликата. Ако няколко фактора се променят заедно, опишете сравнението като пакет, вместо да приписвате целия ефект на един компонент. Това звучи очевидно, докато ъпгрейд, обновяване на данните и нова политика за кеша не пристигнат в една и съща версия. Тогава графиката има една стрелка и три възможни причини, което е малка загадка, за която никой не е предвидил бюджет.
Базовата линия също има срок на годност. Поток от данни, доставчик, модел, политика или хардуерна платформа могат да се променят. Сравнението остава валидно за версиите и периода, в които е тествано. Не трябва да се преизползва като текуща гаранция без проверка на договора. Точно тук историята на версиите си заслужава. Отхвърлен резултат не е провал. Той е историческо твърдение, чиито условия трябва да останат видими.
Несигурността не е извинение
Всяко измерване съдържа вариация. Част от вариацията идва от системата, част от натоварването и част от процеса на измерване. Повторните изпълнения могат да я разкрият, но повторението само по себе си не обяснява причината. Топъл кеш може да е стабилен. Шумен съсед може да не е. Малък набор за оценка може да произведе широк диапазон от правдоподобни резултати. По-голям набор може да намали шума от извадката, но да остави пристрастената съвкупност незасегната. Несигурността казва на читателя доколко резултатът може безопасно да се пренесе.
Докладвайте несигурността във форма, подходяща за твърдението. Тя може да бъде диапазон при повторни изпълнения, доверителен интервал, стандартна грешка, разпределение на латентността, анализ на чувствителността или списък с известни ограничения. Не добавяйте доверителен интервал, защото таблицата изглежда самотна. Посочете какво е повторено, какво е задържано фиксирано и какво интервалът представлява и какво не представлява. Статистическият език не е магия. Той е договор за вариацията.
Съществува втори вид несигурност, която числата не могат да премахнат: несигурност дали измерването представлява предвидената услуга. Резултат може да има минимална вариация между изпълненията и слабо покритие в реалния свят. Един бенчмарк може да е напълно възпроизводим в лаборатория, но да пропуска езиците, входните формати, работните смени или последствията от отказ в реалното внедряване. Ниският шум при измерването не създава валидност. Той просто прави грешния въпрос да получава по-последователен отговор.
Следователно несигурността трябва да стои до самото твърдение, а не в бележка под линия в долната част. Ако прагът е близо до измерената граница, това има значение. Ако резултатът се промени съществено при различен набор от входни данни, това има значение. Ако енергийната граница изключва охлаждането или преноса на данни, това има значение. Честното изречение може да звучи по-малко триумфално, но дава на вземащия решение нещо по-добро от оптимизъм: място, където да постави предпазливостта.
Възпроизвеждането е верига, а не бутон за изтегляне
Възпроизводимостта често се свежда до публикуване на код. Кодът има значение. Но той е само едно звено от веригата. Втората страна се нуждае също от работното натоварване или от законосъобразно негово описание, версията на данните, конфигурацията, средата, командата или тестовата среда, политиката за случайните състояния, правилото за очаквания резултат, файла с резултатите и метода, използван за преценка дали изпълнението съвпада. Ако липсва едно звено, втората страна може да възпроизведе подобен експеримент, а не точно докладвания.
Веригата трябва да разграничава точното повторение от независимото възпроизвеждане. Точното повторение използва уловения артефакт, състоянието, входните данни, конфигурацията и пътя на изпълнение, за да провери дали същото изпълнение може да бъде реконструирано. Независимото възпроизвеждане използва отделно подготвена среда, за да тества дали резултатът оцелява извън оригиналната машина или екип. И двете са ценни. Те отговарят на различни въпроси. Байт за байт идентичен резултат върху уловени входни данни доказва силно твърдение за идентичност на това изпълнение. Той не доказва, че живият свят ще остане непроменен.
Оценъчната рамка на ОИСР улеснява виждането на това разграничение, като третира целта, реализма, обхвата и надеждността като отделни аспекти. Една оценка може да е отлична за регресионно тестване и слаба за оценка на ефективността на услугата в реално време. Тя може да е полезна за изследвания и неподходяща за съответствие. Възпроизвеждането не заличава целта. То помага на читателя да провери твърдението, което методът действително подкрепя.
За данни, които не могат да бъдат публикувани, публикувайте границата и пътя. Опишете съвкупността, процеса на вземане на извадка, метода на етикетиране, правилата за изключване и проверките за валидиране. Осигурете безопасен пакет за възпроизвеждане, когато е възможно, и обяснете какво остава защитено. „Данните са поверителни“ е легитимна граница, а не завършен метод. Читателят все пак трябва да може да разбере какво е измерено и защо резултатът трябва или не трябва да бъде обобщаван.
Публичните институции трябва да откажат демонстрационен театър
Публичните институции не трябва да отхвърлят бенчмарковете. Те трябва да отказват бенчмаркове, които не могат да заявят своя договор. Една полирана демонстрация може да помогне на комисия да разбере една възможност. Тя не може да замести доказателствата за услугата, която институцията трябва да поддържа, за хората, които обслужва, и за грешките, които трябва да поправи. Разликата има значение, защото демонстрацията е оптимизирана за кратък контакт, докато публичната услуга се оценява през сезони, смени на персонала, жалби, поддръжка и закон.
Преди да купите, поискайте от доставчика да определи натоварването на езика на услугата. Какво влиза в системата? Какво се измерва? Какво е изключено? Кое правило за качество трябва да важи? Коя човешка роля преглежда резултата? Как се открива отклонението? Как институцията може да експортира своите доказателства? Какво се случва, когато моделът, източникът, доставчикът или политиката се променят? С коя версия се прави сравнението? Какъв е пътят за връщане назад? Доставчикът може да отговори на някои въпроси с договор, на някои с тест, а на някои с честна граница. Тази смесица е по-здравословна от отговор, съставен изцяло от прилагателни.
Актът за изкуствения интелект на ЕС изразява това с правен език за системите с висок риск. Член 15 изисква подходящо ниво на точност, устойчивост и киберсигурност, с последователно представяне в тези отношения през целия жизнен цикъл. Един бенчмарк не може сам да установи цялото правно задължение. Той може да подкрепи част от доказателствата, ако обхватът, условията за качество и позицията в жизнения цикъл са ясни. Третирането на един резултат като съответствие би било друга грешка в знаменателя. Законът назовава резултата; инженерството трябва да покаже пътя.
Обществените поръчки трябва също да попитат кой притежава бенчмарка след възлагането. Тестово изпълнение, подготвено от доставчика, може да е полезно, но институцията се нуждае от достатъчно информация, за да наблюдава системата в собствената си среда. Тя се нуждае от базова линия, която може да се изпълни отново при промяна на версията, от път за преглед, когато резултатите се променят, и от запис на решенията, взети относно приемливото представяне. В противен случай първият бенчмарк е приемен изпит, а производствената система получава правото да завърши без допълнителни въпроси.
Направете картата на бенчмарка достатъчно малка, за да се използва
Дългите методи могат да бъдат необходими. Те не винаги са първото нещо, от което читателят има нужда. Картата на бенчмарка е компактен указател към договора. Тя може да стои до резултат в доклад, регистър за оценка или досие за обществена поръчка. Картата трябва да посочва въпроса, натоварването, обхвата, системата, показателя, изискването за качество, базовата линия, неопределеността, пътя за възпроизвеждане, собственика и срока на валидност или тригера за промяна. Подробният метод може да стои зад нея. Картата не позволява на твърдението да пътува само.
Добрите карти са подбрани, а не претрупани. Те извеждат полетата, които могат да променят тълкуването, и след това водят към пакета с доказателства. Карта за латентност може да изведе размера на входа, паралелността, персентила, загряването, версията и правилото за изчакване. Карта за енергия може да изведе границата на системата, натоварването, измервателния инструмент, продължителността и изключената инфраструктура. Карта за точност може да изведе популацията, правилото за етикетиране, агрегирането, третирането на въздържанието и тежестта на грешката. Общата форма не е фиксиран шаблон. Тя е обещание, че читателят може да намери знаменателя.
Картата трябва да отбелязва епистемичния статус. Стойността измерена ли е, оценена ли е, очаквана ли е, предложена ли е или илюстративна? Базовата линия актуална ли е? Оценъчният пакет подготвен ли е, но все още не е изпълнен? Защитени ли са резултатите, защото тестовият материал съдържа лични данни? Тези етикети предотвратяват объркването на метод с резултат. Те също позволяват на организацията да публикува напредък, без да фабрикува успех. Подготвен тест е полезна информация. Той не е доказателство, че системата го е преминала.
Накрая дайте на резултата собственик и правило за промяна. Резултат без собственик се изражда в слайд. Резултат без правило за промяна остава на стената, след като натоварването се е преместило. Собственикът не е длъжен да защитава числото завинаги. Но е длъжен да каже кога твърдението трябва да се стартира отново, да се оттегли или да се стесни. Измерването става част от операциите, когато някой има правомощието да го поддържа честно.
Два честни начина за публикуване на резултат
Има два често срещани режима на публикуване. Първият е строго сравнение. То фиксира задачата, данните, правилото за качество, границата на системата и базовата линия, така че читателят да може да сравнява алтернативи. Вторият е изследователско измерване. То пита какво се случва, когато дизайнът, натоварването или средата се променят, и докладва наблюденията с техните ограничения. Изследователската работа може да е ценна, преди да съществува строг бенчмарк. Но не трябва да заема езика на резултат за съответствие.
Строгите сравнения са взискателни, защото правят разликите видими. Ако екип промени модела и хардуера едновременно, може да е невъзможно да се припише резултатът. Ако ново натоварване е по-реалистично, но вече не съвпада с базовата линия, твърдението трябва да се преформулира като ново измерване. Ако оптимизацията подобрява скоростта, но променя качеството на изхода, докладвайте и двете страни. Дисциплината не е да се спира напредъкът. Тя е да не се позволява историята за напредъка да заличава условието, което го е направило възможен.
Изследователските измервания изискват собствена честност. Кажете, че извадката е малка, че средата е временна, че натоварването е синтетично, че резултатът не е независимо възпроизведен или че проверката на качеството е непълна. Това не са слабости, които да се крият до полирано издание. Това е информацията, която помага на читателя да реши какво да прави по-нататък. Европейската инженерна култура не трябва да се преструва, че всеки тест е окончателна присъда. Тя трябва да спре да нарича въпроса отговорен, преди тестът да е прочетен.
И двата режима се възползват от архив на резултатите. Пазете старите дефиниции, конфигурации и резултати разпознаваеми. Записвайте замяната, вместо да изтривате миналото. Променен бенчмарк може да е правилният бенчмарк за променена услуга, но не може да се използва, за да се пренапише значението на стария резултат. Историята на версиите е паметта на знаменателя.
Нашата кратка бележка
В Dweve описваме Core с изпълнителна клетка и договор за детерминизъм. Полезната част от този речник не е името на продукта. Тя е настояването, че една операция носи своето числово представяне, бекенд, набор от инструкции, политика за разпределение и позиция за повторение като част от оценявания път. Това е същият навик, от който се нуждае един бенчмарк: дръжте условията прикрепени към резултата, вместо да описвате производителността, сякаш тя се носи над системата.
Това е кратка дизайнерска бележка, а не твърдение за външно внедряване или измерен резултат. По-широкият урок не зависи от Dweve. Независимо дали системата е публична статистическа услуга, индустриален контролер, езиков инструмент или изследователски прототип, едно число печели доверие, като назовава своята работа и своите ограничения. Нашата собствена документация е просто едно място, където се опитваме да направим тази граница изрична.
Знаменателят е частта, която пътува
Заглавието на бенчмарк е лесно за копиране. Знаменателят е по-труден за пренасяне, поради което често остава назад. Купувач копира цифра за пропускателна способност в бизнес казус. Регулатор вижда резултат за точност в досие. Инженер сравнява две диаграми от различни натоварвания. Журналист повтаря процент без съвкупността. Всеки читател получава число, което е загубило договора, който го е правил смислен.
Ремонтът не е сложен, макар че изисква дисциплина. Назовете въпроса. Определете работата. Посочете обхвата и изключенията. Идентифицирайте системата и версиите. Изберете показател, който съответства на услугата. Поддържайте базова линия. Измервайте отклоненията. Публикувайте метода и доказателствата. Отбележете какво остава неизвестно. Дайте на твърдението собственик и причина да бъде повторено. Ако резултатът не може да подкрепи широко твърдение, направете твърдението по-тясно.
Ето как Европа може да устои на демонстрационния театър, без да стане алергична към амбицията. Публична институция може да закупи нови възможности и пак да изисква бенчмарк, който зачита услугата. Изследователски екип може да публикува вълнуващ резултат и пак да посочи натоварването, което го е произвело. Доставчик може да покаже бърз път и пак да каже къде свършва пътят. Честният обхват не е спирачка за иновациите. Той е пътната настилка, която позволява на всеки друг да шофира.
Бенчмаркът е договор със знаменател, защото знаменателят ни казва какво всъщност е направено. Дръжте го до числото. Резултатът ще стане по-малко магически, по-сравним и много по-полезен. Това е честен размен. Системите, на които хората трябва да разчитат, заслужават числа, които могат да оцелеят при бавно четене.
Когато показател пътува между светове
Бенчмарк числата често напускат екипа, който ги е измерил, и влизат в различна система за вземане на решения. Изследовател публикува таблица. Продуктов екип превръща един ред в цел. Снабдяването превръща целта в договор. Операциите превръщат договора в очакване за ниво на услугата. Всяка стъпка променя това, което числото трябва да прави. Първоначалният знаменател може все още да присъства в статията или хранилището, но е станал социално отдалечен от решението. Показателят се нуждае от бележка за превод, когатото премине тази граница.
Бележката за превод може да бъде проста. Този резултат се отнася до пропускателната способност на компонента, а не до завършени случаи. Тази точност използва фиксиран набор от етикети, а не реални резултати. Тази стойност за енергия изключва охлаждането на центъра за данни. Тази базова линия е референтна реализация, а не действащата услуга. Тези изречения спират полезното измерване да се превърне в подвеждащо обещание. Те също улесняват несъгласието. Читателят може да оспори границата, вместо да спори дали числото изглежда впечатляващо.
Различните екипи може умишлено да изберат различни знаменатели. Платформен екип може да се интересува от работа на джаул. Собственикът на услуга може да се интересува от завършени решения на час работа. Публичен орган може да се интересува от правилни, обясними резултати за определена популация и време за отговор. Това не са конкуриращи се истини, ако всяка е наименувана. Проблемите започват, когато най-лесният знаменател застане на мястото на мисията. Най-бързото ядро не прави автоматично най-добрата услуга, точно както най-големият тестов набор не прави автоматично най-подходящия.
Преди бенчмаркът да бъде използван повторно, попитайте какво се е променило: натоварването, собственикът, последствието или времевият хоризонт. Ако някое от тях се е променило, преинтерпретирайте, дори когато основното число е непроменено. Измерването не е реликва, която да се носи между стаи. То е връзка, която трябва да бъде подновена, когато стаята се промени.
Резултатът трябва да знае кога да изтече
Резултатите имат полезен живот. Бенчмарк, обвързан с версия на модел, моментна снимка на източник или хардуерна конфигурация, става исторически, когато тези условия се променят. Това не прави старият резултат неверен. Променя въпроса, на който може да отговори. Докладът трябва да каже кое събитие прави твърдението остаряло: нов модел, променен компилатор, ново разпределение на данните, преразгледано правило за етикети, подмяна на хардуер, промяна в политиката или наблюдаван сигнал за отклонение. Правилото за изтичане е малко парче институционална памет.
Без правило за изтичане числата се трупат като палта на стол. Всяко от тях технически все още е там и никой не знае кое принадлежи на днешния ден. Регистърът на резултатите може да съхрани пълната история, като същевременно отбелязва текущото сравнение, заменената дефиниция и причината за повторното изпълнение. Самото повторно изпълнение тогава е обичайна поддръжка, а не реакция при криза. Това е особено важно за обществените услуги, където даден резултат може да надживее екипа, който го е създал.
Изтичането също така защитава честния напредък. Ако ново натоварване разкрие, че по-ранен показател е бил твърде тесен, организацията може да публикува промяната, да запази стария метод и да обясни новата граница. Не е нужно да защитава остаряло число или да се преструва, че старото число никога не е съществувало. Показател, който може да бъде стеснен, заменен и разбран, е по-полезен от такъв, който трябва да остане впечатляващ завинаги.
Източници
- Рамка за характеризиране на инструментите за оценка на ефективността на ИИ, ОИСР, „ИИ и бъдещето на уменията“, том 2. Използвана е рамката на главата с 18 аспекта, включително обхват, цел, реализъм, валидност, надеждност и прозрачност.
- Изграждане на рамка за измерване на способностите на ИИ, ОИСР, „ИИ и бъдещето на уменията“. Използвани са основаната на доказателства и предпазлива рамка за измерване в главата и ограниченията на текущия обхват на показателите.
- Европейски кодекс на статистическата практика, Евростат. Използвани са 16-те принципа и 84-те показателя за Европейската статистическа система.
- Рамка за осигуряване на качеството, Евростат. Използвани са методите, инструментите и ролята на рамката за добри практики при прилагането на Кодекса на практиката.
- Политика за качеството на Евростат, Евростат. Използвани са четирите нива на осигуряване на качеството и ролята на докладите за качество и метаданни.
- Ръководство за подаване на резултати от MLPerf Inference, MLCommons. Използвани са типовете системи, сценариите, категориите, проверката на точността и стъпките за подаване.
- Документация за показателите на MLPerf Inference, MLCommons. Използвани са публикуваните полета и примери за показатели, включително условията за набор от данни, качество и латентност.
- Работна група за MLPerf Inference, MLCommons. Използвани са целта за честни и представителни показатели за инференция и предизвикателството за възпроизводимост при различни хардуер и софтуер.
- Регламент (ЕС) 2024/1689, Законът за изкуствения интелект, EUR-Lex. Използван е член 15 относно точността, устойчивостта, киберсигурността и последователността през целия жизнен цикъл.
- Dweve Core, Dweve. Публичните дефиниции на изпълнителна клетка и договора за детерминизъм подкрепят само кратката, разкрита бележка за Dweve.