The case for smaller, stricter models
Моделът, който знаеше твърде много
Първият предупредителен знак не беше срив. Сривовете поне са честни. Предупредителният знак беше красив отговор на грешен въпрос. Екип беше изградил вътрешен асистент за техническа поддръжка. Той можеше да чете ръководства за продукти, история на билети, бележки към версии и малък пакет от политики, който обясняваше какво е позволено на агентите да обещават на клиентите. Моделът беше голям, плавен и достатъчно уверен, за да накара една зала за срещи да изглежда временно модерна.
По време на пилотния период той отговаряше добре на общи въпроси. Обобщаваше дълги билети. Превеждаше гневната клиентска проза в нещо използваемо. Откриваше скрити връзки между симптоми и предишни корекции. Тогава пристигна рутинен въпрос за гаранция. Правилният отговор зависеше от три тесни факта: регион на продукта, канал на покупка и версия на фърмуера. Моделът намери правдоподобен параграф от политиката, пренебрегна тихо изключение в бележките към версията и написа отговор, който звучеше така, сякаш някой беше изгладил истината, докато не изглеждаше почтена. Никой не беше поискал поезия. Те имаха нужда от ограничено решение.
Поправката не беше да се направи моделът по-голям. Поправката беше да се направи част от системата по-малка и по-строга. Малък класификатор определяше гаранционния път. Ограничен извличащ компонент изваждаше трите необходими факта. Проверка по правила отказваше случая, ако липсваше някой факт. Големият модел все още помагаше да се напише крайната бележка за хора, но вече не притежаваше решението. Резултатът беше по-малко бляскав и много по-добър. Това е често срещан модел. Широкият модел е впечатляващ, докато работата не изисква компонент, който може да каже точно какво е видял, точно какво е решил и точно кога отказва да продължи.
Аргументът за по-малки, по-строги модели започва оттам. Не от носталгия по стар софтуер и не от морално възражение срещу мащаба. Големите модели са полезни. Те могат да покрият разхвърлян език, да преведат намерение, да обобщят доказателства и да дадат на хората по-бърз път към сложен материал. Но размерът купува широта. Той не купува автоматично контрол. Сериозните системи се нуждаят от компоненти, които могат да бъдат ограничавани, оценявани, разгръщани, наблюдавани и заменяни, без всяка инцидент да се превръща във философски семинар с логове.
Строгостта е функция, а не настроение
Строгостта звучи неприветливо, защото хората я бъркат с глупост. Строгият компонент не е такъв, който разбира по-малко без причина. Той е такъв, на който умишлено е позволено да прави по-малко неща. Може да приема само позната схема. Може да извежда само фиксиран набор от етикети. Може да чете само именуван пакет от доказателства. Може да не извиква никакви инструменти. Може да бъде принуден да върне недостатъчно доказателства, вместо да импровизира. Тези ограничения не са наказание. Те са това, което прави компонента използваем в система, в която други части разчитат на него.
Софтуерното инженерство научи този урок много преди ИИ да се превърне в категория за възлагане на обществени поръчки. Типовете са строги. Ограниченията в базите данни са строги. Крайните автомати са строги. Контролът на достъпа е строг. Платената система не пита модела да изрази чувствата си относно салдата по сметки. Тя представя парите с точни единици, проверява правомощията, записва състоянието и отказва невалидни преходи. Строгостта е причината системата да може да бъде одитирана и поправяна. Може да не харесвате съобщението за грешка, но обикновено можете да намерите реда, който я е причинил. Това не е дребен подарък.
Компонентите на ИИ се нуждаят от същата дисциплина, защото са разположени във работни потоци, които имат последствия. Класификатор, който избира между възстановяване на средства, замяна, ескалация и отказ, не бива да измисля пето състояние, наречено може би по-късно с искрено съжаление. Екстрактор, който чете договор, не бива да поставя неясна дата в поле за краен срок, само защото текстът е звучал като краен срок. Модел за извличане на информация не бива мълчаливо да пресича граница на разрешенията, защото близкият документ е изглеждал полезен. Строгостта дава на останалата част от системата нещо солидно, за което да се държи.
Полезният въпрос не е дали даден модел е интелигентен в абстрактен смисъл. Полезният въпрос е дали моделът има правилния договор за работата. Какви входни данни може да вижда. Какви изходни данни може да произвежда. Коя несигурност трябва да бъде разкрита. Кои случаи трябва да бъдат отказани. Кои доказателства трябва да пътуват с резултата. Кои показатели доказват, че работи. По-малък модел с ясен договор често побеждава по-голям модел с героична подкана, защото договорът оцелява при контакт с оперативната дейност.
Размерът купува широта, а широтата има сметка
Големите модели са обучени да бъдат универсални. Това е тяхната сила. Те могат да преминават между области, да се справят с необичайно формулирани текстове, да извеждат контекст и да произвеждат плавни отговори, дори когато входът е неравен. Ето защо те изглеждат вълшебни при проучване. Човек може да зададе въпрос свободно и пак да получи нещо смислено. Смислеността е полезна. Тя е и опасна, когато работният процес изисква тясно обвързване.
Широтата има сметка. Широкият модел има повече начини да бъде полезно грешен. Той може да внесе контекст от грешната част на разговора. Може да заглади липсващи доказателства. Може да отговори от предишни знания, когато системата е искала доказателство, основано на извличане на информация. Може да следва модел, който изглежда често срещан, вместо изключението, което се прилага. Може да направи правдоподобен мост през празнина, която е трябвало да спре процеса. Резултатът може да звучи по-добре точно защото моделът е добър в езика. Това е удобно за демонстрации и неудобно за отчетността.
По-малките модели намаляват част от тази сметка, като стесняват пространството на възможното поведение. Класификатор на области с дванадесет етикета може все още да сгреши, но грешката му е разбираема. Ограничен екстрактор може все още да пропусне поле, но пропуснатото поле може да бъде преброено. Малък модел за класиране може все още да предпочете остарели доказателства, но предпочитанието може да бъде тествано срещу познат корпус. Това са инженерни грешки, което е отлична новина. Инженерните грешки могат да бъдат измервани, планирани и поправяни. Мистичните грешки изискват повече срещи.
Има и когнитивна сметка за екипите. Един широк модел прави собствеността размита. Кой отговаря за обосновката на гаранциите, формулировката на съответствието, избора на източници, тона, отказа и ескалацията, ако всичко това живее в един промпт и една крайна точка. Когато нещо се промени, кой тестов пакет трябва да се изпълни. Когато потребител оспори даден резултат, кой компонент е виновен. Моделът се превръща в много талантлив шкаф, в който е поставено всяко институционално решение. В един момент някой отваря вратата и отвътре пада папка с политики.
По-малките модели правят грешките видими
Видимостта има значение, защото всяка производствена система в крайна сметка е система за установяване какво се е объркало. Големият модел може да се провали по начини, които трудно се разделят. Дали промптът е бил двусмислен. Дали извличането е било остаряло. Дали моделът е обобщил прекомерно. Дали инструкцията за политиката е била твърде ниско в контекста. Дали настройката за декодиране е насърчавала разнообразие там, където последователността е имала значение. Дали резултат от инструмент е пристигнал късно. Дали защитната ограда е пренаписала отговора. Всяка възможност може да е реална. Разглеждането на инцидента се превръща в детективска история с бюджетен код.
По-малките компоненти пораждат по-малки въпроси. Ако извличащият модул е пропуснал канала за покупка, проверете извличащия модул. Ако класификаторът е избрал възстановяване вместо ескалация, разгледайте маркирания набор и прага. Ако проверяващият модул не е успял да засече неподкрепено твърдение, добавете модела на твърдението и правилото за източника към оценката на проверяващия модул. Това не прави работата тривиална. Това прави работата локална. Локалното е добро. Локалното означава, че радиусът на поражението може да бъде ограничен и поправката може да бъде тествана, без да се разтърсва цялата катедрала.
Строгите резултати създават и по-добра телеметрия. Модел, който връща едно от дванадесет състояния, може да бъде проследяван във времето. Модел, който връща структурирани полета, може да отчита липсващи стойности, несъответствия, доверителни интервали и отклонения. Модел, който отказва, може да ви каже защо. Прозаичен отговор може да съдържа всичко това, но тогава всеки потребител надолу по веригата трябва да анализира изречение, написано от машина, която е била възнаградена за това, че звучи естествено. Ето как една система за мониторинг се превръща в книжен клуб.
Видимостта на грешките променя културата. Екипите спират да спорят дали ИИ е добър и започват да питат кой компонент се е провалил при какви условия. Това е по-здравословен спор. Той може да доведе до нов срез от данни, по-добър праг, по-малък набор от доказателства, по-строга схема или състояние на човешки преглед. Той превръща тревожността в поддръжка. Поддръжката е по-малко бляскава от екзистенциалния дебат, но обикновено излиза в продукция преди обяд.
Интерфейсът е половината от модела
Когато хората сравняват модели, често сравняват тегла, параметри, бенчмаркове и класации. Те имат значение, но интерфейсът има също толкова голямо значение в продукцията. Интерфейсът определя какви обещания може да даде моделът. Свободният текстов интерфейс допуска поведение с отворен край. Структурираният интерфейс изисква контролиран резултат. Декодер с ограничена граматика, схема за инструменти, типизиран изходен обект или фиксиран набор от етикети може да промени оперативния характер на същата основна интелигентност.
Представете си модел, който чете фактури. Ако върне параграф с обяснение на фактурата, екипът все още трябва да извлече доставчика, данъчния номер, междинните суми, валутата, падежа и степента на увереност. Ако върне типизиран обект със задължителни полета, валидацията може да се изпълни веднага. Ако падежът липсва, обектът може да посочи, че липсва. Ако сумите не съвпадат, проверяващ модул може да откаже импортирането. Моделът може да е по-малко приказлив, но счетоводният екип не му плаща, за да е харизматичен. Те искат счетоводната книга да спре да се клати.
Интерфейсите също оформят обучението. Модел, обучен да произвежда фиксирани етикети, може да се оценява спрямо грешки в етикетите. Модел, обучен да извлича полета, може да се оценява за точно съвпадение, коректност на обхвата, липсващи стойности и измислени стойности. Модел, обучен да създава проза, изисква повече преценка, повече рубрики и повече човешка проверка. Това може да е подходящо за някои задачи. Но е разточително за задачи, при които желаният резултат вече е структуриран. Изненадващо голяма част от работата с изкуствен интелект е просто въвеждане на данни, облечено в кадифе.
По-малките и по-строги модели следователно принуждават екипите да мислят за формата на работата. Дали това е задача за класификация, извличане, класиране, трансформация, проверка, планиране или обяснение. Дали изобщо е нужен модел, или би било по-добре правило, решаваща програма, ограничение в базата данни или индекс за търсене. Коя част се нуждае от разбиране на езика и коя част се нуждае от сигурност. Това разграничение не е педантично. То е разликата между проектиране на система и наемане на уста.
Обучителните данни стават по-малко театрални
Общите модели се нуждаят от огромни и разнообразни обучителни набори, защото се очаква да покриват огромно и разнообразно поведение. Тесните модели често могат да бъдат подобрени с по-малки, по-добре етикетирани и по-подходящи данни. Това звучи по-малко ефектно, което е още едно предимство. Ефектността не е показател за качество. Хиляда внимателно прегледани примера за класификатор на искове може да допринесат повече за надеждността в продукцията, отколкото грандиозно езеро от данни, в което всеки документ е поканен и никой не е проверил списъка с гости.
По-малките задачи правят значението на етикетите по-ясно. Ако етикетът е „ескалиране“, рецензентите могат да обсъдят точно кои условия оправдават ескалация. Ако полето е „крайна дата на договора“, рецензентите могат да определят как да се обработват клаузи за подновяване, изменения, липсващи подписи и противоречиви дати. Ако изходът е „разрешението е блокирано“, екипите по сигурност и право могат да уточнят границата. Това създава институционално знание като страничен ефект от дизайна на модела. Екипът научава какво означава процесът. Това е неудобно само ако организацията е предпочела да не знае.
Тесното обучение също прави оценяването по-представително. Можете да изградите тестови набори около реални режими на отказ: липсващи полета, остарели политики, подвеждащи формулировки, регионални изключения, необичайно форматиране, ниска увереност и случаи, в които отказът е правилният. Можете да измервате точност и припомняне там, където имат значение. Можете да решите, че фалшиво одобрение е десет пъти по-лошо от фалшива ескалация. Можете да настройвате прагове спрямо оперативните разходи. Това са конкретни избори. Не са бляскави, но имат рядкото свойство да бъдат полезни.
Все още има място за широко предварително обучение и трансфер. Малък строг модел може да стои върху вграждания от по-голям модел. Ограничен езиков модел може да използва общи лингвистични знания, докато извежда фиксирана схема. Общ модел може да генерира кандидати, които строг проверяващ да проверява. Аргументът не е чистота. Аргументът е разположение. Използвайте широка способност там, където е необходима широчина. Използвайте строгост там, където системата изисква ангажимент.
Икономиката е по-тиха и по-добра
Разходите не са само фактурата за извод. Разходите са латентност, памет, енергия, оперативна сложност, усилия за оценяване, тежест на прегледа, реакция при инциденти и броят на инженерите, необходими да обяснят защо вторникът се е различавал от понеделника. По-малките модели могат да помогнат по всички тези измерения. Те могат да работят по-близо до данните. Могат да се поберат на обикновен хардуер. Могат да бъдат кеширани, квантувани, пакетирани или вградени в услуга, без да превръщат внедряването в церемония с три календара и резервация на капацитет.
Латентността променя поведението на продукта. Ако класификатор връща резултат за милисекунди, той може да стои в работния процес, без да кара потребителя да гледа въртяща се иконка и да преосмисля кариерните си избори. Ако извличащ инструмент работи локално, чувствителен материал не трябва да пътува до отдалечена услуга за просто извличане на поле. Ако проверяващият е евтин, той може да работи върху всеки изход, а не върху извадкови случаи. Тези детайли не са дребни. Те решават дали контролът на качеството и безопасността действително се използва или просто се възхищава в архитектурни диаграми.
Оперативно по-малките модели са по-лесни за замяна. Екип може да обучи нов извличащ инструмент, да го пусне срещу стария, да сравни разминаванията и да го внедри на части. Може да запази предишната версия налична за повторно пускане. Може да прикачи версия на модела и праг към всяко решение. Огромна универсална крайна точка също може да бъде версионирана, но сравнението често става по-мътно, защото много поведения се променят наведнъж. Големите набори от промени са мястото, където увереността се превръща в градиент на PowerPoint.
Има и предимство при доставките. По-малките строги компоненти правят замяната на доставчик по-реалистична. Ако договорът е известна схема и известен набор за оценяване, екип може да сравни реализации. Ако договорът е огромен подкана, пълен със скрита политика и личност, превключването става рисковано. Организацията може да открие, че нейният работен процес не се захранва от модел, а е заплетен с него. Заплетеността е романтична в романите. В производството това е миграционен план със зъби.
Къде големите модели все още принадлежат
Нищо от това не означава, че големите модели трябва да бъдат изпратени в научното мазе. Те са отлични в много неща. Полезни са за проучване, чернови, обобщаване, превод, двусмислени потребителски въведени данни, помощ при писане на код и задачи, при които желаният резултат е наистина отворен. Те могат да помогнат на хората да осмислят непознат материал. Могат да генерират възможни обяснения. Могат да превърнат разхвърлян естествен език в по-структурирана заявка. Могат да бъдат щедрата входна врата към по-строга задна канцелария.
Грешката е да позволим входната врата да се превърне в самата сграда. Голям модел може да тълкува намерението, но по-малък класификатор може да избере работния процес. Голям модел може да напише чернова на отговор, но проверяващ може да провери твърденията. Голям модел може да обобщи документ, но инструмент за извличане може да попълни регулираните полета. Голям модел може да предложи план, но политическа врата може да реши кои стъпки са разрешени. Широкият модел остава ценен. Просто престава да се преструва, че е източник на цялата власт.
Това разделение е по-мило и към потребителите. Хората не искат да преговарят с модел за това дали съществува статус на възстановяване. Те искат ясни резултати, ясни доказателства и път за оспорване. Система, сглобена от строги компоненти, може да се обясни с оперативни термини: този източник беше използван, това поле липсваше, този праг беше достигнат, тази политика изискваше преглед. Това обяснение може да е по-малко очарователно от абзац с плавна емпатия, но е по-полезно, когато става въпрос за пари, права, безопасност или доверие.
Бъдещето вероятно не е един модел, който да управлява работния процес. То е съчетание от модели, правила, решаващи механизми, индекси, проверяващи и човешки преглед. Някои части ще са големи и гъвкави. Някои ще са мънички и упорити. Изкуството е да знаем кое кое е. Добрият инженер трябва да подозира всяка архитектура, при която всеки проблем се решава чрез уголемяване на един и същ компонент. Това не е дизайн. Това е инфлация.
Случаят
Случаят за по-малки, по-строги модели не е, че малкото е морално по-висше. Той е, че много ценни задачи са по-малки, отколкото настоящият ни речник за модели допуска. Класифицирай този случай. Извлечи тези полета. Класирай тези източници. Провери това твърдение. Откажи без доказателства. Насочи към човек. Запази причина. Това не са по-нисши форми на интелигентност. Те са формите, които правят по-големите системи надеждни.
Когато екипите започват от най-големия наличен модел, те често отлагат трудните въпроси на дизайна. Какво е пространството на състоянията. Кои изходи са допустими. Какви доказателства се изискват. Какво означава несигурността. Кой носи отговорност за грешката. Как се тества компонентът. Кога трябва да откаже. Когато тези въпроси бъдат пренебрегнати, моделът ги поема като скрита политика. Скритата политика може да работи за пилотен проект. Тя остарява зле в производствена среда, обикновено точно когато някой поиска одитна пътека.
Започването с по-малък модел изкарва въпросите наяве по-рано. То пита дали проблемът има позната форма. То пита дали строг интерфейс може да пренесе резултата. То пита дали моделът се нуждае от широка езикова способност или от тесен преценъчен усет. То пита какво трябва да бъде измерено, преди да се предостави доверие. Тази дисциплина не намалява амбицията. Тя дава на амбицията скелет. Без него системата може да се движи, но никой не бива да стои твърде близо.
По-малките и по-строги модели са по-лесни за притежаване. Те са по-евтини за работа, по-лесни за оценяване, по-ясни за отстраняване на грешки, по-безопасни за комбиниране и по-честни за своите ограничения. Те не заменят широките модели навсякъде. Те правят широките модели полезни там, където полезно означава повече от плавна реч. В сериозното AI инженерство това е разликата, която има значение. Най-добрата система рядко е тази с най-големия модел на всяка точка. Тя е тази, в която всяка точка има най-малкия компонент, който може да свърши работата, най-строгия договор, който все още отговаря на реалността, и достатъчно доказателства, оставени след себе си, за да разбере следващият човек какво се е случило.