Илюзии на ИИ: когато изкуственият интелект си измисля неща (и защо)
Самоуверената лъжа
AI ми каза, че Айфеловата кула е построена през 1889 г. за Световното изложение. Вярно.
AI ми каза, че е проектирана от Гюстав Айфел. Вярно.
AI ми каза, че първоначално е трябвало да бъде демонтирана след 20 години. Вярно.
AI ми каза, че е боядисана в ярко розово през 1962 г. за отбелязване на френската независимост. Напълно невярно. Каза го самоуверено. С конкретни подробности. Напълно измислено.
Това е халюцинация. AI генерира невярна информация, представена като факт. Разбирането защо се случва това е важно. Защото да се доверяваш на AI, който халюцинира, е опасно.
Какво всъщност представляват халюцинациите на AI
Халюцинация е, когато AI генерира информация, която е фактически невярна, безсмислена или невярна на изходния материал. Но я представя самоуверено. Сякаш знае.
- Не случайни грешки: Халюцинациите не са правописни грешки. Те са правдоподобно звучащи лъжи. Това, че Айфеловата кула е боядисана в розово, звучи правдоподобно. Конкретна година. Конкретна причина. Просто грешно.
- Висока увереност, ниска точност: AI не казва „може би“ или „вероятно“. Той излага факти. Без колебание. Без маркери за несигурност. Самоуверено представяне на невярна информация.
- Видове халюцинации: Фактически халюцинации: Грешна информация за реални неща. „Айнщайн печели Нобеловата награда през 1922 г.“ (всъщност е 1921 г.).
- Измислени обекти: Изобретяване на неща, които не съществуват. „Значимото проучване на д-р Джонсън от 2019 г....“ (такова проучване не съществува).
- Неточни обобщения: Обобщаване на текст неправилно. Добавяне на твърдения, които не са в източника. Пропускане на съществени уточнения. Промяна на смисъла.
- Логически несъответствия: Противоречие със себе си. Параграф 1 казва X. Параграф 3 казва не-X. И двете са заявени самоуверено.
Всичко е представено като истина. Ето защо халюцинациите са опасни.
Защо възникват халюцинациите
Разбирането на причината помага да разберем решението:
Завършване на модели, а не извличане на знания:
Невронните мрежи нямат база данни с факти. Те завършват модели. „Айфеловата кула била боядисана...“ задейства съпоставяне по модел. Розово + празник + година звучи правдоподобно. Моделът завършва модела. Но моделът не е основан на факти.
Това е сложно автоматично довършване. Не търсене на факти. Моделът предвижда кои думи трябва да следват. Понякога тези думи образуват лъжи.
Ограничения на обучителните данни:
Моделът се учи от обучителни данни. Ако дадена тема е рядко срещана в обучителните данни, моделът предполага. Тези предположения могат да са грешни. Темите с ниска честота = по-висок риск от халюцинации.
Пример: Попитайте за конкретна научна статия от 2023 г. Ако тя не е в обучителните данни (срезът на обучението е от 2022 г.), моделът екстраполира. Създава правдоподобно звучаща, но фалшива статия.
- Прекалено обобщаване: Моделът вижда модела X→Y често. Приема, че е универсален. Прилага го към случай Z, където не важи. Генерира невярна информация чрез фалшиво обобщение.
- Пристрастие към потвърждение при генерирането: След като моделът поеме в дадена посока, той продължава. Първият токен подсказва „розово“ → следващите токени затвърждават розовия разказ. Последователна история. Просто невярна.
Езиковите модели са машини за последователност. Те поддържат последователни разкази. Това не означава, че тези разкази са истина.
Липса на проверка на истината:
Моделите не проверяват факти. Нямат вътрешна проверка. Нямат стъпка „вярно ли е това?“. Те оптимизират за плавност и последователност. Истината е второстепенна. Всъщност истината изобщо не е изрична цел.
Реални примери за халюцинации
Документирани случаи:
- Правни цитати (ChatGPT в съда): Адвокат използва ChatGPT за проучване на дела. Моделът цитира няколко прецедента. Имена на дела. Съдебни решения. Конкретни постановления. Адвокатът ги представил. Проблемът: тези дела не съществували. Измислени от ИИ. Адвокатът беше изправен пред санкции. ИИ халюцинира правни прецеденти.
- Медицинска информация: Потребителят пита за рядко заболяване. ИИ предоставя симптоми, лечения, имена на лекарства. Звучи медицински. Цитира конкретни дози. Но съчетава реални имена на лекарства с грешни приложения. Или измисля несъществуващи лечения. Опасно е, ако се следва.
- Академични източници: „Според проучване от 2020 г. на Smith et al., публикувано в Nature...“ Конкретно списание. Автори. Година. Проучването не съществува. Напълно изфабрикувано. Но следва модела на реалните цитирания.
- Исторически събития: „Парижкият договор от 1783 г. включвал разпоредби за...“ Добавя разпоредби, които не са били в договора. Или смесва детайли от различни договори. Правдоподобно звучаща историческа ревизия.
- Генериране на код: ИИ генерира код с помощта на библиотека. Измисля API методи, които не съществуват. Или използва правилни имена на методи с грешни сигнатури. Кодът изглежда правилен. Не се изпълнява. Халюциниран API.
Всички примери споделят: правдоподобно представяне, конкретни детайли, пълна неистина.
Разпознаване на халюцинации
Как ги забелязвате?
- Проверете конкретните твърдения: Конкретните твърдения могат да бъдат проверени. „Проучване от X в списание Y, година Z“ → потърсете го. Халюцинациите често включват конкретни измислени детайли. Проверете ги.
- Сравнете с други източници: Няколко източника. Ако ИИ каже нещо изненадващо, проверете го другаде. Уикипедия. Официални източници. Реални научни бази данни. Не разчитайте само на ИИ.
- Търсете предпазлив език: Реалната несигурност включва „може“, „вероятно“, „според някои източници“. Абсолютната увереност по неясни теми е подозрителна. Легитимните отговори признават несигурността.
- Проверете вътрешната последователност: Задайте същия въпрос по различни начини. Халюцинациите често водят до противоречиви отговори. Реалните знания остават последователни.
- Изискайте източници: Попитайте ИИ откъде е научил това. Халюцинациите не могат да цитират реални източници. Може да измислят източници, но вие можете да ги проверите.
- Експертна проверка: Експертите разпознават халюцинациите в своята област. Фините грешки се открояват. За критични приложения експертната проверка е задължителна.
Стратегии за смекчаване
Как да намалим халюцинациите:
Генериране с допълнено извличане (RAG):
Не разчитайте само на обучението на модела. Извлечете съответните документи. Основавайте отговорите на извлечения текст. Моделът вижда: „Ето изходния материал. Отговорете въз основа на него.“
Това намалява халюцинациите. Моделът все още генерира текст, но основан на реални документи. Все още не е перфектен (може да изтълкува погрешно източниците), но е много по-добре.
- Ограничено декодиране: Ограничете какво може да каже моделът. Предоставете списъци с обекти, бази данни с факти, разрешени стойности. Моделът може да използва само одобрена информация. Халюцинациите се свеждат до одобрения набор.
- Калибриране на увереността: Обучете моделите да изразяват несигурност. Ниска увереност по редки теми. Висока увереност по добре покрити теми. Потребителят вижда оценките за увереност. Знае кога да бъде скептичен.
- Фино настройване за фактичност: Обучете моделите специално да бъдат фактични. Възнаграждавайте верните твърдения. Наказвайте неверните. Обучение с подсилване от човешка обратна връзка, фокусирано върху истината, а не само върху полезността.
- Верига на проверка: Моделът генерира отговор. След това го проверява. Самопроверка. „Това твърдение точно ли е? Мога ли да намеря подкрепящи доказателства?“ Улавя някои халюцинации преди изхода.
- Консенсус между няколко модела: Попитайте няколко модела. Ако са съгласни, вероятно е правилно. Ако не са съгласни, разследвайте. Халюцинациите често са специфични за модела. Консенсусът повишава увереността.
- Изрично свързване с източници: Изисквайте цитиране за всяко твърдение. Ако моделът не може да цитира източник, не правете твърдението. Принуждава към основаване на факти. Намалява неподкрепените твърдения.
Подходи, основани на ограничения (гледната точка на Dweve)
Двоичните системи с ограничения предлагат различен път:
- Изрично представяне на знания: Ограниченията кодират фактите изрично. „Обект X има свойство Y.“ Не статистически модели. Реално кодирано знание. Извличането е детерминистично. Без генериране от размити модели.
- Проверими резултати: Всяко заключение води до ограничения. „Този отговор произтича от ограничения C1, C2, C3.“ Одитна следа. Проверете ограниченията. Ако те са верни, отговорът е верен. Без скрито довършване на модели.
- Без генеративни халюцинации: Системите с ограничения не генерират по същия начин. Те съпоставят модели. Прилагат правила. Извличат знания. Без динамиката „довърши този правдоподобен разказ“. Ако знанието не е в ограниченията, системата казва „Не знам.“ Не измисля.
- Ограничено знание: Системата знае какво знае. Графът на знанията има ръбове или не ги има. Ограниченията съществуват или не съществуват. Двоично. Ясни граници. Извън тези граници? Изрична несигурност.
Компромис: По-малко гъвкава от генеративните модели. Не може да запълва празнини творчески. Но за фактическа надеждност това е предимство, не недостатък. Ограничеността до истината е целта.
Регулаторен отговор в Европа (халюцинациите като правна отговорност)
Европейските регулатори третират халюцинациите като сериозни нарушения на съответствието, а не като незначителни грешки.
Изисквания за прозрачност по Закона за ИИ на ЕС: Член 13 изисква системите с ИИ с висок риск да бъдат „достатъчно прозрачни, за да позволяват на потребителите да интерпретират резултатите от системата и да ги използват по подходящ начин“. Халюцинациите, уверените неистини, пряко нарушават този принцип. Член 15 изисква „подходящи нива на точност, стабилност и киберсигурност“. Системите, които генерират измислена информация, трудно отговарят на тези изисквания за точност и срещат регулаторни предизвикателства по време на оценките за съответствие.
Пресечна точка с GDPR: Когато ИИ халюцинира лични данни (измисля идентификационни данни, трудова история, медицински състояния), това потенциално създава неразрешена обработка на данни съгласно член 6 от GDPR. Френският орган за защита на данните (CNIL) е установил прецеденти на правоприлагане за нарушения, свързани с ИИ, с глоби до 20 милиона евро или 4% от глобалните приходи за сериозни нарушения. Това създава правна отговорност за генерирани от ИИ измислици, третирайки ги като нарушения на съответствието, а не просто като технически грешки.
Прилагане от държавите членки: Германските и френските регулатори са посочили, че системите с ИИ, внедрени в критична инфраструктура, трябва да демонстрират механизми за проверка на фактическата точност. Въпреки че конкретните протоколи за тестване варират по сектори, принципът е ясен: системите, склонни към халюцинации, са обект на засилен контрол в здравеопазването, финансите и приложенията, свързани със сигурността.
Защо халюцинациите имат значение за внедряването
Базата данни за халюцинации на ИИ проследява 426 правни случая в световен мащаб, включващи генерирани от ИИ измислици. Проучванията показват нива на халюцинации между 58-88% за моделите с общо предназначение при отговаряне на конкретни фактически въпроси, а дори специализираните инструменти показват нива на халюцинации от 20-33%. Това не са крайни случаи; те са фундаментални архитектурни предизвикателства.
Особено уязвими области с високи залози: Юристите са документирали случаи, в които ИИ цитира несъществуваща съдебна практика, което води до професионални санкции. Пилотните проекти в здравеопазването разкриха случаи, в които ИИ предлага несъществуващи лекарствени взаимодействия или измислени протоколи за лечение. Финансовите услуги са се сблъсквали с халюцинирани показатели и измислени аналитични доклади. Чатботовете в публичния сектор са давали неправилни процедурни указания въз основа на измислени разпоредби.
Моделът в различните сектори: Халюцинациите създават реална отговорност: финансова, регулаторна и репутационна. Европейските организации все по-често третират ИИ, склонен към халюцинации, като неприемлив риск в критични приложения, предпочитайки системи с изрични механизми за проверка или избирайки да ограничат внедряването на ИИ до случаи на употреба с по-ниски залози, където измислиците причиняват минимални щети.
Бъдещето на намаляването на халюцинациите
Накъде върви това?
- По-добро обосноваване: По-тясна интеграция с бази от знания. Всяко твърдение, подкрепено от извлекаем източник. Задължително обосноваване, а не по желание.
- Количествено определяне на несигурността: Модели, които знаят какво не знаят. Изразяване на увереността точно. Автоматично отбелязване на потенциални халюцинации.
- Интеграция на проверка на фактите: Проверка на фактите в реално време. Моделът генерира твърдение. Проверяващият фактите го валидира. Извеждат се само проверени твърдения.
- Хибридни архитектури: Генеративни модели за плавност. Символни системи за факти. Най-доброто от двете. Четивност с надеждност.
- Изисквания за прозрачност: Регулациите може да изискват посочване на източници. Всяко твърдение на ИИ трябва да цитира източници. Халюцинациите стават правно проблематични. Принуждават архитектурни промени.
Целта: ИИ, който генерира плавно И правдиво. Не едното или другото. И двете.
Нововъзникващи подходи за намаляване на халюцинациите
Изследователски институции по света разработват архитектурни решения на проблема с халюцинациите:
Генериране с ограничена увереност: Системи, които генерират множество кандидат-отговори, оценяват увереността за всяко твърдение и връщат само твърдения с висока увереност с посочване на източника. Твърденията с ниска увереност се отбелязват като несигурни, вместо да се представят като факт.
Итеративни цикли на проверка: Архитектури, при които един модел генерира отговори, докато втори проверява фактите на твърденията спрямо бази от знания. Противоречията задействат повторно генериране с корекции, което продължава, докато проверката не премине или системата изрично не заяви несигурност. Изчислителната цена е по-висока, но нивата на халюцинации спадат значително.
Хибридни символни-невронни системи: Комбиниране на генеративни модели за езикова плавност със символни системи за фактическа обосновка. Всяко фактическо твърдение трябва да съществува в граф на знанието: ако не съществува, системата заявява „не може да се провери“ вместо да предполага, предотвратявайки измислици чрез архитектурно ограничение.
Генериране с приоритет на източника: Обръщане на традиционния поток чрез започване с проверени източници, след което генериране на текст, който обяснява или обобщава тези източници, без да надхвърля съдържанието им. Всяко изречение остава проследимо до конкретни изходни документи, което прави халюцинациите невъзможни по дизайн.
Моделът в тези подходи: решаване на халюцинациите чрез архитектура, вместо да се надяваме, че по-доброто обучение е достатъчно. Компромисите, по-високата изчислителна цена, намалената творческа гъвкавост, се оказват приемливи за приложения, където фактическата надеждност е от най-голямо значение.
Какво трябва да запомните
- 1. Халюцинациите са уверени лъжи. Конкретни детайли. Без колебание. Напълно грешно. Правдоподобно представяне.
- 2. Те се появяват заради довършване на модели. Не извличане на факти. Моделите предвиждат правдоподобни продължения. Това не означава, че са верни.
- 3. Видовете варират. Фактически грешки, измислени обекти, неверни обобщения, логически несъответствия. Всичко представено като истина.
- 4. Откриването изисква проверка. Проверявайте конкретните детайли. Сверявайте с други източници. Тествайте последователността. Експертна оценка. Не вярвайте сляпо.
- 5. Съществуват мерки за смекчаване. RAG, ограничено декодиране, калибриране на увереността, верига за проверка. Не са перфектни, но са по-добри.
- 6. Системите с ограничения помагат. Явни знания. Проверими резултати. Без генеративно измисляне. Ограничена надеждност.
- 7. Бъдещето се подобрява. По-добра обосновка, оценка на несигурността, проверка на факти, хибридни архитектури. Напредъкът продължава.
- 8. Европейското законодателство третира халюцинациите сериозно. Изисквания за точност в Закона за ИИ на ЕС, правила за обработка на данни по GDPR. Измислиците създават потенциална отговорност: финансова, регулаторна, репутационна.
- 9. Секторите с високи залози са особено засегнати. Право, здравеопазване, финанси, обществени услуги. Документирани случаи на професионални санкции, провалени внедрявания, излагане на отговорност. Предотвратяването е от съществено значение за критични приложения.
- 10. Появяват се архитектурни решения. Генериране с ограничена увереност, итеративна проверка, хибридни символно-невронни системи, подходи с приоритет на източника. Изследвания, които адресират халюцинациите чрез дизайн, а не само чрез обучение.
Изводът
Халюцинациите на ИИ са фундаментални за настоящите архитектури. Не са грешки. Те са характеристики на системите за разпознаване на модели. Моделите допълват правдоподобни последователности. Тези последователности не са гарантирано верни.
Опасността е увереността. ИИ не казва „може би“ или „вероятно“. Той заявява. Потребителите се доверяват. Това доверие е неуместно при халюцинирано съдържание.
Решения съществуват. Генериране с допълнено извличане. Системи, базирани на ограничения. Слоеве за проверка. Нито едно не е перфектно. Но всички намаляват риска от халюцинации.
Критичните приложения изискват надеждност. Медицинска диагностика. Правни проучвания. Финансови съвети. Халюцинациите са неприемливи. Архитектурата има значение. Избирайте системи, проектирани за точност, а не само за плавност.
За обща употреба бъдете скептични. Проверявайте твърденията. Сверявайте източниците. Кръстосано сравнявайте. Не предполагайте, че ИИ знае. Той предвижда. Понякога греши. Уверената грешка е най-опасният вид.
Бъдещето на ИИ трябва да се справи с това. Не просто да генерира. Да генерира истинно. С проверими източници. С изрична несигурност, когато е уместно. Това е надежден ИИ. Не това, което имаме днес. А това, което трябва да изградим утре.
Регулаторните рамки като Закона за ИИ на ЕС признават халюцинациите за фундаментални предизвикателства пред надеждността на ИИ. Като изискват точност, прозрачност и стабилност, тези регулации тласкат развитието към механизми за проверка и архитектурни решения. Въпросът не е дали да се справим с халюцинациите, а дали да го направим проактивно чрез по-добър дизайн или реактивно след провали при внедряването.
Искате AI, основан на факти? Разгледайте Dweve Loom и Nexus. Бинарни ограничения на знанието. Изрични вериги на разсъждение. Проверими резултати. Ограничено знание с ясна несигурност. Такъв вид AI, който знае кога не знае. И не халюцинира, за да запълни празнините.