Data Dignity: Краят на безплатния обяд в обучението на ИИ

Ерата на безплатното извличане на данни от мрежата приключва. Създателите на съдържание се противопоставят. Ето как пазарният модел на Dweve компенсира...

Data Dignity: Краят на безплатния обяд в обучението на ИИ

Най-големият обир в историята

Нека наречем първата фаза на генеративния изкуствен интелект с истинското ѝ име: най-мащабното извличане на стойност в човешката история.

Между 2018 г. и 2024 г. шепа компании в Силициевата долина разположиха армии от уеб обхождачи в целия интернет. Тези обхождачи погълнаха всичко: всяка дигитализирана книга, всяка публикувана статия, всяка качена снимка, всеки написан форум пост, всеки ред код, споделен в GitHub, всеки текст на песен, всяка докторска дисертация, всяко любовно писмо, публикувано в личен блог.

Те направиха това без да поискат разрешение. Направиха го без да предоставят обезщетение. Направиха го дори без да признаят източника.

След това взеха цялата тази извлечена стойност, компресираха я в математически тегла и изградиха патентовани продукти, които продадоха за стотици милиарди долари. Хората, които създадоха стойността, не получиха нищо. Компаниите, които я извлякоха, се превърнаха в най-ценните предприятия на планетата.

Това не беше иновация. Това беше индустриализиран арбитраж на авторски права в безпрецедентен мащаб.

Но безплатният обяд приключва. Създателите се борят. А правните, етичните и икономическите основи на модела на извличане се рушат.

Големият трансфер на стойност: извличане срещу достойнствоМодел на извличане (2018-2024)Целият интернет е обходенБез разрешениеКниги, статии, код, изкуствоБез посочване на авторТворчески и интелектуален трудБез възнаграждениеРезултатът:Над 2 трилиона доларапазарна капитализация на AI компании0 долара за създателите на съдържаниеМодел на достойнство на данните (Dweve)Подбрани източници на знанияИзрично лицензиранеПроследяване на експертни областиПълна верига на произходИзмерване на ползването при всяка заявкаРазпределяне на дял от приходитеРезултатът:Устойчива екосистемаСъздателите са стимулирани да допринасятПо-високо качество на знанията

Правните стени се издигат

Правните основи на модела за извличане на данни винаги са били съмнителни. Компаниите за изкуствен интелект твърдяха, че обучението върху защитени с авторски права материали представлява „честна употреба“, защото моделът „трансформира“ данните, вместо да ги копира директно. Те твърдяха, че това е аналогично на човек, който чете книги в библиотека.

Този аргумент се проваля в съдилищата по целия свят.

Съдебният процес на The New York Times

Съдебният процес на The New York Times срещу OpenAI и Microsoft, заведен през декември 2023 г., беше първият изстрел в това, което обещава да бъдат години на съдебни спорове. Процесът показа, че ChatGPT може да възпроизвежда статии на Times, защитени с авторски права, почти дословно. Той показа, че моделът може да заобикаля платените стени, като обобщава статиите толкова изчерпателно, че потребителите нямат причина да посещават оригиналния източник.

Това не е „трансформация“. Това е заместване на пазара. Когато изкуственият интелект може да замени функцията на абонамент за вестник, защитата на честната употреба се срива.

Бунтът на художниците

Визуалните художници бяха сред първите, които разпознаха заплахата. Генераторите на изображения, обучени върху милиарди произведения на изкуството, можеха да възпроизвеждат стиловете на отделни художници с опустошителна точност. Подсказка като „в стила на [жив художник]“ можеше да създаде неограничен брой произведения, които директно се конкурираха с прехраната на оригиналния творец.

Колективни съдебни искове от името на визуални художници в момента преминават през съдилищата. Но художниците не изчакаха правното разрешение. Те разработиха технически контрамерки.

Инструменти като Glaze и Nightshade добавят незабележими смущения към изображенията, които отравят обучението на ИИ. Извлечено изображение изглежда нормално за хората, но причинява влошаване на модела или непредвидими резултати. Това е дигитална форма на миниране на съдържание и се разпространява бързо.

Заключването на платформите

Големите платформи затвориха вратите си за обучението на ИИ. Reddit, който беше един от най-големите източници на данни за разговорно обучение, сега начислява забранителни такси за API достъп. Twitter/X напълно блокираха AI обхождащите програми, преди да обърнат курса и да монетизират достъпа. Stack Overflow въведе строги условия срещу обучението на ИИ върху техните въпроси и отговори за програмиране.

„Отворената мрежа“, на която разчитаха компаниите за ИИ, се превръща в мозайка от оградени градини, всяка от които събира такси от всеки ИИ, който иска достъп.

Стените, издигащи се срещу извличането на данниПравни действияДело NYT срещу OpenAIСъдебен спор на Getty ImagesКолективни искове на авториТехническа защитаЗащита на стила GlazeОтравяне на данни с NightshadeВодни знаци на съдържаниетоБлокиране на платформиПлатен достъп до API на RedditОграничения на Stack OverflowБлокиране на обхождащи програми от издателиСчупеният обществен договорТърсачките изпращаха трафик. AI двигателите поглъщат стойност. Размяната е счупена.За AI компаниитеНарастваща правна отговорностНамаляващи източници за обучениеЗа етичния AI (Dweve)Чист правен статутДостъп до първокласни източници
Правната контраатака превръща стария компромис „първо пълзи“ в граница, която изисква доказателства преди обучение.

Достойнство на данните: различна философия

В Dweve възприемаме концепцията за достойнство на данните, термин, популяризиран от компютърния учен Джарон Ланиър. Принципът е ясен: ако вашите данни допринасят за стойността на AI система, вие заслужавате дял от тази стойност.

Това не е благотворителност. Това дори не е етика заради самата нея. Това е основата за устойчива AI икономика.

Моделът на извличане никога не е бил икономически здрав. Той разчиташе на временна правна сива зона и на практическата невъзможност на милиони отделни създатели да отстояват правата си. Тъй като и двете условия се променят, компаниите, изградени върху извличането, са изправени пред екзистенциален риск.

Модел, изграден върху достойнството, напротив, създава съгласувани стимули. Създателите са мотивирани да предоставят най-добрата си работа, защото получават възнаграждение за нея. AI компаниите получават достъп до по-качествени данни, защото плащат за подбор и проверка. Потребителите получават по-добри резултати, защото обучителните данни са по-качествени.

Архитектурата на Dweve за достойнство на данните

Нашият подход към достойнството на данните не е просто политическа позиция. Той е вграден в нашата техническа архитектура.

Пайплайнът за знания Spindle

Dweve Spindle внедрява седеметапен епистемологичен пайплайн, който проследява всяко знание от произхода до внедряването:

  1. Кандидат: Суровата информация се идентифицира и маркира с метаданни за източника
  2. Извлечено: Структурираната информация се извлича със запазен произход
  3. Анализирано: Съдържанието се разлага на атомарни факти с проверен лицензионен статус
  4. Свързано: Фактите се свързват с графа на знанието с вериги на приписване
  5. Проверено: Многоизточниковата валидация потвърждава точността и правния статус
  6. Сертифицирано: Контролът на качеството потвърждава съответствието с изискванията за достойнство на данните
  7. Канонично: Провереното знание става готово за AI с пълен произход

Този пайплайн означава, че можем да проследим всяко знание в нашата система до първоначалния му източник. Можем да докажем лицензионния статус. Можем да идентифицираме кои създатели са допринесли за даден резултат.

456-те набора от ограничения за предметни специалисти

Архитектурата на Dweve Loom с 456 специализирани набора от ограничения позволява прецизно лицензиране и възнаграждение. Всеки предметен специалист представлява отделна област на знанието със собствени източници на данни и лицензионни договорености.

Когато специалистът по правна област (германско договорно право) обработва заявка, ние знаем точно кои правни издателства и адвокатски кантори са допринесли за тази възможност. Когато специалистът по медицинска област (онкология) предоставя информация, можем да проследим до медицинските списания, клиничните бази данни и изследователските институции, които са предоставили знанието.

Тази прецизност позволява сложно споделяне на приходи. Вместо неясни твърдения за „обучение върху интернет“, можем да изчислим точно колко всеки източник на данни е допринесъл за всяка възможност.

Dweve Spindle: Тръбопровод за достойнство на даннитеСедемстепенен епистемологичен тръбопровод1. КандидатСурова информацияидентифицирана2. ИзвлеченаСтруктуриранас произход3. АнализиранаАтомарни фактилицензът проверен4. СвързанаГраф назнанията свързан5. ПроверенаМногоизточниковавалидация6. СертифициранаОС пълнаУвереност 0.7+7. КаноничнаГотова за ИИ с пълен произходВсеки факт проследен до източник + статус на лицензаЙерархия от 32 агента валидира на всеки етапLoom: Гранулирано лицензиране456 специалисти по домейни с отделни източници на данниДял от приходите, изчислен за всеки специалист по домейнДоставчиците на данни се заплащат пропорционалноMesh: Федеративен суверенитетДанните остават при създателитеОбучение, запазващо поверителносттаSMPC + хомоморфно криптиране
Spindle прави достойнството на данните оперативно, като пренася заедно произхода, правата, статуса на лиценза и ограниченията на експертите в областта.

Пазарът за лоялна търговия с данни

Изграждаме инфраструктурата за нова икономика на данните. Мислете за това като за сертификация за „лоялна търговия“ за данни за обучение на изкуствен интелект.

За доставчиците на данни

Издатели, университети, изследователски институции и експерти в областта могат да регистрират съдържанието си на нашата платформа. Те определят условията на лиценза. Те определят цената. Те запазват контрола.

За разлика от модела на извличане, при който съдържанието им просто е било вземано, те стават активни участници в икономиката на изкуствения интелект. Те могат да избират кои приложения на изкуствения интелект да използват данните им, при какви условия и на каква цена.

Висококачествените данни изискват високи цени. Академичен издател със строго рецензирани изследвания може да таксува повече от ферма за съдържание с кликбейт, оптимизиран за търсачки. Пазарът възнаграждава качеството.

За разработчиците на изкуствен интелект

Компаниите, които изграждат приложения с изкуствен интелект, получават достъп до правно изчистени данни за обучение с документиран произход. Те могат да докажат на регулаторите, застрахователите и съдилищата откъде точно идват данните им за обучение и че са имали право да ги използват.

Това елиминира нарастващия правен риск от модели, обучени върху изстъргани данни. Освен това осигурява достъп до „тъмната материя“ на знанието, огромните хранилища от висококачествена информация, която никога не е била достъпна в отворената мрежа: корпоративни архиви, изследвания зад пейуол, патентовани бази данни.

За крайните потребители

Потребителите получават по-добри резултати, защото изкуственият интелект е обучен върху по-качествени, подбрани данни, а не върху шума на отворения интернет. Те също получават атрибуция, когато нашата система предоставя информация от лицензирани източници, можем да цитираме тези източници, което позволява проверка и по-задълбочено проучване.

Пазарът е мястото, където съгласието, атрибуцията, плащането и контролът на корпоративния риск се превръщат в един и същ работен процес.

Икономиката на качеството пред количеството

Критиците твърдят, че плащането за данни прави разработването на изкуствен интелект икономически неизгодно. Те твърдят, че ви трябва „целият интернет“, за да обучите способни модели.

Това отразява остаряло мислене от ерата на „големите данни“ през 2020 г. Скорошни изследвания убедително показаха, че качеството на данните е далеч по-важно от количеството данни.

Помислете за математиката. Обучението на GPT-3 изискваше приблизително 45 терабайта компресиран текст. По-голямата част от това беше нискокачествено изстъргване от мрежата: секции за коментари, спам, остаряла информация, фактически грешки и откровени глупости.

Модел, обучен върху 500 гигабайта подбрано, висококачествено учебникарско и академично съдържание, може да достигне или надмине представянето на модели, обучени върху 100 пъти повече данни. Съотношението сигнал/шум на подбраните данни е просто толкова по-високо.

Като плащаме за данни, получаваме достъп до съдържание, което никога не е било достъпно за скрейпърите: медицинска литература зад пейуол на издатели, финансови изследвания в патентовани бази данни, индустриални знания в корпоративни архиви. Тази „тъмна материя“ е по-чиста, по-плътна и по-ценна от всичко в отворената мрежа.

Икономиката всъщност благоприятства модела на достойнството. Плащаме повече за байт, но имаме нужда от значително по-малко байтове. Получаваме достъп до първокласни източници, до които скрейпърите никога не могат да достигнат. И елиминираме правната отговорност, която в момента заплашва компаниите, базирани на извличане на данни, с милиарди потенциални щети.

Качество пред количество: Новата икономика на даннитеМодел на извличане45+ TB уеб скрейпинг90%+ нискокачествен шумНарастваща правна отговорностМодел на достойнство на данните~500 GB подбрано съдържание95%+ висококачествен сигналЧист правен статусПредимството на тъмната материяЛицензираните данни предоставят достъп до първокласни източници, до които скрейпърите никога не могат да достигнатМедицински списанияРецензирани изследванияФинансови данниСобствени бази данниИндустриални знанияКорпоративни архиви

Императивът за предприятията

За корпоративните клиенти достойнството на данните не е опция. То е изискване за управление на риска.

Големите организации са изложени на огромна отговорност поради системи с изкуствен интелект, обучени върху съмнителни данни. Маркетингов отдел, който използва генератор на изображения, обучен върху събрани от интернет произведения на изкуството, е изправен пред потенциални искове за нарушаване на авторски права. Юридически отдел, който използва езиков модел, обучен върху съдържание зад пейуол, е изправен пред експозиция по отношение на интелектуална собственост. Здравна организация, която използва модел, който не може да докаже произхода на своите обучителни данни, е изправена пред регулаторен риск.

Съдебните дела идват. Getty Images съди Stability AI. The New York Times съди OpenAI. Съюзи на автори организират колективни искове. Потенциалните обезщетения са в милиарди.

Организациите, които използват системите на Dweve, могат да докажат точно откъде идват нашите обучителни данни и че сме имали подходящи лицензи за всички тях. Този чист произход струва далеч повече от всякакви маргинални печалби в способности, получени от събрани данни.

Приписване и икономиката на знанието

Освен обезщетението, достойнството на данните изисква приписване. Когато нашите системи предоставят информация, получена от лицензирани източници, ние цитираме тези източници.

Това създава положителен цикъл. Потребителите могат да проверяват информацията, като се запознаят с оригиналните източници. Те могат да изследват теми по-задълбочено, като следват цитиранията. Трафикът се връща към създателите на съдържание, възстановявайки нарушения обществен договор на мрежата.

За нашите 456 набора от ограничения за специалисти по домейни в Dweve Loom, всяко знание има верига на произход. Когато специалистът по медицински домейн предоставя информация за рядко заболяване, можем да покажем кои статии от медицински списания са информирали този отговор. Когато специалистът по правен домейн обяснява регулаторно изискване, можем да цитираме законовите източници.

Това не е просто добра етика. Това е добър продуктов дизайн. Потребителите се доверяват повече на системи, които могат да проверят. Предприятията предпочитат системи, които могат да демонстрират своите разсъждения. Приписването изгражда доверие.

Бъдещето, което изграждаме

Ерата на извличането приключва. Това, което следва, се определя сега.

Единият път води до отровено общо пространство. Създателите приемат все по-агресивни защитни мерки. Качеството на обучителните данни се влошава. Развитието на ИИ спира или става провинция на няколко компании с наследени предимства в данните.

Другият път води до устойчива икономика на знанието. Създателите получават обезщетение за своя принос. Качествени данни са достъпни за тези, които са готови да платят справедливо за тях. Развитието на ИИ продължава с широко участие и разпределени ползи.

В Dweve изграждаме инфраструктурата за втория път. Нашето 96% намаление на енергията демонстрира, че ефективният ИИ е възможен. Нашата 100% обяснимост демонстрира, че прозрачният ИИ е постижим. Нашата архитектура за достойнство на данните демонстрира, че етичният ИИ е практичен.

Вярваме, че третирането на създателите на данни с достойнство не е просто морално правилно. То е икономически превъзходно. То произвежда по-добър ИИ, обучен върху по-добри данни, с по-чист правен статут и устойчива икономика.

Безплатният обяд свърши. Въпросът е какво следва. Ние изграждаме алтернативата.

Готови ли сте да изградите ИИ върху основа от достойнство на данните? Пазарът за справедлива търговия с данни на Dweve осигурява правна сигурност, по-висококачествени обучителни данни и устойчива икономика. Свържете се с нас, за да откриете как достойнството на данните може да се превърне във вашето конкурентно предимство.

Устойчивият път е маховик: качествените източници се заплащат, произходът пътува, рискът за купувача спада и по-добри данни продължават да се създават.