Fim do almoço grátis: dignidade dos dados na formação de IA
O Maior Golpe da História
Chamemos a primeira fase da IA generativa pelo que ela realmente foi: o maior ato de extração de valor da história humana.
Entre 2018 e 2024, um punhado de empresas do Vale do Silício mobilizou exércitos de rastreadores web por toda a internet. Esses rastreadores consumiram tudo: todos os livros já digitalizados, todos os artigos já publicados, todas as fotografias já carregadas, todas as publicações em fóruns já escritas, todas as linhas de código já partilhadas no GitHub, todas as letras de canções, todas as teses de doutoramento, todas as cartas de amor publicadas num blogue pessoal.
Fizeram-no sem pedir permissão. Fizeram-no sem oferecer compensação. Fizeram-no sem sequer reconhecer a fonte.
Depois pegaram em todo esse valor extraído, comprimiram-no em pesos matemáticos e construíram produtos proprietários que venderam por centenas de milhares de milhões de dólares. As pessoas que criaram o valor não receberam nada. As empresas que o extraíram tornaram-se nas empresas mais valiosas do planeta.
Isto não foi inovação. Foi arbitragem industrializada de direitos de autor a uma escala sem precedentes.
Mas a refeição grátis está a chegar ao fim. Os criadores estão a lutar. E os alicerces legais, éticos e económicos do modelo de extração estão a desmoronar-se.
As Muralhas Legais a Subir
Os fundamentos legais do modelo de extração sempre foram questionáveis. As empresas de IA argumentaram que o treino em material protegido por direitos de autor constituía "utilização justa" porque o modelo "transforma" os dados em vez de os copiar diretamente. Afirmaram que isto era análogo a um ser humano ler livros numa biblioteca.
Este argumento está a falhar nos tribunais de todo o mundo.
O Processo do The New York Times
O processo do The New York Times contra a OpenAI e a Microsoft, apresentado em dezembro de 2023, foi o primeiro tiro de um litígio que promete durar anos. O processo demonstrou que o ChatGPT conseguia reproduzir artigos protegidos do Times quase na íntegra. Mostrou que o modelo conseguia contornar os paywalls ao resumir os artigos de forma tão completa que os utilizadores não tinham razão para visitar a fonte original.
Isto não é "transformação". Isto é substituição de mercado. Quando uma IA consegue substituir a função de uma subscrição de jornal, a defesa da utilização justa desmorona-se.
A Rebelião dos Artistas
Os artistas visuais estiveram entre os primeiros a reconhecer a ameaça. Os geradores de imagens treinados com milhares de milhões de obras de arte conseguiam replicar os estilos individuais dos artistas com uma precisão devastadora. Um prompt como "no estilo de [artista vivo]" conseguia produzir obras ilimitadas que competiam diretamente com o sustento do criador original.
As ações coletivas em nome dos artistas visuais estão agora a avançar nos tribunais. Mas os artistas não esperaram pela resolução legal. Desenvolveram contramedidas técnicas.
Ferramentas como Glaze e Nightshade adicionam perturbações impercetíveis às imagens que envenenam o treino de IA. Uma imagem recolhida parece normal aos olhos humanos, mas causa degradação do modelo ou resultados imprevisíveis. É uma forma digital de armar conteúdos com armadilhas, e está a espalhar-se rapidamente.
O Bloqueio das Plataformas
As grandes plataformas fecharam as portas ao treino de IA. O Reddit, que era uma das maiores fontes de dados de conversação para treino, agora cobra taxas proibitivas pelo acesso à API. O Twitter/X bloqueou totalmente os crawlers de IA antes de inverter a posição e monetizar o acesso. O Stack Overflow implementou termos rigorosos contra o treino de IA nas suas perguntas e respostas de programação.
A "web aberta" em que as empresas de IA se apoiavam está a tornar-se um mosaico de jardins murados, cada um a cobrar portagens a qualquer IA que queira aceder.
Dignidade dos Dados: Uma Filosofia Diferente
Na Dweve, abraçamos o conceito de Dignidade dos Dados, um termo popularizado pelo cientista informático Jaron Lanier. O princípio é simples: se os seus dados contribuem para o valor de um sistema de IA, merece uma parte desse valor.
Isto não é caridade. Também não é ética pela ética. É o alicerce de uma economia de IA sustentável.
O modelo de extração nunca foi economicamente sólido. Dependia de uma zona cinzenta legal temporária e da incapacidade prática de milhões de criadores individuais fazerem valer os seus direitos. À medida que ambas as condições mudam, as empresas construídas sobre a extração enfrentam um risco existencial.
Um modelo baseado na dignidade, pelo contrário, cria incentivos alinhados. Os criadores são motivados a contribuir com o seu melhor trabalho porque são compensados por isso. As empresas de IA obtêm acesso a dados de maior qualidade porque pagam pela curadoria e verificação. Os utilizadores obtêm melhores resultados porque os dados de treino são superiores.
A Arquitetura Dweve para a Dignidade dos Dados
A nossa abordagem à dignidade dos dados não é apenas uma posição política. Está incorporada na nossa arquitetura técnica.
O Pipeline de Conhecimento Spindle
O Dweve Spindle implementa um pipeline epistemológico de sete fases que rastreia cada peça de conhecimento desde a origem até à implementação:
- Candidato: A informação bruta é identificada e etiquetada com metadados de origem
- Extraído: A informação estruturada é extraída com a proveniência preservada
- Analisado: O conteúdo é decomposto em factos atómicos com o estado de licenciamento verificado
- Ligado: Os factos são ligados ao grafo de conhecimento com cadeias de atribuição
- Verificado: A validação multi-fonte confirma a exatidão e o estado legal
- Certificado: O controlo de qualidade confirma a conformidade com os requisitos de dignidade dos dados
- Canónico: O conhecimento verificado torna-se pronto para IA com proveniência completa
Este pipeline significa que podemos rastrear qualquer peça de conhecimento no nosso sistema até à sua fonte original. Podemos provar o estado de licenciamento. Podemos identificar quais os criadores que contribuíram para qualquer resultado específico.
Os 456 Conjuntos de Restrições Especializadas por Domínio
A arquitetura do Dweve Loom de 456 conjuntos de restrições especializadas permite licenciamento e compensação granulares. Cada especialista de domínio representa um domínio de conhecimento distinto com as suas próprias fontes de dados e acordos de licenciamento.
Quando o especialista de Domínio Legal (Direito Contratual Alemão) processa uma consulta, sabemos exatamente quais as editoras jurídicas e sociedades de advogados que contribuíram para essa capacidade. Quando o especialista de Domínio Médico (Oncologia) fornece informações, podemos rastrear até às revistas médicas, bases de dados clínicas e instituições de investigação que forneceram o conhecimento.
Esta granularidade permite uma partilha de receitas sofisticada. Em vez de alegações vagas sobre «treinar na internet», podemos calcular com precisão quanto cada fonte de dados contribuiu para cada capacidade.
O Mercado de Dados de Comércio Justo
Estamos a construir a infraestrutura para uma nova economia de dados. Pense nisto como uma certificação de "Comércio Justo" para dados de treino de IA.
Para Fornecedores de Dados
Editoras, universidades, instituições de investigação e especialistas de domínio podem registar o seu conteúdo na nossa plataforma. Definem os termos da licença. Definem o preço. Mantêm o controlo.
Ao contrário do modelo de extração em que o seu conteúdo era simplesmente retirado, passam a ser participantes ativos na economia da IA. Podem escolher quais as aplicações de IA que podem utilizar os seus dados, em que condições e a que preço.
Os dados de alta qualidade exigem preços premium. Uma editora académica com investigação rigorosamente revista por pares pode cobrar mais do que uma fábrica de conteúdo com manchetes sensacionalistas otimizadas para SEO. O mercado recompensa a qualidade.
Para Programadores de IA
As empresas que criam aplicações de IA obtêm acesso a dados de treino legalmente claros com proveniência documentada. Podem provar a reguladores, seguradoras e tribunais exatamente de onde vieram os seus dados de treino e que tinham o direito de os utilizar.
Isto elimina o risco legal crescente de modelos treinados com dados extraídos. Também proporciona acesso à "matéria escura" do conhecimento, os vastos repositórios de informação de alta qualidade que nunca estiveram disponíveis na web aberta: arquivos corporativos, investigação atrás de paywalls, bases de dados proprietárias.
Para Utilizadores Finais
Os utilizadores obtêm melhores resultados porque a IA é treinada com dados selecionados de maior qualidade, em vez do ruído da internet aberta. Também obtêm atribuição: quando o nosso sistema fornece informações de fontes licenciadas, podemos citar essas fontes, permitindo a verificação e uma exploração mais aprofundada.
A Economia da Qualidade em vez da Quantidade
Os críticos argumentam que pagar por dados torna o desenvolvimento de IA economicamente inviável. Afirmam que é preciso "a internet inteira" para treinar modelos capazes.
Isto reflete um pensamento desatualizado da era do "big data" de 2020. A investigação recente demonstrou de forma decisiva que a qualidade dos dados importa muito mais do que a quantidade de dados.
Considere a matemática. Treinar o GPT-3 exigiu aproximadamente 45 terabytes de texto comprimido. A maior parte era extração de baixa qualidade da web: secções de comentários, spam, informação desatualizada, erros factuais e puro disparate.
Um modelo treinado com 500 gigabytes de conteúdo académico e de manuais selecionado e de alta qualidade pode igualar ou exceder o desempenho de modelos treinados com 100 vezes mais dados. O rácio sinal-ruído dos dados selecionados é simplesmente muito mais elevado.
Ao pagar por dados, obtemos acesso a conteúdo que nunca esteve disponível para os extratores: literatura médica atrás de paywalls de editoras, investigação financeira em bases de dados proprietárias, conhecimento industrial em arquivos corporativos. Esta "matéria escura" é mais limpa, mais densa e mais valiosa do que qualquer coisa na web aberta.
A economia favorece, na prática, o modelo de dignidade. Pagamos mais por byte, mas precisamos de muito menos bytes. Obtemos acesso a fontes premium que os scrapers nunca conseguem alcançar. E eliminamos a responsabilidade legal que agora ameaça as empresas baseadas em extração com milhares de milhões em danos potenciais.
O Imperativo Empresarial
Para clientes empresariais, a dignidade dos dados não é opcional. É um requisito de gestão de risco.
As grandes organizações enfrentam uma exposição enorme a responsabilidades legais devido a sistemas de IA treinados com dados questionáveis. Um departamento de marketing que utiliza um gerador de imagens treinado com obras de arte recolhidas da internet enfrenta potenciais reclamações por violação de direitos de autor. Um departamento jurídico que utiliza um modelo de linguagem treinado com conteúdo protegido por paywall enfrenta exposição em termos de propriedade intelectual. Uma organização de saúde que utiliza um modelo que não consegue comprovar a proveniência dos seus dados de treino enfrenta risco regulatório.
Os processos judiciais estão a chegar. A Getty Images processou a Stability AI. O The New York Times processou a OpenAI. Os sindicatos de autores estão a organizar ações coletivas. Os danos potenciais ascendem a milhares de milhões.
As organizações que utilizam os sistemas da Dweve podem demonstrar exatamente de onde vieram os nossos dados de treino e que tínhamos licenciamento adequado para todos eles. Esta proveniência limpa vale muito mais do que qualquer ganho marginal de capacidade obtido a partir de dados recolhidos da internet.
Atribuição e a Economia do Conhecimento
Para além da compensação, a dignidade dos dados exige atribuição. Quando os nossos sistemas fornecem informações derivadas de fontes licenciadas, citamos essas fontes.
Isto cria um ciclo virtuoso. Os utilizadores podem verificar as informações consultando as fontes originais. Podem explorar os tópicos mais a fundo seguindo as citações. O tráfego flui de volta para os criadores de conteúdo, restaurando o contrato social quebrado da web.
Para os nossos 456 conjuntos de restrições de especialistas de domínio na Dweve Loom, cada peça de conhecimento tem uma cadeia de proveniência. Quando o especialista de Domínio Médico fornece informações sobre uma doença rara, podemos mostrar quais artigos de revistas médicas informaram essa resposta. Quando o especialista de Domínio Jurídico explica um requisito regulatório, podemos citar as fontes estatutárias.
Isto não é apenas boa ética. É um bom design de produto. Os utilizadores confiam mais em sistemas quando podem verificar afirmações. As empresas preferem sistemas que conseguem demonstrar o seu raciocínio. A atribuição constrói confiança.
O Futuro que Estamos a Construir
A era da extração está a terminar. O que vem a seguir está a ser determinado agora.
Um caminho leva a um bem comum envenenado. Os criadores adotam medidas de proteção cada vez mais agressivas. A qualidade dos dados de treino degrada-se. O desenvolvimento da IA estagna ou torna-se domínio de algumas empresas com vantagens de dados legados.
O outro caminho leva a uma economia do conhecimento sustentável. Os criadores são compensados pelas suas contribuições. Dados de qualidade estão disponíveis para aqueles que estão dispostos a pagar de forma justa por eles. O desenvolvimento da IA continua com ampla participação e benefícios distribuídos.
Na Dweve, estamos a construir a infraestrutura para o segundo caminho. A nossa redução de energia de 96% demonstra que uma IA eficiente é possível. A nossa explicabilidade de 100% demonstra que uma IA transparente é alcançável. A nossa arquitetura de dignidade dos dados demonstra que uma IA ética é prática.
Acreditamos que tratar os criadores de dados com dignidade não é apenas moralmente correto. É economicamente superior. Produz melhor IA treinada com melhores dados, com estatuto legal mais limpo e economia sustentável.
O almoço grátis acabou. A questão é o que vem a seguir. Estamos a construir a alternativa.
Pronto para construir IA sobre uma base de dignidade dos dados? O mercado de dados de comércio justo da Dweve proporciona certeza legal, dados de treino de maior qualidade e economia sustentável. Contacte-nos para descobrir como a dignidade dos dados pode tornar-se a sua vantagem competitiva.