Memória em IA: como os modelos recordam (e porque se esquecem)

AI não tem memória como nós. Mas precisa de lembrar o contexto. Eis como diferentes sistemas de IA lidam com a memória, e por que isso importa.

Memória em IA: como os modelos recordam (e porque se esquecem)

A Ilusão da Memória

Conversa com o ChatGPT. Ele lembra-se do que disseste há três mensagens. Responde de forma coerente. Mantém o contexto. Parece ter memória.

Não tem. Não verdadeiramente. Não da forma que pensas.

A memória da IA é fundamentalmente diferente da memória humana. Perceber como funciona realmente, o que pode e não pode fazer, é importante. Porque as limitações são reais. E muitas vezes surpreendentes.

O Que a Memória da IA É Realmente

Os modelos de IA não têm memória persistente como os humanos. Têm parâmetros (pesos) aprendidos durante o treino e têm janelas de contexto para processar entradas.

É só isto. Dois tipos de "memória", ambos completamente diferentes da memória biológica:

1. Memória Paramétrica (Os Pesos):

Durante o treino, o modelo aprende padrões. Esses padrões ficam codificados em milhares de milhões de pesos. Isto é memória paramétrica. Conhecimento incorporado na estrutura do modelo.

Exemplo: Um modelo de linguagem "sabe" que "Paris é a capital de França" porque esse padrão apareceu nos dados de treino. O conhecimento está codificado nos pesos. Não é armazenado como texto. Não é recuperável como um facto. Apenas... codificado como padrões de ativação.

2. Memória de Contexto (A Entrada):

Quando usas o modelo, forneces uma entrada. O modelo processa essa entrada. Para IA conversacional, todo o histórico da conversa faz parte da entrada. Isso é memória de contexto.

O modelo não se lembra das tuas mensagens anteriores. Tu (ou a aplicação) fornece-as novamente com cada nova mensagem. O modelo processa tudo de novo de cada vez. Parece memória. Na verdade, é repetição.

A memória da IA divide-se em pesos treinados e contexto reenviado; nenhum dos dois é uma recordação ao estilo humano.

Janelas de Contexto (O Limite da Memória)

A memória de contexto tem um limite rígido: o tamanho da janela de contexto.

Os modelos só conseguem processar uma quantidade fixa de tokens de cada vez. GPT-4: 8K ou 32K tokens. Claude: 100K tokens. Llama: 4K-8K tokens.

Assim que excedes a janela de contexto, o modelo literalmente não consegue ver informação anterior. Desapareceu. Esquecida. Não porque o modelo se esqueceu, mas porque não cabe na entrada.

O Que Isto Significa na Prática:

Conversas longas acabam por exceder a janela. A IA "esquece-se" do início. Contradiz-se. Perde o contexto. Não é um bug. É uma limitação arquitetónica fundamental.

As aplicações lidam com isto truncando mensagens antigas. Resumindo-as. Ou simplesmente descartando-as. A tua conversa parece contínua. Nos bastidores, a informação está a ser descartada constantemente.

A janela de contexto é um limite rígido: quando a conversa já não cabe, os tokens anteriores desaparecem da visão direta.

Eficiência da Memória (Binário vs. Vírgula Flutuante)

A utilização da memória é importante. Especialmente em dispositivos de ponta. As redes binárias mudam a equação:

Modelos de Vírgula Flutuante:

Cada peso: 16 bits (FP16) é o padrão para a IA moderna. Milhares de milhões de pesos. Faz as contas:

1 mil milhões de parâmetros × 16 bits = 2GB só para os pesos. Mais ativações. Mais o estado do otimizador durante o treino. A memória explode.

Para inferência, ainda precisa de 2GB para um modelo FP16 de 1B parâmetros. Os dispositivos de ponta têm dificuldades. Os telemóveis não conseguem lidar com isto. A compressão é necessária.

Modelos Binários:

Cada peso: 1 bit. Literalmente. 16× menos memória do que FP16.

1 mil milhões de parâmetros × 1 bit = 125MB. Cabe facilmente em telemóveis. Dispositivos embutidos. IoT. A eficiência de memória permite a implementação em todo o lado.

A Abordagem Dweve:

Armazenamento de restrições binárias. Cada restrição é um padrão binário. Conhecimento massivo numa pegada de memória minúscula. Os 456 conjuntos de restrições especializadas por domínio da Loom cabem na memória de trabalho em hardware padrão.

Não porque comprimimos de forma inteligente. Porque a representação binária é fundamentalmente mais eficiente para relações lógicas.

O Que Precisa de Lembrar

  • 1. A memória de IA não é memória humana. Os pesos codificam padrões. As janelas de contexto processam entradas. Nenhuma funciona como a memória biológica.
  • 2. As janelas de contexto têm limites rígidos. Os modelos literalmente não conseguem ver para além da sua janela. A informação é descartada. As conversas são truncadas.
  • 3. A eficiência de memória varia enormemente. FP16: 2GB por mil milhões de parâmetros. Binário: 125MB. Diferença de 16×. Permite ou impede a implementação.
  • 4. "Lembrar" é muitas vezes uma ilusão. As aplicações fornecem o histórico da conversa. Os sistemas de recuperação procuram factos. O modelo apenas processa o que lhe é dado.
  • 5. Arquiteturas diferentes, memórias diferentes. Transformers: contexto simultâneo. RNNs: estado sequencial. Sistemas de restrições: relações discretas.
O armazenamento FP16 e binário não são escolhas de implementação menores; a pegada decide se a implementação cabe no dispositivo.

A Conclusão Final

A memória de IA não tem nada a ver com a memória humana. Nós lembramo-nos continuamente, atualizamos com flexibilidade, recuperamos com fiabilidade. A IA tem parâmetros e janelas de contexto. É só isso.

A ilusão de memória vem de engenharia inteligente. Aplicações que fornecem novamente o contexto. Sistemas de recuperação que procuram factos. Consultas a bases de dados disfarçadas de recordação.

Compreender isto ajuda-o a trabalhar com IA de forma eficaz. Conhecer os limites. Trabalhar dentro deles. Não esperar memória semelhante à humana de sistemas fundamentalmente diferentes.

As redes binárias oferecem eficiência de memória. Os sistemas de restrições oferecem melhor isolamento do conhecimento. Mas nenhum resolve o problema fundamental: a memória de IA é arquitetural, não cognitiva. Parâmetros e janelas, não neurónios e sinapses.

Quer IA eficiente em memória? Explore a Dweve Loom. Representação de restrições binárias. 456 conjuntos especializados por domínio em memória de trabalho. Relações lógicas discretas. O tipo de codificação de conhecimento que respeita as restrições de memória.

A sensação de recordação geralmente vem da orquestração à volta do modelo: contexto, recuperação, bases de dados e um prompt novo.