Context Compression for LLMs in Rust | Signum

Signum is a Rust library and CLI for deterministic context compression before an LLM call. Publishing in the third release round.

Mais curto por regra. Pronto a inspecionar.

Assim que o repositório for publicado, lê as notas de implementação, executa o binário local e coloca o resultado ao lado da passagem que o produziu. O Signum chega na terceira ronda do programa de lançamento da fundação, com a documentação disponível no mesmo dia.

Um formato de dados denso com idas e voltas publicadas.

Um percurso limitado de uma pergunta até evidência com fonte.

Um modelo tecido que deixa um rasto ao lado da resposta.

tarefa de migração não terminar ligação réplica caiu 30 segundos.

O nível move um corte numérico através de uma classificação fixa de palavras. Também aprofunda a penalização de palavras de ligação à medida que a definição aumenta dentro da passagem.

As posições afixadas passam à frente do orçamento, independentemente da sua classificação. As próximas proteções explicam onde a correção, e não a preferência, reside.

Oito tipos de extensão tornam-se substitutos numerados antes da primeira pontuação. Cabeçalhos, citações, tabelas e linhas delimitadas são mantidos como linhas inteiras.

Após a compressão, os marcadores de posição são restaurados, quer sejam escritos normalmente quer em minúsculas. O resultado permanece byte-idêntico onde uma pessoa ou máquina precisa de confiar nele.

O teto é concedido antes de os bónus ordinários poderem ser contados. Nenhuma combinação de comprimento, maiúsculas ou raridade o alcança.

Isso torna uma negação uma garantia em vez de um provável sobrevivente. Importa sempre que uma afirmação oposta aparentemente limpa criaria um erro silencioso.

A verificação retroativa percorre pequenas palavras entre uma partícula e o seu verbo. Quando encontra uma ação, ambas as posições ganham peso forçado.

Uma partícula isolada não ganha nada e pode cair com o preenchimento. Essa distinção mantém "set up" enquanto permite que uma preposição comum passe.

Quarenta e nove reduções são acionadas sem contexto antes de a classificação começar. Outras dezasseis esperam pela palavra seguinte antes de agir.

Uma maiúscula, dígito, caráter de caminho ou termo declarado abre o portão. Um substantivo comum deixa a frase intocada porque a afirmação mudaria.

Prosa e código usam todas as cinco posições, enquanto a saída de ferramentas tem três. Cinco classes moldadas por máquina aterram numa posição sem ler o mostrador.

Um registo, diff ou conjunto de registos produz, portanto, o mesmo resultado em qualquer definição do chamador. A classificação resolve o tratamento antes de a compressão começar.

Uma passagem estrutural trata cada linha pela sua função. Tabelas e regras passam, enquanto parágrafos e cortesia podem ser encurtados.

Uma volta de conversa que contém evidência permanece intacta. Cada substituição é mantida apenas quando é menor do que o original.

A passagem de secção admite uma secção acima do teto enquanto abaixo do piso. Impede que um documento se torne demasiado leve para responder.

A passagem de frase obedece apenas ao teto e pode cortar dentro de uma secção. O despachante tenta primeiro a rota de dois limites.

As palavras marcadoras são contadas em trinta e cinco códigos, com marcadores únicos valendo três vezes mais do que os partilhados. Um idioma precisa de ultrapassar um limiar antes de as suas regras se aplicarem.

O húngaro, o finlandês e o estónio são reduzidos à raiz antes da consulta, quando necessário. Um resultado incerto recorre a regras gerais e remove menos.

Cada fase mantém um resultado apenas quando este usa menos tokens do que a sua entrada. Uma passagem curta regressa exatamente como chegou, inalterada.

Compressores separados devolvem a mesma saída porque nada é amostrado. Os testes afirmam tanto o limite de tamanho como a repetibilidade.

Remoção, semelhança e legibilidade pertencem à mesma execução medida. A legibilidade verifica que uma poupança mais forte não deturpou a prosa.

O corpus era de 5.520 frases de cinquenta documentos técnicos com consulta ativada. Um corpus diferente precisa da sua própria medição, em vez de uma promessa emprestada.

Cada frase é comparada com a consulta usando três codificações de gramas. A sobreposição de palavras-chave pontua o resto.

Metade sobrevive, com um mínimo de três, e depois retorna na ordem original. Uma passagem com menos de quatro frases retorna como foi escrita.

A metade de saída de uma fatura modelo é a metade que a sua equipa pode alterar. É contexto montado, muitas vezes enviado inalterado mais do que uma vez.

Uma regra local remove esse suporte antes da chamada paga. Não cria uma segunda fatura nem altera a resposta que ainda tem de ser gerada.

Um revisor pode nomear cada palavra removida pela regra que a removeu. A cópia marcada dá-lhes algo concreto para inspecionar e assinar.

Um resumo deixa apenas um julgamento para confiar contra a memória. A frase sobre a qual alguém pergunta mais tarde é precisamente a que pode ter desaparecido.

O encurtamento decorre no processo que já contém o documento. Nenhum endpoint, fila de fornecedor ou processador extra recebe uma cópia.

O passo baseado em regras permanece com o código que trata do documento.

Resultados estáveis tornam documentos repetidos entradas de cache úteis. Os testes afirmam a saída exata em vez de algo meramente plausível.

Uma diferença entre duas execuções é então uma descoberta, não ruído. Isso dá a uma revisão de incidente posterior uma parte fixa e inspecionável do seu registo.

Comandos, referências e texto de erro citado ficam completamente fora do encurtamento. Nove palavras inglesas que invertem uma afirmação também são protegidas.

Um comando copiado ainda é executado e um erro citado ainda pode ser pesquisado. Uma frase não pode mudar silenciosamente para o seu oposto numa definição alta.

Um componente cobre cartas cuidadosas a clientes e registos de máquina bruscos. A classificação decide se uma definição de chamada é sequer relevante.

Registos, diffs e registos podem ser corrigidos ou seguir uma rota densa separada. Isso mantém a aquisição num único componente em vez de várias ferramentas.

A passagem de documento honra tanto um teto como um mínimo. O seu piso mantém uma passagem mais curta suficientemente substancial para responder à pergunta.

A passagem de frase honra apenas o teto quando a janela é tudo o que importa. A escolha pertence à revisão de código, não a uma decisão manual apressada.

O componente decide o idioma a partir do texto, não da configuração do inquilino. Um limiar impede uma leitura incerta de aplicar as regras erradas.

Cada código reconhecido traz as suas próprias palavras funcionais e substituições. Idiomas com terminações pesadas são reduzidos à raiz antes de a pesquisa começar.

Cada resposta da ferramenta carrega bytes de entrada, bytes de saída e a poupança resultante. O seu próprio tráfego fornece, portanto, a evidência desde a primeira chamada.

Uma semana de prompts reais transforma o caso numa soma em vez de uma estimativa. Nenhum sistema de monitorização separado tem de medir o mesmo trabalho novamente.

O software remove o excesso antes de uma IA ler um relatório longo. Mais do que colou pode caber no mesmo pedido.

Funciona dentro da ferramenta que já trata do relatório. Nada extra é enviado simplesmente para tornar o texto mais curto.

Um resumo pede a algo que decida o que importa no seu documento. Regras fixas apenas removem os tipos de palavras escritas na sua lista.

Pode juntar as duas cópias e ver cada palavra que saiu. Isso é mais seguro do que confiar na memória quando uma frase em falta importa.

Algumas palavras longas são trocadas por uma palavra mais curta de uma tabela fixa. A mesma palavra recebe a mesma troca em todos os documentos.

O resultado pode soar seco em vez de polido. O seu sentido permanece presente e o próximo leitor precisa desse sentido, não da formulação formal.

Códigos, links e texto de erro exato são retirados antes de qualquer encurtamento começar. Cabeçalhos e linhas de tabela permanecem no lugar pela mesma razão.

Um caráter errado pode impedir uma pesquisa, formulário ou comando de funcionar. Essas referências retornam exatamente como foram escritas.

O encurtamento acontece na máquina que já tem o texto. Nenhuma nova empresa recebe um documento para o tornar mais pequeno.

O mesmo parágrafo também retorna o mesmo parágrafo mais curto amanhã. Se mudar, algo mudou na entrada ou nas regras, não uma opinião.

O Signum determina o idioma a partir das palavras e letras da mensagem. Não etiqueta um documento nem o configura antes de o enviar.

Se não tiver a certeza, usa regras gerais e remove menos. As terminações saem primeiro em idiomas onde escondem a palavra subjacente.

veículo de substituição · excesso · cobertura

Signum é uma biblioteca Rust para compressão determinística de prompts antes de uma chamada de LLM. Pontua e encurta o contexto dentro do processo que já o contém, devolve o mesmo resultado para a mesma entrada e não faz nenhuma chamada de modelo nem pedido de rede. As regras que decidem o que é cortado merecem leitura: a Signum publica na terceira ronda do programa de lançamento da fundação.

O Signum atribui uma pontuação a cada palavra com base em cinco sinais contáveis: comprimento, maiúsculas dentro de uma frase, dígitos, posição e raridade na sua área. O nível altera a quantidade dessa classificação que sobrevive, nunca o significado da passagem.