Token Efficient Data Format for LLMs | Dweve HEDL

HEDL names a table columns once and writes each record behind a pipe, so a table sent to a language model carries under half the bytes it does as JSON.

Multi-agent-orchestrering med HEDL hele vejen igennem.

Sub-millisekund-hentning til rigere prompter.

Installer HEDL, kør MCP-serveren foran dine værktøjer, og se token-forbruget falde. Benchmark-korpus ligger i repositoryet.

Samme semantik, tættere kodning, gendannes præcist.

Fjern proxyen, og du er tilbage på JSON.

Rust-kernel med nul afhængigheder og ingen usikker kode.

Ingen leverandør i stien. Konvertering kører lokalt.

HEDL leveres som et Rust-bibliotek, en MCP-server og en WASM-komponent. Kerneparseren har nul afhængigheder og ingen usikker kode; konvertering er lokal, tovejs og tabsfri på tværs af de understøttede formater.

Bibliotek, MCP-server og WASM udstiller den samme tabsfri konverteringssti.

Gennemsnit på tværs af 7 benchmark-datasæt.

Agent-pipelines, hentning, batch-ekstraktion, overalt hvor LLM-tokens faktureres efter volumen. Besparelserne vokser, når værktøjskæder bliver længere. Samme data ind, samme svar ud, det eneste der ændrer sig er tallet på fakturaen.

Schema-parser, positionsenkoder, MCP-adapter

Front til ethvert værktøj, nul app-ændring

Drop MCP-serveren ind, og din agent-stak taler HEDL upstream og JSON downstream uden ændringer i applikationskoden. Proxien logger token-antal før og efter på hver anmodning. En Rust-crate, en CLI og en WASM-build dækker embedded og browser-brug.

Målt på 571 ekstraktionsopgaver på tværs af 7 datasæt, kørt på Mistral Large, DeepSeek Chat og NVIDIA GLM-4.7.

De værdier, du havde til hensigt at sende. I HEDL er næsten alt det tilbage.

Et citatpar omkring hver streng, selv de utvetydige.

Klammeparenteser og kantede parenteser, der markerer struktur, som skemaet allerede kender.

De samme feltnavne, betalt igen for hver post.

JSON er det universelle udvekslingsformat, men som LLM-input er det spild. Gentagne feltnavne, strukturelle parenteser og citattegn omkring hver streng er bytes, du betaler for, som ikke bærer nogen betydning. Isolér hver del nedenfor for at se præcis, hvad dit token-budget køber.

Gennemsnit på tværs af de 7 benchmark-datasæt.

Gennemsnit på tværs af 3 modeller og 7 datasæt

Vi antog ikke, at LLM'er ville forstå et tættere format. Vi testede det. I én målt kørsel på tværs af 571 strukturerede ekstraktionsspørgsmål på 7 virkelige datasæt brugte HEDL 56 procent færre tokens end JSON og opnåede den højeste præcision blandt formaterne i den kørsel. Resultatet tilhører den model, det korpus og den testopsætning.

JSON til HEDL og tilbage, byte for byte.

HEDL erklærer et skema én gang og koder derefter poster positionelt. Ingen gentagne feltnavne. Ingen parenteser til indlejring. Strenger uden anførselstegn som standard. Vælg et datasæt, og se tokenantallet falde, mens dataene forbliver identiske. Turen frem og tilbage er tabsfri.

Designet og vedligeholdt i Europa, med konvertering, der kører, uanset hvor du implementerer det.

Rust-kernen har nul afhængigheder og ingen usikker kode.

Den ringer ikke hjem. Intet krydser en grænse, du ikke har godkendt.

Ingen leverandør i vejen. Konvertering kører lokalt på dine egne maskiner.

Konvertering kører på dine egne maskiner, i en EU-region eller helt offline. HEDL ringer ikke hjem og har ikke brug for nogen ekstern tjeneste, så strukturerede poster forbliver inden for den grænse, du allerede opererer inden for.

Fjern proxien, og alle nedstrømssystemer fortsætter med almindelig JSON.

Den samme drop-in, hvor det betaler sig.

Rigtige tokenantal, logget pr. anmodning.

Der er ingen big-bang-migrering at planlægge. Sæt konverteren foran én AI-arbejdsgang, sammenlign de loggede tokenantal, og udvid derefter kun, hvor besparelsen holder. Vejen er reversibel: fjern proxien, og alle nedstrømssystemer fortsætter med almindelig JSON.

Fjern konverteren; databaser og rapporter bliver ved med at modtage almindelig JSON.

Den konverterer i kanten, så dine databaser og rapporter aldrig ændrer sig.

Parquet til datasøer og Neo4j Cypher til grafdatabaser, begge retninger.

JSON, YAML, XML og CSV, de former, de fleste teams allerede udveksler hver dag.

Ingen skal rive noget ud. HEDL konverterer til og fra de formater, dine systemer allerede bruger, i begge retninger, og sidder foran dine AI-værktøjer som en enkelt drop-in. Den tætte version findes kun på turen til modellen. Alt nedstrøms ser de former, det altid har gjort.

Måleren skalerer med samme rate op og ned, så du kan aflæse et tal tæt på dit faktiske forbrug.

Besparelsen er simpelthen de tokens, HEDL fjerner. Mindre at sende betyder mindre at betale for, ved samme data.

Den offentliggjorte reference: en tjeneste med en milliard tokens om måneden sparer 1.680 dollars om måneden ved at skifte fra JSON.

Tokens faktureres efter volumen, og HEDL sender 56 procent færre af dem for samme data. Vælg den størrelse, der ligner dit forbrug, og se de månedlige og årlige tal ændre sig. Det offentliggjorte referencepunkt er en tjeneste med en milliard tokens om måneden, som sparer 1.680 dollars om måneden.

Hvert AI-kald prissættes per token, og meget af det budget er syntaks frem for data. HEDL sendte den samme anmodning med 56 procent færre tokens i den målte kørsel og viste en +10,3 pp nøjagtighedsforskel fra JSON der. Det er dokumentation fra dette setup, sammen med en lavere regning, uden at ændre downstream-systemer.

Benchmark-korpus og round-trip-kontroller gør effekten synlig før produktion.

Det taler almindelig JSON til resten af din stack. Fjern det, og du er tilbage på JSON, bit for bit.

Et kompakt lag ligger foran modellen; resten af dine systemer fortsætter med at tale JSON.

HEDL tilføjer et kompakt udvekslingslag foran modellen, mens hver database, rapport og applikation fortsætter med at tale JSON. Kør konverteringen lokalt, mål den på én arbejdsgang, og fjern den uden en datamigrering, hvis tallene ikke holder.

Færre ord at betale for, med samme svar til sidst.

Hver kompakt besked gendannes og kontrolleres, før svaret når dig.

Det ændrer kun, hvordan beskeden foldes til afsendelse.

Du ser aldrig HEDL eller rører ved det. Det ligger bag hjælperen.

HEDL er ét lille stykke, der gør AI-hjælpere billigere at køre, uden at ændre, hvad de siger tilbage til dig. Du installerer det ikke, du sætter det ikke op, og du behøver ikke forstå det. Her er hele løftet i fire korte linjer.

Nej. Den fulde besked gendannes, før den bruges.

Den fulde version kommer tilbage ord for ord.

Du installerer den aldrig eller tænder for den.

Det er normalt at have spørgsmål, og der er ingen dumme spørgsmål. Her er de fem, folk spørger om oftest, hver med et klart svar og intet skjult bagved. Tryk på et spørgsmål for at læse svaret.

Den kommer tilbage præcis, som den startede.

Etiketterne skrives én gang, ikke på hver linje.

Dobbelt så meget af det passer på én gang.

Hjælperen læser mindre for at svare dig.

Du vil aldrig starte HEDL eller endda se det. Men hver gang en af de AI-hjælpere laver et stykke arbejde for dig, er det stille og roligt der og gør hjælperen billigere at køre. Vælg et øjeblik og se, hvad det laver bag kulisserne.

Den kompakte besked bliver forvandlet tilbage til den fulde version og kontrolleret, før den bruges.

Ja. Den korte vej folder tilbage til den lange vej, ord for ord.

Nej. Betydningen forbliver præcis den samme, hver gang.

Nej. Du ser den aldrig eller sætter den op. Den gør sit arbejde på egen hånd.

Tænk på at skrive den samme adresse på hundrede konvolutter. Du kunne skrive den fuldt ud hver gang eller skrive den én gang og holde den kort på resten. Brevene ankommer stadig. HEDL gør den korte måde for dig, og her er, hvad det betyder for din side af sagen.

Ingen tekniske ord, ingen diagrammer. Bare idéen, som du ville forklare den til en ven. HEDL er en kortere måde for computere at sige det samme til en AI-assistent, så det samme svar koster mindre at få.

HEDL sidder foran dine AI-værktøjer og sender de samme anmodninger med 56 procent færre tokens, mens den taler almindelig JSON til resten af din stack. Intet nedstrøms ændres: resultatet er en lavere token-regning, en nøjagtighedsforskel målt i én benchmark-kørsel, og konvertering, der kan køre på dine egne maskiner uden at flytte data til en anden tjeneste.

Du behøver ikke at kende nogen af de tekniske ord for at følge med. Når en computer taler med en af de AI-assistenter, sender den mange ord, og hvert ord betales for, lidt som en telefonregning, der tælles per ord. HEDL er en måde at sige præcis det samme med langt færre ord. Intet udelades, betydningen forbliver den samme, og det svar, du får tilbage, ændres ikke. Det koster bare mindre, og du behøver aldrig at røre ved det.

Hver API-kald til en stor sprogmodel prissættes pr. token. Det meste af token-budgettet er ikke data; det er overhead: gentagne feltnavne, indlejrede parenteser, anførselstegn omkring hver streng. HEDL sendte præcis den samme information med 56 procent færre tokens i en benchmark-kørsel på tværs af 571 ekstraktionsopgaver og 7 datasæt, med en +10,3 procentpoint nøjagtighedsforskel fra JSON i den kørsel. Drop MCP-serveren ind, og din eksisterende JSON-pipeline fungerer præcis som før.

HEDL (Hierarchical Entity Data Language) er et open source, token-effektivt tekstdataformat under Apache 2.0 til LLM'er og strukturerede poster. Dets Rust-læser, -skriver, -validatorer og -servere holder formatet inspekterbart og reversibelt.