Dweve

Tokenefficiënt dataformaat voor LLM's | Dweve HEDL

HEDL noemt tabelkolommen één keer en zet elk record achter een pipe, zodat een tabel naar een taalmodel minder dan de helft van de bytes van JSON bevat.

Kies de doelgroep die bij je vraag past

De pagina bevat drie selecteerbare lezingen van hetzelfde onderwerp.

Voor consumenten

HEDL (Hierarchical Entity Data Language) is een open-source tekstformaat onder de Apache 2.0-licentie voor lijsten die je naar LLM's stuurt. De kolomlabels staan één keer bovenaan; in elke rij blijven dezelfde feiten staan.

Voor bedrijven

HEDL (Hierarchical Entity Data Language) is een open-source, tokenefficiënt tabelformaat onder de Apache 2.0-licentie voor LLM-verzoeken. Begin lokaal met cargo add hedl; herhaalde labels verdwijnen terwijl conversie lokaal en omkeerbaar blijft. In één gemeten run waren 500 platte records 48,7% kleiner dan minified JSON.

Voor engineers

HEDL (Hierarchical Entity Data Language) is een open-source, tokenefficiënt tekstformaat onder de Apache 2.0-licentie voor LLM's en gestructureerde records. De Rust-reader, writer, validators en servers houden het formaat controleerbaar en omkeerbaar.

Multi-agentorkestratie met HEDL in elke laag.

Ophalen in minder dan een milliseconde voor rijkere prompts.

Op inhoud geadresseerde parseerpijplijn.

Installeer HEDL, draai de MCP-server voor je tools en zie het tokenverbruik dalen. Benchmarkcorpus in de repository.

Zelfde semantiek, dichtere codering, exact hersteld.

Verwijder de proxy en je zit weer op JSON.

Rust-core zonder dependencies en zonder unsafe code.

Geen leverancier in het pad. Conversie draait lokaal.

HEDL wordt geleverd als Rust-library, MCP-server en WASM-component. De kernparser heeft geen dependencies en geen unsafe code; conversie werkt lokaal, in beide richtingen en zonder verlies voor de ondersteunde formaten.

Bibliotheek, MCP-server en WASM gebruiken hetzelfde verliesvrije conversiepad.

Direct inzetbare server, zonder wijzigingen aan de app.

Agentpijplijnen, retrieval en batchextractie: overal waar LLM-tokens per volume worden afgerekend. De besparing groeit naarmate reeksen toolaanroepen langer worden. Dezelfde data gaat erin en dezelfde antwoorden komen eruit; alleen het bedrag op de factuur verandert.

Verliesloze round-trip in beide richtingen

Schemaparser, positionele encoder, MCP-adapter

Converteren, valideren, linten, formatteren

Voor elke tool, zonder wijzigingen aan de app

Plaats de MCP-server en je agentstack spreekt HEDL richting het model en JSON richting je applicatie, zonder wijzigingen aan de applicatiecode. De proxy registreert voor elk verzoek het aantal tokens vóór en na de conversie. Een Rust-crate, CLI en WASM-build dekken ingebed gebruik en de browser.

Gemeten op 571 extractietaken over 7 datasets, uitgevoerd op Mistral Large, DeepSeek Chat en NVIDIA GLM-4.7.

De waarden die je wilde versturen. In HEDL blijft daarvan bijna alles over.

Een paar aanhalingstekens rond elke string, ook als die ondubbelzinnig is.

Accolades en vierkante haken die structuur markeren die het schema al kent.

Dezelfde veldnamen, opnieuw betaald voor elk record.

JSON is het universele uitwisselingsformaat, maar als LLM-invoer is het verspillend. Herhaalde veldnamen, structurele haakjes en aanhalingstekens rond elke string zijn bytes waarvoor je betaalt, zonder dat ze betekenis toevoegen. Isoleer hieronder elk onderdeel om precies te zien waaraan je tokenbudget opgaat.

Gemiddelde over 3 modellen en 7 datasets

We gingen er niet van uit dat LLM's een compacter formaat zouden begrijpen. We hebben het getest. In één gemeten run met 571 gestructureerde extractievragen op 7 datasets uit de praktijk gebruikte HEDL 56 procent minder tokens dan JSON en noteerde het de hoogste nauwkeurigheid van de formaten in die run. Het resultaat hoort bij dat model, corpus en die testopzet.

JSON naar HEDL en terug, byte voor byte.

Zelfde records, schema eenmaal gedeclareerd.

HEDL declareert een schema één keer en codeert records daarna positioneel. Geen herhaalde veldnamen. Geen haakjes voor nesting. Strings hebben standaard geen aanhalingstekens. Kies een dataset en zie de tokentelling dalen terwijl de data identiek blijft. De round-trip verloopt zonder verlies.

Ontworpen en onderhouden in Europa; de conversie draait waar je haar inzet.

De Rust-core heeft geen dependencies en geen unsafe code.

Het belt niet naar huis. Niets overschrijdt een grens die jij niet hebt goedgekeurd.

Geen leverancier in het pad. Conversie draait lokaal op je eigen machines.

Conversie draait op je eigen machines, in een EU-regio of volledig offline. HEDL belt niet naar buiten en heeft geen externe dienst nodig, zodat gestructureerde data binnen je bestaande grens blijft.

Verwijder de proxy en ieder achterliggend systeem blijft gewone JSON ontvangen.

Dezelfde direct inzetbare laag, waar die ook loont.

Echte tokentellingen, gelogd per verzoek.

Eén AI-workflow, zonder iets anders aan te raken.

Er is geen grote migratie nodig. Plaats de converter voor één AI-workflow, vergelijk de gelogde tokenaantallen en breid alleen uit waar de besparing standhoudt. Het pad is omkeerbaar: verwijder de proxy en ieder achterliggend systeem blijft gewone JSON gebruiken.

Verwijder de converter; databases en rapporten blijven gewone JSON ontvangen.

Conversie gebeurt aan de rand, dus je databases en rapporten veranderen nooit.

Parquet voor datalakes en Neo4j Cypher voor grafdatabases, in beide richtingen.

JSON, YAML, XML en CSV, de formaten die de meeste teams al dagelijks uitwisselen.

Je hoeft niets te vervangen. HEDL zet de formaten die je systemen al gebruiken in beide richtingen om en staat als één tussenlaag voor je AI-tools. De compacte vorm bestaat alleen onderweg naar het model. De rest van je systeem blijft dezelfde datastructuren zien als voorheen.

De meter schaalt hetzelfde tarief op en neer, dus je kunt een bedrag aflezen dat dicht bij je werkelijke gebruik ligt.

De besparing bestaat simpelweg uit de tokens die HEDL verwijdert. Minder versturen betekent minder betalen voor dezelfde data.

Het gepubliceerde referentiepunt: een dienst met één miljard tokens per maand bespaart 1.680 dollar per maand door over te stappen van JSON.

Tokens worden op volume gefactureerd en HEDL verstuurt voor dezelfde data 56 procent minder tokens. Kies de omvang die bij je gebruik past en zie de maand- en jaarbedragen veranderen. Het gepubliceerde referentiepunt is een dienst met één miljard tokens per maand, die 1.680 dollar per maand bespaart.

Elke AI-aanroep wordt per token afgerekend en een groot deel van dat budget bestaat uit syntaxis in plaats van data. In de gemeten run verstuurde HEDL hetzelfde verzoek met 56 procent minder tokens en lag het 10,3 procentpunt hoger dan JSON. Dat is bewijs voor deze opzet, naast een lagere rekening, zonder de systemen verderop te wijzigen.

Wat het bespaart en welke risico's het verlaagt

Het benchmarkcorpus en de round-tripcontroles maken het effect vóór productie zichtbaar.

Het spreekt gewoon JSON met de rest van je stack. Verwijder het en je bent terug op JSON, byte voor byte.

Eén compacte laag staat vóór het model; de rest van je systemen blijft JSON spreken.

HEDL voegt één compacte uitwissellaag vóór het model toe, terwijl iedere database, ieder rapport en iedere applicatie JSON blijft spreken. Draai de conversie lokaal, meet dit op één workflow en verwijder het zonder datamigratie als de cijfers niet standhouden.

Minder woorden om af te rekenen, met hetzelfde antwoord aan het eind.

Ieder compact bericht wordt hersteld en gecontroleerd voordat het antwoord je bereikt.

Het verandert alleen hoe het bericht voor verzending wordt opgevouwen.

Je ziet HEDL nooit of raakt het aan. Het zit achter de helper.

HEDL is een klein onderdeel dat AI-helpers goedkoper maakt om te draaien, zonder te veranderen wat ze terugzeggen. Je installeert het niet, je stelt het niet in, en je hoeft het niet te begrijpen. Hier is de hele belofte, in vier korte regels.

Nee. Het volledige bericht wordt hersteld voordat het wordt gebruikt.

De volledige versie komt woord voor woord terug.

Je installeert het nooit of schakelt het nooit in.

Het is normaal om vragen te hebben; geen enkele vraag is gek. Dit zijn de vijf vragen die mensen het vaakst stellen, elk met een helder antwoord zonder iets te verbergen. Tik op een vraag om het antwoord te lezen.

De labels worden één keer geschreven, niet op elke regel.

De helper hoeft minder te lezen om je antwoord te geven.

Je start HEDL nooit en ziet het zelfs niet. Maar telkens wanneer een van die AI-helpers een klus voor je doet, werkt HEDL stilletjes op de achtergrond en maakt het de helper goedkoper om te gebruiken. Kies een moment en bekijk wat er achter de schermen gebeurt.

Het compacte bericht wordt teruggezet naar de volledige versie en gecontroleerd voordat het wordt gebruikt.

Ja. De korte manier vouwt terug naar de lange manier, woord voor woord.

Nee. De betekenis blijft exact hetzelfde, elke keer.

Nee. Je ziet het nooit of stelt het nooit in. Het doet zijn werk vanzelf.

Stel dat je hetzelfde adres op honderd enveloppen schrijft. Je kunt het adres telkens volledig uitschrijven, of één keer vastleggen en daarna een korte verwijzing gebruiken. De brieven komen nog steeds aan. HEDL kiest die kortere route. Dit merk jij daarvan.

Niets wordt weggelaten, niets verandert.

Minder woorden betekent minder om af te rekenen.

Hetzelfde bericht, in minder woorden gezegd.

Vier dingen die de moeite waard zijn om te weten

Geen technische termen en geen grafieken. Alleen het idee, zoals je het aan een vriend zou uitleggen. HEDL is een kortere manier waarop computers hetzelfde tegen een AI-helper zeggen, zodat hetzelfde antwoord minder kost.

+10,3 procentpunt gemiddeld ten opzichte van JSON

HEDL staat vóór je AI-tools en verstuurt dezelfde verzoeken met 56 procent minder tokens, terwijl de rest van je stack gewoon JSON blijft spreken. Zo daalt de tokenrekening, is er een nauwkeurigheidsverschil uit één benchmarkrun en kan conversie op je eigen machines draaien zonder data naar een andere dienst te verplaatsen.

Minder woorden betekent een kleinere rekening

Een kortere manier om hetzelfde te zeggen

Je hoeft geen technische termen te kennen om dit te volgen. Wanneer een computer met zo'n AI-helper praat, verstuurt hij veel woorden en voor elk woord wordt betaald, ongeveer zoals bij een telefoonrekening per woord. HEDL zegt precies hetzelfde met veel minder woorden. Er valt niets weg, de betekenis blijft gelijk en het antwoord dat je terugkrijgt verandert niet. Het kost alleen minder en je hoeft er niets voor te doen.