Token Efficient Data Format for LLMs | Dweve HEDL

HEDL names a table columns once and writes each record behind a pipe, so a table sent to a language model carries under half the bytes it does as JSON.

Multi-agent orchestrace s HEDL v celém průběhu.

Vyhledávání pod milisekundu pro bohatší výzvy.

Nainstalujte HEDL, spusťte MCP server před svými nástroji a sledujte, jak spotřeba tokenů klesá. Benchmark korpus je v repozitáři.

Stejná sémantika, hustší kódování, přesně obnoveno.

Rust jádro s nulovými závislostmi a bez unsafe kódu.

Žádný dodavatel v cestě. Konverze probíhá lokálně.

HEDL je dodáván jako Rust knihovna, MCP server a WASM komponenta. Základní parser má nulové závislosti a žádný unsafe kód; konverze je lokální, obousměrná a bezeztrátová napříč podporovanými formáty.

Knihovna, MCP server a WASM nabízejí stejnou bezeztrátovou konverzní cestu.

Server bez úprav, nulová změna aplikace.

Průměr napříč 7 benchmark datovými sadami.

Agentní pipeline, vyhledávání, dávková extrakce, kdekoli jsou tokeny LLM účtovány podle objemu. Úspory se sčítají, jak se řetězce volání nástrojů prodlužují. Stejná data vstupují, stejné odpovědi vycházejí, jediné, co se mění, je číslo na faktuře.

Schema parser, poziční kodér, MCP adaptér

Před jakýkoli nástroj, bez změny aplikace

Nasaďte MCP server a váš agentí stack mluví HEDL upstream a JSON downstream bez jakékoli změny kódu aplikace. Proxy loguje počty tokenů před a po každém požadavku. Rust crate, CLI a WASM build pokrývají použití v embedded a prohlížeči.

Měřeno na 571 extrakčních úlohách napříč 7 datovými sadami, běželo na Mistral Large, DeepSeek Chat a NVIDIA GLM-4.7.

Hodnoty, které jste chtěli poslat. V HEDL zůstává téměř jen to.

Uvozovky kolem každého řetězce, i těch jednoznačných.

Složené a hranaté závorky označující strukturu, kterou schéma už zná.

Stejné názvy polí, zaplacené znovu u každého záznamu.

JSON je univerzální výměnný formát, ale jako vstup pro LLM je plýtvavý. Opakované názvy polí, strukturální závorky a uvozovky kolem každého řetězce jsou bajty, za které platíte a které nenesou žádný význam. Izolujte každou část níže a uvidíte přesně, co váš rozpočet tokenů kupuje.

Průměr napříč 7 benchmarkovými datovými sadami.

Průměr napříč 3 modely a 7 datovými sadami

Nepředpokládali jsme, že LLM pochopí hustší formát. Otestovali jsme to. V jednom měřeném běhu napříč 571 strukturovanými extrakčními otázkami na 7 reálných datových sadách použil HEDL o 56 procent méně tokenů než JSON a zaznamenal nejvyšší přesnost mezi formáty v tomto běhu. Výsledek patří tomuto modelu, korpusu a testovacímu nastavení.

Stejné záznamy, schéma deklarované jednou.

Ploché uživatelské záznamy, podle otázky.

HEDL deklaruje schéma jednou a poté zapisuje záznamy pozicionálně. Žádná opakovaná jména polí. Žádné závorky pro vnoření. Řetězce bez uvozovek ve výchozím stavu. Vyberte datovou sadu a sledujte, jak počet tokenů klesá, zatímco data zůstávají identická. Obousměrný převod je bezeztrátový.

Navrženo a udržováno v Evropě, s konverzí běžící tam, kde ji nasadíte.

Rustové jádro má nulové závislosti a žádný bezpečnostně nekorektní kód.

Nevolá domů. Nic nepřekračuje hranici, kterou jste neschválili.

Žádný dodavatel v cestě. Konverze běží lokálně na vašich vlastních strojích.

Konverze běží na vašich vlastních strojích, v regionu EU nebo zcela offline. HEDL nevolá domů a nepotřebuje žádnou externí službu, takže strukturované záznamy zůstávají v rámci hranice, kterou již provozujete.

Odstraňte proxy a všechny navazující systémy pokračují v práci s obyčejným JSON.

Stejná náhrada, všude, kde se to vyplatí.

Skutečné počty tokenů, zaznamenané pro každý požadavek.

Jeden AI pracovní postup, nic jiného se nedotkne.

Není třeba plánovat žádnou migraci velkého třesku. Postavte převodník před jeden AI pracovní postup, porovnejte zaznamenané počty tokenů a poté rozšiřte pouze tam, kde úspora platí. Cesta je vratná: odstraňte proxy a všechny navazující systémy pokračují v práci s obyčejným JSON.

Odstraňte převodník; databáze a sestavy nadále dostávají obyčejný JSON.

Převádí na okraji, takže vaše databáze a sestavy se nikdy nemění.

Parquet pro datové jezera a Neo4j Cypher pro grafové databáze, oběma směry.

JSON, YAML, XML a CSV, tvary, které většina týmů už denně vyměňuje.

Nikdo nemusí nic vytrhávat. HEDL převádí do formátů, které vaše systémy již používají, a z nich, v obou směrech, a stojí před vašimi AI nástroji jako jediná náhrada. Hustá verze existuje pouze na cestě k modelu. Všechno za tím vidí tvary, které vždy vidělo.

Měřidlo škáluje stejným tempem nahoru i dolů, takže si můžete přečíst hodnotu blízkou vaší skutečné spotřebě.

Úspora je jednoduše počet tokenů, které HEDL odstraní. Méně odeslaných dat znamená méně peněz za stejná data.

Publikovaný referenční bod: služba s jedním miliardou tokenů měsíčně ušetří 1 680 dolarů měsíčně přechodem z JSON.

Tokeny se účtují podle objemu a HEDL jich pro stejná data odešle o 56 procent méně. Vyberte velikost, která odpovídá vaší spotřebě, a sledujte, jak se měsíční a roční čísla mění. Publikovaný referenční bod je služba s jedním miliardou tokenů měsíčně, která ušetří 1 680 dolarů měsíčně.

Více použitelných odpovědí za každou utracenou korunu.

Každé volání AI je zpoplatněno za token a velká část tohoto rozpočtu je syntaxe, ne data. HEDL odeslal stejný požadavek s o 56 procent méně tokeny v měřeném běhu a vykázal rozdíl přesnosti +10,3 pp oproti JSON. To je důkaz z tohoto nastavení, spolu s nižším účtem, bez změny navazujících systémů.

Benchmarkový korpus a kontroly zpětného přenosu zviditelní efekt před produkčním nasazením.

Ke zbytku vašeho stacku mluví čistým JSON. Odstraňte ho a jste zpět na JSON, byte po bytu.

Jedna kompaktní vrstva leží před modelem; zbytek vašich systémů nadále mluví JSON.

HEDL přidává jednu kompaktní výměnnou vrstvu před model, zatímco každá databáze, sestava a aplikace nadále mluví JSON. Spusťte konverzi lokálně, změřte ji na jednom pracovním postupu a odstraňte ji bez migrace dat, pokud čísla neplatí.

Méně slov k zaplacení, se stejnou odpovědí na konci.

Každá kompaktní zpráva je obnovena a zkontrolována, než se k vám odpověď dostane.

Mění se jen to, jak je zpráva složena pro odeslání.

HEDL nikdy nevidíte ani se ho nedotýkáte. Sedí za pomocníkem.

HEDL je jeden malý kousek, který dělá AI pomocníky levnějšími na provoz, aniž by měnil to, co vám říkají zpět. Neinstalujete ho, nenastavujete ho a nemusíte mu rozumět. Tady je celý slib ve čtyřech krátkých řádcích.

Ne. Plná zpráva se před použitím obnoví.

Je normální mít otázky a žádná není hloupá. Zde je pět nejčastějších otázek, každá s jasnou odpovědí a bez čehokoli skrytého. Klepnutím na otázku si přečtete odpověď.

Štítky se píší jednou, ne na každém řádku.

HEDL nikdy nespustíte ani neuvidíte. Ale pokaždé, když některý z těch AI pomocníků pro vás dělá práci, je tiše u toho a dělá pomocníka levnějším. Vyberte si okamžik a podívejte se, co dělá v zákulisí.

Kompaktní zpráva se převede zpět na plnou verzi a před použitím se zkontroluje.

Ano. Krátká cesta se složí zpět do dlouhé cesty, slovo od slova.

Ne. Význam zůstává přesně stejný, pokaždé.

Ne. Nikdy to nevidíte ani nenastavujete. Dělá svou práci samo.

Představte si, že píšete stejnou adresu na sto obálek. Mohli byste ji pokaždé napsat celou, nebo ji napsat jednou a na zbytku ji zkrátit. Dopisy stejně dorazí. HEDL to za vás udělá zkráceně, a tady je, co to znamená pro vaši stranu.

Žádná technická slova, žádné grafy. Jen myšlenka, jak byste ji vysvětlili příteli. HEDL je kratší způsob, jak počítače řeknou to samé AI asistentovi, takže stejná odpověď stojí méně.

HEDL stojí před vašimi AI nástroji a posílá stejné požadavky s o 56 procent méně tokeny, zatímco zbytku vašeho systému mluví čistým JSON. Nic se nemění dál po proudu: výsledkem je nižší účet za tokeny, rozdíl v přesnosti změřený v jednom běhu benchmarku a konverze, která může běžet na vašich vlastních strojích bez přesunu dat do jiné služby.

Abyste to pochopili, nemusíte znát žádná technická slova. Když počítač mluví s některým z těch AI asistentů, posílá spoustu slov a každé slovo se platí, trochu jako účet za telefon počítaný za slovo. HEDL je způsob, jak říct přesně to samé s mnohem menším počtem slov. Nic se nevynechá, význam zůstává stejný a odpověď, kterou dostanete, se nemění. Jen to stojí méně a nikdy se o to nemusíte starat.

Každé volání API k velkému jazykovému modelu je zpoplatněno podle tokenů. Většina tohoto rozpočtu tokenů nejsou data, ale režie: opakované názvy polí, vnořené závorky, uvozovky kolem každého řetězce. HEDL odeslal přesně stejné informace s o 56 procent méně tokeny v jednom benchmarkovém běhu napříč 571 extrakčními úlohami a 7 datovými sadami, s rozdílem přesnosti +10,3 procentního bodu oproti JSON v tomto běhu. Přidejte MCP server a váš stávající JSON pipeline bude fungovat přesně jako dříve.

HEDL (Hierarchical Entity Data Language) je open-source textový datový formát šetrný k tokenům pod licencí Apache 2.0 pro LLM a strukturované záznamy. Jeho čtečka, zapisovač, validátory a servery v jazyce Rust udržují formát kontrolovatelný a reverzibilní.

HEDL (Hierarchical Entity Data Language) je open-source tabulkový formát šetrný k tokenům pod licencí Apache 2.0 pro požadavky LLM. Začněte lokálně pomocí cargo add hedl; opakované popisky zmizí, zatímco konverze zůstává lokální a reverzibilní. V jednom měřeném běhu bylo 500 plochých záznamů o 48,7 % menších než minifikovaný JSON.