Context Compression for LLMs in Rust | Signum
Signum is a Rust library and CLI for deterministic context compression before an LLM call. Publishing in the third release round.
Algoritmide rühmitamine andmetüübi järgi
Reegli järgi lühem. Valmis kontrollimiseks.
Kui hoidla avaldatakse, loe juurutamismärkmeid, käivita kohalik binaar ise ja pane tulemus selle lõigu kõrvale, mis selle tekitas. Signum jõuab välja sihtasutuse väljalaskeprogrammi kolmandas voorus, selle dokumentatsioon on sama päeva õhtul saadaval.
Tihe andmevorming avaldatud edasi-tagasi teisendustega.
Piiratud tee küsimusest allikatega tõenditeni.
Kootud mudel, mis jätab vastuse kõrvale jälje.
Migratsioonitöö ei lõppenud, sest ühendus koopiaga katkes pärast 30 sekundit.
migratsioonitöö ei lõppenud ühendus koopia katkes 30 sekundit.
Tase liigutab numbrilise lõike läbi ühe fikseeritud sõnareitingu. See süvendab ka karistust ühendussõnadele, kui seade tõuseb lõigu sees.
Kinnitatud positsioonid pääsevad eelarvest edasi olenemata nende reitingust. Järgmised kaitsed selgitavad, kus õigsus, mitte eelistus, asub.
Kaheksa vahemiku tüüpi muutuvad nummerdatud asendusteks enne esimest skoori. Pealkirjad, tsitaadid, tabelid ja piiritletud read hoitakse tervete ridadena.
Pärast tihendamist taastatakse kohahoidjad, olenemata sellest, kas need on kirjutatud tavapäraselt või väikeste tähtedega. Tulemus jääb baitide kaupa identseks seal, kus inimene või masin peab sellele toetuma.
Lagi antakse enne, kui tavalisi boonuseid saab lugeda. Ükski pikkuse, suurtähtede või harulduse kombinatsioon ei ulatu selleni.
See muudab eituse garantiiks, mitte lihtsalt tõenäoliseks ellujääjaks. See on oluline kõikjal, kus puhta välimusega vastupidine väide tekitaks vaikse vea.
Tagurpidi skaneerimine astub üle väikeste sõnade osakese ja tegusõna vahel. Kui see leiab tegevuse, saavad mõlemad positsioonid sunnitud kaalu.
Üksildane osake ei saa midagi ja võib langeda täiteainega. See eristus hoiab üleval set up, lastes tavalisel eessõnal minna.
Nelikümmend üheksa vähendamist käivituvad ilma kontekstita enne reitingu algust. Kuusteist teist ootavad järgnevat sõna enne tegutsemist.
Suurtäht, number, teepikkuse märk või deklareeritud termin avab värava. Tavaline nimisõna jätab fraasi puutumata, sest väide muutuks.
Proosa ja kood kasutavad kõiki viit positsiooni, samas kui tööriista väljundil on kolm. Viis masinakujulist klassi maanduvad ühele positsioonile ilma sihverplaati lugemata.
Logi, erinevus või kirjete kogum annab seetõttu sama tulemuse igal helistaja seadistusel. Klassifitseerimine otsustab kohtlemise enne tihendamise algust.
Struktuurne läbivaatus käsitleb iga rida selle ülesande järgi. Tabelid ja reeglid lähevad läbi, samas kui lõigud ja viisakus võivad lüheneda.
Vestluspööre, mis sisaldab tõendeid, jääb terveks. Iga asendus säilitatakse ainult siis, kui see on originaalist väiksem.
Jaotise läbivaatus lubab jaotise üle lae, kui see on allpool põrandat. See takistab dokumendi muutumist liiga hõredaks, et vastata.
Lause läbivaatus järgib ainult lage ja võib lõigata jaotise sees. Saatja proovib kõigepealt kahe piiranguga marsruuti.
Märksõnu loendatakse kolmekümne viie koodi lõikes, kusjuures unikaalsed märksõnad on kolm korda väärtuslikumad kui jagatud. Keel peab ületama künnise, enne kui selle reeglid rakenduvad.
Ungari, soome ja eesti keelt tüvitakse enne otsingut, kui vaja. Ebakindel tulemus langeb tagasi üldreeglitele ja eemaldab vähem.
Iga etapp säilitab tulemuse ainult siis, kui see kasutab vähem tokeneid kui sisend. Lühike lõik naaseb täpselt nii, nagu see saabus, muutumatuna.
Eraldi tihendajad tagastavad sama väljundi, sest miski ei valimi. Testid kinnitavad nii suuruse piiri kui ka korratavuse.
Eemaldamine, sarnasus ja loetavus kuuluvad samasse mõõdetud käiku. Loetavus kontrollib, et tugevam kokkuhoid ei rikkunud proosat.
Korpus oli 5 520 lauset viiekümnest tehnilisest dokumendist, kus otsing oli lubatud. Erinev korpus vajab oma mõõtmist, mitte laenatud lubadust.
Iga lauset võrreldakse päringuga kolme grammi kodeeringu abil. Märksõnade kattuvus hindab ülejäänu.
Pooled jäävad ellu, alampiir on kolm, seejärel naastakse algses järjekorras. Lõik, mis on lühem kui neli lauset, jääb muutmata.
Mudeli arve väljuv pool on see pool, mida teie meeskond saab muuta. See on kokku pandud kontekst, mida saadetakse sageli muutmata mitu korda.
Kohalik reegel eemaldab selle tellingu enne tasulist kõnet. See ei loo teist arvet ega muuda vastust, mis tuleb ikkagi genereerida.
Ülevaataja saab nimetada iga eemaldatud sõna reegli järgi, mis selle eemaldas. Märgitud koopia annab neile midagi konkreetset, mida kontrollida ja allkirjastada.
Kokkuvõte jätab ainult hinnangu, mida mälu vastu usaldada. Lause, mille kohta hiljem küsitakse, on just see, mis võis kaduda.
Lühendamine toimub protsessis, mis juba hoiab dokumenti. Ükski lõpp-punkt, tarnija järjekord ega lisaprotsessor ei saa koopiat.
Reeglipõhine samm jääb dokumendiga tegeleva koodi juurde.
Stabiilsed tulemused muudavad korduvad dokumendid kasulikeks vahemälukirjeteks. Testid kinnitavad täpset väljundit, mitte ainult usutavat.
Erinevus kahe käituse vahel on siis leid, mitte müra. See annab hilisemale intsidendiülevaatele ühe fikseeritud ja kontrollitava osa selle arvestuses.
Käsud, viited ja tsiteeritud veateated jäävad lühendamisest täielikult välja. Üheksa ingliskeelset sõna, mis pööravad väite ümber, on samuti kaitstud.
Kopeeritud käsk töötab endiselt ja tsiteeritud viga on endiselt otsitav. Lause ei saa vaikselt muutuda oma vastandiks kõrge seadistuse juures.
Üks komponent katab hoolikad kliendikirjad ja otsekohesed masinalogid. Klassifitseerimine otsustab, kas helistaja seadistus on üldse asjakohane.
Logid, erinevused ja kirjed saab parandada või suunata eraldi tihedale teele. See hoiab hankimise ühes komponendis, mitte mitmes tööriistas.
Dokumendipass austab nii ülempiiri kui ka alampiiri. Selle põrand hoiab lühema lõigu piisavalt sisukana, et küsimusele vastata.
Lausepass austab ainult ülempiiri, kui aken on ainus, mis loeb. Valik kuulub koodiülevaatesse, mitte kiirustatud käsitsi otsusesse.
Komponent määrab keele teksti põhjal, mitte rentniku seadistuse põhjal. Lävi takistab ebakindla lugemise valede reeglite rakendamist.
Iga tuntud kood toob oma funktsioonisõnad ja asendused. Keeled, millel on rasked lõpud, tüvistatakse enne otsingu algust.
Iga tööriista vastus kannab sisse baite, välja baite ja sellest tulenevat kokkuhoidu. Teie enda liiklus annab seega tõendid esimesest kõnest alates.
Nädal päris päringuid muudab juhtumi summaks, mitte hinnanguks. Ükski eraldi seiresüsteem ei pea sama tööd uuesti mõõtma.
Tarkvara eemaldab täidise enne, kui AI loeb pikka aruannet. Rohkem sellest, mida kleepisite, mahub samasse päringusse.
See töötab tööriista sees, mis juba aruannet töötleb. Midagi lisaks ei saadeta minema ainult selleks, et teksti lühemaks muuta.
Kokkuvõte palub millelgi otsustada, mis teie dokumendis oluline on. Fikseeritud reeglid eemaldavad ainult selliseid sõnu, mis on nende nimekirjas.
Saate panna kaks koopiat kõrvuti ja näha iga sõna, mis läks. See on ohutum kui mälule lootmine, kui puuduv lause on oluline.
Mõned pikad sõnad vahetatakse lühema sõna vastu fikseeritud tabelist. Sama sõna saab igas dokumendis sama vahetuse.
Tulemus võib kõlada lühidalt, mitte viimistletult. Selle mõte jääb alles ja järgmine lugeja vajab seda mõtet, mitte formaalset sõnastust.
Koodid, lingid ja täpne hoiatustekst tõstetakse välja enne lühendamise algust. Pealkirjad ja tabeliread jäävad samal põhjusel paigale.
Üks vale märk võib peatada otsingu, vormi või käsu töötamise. Need viited naasevad täpselt nii, nagu need olid kirjutatud.
Lühendamine toimub masinas, millel tekst juba on. Ükski uus ettevõte ei saa dokumenti selleks, et seda väiksemaks muuta.
Sama lõik tagastab homme ka sama lühema lõigu. Kui see muutub, muutus midagi sisendis või reeglites, mitte arvamus.
Signum määrab keele sõnumis olevate sõnade ja tähtede põhjal. Te ei märgista dokumenti ega konfigureeri seda enne saatmist.
Kui see pole kindel, kasutab see üldreegleid ja eemaldab vähem. Lõpud tulevad esimesena maha keeltes, kus need peidavad all oleva sõna.
Signum on Rusti teek deterministlikuks viipade tihendamiseks enne LLM-i kutset. See hindab ja lühendab konteksti protsessis, mis seda juba hoiab, tagastab sama sisendi puhul sama tulemuse ega tee mudelikutset ega võrgupäringut. Reeglid, mis otsustavad, mis välja jäetakse, on lugemist väärt: Signum avaldatakse fondi väljalaskeprogrammi kolmandas voorus.
Signum annab igale sõnale skoori viie loendatava signaali põhjal: pikkus, suurtähed lause sees, numbrid, asukoht ja haruldus sinu valdkonnas. Tase muudab seda, kui palju sellest järjestusest säilib, mitte kunagi seda, mida lõik tähendab.
Viis signaali moodustavad skoori. Tase liigutab piiri, umbes seitsmelt sõnalt kümnest alla kahele.
Sama sisend järgib sama aritmeetilist rada, nii et tulemust saab kontrollida ja kinnitada.
Skoor on kasulik ainult siis, kui mõned lõigud sellesse kunagi ei sisene.
Käsud, lingid, kood, rõhutus, sildid ja URL-id võetakse enne skoorimist välja ja taastatakse pärast seda märk märgi haaval. Struktuuriread jäetakse samuti kõrvale, nii et lühendatud dokument jääb dokumendiks.
Kaheksa lõiguliiki muutuvad nummerdatud asendajateks enne esimese sõna järjestamist.