Rust Office Document Processing Library | Dweve Bindery
Bindery is a Rust document runtime for Word, Excel, PowerPoint, PDF and iWork. Apache-2.0 terms; the repository publishes in the seventh release round.
Knowledge governance basata su documenti analizzati.
Indicizza i documenti analizzati per il recupero.
Analizza e indirizza tramite contenuto testo e codice.
Aggiungi Bindery al tuo progetto. Apri qualsiasi documento supportato con una sola API.
Un solo parser, tutti i formati da ufficio
Un unico modello di documento strutturato
Lascia che Fabric apra i documenti che hai già
Bindery opera sotto Fabric per identificare e leggere i documenti che scegli, così Fabric può usarne il contenuto reale senza chiederti di gestire formati o lettori.
Inizia con la varietà di documenti che il tuo team gestisce già. Portali attraverso un unico percorso di acquisizione, un unico modello strutturato e una consegna controllata, mantenendo il lavoro specifico del formato al confine.
Area di lavoro in cui gli utenti trascinano i documenti.
Knowledge governance sui documenti estratti da Bindery.
Analizza codice, configurazione e documenti in alberi Merkle.
bindery convert / query / inspect. Componibile con pipeline di shell.
Binding Python. Stesso motore, API Python idiomatica.
API nativa per l'incorporamento nei servizi. Zero-copy dove i formati lo consentono.
Bindery estrae contenuti strutturati dai documenti. Abbinalo ai layer di recupero e governance per creare una pipeline di conoscenza completa.
Sotto i 100 MB. Report annuali e PDF di grandi dimensioni.
Sotto i 10 MB. Cartelle di lavoro e presentazioni di grandi dimensioni.
Sotto i 100 KB. La maggior parte dei fogli di calcolo e dei file Word.
I budget di analisi documentati sono suddivisi per dimensione: piccolo sotto il millisecondo, medio sotto i cinquanta, grande sotto i cinquecento. L'analisi in streaming mantiene la memoria limitata dalla struttura e SIMD accelera il percorso critico. Nessuna GPU.
Simile a SQL nel modello di documento unificato.
Motore di formule compatibile con Excel.
docx, xlsx, pptx, pdf, iWork, ODF, RTF più crittografati.
Una crate, 17 formati, 300+ formule, DocQL, lettura e scrittura complete. Veloce su CPU standard. Il layer documentale per lo stack Dweve.
L'ingestione di conoscenza, l'analisi normativa, l'elaborazione di documenti finanziari, l'e-discovery, gli strumenti di archiviazione e di documentazione del codice iniziano tutti con i formati office come input e dati strutturati come output. Ogni documento si apre con le stesse tre righe di Rust.
docx, xlsx, pptx, pdf, iWork, ODF, RTF più crittografati
API Rust nativa per l'incorporamento. Binding PyO3 per pipeline Python. Una CLI per ispezione, conversione e query monouso. Lo stesso motore dietro tutti e tre.
Un modello di documento, ogni superficie
Una libreria, 17 formati. OOXML e ODF sono superfici di prima classe per lettura, scrittura e query. PDF e RTF si leggono completamente e si scrivono al meglio. EPUB, LaTeX e Markdown sono output di scrittura. La matrice indica cosa promette ogni formato.
SOMMA, MEDIA, DEV.ST, funzioni matriciali.
Oltre 300 funzioni compatibili con Excel
Il motore di formule valuta oltre 300 funzioni compatibili con Excel. DocQL è un linguaggio di query simile a SQL per il modello di documento unificato: trova riferimenti, valuta formule, esplora tabelle, filtra forme.
Bindery sostituisce il portfolio con un unico crate Rust: un'API, un linguaggio di query e un ciclo di aggiornamento unico su 17 formati.
Il livello di collante diventa il progetto.
Un parser per formato, un'API per formato, un ciclo di aggiornamento per formato. La superficie di manutenzione cresce più velocemente di quanto il prodotto venga rilasciato.
Lo scrittore emette in un formato supportato.
Il lettore produce un DocModel unificato.
Analizza i byte, scegli il lettore, ignora le bugie delle estensioni.
Il rilevamento del formato sceglie il lettore giusto. I parser normalizzano tutto in un modello di documento unificato. DocQL interroga quel modello con sintassi simile a SQL. Gli scrittori emettono di nuovo in OOXML, ODF, LaTeX, EPUB e Markdown.
La maggior parte dei parser legge. Pochi fanno il round-trip.
Impossibile porre una domanda tra formati diversi.
I file mentono sulle estensioni. Serve il rilevamento automatico.
La maggior parte delle pipeline Rust e Python cuce insieme una libreria diversa per formato, ognuna con la propria API, i propri bug, la propria finestra di manutenzione. Il livello di colla diventa il progetto.
Il rilevamento del formato legge i byte magici e gli indizi strutturali. L'estensione è un suggerimento, non la verità.
Sheet1!B4, Sheet1!D12, Sheet3!A1 (3 risultati)
bindery query 'SELECT cells WHERE refs CONTAINS "Sheet2.A1"'
DocQL: trova ogni cella che fa riferimento a Sheet2.A1
apri qualsiasi file. Formato rilevato dai byte, non dall'estensione
Cartelle di lavoro grandi e presentazioni.
La maggior parte dei fogli di calcolo e dei file Word.
Per dimensione del documento, CPU standard
Aggiungi il crate, chiama open e leggi il modello del documento. Le stesse tre righe funzionano su Word, Excel, PDF e ogni altro formato supportato. Il rilevamento parte dalla firma del file invece di fidarsi dell'estensione.
Scrivi un output supportato o passa il modello strutturato oltre.
Rileva, leggi, interroga e trasforma nell'ambiente scelto.
I file entrano attraverso il confine del documento che gestisci.
Bindery può operare dove i documenti arrivano già e dove il sistema successivo li attende. Rilevamento, lettura, interrogazione e trasformazione restano vicini al flusso di lavoro, mentre la consegna finale produce contenuti strutturati o un formato di output supportato.
I documenti sensibili si aprono sul tuo hardware, quindi non vengono mai letti altrove.
I file legacy, Apple e OpenDocument si aprono tutti, così gli archivi vecchi restano leggibili.
I file vengono identificati dal loro contenuto, quindi un file con nome errato non blocca più la coda.
Lo stesso flusso di documenti supporta acquisizione mista, conversione di archivi e revisione controllata. I file vengono rilevati e aperti in modo coerente, poi esposti come informazioni strutturate per il compito in questione. Il modello operativo resta familiare anche quando cambia la combinazione di documenti.
I sistemi a valle ereditano una struttura diversa per ogni famiglia di file.
Un percorso di sola lettura crea un altro passaggio quando serve un nuovo output.
Lo stesso compito si comporta in modo diverso tra integrazioni di formato separate.
Il routing per estensione può selezionare il percorso di documento sbagliato.
Piccole differenze che si propagano a valle
Un'estensione errata, un lettore separato o una conversione unidirezionale possono introdurre un altro ramo nelle operazioni documentali. Bindery rileva dal contenuto, espone un modello interrogabile e scrive tramite percorsi di output supportati, lasciando meno casi specifici di formato da testare e gestire.
I sistemi a valle ricevono una struttura coerente.
Le interrogazioni vengono eseguite su un unico modello di documento.
I formati supportati si aprono tramite un'unica interfaccia.
I percorsi specifici per formato diventano uno
Documenti Word, fogli di calcolo, presentazioni, PDF e altri file supportati iniziano con strutture interne diverse. Bindery li normalizza in un unico modello di documento, così interrogazioni, trasformazioni e integrazioni a valle possono usare una struttura coerente.
Il contenuto diventa un unico modello di documento strutturato.
Le firme dei file e gli indizi strutturali selezionano il lettore appropriato.
I file office misti entrano attraverso lo stesso confine del documento.
I documenti raramente entrano nelle operazioni in un insieme ordinato e uniforme. Bindery identifica i formati supportati dal contenuto dei file e li apre tramite un'unica interfaccia. Il risultato è un modello di documento strutturato pronto per il compito successivo.
un unico percorso di acquisizione prende il sopravvento
Il lettore funziona all'interno dell'app, senza account separato o servizio documenti esterno.
Legge vicino ai tuoi file, dalla tua parte.
Apre lettere, fogli, moduli e presentazioni allo stesso modo.
La stessa risposta su ogni computer, oggi e domani.
Non devi capire come funziona per sentire cosa fa per te. Dà la stessa risposta su ogni computer, apre documenti qualunque sia il programma che li ha creati e legge in privato dalla tua parte. Quando Bindery pubblicherà il settimo round, potrai ispezionare tu stesso l'implementazione.
Proviene dal tuo vero documento, sempre allo stesso modo.
Bindery apre il documento reale e legge ciò che contiene.
Sulla tua lettera, il tuo foglio o il tuo modulo, con le tue parole.
Quando chiedi a un computer informazioni sui tuoi documenti, qualcosa deve prima aprirli e leggere ciò che contengono davvero. Senza questo, ottieni solo una risposta educata a caso. Bindery è la parte che apre prima i tuoi veri documenti, così la risposta riguarda loro e non il nulla.
Pagine fisse che appaiono uguali ovunque.
Presentazioni di parole e foto sulle pagine.
Budget ed elenchi disposti in piccole caselle.
Le note e le lettere che hai scritto e salvato negli anni.
Una lettera, un foglio di budget, una presentazione, un modulo stampato. Sono stati creati da programmi diversi e all'interno appaiono diversi. Il quieto aiutante apre ognuno di essi allo stesso modo e trova le parole. Tocca una qualsiasi scheda a sinistra per dare un'occhiata all'interno di quel tipo di carta.