Rust Office Document Processing Library | Dweve Bindery

Bindery is a Rust document runtime for Word, Excel, PowerPoint, PDF and iWork. Apache-2.0 terms; the repository publishes in the seventh release round.

Wissens-Governance auf Basis geparster Dokumente.

Indiziert geparste Dokumente für den Abruf.

Parst und adressiert Text und Code über ihren Inhalt.

Bindery zu Ihrem Projekt hinzufügen. Öffnen Sie jedes unterstützte Dokument mit einer einzigen API.

Lassen Sie Fabric die Dokumente öffnen, die Sie bereits haben

Bindery arbeitet unter Fabric, um die von Ihnen gewählten Dokumente zu identifizieren und zu lesen, sodass Fabric deren echte Inhalte nutzen kann, ohne dass Sie Formate oder Reader verwalten müssen.

Geben Sie jedem Dokument einen klaren Weg

Beginnen Sie mit der Mischung von Dokumenten, die Ihr Team bereits verarbeitet. Führen Sie sie durch einen einzigen Aufnahmepfad, ein strukturiertes Modell und eine kontrollierte Übergabe, während formatabhängige Arbeit an der Grenze bleibt.

Arbeitsbereich, in dem Benutzer Dokumente ablegen.

Wissens-Governance über mit Bindery extrahierten Dokumenten.

Parst Code, Konfiguration und Dokumente in Merkle-Bäume.

bindery convert / query / inspect. Mit Shell-Pipelines kombinierbar.

Python-Bindungen. Gleiche Engine, idiomatische Python-API.

Native API für die Einbettung in Dienste. Null-Kopie, wo Formate es erlauben.

Bindery extrahiert strukturierte Inhalte aus Dokumenten. Kombinieren Sie es mit den Retrieval- und Governance-Ebenen, um eine vollständige Wissens-Pipeline aufzubauen.

Unter 100 MB. Jahresberichte und große PDFs.

Unter 10 MB. Große Arbeitsmappen und Präsentationen.

Unter 100 KB. Die meisten Tabellenkalkulationen und Word-Dateien.

Die dokumentierten Parse-Budgets sind nach Größe gestaffelt: klein unter einer Millisekunde, mittel unter fünfzig, groß unter fünfhundert. Streaming-Parse hält den Speicher durch die Struktur begrenzt, und SIMD beschleunigt den heißen Pfad. Keine GPU.

SQL-ähnlich über das einheitliche Dokumentmodell.

docx, xlsx, pptx, pdf, iWork, ODF, RTF plus verschlüsselt.

Eine Crate, 17 Formate, 300+ Formeln, DocQL, vollständiges Lesen und Schreiben. Schnell auf Standard-CPUs. Die Dokumentebene für den Dweve-Stack.

Wissens-Ingestion, regulatorische Analyse, Verarbeitung von Finanzdokumenten, E-Discovery, Archivierung und Code-Dokument-Tools beginnen alle mit Office-Formaten als Eingabe und strukturierten Daten als Ausgabe. Jedes Dokument öffnet sich über dieselben drei Zeilen Rust.

docx, xlsx, pptx, pdf, iWork, ODF, RTF plus verschlüsselt

Native Rust-API zur Einbettung. PyO3-Bindungen für Python-Pipelines. Eine CLI für einmalige Inspektion, Konvertierung und Abfragen. Dieselbe Engine hinter allen dreien.

Eine Bibliothek, 17 Formate. OOXML und ODF sind erstklassige Lese-, Schreib- und Abfrageoberflächen. PDF und RTF werden vollständig gelesen und nach bestem Vermögen geschrieben. EPUB, LaTeX und Markdown sind Ausgabeformate. Die Matrix zeigt, was jedes Format verspricht.

ARBEITSTAG, NETTOARBEITSTAGE, MONATSENDE.

SUMME, MITTELWERT, STABW, Matrixfunktionen.

Die Formel-Engine wertet über 300 Excel-kompatible Funktionen aus. DocQL ist eine SQL-ähnliche Abfragesprache für das einheitliche Dokumentmodell: Referenzen finden, Formeln auswerten, Tabellen durchlaufen, Formen filtern.

Bindery ersetzt das Portfolio durch eine einzige Rust-Crate: eine API, eine Abfragesprache und einen Aktualisierungsrhythmus über 17 Formate.

Ein Parser pro Format, eine API pro Format, ein Aktualisierungszyklus pro Format. Die Wartungsfläche wächst schneller, als das Produkt ausgeliefert wird.

Writer gibt in ein unterstütztes Format aus.

DocQL, SQL-ähnliche Abfragen über DocModel.

Reader erzeugt ein einheitliches DocModel.

Bytes schnüffeln, Reader wählen, Erweiterungslügen ignorieren.

Die Formaterkennung wählt den richtigen Reader. Parser normalisieren alles zu einem einheitlichen Dokumentmodell. DocQL fragt dieses Modell mit SQL-ähnlicher Syntax ab. Writer geben zurück an OOXML, ODF, LaTeX, EPUB und Markdown aus.

Die meisten Parser lesen. Nur wenige machen den Rundweg.

Eine Frage lässt sich nicht über Formate hinweg stellen.

Dateien lügen über Erweiterungen. Auto-Erkennung nötig.

Die meisten Rust- und Python-Pipelines flicken eine andere Bibliothek pro Format zusammen, jede mit eigener API, eigenen Fehlern, eigenem Wartungsfenster. Die Klebstoffschicht wird zum Projekt.

Jedes Format fügt eine weitere Naht hinzu

Die Formaterkennung liest Magic Bytes und Strukturhinweise. Die Erweiterung ist ein Hinweis, nicht die Wahrheit.

Sheet1!B4, Sheet1!D12, Sheet3!A1 (3 Ergebnisse)

bindery query 'SELECT cells WHERE refs CONTAINS "Sheet2.A1"'

DocQL: jede Zelle finden, die auf Sheet2.A1 verweist

beliebige Datei öffnen. Format aus Bytes erkannt, nicht aus Erweiterung

Die meisten Tabellenkalkulationen und Word-Dateien.

Crate hinzufügen, open aufrufen und das Dokumentmodell lesen. Dieselben drei Zeilen funktionieren mit Word, Excel, PDF und jedem anderen unterstützten Format. Die Erkennung startet von der Dateisignatur, statt der Erweiterung zu vertrauen.

Ein unterstütztes Ausgabeformat schreiben oder das strukturierte Modell weitergeben.

Erkennen, lesen, abfragen und transformieren in der gewählten Umgebung.

Dateien gelangen über die Dokumentgrenze, die Sie betreiben, in den Prozess.

Bindery kann dort ausgeführt werden, wo Dokumente bereits eintreffen und wo das nächste System sie erwartet. Erkennung, Lesen, Abfragen und Transformation bleiben nahe am Workflow, während die endgültige Übergabe strukturierte Inhalte oder ein unterstütztes Ausgabeformat erzeugt.

Vertrauliche Dokumente werden auf Ihrer eigenen Hardware geöffnet und verlassen diese nie zum Lesen.

Legacy-, Apple- und OpenDocument-Dateien öffnen sich alle, sodass alte Archive lesbar bleiben.

Dateien werden anhand ihres Inhalts identifiziert, sodass eine falsch benannte Datei die Warteschlange nicht mehr blockiert.

Derselbe Dokumentfluss unterstützt gemischten Eingang, Archivkonvertierung und kontrollierte Prüfung. Dateien werden konsistent erkannt und geöffnet und dann als strukturierte Informationen für die jeweilige Aufgabe bereitgestellt. Das Betriebsmodell bleibt vertraut, auch wenn sich die Dokumentmischung ändert.

Nachgelagerte Systeme erben für jede Dateifamilie eine andere Struktur.

Ein schreibgeschützter Pfad erzeugt einen weiteren Schritt, wenn eine neue Ausgabe benötigt wird.

Dieselbe Aufgabe verhält sich über separate Formatintegrationen hinweg unterschiedlich.

Die Weiterleitung nach Erweiterung kann den falschen Dokumentpfad wählen.

Kleine Unterschiede, die sich nachgelagert ausbreiten

Eine falsche Erweiterung, ein separater Leser oder eine Einwegkonvertierung kann einen weiteren Zweig in den Dokumentbetrieb einführen. Bindery erkennt anhand des Inhalts, stellt ein abfragbares Modell bereit und schreibt über unterstützte Ausgabepfade, sodass weniger formatspezifische Fälle zu testen und zu betreiben sind.

Formatunterschiede an einer kontrollierten Grenze stoppen

Nachgelagerte Systeme erhalten eine konsistente Struktur.

Abfragen laufen gegen ein Dokumentmodell.

Unterstützte Formate öffnen sich über eine Schnittstelle.

Word-Dokumente, Tabellenkalkulationen, Präsentationen, PDFs und andere unterstützte Dateien beginnen mit unterschiedlichen internen Strukturen. Bindery normalisiert sie in ein Dokumentmodell, sodass Abfragen, Transformationen und nachgelagerte Integrationen eine konsistente Struktur verwenden können.

das Format bestimmt die Arbeit nicht mehr

Der Inhalt wird zu einem strukturierten Dokumentmodell.

Dateisignaturen und strukturelle Hinweise wählen den passenden Reader aus.

Gemischte Office-Dateien gelangen über dieselbe Dokumentgrenze hinein.

Dokumente gelangen selten als ordentliche, einheitliche Menge in den Betrieb. Bindery erkennt unterstützte Formate anhand des Dateiinhalts und öffnet sie über eine einzige Oberfläche. Das Ergebnis ist ein strukturiertes Dokumentmodell, bereit für die nächste Aufgabe.

Der Reader läuft in der App, ohne separates Konto oder externen Dokumentdienst.

Er liest nahe an Ihren Dateien, auf Ihrer Seite.

Er öffnet Briefe, Blätter, Formulare und Folien gleichermaßen.

Dieselbe Antwort auf jedem Computer, heute und morgen.

Sie müssen nicht verstehen, wie es funktioniert, um zu spüren, was es für Sie tut. Es gibt dieselbe Antwort auf jedem Computer, es öffnet Dokumente, egal wer sie erstellt hat, und es liest privat auf Ihrer Seite. Sobald Bindery in der siebten Runde veröffentlicht wird, können Sie die Implementierung selbst prüfen.

Es stammt von Ihrem echten Papier, jedes Mal auf dieselbe Weise.

Bindery öffnet das echte Dokument und liest, was darin steht.

Über Ihren eigenen Brief, Ihr Blatt oder Ihr Formular, in Ihren eigenen Worten.

Wenn Sie einen Computer nach Ihren eigenen Dokumenten fragen, muss sie zuerst jemand öffnen und lesen, was wirklich darin steht. Ohne das erhalten Sie nur eine höfliche Vermutung. Bindery ist der Teil, der zuerst Ihre echten Papiere öffnet, damit die Antwort über sie geht und nicht über nichts.

Gedruckte Seiten, die überall gleich aussehen.

Diashows aus Wörtern und Fotos auf Seiten.

Die Notizen und Briefe, die du im Laufe der Jahre geschrieben und gespeichert hast.

Ein Brief, eine Budgettabelle, eine Diashow, ein gedrucktes Formular. Sie wurden jeweils von einem anderen Programm erstellt und sehen innen unterschiedlich aus. Der stille Helfer öffnet jedes davon auf die gleiche Weise und findet die Wörter. Tippe auf eine beliebige Karte links, um in diese Art von Papier hineinzuschauen.