Rust Office Document Processing Library | Dweve Bindery

Bindery is a Rust document runtime for Word, Excel, PowerPoint, PDF and iWork. Apache-2.0 terms; the repository publishes in the seventh release round.

Gobernanza del conocimiento basada en documentos analizados.

Indexa documentos analizados para su recuperación.

Analiza y direcciona por contenido texto y código.

Añade Bindery a tu proyecto. Abre cualquier documento compatible con una sola API.

Un analizador, todos los formatos de oficina

Contenido del archivo, no solo el nombre

Consulta y transforma de forma coherente

Deja que Fabric abra los documentos que ya tienes

Bindery funciona bajo Fabric para identificar y leer los documentos que elijas, de modo que Fabric pueda usar su contenido real sin que tengas que gestionar formatos o lectores.

Empieza con la mezcla de documentos que tu equipo ya maneja. Hazlos pasar por una única vía de entrada, un modelo estructurado y una entrega controlada, manteniendo el trabajo específico de formato en el límite.

Espacio de trabajo donde los usuarios sueltan documentos.

Gobernanza del conocimiento sobre documentos extraídos con Bindery.

Analiza código, configuración y documentos en árboles Merkle.

bindery convert / query / inspect. Componible con pipelines de shell.

Enlaces de Python. Mismo motor, API de Python idiomática.

API nativa para integración en servicios. Cero copias donde los formatos lo permitan.

Bindery extrae contenido estructurado de documentos. Combínalo con las capas de recuperación y gobernanza para crear un pipeline de conocimiento completo.

Menos de 100 MB. Informes anuales y PDF grandes.

Menos de 10 MB. Libros de trabajo grandes y presentaciones.

Menos de 100 KB. La mayoría de hojas de cálculo y archivos de Word.

Los presupuestos de análisis documentados están escalonados por tamaño: pequeño en menos de un milisegundo, mediano en menos de cincuenta, grande en menos de quinientos. El análisis en flujo mantiene la memoria limitada por estructura, y SIMD acelera la ruta crítica. Sin GPU.

Similar a SQL en el modelo de documento unificado.

docx, xlsx, pptx, pdf, iWork, ODF, RTF y cifrados.

Un crate, 17 formatos, 300+ fórmulas, DocQL, lectura y escritura completas. Rápido en CPUs estándar. La capa de documentos para la pila Dweve.

La ingesta de conocimiento, el análisis regulatorio, el procesamiento de documentos financieros, el descubrimiento electrónico, el archivado y las herramientas de código y documentación comienzan con formatos de oficina como entrada y datos estructurados como salida. Cada documento se abre con las mismas tres líneas de Rust.

docx, xlsx, pptx, pdf, iWork, ODF, RTF y cifrados

API nativa de Rust para integración. Enlaces PyO3 para canalizaciones de Python. Una CLI para inspección, conversión y consultas de una sola vez. El mismo motor detrás de las tres.

Un modelo de documento, todas las superficies

Una biblioteca, 17 formatos. OOXML y ODF son superficies de primera clase para leer, escribir y consultar. PDF y RTF se leen por completo y se escriben con el mejor esfuerzo. EPUB, LaTeX y Markdown son salidas de escritor. La matriz indica lo que promete cada formato.

Más de 300 funciones compatibles con Excel

El motor de fórmulas evalúa más de 300 funciones compatibles con Excel. DocQL es un lenguaje de consulta similar a SQL para el modelo de documento unificado: encontrar referencias, evaluar fórmulas, recorrer tablas, filtrar formas.

Bindery reemplaza el portafolio con un solo crate de Rust: una API, un lenguaje de consulta y un ritmo de actualización en 17 formatos.

La capa de unión se convierte en el proyecto.

Un analizador por formato, una API por formato, un ciclo de actualización por formato. La superficie de mantenimiento se expande más rápido de lo que se publica el producto.

El escritor emite a un formato compatible.

DocQL, consultas similares a SQL sobre DocModel.

El lector produce un DocModel unificado.

Detectar bytes, elegir lector, ignorar mentiras de extensión.

La detección de formato elige el lector correcto. Los analizadores normalizan todo a un modelo de documento unificado. DocQL consulta ese modelo con sintaxis similar a SQL. Los escritores emiten de vuelta a OOXML, ODF, LaTeX, EPUB y Markdown.

La mayoría de los analizadores leen. Pocos hacen el viaje de ida y vuelta.

No se puede hacer una sola pregunta entre formatos.

Los archivos mienten sobre las extensiones. Se necesita detección automática.

Una caja distinta por formato, una API distinta.

La mayoría de los pipelines de Rust y Python cosen una biblioteca distinta por formato, cada una con su propia API, sus propios errores, su propia ventana de mantenimiento. La capa de pegamento se convierte en el proyecto.

La detección de formato lee bytes mágicos y pistas estructurales. La extensión es una pista, no la verdad.

¡Hoja1!B4, ¡Hoja1!D12, ¡Hoja3!A1 (3 resultados)

bindery query 'SELECT cells WHERE refs CONTAINS "Sheet2.A1"'

DocQL: encuentra cada celda que referencia Sheet2.A1

abre cualquier archivo. Formato detectado por bytes, no por extensión

Libros de trabajo grandes y presentaciones.

La mayoría de las hojas de cálculo y archivos de Word.

Añade la caja, llama a open y lee el modelo de documento. Las mismas tres líneas funcionan con Word, Excel, PDF y cualquier otro formato compatible. La detección comienza desde la firma del archivo en lugar de confiar en la extensión.

Escribe una salida compatible o pasa el modelo estructurado hacia adelante.

Detecta, lee, consulta y transforma en el entorno elegido.

Los archivos entran por el límite documental que usted opera.

Bindery puede ejecutarse donde los documentos ya llegan y donde el siguiente sistema los espera. La detección, lectura, consulta y transformación permanecen cerca del flujo de trabajo, mientras que la entrega final produce contenido estructurado o un formato de salida compatible.

Los documentos confidenciales se abren en su propio hardware, por lo que nunca salen para ser leídos.

Los archivos heredados, de Apple y de OpenDocument se abren todos, por lo que los archivos antiguos siguen siendo legibles.

Los archivos se identifican por su contenido, por lo que un archivo con nombre incorrecto ya no detiene la cola.

El mismo flujo de documentos admite recepción mixta, conversión de archivos y revisión controlada. Los archivos se detectan y abren de manera consistente, y luego se exponen como información estructurada para la tarea en cuestión. El modelo operativo sigue siendo familiar incluso cuando cambia la mezcla de documentos.

Los sistemas posteriores heredan una estructura diferente para cada familia de archivos.

Una vía de solo lectura crea otro paso cuando se necesita una nueva salida.

La misma tarea se comporta de manera diferente en integraciones de formato separadas.

El enrutamiento por extensión puede seleccionar la vía de documento incorrecta.

Pequeñas diferencias que se extienden aguas abajo

Una extensión incorrecta, un lector separado o una conversión unidireccional pueden introducir otra rama en las operaciones documentales. Bindery detecta desde el contenido, expone un modelo consultable y escribe a través de vías de salida compatibles, dejando menos casos específicos de formato para probar y operar.

Los sistemas posteriores reciben una estructura consistente.

Las consultas se ejecutan contra un modelo documental.

Los formatos compatibles se abren a través de una interfaz.

Las vías específicas de formato se convierten en una

Los documentos de Word, hojas de cálculo, presentaciones, PDF y otros archivos compatibles comienzan con estructuras internas diferentes. Bindery los normaliza en un modelo documental, de modo que las consultas, transformaciones e integraciones posteriores puedan usar una estructura consistente.

El contenido se convierte en un modelo de documento estructurado.

Las firmas de archivo y las pistas estructurales seleccionan el lector adecuado.

Los archivos de oficina mixtos entran por el mismo límite de documento.

De la llegada a la estructura utilizable

Los documentos rara vez llegan a las operaciones en un conjunto ordenado y uniforme. Bindery identifica los formatos compatibles a partir del contenido del archivo y los abre a través de una única interfaz. El resultado es un modelo de documento estructurado listo para la siguiente tarea.

El lector se ejecuta dentro de la aplicación, sin una cuenta separada ni un servicio de documentos externo.

Abre cartas, hojas, formularios y presentaciones por igual.

La misma respuesta en cada ordenador, hoy y mañana.

No necesitas entender cómo funciona para sentir lo que hace por ti. Da la misma respuesta en cada ordenador, abre documentos sea cual sea su origen y lee en privado, de tu lado. Cuando Bindery publique en la séptima ronda, podrás inspeccionar la implementación tú mismo.

Proviene de tu documento real, siempre de la misma manera.

Bindery abre el documento real y lee lo que hay dentro.

Sobre tu propia carta, hoja o formulario, con tus propias palabras.

Cuando le preguntas a un ordenador sobre tus propios documentos, primero algo tiene que abrirlos y leer lo que realmente contienen. Sin eso, solo obtienes una suposición educada. Bindery es la parte que abre primero tus documentos reales, para que la respuesta trate sobre ellos y no sobre nada.

Páginas fijas que se ven igual en todas partes.