Rust Office Document Processing Library | Dweve Bindery

Bindery is a Rust document runtime for Word, Excel, PowerPoint, PDF and iWork. Apache-2.0 terms; the repository publishes in the seventh release round.

Zarządzanie wiedzą oparte na sparsowanych dokumentach.

Indeksuj sparsowane dokumenty do wyszukiwania.

Dodaj Bindery do swojego projektu. Otwórz dowolny obsługiwany dokument za pomocą jednego API.

Pozwól Fabric otworzyć dokumenty, które już masz

Bindery działa pod spodem Fabric, aby identyfikować i odczytywać wybrane dokumenty, dzięki czemu Fabric może korzystać z ich rzeczywistej zawartości bez konieczności zarządzania formatami lub czytnikami.

Daj każdemu dokumentowi jedną jasną ścieżkę

Zacznij od mieszanki dokumentów, którymi Twój zespół już się zajmuje. Przeciągnij je przez jedną ścieżkę przyjęcia, jeden ustrukturyzowany model i kontrolowane przekazanie, zachowując prace specyficzne dla formatu na granicy.

Obszar roboczy, do którego użytkownicy wrzucają dokumenty.

Zarządzanie wiedzą nad dokumentami wyodrębnionymi przez Bindery.

Parsuj kod, konfigurację i dokumenty do drzew Merkle.

bindery convert / query / inspect. Możliwość łączenia z potokami powłoki.

Wiązania Pythona. Ten sam silnik, idiomatyczne API Pythona.

Natywne API do osadzania w usługach. Zero kopii tam, gdzie formaty na to pozwalają.

Bindery wyodrębnia ustrukturyzowaną treść z dokumentów. Połącz go z warstwami wyszukiwania i zarządzania, aby zbudować kompletny potok wiedzy.

Poniżej 100 MB. Raporty roczne i duże pliki PDF.

Poniżej 10 MB. Duże skoroszyty i prezentacje.

Poniżej 100 KB. Większość arkuszy kalkulacyjnych i plików Word.

Udokumentowane budżety analizy są podzielone według rozmiaru: mały poniżej jednej milisekundy, średni poniżej pięćdziesięciu, duży poniżej pięciuset. Strumieniowe analizowanie utrzymuje pamięć ograniczoną przez strukturę, a SIMD przyspiesza krytyczną ścieżkę. Bez GPU.

Poniżej sekundy na standardowych procesorach

Podobny do SQL w ujednoliconym modelu dokumentu.

docx, xlsx, pptx, pdf, iWork, ODF, RTF oraz zaszyfrowane.

Jedna skrzynia, 17 formatów, 300+ formuł, DocQL, pełny odczyt i zapis. Szybki na standardowych procesorach. Warstwa dokumentów dla stosu Dweve.

Pozyskiwanie wiedzy, analiza regulacyjna, przetwarzanie dokumentów finansowych, e-discovery, archiwizacja i narzędzia do dokumentacji kodu zaczynają się od formatów biurowych jako danych wejściowych i ustrukturyzowanych danych jako danych wyjściowych. Każdy dokument otwiera się przez te same trzy linie Rusta.

docx, xlsx, pptx, pdf, iWork, ODF, RTF oraz zaszyfrowane

Natywny interfejs API Rust do osadzania. Powiązania PyO3 dla potoków Pythona. Interfejs CLI do jednorazowej inspekcji, konwersji i zapytań. Ten sam silnik we wszystkich trzech.

Jeden model dokumentu, każda powierzchnia

Jedna biblioteka, 17 formatów. OOXML i ODF to pełnoprawne powierzchnie odczytu, zapisu i zapytań. PDF i RTF są w pełni odczytywane, a zapisywane najlepiej, jak to możliwe. EPUB, LaTeX i Markdown to wyniki zapisu. Macierz określa, co obiecuje każdy format.

Silnik formuł obsługuje ponad 300 funkcji zgodnych z Excelem. DocQL to język zapytań w stylu SQL dla ujednoliconego modelu dokumentu: znajdź odwołania, oblicz formuły, przeglądaj tabele, filtruj kształty.

Bindery zastępuje portfolio jedną skrzynią Rust: jednym interfejsem API, jednym językiem zapytań i jednym cyklem aktualizacji w 17 formatach.

Jeden parser na format, jeden interfejs API na format, jeden cykl aktualizacji na format. Powierzchnia utrzymania rośnie szybciej, niż produkt się ukazuje.

DocQL, zapytania w stylu SQL do DocModel.

Wykryj bajty, wybierz czytnik, zignoruj kłamstwa rozszerzeń.

Wykrywanie formatu wybiera odpowiedni czytnik. Parserzy normalizują wszystko do ujednoliconego modelu dokumentu. DocQL przeszukuje ten model składnią w stylu SQL. Zapis zwraca do OOXML, ODF, LaTeX, EPUB i Markdown.

Większość parserów czyta. Niewiele wykonuje pełny cykl.

Nie można zadać jednego pytania w różnych formatach.

Pliki kłamią o rozszerzeniach. Potrzebna automatyczna detekcja.

Większość potoków w Rust i Pythonie skleja inną bibliotekę dla każdego formatu, każda z własnym API, własnymi błędami, własnym oknem konserwacji. Warstwa kleju staje się projektem.

Detekcja formatu czyta bajty magiczne i wskazówki strukturalne. Rozszerzenie to podpowiedź, nie prawda.

Sheet1!B4, Sheet1!D12, Sheet3!A1 (3 wyniki)

bindery query 'SELECT cells WHERE refs CONTAINS "Sheet2.A1"'

DocQL: znajdź każdą komórkę odwołującą się do Sheet2.A1

arkusze: 3, wiersze: 12847, formuły: 4193

otwórz dowolny plik. Format wykryty z bajtów, nie z rozszerzenia

Większość arkuszy kalkulacyjnych i plików Word.

W zależności od rozmiaru dokumentu, standardowy procesor

Dodaj skrzynkę, wywołaj open i odczytaj model dokumentu. Te same trzy linie działają w Word, Excel, PDF i każdym innym wspieranym formacie. Detekcja zaczyna się od sygnatury pliku, a nie od zaufania do rozszerzenia.

Zapisz wspierany wynik lub przekaż model strukturalny dalej.

Wykrywaj, czytaj, odpytywaj i przekształcaj w wybranym środowisku.

Pliki wchodzą przez granicę dokumentów, którą obsługujesz.

Bindery może działać tam, gdzie dokumenty już docierają i gdzie kolejny system ich oczekuje. Wykrywanie, odczyt, zapytania i transformacje pozostają blisko przepływu pracy, a końcowe przekazanie tworzy ustrukturyzowaną treść lub obsługiwany format wyjściowy.

Wrażliwe dokumenty otwierają się na Twoim sprzęcie, więc nigdy nie są opuszczane w celu odczytu.

Pliki Legacy, Apple i OpenDocument otwierają się, więc stare archiwa pozostają czytelne.

Pliki są identyfikowane na podstawie zawartości, więc błędnie nazwany plik nie blokuje już kolejki.

Ten sam przepływ dokumentów obsługuje mieszane przyjmowanie, konwersję archiwów i kontrolowany przegląd. Pliki są wykrywane i otwierane spójnie, a następnie udostępniane jako ustrukturyzowane informacje do bieżącego zadania. Model działania pozostaje znajomy, nawet gdy zmienia się mieszanka dokumentów.

Systemy niższego poziomu dziedziczą inną strukturę dla każdej rodziny plików.

Ścieżka tylko do odczytu tworzy kolejny krok, gdy potrzebny jest nowy wynik.

To samo zadanie zachowuje się inaczej w różnych integracjach formatów.

Kierowanie według rozszerzenia może wybrać niewłaściwą ścieżkę dokumentu.

Małe różnice, które rozprzestrzeniają się dalej

Błędne rozszerzenie, osobny czytnik lub jednokierunkowa konwersja mogą wprowadzić kolejną gałąź do operacji na dokumentach. Bindery wykrywa na podstawie treści, udostępnia jeden model zapytań i zapisuje przez obsługiwane ścieżki wyjściowe, pozostawiając mniej przypadków specyficznych dla formatu do testowania i obsługi.

Systemy niższego poziomu otrzymują spójną strukturę.

Zapytania działają na jednym modelu dokumentu.

Obsługiwane formaty otwierają się przez jeden interfejs.

Ścieżki specyficzne dla formatu stają się jedną

Dokumenty Word, arkusze kalkulacyjne, prezentacje, pliki PDF i inne obsługiwane pliki zaczynają się od różnych struktur wewnętrznych. Bindery normalizuje je do jednego modelu dokumentu, więc zapytania, transformacje i integracje niższego poziomu mogą używać spójnej struktury.

Treść staje się jednym ustrukturyzowanym modelem dokumentu.

Sygnatury plików i wskazówki strukturalne wybierają odpowiedni czytnik.

Mieszane pliki biurowe wchodzą przez tę samą granicę dokumentu.

Dokumenty rzadko trafiają do operacji jako schludny, jednolity zbiór. Bindery identyfikuje obsługiwane formaty na podstawie zawartości plików i otwiera je przez jeden interfejs. Efektem jest ustrukturyzowany model dokumentu gotowy na następne zadanie.

jedna ścieżka przyjmowania przejmuje kontrolę

Czytnik działa wewnątrz aplikacji, bez osobnego konta lub zewnętrznej usługi dokumentów.

Czyta blisko Twoich plików, po Twojej stronie.

Otwiera listy, arkusze, formularze i prezentacje jednakowo.

Ta sama odpowiedź na każdym komputerze, dziś i jutro.

Nie musisz rozumieć, jak to działa, aby poczuć, co dla Ciebie robi. Daje tę samą odpowiedź na każdym komputerze, otwiera dokumenty niezależnie od tego, co je stworzyło, i czyta prywatnie po Twojej stronie. Gdy Bindery ukaże się w siódmej rundzie, możesz samodzielnie przejrzeć implementację.

Pochodzi z Twojego prawdziwego papieru, za każdym razem w ten sam sposób.

Bindery otwiera prawdziwy dokument i czyta to, co jest w środku.

O Twoim własnym liście, arkuszu lub formularzu, Twoimi własnymi słowami.

Gdy pytasz komputer o własne dokumenty, najpierw ktoś musi je otworzyć i przeczytać to, co naprawdę jest w środku. Bez tego dostajesz tylko grzeczne zgadywanie. Bindery to część, która najpierw otwiera Twoje prawdziwe papiery, aby odpowiedź dotyczyła ich, a nie niczego.

Zamrożone strony, które wyglądają tak samo wszędzie.

Pokazy slajdów ze słowami i zdjęciami na stronach.

Budżety i listy ułożone w małych polach.

Notatki i listy, które pisałeś i zapisywałeś przez lata.

List, arkusz budżetu, pokaz slajdów, wydrukowany formularz. Każdy z nich został stworzony przez inny program i każdy wygląda inaczej w środku. Cichy pomocnik otwiera każdy z nich w ten sam sposób i znajduje słowa. Dotknij dowolnej karty po lewej, aby zajrzeć do środka takiego dokumentu.

Kiedy pytasz komputer o swoje dokumenty, odpowiada o twoich prawdziwych dokumentach.

Bindery otwiera każdy z nich i znajduje słowa w środku, bez względu na to, co go stworzyło.

Wszystkie twoje dokumenty, w różnych kształtach, zapisywane przez lata.