Surya OCR

Bewerten Sie Surya OCR für die Dokumentextraktion: Trennen Sie aktuelle und ältere Schnittstellen, Code- und Gewichtslizenzen, Tabellenbeziehungen und den Prüfaufwand Ihrer Pipeline.

Identität und Zugang

Modellname
Surya OCR
Zugang
Das aktuelle Projekt ist über das offizielle Repository und Python-Paket verfügbar. Code- und Modellgewichtslizenzen müssen getrennt bewertet werden.
Modelltyp
Transformer
Architektur
Surya-2-Dokument-VLM mit separaten Erkennungsmodellen
Zielgruppe
Entwickler und Dokumentbetriebsteams, die Versionen fixieren, eine Referenzstichprobe erstellen und die Extraktionsstruktur vor der Automatisierung prüfen können.
Eingabe
Dokumentseitenbilder für die dokumentierte OCR-Schnittstelle. Bewahren Sie Paketversion und mögliche PDF-zu-Bild-Vorbereitung mit dem Testprotokoll auf.
Ausgabe
Strukturierte OCR-Ergebnisse, deren Text, Blöcke, Lesereihenfolge, HTML, übersprungene Inhalte und Fehler gegen den nachgelagerten Vertrag geprüft werden müssen.
Kosten
Planen Sie Modelllizenz, Serverstart, Seitenverarbeitung und menschliche Korrektur getrennt. Codezugriff belegt weder Ihre Berechtigung für die Gewichtslizenz noch die Kosten pro akzeptiertem Dokument.
Nicht geeignet
Vermeiden Sie eine automatische Einführung, solange Lizenzbedingungen, dokumentbezogene Fehlertoleranz oder der aktuelle Ausgabevertrag ungeklärt sind.

Quellen und Methode

Lizenz und Rechte

Lizenz
Apache-2.0-Code; modifizierte OpenRAIL-M-Gewichte
Lizenzart
Quellcode verfügbar
Geltungsbereich der Lizenz
Apache 2.0 gilt für den Code. Die Modellgewichte haben eigene modifizierte OpenRAIL-M-Bedingungen zu Umsatz, Finanzierung und konkurrierender Nutzung. Lesen Sie die vollständigen Bedingungen für Ihre Organisation.
Open Source
Nein

Verfügbarkeit

Status
Verfügbar
Geltungsbereich des Status
Das offizielle Surya-Repository dokumentiert das aktuelle Datalab-Projekt, das Python-Paket und den Surya-2-Inferenzablauf. Verfügbarkeit hebt die separate Gewichtslizenz nicht auf und belegt keine Laufzeitleistung.

Wichtige Aspekte

OCR, Layout und Tabellen mit Surya 2

Die am 10. September 2026 geprüfte Dokumentation verwendet ein Dokumentmodell für OCR, Layout- und Tabellenerkennung. V2-Schnittstellen und Ausgabeschemata unterscheiden sich von älteren Beispielen.

Dokumentstruktur braucht eigene Abnahmekontrollen

Das geprüfte Schema zeigt Blöcke, Lesereihenfolge, HTML, übersprungene Inhalte und Fehler. Ein sinnvoller Test prüft diese Beziehungen, statt das Ergebnis auf eine Genauigkeitszahl zu reduzieren.

Code und Modellgewichte haben verschiedene Bedingungen

Der Repository-Code steht unter Apache 2.0. Die Gewichte verwenden eine modifizierte OpenRAIL-M-Lizenz mit zusätzlichen Einschränkungen. Prüfen Sie beide Ebenen für die geplante Bereitstellung.

Einsatzbereiche und Grenzen

Test zur Extraktion von Lieferantendokumenten

Erstellen Sie eine kleine Stichprobe mit relevanten Layouts, Tabellen und Fehlerfällen. Vergleichen Sie Text und Struktur mit einer von Menschen vorbereiteten Referenz, bevor Sie den Import automatisieren.

Versionsbewusste OCR-Migration

Nutzen Sie ein fixiertes Paket und gespeicherte Beispielausgaben, um geänderte Schema-, Endpunkt- und Parallelitätsannahmen zu finden. Erfolgreiche Ausführung und korrekte nachgelagerte Daten sind getrennte Prüfungen.

Vorteile

  • OCR, Layout- und Tabellenerkennung teilen im dokumentierten V2-Ablauf einen Inference Manager.
  • Strukturierte Ausgabefelder erlauben die ausdrückliche Prüfung von Lesereihenfolge, übersprungenen Inhalten und Fehlern.
  • Der dokumentierte Inference Manager kann sich mit einem vorhandenen Server verbinden, sodass mehrere Verarbeitungsschritte ihn gemeinsam verwenden können.

Einschränkungen

  • Ältere Surya-Beispiele können den aktuellen V2-Schnittstellen und dem Ausgabeschema widersprechen.
  • Apache 2.0 für den Code ersetzt nicht die separaten modifizierten OpenRAIL-M-Bedingungen der Gewichte.
  • Richtig erkannte Wörter können weiterhin eine falsche Lesereihenfolge oder Tabellenbeziehung besitzen und benötigen eine Prüfung auf Dokumentebene.

Themen

  • Surya OCR

Über das Modell

Auf dieser Seite

Surya OCR ist ein Projekt zur Dokumentverarbeitung, das Text und Seitenstruktur aus Bildern und PDF-Dateien extrahiert. Es kommt infrage, wenn eine Anwendung mehr als eine einfache Textfolge benötigt, etwa Lesereihenfolge oder Tabellenbereiche. Entscheidend ist die Version: Dieser Leitfaden bezieht sich auf die aktuelle Dokumentation von Surya 2 und nicht auf ältere Schnittstellen, die noch in vielen Tutorials vorkommen. Eine erfolgreiche Installation ist nur der Anfang. Der Abnahmetest muss zeigen, ob das extrahierte Dokument weiterhin dieselbe Bedeutung trägt.

Diese quellenbasierte Bewertung wurde am 10. September 2026 geprüft. Wir haben keinen OCR-Benchmark ausgeführt und keine Kundendokumente verarbeitet. Der folgende Ablauf ist ein anpassbarer Testvorschlag mit ausdrücklichen Ablehnungsbedingungen. Er enthält keinen erfundenen Genauigkeitswert.

Untersuchte Code- und Dokumentationsrevision: a2363d33.

Bestimmen Sie, was die Extraktion bewahren muss

Beginnen Sie mit dem Vorgang, der das Ergebnis verwenden soll. Eine Archivsuche benötigt andere Belege als der Import einer Rechnung in die Buchhaltung. Ein Suchindex kann eine beschädigte dekorative Überschrift möglicherweise tolerieren, solange Nutzer die richtige Seite finden. Ein Rechnungsimport darf eine plausibel wirkende, aber falsche Kontonummer nicht als kleinen Formatfehler behandeln.

Nehmen wir ein hypothetisches Team, das Lieferanten-PDFs erhält. Einige Dateien enthalten sauberen digitalen Text. Andere sind Scans mit Stempelnotiz, zweispaltigem Adressblock oder einer Tabelle, die auf der nächsten Seite weiterläuft. Das gewünschte Ergebnis lautet nicht einfach „OCR abgeschlossen“. Das Team braucht einen prüfbaren Datensatz, in dem Lieferantenidentität, Artikelbeschreibungen, Mengen und Summen mit ihren Quellpositionen verbunden bleiben.

Schreiben Sie diese Anforderungen auf, bevor Sie Einstellungen wählen. Legen Sie fest, welche Felder nie ohne Prüfung übernommen werden dürfen, welche Strukturen verbunden bleiben müssen und welche Fälle in eine menschliche Warteschlange gehören. So kann ein lesbarer Absatz keine unbrauchbare Tabelle verdecken. Jeder getestete Ablauf muss dieselben Informationen erhalten und nicht bloß eine ansprechende Vorschau erzeugen.

Die Projektdokumentation positioniert Surya für Dokumente und nicht für Text in natürlichen Szenen. Ein Foto eines Schaufensters oder ein bewegtes Straßenschild braucht deshalb eine eigene Bewertung. Breite Sprachunterstützung belegt nicht die Eignung für jedes Kamerabild. Umfang und Einschränkungen von Surya.

Ermitteln Sie die installierte Version vor dem Kopieren von Beispielen

Der Name der Surya-Modellfamilie und die Version des Python-Pakets sind verschiedene Kennungen. Zum Prüfzeitpunkt deklarierte die Paketkonfiguration Version 0.22.1 und Python-Unterstützung ab 3.10. Notieren Sie tatsächlich installiertes Paket, Checkpoint, Backend und Umgebung. Ein kopierter Befehl ohne diese Angaben ist keine reproduzierbare Integration. Paketkonfiguration.

Die aktuellen Migrationshinweise ersetzen den früheren Foundation Predictor durch einen Inference Manager und beschreiben geänderte OCR-Ausgabefelder. Behandeln Sie ein Upgrade als Änderung des Anwendungsvertrags. Prüfen Sie vor der Verarbeitung einer Sammlung ein echtes Ergebnis und stellen Sie sicher, dass Ihr Parser die Felder dieser Version liest. Migrationshinweise von Surya v1.

Das aktuelle Erkennungsschema stellt eine Seite als Blöcke und Bildgrenze dar. Einzelne Blöcke enthalten Lesereihenfolge, HTML-Inhalt und ausdrückliche Statuswerte für übersprungene Bereiche oder Fehler. Ein leerer Block darf nicht automatisch zu einem leeren Datenbankwert werden. Bewahren Sie genügend Statusinformationen auf, um einen absichtlich übersprungenen Bereich von einem Erkennungsfehler oder einer tatsächlich textlosen Region zu unterscheiden. Erkennungsschema.

Bei einer bestehenden Integration sollten Sie ein repräsentatives altes Ergebnis neben einem neuen sichern und zuerst die Struktur vergleichen. Kontrollieren Sie umbenannte Felder, geänderte Verschachtelung, Seitenreihenfolge und die nachgelagerte Behandlung fehlender Werte. Ein Schematest, der besteht und zugleich jede Tabelle unbemerkt verwirft, ist kein akzeptabler Migrationstest.

Trennen Sie die Erlaubnis für Code und Modellgewichte

Der Repository-Code verwendet Apache 2.0. Für die Modellgewichte gilt eine separate, modifizierte OpenRAIL-M-Lizenz. Das Gesamtsystem pauschal als GPL zu bezeichnen oder aus der Code-Lizenz eine unbeschränkte Erlaubnis für die Gewichte abzuleiten, verdeckt die eigentliche kommerzielle Entscheidung. Code-Lizenz, Lizenz der Modellgewichte.

Anhang A enthält Beschränkungen in Verbindung mit einem Bruttoumsatz des Vorjahres von mehr als fünf Millionen US-Dollar, einer gesamten Eigen- oder Fremdfinanzierung oberhalb dieses Betrags sowie Produkten oder Diensten, die mit Angeboten des Lizenzgebers konkurrieren. Die Ausnahmen für persönliche Nutzung oder Forschung in den Umsatz- und Finanzierungsbestimmungen sind nicht mit der Wettbewerbsbeschränkung gleichzusetzen. Machen Sie daraus keine pauschale Aussage, dass kleine Unternehmen automatisch berechtigt sind. Lesen Sie die vollständigen Bedingungen für Ihre Organisation und die geplante Bereitstellung. Dieser Leitfaden beschreibt die Lizenz, erteilt aber keine rechtliche Freigabe.

Auch die Dokumente selbst benötigen eine getrennte Prüfung. Die Erlaubnis, ein Modell auszuführen, belegt weder die Erlaubnis zum Hochladen von Lieferantendaten noch zur unbegrenzten Speicherung extrahierter Kennungen oder zur Nutzung dieser Daten für ein anderes Training. Halten Sie fest, wem die Eingabe gehört, wer das Ergebnis sehen darf und welche Umgebung zur Verarbeitung berechtigt ist.

Bauen Sie eine kleine Stichprobe für kostspielige Fehler

Wählen Sie für das Lieferantenszenario eine begrenzte Stichprobe, die tatsächliche Probleme Ihres Teams abbildet. Dazu können ein sauberes digitales PDF, ein Scan mit blasser Schrift, eine gedrehte Seite, ein mehrspaltiges Dokument und eine Tabelle mit wiederholten Überschriften gehören. Das sind vorgeschlagene Kategorien und keine Behauptung, dass Surya jede davon besteht oder verfehlt.

Lassen Sie eine Person die kritischen Felder übertragen und die erwartete Lesereihenfolge markieren, bevor sie die Modellausgabe betrachtet. Sonst kann der erzeugte Text zu seinem eigenen Lösungsschlüssel werden. Bewahren Sie die Originalseite neben der Referenz auf und markieren Sie wirklich unklare Zeichen als unklar, statt einen bequemen Sollwert zu erzwingen.

Geben Sie jeder Seite eine stabile Kennung. Speichern Sie Eingabe-Hash, Ausgangsabmessungen, Verarbeitungseinstellungen und Ausgabepfad. Private Dokumente gehören nicht in öffentliche Fehlermeldungen oder geteilte Screenshots. Reproduzieren Sie einen Parserfehler möglichst mit einer unempfindlichen Ersatzdatei, die das relevante Layout erhält, und kennzeichnen Sie diese als Diagnosebeispiel.

Führen Sie zuerst die kleinste Stichprobe aus. Verfolgen Sie das Ergebnis von der Eingabe über Ihren Parser bis zur Zielanwendung und prüfen Sie nicht nur die Surya-Vorschau. Ein komplettes Archiv durch einen ungeprüften Parser zu schicken vergrößert die spätere Bereinigung, ohne die erste falsche Annahme besser zu erklären.

Verwenden Sie ein Abnahmeblatt statt einer einzelnen Genauigkeitszahl

Das folgende Blatt ist ein redaktioneller Vorschlag für das Lieferantendokument-Beispiel. Legen Sie reale Toleranzen gemeinsam mit den Verantwortlichen des Zielsystems fest. Es enthält keine gemessenen Surya-Ergebnisse.

PrüfungAufzuzeichnender BelegAblehnen oder zur Prüfung weiterleiten, wenn
Kritische IdentitätsfelderQuellausschnitt, Referenztranskription und extrahierter WertEin Zeichen den Lieferanten oder die Zahlungsreferenz verändert, auch wenn der Satz plausibel aussieht.
LesereihenfolgeGeordnete Quellbereiche und geordnete AusgabeblöckeText aus getrennten Spalten vermischt oder eine Notiz dem falschen Abschnitt zugeordnet wird.
TabellenbeziehungenÜberschrift, Zeilenbezeichnung, Menge und Betrag bleiben verbundenRichtige Einzelzahlen dem falschen Artikel zugeordnet werden.
Fehlendes MaterialSeitenzahl und erwartete Bereiche im Vergleich zum AusgabestatusEine Seite, Fortsetzungszeile oder kleine Fußnote ohne Prüfsignal verschwindet.
Verhalten im ZielsystemImportierter Datensatz mit Link zur QuelleDie Anwendung Unsicherheit entfernt, Herkunft verliert oder die geprüfte Seite nicht zeigen kann.

Trennen Sie kritische Fehler von kosmetischen. Ein geänderter Zeilenumbruch kann für die Suche harmlos und für ein Formular mit fester Anordnung unzulässig sein. Diese Unterscheidung gehört in die Abnahmerichtlinie und nicht in eine spontane Entscheidung nach Betrachtung des Ergebnisses. Dokumentieren Sie den Grund jeder Einstufung, damit die nächste prüfende Person dieselbe Regel anwenden kann.

Zählen Sie die Prüfarbeit als Teil des Resultats. Wenn die Ausgabe Tipparbeit spart, aber ständige Seitensuche erfordert, kann der Ablauf insgesamt langsamer sein. Messen Sie die Zeit bis zu einem korrigierten, akzeptierten Datensatz einschließlich der Fehler und nicht nur die Laufzeit erfolgreicher Seiten.

Messen Sie Start und Verarbeitung getrennt

Die aktuelle Surya-Dokumentation beschreibt vLLM für NVIDIA-GPUs sowie llama.cpp für CPU oder Apple Silicon. Eine Installation muss deshalb neben dem Python-Paket auch einen Inferenzdienst berücksichtigen. Dokumentieren Sie das gewählte Backend ausdrücklich. „Lief lokal“ beschreibt Hardware und Software nicht ausreichend. Dokumentation der Inferenz-Backends.

Die Einstellungsdatei enthält getrennte Konfigurationen für Modell-Cache, Endpunkt und Server-Lebenszyklus. Ein lokaler Befehl kann einen entfernten Endpunkt verwenden, und beim ersten Lauf können Modelldownloads nötig sein. Prüfen Sie den tatsächlichen Netzwerkverkehr und die Dokumentenwege, bevor Sie eine Bereitstellung als offline oder für vertrauliche Unterlagen geeignet bezeichnen. Inferenz-Einstellungen.

Erfassen Sie kalten Start, warme Seitenverarbeitung, Ausgabekonvertierung und menschliche Korrektur getrennt. Vergleichen Sie Läufe auf derselben Stichprobe und berichten Sie Fehler zusammen mit der Dauer. Ein günstiger warmer Lauf erklärt nicht das Verhalten eines geplanten Jobs, der für jedes Dokument eine frische Umgebung startet.

Ändern Sie Auflösung oder Parallelität einzeln. Prüfen Sie nach jeder Änderung kleine Schrift und die anspruchsvollste Tabelle erneut. Beobachten Sie den vollständigen Prozess auf Speicherdruck oder abgeschnittene Ausgabe. Behalten Sie die vorherige Einstellung, bis der Ersatz dasselbe Abnahmeblatt besteht. Ein schnellerer Lauf, der das Dezimaltrennzeichen eines Lieferanten verliert, ist keine brauchbare Optimierung.

Diagnostizieren Sie die fehlerhafte Stufe vor einem neuen Versuch

Betrachten Sie Quellseite, Rohergebnis und importierten Datensatz gemeinsam. Wenn der Text bereits im Rohergebnis falsch ist, repariert eine Änderung der Datenbankzuordnung die Erkennung nicht. Sind die Rohwerte korrekt, aber Zeilen nach dem Import vertauscht, lösen wiederholte Modellläufe den Parserfehler nicht.

SymptomErste UntersuchungBeobachtbare Kontrolle nach der Änderung
Die Anwendung importiert nichtsErwartetes Schema mit gespeichertem Rohergebnis und Fehlerflags vergleichenEine bekannte nichtleere Seite erzeugt den erwarteten Datensatz und erhält den Fehlerstatus.
Zeichen sind lesbar, aber die Bedeutung ändert sichSpaltenreihenfolge und Beziehungen zwischen Überschrift und Wert verfolgenJeder extrahierte Wert lässt sich zum vorgesehenen Quellbereich zurückverfolgen.
Kleine Schrift fehltOriginalausschnitt mit der tatsächlich erkannten Rastereingabe vergleichenDerselbe kleine Bereich bleibt in der Eingabe lesbar und erscheint korrekt in der Ausgabe.
Durchsatz schwankt starkStart, Backend-Auslastung und nachgelagerte Konvertierung zeitlich trennenWiederholte Läufe erklären die Abweichung, ohne fehlgeschlagene Seiten auszuschließen.
Neue Version beschädigt alte DokumenteFixierte Versionen, Konfiguration und Ausgabevertrag vergleichenFrühere Abnahmestichprobe und neuer Problemfall bestehen vor der Einführung.

Reparieren Sie eine unklare Quelle nicht durch stilles Erfinden des wahrscheinlichsten Textes. Bewahren Sie eine Unsicherheitsmarkierung auf oder schicken Sie die Seite zur Prüfung. Das ist besonders wichtig, wenn ein flüssiges Ergebnis Vertrauen in einen Wert erzeugt, der im Original kaum lesbar war.

Wählen Sie den nächsten Ablauf anhand der Belege

Enthält das ursprüngliche PDF bereits nutzbaren Text und Struktur, vergleichen Sie zuerst eine direkte Extraktion. Bei einer kleinen Sammlung mit schwieriger Handschrift oder stark unregelmäßigen Tabellen kann eine beaufsichtigte Transkription leichter kontrollierbar sein als eine umfangreiche Integration. Das sind alternative Vorgehensweisen und keine Behauptung, ein bestimmtes Konkurrenzmodell sei besser.

Ein verwalteter Dokumentdienst ist eine andere operative Wahl als selbst gehostetes Surya. Prüfen Sie dessen aktuelle Bedingungen, Aufbewahrungskontrollen, Ausgabevertrag und gesamten Prüfaufwand unabhängig. Die Verwendung eines verwandten Modells macht einen gehosteten Dienst nicht mit dem Repository identisch und überträgt keine lokalen Testergebnisse.

Das nützliche Ergebnis ist eine dokumentierte Grenze: Welche Dokumentklassen dürfen in die Pipeline, welche Felder brauchen Prüfung und welche Fehler stoppen den automatischen Import? Bewahren Sie abgelehnte Beispiele im Rahmen Ihrer Aufbewahrungsregeln als Regressionstest auf. Wiederholen Sie diese Tests, wenn sich Paket, Checkpoint, Backend oder Parser ändert.

Diese Bewertung belegt weder universelle Sprachgenauigkeit noch Datenschutzkonformität in Produktion oder eine Garantie für unbeaufsichtigte Rechnungsverarbeitung. Sie zeigt, wie Sie die konkrete Aufgabe prüfen können. Weitere Kategorien finden Sie im Modellverzeichnis. Wenden Sie dort dieselbe Quellen- und Abnahmedisziplin an.

Häufige Fragen

Was sollte vor der Integration von Surya OCR geprüft werden?

Notieren Sie Paketversion, Modellfamilie, Endpunkt oder lokales Backend, Einstellungen und erwartetes Ausgabeschema. Testen Sie dann eine repräsentative Dokumentstichprobe gegen eine menschlich erstellte Referenz.

Steht Surya OCR vollständig unter Apache 2.0?

Nein. Der geprüfte Repository-Code steht unter Apache 2.0, während die Modellgewichte eine modifizierte OpenRAIL-M-Lizenz mit zusätzlichen Bedingungen verwenden. Prüfen Sie die konkret eingesetzten Dateien.

Belegt ein richtiger Text die korrekte Dokumentextraktion?

Nein. Lesereihenfolge, Blockbeziehungen, Tabellen, übersprungene Inhalte und Fehler können die nachgelagerte Aufgabe weiterhin beschädigen. Prüfen Sie die von Ihrer Anwendung verwendete Struktur.

Wurde Surya OCR für diese Seite einem Benchmark unterzogen?

Nein. Dies ist eine quellenbasierte Bewertung. Sie belegt keine Genauigkeit, Geschwindigkeit, Hardwareanforderung oder Prüfdauer für Ihre Dokumente.