MOSS-OCR: 0,3B-Modell für Patent-OCR schlägt größere Systeme
MOSS-OCR entstand aus einem konkreten Praxisproblem bei PatSnap: Gängige OCR-Systeme scheiterten regelmäßig an den spezifischen Anforderungen von Patentdokumenten – zusammengeführte Tabellen verloren ihre Struktur, chemische Diagramme wurden entstellt und Formelblöcke mit gemischter CJK- und lateinischer Schrift korrumpiert. Das Team entschied sich bewusst für ein Block-Level-Design: MOSS-OCR setzt voraus, dass Layout-Erkennung und Lesereihenfolge bereits extern bestimmt wurden, was das Modell klein und schnell hält. Das Trainingsset umfasst über 50 Millionen Samples mit patent-spezifischen Daten als Kern. Für den vollständigen Dokumenten-Pipeline-Bedarf hat PatSnap ergänzend Hiro-Smart-Doc entwickelt, das RT-DETR-basierte Layout-Erkennung und MOSS-OCR als FastAPI-Service zusammenführt. Beide Projekte stehen unter der Apache-2.0-Lizenz und sind auf GitHub verfügbar; eine interaktive Demo läuft auf Hugging Face Spaces. Der eigens erstellte patent-bench-Datensatz, auf dem MOSS-OCR mit 93,49 Punkten den ersten Platz belegt, soll die Lücke bei domänenspezifischer Evaluation schließen, da OmniDocBench allein keine Patent-spezifischen Szenarien abdeckt.
- Block-Level-Only-Architektur: MOSS-OCR übernimmt keine Seiten-Layout-Erkennung oder Lesereihenfolge — diese Aufgaben übernimmt Hiro-Smart-Doc via RT-DETR.
- Eigener Benchmark patent-bench: PatSnap veröffentlicht einen offenen patent-domänenspezifischen Benchmark, auf dem MOSS-OCR mit 93,49 Punkten Rang 1 belegt.
- Deployment via vLLM: Die ~59 QPS auf einer RTX 4090 entsprechen etwa dem doppelten Durchsatz gegenüber MinerU 2.5 unter vergleichbaren Bedingungen.
- Hiro-Smart-Doc kombiniert RT-DETR für Layout-Detektion mit MOSS-OCR als OCR-Backend in einem einzigen FastAPI-Service.
- Reddit-Post stammt von /u/Brilliant_Rich3746, vermutlich einem PatSnap-Entwickler; beide Repos liegen unter github.com/patsnap.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
MOSS-OCR: 0,3B-Modell für Patent-OCR schlägt größere Systeme
MOSS-OCR entstand aus einem konkreten Praxisproblem bei PatSnap: Gängige OCR-Systeme scheiterten regelmäßig an den spezifischen Anforderungen von Patentdokumenten – zusammengeführte Tabellen verloren ihre Struktur, chemische Diagramme wurden entstellt und Formelblöcke mit gemischter CJK- und lateinischer Schrift korrumpiert. Das Team entschied sich bewusst für ein Block-Level-Design: MOSS-OCR setzt voraus, dass Layout-Erkennung und Lesereihenfolge bereits extern bestimmt wurden, was das Modell klein und schnell hält. Das Trainingsset umfasst über 50 Millionen Samples mit patent-spezifischen Daten als Kern. Für den vollständigen Dokumenten-Pipeline-Bedarf hat PatSnap ergänzend Hiro-Smart-Doc entwickelt, das RT-DETR-basierte Layout-Erkennung und MOSS-OCR als FastAPI-Service zusammenführt. Beide Projekte stehen unter der Apache-2.0-Lizenz und sind auf GitHub verfügbar; eine interaktive Demo läuft auf Hugging Face Spaces. Der eigens erstellte patent-bench-Datensatz, auf dem MOSS-OCR mit 93,49 Punkten den ersten Platz belegt, soll die Lücke bei domänenspezifischer Evaluation schließen, da OmniDocBench allein keine Patent-spezifischen Szenarien abdeckt.
- Block-Level-Only-Architektur: MOSS-OCR übernimmt keine Seiten-Layout-Erkennung oder Lesereihenfolge — diese Aufgaben übernimmt Hiro-Smart-Doc via RT-DETR.
- Eigener Benchmark patent-bench: PatSnap veröffentlicht einen offenen patent-domänenspezifischen Benchmark, auf dem MOSS-OCR mit 93,49 Punkten Rang 1 belegt.
- Deployment via vLLM: Die ~59 QPS auf einer RTX 4090 entsprechen etwa dem doppelten Durchsatz gegenüber MinerU 2.5 unter vergleichbaren Bedingungen.
- Hiro-Smart-Doc kombiniert RT-DETR für Layout-Detektion mit MOSS-OCR als OCR-Backend in einem einzigen FastAPI-Service.
- Reddit-Post stammt von /u/Brilliant_Rich3746, vermutlich einem PatSnap-Entwickler; beide Repos liegen unter github.com/patsnap.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.