+ Erkennen von gedruckten asiatischen Texten mit Transkribus

Dezember 6, 2018
HTR-Modelle, News, Erfolgsgeschichten, Transkribus

Ja, Sie haben richtig gelesen - unser Transkribus Plattform kann tatsächlich gedruckte indische Texte erkennen.

Herkömmliche OCR-Software hat normalerweise Schwierigkeiten, die komplexen südasiatischen Schriften zu entziffern. Zwei Projekte haben kürzlich mit gedruckten Texten aus dem 19. Jahrhundert in Transkribus gearbeitet, in der Hoffnung, bessere Ergebnisse zu erzielen. Mit Bildern und Abschriften aus einer Sammlung können Transkribus-Benutzer ein Modell trainieren, um gedruckten Text jeder Art zu erkennen.

Zunächst einmal, die British Library Zwei Jahrhunderte indischer Druck Projekt erstellt eine digitalisierte Sammlung von Werken, die in Südasien im achtzehnten und neunzehnten Jahrhundert veröffentlicht wurden. Das Projektteam trainierte ein Texterkennungsmodell in Transkribus mit 50 Seiten (mit 5.700 Wörtern) digitalisierter Bilder und Transkripte aus bengalischen Büchern. Das resultierende Modell kann Transkripte von Seiten aus der Sammlung mit einer durchschnittlichen Zeichenfehlerrate von 21% erzeugen. Obwohl dies eine relativ hohe Fehlerrate ist, plant das Team, das Modell neu zu trainieren, indem es mehr Seiten mit Trainingsdaten erstellt und sich auf die Verbesserung der Erkennung von Elementen der bengalischen Schriftzeichen konzentriert, die manchmal von der Software übersehen wurden.

Die Naval Kishore Presse war ein Verlag des neunzehnten Jahrhunderts, der Werke zu verschiedenen Themen in Hindi, Urdu, Arabisch, Persisch und Sanskrit auf den Markt brachte. Ein Teil seiner Ausgaben befindet sich in der Bibliothek des Südasien-Instituts (SAI) der Universität Heidelberg. Die Bibliothek des Südasien-Instituts und die Universitätsbibliothek Heidelberg arbeiten gemeinsam an der Naval Kishore Press - digital Projekt, bei dem es darum ging, eine Auswahl von Texten, die von dieser Presse veröffentlicht wurden, zu digitalisieren und maschinenlesbar zu machen. Das Projektteam verwendete 200 Seiten an Bildern und Transkripten, um ein Modell in Transkribus zu trainieren, das Hindi- und Sanskrit-Texte erkennt. Dieses Modell kann Transkripte der Sammlung mit einer Zeichenfehlerrate von etwa 5% erstellen. Vollständig durchsuchbare Bilder und Transkripte aus der Sammlung können nun im Online-Katalog der Universitätsbibliothek Heidelberg eingesehen, heruntergeladen und mit Anmerkungen versehen werden.

Lesen Sie mehr:

DIESEN ARTIKEL TEILEN

Neueste Beiträge

Juli 3, 2024

News, Transkribus

Kartierung der Konzerte von Beethoven und Haydn: das Projekt "Konzertleben in Wien".

Einige Transkribus-Projekte enden mit einer vollständig digitalisierten Sammlung in Transkribus. Andere nehmen diese digitalisierte Quelle und verwenden sie ...

Juni 12, 2024

News, Transkribus

Was ist die karolingische Minuskel?

Wenn man an karolingische (oder karolingische) Minuskeln denkt, kommen einem wahrscheinlich Karl der Große und sein riesiges karolingisches Reich in den Sinn. Während die ...

Mai 14, 2024

Uncategorized

KI-Modelle für das Lesen von kursiven und gedruckten polnischen Texten

Das Verstehen historischer Dokumente ist der Schlüssel zum Verständnis der Geschichte. Das Verstehen historischer Dokumente auf Polnisch kann jedoch eine Herausforderung sein. Nicht nur ...

Cookie	Beschreibung	Dauer
viewed_cookie_policy	Das Cookie wird vom GDPR Cookie Consent Plugin gesetzt und dient dazu, zu speichern, ob der Benutzer der Verwendung von Cookies zugestimmt hat oder nicht. Es speichert keine persönlichen Daten.	1 Stunde
PHPSESSID	Dieses Cookie ist in PHP-Anwendungen enthalten. Der Cookie wird verwendet, um die eindeutige Sitzungs-ID eines Benutzers zu speichern und zu identifizieren, um die Benutzersitzung auf der Website zu verwalten. Das Cookie ist ein Sitzungscookie und wird gelöscht, wenn alle Browserfenster geschlossen werden.	1 Jahr

Cookie	Beschreibung	Dauer
BESUCHER_INFO1_LIVE	Dieses Cookie wird von Youtube gesetzt. Wird verwendet, um die Informationen der eingebetteten Youtube-Videos auf einer Website zu verfolgen.	5 Monate
IDE	Wird von Google DoubleClick verwendet und speichert Informationen darüber, wie der Nutzer die Website und andere Werbung vor dem Besuch der Website nutzt. Dies wird verwendet, um Nutzern Anzeigen zu präsentieren, die für sie entsprechend dem Nutzerprofil relevant sind.	2 Jahre

Cookie	Beschreibung	Dauer
GPS	Dieses Cookie wird von Youtube gesetzt und registriert eine eindeutige ID für die Nachverfolgung von Benutzern basierend auf ihrem geografischen Standort	30 Minuten
tk_oder	Dieses Cookie wird vom JetPack-Plugin auf Websites gesetzt, die WooCommerce verwenden. Dies ist ein Referral-Cookie, das zur Analyse des Referrer-Verhaltens für Jetpack verwendet wird	5 Jahre
tk_r3d	Das Cookie wird von JetPack installiert. Wird für die internen Metriken für Benutzeraktivitäten verwendet, um die Benutzererfahrung zu verbessern	3 Tage
tk_lr	Dieses Cookie wird vom JetPack-Plugin auf Websites gesetzt, die WooCommerce verwenden. Dies ist ein Referral-Cookie, das zur Analyse des Referrer-Verhaltens für Jetpack verwendet wird	1 Jahr
_ga	Dieses Cookie wird von Google Analytics installiert. Das Cookie wird verwendet, um Besucher-, Sitzungs- und Camapign-Daten zu berechnen und die Nutzung der Website für den Analysebericht der Website zu verfolgen. Die Cookies speichern Informationen anonym und weisen eine zufällig generierte Nummer zu, um eindeutige Besucher zu identifizieren.	2 Jahre
_gid	Dieses Cookie wird von Google Analytics installiert. Das Cookie wird verwendet, um Informationen darüber zu speichern, wie Besucher eine Website nutzen, und hilft bei der Erstellung eines Analyseberichts darüber, wie sich die Website verhält. Die gesammelten Daten umfassen die Anzahl der Besucher, die Quelle, von der sie kommen, und die besuchten Seiten in anonymer Form.	1 Tag
matomo	Für die statistische Analyse verwenden wir auf dieser Website "Matomo". Dies ist ein Open-Source-Tool für die Webanalyse. Matomo überträgt keine Daten an Server außerhalb der Kontrolle von READ-COOP. Matomo ist deaktiviert, wenn Sie unsere Website besuchen. Nur wenn Sie aktiv zustimmen, wird Ihr Nutzungsverhalten anonymisiert erfasst.	1 Jahr

Cookie	Beschreibung	Dauer
YSC	Dieses Cookie wird von Youtube gesetzt und dient dazu, die Aufrufe von eingebetteten Videos zu verfolgen.	1 Jahr
_gat	Dieses Cookie wird von Google Universal Analytics installiert, um die Abfragerate zu drosseln und so die Datensammlung auf stark frequentierten Seiten zu begrenzen.	1 Minute

+ Erkennen von gedruckten asiatischen Texten mit Transkribus

Neueste Beiträge

Kartierung der Konzerte von Beethoven und Haydn: das Projekt "Konzertleben in Wien".

Was ist die karolingische Minuskel?

KI-Modelle für das Lesen von kursiven und gedruckten polnischen Texten

Die COOP

Produkte & Dienstleistungen

Nützliche Informationen

Hilfreiche Ressourcen

Community