Lateinische Abkürzungen und Silbentrennungen beherrschen - Das Bentham- und DEEDS-Projekt

1. Juli 2021
HTR-Modelle

Eine Zusammenarbeit zwischen dem Bentham-Projekt des University College London und dem DEEDS-Projekt (Documents of Early England Data Set) der University of Toronto nutzt Transkribus für die Transkription eines immensen Korpus mittelalterlicher Urkunden aus dem 12.^. zum 15^. Jahrhundert. Das handgeschriebene Latein dieser Zeit ist sehr eigenartig und konfrontierte sie mit zwei interessanten Fragen:

Konnte Transkribus konsequent darauf trainiert werden, abgekürzte lateinische Wörter zu verarbeiten, die bis zur Hälfte des Vokabulars mittelalterlicher Rechtstexte ausmachen können und daher in einem beträchtlichen Teil des Documents of Early England Data Set (DEEDS) Korpus an der Universität Toronto enthalten sind?
Könnte Transkribus dazu gebracht werden, Wörter mit Bindestrich, die sich über mehrere Textzeilen erstrecken, konsequent zu erkennen (sofern sie sowohl in Latein als auch abgekürzt sind)?

Um Antworten zu finden, beschloss das Team zunächst, ein eigenes Wörterbuch mit über hundert abgekürzten lateinischen Wörtern zu erstellen, sowohl in ihrer abgekürzten als auch in ihrer erweiterten Form. Dies geschah mit Hilfe des unabhängigen Programmierers Ismail Prada aus der Schweiz, der abbrevSolver-master, ein Python-Skript, programmierte. Die verkürzte Form wurde durch kompatible Sonderzeichen dargestellt, die am besten wiedergeben, wie sie in der Schrift erscheinen. Diese Abkürzungen wurden auch als Präfixe, Suffixe oder eigenständige Abkürzungen kategorisiert, was die Art und Weise, wie sie vom Algorithmus verarbeitet werden, verändern würde. Diese Methode erwies sich jedoch als problematisch, da mehrere Versionen der entsprechenden tabulatorgetrennten Excel-Datei erstellt werden mussten, die die abgekürzten Wörter und mehrere Varianten von Sonderzeichen enthielten, damit sie wie vorgesehen funktionierten. Die einzige Möglichkeit, dieses Problem zu lösen, bestand darin, mit dem Suchen und Ersetzen der abgekürzten Wörter ohne die Verwendung des Skripts fortzufahren, indem die Wörter manuell gesucht und ersetzt wurden. Dies bedeutete einen sehr zeitintensiven Prozess und war auf Dauer nicht praktikabel. Mit Hilfe von Prada wurde das Skript jedoch korrigiert und sogar ein übergeordnetes API-Skript entwickelt, das nach Angabe des Benutzernamens und Passworts des Sammlungseditors sowie der Sammlungs-ID direkt mit Transkribus verbunden ist. Das neue Skript ist schneller und einfacher zu bedienen. Nach dem Ausführen eines einfachen Befehls kommuniziert das Skript mit Transkribus und wendet dessen Find-and-Replace-Algorithmus auf jede Untersammlung an, wobei es jeden gefundenen Begriff aus dem Abkürzungswörterbuch durch sein kürzeres Äquivalent ersetzt und als abgekürzt kennzeichnet. In dieser Phase des Projekts wurden fünf neue HTR-Modelle erstellt. Im Laufe des Projekts sanken sowohl der WER als auch der CER in vielversprechender Weise und die Modelle, die nach der Erstellung des neuen Skripts generiert wurden, sind extrem gut. Zusätzlich nutzte das Forschungsteam Material der Oxford University und der Christ Church, um die Ground Truth weiter zu erweitern und konnte zwei weitere Modelle erstellen, die die Testergebnisse des DEEDS-Korpus verbesserten. Auf dem Weg zu den neuen Modellen erschwerten einige Hindernisse, wie z. B. die schlechte Bildqualität und die Kürze der Bilder, die Entwicklung zusätzlich. Dennoch ist das #7-Modell nun für jedermann frei verfügbar. Mehr als 140 000 Wörter wurden trainiert und der CER auf dem Validation Set liegt bei 0,8% Für weitere Details über das Projekt und die entwickelten Modelle besuchen Sie deren Website: https://blogs.ucl.ac.uk/transcribe-bentham/2021/04/20/ucl-university-of-toronto-transkribus-htr-and-medieval-latin-abbreviations/

DIESEN ARTIKEL TEILEN

Neueste Beiträge

Juli 3, 2024

News, Transkribus

Kartierung der Konzerte von Beethoven und Haydn: das Projekt "Konzertleben in Wien".

Einige Transkribus-Projekte enden mit einer vollständig digitalisierten Sammlung in Transkribus. Andere nehmen diese digitalisierte Quelle und verwenden sie ...

Juni 12, 2024

News, Transkribus

Was ist die karolingische Minuskel?

Wenn man an karolingische (oder karolingische) Minuskeln denkt, kommen einem wahrscheinlich Karl der Große und sein riesiges karolingisches Reich in den Sinn. Während die ...

Mai 14, 2024

Uncategorized

KI-Modelle für das Lesen von kursiven und gedruckten polnischen Texten

Das Verstehen historischer Dokumente ist der Schlüssel zum Verständnis der Geschichte. Das Verstehen historischer Dokumente auf Polnisch kann jedoch eine Herausforderung sein. Nicht nur ...

Cookie	Beschreibung	Dauer
viewed_cookie_policy	Das Cookie wird vom GDPR Cookie Consent Plugin gesetzt und dient dazu, zu speichern, ob der Benutzer der Verwendung von Cookies zugestimmt hat oder nicht. Es speichert keine persönlichen Daten.	1 Stunde
PHPSESSID	Dieses Cookie ist in PHP-Anwendungen enthalten. Der Cookie wird verwendet, um die eindeutige Sitzungs-ID eines Benutzers zu speichern und zu identifizieren, um die Benutzersitzung auf der Website zu verwalten. Das Cookie ist ein Sitzungscookie und wird gelöscht, wenn alle Browserfenster geschlossen werden.	1 Jahr

Cookie	Beschreibung	Dauer
BESUCHER_INFO1_LIVE	Dieses Cookie wird von Youtube gesetzt. Wird verwendet, um die Informationen der eingebetteten Youtube-Videos auf einer Website zu verfolgen.	5 Monate
IDE	Wird von Google DoubleClick verwendet und speichert Informationen darüber, wie der Nutzer die Website und andere Werbung vor dem Besuch der Website nutzt. Dies wird verwendet, um Nutzern Anzeigen zu präsentieren, die für sie entsprechend dem Nutzerprofil relevant sind.	2 Jahre

Cookie	Beschreibung	Dauer
GPS	Dieses Cookie wird von Youtube gesetzt und registriert eine eindeutige ID für die Nachverfolgung von Benutzern basierend auf ihrem geografischen Standort	30 Minuten
tk_oder	Dieses Cookie wird vom JetPack-Plugin auf Websites gesetzt, die WooCommerce verwenden. Dies ist ein Referral-Cookie, das zur Analyse des Referrer-Verhaltens für Jetpack verwendet wird	5 Jahre
tk_r3d	Das Cookie wird von JetPack installiert. Wird für die internen Metriken für Benutzeraktivitäten verwendet, um die Benutzererfahrung zu verbessern	3 Tage
tk_lr	Dieses Cookie wird vom JetPack-Plugin auf Websites gesetzt, die WooCommerce verwenden. Dies ist ein Referral-Cookie, das zur Analyse des Referrer-Verhaltens für Jetpack verwendet wird	1 Jahr
_ga	Dieses Cookie wird von Google Analytics installiert. Das Cookie wird verwendet, um Besucher-, Sitzungs- und Camapign-Daten zu berechnen und die Nutzung der Website für den Analysebericht der Website zu verfolgen. Die Cookies speichern Informationen anonym und weisen eine zufällig generierte Nummer zu, um eindeutige Besucher zu identifizieren.	2 Jahre
_gid	Dieses Cookie wird von Google Analytics installiert. Das Cookie wird verwendet, um Informationen darüber zu speichern, wie Besucher eine Website nutzen, und hilft bei der Erstellung eines Analyseberichts darüber, wie sich die Website verhält. Die gesammelten Daten umfassen die Anzahl der Besucher, die Quelle, von der sie kommen, und die besuchten Seiten in anonymer Form.	1 Tag
matomo	Für die statistische Analyse verwenden wir auf dieser Website "Matomo". Dies ist ein Open-Source-Tool für die Webanalyse. Matomo überträgt keine Daten an Server außerhalb der Kontrolle von READ-COOP. Matomo ist deaktiviert, wenn Sie unsere Website besuchen. Nur wenn Sie aktiv zustimmen, wird Ihr Nutzungsverhalten anonymisiert erfasst.	1 Jahr

Cookie	Beschreibung	Dauer
YSC	Dieses Cookie wird von Youtube gesetzt und dient dazu, die Aufrufe von eingebetteten Videos zu verfolgen.	1 Jahr
_gat	Dieses Cookie wird von Google Universal Analytics installiert, um die Abfragerate zu drosseln und so die Datensammlung auf stark frequentierten Seiten zu begrenzen.	1 Minute

Lateinische Abkürzungen und Silbentrennungen beherrschen - Das Bentham- und DEEDS-Projekt

Neueste Beiträge

Kartierung der Konzerte von Beethoven und Haydn: das Projekt "Konzertleben in Wien".

Was ist die karolingische Minuskel?

KI-Modelle für das Lesen von kursiven und gedruckten polnischen Texten

Die COOP

Produkte & Dienstleistungen

Nützliche Informationen

Hilfreiche Ressourcen

Community