Indtil for nylig var massetransskribering af frakturskrift ikke en realistisk mulighed for hobbyfolk. Resultatet af ABBYY FineReader Fraktur OCR er lige så dårligt, som det er dyrt. Transkribus’ Metagrapho-API er en lukket fest for arkiver, biblioteker og andre med organisationsabonnement. Tesseract OCR for gotisk skrift er gratis, men kvaliteten er ringe.
Derfor kom det som en gave sendt fra himlen til private entusiaster, da Gemini 2.5 i juni 2025 pludselig gjorde massetransskribering af frakturskrift tilgængelig med forbavsende god kvalitet og særdeles overkommelig prissætning.
Teksterne her på siden er derfor transskriberet fra PDF under anvendelse af Gemini API, bortset fra den digitale tekst til Danske Lov, der er baseret på Bjørn Andersens transskription (bjoerna.dk). Teksterne er programmatisk efterbehandlet og kontrolleret for systemiske fejl. Både Gemini API og OpenAI API er anvendt ved den efterfølgende strukturering af materialet.
Selv om Gemini leverer transskriptioner af pæn kvalitet, er resultatet langt fra fejlfrit. Det skyldes ikke kun mangler i Geminis transskription, men også, at de tilgængelige PDF-filer er af meget svingende kvalitet.
Nogle bogsider er overlæsset med håndskrevne tilføjelser, understregninger og i værste fald overstregninger. Andre bogsider har så svag skrift, at indholdet selv for det menneskelige øje er svært at læse. Hvor tydning har vist sig helt umulig, vil der være indsat [Uklart].
Der er nogle områder, hvor der i øjeblikket er særlig risiko for at støde på fejl:
-
Lange og komplekse tabeller
Lange tabeller kan være en meget stor udfordring. De længste strækker sig over mere end 120 bogsider og kan rumme skiftende layout, krøllede parenteser med forskellig betydning, indskudte noter og midlertidige tabelafbrydelser. En del tabeller er to-siders, hvor venstre del af kolonnerne står på lige bogsider og højre del på ulige. For at gengive komplekse tabelstrukturer i simpel HTML har det været nødvendigt at give AI frihed til at omstrukturere tabeller, under forudsætning af at den originale tabels faktuelle indhold og intention bevares. Der kan derfor være layoutforskelle mellem originalens tabeller og de viste.
-
Fangord og sideskift
Ved sideskift i originalen kan der i enkelte tilfælde fejlagtigt være medtaget fangord, også kaldet kustoder. Der kan også fejlagtigt være begyndt på nyt afsnit. Den dokumentdatering i margin, som altid optræder på ny originalsides første linje, kan i nogle tilfælde fejlagtigt være læst som del af brødteksten. Disse typer fejl vil i næsten alle tilfælde blive rettet øjeblikkeligt, hvis du gør opmærksom på dem (se øjeblikkelige rettelser).
-
Fodnoter
Fodnoter er en anden stor udfordring, fordi en enkelt note kan strække sig over adskillige bogsider. Vær særlig opmærksom på lange fodnoter og kontrollér med originalen.
-
Sammensmeltede dokumenter
Der kan forekomme tilfælde, hvor der ikke er korrekt adskillelse mellem to dokumenter, så nyt dokument fortsætter i forlængelsen af det viste dokument. Gør du opmærksom på det med "Ret Fejl", vil dokumenterne blive adskilt efter manuel kontrol
-
Fejltolkede bogstaver og tegn
Der kan forekomme almindelige fejltolkninger af bogstaver, hvor især æ, ø og tysk umlaut er i risikozonen. Der er også risiko for, at ſ, langt s, forveksles med f, ligesom k også er i øget risiko for at blive forvekslet med f. Der er desuden noteret problemer med at kende forskel på ₻ (mark) og ß (skilling).
-
Malplacerede ord
Der er risiko for, at AI ved problemer med tydning tyr til at vælge et malplaceret ord. Med en skarp prompt kan problemet minimeres ganske meget, men ikke helt udelukkes.
-
Orddelingsstreg
I nogle tilfælde er orddelingsstreger, der i originalen markerer orddeling ved linjeafslutning, fejlagtigt medtaget, så f.eks. "antage" står som "an-tage". Bruger du "Ret fejl" på denne fejltype, bliver den rettet øjeblikkeligt.
-
Efterbehandling
Endelig er der en risiko for, at der ved efterbehandlingen utilsigtet er forårsaget nye fejl. Karakteren af dem er i sagens natur ukendt, for ellers var de blevet rettet.