
Das FineBooks-Projekt von Hugging Face und EleutherAI hat 14 offene OCR-Modelle an über 2000 historischen Buchseiten getestet. Das beste Modell, dots.mocr, erreicht 97,6 Prozent Zeichengenauigkeit bei unter zwei Dollar pro tausend Seiten. Für KI-Trainingsdaten reicht das, für wissenschaftliche Transkriptionen bisher nicht.
Der Artikel Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern erschien zuerst auf The Decoder.
