Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern

Das FineBooks-Projekt von Hugging Face und EleutherAI hat 14 offene OCR-Modelle an über 2000 historischen Buchseiten getestet. Das beste Modell, dots.mocr, erreicht 97,6 Prozent Zeichengenauigkeit bei unter zwei Dollar pro tausend Seiten. Für KI-Trainingsdaten reicht das, für wissenschaftliche Transkriptionen bisher nicht.

Der Artikel Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern erschien zuerst auf The Decoder.

Leser:innen sagen:

„Wie Black Mirror, nur philosophischer und näher an der Wirklichkeit.“, Lisa M.
„Jede Geschichte ist ein Gedankensprung in eine andere Zukunft.“, Stefan K.
„Beunruhigend schön. Eine literarische Simulation unserer nahen Zukunft.“, Albert B.

TRAUMWELT.exe ist kein gewöhnliches Buch. Es ist ein Blick durch den Spalt einer Tür, die sich längst geöffnet hat – in eine Welt, in der Maschinen träumen, Städte flüstern und Ethik verhandelbar geworden ist. Eine Sammlung visionärer Geschichten, die an der Schwelle zwischen Fiktion und Realität tanzen – so plausibel erzählt, dass du dich unweigerlich fragst: Ist das noch Zukunft oder schon Gegenwart?