El proyecto FineBooks, desarrollado por Hugging Face y EleutherAI, ha evaluado 14 modelos de OCR de código abierto utilizando más de 2,000 páginas de libros históricos. Los resultados muestran que los modelos más pequeños superan a los más grandes, con el modelo más eficiente logrando una precisión de caracteres superior al 97% a un costo inferior a dos dólares por mil páginas.
A pesar de que la calidad de salida es adecuada para el entrenamiento de modelos de lenguaje de inteligencia artificial, los investigadores advierten que estos modelos aún presentan demasiados errores para aplicaciones académicas. La diferencia en la eficiencia de aprendizaje es notable, ya que un modelo entrenado con texto de OCR opera a solo el 30% de la efectividad en comparación con uno entrenado con transcripciones humanas.
Con el objetivo de mejorar los conjuntos de datos de entrenamiento de IA, FineBooks se enfoca en reprocessar libros de dominio público, comenzando por la Biodiversity Heritage Library (BHL), que alberga más de 300,000 libros. Este esfuerzo se considera crucial para avanzar en la calidad de los datos disponibles para la inteligencia artificial.