El trabajo con documentos históricos


La investigación de documentos históricos consiste en organizar grandes cantidades de registros manuscritos, archivos y datos dispersos.

¿Cómo consiguen los historiadores y los investigadores examinar décadas de documentos para encontrar lo que realmente importa?

En este episodio de AiCR , Joe Furlong conversa con el Dr. Jonathan DeCoster, Kathleen Miller y Miles Gabrielli-Burke, de la Universidad de Nueva Inglaterra, para hablar sobre la investigación de documentos históricos, el aprendizaje basado en la comunidad y los retos que plantea trabajar con material de archivo. La conversación analiza cómo abordan los investigadores los registros históricos, cómo participan los estudiantes en proyectos del mundo real y por qué la organización de la información suele ser una de las partes más difíciles del proceso.

  •  Cómo abordan los historiadores la investigación documental y los archivos
  •  Los retos que plantea el trabajo con documentos manuscritos e históricos
  •  Proyectos de investigación de base comunitaria y participación de los estudiantes
  •  Cómo son realmente los flujos de trabajo con documentos históricos en el día a día

El AiCR ofrece entrevistas con líderes del sector hipotecario y de los servicios financieros sobre los flujos de trabajo documentales y la toma de decisiones tecnológicas.

Extrar texto de un documento histórico parece algo que ya debería haberse resuelto. Pero no es así. Conseguir que los documentos digitalizados sean consultables, estén estructurados y sean útiles para la investigación es uno de los problemas más difíciles a los que se enfrenta hoy en día el trabajo archivístico. 

En el episodio 8 deAiCR , Joe Furlong conversa con el Dr. Jonathan DeCoster, profesor de Historia de la Universidad de Nueva Inglaterra; Kathleen Miller, bibliotecaria y archivista; y Miles Gabrielli-Burke, estudiante de Historia, para hablar sobre cómo funciona realmente la investigación de documentos históricos, cómo se desarrolla en la práctica el aprendizaje participativo con la comunidad y qué ocurre cuando se prueban herramientas de extracción de documentos en actas judiciales manuscritas del siglo XVIII. 

¿Con qué tipo de documentos históricos trabajan realmente los investigadores? 

Los documentos que surgen en la investigación histórica comunitaria son variados y, a menudo, inesperados. Miles Gabrielli-Burke trabajó en un proyecto de digitalización de menús de hotel de 1939, recopilados por un historiador local de Biddeford (Maine), cuya familia tenía profundas raíces en la zona. Otro proyecto se centró en fotografías de objetos del Museo Abbey con una documentación existente mínima. El reto en todos estos casos es el mismo: tomar un documento físico o una imagen y convertirlo en algo consultable, estructurado y utilizable con fines de investigación. Esa brecha entre la existencia de un documento y su utilizabilidad es donde realmente se lleva a cabo la mayor parte del trabajo. 

¿Por qué resulta tan difícil digitalizar documentos históricos? 

Hacer una foto de un documento es muy sencillo. Sin embargo, conseguir que el texto sea extraíble, consultable y utilizable es un problema totalmente distinto. Jonathan DeCoster describe la extracción de texto de registros históricos manuscritos como una de las tareas más difíciles que ha realizado jamás. El reto se complica cuando se trabaja con escritura manuscrita de hace cientos de años, formatos inconsistentes, abreviaturas que requieren conocimientos históricos para interpretarlas y documentos que nunca se diseñaron para ser leídos por una máquina. Un investigador que quiera identificar tendencias en cientos de casos judiciales no puede hacerlo leyendo cada uno de ellos individualmente. El texto debe extraerse, estructurarse y organizarse a gran escala. 

¿Qué resultados ofrecen las herramientas de extracción de documentos cuando se aplican a registros históricos? 

Jonathan DeCoster realizó una comparación en directo con un registro judicial manuscrito de 1770 utilizando cuatro herramientas: el OCR integrado de Apple, Adobe Acrobat, la herramienta de conversión de Google Drive yAiCR. La herramienta de Apple arrojó resultados deficientes. Adobe Acrobat ni siquiera fue capaz de detectar que había texto. Google Drive funcionó algo mejor, pero seguía teniendo limitaciones.AiCR resultados sustancialmente mejores, extrayendo con éxito los nombres, identificando los roles de demandante y demandado incluso cuando solo aparecían como abreviaturas, y reconociendo los nombres de las localidades. No fue perfecto, y Jonathan señaló las correcciones que tuvo que hacer al compararlo con la imagen original. Pero la diferencia en la calidad del resultado fue significativa, y la capacidad de procesar cientos de registros en lugar de uno a uno es donde el valor de la investigación se hace realidad. Un documento aparte, un registro de tienda de una fábrica textil que ocupaba ocho gigabytes y constaba de 360 páginas de densas anotaciones manuscritas, resultó demasiado complicado para que ninguna herramienta pudiera procesarlo con claridad. 

¿CómoAiCR las alucinaciones en las preguntas y respuestas sobre documentos? 

La función de preguntas y respuestas sobre documentosAiCRpermite a los investigadores formular preguntas directamente sobre el contenido de sus documentos, en lugar de tener que revisarlo todo manualmente. El sistema está diseñado de tal forma que, si no conoce la respuesta basándose en el contenido del documento, lo indica en lugar de generar una respuesta a partir de fuentes externas. La base de conocimientos se limita al contenido extraído del documento. La puntuación de confianza ofrece a los usuarios transparencia sobre el grado de certeza del sistema cuando devuelve un valor. Joe Furlong describe el principio de diseño como la preferencia por un falso negativo, en el que el sistema dice que no sabe, frente a una alucinación en la que el sistema inventa una respuesta. Para aplicaciones de investigación en las que la precisión y la integridad de la fuente son importantes, esa distinción es fundamental. 

¿Cuál es la opinión de los bibliotecarios y archiveros sobre las herramientas de inteligencia artificial? 

Kathleen Miller, bibliotecaria y archivista de la Universidad de Nueva Inglaterra, describe su postura actual como escéptica, pero abierta. Sus preocupaciones se centran en la amplia implantación de las herramientas de IA, las cuestiones relacionadas con la propiedad intelectual y la fiabilidad de los resultados, que aún requieren una revisión y corrección humanas considerables. Ha utilizado herramientas de IA para ayudar a transcribir grabaciones de historia oral y las ha encontrado de utilidad limitada, ya que, aunque le han permitido acercarse a una transcripción utilizable, han requerido una minuciosa verificación de los datos a lo largo de todo el proceso. Cuando procesó los menús de hotel del proyecto de digitalización a través deAiCR, encontró los resultados realmente impresionantes para el texto mecanografiado, ya que solo requirieron pequeños ajustes de formato. Su opinión es que las herramientas de IA específicas para documentos, con bases de conocimiento limitadas y puntuaciones de confianza transparentes, son significativamente diferentes de las aplicaciones de modelos de lenguaje grandes y generales, y representan un enfoque más defendible para el trabajo de archivo e investigación. 

¿Cómo están abordando los profesores el uso de la inteligencia artificial en el trabajo académico? 

Jonathan DeCoster aborda el uso de la IA en el ámbito académico mediante el diseño de proyectos que exigen a los estudiantes realizar tareas que la IA no puede llevar a cabo. La investigación basada en la comunidad —que implica el manejo físico de documentos, entrevistas con miembros de la comunidad y la creación de bases de datos a partir de decisiones de investigación reales— es, por naturaleza, inmune a los atajos que ofrece la IA. El verdadero aprendizaje en la investigación histórica no reside en la transcripción. Reside en leer, pensar, hablar con la gente, comprender quién es el público y decidir qué debe lograr el resultado final. Las herramientas de IA que agilizan las partes mecánicas de ese trabajo liberan a los estudiantes para que se centren en las partes que realmente requieren criterio. 

Preguntas frecuentes sobre la investigación de documentos históricos 

¿Cuál es la diferencia entre digitalizar y hacer que los documentos sean consultables? 

La digitalización es el proceso de convertir un documento físico en una imagen digital. Para que un documento sea consultable, es necesario extraer el texto de dicha imagen, de modo que pueda ser consultado, analizado y utilizado en bases de datos de investigación. Muchos documentos históricos solo existen en forma de imágenes digitales sin texto extraído, lo que significa que los investigadores aún tienen que leerlos manualmente. La extracción de texto a gran escala es lo que permite el análisis de tendencias y la investigación histórica a gran escala. 

¿Por qué resulta tan difícil extraer texto de documentos históricos escritos a mano? 

La escritura manuscrita histórica no sigue las formas de letra uniformes con las que se han entrenado las herramientas de OCR. Los documentos antiguos utilizan abreviaturas, convenciones de formato y vocabulario diferentes. El estado físico del documento, la pérdida de intensidad de la tinta, la degradación del papel y la calidad del escaneo influyen en la legibilidad del texto. La mayoría de las herramientas de OCR estándar fracasan por completo con los registros manuscritos del siglo XVIII, ya que no fueron diseñadas para ese tipo de documentos. 

¿CómoAiCR las preguntas y respuestas sobre documentos sin dar resultados erróneos? 

La función de preguntas y respuestas sobre documentosAiCRlimita la base de conocimientos del sistema al contenido extraído de los documentos que se están procesando. No recurre a fuentes externas para generar respuestas. Cuando el sistema tiene dudas o la información no se encuentra en el documento, devuelve una puntuación de confianza baja o indica que no sabe, en lugar de generar una respuesta a partir de conocimientos generales. Este diseño permite rastrear el origen de las respuestas hasta el documento de referencia. 

Acerca de la plataforma AiCR

AiCR es una serie de conversaciones en directo presentada por Joe Furlong. Los nuevos episodios se emiten en directo en LinkedIn el segundo y cuarto martes de cada mes a las 12:00 h (hora del Este). Sigue aAiCR LinkedIn para ver los episodios a medida que se emiten y únete a la conversación.

Acerca del Dr. Jonathan DeCoster 

El Dr. Jonathan DeCoster es profesor de Historia en la Universidad de Nueva Inglaterra, donde imparte clases y lleva a cabo investigaciones mediante un modelo de participación comunitaria que pone en contacto a los estudiantes con proyectos de archivo reales y socios de la comunidad. Se puede contactar con él a través de LinkedIn

Acerca de Kathleen Miller 

Kathleen Miller es bibliotecaria y archivista en la Universidad de Nueva Inglaterra. Puedes contactar con ella en LinkedIn