Imagen generada con IA

El estudio analiza cómo la reducción del tamaño de archivos digitalizados puede afectar, sin que sea evidente a simple vista, la capacidad de los sistemas de reconocimiento óptico de caracteres para interpretar correctamente el texto.

Por: Adriana Torres

04 de Setiembre, 2026.


El Dr. Ing. Brandon Vicente Ramírez Romero, docente del Programa de Ingeniería de Sistemas de la filial Tarma de la Facultad de Ingeniería de la Universidad Católica Sedes Sapientiae (UCSS), publicó junto a Becquer Frauberth Camayo Lapa, de la Universidad Nacional del Centro del Perú (UNCP), el artículo científico Open-Source Document-Image Compression and OCR Degradation: A Reproducible, Multi-Axis Evaluation en la revista internacional IEEE Access.

La investigación analiza cómo la reducción del tamaño de documentos escaneados puede afectar el funcionamiento de los sistemas de reconocimiento óptico de caracteres (OCR), utilizados para identificar y procesar texto de manera automática. Así, una página puede conservar una buena apariencia visual y, al mismo tiempo, presentar dificultades para ser interpretada correctamente por estos sistemas.

Para evaluar este riesgo, los investigadores analizaron 1951 páginas escaneadas y más de 56 000 mediciones, utilizando cinco métodos de compresión de software libre. Como parte del trabajo, desarrollaron Barlume, una suite de evaluación de código abierto que permite medir, antes de comprimir una colección, cuánto se degrada el reconocimiento de texto con cada método.

Entre sus principales hallazgos, el estudio encontró que en el 34,9 % de las comparaciones analizadas la compresión empeoró el reconocimiento automático del texto por encima del umbral fijado por los autores. También mostró que el aspecto visual de una página no basta para anticipar ese daño y que la compresión con pérdida de la capa de texto en el formato JBIG2, la misma técnica que en 2013 llevó a algunos escáneres de Xerox a cambiar dígitos en los documentos, aumentó la degradación en todos los niveles de calidad probados. El porcentaje corresponde a las 540 páginas del estudio que contaban con transcripción de referencia, por lo que no representa la proporción de páginas afectadas en cualquier archivo.

“Una página escaneada puede verse impecable después de comprimirla y, aun así, haberse vuelto menos legible para los sistemas que la buscan y la procesan. Ese daño silencioso es lo que este estudio mide y pone en manos de quien digitaliza”, señala Ramírez Romero.

El artículo fue publicado el 18 de agosto de 2026 en IEEE Access, volumen 14, páginas 144402-144419, revista indexada en Scopus y ubicada en el primer cuartil (Q1) de General Engineering, según CiteScore 2025: 9.3, puesto 31 de 351 y percentil 91. Asimismo, se encuentra disponible en acceso abierto bajo licencia Creative Commons CC BY 4.0, lo que permite su lectura y difusión sin necesidad de suscripción.

Ramírez Romero figura como primer autor y autor de correspondencia del artículo. Además, el código, las tablas de resultados y el entorno de ejecución utilizados en el estudio se encuentran disponibles en un repositorio abierto, contribuyendo a la reproducibilidad de la investigación.

DOI: https://doi.org/10.1109/ACCESS.2026.3724788

Dos páginas escaneadas del estudio. El color indica cuánto alteró la compresión cada zona de la página: la de la izquierda cambió mucho y conservó su texto legible por máquina; la de la derecha quedó casi igual y, sin embargo, lo perdió. Figura adaptada del artículo (CC BY 4.0).

También te puede interesar:

1 2 3 4 5 … 7 8 9 10

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *