DocoMatic

Traducción automática, pendiente de revisión profesional. Leer el original en inglés.

Documentos escaneados y OCR para la accesibilidad

Por qué los PDF escaneados fallan toda norma de accesibilidad, cómo encaja el OCR en la remediación y cómo decidir entre OCR, recreación y archivo para un rezago de escaneos.

Por DocoMatic Team

Publicado el 14 de septiembre de 2026 · Actualizado el 14 de septiembre de 2026

Un PDF escaneado es una fotografía de papel: no hay texto que un lector de pantalla pueda leer, no hay estructura que recorrer, no hay nada que buscar. Los archivos públicos están llenos de ellos: actas, ordenanzas, formularios viejos. Esta guía explica cómo el OCR convierte las imágenes de nuevo en texto, dónde falla y cómo clasificar un rezago de escaneos.

¿Por qué los PDF escaneados fallan las comprobaciones de accesibilidad?

Porque no contienen texto. Un escaneo es una imagen; la tecnología de asistencia no encuentra nada que leer, la búsqueda no encuentra nada que coincidir, y ningún etiquetado arregla una página sin capa de texto. Todo documento escaneado falla los requisitos de alternativa textual de WCAG hasta que el OCR o una recreación le dan texto real y correcto.

  • PDF solo de imagen frente a escaneos "buscables" con una capa de texto oculta
  • Por qué el etiquetado no puede empezar hasta que exista una capa de texto
  • Cómo detectar escaneos en lote dentro de un inventario documental

¿Qué hace realmente el OCR en un flujo de remediación?

El OCR reconoce los caracteres de la imagen de la página y añade una capa de texto invisible y seleccionable, alineada con el escaneo. En un flujo de remediación se ejecuta primero; el etiquetado, el orden de lectura y los metadatos se construyen sobre el texto reconocido. La calidad del OCR pone, por tanto, el techo a la calidad de todo lo que viene después.

  • El paso de OCR: reconocimiento, análisis de maquetación y colocación de la capa de texto
  • Lo que el OCR no hace: estructura, texto alternativo, campos de formulario
  • Ajustes de idioma y documentos multilingües

¿Cuándo falla el OCR y qué hacer entonces?

El OCR se degrada con la fuente: copias de fax, escritura a mano, sellos, escaneos de baja resolución, maquetaciones multicolumna apretadas y tablas. Cuando la exactitud cae por debajo de lo utilizable, las opciones honestas son volver a teclear el documento, recrearlo desde el archivo fuente original, o decidir que no necesita estar en línea (Holley, D-Lib Magazine 2009).

  • Modos de falla: escritura a mano, deterioro, maquetación compleja, idiomas mezclados
  • Revisión de exactitud: muestrear el texto reconocido frente a la imagen
  • Recreación frente a corrección: cuándo sale más barata cada una

¿Vale la pena remediar los documentos escaneados viejos?

A menudo no. La excepción de contenido archivado del Title II puede cubrir un documento escaneado que se conserva solo para referencia o para constancia y que no se necesita actualmente para usar los servicios de la entidad. Clasifique primero el rezago de escaneos: una parte grande puede archivarse legítimamente, retirarse o reservarse para remediación a solicitud.

  • Aplicar la excepción de contenido archivado a los fondos de escaneos
  • La remediación a solicitud como política para la cola larga
  • Lo que igual hay que arreglar: cualquier escaneo que la gente necesite hoy

¿Cómo maneja DocoMatic los documentos escaneados?

DocoMatic detecta las páginas de solo imagen durante el descubrimiento, ejecuta OCR como complemento con precio (dos créditos por página) y marca los reconocimientos de baja confianza para revisión humana en lugar de publicar texto malo. El resultado es un candidato a remediación como cualquier otro: texto real, después etiquetas, después verificación, igual que en un archivo nativo digital.

  • La detección de escaneos en el inventario documental
  • Los umbrales de confianza del OCR y la derivación a revisión humana
  • La verificación del resultado del OCR antes de que empiece el etiquetado

Fuentes

Lecturas relacionadas