OFICINA Y PAPEL

El PDF se ve bien, pero no encuentra palabras: comprobar el texto antes de archivar

La palabra está delante de ti, bien impresa en la página, pero el buscador del PDF devuelve cero resultados. Antes de volver a escanear todo el documento, conviene averiguar qué conserva el archivo: la imagen de las letras o también un texto que el programa pueda interpretar.

La documentación de Adobe sobre reconocimiento de texto explica esa diferencia en los PDF obtenidos al escanear papel. El OCR convierte las letras de la imagen en texto seleccionable y buscable. Que una página se lea bien a simple vista no demuestra que ese reconocimiento se haya realizado.

Coloca el papel junto a la pantalla y elige una línea corta que puedas comparar sin perder el lugar. Intenta seleccionar sus palabras, buscarlas dentro del archivo y copiar la línea a una nota. Son comprobaciones diferentes: ver la página, encontrar un término y obtener una transcripción correcta no son el mismo resultado.

La misma línea, tres comprobaciones

Trabaja primero con una página representativa. Una búsqueda fallida no basta para diagnosticar cualquier PDF: puede haber texto mal reconocido o páginas con tratamientos distintos. La pequeña comparación sirve para saber qué ocurre en el fragmento que necesitas utilizar.

Comprobación Qué observar
Seleccionar palabras Si solo se selecciona una zona de imagen, todavía no has demostrado que exista texto utilizable en esa línea.
Buscar un término visible Comprueba una palabra poco ambigua tal como aparece en el papel; no pruebes únicamente con el nombre del archivo.
Copiar y pegar una línea Lee el resultado junto al original: letras, cifras, espacios y orden de lectura.

Si falta el reconocimiento, utiliza una herramienta que realmente incluya OCR. Como ejemplo concreto, la guía de Acrobat sitúa la función en «Todas las herramientas», «Escanear y OCR» y «En este archivo». Permite elegir páginas e idioma antes de reconocer el texto. Esa ruta corresponde a Acrobat; no implica que cualquier visor de PDF, edición o plan gratuito disponga de la misma función.

Conserva una copia del escaneo original antes de procesarlo. Así podrás distinguir la imagen recibida de la versión sobre la que has trabajado y volver a comparar una palabra cuando surja una duda. El nombre de la copia debe permitir reconocer esa relación, sin mezclarla con otros documentos parecidos.

Una coincidencia no valida toda la página

Después del OCR, vuelve a la línea elegida. Busca la palabra, pega el texto y sigue con el dedo la misma posición en el papel. Amplía la imagen si hace falta. Una cifra cambiada puede pasar desapercibida dentro de una frase que parece correcta; por eso interesa comprobar también algún dato que vayas a reutilizar, no solo un título grande.

Microsoft señala en su ayuda para extraer texto con OCR en OneNote que el resultado depende de la calidad de la imagen y recomienda revisar el texto pegado. Aquí esa advertencia sirve para la comprobación, no como promesa de que copiar texto en OneNote convierta por sí solo el PDF original en un archivo buscable.

Si la copia contiene un error, localiza el punto equivalente en la imagen y decide si puedes corregirlo con certeza. Cuando ni el papel ni el escaneo permiten leerlo, deja esa parte pendiente de comprobación. No completes una palabra o un número por lo que «debería decir». La incertidumbre debe seguir siendo visible para quien vaya a usar el documento.

Antes de guardar, repite la prueba en otras páginas que necesites consultar, especialmente si cambia la disposición del texto. Anota qué has revisado y qué sigue sin resolverse. El objetivo no es dar por bueno todo el documento porque apareció una coincidencia: es poder recuperar información concreta y contrastarla con el original.

Redacción En Directo

Equipo editorial de En Directo.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Botón volver arriba