Saltar al contenido principal

OCR de documentos escaneados

Un PDF no siempre es texto. Un libro escaneado, una escritura notarial, un archivo antiguo, una página fotografiada: eso son imágenes de texto, y cualquier herramienta que lea la «capa de texto» de un PDF no encuentra nada en ellas.

Los PDF con capa de texto ya funcionan sin OCR. Se instala un motor por una sola razón: leer los escaneos y las imágenes.

Dos motores, un mismo oficio

Ajustes → OCR. Eliges uno, lo instalas una vez, y funciona en tu máquina como todo lo demás aquí.

Ajustes, OCR: RapidOCR ligero y MinerU potencia, ambos listos

MotorPesoExigeIdeal para
RapidOCR (ligero)~200 MBsin GPUlos PDF cotidianos, rápido y gratis
MinerU (potencia)descarga grandeuna GPU · una licencia Engrammmaquetación, tablas y fórmulas devueltas intactas

Cada fila lleva su estado y sus controles: Instalar, luego Listo, un botón Probar que ejecuta el motor sobre un documento y te enseña lo que realmente leyó, y un Eliminar que se lleva todo el entorno de tu disco.

Un requisito que la aplicación no puede instalar por ti, y que está escrito en la página: Python 3.10+ debe existir en la máquina.

La instalación termina de instalar

Instalar un motor no es una descarga sino una cadena, y la página nombra la etapa en curso: preparando el entorno · instalando dependencias · descargando runtime GPU · instalando motor OCR · descargando modelos OCR · finalizando.

La penúltima etapa existe por una trampa real. MinerU iba a buscar sus modelos de detección de forma perezosa, en el primer PDF escaneado que le dabas, lo que convertía un martes por la tarde cualquiera en diez minutos de espera sin explicación. Ahora los modelos se descargan durante la instalación: Listo significa listo.

Sin motor, un escaneo permanece invisible (a propósito)

La aplicación cambió de opinión deliberadamente sobre este punto.

Un PDF escaneado en una carpeta vigilada no se indexa en absoluto: ninguna crónica, ningún vector, nada que se pueda recuperar. Queda registrado como pendiente, y la página de OCR los cuenta en voz alta:

N PDF escaneado(s) en tus vaults NO están indexados — no tienen capa de texto y ningún motor puede leerlos. Se leerán automáticamente en cuanto instales uno.

La versión anterior guardaba un sustituto localizable por su nombre de archivo. Eso parece un éxito y se comporta como una mentira: un recuerdo con forma de nombre de archivo se recupera para preguntas que no puede responder, y la respuesta vuelve segura y vacía. Negarse a indexar es la mitad honesta de un compromiso real, y el precio es que tu documento es invisible hasta que llegue el OCR.

Y cuando llega, no tienes que ir a buscar nada: instalar un motor vuelve a leer automáticamente todos los archivos pendientes, y el contador cae a cero.

Cómo decide, en el chat y en el lector

  • Un PDF: primero se lee la capa de texto. Por debajo de 16 caracteres de texto real es un escaneo, y el OCR toma el relevo. Los marcadores de página del tipo -- 3 of 516 -- se quitan antes de esa cuenta, porque hacían pasar un escaneo de 516 páginas por un PDF de texto, y el lector leía diligentemente los números de página en voz alta.
  • Una imagen (PNG, JPG, WEBP, BMP, TIFF) va directa al OCR.
  • Ningún motor instalado: recibes una frase que te lo dice.

Un documento escaneado se lee en ventanas de 20 páginas en vez de en una sola llamada interminable. La cabecera muestra un progreso real, y el motor vuelve entre ventanas en lugar de quedar retenido una hora. Atiende una petición a la vez, así que un OCR largo congelaba todos los demás.

Hasta dónde lee depende de quién lo pida. Un documento adjunto en el chat se detiene en 60 páginas, porque esa vía limita su texto de todos modos. Un libro importado en MnemoReader se lee hasta su última página, con un tope de 2000 para que un archivo corrupto termine igualmente. Un PDF que ya tiene capa de texto no tiene tope alguno.

OCR profundo, cuando la capa de texto miente

Algunos escaneos llegan con una capa de texto incrustada que ya es un mal OCR, hecho hace años por quien digitalizó el libro. Pasa la prueba de los 16 caracteres, así que nada cae al plan B, y el texto es un galimatías.

MnemoReader tiene el botón para ese caso: OCR profundo, rehacer un OCR real de cada página (lento, mejor calidad que una capa de texto incrustada). Ignora por completo el texto incrustado y vuelve a leer las imágenes de las páginas.


Una vez leído un escaneo, es texto como cualquier otro: fluye hacia DocWatch y tus bóvedas, se vectoriza, y responde preguntas como una nota que hubieras escrito tú.