Cómo aplicar OCR local a un PDF escaneado en inglés
El reconocimiento añade una capa de texto buscable, pero la existencia de esa capa no demuestra que cada palabra sea correcta.
Elige un PDF escaneado en inglés que no supere ocho páginas ni 15 MB. Espera a que se carguen el motor y el modelo de inglés desde OpenToolSuite y deja abierta la pestaña mientras se lee cada página. Compara la vista del texto con el escaneo, sobre todo nombres, números de cuenta, puntos decimales y fechas.
El navegador muestra la imagen y Tesseract reconoce las palabras. Sus posiciones se transforman en coordenadas PDF para colocar una capa invisible de texto bajo la imagen. El archivo generado se vuelve a abrir para comprobar que contiene texto extraíble antes de ofrecerlo como buscable; esto no prueba su exactitud.
Se admiten mejor impresos rectos y nítidos en inglés. Páginas torcidas, escritura a mano, sellos, letra muy pequeña y otros alfabetos pueden fallar. Si no es posible escribir palabras buscables con la fuente PDF actual, la herramienta informa del fallo en vez de presentar una imagen sin texto como PDF buscable.
Prueba una página clara antes de procesar el resto. La rotación, el contraste bajo y el tamaño de letra pueden perjudicar más que el peso del archivo. Vuelve a escanear una página difícil si una persona no puede leer sus letras con un aumento normal.
Después de guardar, busca una frase característica en un lector PDF y copia una línea a un editor de texto. Comprueba orden de lectura y signos de puntuación. Si el documento es importante, conserva la imagen fuente y el texto corregido.
Verificar el OCR con una frase conocida
| Comprobación | Ejemplo | Resultado esperado |
|---|---|---|
| Texto de origen | Sample invoice 1234.56 | Mismas palabras y decimales en la vista previa |
| Buscar en un lector PDF | 1234.56 | El lector encuentra la capa de texto |
| Copiar una línea | Sample invoice 1234.56 | El texto copiado coincide con el escaneo |
Un PDF buscable aún puede confundir O con 0 o perder un punto decimal. La herramienta comprueba que exista texto extraíble, no su exactitud. Si no reconoce nada, mejora contraste o endereza el escaneo. Antes de procesar localmente, descarga los componentes del motor de inglés desde este sitio.
Abrir herramienta relacionada
Actualizado el .
OpenToolSuite · Feroz Sheikh · Contacto