Extrae texto de escaneos y fotos
Un documento escaneado es una imagen de texto, así que copiar, buscar y seleccionar no funcionan sobre él. El OCR vuelve a leer los caracteres. Obtienes el texto plano o el mismo documento con una capa de texto invisible añadida, para que se comporte como un PDF normal.
- PDF escaneados y fotos, hasta 200 páginas
- Siete idiomas, incluidos ruso, japonés y chino
- El PDF buscable conserva las páginas exactamente como estaban
- Los archivos se eliminan automáticamente: 24 horas en el plan gratuito, 7 días en los planes de pago
PDF, PNG, JPG, TIFF, BMP, GIF, WebP o HEIC.
Elige el idioma que realmente aparece en la página. Si te equivocas, no falla: devuelve texto sin sentido.
Cómo extraer texto de un escaneo
- 01
Sube el escaneo o la foto
Elige un PDF escaneado o una imagen de la página. Los PDF de varias páginas se leen página por página, en orden.
- 02
Elige el idioma
Selecciona el idioma en el que está escrito realmente el documento. Esto importa más de lo que parece: un idioma equivocado no produce un error, produce un sinsentido convincente.
- 03
Elige texto plano o PDF buscable
El texto plano te da los caracteres para copiar. El PDF buscable devuelve las páginas originales con una capa de texto oculta, así que el archivo sigue viéndose igual pero permite buscar y seleccionar.
- 04
Lee o descarga el resultado
El texto aparece en la página listo para copiar; un PDF buscable se descarga de inmediato.
Qué afecta a la precisión
La resolución. Las páginas se procesan a 300 DPI antes de leerlas, que es el nivel que recomienda la propia documentación de Tesseract. Una foto tomada de lejos, o un escaneo hecho a 100 DPI, le deja menos material al motor.
El encuadre y el enfoque. Una página fotografiada en ángulo, o en la que el texto se curva cerca del lomo de un libro, se lee bastante peor que un escaneo plano.
El idioma. Cada idioma tiene su propio modelo entrenado. Pasar texto cirílico o japonés por el modelo inglés devuelve algo que parece fluido pero es basura, en lugar de un error; por eso el selector solo ofrece los idiomas que el servidor puede cargar de verdad.
Lo que el OCR no hace. No conserva la maquetación: columnas, tablas y encabezados vuelven como texto corrido en orden de lectura. Si el PDF original ya tiene una capa de texto, convertirlo a texto usa esa capa: exacto, instantáneo y mejor que cualquier OCR.
Para qué lo usa la gente
Contratos y facturas
Un PDF firmado que llegó como escaneo, convertido en un archivo buscable para poder encontrar más adelante un número de referencia.
Recibos fotografiados con el móvil
Saca los importes y las fechas de una foto en vez de volver a escribirlos.
Documentos antiguos y archivos históricos
Registros en papel escaneados hace años, convertidos en buscables sin cambiar el aspecto de las páginas.
Capturas de pantalla y diapositivas
Recupera el texto de una imagen cuando el archivo original ya no existe.
Preguntas frecuentes
¿Qué es un PDF buscable?
Un PDF que se ve exactamente igual que el escaneo que subiste, con una capa invisible de texto reconocido colocada sobre las palabras. Las páginas no cambian visualmente, pero ahora puedes seleccionarlas, copiarlas y buscar en ellas, y otros programas también.
¿Qué idiomas se admiten?
Inglés, ruso, francés, alemán, español, japonés y chino simplificado. El selector muestra exactamente lo que el servidor puede cargar: nunca ofrece un idioma que produciría un sinsentido en silencio.
¿Cuántas páginas puede procesar?
Hasta 200 páginas por archivo. Cada página se procesa y se lee por separado, así que un documento largo tarda proporcionalmente más.
¿Es el OCR lo bastante preciso como para fiarse?
Con un escaneo limpio y recto de texto impreso es muy preciso. La escritura a mano, las fotos de baja resolución, las páginas en ángulo y las tipografías poco habituales son bastante peores. Revisa siempre las cifras que importan: los fallos de OCR parecen texto plausible, no errores.
¿Guardáis mi documento?
No más tiempo que la retención de tu plan: 24 horas en el plan gratuito y para visitantes sin cuenta, 7 días en los planes de pago. El archivo se transfiere por TLS y no se usa para nada más que producir tu resultado.
Mi PDF ya tiene texto seleccionable. ¿Necesito OCR?
No. Si un PDF ya tiene una capa de texto, convertirlo a texto usa esa capa directamente, lo cual es exacto e instantáneo. El OCR solo se ejecuta cuando no hay nada que extraer, es decir, cuando la página realmente es solo una imagen.