Saltar al contenido

📷 OCR — Imagen / PDF a Texto

Tesseract 5 con modelo japonés. Extrae texto de imagen / PDF (máx 50 MB, 50 páginas por PDF).

100% Gratis Sin registro Servidor Sin logs / BD Rate-limit VPS alta precisión Basado en OSS 5 idiomas

🔒 Sobre la privacidad

📂
Arrastra o haz clic para elegir
PNG / JPEG / WebP / GIF / PDF · ≤50MB

📖 Dónde se suele tropezar

Extrae texto de imágenes (PNG, JPEG, WebP, GIF) y de PDF con Tesseract 5 y un modelo entrenado para japonés, hasta 50MB, hasta 50 páginas de PDF y 30 peticiones por minuto y por IP. La precisión la determina mucho más la calidad de la entrada que el modelo: el mismo documento escaneado a 300dpi y fotografiado en ángulo dan resultados completamente distintos. Cuando salga mal, sospecha primero de la entrada.

Caso Qué ocurre Qué hacer
La precisión es menor de lo que esperabas Tesseract está optimizado para tipografía impresa. Por eso la escritura a mano, la baja resolución, los fondos con textura, las sombras, la inclinación y los pliegues lo degradan bruscamente. Lo que más pesa es la resolución: por debajo de 300dpi la tasa de reconocimiento empeora de forma visible; un documento fotografiado con el móvil suele leerse en pantalla aun teniendo demasiados pocos píxeles por carácter. La inclinación también cuenta: unos pocos grados bastan para romper la segmentación de líneas y mezclar varias. Los fondos de color y las líneas finas de tabla también se confunden con glifos y generan caracteres espurios. Si escaneas, usa al menos 300dpi, escala de grises y corrige la inclinación. Si fotografías, lo básico es de frente, en una posición sin sombras encima y llenando el encuadre con el documento. Si está torcido, enderézalo antes de pasar el OCR (herramienta de rotación): ese único paso puede transformar el resultado. Ampliar una imagen de baja resolución no mejora la precisión: la información que no está no se puede añadir, así que hay que repetir la toma. Si aun así no basta, subir el contraste y binarizar como preprocesado ayuda. Como regla práctica, si cinco páginas no salen bien, cincuenta tampoco: mejora antes la entrada.
Se intercambian caracteres de aspecto parecido Distinguir formas parecidas es un problema difícil de raíz: el dígito 1 frente a la l minúscula y la I mayúscula, el 0 frente a la O, y en japonés los caracteres casi idénticos entre silabario y kanji. Las personas los resolvemos por contexto: cuál de dos grafías casi iguales es la correcta se deduce del significado, no de la forma de las letras. El caso peligroso es una cadena sin contexto: un número de pieza, un número de serie, una contraseña o una URL, donde ninguna corrección basada en el lenguaje interviene y el error se queda tal cual. Acotar el idioma reduce las confusiones: en un documento sólo en japonés, elegir japonés únicamente elimina la posibilidad de confundirlo con letras latinas, y en un documento alfanumérico, inglés únicamente hace lo propio. Japonés más inglés es cómodo, pero más candidatos significa más errores. Más eficaz todavía es validar después del OCR: cualquier cadena cuyo formato conozcas se puede corregir mecánicamente con una expresión regular; si un número de pieza son tres letras y cuatro dígitos, una O en una posición de dígito es sin duda un 0 mal leído (probador de regex). Y allí donde un solo carácter erróneo sea fatal —importes, números de cuenta, referencias— una persona debe cotejarlo con el original. El OCR reduce el tecleo, no sustituye la verificación.
Las tablas y la maquetación salen rotas Tesseract reconoce líneas y nada por encima de eso; no reconstruye columnas ni estructura de tabla. Dale una tabla y las líneas de la cuadrícula desaparecen, dejando el contenido de las celdas estirado en una sola fila separado por espacios: nada en la salida indica dónde terminaba cada celda. Una maquetación a dos columnas se comporta igual, con la izquierda y la derecha entrelazadas línea a línea. Encabezados, pies, números de página y notas al margen tampoco se distinguen del cuerpo y aterrizan en medio del texto. Si el objetivo son las tablas, usa un enfoque de extracción de tablas y no OCR: Tabula y Camelot deducen las columnas a partir de las líneas y los espacios. Ahora bien, dan por supuesto un PDF con capa de texto, así que para una tabla escaneada la vía práctica es pasar OCR a los caracteres y rehacer la tabla a mano. En un documento a varias columnas, corta la página en mitades y pasa OCR a cada una por separado y sale limpio (herramienta de recorte). En el fondo, el OCR no es la herramienta adecuada cuando necesitas conservar la maquetación: pedir los datos de origen a quien produjo el documento suele ser a la vez lo más fiable y lo más rápido.

Esta es la única herramienta del sitio que envía tu archivo a un servidor: el modelo entrenado para japonés es demasiado grande para ejecutarse en el navegador, así que la premisa difiere de la de todas las demás páginas. Los archivos enviados permanecen unos segundos en un directorio temporal y se eliminan en cuanto Tesseract termina, y no se guarda registro alguno del texto reconocido, del nombre del archivo ni de su tamaño. Aun así, hay situaciones en las que enviarlo a cualquier parte no está permitido: contratos, historiales médicos, expedientes de personal e información financiera no publicada suelen estar cubiertos por normas internas que prohíben transmitirlos a servicios externos. En esos casos, instala tesseract localmente y ejecútalo directamente (brew install tesseract tesseract-lang o apt install tesseract-ocr tesseract-ocr-jpn): el mismo motor y el mismo modelo que esta página, así que los resultados son equivalentes. La prueba es si te permitirían enviar ese archivo por correo fuera de tu organización: si no, tampoco lo metas aquí.

📖 Cómo usar

  1. 1
    Elegir archivo
    Arrastra una imagen o PDF (máx 50 MB).
  2. 2
    Elige idioma
    Japonés + Inglés (recomendado), solo japonés o solo inglés.
  3. 3
    Ejecuta → copia o descarga
    Clic en Ejecutar OCR. Copia o descarga como .txt.

❓ Preguntas frecuentes

¿Qué tan preciso es?
Tesseract 5 con modelo japonés oficial. Impresos limpios 90%+; manuscrito y baja resolución degradan.
¿Páginas máximas en PDF?
PDF: páginas 1–20. Ghostscript rasteriza a 300 dpi y OCR por página.
¿Se guardan los archivos?
No. Los archivos viven unos segundos en /tmp y se eliminan tras OCR. No se guardan logs.

🔗 Herramientas relacionadas

🐛 ¿Encontró un problema con esta herramienta?

Gratis, sin registro. Incluso solo los pasos para reproducir ayudan. Los informes van directamente al operador y se usan para corregir.

* Se envía automáticamente la info del navegador (UA / pantalla / idioma / URL) para reproducir