📄 Extractor de Texto PDF
Arrastra un PDF para extraer texto pagina por pagina. Copia o descarga como .txt. Todo en tu navegador.
🔒 Sobre la privacidad
- ・Todo el procesamiento ocurre en tu navegador
- ・Los datos PDF nunca se envian a ningun servidor
- ・Sin registros, sin historial, sin base de datos
- ・Sin registro, sin inicio de sesión, sin pago
⚠ Los PDF escaneados (imagen) no pueden extraerse (se necesita OCR). Solo se admiten PDFs con capa de texto.
Arrastra un PDF o haz clic
📖 Dónde se suele tropezar
Usa pdf.js para extraer la capa de texto de un PDF, página a página. Todo se ejecuta en el navegador y el archivo nunca se sube. Sólo sale lo que se escribió como caracteres: los párrafos, las tablas y los títulos no existen en el PDF de partida, porque un PDF es un conjunto de instrucciones de dibujo que coloca glifos en coordenadas, no un formato de documento estructurado.
| Caso | Qué ocurre | Qué hacer |
|---|---|---|
| El texto sale en un orden equivocado | El cuerpo de un PDF es una lista de instrucciones del tipo dibuja este glifo en esta posición, y nada garantiza el orden de lectura. Un artículo a dos columnas entrelaza la izquierda y la derecha; una tabla pierde sus líneas y deja el contenido de las celdas en una sola fila. Los encabezados y los números de página caen en medio del texto. No es una extracción fallida: el orden sencillamente no está en el archivo. | Empieza activando Mantener diseño: los caracteres con una coordenada Y parecida se reagrupan en líneas, así que incluso una página a varias columnas queda correcta línea a línea. Luego separa las columnas a ojo. Si lo que quieres son tablas, cambia a un enfoque de extracción de tablas en lugar de texto: Tabula, Camelot o pdftotext -layout. Las columnas desalineadas suelen indicar que falló la estimación de anchura, así que volcarlo en tipografía monoespaciada y cortar por posición de columna a menudo las recupera. |
| El texto sale ilegible o se copia como otros caracteres | Un PDF dibuja texto por índice de glifo dentro de una fuente incrustada. Sin la tabla que convierte esos índices de vuelta a Unicode (el CMap ToUnicode), ningún extractor puede recuperar los caracteres reales. Suele faltar cuando la aplicación que generó el archivo incrustó sólo un subconjunto de la fuente, y el síntoma clásico es que la página se lee perfectamente en pantalla pero se copia como texto sin sentido. Los PDF japoneses antiguos y los exportados desde programas de maquetación son los sospechosos habituales. |
El extractor no puede hacer nada. Si puedes regenerar el archivo, volver a incrustar la fuente al exportar es el único arreglo de fondo. Cuando sólo tienes el PDF terminado, rasterizar las páginas a imagen y pasarles OCR es en la práctica la vía más rápida (herramienta OCR). Con unas pocas líneas de salida ya se ve si el mapeo está roto, así que comprueba siempre la primera página antes de procesar el documento entero. |
| La extracción devuelve cero caracteres | Un documento escaneado, o una foto convertida en PDF con el móvil, es una imagen por página sin capa de texto alguna. Cuesta darse cuenta porque los caracteres se ven perfectamente, pero el contenido del archivo es una fotografía. Los folletos oficiales, los contratos escaneados y los archivos de papel digitalizados son casi siempre de este tipo. | Pásalo por OCR. La herramienta OCR usa Tesseract para japonés e inglés y, igual que esta página, no entrega tu archivo a terceros. Distinguirlos es fácil: si el recuento de caracteres es minúsculo frente al número de páginas (unos pocos caracteres por página o menos), es un escaneo. Los archivos mixtos, con páginas de texto y páginas escaneadas en el mismo documento, también abundan, así que mira el recuento por página y manda a OCR sólo las de cero caracteres. |
Poder extraer algo no equivale a tener permiso para usarlo. Un PDF puede llevar una marca de permisos que prohíbe la extracción de contenido, pero esa marca es una convención que los visores respetan voluntariamente, no una protección técnica: pdf.js y casi todas las demás implementaciones la ignoran. Su ausencia tampoco equivale a un permiso. Que puedas redistribuir o adaptar el texto lo decide el copyright y la licencia del documento original, y nada más. Ten en cuenta además que todo en esta página se ejecuta en tu navegador, así que un PDF confidencial nunca sale de tu equipo, pero esa garantía termina en cuanto pegas el texto extraído en otro servicio.
📖 Cómo usar
-
1
Cargar PDFArrastra o selecciona un PDF. pdf.js extrae el texto.
-
2
Ajustar opcionesActiva diseno y numeros de pagina; se actualiza.
-
3
Copiar o descargarCopia al portapapeles o descarga .txt.
❓ Preguntas frecuentes
Puedo extraer de PDF escaneados?
Se envia el PDF al servidor?
Diferencia con preservar diseno?
🔗 Herramientas relacionadas
🐛 ¿Encontró un problema con esta herramienta?
Gratis, sin registro. Incluso solo los pasos para reproducir ayudan. Los informes van directamente al operador y se usan para corregir.
¡Gracias por tu reporte!
Tu reporte llegó al operador y se usará para mejorar.