Extraer texto de PDF
Extrae el texto seleccionable de un PDF a un archivo TXT. Selecciona páginas y procesa el documento en el navegador, sin OCR ni subida de archivos.
El archivo se procesa en este navegador. No se sube a un servidor.
Qué resuelve esta herramienta
Recuperar la capa de texto de un documento digital para copiarla o descargarla. Esta página está pensada para producir un resultado concreto y descargable sin convertir la operación en un servicio de edición documental general.
Carga un PDF digital y selecciona las páginas que quieras leer. PDF.js recupera los fragmentos de texto seleccionables y los presenta como texto plano para copiar o descargar. El orden depende de cómo estén colocados esos fragmentos.
Recuperar la capa de texto
Un PDF puede contener solo una imagen escaneada aunque parezca texto. En ese caso la salida puede estar vacía. Esta herramienta no incorpora OCR y no intenta adivinar letras a partir de fotografías.
El componente funciona en tu navegador: el PDF se lee localmente y la salida se construye en el dispositivo. La página no necesita una cuenta ni una API para completar esta operación. Aun así, revisa el archivo descargado antes de enviarlo o archivarlo, porque la compatibilidad de elementos avanzados depende del documento de origen y del lector que uses.
Texto seleccionable frente a una página escaneada
Un documento digital puede guardar caracteres y posiciones, mientras que una página escaneada puede ser solo una fotografía. Esta herramienta recupera los caracteres disponibles. Cuando no encuentra texto en las páginas seleccionadas, muestra un error en vez de ofrecer un TXT vacío.
El TXT añade un separador con la posición de cada página. En dos columnas, tablas o formularios, el orden de los fragmentos puede diferir del orden visual. La extracción no reconstruye una tabla editable ni interpreta escritura a mano: esas tareas requieren reconocimiento y revisión adicionales.
Ejemplo concreto
En un PDF de tres páginas que contiene ALFA, BETA y GAMMA como texto seleccionable, selecciona las tres y revisa el TXT. La salida debe incluir esas etiquetas, aunque una tabla o dos columnas puedan necesitar reordenación manual.
Qué produce y qué límites tiene
El resultado es un archivo TXT y el texto total está limitado a dos millones de caracteres. No extrae imágenes incrustadas, no reconstruye tablas y no garantiza mantener el diseño visual o el orden de lectura de columnas.
El límite general es 20 MB por archivo, 100 MB sumados, 20 archivos y 300 páginas. La extracción no incorpora OCR y un escaneado puede devolver texto vacío.
Las operaciones unir, dividir, ordenar y eliminar crean un PDF nuevo y no garantizan conservar marcadores, adjuntos o estructura de formularios. Los archivos firmados y los formularios se rechazan para edición y deben seguir su flujo documental específico. En texto no hay OCR; en PDF a imágenes se renderiza la página completa y no se extraen sus imágenes incrustadas.
Fuente técnica y uso local
La referencia principal para esta operación es la documentación técnica consultada. Esa fuente describe la API o el lector utilizado; los límites de tamaño, número de archivos, páginas y controles de entrada son decisiones de esta herramienta. El procesamiento local reduce el envío de datos, pero no sustituye la revisión del documento resultante.
Herramientas relacionadas: contador caracteres · analizador texto · conversor texto · comparador textos
Preguntas frecuentes
¿Qué texto puede extraer?
Recupera la capa de texto seleccionable de las páginas elegidas y la prepara para copiar o descargar como TXT.
¿Funciona con un PDF escaneado?
No necesariamente. Si el archivo solo contiene imágenes, el resultado puede quedar vacío porque esta herramienta no hace OCR.
¿Se conservan las columnas y tablas?
El orden depende de los fragmentos que exponga el PDF. Tablas y columnas pueden necesitar una revisión manual después de extraerlas.
¿Puedo elegir páginas?
Sí. Selecciona las páginas que quieres procesar dentro del límite de la interfaz para evitar extraer contenido innecesario.
¿Extrae imágenes incrustadas?
No. La función recupera texto seleccionable y no funciona como extractor de imágenes ni como OCR.
¿Dónde se procesa el documento?
PDF.js lee el archivo en el navegador y el TXT se descarga localmente; no se sube el PDF a OCC Tools.
Herramienta de OCC Tools