Cómo limpiar texto copiado de un PDF, Word o una web

Copias un párrafo de un PDF, lo pegas en tu documento y aparece troceado, con saltos de línea a mitad de frase. Copias una tabla de una web y llegan espacios que no se borran. Pegas un texto de Word en un formulario y las comillas se convierten en símbolos raros. No es mala suerte. Cada formato guarda el texto a su manera, y al copiar te llevas también sus costumbres. Esta guía explica de dónde sale cada problema y en qué orden conviene limpiarlo.

Por qué el texto copiado llega sucio

Los PDF guardan líneas, no párrafos

Un PDF es, sobre todo, una descripción de dónde va cada trozo de texto en la página. Muchos no guardan la idea de «párrafo». Guardan líneas sueltas colocadas una debajo de otra. Al copiar, cada final de línea se convierte en un salto de línea real, aunque la frase continúe. Si el documento estaba justificado y con guiones de corte, también te llevas los guiones.

Los PDF tienen otro truco: las ligaduras. Algunas tipografías dibujan «fi» o «fl» como un solo carácter. Al copiar, ese carácter puede llegar tal cual (fi), y entonces la palabra «oficina» ya no se encuentra con el buscador, porque técnicamente no contiene una f y una i.

Word y los procesadores de texto añaden tipografía

Word cambia automáticamente las comillas rectas por comillas tipográficas (“ ”), los guiones dobles por rayas y, en algunos casos, inserta espacios de no separación para que dos palabras no queden separadas al final de una línea. Todo eso es correcto dentro del documento. El problema llega al pegarlo en un sitio que espera texto simple.

Las webs traen caracteres invisibles

El código de una página web usa con frecuencia espacios de no separación ( ) para controlar la maquetación. A veces incluye espacios de anchura cero, que no ocupan nada en pantalla. Y al copiar tablas, las columnas llegan separadas por tabuladores.

Los problemas, uno a uno

ProblemaCómo se veDe dónde sale
Saltos de línea a mitad de frasePárrafos partidos en renglonesPDF
Guiones de corte«infor- mación»PDF justificado
Espacios dobles«dos espacios»Revisiones, texto justificado
Espacios de no separaciónNada. Parecen espacios normalesWebs, Word
Espacios de anchura ceroNada en absolutoWebs, mensajería
TabuladoresHuecos grandesTablas y hojas de cálculo
Comillas mezcladas"rectas", “inglesas” y «angulares» en el mismo textoVarias fuentes juntas
Ligaduras«oficina» que el buscador no encuentraPDF
Líneas vacías de másHuecos irregulares entre párrafosWebs, correos

Los espacios invisibles son los peores, porque no los ves y causan fallos en otra parte: una búsqueda que no encuentra la palabra, una lista con duplicados que no se van, una celda que la hoja de cálculo no reconoce como número.

El flujo de limpieza, en orden

El orden importa. Si unes las líneas antes de arreglar los guiones de corte, te quedan palabras como «infor- mación». Si quitas las líneas vacías antes de unir las líneas partidas, pierdes la separación entre párrafos. Este es el orden que funciona:

  1. Normaliza los espacios especiales. Eliminar espacios convierte los espacios de no separación y otros espacios Unicode en espacios normales en cuanto pegas el texto. Los espacios de anchura cero (U+200B) no los toca: búscalos con Buscar y reemplazar en modo expresiones regulares con el patrón ​ y reemplaza por nada.
  2. Recompón los guiones de corte. Con expresiones regulares, busca ([a-záéíóúüñ])-\n([a-záéíóúüñ]) y reemplaza por $1$2.
  3. Une las líneas partidas conservando los párrafos. Busca ([^\n])\n(?!\n) y reemplaza por $1␣ (un espacio tras el $1). Si el PDF no dejaba líneas en blanco entre párrafos, este paso lo convierte todo en un solo bloque; en ese caso, separa los párrafos a mano después.
  4. Reduce espacios múltiples y recorta los extremos. Las casillas «Espacios múltiples → uno» y «Recortar inicio y final» de Eliminar espacios.
  5. Unifica las comillas. Decide un estilo (en español, las angulares « » son la primera opción) y sustituye las demás. Las recetas 11 y 12 de la guía de expresiones regulares lo hacen.
  6. Deshaz las ligaduras. Busca fi y reemplaza por fi; busca fl y reemplaza por fl.
  7. Revisa y compara. Cuenta las palabras antes y después con el contador de palabras. Si la cifra baja mucho, algo se ha perdido. Si sube, puede que se hayan separado palabras unidas.

Ejemplo completo: un párrafo de un PDF

Así llega un párrafo copiado de un informe en PDF:

La oficina de atención al ciudadano amplía su horario a partir del próximo lunes. La infor- mación completa está disponible en la web municipal. El nuevo horario será de 8:00 a 20:00.

Después de los pasos 2, 3, 4 y 6:

La oficina de atención al ciudadano amplía su horario a partir del próximo lunes. La información completa está disponible en la web municipal. El nuevo horario será de 8:00 a 20:00.

Fíjate en dos cosas. La línea en blanco entre los dos párrafos se ha conservado, porque el paso 3 solo une saltos de línea sueltos. Y «oficina» ya se puede encontrar con el buscador.

Casos especiales

Guiones que sí son parte de la palabra

El paso 2 no distingue un guion de corte de un guion de verdad. Si el texto tiene compuestos como «franco-alemán» o «teórico-práctico» y alguno cae justo al final de una línea, perderá su guion. En textos técnicos o con muchos compuestos, busca primero las coincidencias y revísalas una a una antes de reemplazar.

Listas y viñetas

Al copiar listas de un PDF, cada viñeta llega como un carácter suelto («•», «▪», «◦»). Si unes las líneas, las viñetas acaban en medio del párrafo. Haz primero un reemplazo de la viñeta por un salto de línea seguido de un guion, o quítalas si vas a reconstruir la lista a mano.

Tablas

Una tabla copiada de una web llega con tabuladores entre columnas. Si la vas a pegar en una hoja de cálculo, no los quites: los tabuladores son justamente lo que la hoja usa para repartir las columnas. Si la vas a convertir en texto, cámbialos por punto y coma o por un espacio.

Texto en mayúsculas

Los encabezados de algunos documentos se copian en mayúsculas sostenidas. Pásalos por el convertidor de mayúsculas y minúsculas con «todo minúsculas» y luego «Mayúsculas después de punto», y repasa los nombres propios a mano.

Cómo evitar parte del problema

  • Pega sin formato. En la mayoría de programas, Ctrl + Mayús + V (o Cmd + Mayús + Opción + V en Mac) pega solo el texto. Evita los estilos, aunque no los espacios raros.
  • Busca otra fuente. Si el PDF se generó desde una web o un documento editable, el original suele dar un texto mucho más limpio.
  • Copia por párrafos. En PDF de varias columnas, copiar la página entera mezcla columnas. Copia columna a columna.
  • Desconfía del texto escaneado. Si el PDF es una imagen pasada por reconocimiento de caracteres, habrá letras confundidas («rn» por «m», «l» por «1»). Ninguna limpieza automática lo arregla; hay que releer.

Errores frecuentes

  • Quitar todos los saltos de línea de golpe. Pierdes los párrafos. Usa la receta que respeta las líneas en blanco.
  • Limpiar el texto original. Trabaja sobre una copia.
  • Dar por buena la primera pasada. Lee el resultado. Los problemas que quedan suelen estar en cifras, nombres propios y guiones.
  • Olvidar los espacios invisibles. Si una búsqueda no encuentra una palabra que estás viendo, sospecha de un espacio de no separación o de una ligadura.

¿Has encontrado un error o una explicación que no se entiende? Escríbeme y lo corrijo. Las guías se revisan con las obras de la RAE y la FundéuRAE como referencia; puedes leer cómo se preparan en Sobre el proyecto.