Copias un párrafo de un PDF, lo pegas en tu documento y aparece troceado, con saltos de línea a mitad de frase. Copias una tabla de una web y llegan espacios que no se borran. Pegas un texto de Word en un formulario y las comillas se convierten en símbolos raros. No es mala suerte. Cada formato guarda el texto a su manera, y al copiar te llevas también sus costumbres. Esta guía explica de dónde sale cada problema y en qué orden conviene limpiarlo.
Por qué el texto copiado llega sucio
Los PDF guardan líneas, no párrafos
Un PDF es, sobre todo, una descripción de dónde va cada trozo de texto en la página. Muchos no guardan la idea de «párrafo». Guardan líneas sueltas colocadas una debajo de otra. Al copiar, cada final de línea se convierte en un salto de línea real, aunque la frase continúe. Si el documento estaba justificado y con guiones de corte, también te llevas los guiones.
Los PDF tienen otro truco: las ligaduras. Algunas tipografías dibujan «fi» o
«fl» como un solo carácter. Al copiar, ese carácter puede llegar tal cual
(fi), y entonces la palabra «oficina» ya no se encuentra con el
buscador, porque técnicamente no contiene una f y una i.
Word y los procesadores de texto añaden tipografía
Word cambia automáticamente las comillas rectas por comillas tipográficas (“ ”), los guiones dobles por rayas y, en algunos casos, inserta espacios de no separación para que dos palabras no queden separadas al final de una línea. Todo eso es correcto dentro del documento. El problema llega al pegarlo en un sitio que espera texto simple.
Las webs traen caracteres invisibles
El código de una página web usa con frecuencia espacios de no separación
( ) para controlar la maquetación. A veces incluye
espacios de anchura cero, que no ocupan nada en pantalla. Y al copiar tablas,
las columnas llegan separadas por tabuladores.
Los problemas, uno a uno
| Problema | Cómo se ve | De dónde sale |
|---|---|---|
| Saltos de línea a mitad de frase | Párrafos partidos en renglones | |
| Guiones de corte | «infor- mación» | PDF justificado |
| Espacios dobles | «dos espacios» | Revisiones, texto justificado |
| Espacios de no separación | Nada. Parecen espacios normales | Webs, Word |
| Espacios de anchura cero | Nada en absoluto | Webs, mensajería |
| Tabuladores | Huecos grandes | Tablas y hojas de cálculo |
| Comillas mezcladas | "rectas", “inglesas” y «angulares» en el mismo texto | Varias fuentes juntas |
| Ligaduras | «oficina» que el buscador no encuentra | |
| Líneas vacías de más | Huecos irregulares entre párrafos | Webs, correos |
Los espacios invisibles son los peores, porque no los ves y causan fallos en otra parte: una búsqueda que no encuentra la palabra, una lista con duplicados que no se van, una celda que la hoja de cálculo no reconoce como número.
El flujo de limpieza, en orden
El orden importa. Si unes las líneas antes de arreglar los guiones de corte, te quedan palabras como «infor- mación». Si quitas las líneas vacías antes de unir las líneas partidas, pierdes la separación entre párrafos. Este es el orden que funciona:
- Normaliza los espacios especiales.
Eliminar espacios convierte los espacios de
no separación y otros espacios Unicode en espacios normales en cuanto pegas el
texto. Los espacios de anchura cero (U+200B) no los toca: búscalos con
Buscar y reemplazar en modo expresiones
regulares con el patrón
y reemplaza por nada. - Recompón los guiones de corte. Con expresiones regulares,
busca
([a-záéíóúüñ])-\n([a-záéíóúüñ])y reemplaza por$1$2. - Une las líneas partidas conservando los párrafos. Busca
([^\n])\n(?!\n)y reemplaza por$1␣(un espacio tras el $1). Si el PDF no dejaba líneas en blanco entre párrafos, este paso lo convierte todo en un solo bloque; en ese caso, separa los párrafos a mano después. - Reduce espacios múltiples y recorta los extremos. Las casillas «Espacios múltiples → uno» y «Recortar inicio y final» de Eliminar espacios.
- Unifica las comillas. Decide un estilo (en español, las angulares « » son la primera opción) y sustituye las demás. Las recetas 11 y 12 de la guía de expresiones regulares lo hacen.
- Deshaz las ligaduras. Busca
fiy reemplaza porfi; buscafly reemplaza porfl. - Revisa y compara. Cuenta las palabras antes y después con el contador de palabras. Si la cifra baja mucho, algo se ha perdido. Si sube, puede que se hayan separado palabras unidas.
Ejemplo completo: un párrafo de un PDF
Así llega un párrafo copiado de un informe en PDF:
Después de los pasos 2, 3, 4 y 6:
Fíjate en dos cosas. La línea en blanco entre los dos párrafos se ha conservado, porque el paso 3 solo une saltos de línea sueltos. Y «oficina» ya se puede encontrar con el buscador.
Casos especiales
Guiones que sí son parte de la palabra
El paso 2 no distingue un guion de corte de un guion de verdad. Si el texto tiene compuestos como «franco-alemán» o «teórico-práctico» y alguno cae justo al final de una línea, perderá su guion. En textos técnicos o con muchos compuestos, busca primero las coincidencias y revísalas una a una antes de reemplazar.
Listas y viñetas
Al copiar listas de un PDF, cada viñeta llega como un carácter suelto («•», «▪», «◦»). Si unes las líneas, las viñetas acaban en medio del párrafo. Haz primero un reemplazo de la viñeta por un salto de línea seguido de un guion, o quítalas si vas a reconstruir la lista a mano.
Tablas
Una tabla copiada de una web llega con tabuladores entre columnas. Si la vas a pegar en una hoja de cálculo, no los quites: los tabuladores son justamente lo que la hoja usa para repartir las columnas. Si la vas a convertir en texto, cámbialos por punto y coma o por un espacio.
Texto en mayúsculas
Los encabezados de algunos documentos se copian en mayúsculas sostenidas. Pásalos por el convertidor de mayúsculas y minúsculas con «todo minúsculas» y luego «Mayúsculas después de punto», y repasa los nombres propios a mano.
Cómo evitar parte del problema
- Pega sin formato. En la mayoría de programas, Ctrl + Mayús + V (o Cmd + Mayús + Opción + V en Mac) pega solo el texto. Evita los estilos, aunque no los espacios raros.
- Busca otra fuente. Si el PDF se generó desde una web o un documento editable, el original suele dar un texto mucho más limpio.
- Copia por párrafos. En PDF de varias columnas, copiar la página entera mezcla columnas. Copia columna a columna.
- Desconfía del texto escaneado. Si el PDF es una imagen pasada por reconocimiento de caracteres, habrá letras confundidas («rn» por «m», «l» por «1»). Ninguna limpieza automática lo arregla; hay que releer.
Errores frecuentes
- Quitar todos los saltos de línea de golpe. Pierdes los párrafos. Usa la receta que respeta las líneas en blanco.
- Limpiar el texto original. Trabaja sobre una copia.
- Dar por buena la primera pasada. Lee el resultado. Los problemas que quedan suelen estar en cifras, nombres propios y guiones.
- Olvidar los espacios invisibles. Si una búsqueda no encuentra una palabra que estás viendo, sospecha de un espacio de no separación o de una ligadura.
¿Has encontrado un error o una explicación que no se entiende? Escríbeme y lo corrijo. Las guías se revisan con las obras de la RAE y la FundéuRAE como referencia; puedes leer cómo se preparan en Sobre el proyecto.