Cómo eliminar duplicados de una lista sin perder datos

Juntas dos listas de contactos, quitas los repetidos y te quedan 412 correos. Envías el boletín. A la mañana siguiente, tres personas te escriben para decirte que lo han recibido dos veces. La herramienta no falló: hizo exactamente lo que le pediste. El problema es que «igual» significa cosas distintas para ti y para un ordenador. Esta guía va de cerrar esa distancia.

Qué significa «duplicado» para un ordenador

Para un programa, dos líneas son iguales si tienen exactamente los mismos caracteres, en el mismo orden. Ni uno más. Eso deja fuera muchas repeticiones que una persona ve a la primera:

Línea ALínea B¿Iguales para el ordenador?Qué las separa
ana@correo.esAna@correo.esNoUna mayúscula
José PérezJose PerezNoDos tildes
MadridMadrid␣NoUn espacio al final
Calle Mayor 5Calle Mayor 5NoUn espacio doble
SevillaSevillaPuede que noUn espacio de no separación que se ve igual que uno normal

(El símbolo ␣ marca un espacio que en pantalla no se vería.) Antes de quitar duplicados, por tanto, tienes que decidir qué diferencias te importan. Esa decisión depende del tipo de lista, no de la herramienta.

Tres decisiones antes de empezar

1. ¿Cuentan las mayúsculas?

En la mayoría de listas, no. «Madrid» y «madrid» son la misma ciudad. Lo mismo pasa con los correos electrónicos: en la práctica, los proveedores tratan igual «Ana@correo.es» y «ana@correo.es», así que conviene ignorar las mayúsculas al deduplicarlos.

Hay excepciones. Los códigos de producto, las contraseñas, los identificadores de algunos sistemas o las referencias de expediente pueden distinguir «AB12» de «ab12». Si la lista es técnica, pregunta antes de juntarlos.

2. ¿Cuentan las tildes?

Aquí hay que ir con más cuidado. «José Pérez» y «Jose Perez» casi seguro son la misma persona escrita con prisas. Pero «Peña» y «Pena» son dos apellidos distintos, y «Ángeles» y «Angeles» pueden serlo según quién los haya registrado. La tilde y la eñe también son información.

Un método seguro: no borres directamente. Crea una copia de la lista sin acentos con Quitar acentos (conservando la ñ), quita duplicados en esa copia y compara cuántas líneas te quedan en cada versión. Si la diferencia son tres líneas, revísalas a mano. Si son trescientas, tienes un problema de calidad de datos que merece otra solución.

3. ¿Qué copia se queda?

Cuando una línea está repetida, normalmente se conserva la primera aparición y se descartan las siguientes. Es lo que hace Eliminar duplicados. Eso tiene una consecuencia: si ignoras las mayúsculas, la versión que sobrevive es la que aparecía antes. Si tu lista tiene «JOSÉ PÉREZ» en la línea 3 y «José Pérez» en la 40, te quedarás con la versión en mayúsculas. Si quieres la otra, normaliza primero el formato de toda la lista.

Los duplicados fantasma: espacios que no se ven

Es la causa número uno de «he quitado duplicados y siguen saliendo». Las listas copiadas de una hoja de cálculo, un PDF o una web arrastran caracteres invisibles:

  • Espacios al final de la línea. Muy habituales al copiar celdas de Excel o al exportar desde formularios.
  • Espacios dobles en medio. «Calle Mayor» con dos espacios.
  • Tabuladores. Salen al copiar varias columnas.
  • Espacios de no separación. Las webs y los procesadores de texto los usan para que dos palabras no se separen al final de la línea. Se ven como un espacio normal, pero son otro carácter.

La herramienta de duplicados de este sitio ya compara las líneas sin los espacios del principio y del final. Los espacios dobles en medio y los espacios de no separación sí cuentan como diferencia. Para quitarlos, pasa antes la lista por Eliminar espacios, que convierte los espacios especiales en normales y reduce los dobles a uno.

Caso 1: una lista de correos para un envío

Tienes los inscritos de dos formularios. Pegados uno debajo de otro:

lucia.romero@correo.es pablo.diaz@empresa.com Lucia.Romero@correo.es marta.vidal@correo.es pablo.diaz@empresa.com␣ info@asociacion.org

Si quitas duplicados sin ignorar mayúsculas y sin limpiar espacios, solo desaparece una línea… o ninguna, según la herramienta. La secuencia correcta:

  1. Eliminar espacios, con «Recortar inicio y final» activado.
  2. Eliminar duplicados con «Ignorar mayúsculas».
lucia.romero@correo.es pablo.diaz@empresa.com marta.vidal@correo.es info@asociacion.org

Quedan cuatro direcciones, cada una en la posición de su primera aparición. Un detalle más: info@, contacto@ y similares suelen ser buzones compartidos. No son duplicados, pero conviene saber que detrás puede haber varias personas.

Caso 2: nombres de personas

Con nombres, la deduplicación automática es un punto de partida, no el final. Estos tres casos son frecuentes y ninguna herramienta los resuelve sola:

  • Orden distinto: «Pérez Gómez, Ana» y «Ana Pérez Gómez». Unifica el formato antes.
  • Segundo apellido ausente: «Ana Pérez» y «Ana Pérez Gómez». Pueden ser la misma persona o dos.
  • Homónimos reales: dos personas que se llaman igual. Si tienes otro dato (correo, DNI, fecha), deduplica por ese dato y no por el nombre.

La regla práctica: deduplica por el campo que identifica de verdad. En una lista de personas, casi nunca es el nombre.

Caso 3: un inventario consolidado

Al juntar referencias de varios almacenes aparecen listas como esta:

TOR-M8-40 tor-m8-40 TOR-M8-040 TOR M8 40 TOR-M8-40

Ignorando mayúsculas, las líneas 1, 2 y 5 se reducen a una. Pero «TOR-M8-040» y «TOR M8 40» siguen ahí. ¿Son la misma pieza? Probablemente. ¿Puedes asegurarlo sin mirar el catálogo? No. En inventarios, quita solo los duplicados exactos de forma automática y lleva el resto a una lista de «posibles duplicados» para revisar. Si las variantes siguen un patrón (un cero de más, espacios en lugar de guiones), puedes normalizarlas antes con Buscar y reemplazar.

Quitar duplicados y ordenar: en qué orden

Si además quieres la lista ordenada, el orden de las operaciones importa poco para el resultado final, con un matiz: si quitas duplicados primero, decides tú qué versión se queda (la primera de la lista original). Si ordenas primero, la que se queda depende del orden alfabético, y entre «JOSÉ» y «José» ganará la que el programa ordene antes.

Por eso el flujo recomendado es: limpiar espacios, normalizar formato, quitar duplicados y, al final, ordenar. En la guía de orden alfabético tienes las reglas para ese último paso.

Si trabajas en una hoja de cálculo

Excel y Google Sheets tienen su propia función para quitar duplicados, y para tablas con varias columnas es la opción correcta: te deja elegir qué columnas definen un duplicado. Tienen los mismos problemas que cualquier otra herramienta con los espacios invisibles, así que la limpieza previa sigue haciendo falta.

Para una sola columna, copiarla, limpiarla en una herramienta de texto y pegarla de vuelta suele ser más rápido. Y tiene una ventaja: ves el resultado completo antes de tocar el archivo original.

Errores frecuentes

  • No guardar la lista original. Deduplicar es destructivo. Si te equivocas de criterio, necesitas volver atrás.
  • Ignorar tildes por defecto. Une apellidos que son distintos. Hazlo solo después de revisar.
  • Deduplicar por nombre en lugar de por identificador. Borra homónimos que son personas distintas.
  • Olvidar las líneas vacías. Si una lista tiene diez líneas en blanco, cuentan como diez duplicados entre sí. Elimínalas antes o a la vez.
  • Contar mal el resultado. Compara siempre el número de líneas antes y después. Si esperabas quitar 20 y has quitado 200, para y revisa.

¿Has encontrado un error o una explicación que no se entiende? Escríbeme y lo corrijo. Las guías se revisan con las obras de la RAE y la FundéuRAE como referencia; puedes leer cómo se preparan en Sobre el proyecto.