Herramienta limpieza de datos: 7 soluciones comparadas
Imagen generada por IALa búsqueda de una herramienta de limpieza de datos suele terminar en una demostración comercial que muestra exactamente lo que ya funcionaba: quitar espacios sobrantes, unificar mayúsculas, borrar filas idénticas. Seis semanas y una firma de licencia después, el siguiente envío postal sale duplicado a 200 clientes, porque la herramienta considera que «García» y «Garcia» son dos personas distintas.
La causa casi nunca es la calidad del software. Es una confusión de términos: detrás de «limpieza de datos» se esconden cuatro operaciones técnicamente independientes, y pocas herramientas dominan las cuatro. En España se añade una dificultad propia que ningún fabricante internacional resuelve de fábrica: los dos apellidos. Un mismo cliente aparece como «José María García Rodríguez», «García Rodríguez, José Maria» y «J. M. García R.», y cada una de esas tres formas rompe un método de comparación diferente.
Esta comparativa desmonta siete enfoques concretos, desde la hoja de cálculo hasta el software instalado en local. Los siete procesan las mismas ocho filas de ejemplo, de modo que se ve quién encuentra qué. Después viene un cálculo a tres años que incluye el tiempo de trabajo y un protocolo para evaluar cualquier herramienta con sus propios datos en 30 minutos.
Cuatro operaciones detrás de un solo término
Antes de valorar una herramienta de limpieza de datos hay que saber qué trabajo se le pide. En un fichero de direcciones son cuatro operaciones sin nada en común desde el punto de vista técnico.
| Operación | Qué ocurre | Cómo se nota que falta |
|---|---|---|
| Normalización | «C/» pasa a «Calle», el piso y la puerta se separan del campo de vía | La misma dirección aparece en cinco grafías distintas |
| Validación postal | Código postal, municipio y formato se comprueban contra un referencial | Devoluciones con la marca «dirección incompleta» |
| Deduplicación | Los registros que designan a la misma persona se agrupan | Clientes que avisan de haber recibido dos veces lo mismo |
| Agrupación por hogar | Varias personas en una dirección pasan a ser un solo envío | Tres cartas a la misma familia, tres franqueos |
El orden no es cuestión de gusto. Buscar duplicados antes de normalizar significa encontrar una fracción de ellos, porque «Avda. Diagonal 405» y «Avenida Diagonal 405» son dos cadenas de caracteres distintas para cualquier algoritmo de comparación.
Hay un detalle específico del fichero español que conviene resolver en la fase de normalización: el piso y la puerta. Cuando «3ºB» acaba dentro del campo de la vía, dos registros de la misma persona dejan de parecerse lo suficiente y la deduplicación falla. Separar ese dato en su propio campo eleva la tasa de detección más que cualquier ajuste de umbral.
Los siete enfoques de un vistazo
El mercado parece ilegible pero se reduce a siete enfoques. Los precios corresponden a un fichero de unas 12.000 direcciones.
| Enfoque | Duplicados aproximados | Validación CP | Hogares | Los datos no salen del equipo | Coste de entrada | Quién lo maneja |
|---|---|---|---|---|---|---|
| Funciones de Excel | no | no | no | sí | 0 EUR | cualquiera |
| Power Query (agrupación aproximada) | por columna | no | no | sí | 0 EUR | usuario avanzado de Excel |
| OpenRefine | sí, por huella | no | no | sí | 0 EUR | perfil técnico |
| Python (pandas, recordlinkage) | sí, totalmente configurable | con base propia | hay que construirlo | sí | 0 EUR | desarrollador |
| Detección de duplicados del CRM | parcialmente | rara vez | rara vez | según el CRM | incluido en la suscripción | usuario de negocio |
| Plataforma cloud de calidad de datos | sí | sí, datos de referencia | sí | no | desde 200 EUR/mes | departamento de marketing |
| Software de escritorio sin conexión | sí | sí, base local | sí | sí | desde 69 EUR | usuario de negocio |
Dos filas merecen comentario, porque se valoran mal con frecuencia.
OpenRefine es gratuito y está subestimado, sobre todo para el español. Su función «Cluster & Edit» incluye un método de huella (fingerprint) que pasa el texto a minúsculas, quita la puntuación, convierte los caracteres acentuados a ASCII y, lo decisivo aquí, ordena las palabras alfabéticamente antes de compararlas. Eso significa que «José María García Rodríguez» y «García Rodríguez, Jose Maria» producen exactamente la misma huella y caen en el mismo grupo. El problema del orden invertido de nombre y apellidos, que es la variante más frecuente en los ficheros españoles, se resuelve así sin escribir una línea de código. Los métodos fonéticos del programa, en cambio, están calibrados para el inglés y el alemán: con apellidos españoles conviene usar la comparación por distancia de edición.
La detección de duplicados del CRM está sobrevalorada. Salesforce, HubSpot o Dynamics comprueban al crear una ficha, normalmente por correo electrónico o razón social. Para correo postal eso no basta: dos miembros de un mismo hogar son dos contactos legítimos para el CRM, pero un solo envío para la imprenta.
La prueba: las mismas ocho filas, siete resultados
El fichero de partida contiene a propósito los tipos de error que más dinero cuestan en un fichero español.
Fichero de partida (extracto):
1 D. José María García Rodríguez | C/ Gran Vía 28 | 28013 | Madrid
2 GARCIA RODRIGUEZ, Jose Maria | Calle Gran Via 28 | 28013 | Madrid
3 J. M. García R. | Gran Vía 28, 3ºB | 28013 | Madrid
4 Montserrat Ferrer Puig | Avda. Diagonal 405 | 08008 | Barcelona
5 M. Ferrer | Avenida Diagonal 405 | 08008 | Barcelona
6 Álvaro Núñez | Plaza del Ayuntamiento 7 | 46002 | Sevilla <- CP de Valencia
7 Fam. Nunez | Pl. del Ayuntamiento 7 | 46002 | Valencia
8 Lucía Ortega | Calle Sierpes 12 | 8008 | Barcelona <- cero inicial perdido
Contiene: orden invertido de nombre y apellidos (1/2), pérdida del segundo apellido (3 y 5), variante de acentuación (6/7), tres abreviaturas de vía, el piso metido en el campo de la calle (3), una contradicción entre código postal y municipio (6), un hogar de dos personas (6/7) y el clásico cero inicial desaparecido (8).
La fila 8 merece atención propia porque no es un error de quien teclea. Los códigos postales de Barcelona, Girona, Lleida y Tarragona empiezan por cero, y Excel los interpreta como números y se come ese cero en el momento de abrir el CSV. Un fichero exportado, abierto en Excel y vuelto a guardar convierte «08008» en «8008» sin avisar. Es el error más extendido en los ficheros de direcciones españoles y ninguna herramienta de deduplicación lo detecta, porque no es un duplicado sino un dato dañado.
Excel, función «Quitar duplicados»: ningún resultado. La comparación es literal y ninguna pareja de filas es idéntica. Un CONTAR.SI da lo mismo. Las razones estructurales de este fallo están detalladas en nuestro artículo sobre duplicados de direcciones en Excel.
Power Query, agrupación aproximada con umbral 0,8: detecta 4 y 5 con dificultad y falla en 1 y 2, porque la comparación no reordena las palabras: «José María García Rodríguez» y «GARCIA RODRIGUEZ, Jose Maria» tienen pocos caracteres en común en la misma posición. Las abreviaturas de vía solo se resuelven si usted aporta su propia tabla de transformación («C/» a «Calle», «Avda.» a «Avenida», «Pl.» a «Plaza»). La comparación es columna a columna, sin puntuación global del registro.
OpenRefine, método de huella: detecta 1 y 2 gracias a la ordenación alfabética de las palabras, y 6 y 7 porque los acentos desaparecen al calcular la huella. Con la fila 3 falla, ya que «J. M. García R.» no comparte suficientes palabras completas. Hay que construir antes una columna combinada de nombre, vía y código postal, porque la agrupación siempre actúa sobre una sola columna. Los problemas de código postal de las filas 6 y 8 pasan inadvertidos: OpenRefine no conoce ningún referencial postal.
Python con pandas y recordlinkage: con una configuración cuidada detecta todas las parejas, incluido el hogar y la fila 3, porque permite comparar iniciales contra nombres completos. Cuente unas cuarenta líneas de código y una estrategia de blocking para no calcular 12.000 por 12.000 comparaciones. Es el mejor resultado accesible de forma gratuita, pero depende de una sola persona en la empresa.
Plataforma cloud de calidad de datos: detecta todos los duplicados y además corrige las filas 6 y 8, porque el contraste se hace contra datos de referencia postales. El precio es subir 12.000 registros con datos personales a un proveedor externo.
Software de escritorio sin conexión con varios algoritmos: detecta las parejas 1/2, 4/5 y 6/7, marca la fila 3 como caso incierto para revisión manual, agrupa 6 y 7 como hogar y avisa de las anomalías de código postal contra una base local. Cómo trabajan juntos esos algoritmos se explica en el artículo sobre la coincidencia aproximada de direcciones.
Donde se detiene incluso la mejor herramienta
Tres tipos de error no se pueden deducir de ningún fichero, porque la información no está dentro.
Los cambios de domicilio son la partida más grande. En España alrededor del 9 % de la población se muda cada año, y su fichero no lo sabe. Para eso hace falta un cruce con datos de mudanzas, prestación reservada a proveedores que disponen de esos flujos. Lo mismo ocurre con las personas fallecidas. Y decidir si «José María García Rodríguez, Gran Vía 28» y «J. M. García R., Gran Vía 28, 3ºB» son la misma persona o padre e hijo en el mismo edificio es un juicio humano. Una buena herramienta se reconoce porque marca esos casos como inciertos en lugar de fusionarlos en silencio.
Coste a tres años: la licencia es la partida menor
Las comparativas alinean precios de licencia y pasan por alto las dos partidas más pesadas: el tiempo de trabajo por pasada y el franqueo de los duplicados que quedan sin detectar.
El cálculo parte de un fichero de 12.000 direcciones, cuatro envíos al año con tarifa Publicorreo (0,22 EUR por envío) más 0,12 EUR de impresión, es decir 0,34 EUR por pieza, y un coste horario interno de 35 EUR. En doce envíos a lo largo de tres años, un duplicado no detectado cuesta por tanto 4,08 EUR.
| Enfoque | Licencia 3 años | Tiempo 3 años | Tiempo en EUR | Duplicados no detectados | Franqueo | Total |
|---|---|---|---|---|---|---|
| Funciones de Excel | 0 EUR | 42 h | 1.470 EUR | 4,0 % (480) | 1.958 EUR | 3.428 EUR |
| Power Query | 0 EUR | 30 h | 1.050 EUR | 2,5 % (300) | 1.224 EUR | 2.274 EUR |
| OpenRefine | 0 EUR | 30 h | 1.050 EUR | 1,5 % (180) | 734 EUR | 1.784 EUR |
| Python (desarrollo propio) | 0 EUR | 26 h | 910 EUR | 0,5 % (60) | 245 EUR | 1.155 EUR |
| Plataforma cloud | 7.200 EUR | 12 h | 420 EUR | 0,5 % (60) | 245 EUR | 7.865 EUR |
| Software de escritorio | 2.370 EUR | 9 h | 315 EUR | 0,5 % (60) | 245 EUR | 2.930 EUR |
El resultado contradice la intuición en dos puntos. Primero, Excel es la más cara de las opciones gratuitas, porque tres horas y media de manipulación por pasada se suman a la peor tasa de detección. Segundo, el desarrollo propio en Python gana el cálculo con claridad, y honestamente así es.
El inconveniente del desarrollo propio no aparece en la tabla. El script lo conoce una persona, y si esa persona cambia de empresa el proceso se detiene. Las 26 horas cubren el desarrollo, no el mantenimiento cuando llega una fuente nueva o cambia un formato de columna. Quien no quiera asumir esa dependencia paga, con una licencia de escritorio, unos 1.800 EUR a tres años por una herramienta que cualquiera del equipo puede ejecutar.
La plataforma cloud está claramente sobredimensionada para este volumen. Su ventaja aparece a partir de unas 50.000 direcciones con importaciones continuas, donde la API sustituye por completo el trabajo manual. Los importes de franqueo que están en juego se detallan en el artículo sobre reducir costes de mailing postal.
El protocolo de prueba de 30 minutos con sus datos
Todo fabricante presenta en la demostración datos hechos a medida de su herramienta. Solo es fiable una prueba con sus direcciones y con casos cuya respuesta correcta usted ya conoce. El método ocupa media hora y sirve para cualquier candidato.
Paso 1 Extraer una muestra aleatoria de 1.000 direcciones del fichero real.
Paso 2 Insertar 20 casos de prueba cuya solución usted conoce:
5x orden invertido (José García Ruiz / García Ruiz, José)
4x abreviatura de vía (Avda. Diagonal 405 / Avenida Diagonal 405)
3x segundo apellido (María García Rodríguez / María García)
3x acento omitido (Núñez / Nunez)
3x hogar (2 personas, 1 dirección)
2x cifras invertidas (28013 / 20813)
Paso 3 Pasar el fichero por la herramienta con los ajustes por defecto.
Paso 4 Anotar dos cifras:
Tasa de detección = casos de prueba encontrados / 20
Falsos positivos = parejas fusionadas por error en el resultado
Lectura: por debajo de 15 aciertos sobre 20, la herramienta no sirve para direcciones.
Más de 2 falsos positivos es más grave que unos aciertos menos,
porque una fusión errónea borra a un cliente real de su base.
La segunda cifra es la más importante y casi siempre se olvida. Una herramienta que fusiona de forma agresiva presenta tasas de detección lucidas mientras elimina clientes que nunca debió tocar. Compruebe que el umbral es ajustable y que las parejas inciertas se someten a revisión en lugar de desaparecer solas.
ListenFix es un software de escritorio pensado exactamente para este recorrido: cinco algoritmos de coincidencia en paralelo, validación de códigos postales contra una base incluida para 29 países europeos, detección de hogares y umbral ajustable con lista de control para los casos límite. El procesamiento es totalmente local, su fichero de prueba no sale del ordenador. Descargar ListenFix gratis, sin tarjeta.
RGPD: adónde van sus direcciones durante la limpieza
La elección de la herramienta es también una decisión jurídica, y se toma mucho antes del primer clic.
En cuanto una herramienta de limpieza de datos transmite sus direcciones a servidores ajenos para procesarlas, existe un encargo de tratamiento en el sentido del artículo 28 del RGPD. Eso implica un contrato de encargado del tratamiento, conocer la ubicación del alojamiento e inscribir el tratamiento en el registro de actividades. Si la matriz del proveedor está fuera de la Unión Europea, se añade el análisis de la transferencia internacional.
Las herramientas que trabajan en local, desde la hoja de cálculo hasta OpenRefine y el software de escritorio, resuelven la cuestión evitando que nazca. Los datos permanecen en el equipo, no hay encargado del tratamiento ni alojamiento que verificar.
Para algunos sectores esto no es una comodidad sino la única vía practicable. Los profesionales sanitarios y los abogados están sujetos a secreto profesional, en el caso de la abogacía por el artículo 542.3 de la Ley Orgánica del Poder Judicial. Los datos de salud son además categoría especial según el artículo 9 del RGPD, lo que obliga con frecuencia a una evaluación de impacto antes de subirlos a cualquier servicio. En esos ámbitos la fila «plataforma cloud» de la tabla se puede tachar antes de empezar.
Segundo punto, menos previsto: el artículo 5 del RGPD exige datos exactos y actualizados. Una limpieza periódica no es solo una cuestión de coste, es una medida técnica documentable en el sentido del artículo 32. La AEPD considera el mantenimiento de los ficheros parte del principio de exactitud. Un registro que indique qué fichero se limpió y cuándo pesa más en una inspección que cualquier declaración de intenciones.
Qué herramienta encaja con cada situación de partida
Los siete enfoques no compiten realmente entre sí, responden a situaciones distintas. El mercado cubre cuatro.
Menos de 1.000 direcciones y una limpieza al año: quédese en Excel y dedique la licencia ahorrada a una revisión manual cuidadosa. A ese volumen el trabajo a mano es defendible, y toda herramienta tiene una curva de aprendizaje que no se amortiza con una pasada anual.
Entre 1.000 y 30.000 direcciones y varios envíos al año: la decisión se juega en quién maneja la herramienta. Si hay una persona con soltura técnica y tiempo disponible, OpenRefine con el método de huella es una opción gratuita seria para un fichero español, precisamente porque resuelve el orden invertido de los apellidos. Si el proceso debe funcionar con independencia de las personas, el software de escritorio local es el camino más económico, ya que baja el tiempo por pasada por debajo de una hora.
Más de 50.000 direcciones con importaciones continuas desde varios sistemas: una plataforma cloud con API pasa a tener sentido, siempre que el análisis de protección de datos lo permita. A esos volúmenes el cruce con referenciales postales y datos de mudanzas vale más que el ahorro en licencia.
Fichero sujeto a secreto profesional: tratamiento local exclusivamente. Entre OpenRefine y el software de escritorio decide únicamente cuánto tiempo de puesta en marcha esté dispuesto a invertir.
El camino elegido importa menos que la regularidad. Un fichero limpiado a fondo una vez y luego desatendido vuelve a perder entre el 3 y el 5 % de su calidad al año por mudanzas, cambios de apellido y errores de tecleo en los registros nuevos. Fije la limpieza antes de cada envío, anote la tasa de detección y la de devoluciones, y en la segunda pasada verá con números si la herramienta elegida cubre su coste. Un punto de partida práctico para los pasos previos está en el artículo sobre la normalización de direcciones.
Limpia tus direcciones — pruébalo ahora
ListenFix detecta significativamente más duplicados que Excel gracias al fuzzy matching. 100% sin conexión, compatible con RGPD.
Probar gratis