Outil nettoyage de données : 7 solutions comparées
Image générée par IALa recherche d'un outil de nettoyage de données se termine souvent par une démonstration commerciale qui montre exactement ce qui fonctionnait déjà : suppression des espaces superflus, harmonisation de la casse, élimination des lignes strictement identiques. Six semaines et une signature de licence plus tard, le publipostage suivant part quand même en double chez 200 clients, parce que l'outil considère « Lefèvre » et « Lefevre » comme deux personnes distinctes.
La cause n'est presque jamais la qualité du logiciel. C'est une confusion de vocabulaire : derrière le terme « nettoyage de données » se cachent quatre opérations techniquement indépendantes, et peu d'outils maîtrisent les quatre. En France s'ajoute une particularité : le RNVP, la norme postale de La Poste, couvre deux de ces quatre opérations et pas les deux autres. Beaucoup d'entreprises croient leur fichier propre parce qu'il est passé au RNVP, alors que les doublons n'ont jamais été traités.
Ce comparatif dissèque sept approches concrètes, du tableur au logiciel installé en local. Toutes les sept traitent les mêmes huit lignes d'exemple, ce qui rend visible qui trouve quoi. Suit un calcul sur trois ans intégrant le temps de travail, puis un protocole de test permettant d'évaluer n'importe quel outil sur vos propres données en 30 minutes.
Quatre opérations derrière un seul terme
Avant d'évaluer un outil de nettoyage de données, il faut savoir quel travail vous attendez de lui. Sur un fichier adresses, il s'agit de quatre opérations qui n'ont rien de commun sur le plan technique.
| Opération | Ce qui se passe | Comment repérer qu'elle manque |
|---|---|---|
| Normalisation | « bd » devient « Boulevard », civilité et complément sont isolés dans leurs champs | La même adresse existe en cinq graphies dans le fichier |
| Validation postale | Code postal, commune et format sont contrôlés contre un référentiel | Retours NPAI portant la mention « adresse incomplète » |
| Dédoublonnage | Les enregistrements désignant la même personne sont regroupés | Des clients signalent avoir reçu deux fois le même courrier |
| Regroupement par foyer | Plusieurs personnes à une même adresse deviennent un seul pli | Trois courriers à la même famille, trois affranchissements |
Le RNVP, acronyme de Restructuration, Normalisation, Validation Postale, couvre les deux premières lignes. Il redresse les libellés de voie, complète les codes postaux et vérifie la cohérence avec le référentiel de La Poste. Il ne fait ni dédoublonnage ni regroupement par foyer. Ces deux prestations se facturent séparément chez la plupart des prestataires, et c'est précisément là que se logent les économies d'affranchissement les plus importantes.
L'ordre compte également. Chercher des doublons avant d'avoir normalisé revient à n'en trouver qu'une fraction, puisque « 8 bd de la Liberté » et « 8 Boulevard de la Liberté » sont deux chaînes de caractères différentes pour tout algorithme de comparaison.
Les sept approches en vue d'ensemble
Le marché paraît illisible mais se ramène à sept approches. Les tarifs indiqués correspondent à un fichier d'environ 12 000 adresses.
| Approche | Doublons approximatifs | Validation CP | Foyers | Données restent locales | Coût d'entrée | Qui l'utilise |
|---|---|---|---|---|---|---|
| Fonctions Excel | non | non | non | oui | 0 EUR | tout le monde |
| Power Query (regroupement approximatif) | par colonne | non | non | oui | 0 EUR | utilisateurs Excel avancés |
| OpenRefine | oui, par empreinte | non | non | oui | 0 EUR | profil technique |
| Python (pandas, recordlinkage) | oui, entièrement paramétrable | avec base fournie | à construire | oui | 0 EUR | développeur |
| Détection de doublons du CRM | partiellement | rarement | rarement | selon le CRM | inclus dans l'abonnement | utilisateur métier |
| Prestataire RNVP | en option payante | oui, référentiel La Poste | en option | non | facturé au volume | service marketing |
| Logiciel bureau hors ligne | oui | oui, base locale | oui | oui | à partir de 69 EUR | utilisateur métier |
Deux lignes méritent un commentaire, car elles sont régulièrement mal évaluées.
OpenRefine est gratuit et sous-estimé, en particulier pour le français. Sa fonction « Cluster & Edit » propose une méthode dite d'empreinte (fingerprint) qui met le texte en minuscules, retire la ponctuation et surtout convertit les caractères accentués en ASCII. « Lefèvre » et « Lefevre » produisent donc la même empreinte « lefevre » et se retrouvent automatiquement dans le même groupe. Comme l'accentuation est la première source de variantes dans un fichier français, cet unique mécanisme règle une grande partie du problème sans coder une ligne. Les méthodes phonétiques du logiciel, en revanche, sont calibrées pour l'anglais et l'allemand : sur des noms français, préférez la comparaison par distance d'édition.
La détection de doublons du CRM est surestimée. Salesforce, HubSpot ou Dynamics contrôlent à la création d'une fiche, généralement sur l'adresse email ou la raison sociale. Pour du courrier postal, cela ne suffit pas : deux membres d'un même foyer sont deux contacts légitimes pour le CRM, mais un seul pli pour l'expédition.
Le test : les mêmes huit lignes, sept résultats
Le fichier de départ ci-dessous contient volontairement les types d'erreurs qui coûtent le plus cher dans un fichier adresses français.
Fichier de départ (extrait) :
1 M. Jean-Pierre Durand | 31 rue d'Alsace-Lorraine | 31000 | Toulouse
2 DURAND Jean Pierre | 31 r. Alsace Lorraine | 31000 | Toulouse
3 J.-P. Durand-Blanc | 31 bis rue Alsace Lorraine | 31000 | Toulouse
4 Sophie Lefèvre | 8 bd de la Liberté | 59000 | Lille
5 S. Lefevre-Marchand | 8 Boulevard de la Liberté | 59000 | Lille
6 Éric Moreau | 12 av. des Champs-Élysées | 75008 | Lyon <- CP parisien
7 Fam. Eric Moreau | 12 Avenue des Champs-Elysees | 75008 | Paris
8 Claire Bonnet | 3 place du Capitole | 3100 | Toulouse <- CP à 4 chiffres
On y trouve : une variante d'accentuation (4/5 et 6/7), un nom d'usage après mariage (5), trois abréviations de voie, une incohérence entre code postal et commune (6), un code postal à quatre chiffres (8) et un foyer de deux personnes (6/7).
Excel, fonction « Supprimer les doublons » : aucun résultat. La comparaison est strictement littérale et aucune paire de lignes n'est identique. Un NB.SI donne le même résultat. Les raisons structurelles de cet échec sont détaillées dans notre article sur les doublons d'adresses dans Excel.
Power Query, regroupement approximatif au seuil de 0,8 : détecte 1 et 2, car « Jean-Pierre Durand » et « Jean Pierre Durand » ne diffèrent que d'un caractère. Il échoue sur 4 et 5, « S. Lefevre-Marchand » présentant trop peu de recouvrement avec « Sophie Lefèvre ». Les abréviations de voie ne sont résolues que si vous fournissez votre propre table de transformation (« bd » vers « Boulevard », « r. » vers « Rue », « av. » vers « Avenue »). La comparaison reste colonne par colonne, sans score global sur l'enregistrement.
OpenRefine, méthode par empreinte : détecte 4 et 5 au niveau du nom de famille ainsi que 6 et 7, puisque les accents disparaissent lors du calcul de l'empreinte. Il faut au préalable construire une colonne combinée nom, voie et code postal, car le regroupement porte toujours sur une seule colonne. Les problèmes de code postal des lignes 6 et 8 passent inaperçus : OpenRefine ne connaît aucun référentiel postal.
Python avec pandas et recordlinkage : avec une configuration soignée, toutes les paires sont détectées, y compris le foyer. Comptez une quarantaine de lignes de code et une stratégie de blocking pour éviter de calculer 12 000 fois 12 000 comparaisons. C'est le meilleur résultat accessible gratuitement, mais il repose sur une seule personne dans l'entreprise.
Prestataire RNVP : corrige les lignes 6 et 8 de façon fiable, puisque la validation s'appuie sur le référentiel officiel de La Poste, et redresse toutes les abréviations de voie. Les doublons, en revanche, ne sont traités que si vous avez souscrit l'option de dédoublonnage. Beaucoup de fichiers reviennent parfaitement normalisés et toujours en double.
Logiciel bureau hors ligne multi-algorithmes : détecte les paires 1/2, 4/5 et 6/7, signale la ligne 3 comme cas incertain à vérifier manuellement, regroupe 6 et 7 en un foyer et signale les anomalies de code postal contre une base locale. Le fonctionnement de ces algorithmes est détaillé dans notre article sur la correspondance approximative d'adresses.
Là où même le meilleur outil s'arrête
Trois catégories d'erreurs ne peuvent être déduites d'aucun fichier, parce que l'information n'y figure pas.
Les déménagements constituent le poste le plus lourd. En France, environ 9 % de la population change de domicile chaque année, et votre fichier n'en sait rien. Il faut un croisement avec le fichier des déménagés, prestation réservée aux acteurs disposant de ces flux de données. Le même raisonnement s'applique aux personnes décédées. Enfin, savoir si « Jean-Pierre Durand, 31 rue d'Alsace-Lorraine » et « J.-P. Durand-Blanc, 31 bis » désignent la même personne ou deux voisins relève d'un arbitrage humain. Un bon outil se reconnaît à ce qu'il marque ces cas comme incertains au lieu de les fusionner en silence.
Coût sur trois ans : la licence est le poste le plus faible
Les comparatifs alignent des prix de licence et négligent les deux postes les plus lourds : le temps de travail par passage et l'affranchissement des doublons non détectés.
Le calcul repose sur un fichier de 12 000 adresses, quatre envois par an au tarif Destineo MD (0,256 EUR par pli) avec 0,12 EUR d'impression, soit 0,376 EUR par pli, et un coût horaire interne de 45 EUR. Sur douze envois en trois ans, un doublon non détecté coûte donc 4,51 EUR.
| Approche | Licence 3 ans | Temps 3 ans | Temps en EUR | Doublons ratés | Affranchissement | Total |
|---|---|---|---|---|---|---|
| Fonctions Excel | 0 EUR | 42 h | 1 890 EUR | 4,0 % (480) | 2 165 EUR | 4 055 EUR |
| Power Query | 0 EUR | 30 h | 1 350 EUR | 2,5 % (300) | 1 353 EUR | 2 703 EUR |
| OpenRefine | 0 EUR | 30 h | 1 350 EUR | 1,5 % (180) | 812 EUR | 2 162 EUR |
| Python (développement interne) | 0 EUR | 26 h | 1 170 EUR | 0,5 % (60) | 271 EUR | 1 441 EUR |
| Prestataire RNVP au volume | 3 600 EUR | 6 h | 270 EUR | 0,5 % (60) | 271 EUR | 4 141 EUR |
| Plateforme cloud (abonnement) | 7 200 EUR | 12 h | 540 EUR | 0,5 % (60) | 271 EUR | 8 011 EUR |
| Logiciel bureau local | 2 370 EUR | 9 h | 405 EUR | 0,5 % (60) | 271 EUR | 3 046 EUR |
La ligne du prestataire RNVP suppose une facturation de 25 EUR pour mille adresses traitées et douze passages, option dédoublonnage comprise. C'est un ordre de grandeur courant, à vérifier dans votre devis : certains prestataires appliquent un minimum de facturation qui pénalise les fichiers de moins de 20 000 lignes.
Le résultat contredit l'intuition sur deux points. D'abord, Excel est la plus chère des solutions gratuites, parce que 3,5 heures de manipulation par passage se cumulent avec le pire taux de détection. Ensuite, le développement interne en Python remporte largement le calcul, et c'est honnêtement le cas.
Le défaut du développement interne ne figure pas dans le tableau. Le script n'est connu que d'une personne, et son départ interrompt le processus. Les 26 heures couvrent le développement, pas la maintenance lors de l'arrivée d'une nouvelle source ou d'un changement de format. Qui refuse cette dépendance paie, avec une licence bureau, environ 1 600 EUR sur trois ans pour un outil que n'importe qui dans l'équipe peut faire tourner.
La plateforme cloud est manifestement surdimensionnée à ce volume. Son avantage n'apparaît qu'à partir d'environ 50 000 adresses avec des imports continus, où l'API remplace entièrement la manipulation manuelle. Les autres critères de choix dans ce cas de figure sont traités dans notre article sur les logiciels RNVP.
Le protocole de test en 30 minutes sur vos données
Chaque éditeur présente en démonstration des données taillées pour son outil. Seul un test sur vos adresses, avec des cas dont vous connaissez déjà la bonne réponse, est fiable. La méthode prend une demi-heure et s'applique à tous les candidats.
Étape 1 Extraire un échantillon aléatoire de 1 000 adresses du fichier réel.
Étape 2 Y insérer 20 cas de test dont vous connaissez la solution :
5x variante d'accent (Lefèvre / Lefevre)
4x abréviation de voie (8 bd de la Liberté / 8 Boulevard de la Liberté)
3x nom d'usage (Lefevre / Lefevre-Marchand)
3x civilité omise (M. Durand / Durand)
3x foyer (2 personnes, 1 adresse)
2x inversion de chiffres (31000 / 13000)
Étape 3 Passer le fichier dans l'outil, réglages par défaut.
Étape 4 Relever deux chiffres :
Taux de détection = cas de test trouvés / 20
Faux positifs = paires fusionnées à tort dans le résultat
Lecture : en dessous de 15 détections sur 20, l'outil n'est pas fait pour des adresses.
Plus de 2 faux positifs est plus grave que quelques détections en moins,
car une fusion erronée supprime un client réel de votre base.
Le second chiffre est le plus important et il est presque toujours oublié. Un outil qui fusionne agressivement affiche des taux de détection flatteurs tout en supprimant des clients qu'il n'aurait jamais dû toucher. Vérifiez que le seuil est réglable et que les paires incertaines sont soumises à validation au lieu de disparaître automatiquement.
ListenFix est un logiciel de bureau conçu pour exactement ce déroulé : cinq algorithmes de correspondance en parallèle, validation des codes postaux contre une base fournie couvrant 29 pays européens, regroupement par foyer et seuil réglable avec liste de contrôle pour les cas limites. Le traitement est intégralement local, votre fichier de test ne quitte pas l'ordinateur. Essayez gratuitement, sans carte bancaire.
RGPD : où partent vos adresses pendant le nettoyage
Le choix de l'outil est aussi une décision juridique, et elle se prend bien avant le premier clic.
Dès qu'un outil de nettoyage de données transmet vos adresses à des serveurs tiers pour traitement, vous êtes dans une relation de sous-traitance au sens de l'article 28 du RGPD. Cela implique un contrat de sous-traitance, la connaissance du lieu d'hébergement et l'inscription du traitement au registre. Si la maison mère du prestataire est établie hors de l'Union européenne, s'ajoute l'analyse du transfert hors UE.
Les outils fonctionnant en local, du tableur à OpenRefine en passant par le logiciel de bureau, règlent la question en ne la faisant pas naître. Les données restent sur le poste, il n'y a pas de sous-traitant ni d'hébergement à vérifier.
Pour certains secteurs, ce n'est pas un confort mais la seule option praticable. Les professions de santé et les avocats sont tenus au secret professionnel sanctionné par l'article 226-13 du code pénal. Pour les données de santé, l'hébergeur doit en outre être certifié HDS : téléverser un fichier de patients chez un prestataire non certifié n'est pas régularisable par un simple contrat de sous-traitance. Dans ces métiers, la ligne « plateforme cloud » du tableau peut être rayée avant même de commencer.
Deuxième point, moins souvent anticipé : l'article 5 du RGPD exige des données exactes et tenues à jour. Un nettoyage périodique n'est donc pas seulement une question de coût, c'est une mesure technique documentable au sens de l'article 32. La CNIL considère l'entretien des fichiers comme une composante du principe d'exactitude. Un journal indiquant quel fichier a été nettoyé et quand pèse davantage lors d'un contrôle que n'importe quelle déclaration d'intention.
Quel outil pour quelle situation de départ
Les sept approches ne se concurrencent pas vraiment, elles répondent à des situations différentes. Le marché en couvre quatre.
Moins de 1 000 adresses, un nettoyage par an : restez sur Excel et consacrez la licence économisée à une relecture manuelle soigneuse. À ce volume, la manipulation à la main est défendable, et tout outil comporte une courbe d'apprentissage qui ne s'amortit pas sur un passage annuel.
De 1 000 à 30 000 adresses, plusieurs publipostages par an : la décision se joue sur la question de savoir qui pilote l'outil. Si une personne à l'aise techniquement dispose du temps nécessaire, OpenRefine avec la méthode par empreinte est une option gratuite sérieuse pour un fichier français. Si le processus doit tourner indépendamment des individus, le logiciel de bureau local est la voie la plus économique, car il ramène le temps par passage sous une heure.
Plus de 50 000 adresses avec imports continus depuis plusieurs systèmes : une plateforme cloud avec API devient pertinente, si l'analyse RGPD l'autorise. À ces volumes, le croisement avec les référentiels postaux et le fichier des déménagés vaut davantage que l'économie de licence.
Fichier soumis au secret professionnel : traitement local exclusivement. Entre OpenRefine et le logiciel de bureau, seul le temps d'installation que vous acceptez d'investir tranche.
Le chemin retenu importe finalement moins que la régularité. Un fichier nettoyé une fois à fond puis laissé sans entretien reperd 3 à 5 % de sa qualité par an, du fait des déménagements, des changements de nom et des erreurs de saisie à la création. Inscrivez le nettoyage avant chaque envoi, notez le taux de détection et le taux de NPAI, et dès le deuxième passage vous saurez noir sur blanc si l'outil choisi couvre son coût. Le calcul détaillé des économies d'affranchissement figure dans notre article sur les économies de frais postaux.
Nettoyez vos adresses — essayez maintenant
ListenFix détecte nettement plus de doublons qu'Excel grâce au fuzzy matching. 100% hors ligne, conforme au RGPD.
Essayer gratuitement