Guides pratiques

Nettoyer un tableau avec l’IA sans perdre de données

Un tableau peut être lisible tout en mélangeant dates, unités et identités. Le nettoyage doit rendre les données exploitables sans effacer des différences légitimes. Utilisez l’IA pour préparer des règles et des contrôles ; conservez une copie de la source et validez chaque transformation.

Par AI Powers 6 min de lecture
Carnet ouvert et ordinateur portable sur un bureau blanc
Une copie de travail et un journal des transformations permettent de retrouver les données initiales.Photo : JESHOOTS.COM / Unsplash

Résultat

À la fin de ce guide, vous saurez

  • Décrire les colonnes et les erreurs avant de modifier le tableau.
  • Distinguer doublon confirmé, ressemblance et information manquante.
  • Contrôler les transformations par des totaux et des exemples indépendants.

Étapes

La méthode pas à pas

La règle métier précède la correction technique. Deux lignes semblables ne sont pas nécessairement le même enregistrement.

1. Conserver une source et décrire les champs

Dupliquez le fichier et notez sa date, son origine et le nombre de lignes. Définissez le sens de chaque colonne, son unité, les valeurs autorisées et la clé qui identifie une entrée.

Ne partagez qu’un échantillon minimisé si le tableau contient des informations personnelles ou confidentielles. Les noms de colonnes et quelques valeurs fictives explicitement signalées peuvent suffire pour construire une règle.

2. Mesurer les anomalies

Comptez valeurs vides, formats inattendus, clés répétées et valeurs hors domaine. Distinguez « inconnu », « non applicable » et zéro ; ces états ne signifient pas la même chose.

Pour les dates, identifiez les formats ambigus et la convention de la source. Pour les nombres, contrôlez séparateurs décimaux, devises et unités. Une conversion silencieuse peut changer le sens.

3. Écrire des règles avant de les appliquer

Décrivez chaque transformation : champ concerné, condition, nouvelle valeur et exception. Prévoyez une liste des cas à relire au lieu de forcer une correction incertaine.

Une différence de casse peut être normalisée dans un champ de recherche ; elle peut être significative dans un identifiant. Gardez la valeur d’affichage originale lorsque cela sert l’utilisateur.

4. Examiner les doublons sans fusion aveugle

Commencez par les identifiants stables puis examinez les combinaisons de champs. Un nom commun, une adresse partagée ou une variante orthographique ne prouve pas une identité.

Avant toute fusion, choisissez les valeurs à conserver et documentez les conflits. Gardez une correspondance entre anciennes lignes et nouvelle entrée pour pouvoir expliquer le résultat.

5. Contrôler et rendre les changements réversibles

Comparez nombres de lignes, valeurs manquantes et agrégats avant et après. Relisez un échantillon de corrections, toutes les exceptions et quelques lignes qui ne devaient pas changer.

Conservez règles, journal et version de sortie. Une analyse ultérieure doit pouvoir expliquer quelle donnée a été transformée et pourquoi.

Application

Exemple concret

Demande trop vague

Nettoie mon fichier et supprime les doublons.

Demande améliorée

Voici un échantillon anonymisé et le dictionnaire des colonnes. Propose les règles de nettoyage sans modifier les valeurs. Une entrée est identifiée par son code ; les noms similaires ne doivent pas être fusionnés. Liste les dates ambiguës, les unités incompatibles et les contrôles avant/après.
Pourquoi cela fonctionne

L’identité d’une entrée et les transformations autorisées sont définies avant de toucher aux données.

Avant de continuer

Liste de contrôle

  • Une copie originale est conservée.
  • Les colonnes, unités et clés sont définies.
  • Les dates ambiguës restent à contrôler.
  • Chaque fusion possède une justification.
  • Les totaux avant/après sont comparés.
  • Les changements sont traçables et réversibles.

Le livrable à obtenir et son contrôle

Résultat concret

Une copie nettoyée, un dictionnaire des colonnes et un journal des transformations.

Comment décider s’il est utilisable

Comparez lignes, clés, valeurs manquantes et agrégats avant/après ; relisez les fusions et les dates ambiguës.

Vigilance

Erreurs fréquentes à éviter

Remplacer les vides par zéro

Cela modifie les moyennes et peut transformer une absence d’information en valeur mesurée.

Fusionner sur le nom seul

Deux personnes, lieux ou produits peuvent porter le même nom.

Corriger sans journal

La cohérence apparente ne permet plus de retrouver ce qui a changé.

FAQ

Questions fréquentes

Faut-il supprimer toutes les lignes incomplètes ?

Non. Définissez les champs indispensables selon l’usage et conservez les autres absences comme telles.

L’IA peut-elle trouver la bonne valeur ?

Elle peut proposer une hypothèse ; une correction factuelle doit venir d’une source identifiable.

Comment contrôler un grand tableau ?

Automatisez les règles explicites et compteurs, puis relisez exceptions et échantillons représentatifs.

Sources pour approfondir et vérifier

Ces ressources indépendantes aident à retrouver une référence. Leur langue et leur périmètre sont indiqués : une ressource française ne décrit pas nécessairement les règles d’un autre pays. Elles ne sont pas les sources automatiquement consultées pour les réponses générées.

Guides

Poursuivre avec un autre guide