dropna, fillna, drop_duplicates tiennent en une ligne. Le nettoyage est une politique : quoi garder, quoi jeter, quoi inventer, quoi mettre de côté. Tant que cette politique n’est pas écrite, chaque fillna est une dette. C’est le fil du tutoriel nettoyer des données sales, et c’est ce qu’un entretien senior vérifie.
keep="first".Vous écrivez ces trois réponses. Ensuite seulement, le notebook.
shape, dtypes, taux de NA, cardinalité (nunique), quelques value_counts. Typage défensif à la lecture (dtype="string") pour qu’un code postal ne devienne pas float.format et errors="coerce", numériques, catégories fermées. Calculer sur un mauvais dtype, c’est figer l’erreur.fillna(0) global.NA, sommes qui doivent se conserver, shape.Inverser 4 et 2 (remplir puis parser) fabrique des dates « 0 » et des moyennes tirées vers zéro. Inverser 5 et 6 fait exploser un référentiel sale.
Pas la maîtrise de l’API. La discipline : regarder, décider, typer, puis transformer, puis prouver. Un candidat qui commence par df.dropna() sur tout le tableau vient de perdre l’entretien, même s’il connaît explode.