Un hyperparamètre se choisit avant l’entraînement, un paramètre s’apprend pendant. La distinction se lit dans le code, et elle décide de ce que vous avez le droit de régler.
Un script ElasticNet qui n’affiche ses résultats que dans le terminal, puis les six lignes qui le rendent comparable, reproductible et prêt pour le registre de modèles.
Un modèle qui récite ses données d’entraînement a besoin d’un frein. alpha en règle l’intensité, l1_ratio choisit entre Ridge et Lasso. Trop freiner nuit autant que pas assez.
On répète que Scala est plus rapide que PySpark. C’est vrai dans un cas précis et faux ailleurs. Ce qui se passe sous le capot, et comment choisir.
Dates incohérentes, doublons partiels, valeurs manquantes structurées : le nettoyage n’est pas une liste de méthodes, c’est une suite de choix à poser.