4D Training & Consultancy

Développement logiciel

Machine learning avec Python et scikit-learn

Construire un modèle est simple ; faire confiance au score annoncé l'est moins. Ce programme couvre les pipelines scikit-learn, la validation croisée honnête, les fuites de données qui gonflent les résultats, le déséquilibre de classes, le choix du seuil, la calibration des probabilités et l'interprétation qui permet d'agir.

5 joursPrésentiel interne, en ligne ou sur mesureÉquipes corporate et groupes professionnelsNiveau: Intermédiaire

Aperçu

Un apprentissage pratique pour le transfert en situation de travail.

La plupart des modèles décevants en production n'ont jamais été aussi bons que leur score de validation le laissait croire. Un scaler ajusté avant la séparation, une variable dérivée de la cible, un mélange aléatoire appliqué à des données temporelles ou une exactitude annoncée sur un jeu à quatre-vingt-dix-huit pour cent négatif : chacun produit un chiffre irreproductible. Cette formation fait de la rigueur d'évaluation la compétence centrale. Les participants construisent chaque modèle dans un Pipeline, choisissent des schémas de validation respectant le temps et les groupes, fixent un seuil selon une matrice de coûts réelle et calibrent les probabilités avant tout usage en aval.

Prérequis

Bonne maîtrise de Python et de pandas, ainsi que des statistiques descriptives. Aucune expérience de modélisation n'est requise.

Objectifs

  • Traduire une question métier en tâche d'apprentissage supervisé avec une cible mesurable.
  • Composer prétraitement et estimateurs dans des objets Pipeline et ColumnTransformer.
  • Identifier et éliminer les fuites de données qui gonflent les scores de validation.
  • Choisir des schémas de validation croisée respectant l'ordre temporel et les groupes.
  • Traiter le déséquilibre de classes par rééchantillonnage, pondération et seuils orientés coût.
  • Calibrer, interpréter et empaqueter un modèle pour transfert à une équipe d'ingénierie.

Public cible

  • Data scientists structurant une pratique de modélisation encore informelle
  • Analystes quantitatifs et risque passant des modèles statistiques au ML
  • Ingénieurs logiciels affectés à une fonctionnalité prédictive
  • Ingénieurs data devant industrialiser des modèles conçus par d'autres
  • Équipes maintenance, prévision de la demande et crédit évaluant des cas d'usage prédictifs
  • Responsables techniques validant les résultats de modèles avant décision

Programme

Une structure claire pour le parcours d'apprentissage.

Programme

Les points du programme sont regroupés dans un seul bloc au lieu de créer un module par ligne.

Module 1 : Cadrer le problème et le jeu de données

Définir une cible et un horizon de prédiction exploitables par le métier

Régression, classification et ranking : adapter la tâche à la décision

Références avec DummyClassifier et DummyRegressor avant tout vrai modèle

Stratégie de séparation : aléatoire, stratifiée, groupée ou temporelle

Module 2 : Pipelines, ColumnTransformer et préparation des variables

Pourquoi ajuster un scaler ou un imputer hors pipeline contamine le jeu de test

Mise à l'échelle, imputation et encodage sûr des variables catégorielles

Encodages OneHot, ordinal et par cible et leurs limites en forte cardinalité

Transformers personnalisés avec FunctionTransformer et l'API estimator

Module 3 : Algorithmes supervisés et leurs compromis

Régression linéaire et logistique avec régularisation L1 et L2

Arbres, forêts aléatoires et limites de la réduction de variance

Gradient boosting : comparaison HistGradientBoosting et XGBoost

Comportement biais-variance lu sur les courbes d'apprentissage et de validation

Module 4 : Validation, fuites de données et recherche d'hyperparamètres

KFold, StratifiedKFold, GroupKFold et TimeSeriesSplit selon la structure des données

Fuite de cible, contamination train-test et variables indisponibles à la prédiction

GridSearchCV, RandomizedSearchCV et HalvingSearchCV sous contrainte de calcul

Validation croisée imbriquée pour une estimation non biaisée après optimisation

Module 5 : Déséquilibre, seuils et calibration

Pourquoi l'exactitude n'a pas de sens sur les événements rares et quoi publier

Pondération de classes, SMOTE et sous-échantillonnage et leurs effets secondaires

Courbes précision-rappel, ROC AUC et choix du seuil via une matrice de coûts

Calibration des probabilités : Platt, régression isotonique et courbes de fiabilité

Module 6 : Interprétation, empaquetage et transfert

Importance par permutation et dépendance partielle correctement interprétées

Valeurs SHAP pour les prédictions individuelles et leurs limites de communication

Sauvegarde avec joblib, versions figées et métadonnées d'entraînement

Surveiller la dérive et définir le déclencheur de réentraînement avant la mise en service

Supports fournis

  • Manuel de formation, exemples de code commentés et notes de référence
  • Environnement de laboratoire et dépôts de démarrage
  • Exercices, check-lists et modèles de code réutilisables
  • Certificat de participation 4D
  • Accompagnement technique après la formation

Options de formation

Les programmes peuvent être organisés en entreprise, en ligne ou dans un format hybride selon le calendrier, la localisation et les objectifs de vos équipes. Lorsqu'un certificat ou un examen externe est inclus, les règles et frais de certification restent soumis aux politiques de l'organisme certificateur, tandis que 4D assure la formation et l'accompagnement à la préparation.

Pourquoi choisir 4D

4D structure ce programme autour de l'un de vos cas d'usage candidats : attrition, décision de crédit, prévision de la demande ou prédiction de panne. Les formateurs auditent d'abord le jeu historique pour détecter fuites et défauts d'étiquetage, construisent ensuite le pipeline avec vos analystes et valident le seuil opérationnel avec le responsable métier qui exploitera le résultat, afin que le modèle reparte avec une règle de décision défendable.

Contacter 4D

Planifiez le bon parcours de formation ou de conseil pour votre équipe.

Partagez quelques détails et 4D orientera votre demande vers la formation, le conseil, l’évaluation, Phoenix ou un programme sur mesure.