Développement logiciel
Machine learning avec Python et scikit-learn
Construire un modèle est simple ; faire confiance au score annoncé l'est moins. Ce programme couvre les pipelines scikit-learn, la validation croisée honnête, les fuites de données qui gonflent les résultats, le déséquilibre de classes, le choix du seuil, la calibration des probabilités et l'interprétation qui permet d'agir.
Aperçu
Un apprentissage pratique pour le transfert en situation de travail.
La plupart des modèles décevants en production n'ont jamais été aussi bons que leur score de validation le laissait croire. Un scaler ajusté avant la séparation, une variable dérivée de la cible, un mélange aléatoire appliqué à des données temporelles ou une exactitude annoncée sur un jeu à quatre-vingt-dix-huit pour cent négatif : chacun produit un chiffre irreproductible. Cette formation fait de la rigueur d'évaluation la compétence centrale. Les participants construisent chaque modèle dans un Pipeline, choisissent des schémas de validation respectant le temps et les groupes, fixent un seuil selon une matrice de coûts réelle et calibrent les probabilités avant tout usage en aval.
Prérequis
Bonne maîtrise de Python et de pandas, ainsi que des statistiques descriptives. Aucune expérience de modélisation n'est requise.
Objectifs
- Traduire une question métier en tâche d'apprentissage supervisé avec une cible mesurable.
- Composer prétraitement et estimateurs dans des objets Pipeline et ColumnTransformer.
- Identifier et éliminer les fuites de données qui gonflent les scores de validation.
- Choisir des schémas de validation croisée respectant l'ordre temporel et les groupes.
- Traiter le déséquilibre de classes par rééchantillonnage, pondération et seuils orientés coût.
- Calibrer, interpréter et empaqueter un modèle pour transfert à une équipe d'ingénierie.
Public cible
- Data scientists structurant une pratique de modélisation encore informelle
- Analystes quantitatifs et risque passant des modèles statistiques au ML
- Ingénieurs logiciels affectés à une fonctionnalité prédictive
- Ingénieurs data devant industrialiser des modèles conçus par d'autres
- Équipes maintenance, prévision de la demande et crédit évaluant des cas d'usage prédictifs
- Responsables techniques validant les résultats de modèles avant décision
Programme
Une structure claire pour le parcours d'apprentissage.
Programme
Les points du programme sont regroupés dans un seul bloc au lieu de créer un module par ligne.
Module 1 : Cadrer le problème et le jeu de données
Définir une cible et un horizon de prédiction exploitables par le métier
Régression, classification et ranking : adapter la tâche à la décision
Références avec DummyClassifier et DummyRegressor avant tout vrai modèle
Stratégie de séparation : aléatoire, stratifiée, groupée ou temporelle
Module 2 : Pipelines, ColumnTransformer et préparation des variables
Pourquoi ajuster un scaler ou un imputer hors pipeline contamine le jeu de test
Mise à l'échelle, imputation et encodage sûr des variables catégorielles
Encodages OneHot, ordinal et par cible et leurs limites en forte cardinalité
Transformers personnalisés avec FunctionTransformer et l'API estimator
Module 3 : Algorithmes supervisés et leurs compromis
Régression linéaire et logistique avec régularisation L1 et L2
Arbres, forêts aléatoires et limites de la réduction de variance
Gradient boosting : comparaison HistGradientBoosting et XGBoost
Comportement biais-variance lu sur les courbes d'apprentissage et de validation
Module 4 : Validation, fuites de données et recherche d'hyperparamètres
KFold, StratifiedKFold, GroupKFold et TimeSeriesSplit selon la structure des données
Fuite de cible, contamination train-test et variables indisponibles à la prédiction
GridSearchCV, RandomizedSearchCV et HalvingSearchCV sous contrainte de calcul
Validation croisée imbriquée pour une estimation non biaisée après optimisation
Module 5 : Déséquilibre, seuils et calibration
Pourquoi l'exactitude n'a pas de sens sur les événements rares et quoi publier
Pondération de classes, SMOTE et sous-échantillonnage et leurs effets secondaires
Courbes précision-rappel, ROC AUC et choix du seuil via une matrice de coûts
Calibration des probabilités : Platt, régression isotonique et courbes de fiabilité
Module 6 : Interprétation, empaquetage et transfert
Importance par permutation et dépendance partielle correctement interprétées
Valeurs SHAP pour les prédictions individuelles et leurs limites de communication
Sauvegarde avec joblib, versions figées et métadonnées d'entraînement
Surveiller la dérive et définir le déclencheur de réentraînement avant la mise en service
Supports fournis
- Manuel de formation, exemples de code commentés et notes de référence
- Environnement de laboratoire et dépôts de démarrage
- Exercices, check-lists et modèles de code réutilisables
- Certificat de participation 4D
- Accompagnement technique après la formation
Options de formation
Les programmes peuvent être organisés en entreprise, en ligne ou dans un format hybride selon le calendrier, la localisation et les objectifs de vos équipes. Lorsqu'un certificat ou un examen externe est inclus, les règles et frais de certification restent soumis aux politiques de l'organisme certificateur, tandis que 4D assure la formation et l'accompagnement à la préparation.
Pourquoi choisir 4D
4D structure ce programme autour de l'un de vos cas d'usage candidats : attrition, décision de crédit, prévision de la demande ou prédiction de panne. Les formateurs auditent d'abord le jeu historique pour détecter fuites et défauts d'étiquetage, construisent ensuite le pipeline avec vos analystes et valident le seuil opérationnel avec le responsable métier qui exploitera le résultat, afin que le modèle reparte avec une règle de décision défendable.
Formations liées
Fondamentaux de la programmation Python
Une introduction pratique à Python pour les ingénieurs et analystes qui ont besoin de code opérationnel plutôt que d'extraits de tutoriel. Les participants acquièrent de l'aisance avec les types, les collections, les fonctions, les fichiers et la gestion des erreurs, puis construisent un programme complet.
View coursePython intermédiaire et pratiques de code propre
Conçue pour les développeurs dont le code Python fonctionne mais résiste au changement. Le programme couvre dataclasses, générateurs, décorateurs, gestionnaires de contexte et annotations de types, puis applique les refactorings qui transforment un module interminable en unités testées contrôlées par black, ruff et mypy.
View courseAutomatisation et scripting Python pour les tâches métier
Destinée aux équipes qui perdent chaque semaine des heures en manipulations de fichiers, de tableurs et de rapports. Les participants automatisent ces tâches avec Python : traitement de fichiers en lot, Excel et CSV, appels d'API REST, alertes par e-mail et tâches planifiées qui signalent clairement toute défaillance.
View course