Développement logiciel
Préparation de données avec Python et pandas
Une formation pandas pratique pour les équipes qui passent plus de temps à réparer leurs données qu'à les analyser. Les participants traitent les dtypes et la mémoire, les opérations vectorisées, la sémantique des jointures, les valeurs manquantes, le remodelage et l'alignement temporel, jusqu'à un code de nettoyage réexécutable tel quel.
Aperçu
Un apprentissage pratique pour le transfert en situation de travail.
Le problème vient rarement d'une fonctionnalité absente de pandas : c'est un notebook qui a fonctionné une fois et casse dès que le fichier source change. Une colonne arrive en texte au lieu d'un nombre, une jointure à gauche multiplie les lignes, une affectation chaînée modifie une copie invisible, et le total publié dérive. Cette formation reconstruit les fondations qui évitent ces quatre cas : ce que garantit réellement un Index, pourquoi le choix des dtypes conditionne justesse et mémoire, comment la validation de jointure détecte les clés dupliquées, et comment exprimer une transformation sans boucle Python. Chacun repart avec une tâche de nettoyage réécrite en script testé.
Prérequis
Syntaxe Python de base incluant fonctions, listes et dictionnaires. Aucune expérience préalable de pandas n'est requise.
Objectifs
- Choisir les dtypes de manière délibérée pour garantir la justesse et maîtriser la mémoire.
- Remplacer les boucles ligne à ligne et les appels apply par des opérations vectorisées.
- Utiliser merge, join et concat avec des clés validées et un nombre de lignes prévisible.
- Définir une stratégie de données manquantes défendable et documenter son effet sur les résultats.
- Passer du format large au format long avec pivot, melt, stack et groupby.
- Industrialiser un traitement de nettoyage en script paramétré avec contrôles qualité.
Public cible
- Analystes de données passant du tableur à Python
- Spécialistes de la business intelligence et du reporting
- Analystes finance, planification et commerce traitant des fichiers récurrents
- Ingénieurs data juniors construisant des routines d'ingestion et de nettoyage
- Chercheurs et scientifiques préparant des jeux de données expérimentaux
- Équipes opérations et qualité consolidant des données de plusieurs systèmes
Programme
Une structure claire pour le parcours d'apprentissage.
Programme
Les points du programme sont regroupés dans un seul bloc au lieu de créer un module par ligne.
Module 1 : Series, DataFrames, dtypes et mémoire
Le contrat de l'Index : alignement, doublons et réordonnancements silencieux
Comparaison des dtypes int, float, object, category et nullables sur colonnes réelles
Mesurer la mémoire avec memory_usage et la réduire par category et downcasting
Vues et copies, indexation chaînée et le piège SettingWithCopy
Module 2 : Chargement de sources désordonnées et sélection
Options de read_csv, read_excel et JSON pour encodages, séparateurs et lignes erronées
Déclarer dtype et parse_dates au chargement plutôt que corriger après coup
loc, iloc, masques booléens et query : lequel est le plus lisible et quand
Lire des fichiers plus grands que la mémoire via chunksize et sélection de colonnes
Module 3 : Nettoyage, données manquantes et correction de types
NaN, None, NaT et pd.NA : propagation dans les calculs et les comparaisons
Supprimer, remplir, propager ou interpoler : choisir selon le sens métier
Nettoyage de texte avec l'accesseur .str, extraction regex et normalisation
Détecter doublons, valeurs aberrantes et impossibles avant publication
Module 4 : Combiner des jeux de données sans perdre de lignes
Jointures inner, left, right et outer et le nombre de lignes qu'elles impliquent
L'argument validate comme garde-fou contre les explosions de clés many-to-many
indicator, suffixes et réconciliation des colonnes présentes des deux côtés
concat, merge_asof et assemblage de fichiers au schéma partiellement commun
Module 5 : Regroupement, remodelage et séries temporelles
groupby en split-apply-combine avec agg, transform et filter
pivot_table, melt, stack et unstack pour les formats large et long
DatetimeIndex, fuseaux horaires, resample et fenêtres glissantes
Fonctions de fenêtre pour cumuls, rangs et variations d'une période à l'autre
Module 6 : Du notebook au pipeline de nettoyage reproductible
Transformer les cellules de notebook en fonctions de transformation testées
Contrôles qualité par assertions sur volumes, plages et unicité des clés
Paramétrer chemins, dates et filtres pour une exécution non supervisée
Écriture en Parquet et CSV avec schémas stables et colonnes d'audit
Supports fournis
- Manuel de formation, exemples de code commentés et notes de référence
- Environnement de laboratoire et dépôts de démarrage
- Exercices, check-lists et modèles de code réutilisables
- Certificat de participation 4D
- Accompagnement technique après la formation
Options de formation
Les programmes peuvent être organisés en entreprise, en ligne ou dans un format hybride selon le calendrier, la localisation et les objectifs de vos équipes. Lorsqu'un certificat ou un examen externe est inclus, les règles et frais de certification restent soumis aux politiques de l'organisme certificateur, tandis que 4D assure la formation et l'accompagnement à la préparation.
Pourquoi choisir 4D
4D anime cette formation sur vos propres extractions : l'export ERP aux formats de dates mélangés, le fichier mensuel dont les en-têtes changent, la jointure qui gonfle les totaux. Les formateurs profilent ces fichiers en direct, reconstruisent la logique de nettoyage en pandas avec les analystes concernés et laissent un script testé qui remplace l'étape de réparation manuelle du cycle de reporting.
Formations liées
Fondamentaux de la programmation Python
Une introduction pratique à Python pour les ingénieurs et analystes qui ont besoin de code opérationnel plutôt que d'extraits de tutoriel. Les participants acquièrent de l'aisance avec les types, les collections, les fonctions, les fichiers et la gestion des erreurs, puis construisent un programme complet.
View coursePython intermédiaire et pratiques de code propre
Conçue pour les développeurs dont le code Python fonctionne mais résiste au changement. Le programme couvre dataclasses, générateurs, décorateurs, gestionnaires de contexte et annotations de types, puis applique les refactorings qui transforment un module interminable en unités testées contrôlées par black, ruff et mypy.
View courseAutomatisation et scripting Python pour les tâches métier
Destinée aux équipes qui perdent chaque semaine des heures en manipulations de fichiers, de tableurs et de rapports. Les participants automatisent ces tâches avec Python : traitement de fichiers en lot, Excel et CSV, appels d'API REST, alertes par e-mail et tâches planifiées qui signalent clairement toute défaillance.
View course