4D Training & Consultancy

Développement logiciel

Préparation de données avec Python et pandas

Une formation pandas pratique pour les équipes qui passent plus de temps à réparer leurs données qu'à les analyser. Les participants traitent les dtypes et la mémoire, les opérations vectorisées, la sémantique des jointures, les valeurs manquantes, le remodelage et l'alignement temporel, jusqu'à un code de nettoyage réexécutable tel quel.

3 joursPrésentiel interne, en ligne ou sur mesureÉquipes corporate et groupes professionnelsNiveau: Fondamental à intermédiaire

Aperçu

Un apprentissage pratique pour le transfert en situation de travail.

Le problème vient rarement d'une fonctionnalité absente de pandas : c'est un notebook qui a fonctionné une fois et casse dès que le fichier source change. Une colonne arrive en texte au lieu d'un nombre, une jointure à gauche multiplie les lignes, une affectation chaînée modifie une copie invisible, et le total publié dérive. Cette formation reconstruit les fondations qui évitent ces quatre cas : ce que garantit réellement un Index, pourquoi le choix des dtypes conditionne justesse et mémoire, comment la validation de jointure détecte les clés dupliquées, et comment exprimer une transformation sans boucle Python. Chacun repart avec une tâche de nettoyage réécrite en script testé.

Prérequis

Syntaxe Python de base incluant fonctions, listes et dictionnaires. Aucune expérience préalable de pandas n'est requise.

Objectifs

  • Choisir les dtypes de manière délibérée pour garantir la justesse et maîtriser la mémoire.
  • Remplacer les boucles ligne à ligne et les appels apply par des opérations vectorisées.
  • Utiliser merge, join et concat avec des clés validées et un nombre de lignes prévisible.
  • Définir une stratégie de données manquantes défendable et documenter son effet sur les résultats.
  • Passer du format large au format long avec pivot, melt, stack et groupby.
  • Industrialiser un traitement de nettoyage en script paramétré avec contrôles qualité.

Public cible

  • Analystes de données passant du tableur à Python
  • Spécialistes de la business intelligence et du reporting
  • Analystes finance, planification et commerce traitant des fichiers récurrents
  • Ingénieurs data juniors construisant des routines d'ingestion et de nettoyage
  • Chercheurs et scientifiques préparant des jeux de données expérimentaux
  • Équipes opérations et qualité consolidant des données de plusieurs systèmes

Programme

Une structure claire pour le parcours d'apprentissage.

Programme

Les points du programme sont regroupés dans un seul bloc au lieu de créer un module par ligne.

Module 1 : Series, DataFrames, dtypes et mémoire

Le contrat de l'Index : alignement, doublons et réordonnancements silencieux

Comparaison des dtypes int, float, object, category et nullables sur colonnes réelles

Mesurer la mémoire avec memory_usage et la réduire par category et downcasting

Vues et copies, indexation chaînée et le piège SettingWithCopy

Module 2 : Chargement de sources désordonnées et sélection

Options de read_csv, read_excel et JSON pour encodages, séparateurs et lignes erronées

Déclarer dtype et parse_dates au chargement plutôt que corriger après coup

loc, iloc, masques booléens et query : lequel est le plus lisible et quand

Lire des fichiers plus grands que la mémoire via chunksize et sélection de colonnes

Module 3 : Nettoyage, données manquantes et correction de types

NaN, None, NaT et pd.NA : propagation dans les calculs et les comparaisons

Supprimer, remplir, propager ou interpoler : choisir selon le sens métier

Nettoyage de texte avec l'accesseur .str, extraction regex et normalisation

Détecter doublons, valeurs aberrantes et impossibles avant publication

Module 4 : Combiner des jeux de données sans perdre de lignes

Jointures inner, left, right et outer et le nombre de lignes qu'elles impliquent

L'argument validate comme garde-fou contre les explosions de clés many-to-many

indicator, suffixes et réconciliation des colonnes présentes des deux côtés

concat, merge_asof et assemblage de fichiers au schéma partiellement commun

Module 5 : Regroupement, remodelage et séries temporelles

groupby en split-apply-combine avec agg, transform et filter

pivot_table, melt, stack et unstack pour les formats large et long

DatetimeIndex, fuseaux horaires, resample et fenêtres glissantes

Fonctions de fenêtre pour cumuls, rangs et variations d'une période à l'autre

Module 6 : Du notebook au pipeline de nettoyage reproductible

Transformer les cellules de notebook en fonctions de transformation testées

Contrôles qualité par assertions sur volumes, plages et unicité des clés

Paramétrer chemins, dates et filtres pour une exécution non supervisée

Écriture en Parquet et CSV avec schémas stables et colonnes d'audit

Supports fournis

  • Manuel de formation, exemples de code commentés et notes de référence
  • Environnement de laboratoire et dépôts de démarrage
  • Exercices, check-lists et modèles de code réutilisables
  • Certificat de participation 4D
  • Accompagnement technique après la formation

Options de formation

Les programmes peuvent être organisés en entreprise, en ligne ou dans un format hybride selon le calendrier, la localisation et les objectifs de vos équipes. Lorsqu'un certificat ou un examen externe est inclus, les règles et frais de certification restent soumis aux politiques de l'organisme certificateur, tandis que 4D assure la formation et l'accompagnement à la préparation.

Pourquoi choisir 4D

4D anime cette formation sur vos propres extractions : l'export ERP aux formats de dates mélangés, le fichier mensuel dont les en-têtes changent, la jointure qui gonfle les totaux. Les formateurs profilent ces fichiers en direct, reconstruisent la logique de nettoyage en pandas avec les analystes concernés et laissent un script testé qui remplace l'étape de réparation manuelle du cycle de reporting.

Contacter 4D

Planifiez le bon parcours de formation ou de conseil pour votre équipe.

Partagez quelques détails et 4D orientera votre demande vers la formation, le conseil, l’évaluation, Phoenix ou un programme sur mesure.