...
  1. Accueil
  2. Nos formations
  3. Data
  4. Machine Learning avec Python : préparer ses données, entraîner et évaluer un modèle

Machine Learning avec Python : préparer ses données, entraîner et évaluer un modèle

Construire un premier modèle prédictif de bout en bout et savoir dire s'il est réellement fiable

  • Certifié Qualiopi
  • 1 jour — 7 h
  • Présentiel ou à distance
  • Perfectionnement
  • Finançable OPCO

Passer de l'analyse descriptive à la prédiction bute souvent sur les mêmes obstacles : des données mal préparées, un modèle entraîné et testé sur les mêmes lignes, une exactitude flatteuse sur une variable cible déséquilibrée et aucune idée de ce que le modèle a réellement appris. Le code fonctionne mais la prédiction ne tient pas en production.

Cette journée de sept heures déroule la chaîne complète sur un jeu de données réel avec Python et scikit-learn : préparation des variables séparation des échantillons entraînement de modèles de classification et de régression puis évaluation argumentée. Chaque participant produit un carnet de code réutilisable.

Objectifs pédagogiques

  • Préparer un jeu de données pour l'apprentissage supervisé
  • Séparer les échantillons d'entraînement et de test et justifier ce découpage
  • Entraîner un modèle de classification et un modèle de régression avec scikit-learn
  • Choisir les métriques d'évaluation adaptées au problème traité
  • Diagnostiquer le sur-apprentissage et ajuster les paramètres du modèle
  • Présenter les résultats et les limites du modèle à un interlocuteur non technique

Programme de la formation

Avant la formation

Analyse du besoin et test de positionnement. Vos réponses sont partagées avec votre formateur afin d'adapter la formation à votre niveau et votre contexte professionnel.

Le modèle ne rattrape jamais des données mal préparées

  • Formuler le problème en classification ou en régression
  • Traiter les valeurs manquantes et les valeurs aberrantes
  • Encoder les variables catégorielles et mettre les variables à l'échelle
  • Séparer entraînement et test sans fuite d'information
  • Constituer une base de référence simple servant de point de comparaison
Atelier : Les participants préparent un jeu de données brut jusqu'à obtenir une matrice prête pour l'apprentissage.

Des algorithmes simples avant les modèles complexes

  • Entraîner une régression linéaire et une régression logistique
  • Utiliser un arbre de décision et une forêt aléatoire
  • Comprendre l'effet des principaux hyperparamètres
  • Structurer le traitement dans un enchaînement reproductible
  • Comparer les modèles sur un même découpage
Cas pratique : Entraînement de trois modèles sur le même jeu de données puis comparaison de leurs performances sur l'échantillon de test.

Savoir ce que vaut réellement sa prédiction

  • Choisir entre exactitude précision rappel et erreur quadratique selon l'objectif
  • Lire une matrice de confusion et une courbe de performance
  • Utiliser la validation croisée pour stabiliser l'évaluation
  • Repérer le sur-apprentissage et y remédier
  • Expliquer les variables influentes et les limites du modèle
Mise en situation : Chaque participant présente son modèle en cinq minutes à un commanditaire qui conteste la fiabilité des prédictions.

Après la formation

E-learning accessible en illimité dans le temps. Évaluation de niveau afin de suivre votre progression.

Les points forts

Le fil conducteur est un jeu de données réel traité de la préparation à l'évaluation
Le piège de l'exactitude sur données déséquilibrées est démontré en direct sur le code
Chaque participant repart avec un carnet Python commenté qu'il peut adapter à ses propres données

Les avis de nos apprenants

Prochaines sessions

1 jour — 7 h Réf. MPF-DAT-0014 Entrées permanentes À partir de 980 € HT
2 déc. 2026
Paris — Présentiel
8 déc. 2026
À distance — Classe virtuelle
2 févr. 2027
À distance — Classe virtuelle
2 févr. 2027
Paris — Présentiel
6 avr. 2027
À distance — Classe virtuelle
6 avr. 2027
Paris — Présentiel
1 juin 2027
À distance — Classe virtuelle
1 juin 2027
Paris — Présentiel
3 août 2027
À distance — Classe virtuelle
3 août 2027
Paris — Présentiel
5 oct. 2027
À distance — Classe virtuelle
5 oct. 2027
Paris — Présentiel
7 déc. 2027
À distance — Classe virtuelle
7 déc. 2027
Paris — Présentiel
Date à définir ensemble
Dans vos locaux — jusqu'à 10 collaborateurs
Tarif dégressif en inter-entreprises : −10 % dès 2 participants, −15 % dès 3, −20 % à partir de 4 inscrits sur la même session.
Sessions garanties : ces dates sont confirmées par Mon Pôle Formation. Elles ne sont ni annulées ni reportées, sauf cas de force majeure.

À qui s'adresse cette formation ?

Analystes de données statisticiens développeurs et contrôleurs de gestion souhaitant construire leurs premiers modèles prédictifs.

Prérequis
Savoir écrire un script Python et manipuler un tableau de données avec pandas
Durée
1 jour — 7 h
Format
Présentiel ou à distance
Modalités et délais d'accès
Inscription en ligne, par téléphone, par devis ou via votre OPCO. 11 jours ouvrés après validation du financement.
Certification
Non certifiante Attestation de fin de formation et certificat de réalisation remis à chaque participant.
Modalités d'évaluation
QCM et mises en situation. Évaluation des acquis en début et en fin de parcours, évaluation à chaud et à froid à 60 jours.
Méthodes mobilisées
Apports théoriques, ateliers et cas pratiques. Support de cours numérique et fiches méthodes fournis.
Accessibilité
Accessible aux personnes en situation de handicap. Contactez notre référent handicap pour construire une solution adaptée : contact@monpoleformation.fr

Financer cette formation

Mon Pôle Formation est un organisme certifié Qualiopi au titre des actions de formation. À ce titre, cette formation est éligible aux principaux dispositifs de financement de la formation professionnelle.

Le plan de développement des compétences regroupe l'ensemble des actions de formation décidées par l'employeur. Votre OPCO prend généralement en charge les coûts pédagogiques, et parfois la rémunération, les frais de transport, de repas et d'hébergement.

Tous les salariés peuvent en bénéficier, quels que soient la nature et la durée de leur contrat. Rapprochez-vous de votre service RH ou formation : nous montons le dossier avec vous.

Vous versez chaque année une Contribution à la Formation Professionnelle. Elle ouvre droit à une prise en charge par votre fonds d'assurance formation : FIFPL, AGEFICE, FAFCEA, VIVEA ou OPCO selon votre activité.

Nous préparons pour vous le devis, le programme détaillé et l'attestation nécessaires au dossier.

Selon votre projet professionnel, France Travail peut financer tout ou partie de la formation via l'Aide Individuelle à la Formation. Le dossier se construit avec votre conseiller à partir de notre devis.

Vous pouvez régler la formation directement, en une fois ou jusqu'à 6 fois sans frais. Contactez un conseiller pour définir l'échéancier : 01 87 66 57 66.

Questions fréquentes

Le parcours traite l'apprentissage supervisé classique, classification et régression, avec scikit-learn en Python. Les réseaux de neurones profonds ne sont pas abordés : l'objectif est de construire, évaluer et expliquer un premier modèle fiable sur des données tabulaires d'entreprise.

Le sur-apprentissage se diagnostique par l'écart entre les performances sur l'échantillon d'entraînement et sur l'échantillon de test, travaillé ici sur des cas où l'écart est manifeste. Vous apprenez ensuite à ajuster les paramètres du modèle et à justifier le découpage des échantillons retenu.

Une partie du parcours porte sur la présentation : ce que la métrique choisie mesure réellement, les cas où le modèle se trompe et ce que la prédiction n'autorise pas à conclure. Savoir écrire du Python et manipuler un jeu de données tabulaire reste le prérequis pour suivre les travaux.

dès 980 €HT / participant
Demander un devis