Contexte
À partir d’un jeu de données contenant les caractéristiques de billets (vrais ou faux), mais incomplet, l’objectif était d’identifier les valeurs manquantes à l’aide d’une régression linéaire.
Une fois les données complétées, plusieurs modèles ont été entraînés et évalués à l’aide d’une cross‑validation :
- Regression Logistique
- K-Means
- KNN
- Random Forest
Enfin, un jeu de test a permis de vérifier la robustesse des conclusions obtenues.
Démarche
- Préparation des données sous Jupyter Notebook
- Régression linéaire pour compléter les valeurs manquantes
- Entraînement des modèles
- Test des modèles
- Mise en place d'une régression logistique pour identifier les vrais et faux billets
- Évaluation des performances via matrice de confusion
- Test sur un nouveau jeu de données
- Evaluation finale des résultats
Outils utilisés
Python, bibliothèque Scikit-learn.
Compétences acquises
- Principe et modèles du machine learning.
- utilisation des bibliothèques de scikit-learn.
- Mise en place d'une cross validation.
- Test et comparaisond des différents modèles.
Exemples de visualisations
Extrait du support de présentation
Extrait du support de présentation "matrice de corrélation"
Extrait du support de présentation "Régression logistique"
Extrait du support de présentation "résultat de prédiction"
Extrait du support de présentation "Méthode silhouette"