Contexte
Ce projet m’a permis de renforcer mes compétences en analyse de données et de découvrir les statistiques inférentielles ainsi que les tests d’hypothèses.
Selon la nature des données (quantitatives ou qualitatives), j’ai appris à sélectionner le test statistique approprié pour valider ou invalider les hypothèses H0 et H1 à l’aide de la p-value.
Ce travail m’a également permis de mieux comprendre l’analyse statistique et de mettre en pratique ces notions à travers des exemples concrets portant sur différents types de données.
Il constitue une première étape avant d’aborder le machine learning.
Démarche
- Analyse, nettoyage et agrégation des données issues de trois sources
- Création de différents type de graphiques
- Choix des graphiques pertinents.
- Élaboration d’un support de présentation destiné à un public néophyte en analyse statistique
Outils utilisés
Python, SciPy (statistiques), Seaborn et Matplotlib (visualisation)
Compétences acquises
- Choix et application des tests statistiques : Chi², Fisher, Pearson, Spearman, ANOVA, Kruskal-Wallis, Shapiro-Wilk
- Utilisation de la courbe de lorenz
- Analyse de la distribution des données
- Sélection de graphiques adaptés selon le type de données
- Utilisation des bibliothèques SciPy.stats
- Vulgarisation des analyses de données
Exemples de visualisations
Extrait du support de présentation
Graphique de l'analyse
Graphique de l'analyse
Graphique de l'analyse
Graphique de l'analyse
Graphique de l'analyse
Graphique de l'analyse
Graphique de l'analyse
Graphique de l'analyse