Data
Clustering from scratch — K-means et classification hiérarchique
Par Davy AGONMA — Développeur web freelance & intégrateur IA
Problème
Appeler `fit()` sur une bibliothèque ne garantit pas de comprendre ce que fait un algorithme de clustering, ni de savoir choisir le bon nombre de groupes sur un jeu de données réel.
Solution
Réimplémentation manuelle de K-means et de la classification hiérarchique, sans bibliothèque de machine learning, exposée dans une interface Streamlit : import CSV, suggestion automatique du K par la méthode du coude, dendrogramme, analyse intra et inter-cluster, et prédiction du groupe d'un point inconnu.
Résultat
Outil pédagogique interactif livré dans le cadre du module Big Data du master génie logiciel à l'IFRI.
Projets similaires
Data science & machine learning : ce que couvre ce projet
Les projets data de ce portfolio viennent de ma reconversion vers la data science : régression supervisée, clustering, systèmes de recommandation et programmation par contraintes. Ils sont réalisés en Python, avec le cycle complet — exploration, nettoyage, modélisation, évaluation.
Ils montrent ce que je sais faire aujourd'hui sur la donnée, en complément du développement web et de l'automatisation : préparer un jeu de données, choisir un modèle adapté au problème et rendre le résultat exploitable dans une interface.
Rédigé par Davy AGONMA, développeur web freelance & intégrateur ia.