Mahé Begnis Le CV

Mahé Begnis

Data scientist & GenAI engineer

Deux ans d’alternance en cabinet de conseil en intelligence artificielle, en fin de Master Data et IA. Je conçois, développe et mets en production des solutions de machine learning et d’IA générative utilisées au quotidien chez des clients industriels, du retail et de la formation.

Une même exigence partout : une référence de comparaison, une métrique, un jeu de test. Basé à Lille, mobile sur Lille et Paris.

2 ansd’alternance en conseil IA, projets menés en large autonomie
7,17 Mlignes de ventes modélisées pour la prévision de la demande
64outils métier exposés à un modèle de langage via MCP
0,996AUC sur jeu de test isolé, classification de variants

Ce que je sais faire

Les outils sont listés parce qu’ils ont servi sur un projet, pas parce qu’ils figurent dans un programme.

Machine learning

Apprentissage supervisé. LightGBM, CatBoost, XGBoost, Random Forest, régression linéaire et logistique, SVM à noyau gaussien, k plus proches voisins, scikit-learn.

Apprentissage non supervisé. k-means, DBSCAN, clustering agglomératif, analyse en composantes principales.

Séries temporelles. Prévision de la demande, modèles à deux étages pour données à excès de zéros, validation temporelle stricte, analyse d’importance des variables.

Statistiques et préparation des données

Analyse univariée et bivariée. Statistiques descriptives, analyse de corrélation, facteur d’inflation de la variance (VIF).

Tests d’hypothèses. Khi-2, test exact de Fisher, ANOVA, tests de normalité.

Valeurs manquantes et aberrantes. Mécanismes MCAR, MAR, MNAR. Détection par Isolation Forest, Tukey, DBSCAN.

Préparation. Normalisation des variables (standard, min-max, robuste) et des échantillons (Normalizer), encodage, ingénierie de variables.

Métriques. WAPE, MAE, MASE, biais de prédiction, précision, rappel, F1, AUC, score de silhouette.

IA générative, LLM et NLP

Architectures RAG. Découpage, recherche hybride, citation des sources, cloisonnement des corpus. Vertex AI Search, ChromaDB.

Agents. Agents outillés, serveurs MCP, ingénierie et évaluation de prompts, contrôle des hallucinations. Gemini, Claude, GPT, Mistral.

Traitement du langage. TF-IDF, sac de mots, Word2Vec (CBOW), Naive Bayes, NER-CRF, similarité cosinus.

Réseaux récurrents. RNN, LSTM.

Données et cloud

Langages et bases. Python (pandas, numpy), TypeScript, SQL, PostgreSQL, BigQuery.

Google Cloud. Vertex AI, Agent Builder, Cloud Run, Cloud Functions, Cloud Storage.

Écosystème Microsoft. Azure, Entra ID (inscriptions d’applications, autorisations Graph, authentification déléguée et applicative), Microsoft Graph, SharePoint.

Restitution. Looker Studio, Power BI.

Industrialisation et conformité

Mise en production. FastAPI, Docker, Kubernetes, GitLab, Playwright.

Fiabilité. Pipelines reproductibles, journalisation structurée, tests de non-régression, suivi des performances.

Protection des données. RGPD dès la conception : minimisation, pseudonymisation, purge, journal d’audit, résidence des données en Europe.

Certifié SecNumEdu (ANSSI) et atelier RGPD (CNIL).

En production chez des clients

Chaque projet a été mené du cadrage technique à la recette, en interlocuteur direct du client. Les clients sont désignés par leur secteur.

Prévision de la demande par machine learning

Distribution spécialisée, 40 magasins. Recalibrer le réapprovisionnement à partir de l’historique des ventes.

0,201
WAPE du modèle par famille sur 17 semaines de test
0,621
WAPE des commandes passées par les magasins, soit 3 fois moins précis
7,17 M
lignes de ventes, 149 semaines, 3 413 produits, 19 familles
40 / 40
magasins et 19 familles sur 19 où le gain est vérifié
  • Chaîne complète menée seul. Acquisition, nettoyage, analyse exploratoire, ingénierie de variables, entraînement, évaluation, industrialisation.
  • Modèle par famille. LightGBM, perte MAE, 43 variables (retards, moyennes glissantes, stock, flux entre séries, calendrier, promotions), 760 séries. MAE 25,5, biais -1,4 %, MASE 0,951.
  • Modèle par produit à deux étages. Classifieur d’occurrence puis régresseur conditionnel, sur un panel à 76,8 % de zéros et 63 202 séries. Couverture des ventes portée de 11,7 % à 95,7 %.
  • Étude comparative documentée de CatBoost, LightGBM et XGBoost. Découpage temporel strict, jeu de test jamais vu avant l’évaluation finale.
  • Décision de modélisation défendue auprès du client. Prédire la demande latente et non les ventes observées, après mise en évidence d’une boucle de rétroaction induite par le stock.

Outils. Python, pandas, LightGBM, CatBoost, XGBoost, scikit-learn.

Agent IA de service après-vente

Industrie de la menuiserie. Répondre aux demandes clients à partir de la documentation technique et des données de commande.

111
notices techniques PDF indexées, avec vidéos transcrites et catalogue
2
sources interrogées en parallèle : base documentaire et API ERP temps réel
  • Orchestration. Base documentaire RAG et API ERP (commandes, devis) interrogées en parallèle, croisement BigQuery entre commande, catalogue et fiche technique.
  • Réponse structurée. Synthèse de commande, diagnostic technique, sources PDF citées, liens de suivi. Chaque réponse est sourcée.
  • Intégration industrialisée des notices. Validation de schéma Pydantic, journalisation structurée, manifeste d’exécution. Mise en production sans régression.
  • Pilotage et transfert. Tableau de bord Looker Studio (satisfaction, typologie des demandes). Formation du développeur interne du client à la maintenance et à l’évolution de la solution.

Outils. Vertex AI Agent Builder, Gemini 2.5 Flash, Cloud Run, BigQuery, Cloud Storage, Python.

Serveur MCP de pilotage d’activité

Outil interne, en production. Le système d’information d’un organisme de formation certifié, piloté en langage naturel.

64
outils métier exposés au modèle de langage via le protocole MCP
14
générateurs de documents réglementaires au format Word
11
tables PostgreSQL, logique métier séparée du routage
OAuth 2.0
Resource Server (RFC 9728) adossé à Keycloak
  • Périmètre. Clients, sessions, inscriptions, boîte mail, indicateurs de conformité Qualiopi, en remplacement d’une gestion manuelle.
  • Documents. Contrats, convocations, attestations, feuilles de présence et certificats de réalisation produits directement au format Word.
  • Architecture. Couches séparant le routage de la logique métier. Migration du transport STDIO vers HTTP Streamable sans modifier la logique.
  • Sécurité. Jeton à comparaison en temps constant, puis Resource Server OAuth 2.0 adossé à Keycloak.
  • Production. Kubernetes, image Docker multi-étages non privilégiée, base PostgreSQL managée, TLS automatisé, audit d’image sans secret embarqué.

Outils. TypeScript, Node.js, PostgreSQL, MCP SDK, Docker, Kubernetes, OAuth 2.0, Keycloak.

Structuration technique et gouvernance des développements

Chantier interne transverse, en cours. Donner au cabinet un socle commun de dépôts, de contrôles et de méthode.

  • Dépôt partagé. Conception, avec le second développeur de l’équipe, du dépôt GitHub de l’entreprise : organisation des dépôts, chaîne de traitement, outillage et contrôles à l’entrée (détection de secrets par gitleaks, analyse de sécurité automatisée).
  • Méthode. Instauration d’une revue de sécurité systématique à chaque lot livré, formalisation de la méthodologie data et des critères d’arbitrage des outils et frameworks.
  • Infrastructure. Deux applications déployées et maintenues en production sur le cluster Kubernetes OVH, contribution à son évolution : nœud de secours, nœud dédié à la montée en charge.

Outils. GitHub, gitleaks, Kubernetes, Docker.

Autres réalisations

Projets de recherche

Deux travaux de Master 1, publiés en entier sur GitHub : données, code, décisions et résultats.

Classification de variants génétiques

Données ClinVar. Deux questions sur un même jeu : ce variant est-il pathogène, et les laboratoires seront-ils d’accord entre eux.

0,9962
AUC en pathogénicité, XGBoost, jeu de test isolé de 5 710 variants
3,9 %
de variants pathogènes manqués, 44 sur 1 124
0,795
AUC en conflictualité, un problème au signal 25 fois plus faible
8
modèles comparés, validation croisée stratifiée à 5 plis
  • Données. Deux sources ClinVar croisées : le jeu Kaggle pour les annotations génomiques, le variant_summary du NCBI pour les labels cliniques. 96 % de correspondance. 28 546 variants à label fiable pour la pathogénicité, 65 188 pour la conflictualité.
  • Valeurs manquantes non imputées. Mécanisme MNAR identifié : l’absence de score SIFT pour les variants non missense est une information, pas un manque. Les modèles à base d’arbres la traitent nativement.
  • Protocole. 8 modèles, de la régression logistique aux gradient boosting, évalués par validation croisée stratifiée. Jeu de test touché une seule fois, à la fin.
  • Test de DeLong. Supériorité des gradient boosting sur la régression logistique, p inférieur à 0,0001.
  • Variable créée. af_disagreement, écart-type de la fréquence allélique entre trois bases populationnelles. Première variable pour prédire les désaccords entre laboratoires.
  • Profil d’erreur choisi. Plus de faux positifs que de faux négatifs : sur-investiguer plutôt que manquer un variant pathogène.

Outils. Python, XGBoost, LightGBM, CatBoost, scikit-learn.

Revue systématique PRISMA 2020

Jumeaux numériques pour l’optimisation énergétique des bâtiments intelligents, 2015 à 2025. Travail à cinq auteurs.

29
pages au format IEEE, 52 références
7
scripts Python, une décision tracée en CSV à chaque étape
  • 704
    références brutes : Scopus 343, Web of Science 150, Springer 144, IEEE 67
  • 548
    après déduplication sur DOI puis titre et année
  • 167
    après présélection sur titre et résumé assistée par LLM, validée par les cinq auteurs
  • 130
    après application de quatre critères cumulatifs
  • 51
    textes intégraux lus, le reste étant inaccessible
  • 45
    études incluses dans la synthèse, cartographiées sur 80 motifs techniques

Publication. Licence CC BY 4.0, fichier de citation, article et pipeline dans le dépôt.

Parcours

Expérience

  • Six and See, LilleDéveloppeur IA et data scientist en alternance. Cabinet de conseil en IA et data. Projets clients menés en large autonomie, du cadrage technique à la recette, en interlocuteur direct du client.
  • Observatoire de la Cybersécurité de l’Océan IndienStage, mai à juillet. Contribution à une plateforme d’alerting : API Shodan et Censys, PostgreSQL, visualisation temps réel, capteurs IoT. Intervenant à une conférence sur la sécurité et l’éthique de l’IA devant des DPO et RSSI.
  • Groupe Les FlamboyantsStage, décembre à janvier. Déploiement d’une solution de détection et réponse sur postes en milieu hospitalier.

Formation

  • Master Informatique, parcours Data et Intelligence ArtificielleÉcole du Numérique, FGES, Université Catholique de Lille. Modélisation statistique, machine learning, deep learning, NLP, acquisition et nettoyage des données, analyse prédictive.
  • Cycle ingénieur informatique, ESIROILa Réunion. Deuxième année de cycle préparatoire intégré puis première année du cycle ingénieur. Réorientation vers une spécialisation Data et IA en alternance.
  • Prépa des INPPremière année de cycle préparatoire.
  • Certifications et distinctionsSecNumEdu (ANSSI), atelier RGPD (CNIL). Première place nationale à la Nuit de l’Informatique, défi Ubisoft. Anglais courant, certification CLES B2.

Écrivez-moi, je réponds