TL.

Impact · R&D appliquée · Production ML

Des travaux menés
dans des contextes réels.

4 études de cas · Français / English

Quatre études de cas professionnelles relient recherche comportementale, évaluation de modèles, architecture ML et décision produit.

Les descriptions sont volontairement centrées sur les méthodes, décisions et apprentissages transférables. Aucune donnée client ni information confidentielle n’est exposée.
4études de cas consolidées
>1Mobservations comportementales agrégées
Offline → Prodde l’évaluation au système
Evidence + limitspreuves et limites explicites

01 — TRAVAUX EN ENTREPRISE

Quatre parcours complets, de l’hypothèse à la décision produit.

01
Behavioral AI · Segmentation prédictive

Segmentation comportementale prédictive : savoir quand un modèle ne se généralise pas

Une étude de cas anonymisée sur le feature engineering comportemental, XGBoost, la validation temporelle et l’échec de transfert entre environnements.

XGBoostMouse trackingAblationsTemporal validation
Périmètre
Modélisation comportementale
Résultat
AUC agrégée de 0,70 à 0,77 selon les comportements ; transfert inter-domaines insuffisant, conduisant à une stratégie adaptée par environnement.
02
Multimodal AI · Search & Recommendation

Du benchmark CLIP à une plateforme multimodale en production

Une étude de cas consolidée sur la sélection de modèles, le retrieval vectoriel, le serving et l’industrialisation d’un pipeline texte-image aujourd’hui en production.

CLIPClickHouseHNSWFastAPIKubernetes
Périmètre
Retrieval multimodal
Résultat
Modèles sélectionnés par tâche, pipeline incrémental texte-image désormais en production, avec monitoring et tests de charge.
03
Behavioral AI · Learning-to-rank

Personnaliser la recherche produit par les affinités comportementales

Une étude de cas anonymisée sur les signaux utilisateur-produit, LambdaMART, la validation temporelle et les limites de l’évaluation hors ligne.

LambdaMARTXGBoostNDCGTemporal split
Périmètre
Personnalisation du ranking
Résultat
Les affinités surpassent le contexte seul sur NDCG, Hit Rate et MRR hors ligne ; l’uplift online reste à mesurer.
04
Generative AI · Quantitative UX

Évaluer un modèle vision-langage face à des jugements UX humains

Une expérimentation sur 100 sites e-commerce et 600 évaluations comparant GPT-4.1 mini à un benchmark humain public sur six dimensions de perception du design.

GPT-4.1 miniVision-language modelParquetPearsonSpearman
Périmètre
Évaluation UX multimodale
Résultat
600 évaluations sur 100 sites ; Pearson global de 0,416, avec un biais positif qui impose une calibration avant usage produit.

Collaborer

Un problème produit mérite une méthode mesurable.

Je travaille sur les signaux comportementaux, la recherche, la recommandation et les systèmes d’IA appliqués à l’expérience utilisateur.

Échanger sur un besoin