01 — Problème produit
Produire un signal utile avant que l’intention soit directement observable.
Le système devait exploiter une fenêtre courte en début de session. À ce moment, la conversion ou l’action finale n’existe pas encore ; seuls des micro-comportements et quelques éléments de contexte sont disponibles. Le défi consiste à résumer cette séquence sans lui attribuer une signification psychologique excessive.
Le protocole a porté sur plus d’un million d’observations comportementales filtrées. Les cibles restaient déséquilibrées et dépendantes du parcours, ce qui imposait de séparer soigneusement la fenêtre utilisée pour calculer les variables de la fenêtre servant à définir le résultat.
02 — Research → features
Les trajectoires deviennent des variables testables par familles.
J’ai relié les travaux sur le mouse-tracking à des familles de caractéristiques interprétables : dynamique de trajectoire, pauses, corrections, spatialité, clics et défilement. Ces variables ont été comparées aux historiques comportementaux et aux signaux de configuration disponibles.
Les ablations ont permis de mesurer la contribution de chaque famille sans confondre richesse du modèle et validité du signal. La normalisation spatiale et la distinction entre appareils limitaient notamment la dépendance aux dimensions d’écran et à la géométrie des composants.
03 — Évaluation
Performance moyenne, stabilité temporelle et transfert répondent à trois questions différentes.
La validation croisée stratifiée estimait la capacité de séparation sur une distribution donnée. Des découpages temporels testaient ensuite la stabilité lorsque l’entraînement et l’évaluation provenaient de périodes différentes. Selon les comportements étudiés, les aires sous la courbe ROC agrégées se situaient approximativement entre 0,70 et 0,77.
Le test le plus déterminant consistait à entraîner dans un environnement et à évaluer dans un autre. La performance chutait fortement : certaines positions ou séquences apprises décrivaient aussi le layout, le trafic et les règles propres au domaine. Cette dépendance aurait été invisible dans une validation uniquement aléatoire.
04 — Décision
L’échec de transfert a redéfini la stratégie produit.
Le résultat a écarté l’idée d’un modèle universel immédiatement déployable. La recommandation privilégiait des modèles adaptés par environnement, une calibration locale, des seuils explicites et un monitoring de la dérive plutôt qu’un score global supposé stable.
La suite logique comprend la précision-rappel pour les classes rares, la calibration, la mesure de l’uplift dans une expérimentation contrôlée et l’analyse des erreurs par appareil. L’étude fournit donc une décision de périmètre et un protocole de passage vers l’activation, sans présenter la performance hors ligne comme un impact business déjà démontré.