Vers le self-serve analytics : un an de transformation data chez leboncoin
Speaker
Description
Talk conférence — Forward Data Conference
Thème : Data Foundations for Humans & AI › AI-Ready Data
Titre
"On a migré vers Databricks. Voilà ce qu'on a vraiment appris."
Pitch / Description
Leboncoin, 60 personnes data, 27M d'utilisateurs, 300+ dashboards Tableau. En 2024 on prend une décision : migrer de Redshift/Athena vers Databricks, déployer Unity Catalog, documenter nos domaines dans Coalesce, et rendre les équipes métier autonomes. Le genre de chantier qui fait de belles slides.
Un an plus tard, on est au milieu du gué. La stack avance. Ce qu'on a vraiment appris, c'est que le problème technique était le plus simple.
Ce talk couvre ce qu'on a fait concrètement — migration incrémentale, semantic layer, data products, pilote Real Estate bout en bout — et surtout ce que ça a révélé : des tables sans owner depuis 5 ans, 4 définitions différentes du même KPI, des DA qui veulent l'autonomie mais pas la responsabilité. Et pourquoi tout ça, si on le règle vraiment, est aussi la seule fondation sur laquelle on pourra poser des agents IA sans que ça parte en vrille.
Retour terrain des équipes direct avec des learnings
Agenda (25 minutes)
1. Le constat — 3 min
- 60 personnes data, goulot d'étranglement, BA hors équipes Data
- La stack legacy (Redshift/Athena/Glue) : le symptôme visible
- Le vrai problème : 4 définitions de "lead", des pipelines sans producteur, une gouvernance inexistante
- La décision : ne pas patcher, transformer — et créer une taskforce dédiée pour ne pas noyer le chantier dans le BAU
2. Ce qu'on a construit — 8 min
La migration stack
- Databricks + Unity Catalog : pourquoi ce choix, ce que ça change sur la gouvernance et l'accès
- Coalesce : documenter les domaines métier, aligner les définitions — pas sexy, indispensable
- Migration incrémentale plutôt que big bang : ce que ça coûte en durée, ce que ça évite en risque
Le semantic layer en pratique
- Data Stewards par domaine : qui, comment, pourquoi c'est plus dur que de choisir un outil
Le pilote Real Estate
- Premier domaine bout en bout : tables migrées, Coalesce documenté, DA autonomes sur Databricks
- Ce qu'on a livré, ce qu'on n'a pas livré, ce qu'on a raté
3. Ce qui est vraiment difficile — 8 min
La dette d'ownership
- Migrer une table : 2 jours. Trouver qui en est responsable : 2 semaines.
- Tables héritées, pipelines orphelins, producteurs qui ont quitté la boîte
- Les équipes métier veulent l'autonomie — pas la responsabilité du data product
Le gap de compétences
- Des DA formés sur Tableau ne deviennent pas autonomes sur Databricks en 2 sprints
- Ce qu'on a mis en place : Data Literacy, onboarding par verticale, rôles explicites
- Ce qu'on ne sait pas encore mesurer
La gouvernance contre le rythme
- Mettre en place des fondations solides pendant que tout le monde veut livrer vite
- Comment le pilote RE a forcé les arbitrages qu'on repoussait depuis 18 mois
4. Pourquoi ça compte aussi pour les agents — 3 min
- Ce qu'on vise en Q4 : des Business Users qui génèrent des insights via agents IA
- Ce qu'on a appris : un agent s'appuie sur les mêmes fondations qu'un analyste — ownership clair, définitions stables, accès gouverné. Sauf qu'il ne tolère pas l'ambiguïté.
- Le lien direct : Unity Catalog comme couche d'accès, KPIs unifiés, data products avec owner — c'est le même travail, pas un projet IA en plus
- Ce qui manque encore : honnêteté sur où on en est
5. Takeaways — 3 min
- La partie technique est la plus facile
- Un pilote bien choisi force les arbitrages qu'on repoussait — choisir le bon domaine compte
- Rendre la donnée exploitable pour des agents, c'est finir le travail qu'on aurait dû faire pour les humains
Format
- Durée : 25 min + Q&A
- Audience : Data Engineers, Analytics Engineers, Data Architects — praticiens
- Ton : Mi-parcours honnête. Ce qui marche, ce qui est dur, pas de success story.