Ce dossier presente les stacks data de 6 entreprises tech a des stades différents. Migration post-Covid, plateforme data centralisee, industrialisation de deep learning, stack analytics, reconciliation post-acquisition. Des architectures concretes documentees par les équipes qui les ont construites.
1. Les contributeurs
Orianne Friedrich
VP Data @ Voyage Prive
Quentin Gallet
Big Data Engineer @ Voyage Prive
Stephane Knockaert
BI Lead @ Voyage Prive
Mickael Fine
Data PM @ TheFork
Julien Boyer
Head of Product @ Preligens
Marie-Fleur Sacreste
Head of Product @ Preligens
Lucas de Vries
VP Data and Operations @ Libeo
Cedric Faucheux
Head of Data Science @ Untie Nots
Wassim Almaaoui
Lead Data Engineer @ Untie Nots
Nicolas Pfeffer
Data Analyst @ Cafeyn
2. Aller simple vers la Modern Data Stack post-Covid
Voyage Prive : 1er groupe independant d'e-tourisme en Europe. 56 millions de membres. Selection de voyages et sejours haut de gamme au meilleur prix garanti.
Contexte et défi
1. Stack initiale (2016-2019)
ETL Scala sur Apache Spark (Dataproc). DSS Dataiku. Stockage GCS. Warehouse BigQuery. Dataviz Tableau.
Data Engineering
Outils : Spark, BigQuery, Tableau.
Nouvelle stack post-Covid
2. Orchestration
Google Cloud Composer (Apache Airflow manage). Solution unique, maintenue et eprouvee du marche. Remplace l'ETL interne et DSS.
Data Engineering
Outils : Cloud Composer, Airflow.
3. Collecte de données
Airbyte pour les APIs tierces. DAG Airflow pour les collectes simples. Maxwell CDC pour les collectes MySQL avec contraintes fortes.
Data Engineering
Outils : Airbyte, Maxwell CDC.
4. Transformation
dbt pour toute étape de transformation. Depuis la couche raw data jusqu'a l'exposition business, en passant par le lake et le warehouse.
Analytics Engineering
Outils : dbt.
5. CI/CD
Terraform couple a GitLab pour les bonnes pratiques CI/CD. Qualite des developpements et automatisation du cycle de vie de l'architecture.
DevOps
Outils : Terraform, GitLab.
Outils recommandés : Cloud Composer, Airflow, Airbyte, Maxwell CDC, dbt, BigQuery, Tableau, Terraform, GCS.
3. La Data Plateforme
TheFork : cofondee en 2007. Plateforme de reservation de restaurants. 60 000 restaurants. 12 pays. 20 millions de visites mensuelles. Integree au groupe TripAdvisor depuis 2014.
Organisation de l'équipe Data
1. Data Platform v1 (2016)
AWS (S3, EC2, Spark, EMR) pour le stockage et processing. Airflow pour l'orchestration. Impala pour le DataWarehouse. Rancher pour la gestion des containers.
Data Engineering
Outils : AWS, Spark, Airflow, Impala.
1. Architecture Datalake
Architecture pour centraliser la donnee. Capacites et performances pour analystes, data scientists et équipes BI. Bonne architecture pour industrialiser des dashboards de pilotage.
Migration vers Snowflake
2. Data Platform v2
Migration vers Snowflake. Data Platform centralisee supportant cas d'usages analytiques et operationnels. Équipe composee de data engineers, data ops, product owner et product manager.
Data Engineering
Outils : Snowflake, Airflow.
Outils recommandés : Snowflake, Airflow, AWS, S3, Spark, Impala, Rancher.
4. Industrialisation du process de création de dataset pour du deep learning
Preligens : créée en 2016. Intelligence artificielle pour automatiser l'analyse de données multi-sources. Clients dans le renseignement et la defense.
Contexte produit
1. Detecteurs deep learning
Construction d'algorithmes de deep learning : selection de données, annotation, entrainement, evaluation. La qualité du dataset determine la performance du modele.
Data Science
Outils : Deep Learning, Computer Vision.
Outil de gestion de la donnee
2. Motivations
Rendre les data scientists plus efficaces. Centraliser la gestion des datasets. Tracer la provenance des données. Industrialiser le process de création de datasets.
Product
Outils : Data Management.
3. Mise en oeuvre
Outil interne de gestion de la donnee. Interface pour explorer, selectionner et assembler les datasets. Versioning des datasets. Reproductibilite des expériences.
Engineering
Outils : Python, PostgreSQL.
1. Impact produit
Le process industrialise de création de dataset a eu un fort impact sur le produit IMINT. Gain de temps pour plus de tests et comparaisons lors d'une même release. Gain de performance des modeles.
Outils recommandés : Deep Learning, Computer Vision, Python, PostgreSQL, Data Management.
5. Stack Data et Analytics
Libeo : leader du paiement entre PME en France et en Europe. Paiement de factures fournisseurs et facturation clients en un clic.
Construction de l'équipe Data (2020)
"Nous avions mene une expérience en demandant a toutes les personnes chez Libeo la definition d'un utilisateur actif pour illustrer l'importance d'une source unique de verite."
Vision et missions
1. Provide intelligence
Reporting, analyses et experimentation pour toutes les équipes. Rendre l'entreprise data-driven.
2. Build great data products
Data stack, outils internes, features data dans le produit. Approche Buy over Build.
Stack technique
1. Sources de données
3 categories : bases de données produit, outils métiers (Salesforce, Zendesk, Intercom, Google Ads), tracking (Segment).
Data Engineering
Outils : Segment, Salesforce.
2. Ingestion
Fivetran (95%) et connecteurs custom (5%). Migration depuis Stitch pour la qualité des schemas et la flexibilite des connecteurs.
Data Engineering
Outils : Fivetran.
3. Warehouse et transformation
BigQuery pour le warehouse. dbt pour la transformation. Approche favorisant le standard et le Buy over Build.
Analytics Engineering
Outils : BigQuery, dbt.
4. Visualisation et activation
Metabase pour les dashboards. Census pour le reverse ETL. Donnees poussees dans les outils métiers.
Analytics
Outils : Metabase, Census.
Outils recommandés : Segment, Fivetran, BigQuery, dbt, Metabase, Census, Salesforce.
6. Modernisation de la Stack Data en 4 temps
Untie Nots : solution de fidelisation pour distributeurs alimentaires (Auchan, Carrefour, Leclerc). Intelligence artificielle et gamification pour des offres personnalisees.
Contexte data
Evolution en 4 episodes
1. Episode 1 (2017) : Data Lake Hadoop
Stack Hadoop sur GCP. Choix motive par la communauté, la hype Big Data et la preference open-source. Lecon : bien qualifier son besoin avant de choisir la stack.
Data Engineering
Outils : Hadoop, GCP.
2. Episode 2 (2020) : Delta-Lake
Migration vers Delta-Lake. Meilleure gestion des données transactionnelles. Support ACID. Performance amelioree sur les workloads mixtes.
Data Engineering
Outils : Delta Lake, Spark.
3. Episode 3 (2020) : Analytics avec BigQuery et Looker
Ajout de capacités analytics. Plus de souplesse dans le reporting. Augmentation des capacités d'analyse. Entreprise plus data-driven.
Analytics
Outils : BigQuery, Looker.
4. Episode 4 (2021) : From DataLake to LakeHouse
Migration vers CloudSQL (PostgreSQL manage). Aboutissement du processus de simplification. Consolidation des besoins Cassandra, MySQL et Elasticsearch.
Data Engineering
Outils : CloudSQL, PostgreSQL.
1. Lecon cle
Se concentrer sur les besoins actuels. Le futur est incertain. Partir sur une solution inadaptee par anticipation revient a partir sur une solution inadaptee.
Outils recommandés : Hadoop, GCP, Delta Lake, Spark, BigQuery, Looker, CloudSQL, PostgreSQL.
7. Reconcilier les stacks de 3 structures après des acquisitions
Cafeyn : plus de 15 ans d'existence. Groupe multimarques (Cafeyn, Blendle, miLibris, Kidjo). Bureaux en France, Pays-Bas, Royaume-Uni, Canada et Maroc. 200 employes.
Defi post-acquisition
Stack Cafeyn
1. ETL et orchestration
Airflow pour l'orchestration. Snowflake comme Data Lake centralise.
Data Engineering
Outils : Airflow, Snowflake.
2. Tracking et data hub
Segment pour le tracking front-end et le data hub. Donnees deverses dans le warehouse et directement dans les outils métiers.
Data Engineering
Outils : Segment.
3. Visualisation
Amplitude pour les équipes produit, marketing et CRM. Analyse de fonctionnalités, analyse d'audience, création de cohortes. Tableau pour les dashboards finances et business.
Analytics
Outils : Amplitude, Tableau.
4. AB Testing
Outil interne pour les tests A/B. Integration avec le tracking Segment.
Product
Outils : A/B Testing.
"Aucune valeur absolue a sortir d'Amplitude. Nous l'utilisons pour les tendances, valeurs relatives et taux de conversion."
Stack Blendle (avant reconciliation)
1. Reconciliation
Definir quelles données doivent etre deversees dans chaque outil. Ne pas multiplier les sources d'information. Objectif : une source unique de verite pour le groupe Cafeyn.
Outils recommandés : Airflow, Snowflake, Segment, Amplitude, Tableau, BigQuery, Looker.