TPC
    TPC
    Data

    Modern Data Stack : les stacks de 6 startups

    Comment Voyage Prive, TheFork, Preligens, Libeo, Untie Nots et Cafeyn ont construit et modernise leurs stacks data. Defis, outils et architectures concrets.

    7 min de lecture

    Avec les contributions de :

    Orianne FriedrichVP Data @ Voyage PriveQuentin GalletBig Data Engineer @ Voyage PriveStephane KnockaertBI Lead @ Voyage PriveMickael FineData PM @ TheFork, Co-Lead DataForGoodJulien BoyerHead of Product @ PreligensMarie-Fleur SacresteHead of Product @ PreligensLucas de VriesVP Data and Operations @ LibeoCedric FaucheuxHead of Data Science @ Untie NotsWassim AlmaaouiLead Data Engineer @ Untie NotsNicolas PfefferData Analyst @ Cafeyn

    Ce dossier presente les stacks data de 6 entreprises tech a des stades différents. Migration post-Covid, plateforme data centralisee, industrialisation de deep learning, stack analytics, reconciliation post-acquisition. Des architectures concretes documentees par les équipes qui les ont construites.

    2. Aller simple vers la Modern Data Stack post-Covid

    Voyage Prive : 1er groupe independant d'e-tourisme en Europe. 56 millions de membres. Selection de voyages et sejours haut de gamme au meilleur prix garanti.

    Contexte et défi

    L'équipe Data a été créée fin 2016. Pendant 3 ans, la stack s'articulait autour d'un ETL interne en Scala/Spark, DSS Dataiku pour l'analytics et la data science, GCS pour le stockage, BigQuery pour le warehouse et Tableau pour la dataviz.

    1. Stack initiale (2016-2019)

    ETL Scala sur Apache Spark (Dataproc). DSS Dataiku. Stockage GCS. Warehouse BigQuery. Dataviz Tableau.

    Data Engineering

    Outils : Spark, BigQuery, Tableau.

    Le Covid a été un coup d'arret pour le tourisme. L'équipe Data a été très fortement impactée. Il ne restait qu'une personne sur la quinzaine de l'équipe originelle. La nouvelle équipe de onze personnes a repense l'architecture.

    Nouvelle stack post-Covid

    2. Orchestration

    Google Cloud Composer (Apache Airflow manage). Solution unique, maintenue et eprouvee du marche. Remplace l'ETL interne et DSS.

    Data Engineering

    Outils : Cloud Composer, Airflow.

    3. Collecte de données

    Airbyte pour les APIs tierces. DAG Airflow pour les collectes simples. Maxwell CDC pour les collectes MySQL avec contraintes fortes.

    Data Engineering

    Outils : Airbyte, Maxwell CDC.

    4. Transformation

    dbt pour toute étape de transformation. Depuis la couche raw data jusqu'a l'exposition business, en passant par le lake et le warehouse.

    Analytics Engineering

    Outils : dbt.

    5. CI/CD

    Terraform couple a GitLab pour les bonnes pratiques CI/CD. Qualite des developpements et automatisation du cycle de vie de l'architecture.

    DevOps

    Outils : Terraform, GitLab.

    Outils recommandés : Cloud Composer, Airflow, Airbyte, Maxwell CDC, dbt, BigQuery, Tableau, Terraform, GCS.

    3. La Data Plateforme

    TheFork : cofondee en 2007. Plateforme de reservation de restaurants. 60 000 restaurants. 12 pays. 20 millions de visites mensuelles. Integree au groupe TripAdvisor depuis 2014.

    Organisation de l'équipe Data

    En 2019, une équipe data centrale a été créée sous le management d'un Chief Data Officer. Plusieurs dizaines de personnes. Reorganisee autour de domaines business (B2B et B2C), avec des centres de compétences sur Data Science, BI, Product Analytics et Data Analyse.

    1. Data Platform v1 (2016)

    AWS (S3, EC2, Spark, EMR) pour le stockage et processing. Airflow pour l'orchestration. Impala pour le DataWarehouse. Rancher pour la gestion des containers.

    Data Engineering

    Outils : AWS, Spark, Airflow, Impala.

    1. Architecture Datalake

    Architecture pour centraliser la donnee. Capacites et performances pour analystes, data scientists et équipes BI. Bonne architecture pour industrialiser des dashboards de pilotage.

    Migration vers Snowflake

    Apres un tour du marche des solutions de data warehousing, Snowflake s'est impose. La migration s'est effectuee au debut du confinement Covid. Le passage a Snowflake a apporte scalabilité et performance.

    2. Data Platform v2

    Migration vers Snowflake. Data Platform centralisee supportant cas d'usages analytiques et operationnels. Équipe composee de data engineers, data ops, product owner et product manager.

    Data Engineering

    Outils : Snowflake, Airflow.

    Outils recommandés : Snowflake, Airflow, AWS, S3, Spark, Impala, Rancher.

    4. Industrialisation du process de création de dataset pour du deep learning

    Preligens : créée en 2016. Intelligence artificielle pour automatiser l'analyse de données multi-sources. Clients dans le renseignement et la defense.

    Contexte produit

    Le produit historique (IMINT - Image Intelligence) detecte des objets d'intérêt militaire a partir d'images satellites. La performance des detecteurs est l'axe cle de differenciation. Un des piliers : la selection de la donnee (data exploration).

    1. Detecteurs deep learning

    Construction d'algorithmes de deep learning : selection de données, annotation, entrainement, evaluation. La qualité du dataset determine la performance du modele.

    Data Science

    Outils : Deep Learning, Computer Vision.

    Outil de gestion de la donnee

    2. Motivations

    Rendre les data scientists plus efficaces. Centraliser la gestion des datasets. Tracer la provenance des données. Industrialiser le process de création de datasets.

    Product

    Outils : Data Management.

    3. Mise en oeuvre

    Outil interne de gestion de la donnee. Interface pour explorer, selectionner et assembler les datasets. Versioning des datasets. Reproductibilite des expériences.

    Engineering

    Outils : Python, PostgreSQL.

    1. Impact produit

    Le process industrialise de création de dataset a eu un fort impact sur le produit IMINT. Gain de temps pour plus de tests et comparaisons lors d'une même release. Gain de performance des modeles.

    Outils recommandés : Deep Learning, Computer Vision, Python, PostgreSQL, Data Management.

    5. Stack Data et Analytics

    Libeo : leader du paiement entre PME en France et en Europe. Paiement de factures fournisseurs et facturation clients en un clic.

    Construction de l'équipe Data (2020)

    Les 2 premières personnes recrutees en novembre 2020. La croissance des équipes et l'apparition de silos ont souleve la necessite de creer cette équipe. Profils full stack et generalistes avec 2-5 ans d'expérience.

    "Nous avions mene une expérience en demandant a toutes les personnes chez Libeo la definition d'un utilisateur actif pour illustrer l'importance d'une source unique de verite."

    Lucas de Vries, VP Data @ Libeo

    Vision et missions

    1. Provide intelligence

    Reporting, analyses et experimentation pour toutes les équipes. Rendre l'entreprise data-driven.

    2. Build great data products

    Data stack, outils internes, features data dans le produit. Approche Buy over Build.

    Stack technique

    1. Sources de données

    3 categories : bases de données produit, outils métiers (Salesforce, Zendesk, Intercom, Google Ads), tracking (Segment).

    Data Engineering

    Outils : Segment, Salesforce.

    2. Ingestion

    Fivetran (95%) et connecteurs custom (5%). Migration depuis Stitch pour la qualité des schemas et la flexibilite des connecteurs.

    Data Engineering

    Outils : Fivetran.

    3. Warehouse et transformation

    BigQuery pour le warehouse. dbt pour la transformation. Approche favorisant le standard et le Buy over Build.

    Analytics Engineering

    Outils : BigQuery, dbt.

    4. Visualisation et activation

    Metabase pour les dashboards. Census pour le reverse ETL. Donnees poussees dans les outils métiers.

    Analytics

    Outils : Metabase, Census.

    Outils recommandés : Segment, Fivetran, BigQuery, dbt, Metabase, Census, Salesforce.

    6. Modernisation de la Stack Data en 4 temps

    Untie Nots : solution de fidelisation pour distributeurs alimentaires (Auchan, Carrefour, Leclerc). Intelligence artificielle et gamification pour des offres personnalisees.

    Contexte data

    La stack data est a la fois une plateforme analytics (reporting, stats, experimentation) et une plateforme opérationnelle. Chaque jour, reception de plus de la moitie des transactions en grande distribution alimentaire en France.

    Evolution en 4 episodes

    1. Episode 1 (2017) : Data Lake Hadoop

    Stack Hadoop sur GCP. Choix motive par la communauté, la hype Big Data et la preference open-source. Lecon : bien qualifier son besoin avant de choisir la stack.

    Data Engineering

    Outils : Hadoop, GCP.

    2. Episode 2 (2020) : Delta-Lake

    Migration vers Delta-Lake. Meilleure gestion des données transactionnelles. Support ACID. Performance amelioree sur les workloads mixtes.

    Data Engineering

    Outils : Delta Lake, Spark.

    3. Episode 3 (2020) : Analytics avec BigQuery et Looker

    Ajout de capacités analytics. Plus de souplesse dans le reporting. Augmentation des capacités d'analyse. Entreprise plus data-driven.

    Analytics

    Outils : BigQuery, Looker.

    4. Episode 4 (2021) : From DataLake to LakeHouse

    Migration vers CloudSQL (PostgreSQL manage). Aboutissement du processus de simplification. Consolidation des besoins Cassandra, MySQL et Elasticsearch.

    Data Engineering

    Outils : CloudSQL, PostgreSQL.

    1. Lecon cle

    Se concentrer sur les besoins actuels. Le futur est incertain. Partir sur une solution inadaptee par anticipation revient a partir sur une solution inadaptee.

    Outils recommandés : Hadoop, GCP, Delta Lake, Spark, BigQuery, Looker, CloudSQL, PostgreSQL.

    7. Reconcilier les stacks de 3 structures après des acquisitions

    Cafeyn : plus de 15 ans d'existence. Groupe multimarques (Cafeyn, Blendle, miLibris, Kidjo). Bureaux en France, Pays-Bas, Royaume-Uni, Canada et Maroc. 200 employes.

    Defi post-acquisition

    Apres l'acquisition de Blendle, reconciliation de 2 stacks data en 1. Chaque structure avait ses propres outils, pipelines et conventions. L'objectif : unifier sans perdre de données ni de capacités.

    Stack Cafeyn

    1. ETL et orchestration

    Airflow pour l'orchestration. Snowflake comme Data Lake centralise.

    Data Engineering

    Outils : Airflow, Snowflake.

    2. Tracking et data hub

    Segment pour le tracking front-end et le data hub. Donnees deverses dans le warehouse et directement dans les outils métiers.

    Data Engineering

    Outils : Segment.

    3. Visualisation

    Amplitude pour les équipes produit, marketing et CRM. Analyse de fonctionnalités, analyse d'audience, création de cohortes. Tableau pour les dashboards finances et business.

    Analytics

    Outils : Amplitude, Tableau.

    4. AB Testing

    Outil interne pour les tests A/B. Integration avec le tracking Segment.

    Product

    Outils : A/B Testing.

    "Aucune valeur absolue a sortir d'Amplitude. Nous l'utilisons pour les tendances, valeurs relatives et taux de conversion."

    Nicolas Pfeffer, Data Analyst @ Cafeyn

    Stack Blendle (avant reconciliation)

    ETL avec Looker et Luigi. Data Lake sur Google BigQuery. Tracking front-end avec outil interne. Visualisation avec Looker. AB Testing avec outil interne.

    1. Reconciliation

    Definir quelles données doivent etre deversees dans chaque outil. Ne pas multiplier les sources d'information. Objectif : une source unique de verite pour le groupe Cafeyn.

    Outils recommandés : Airflow, Snowflake, Segment, Amplitude, Tableau, BigQuery, Looker.

    Vous recrutez ce profil ?

    TPC vous accompagne pour trouver des profils adaptés à vos besoins.

    Découvrez aussi notre pôle Data et son accompagnement dédié.