STERE INFORMATIQUE

Data lake : définition, avantages et limites

Data lake : définition, avantages et limites

Logs d’applications, données de capteurs, documents, fichiers d’export, flux de réseaux sociaux : les entreprises produisent des volumes croissants de données qui ne rentrent pas dans les tableaux bien rangés d’une base classique. Le data lake, ou lac de données, a été conçu pour les accueillir toutes, sans les transformer au préalable.

Définition, avantages, limites et différences avec le data warehouse : voici comment savoir si un data lake est adapté à votre entreprise.

Qu’est-ce qu’un data lake ?

Un data lake est un espace de stockage centralisé qui conserve les données dans leur format d’origine, qu’elles soient :

  • structurées : tables issues d’un ERP ou d’un CRM, exports de bases de données ;
  • semi-structurées : fichiers JSON ou XML, logs, données de capteurs IoT ;
  • non structurées : documents, e-mails, images, vidéos.

Sa particularité : la structure des données n’est pas définie au moment du stockage, mais au moment de leur utilisation. On parle de schema on read, par opposition au schema on write du data warehouse, où les données sont modélisées avant d’être chargées.

Comment fonctionne un data lake ?

Les data lakes reposent le plus souvent sur un stockage objet dans le cloud, peu coûteux et quasiment illimité. Les données y sont généralement organisées en zones successives :

  • une zone brute, où les données arrivent telles quelles depuis les sources ;
  • une zone nettoyée, où elles sont contrôlées, dédoublonnées et harmonisées ;
  • une zone exploitable, où elles sont préparées pour des usages précis : tableaux de bord, modèles de machine learning, applications.

Des flux d’intégration de données automatisés alimentent le lac et font passer les données d’une zone à l’autre.

Data lake ou data warehouse ?

Data lake Data warehouse
Types de données Tous formats, y compris non structurés Données structurées
Préparation Au moment de l’analyse Avant le chargement
Coût de stockage Faible Plus élevé
Usages privilégiés Data science, IA, exploration Reporting, pilotage, BI
Qualité des données Variable, à encadrer Contrôlée

Les deux ne s’opposent pas : de nombreuses entreprises utilisent le data lake pour stocker et explorer, et le data warehouse pour le reporting et le pilotage.

Les avantages du data lake

  • Tout conserver : aucune donnée n’est écartée faute de savoir, aujourd’hui, comment l’exploiter.
  • Un coût de stockage réduit, adapté aux très grands volumes.
  • De la souplesse : de nouvelles sources s’ajoutent sans refondre un modèle de données.
  • Un terrain idéal pour la data science et l’IA, qui ont besoin de données variées et détaillées.

Les limites : le risque du « data swamp »

Sans règles, un data lake devient vite un marécage de données (data swamp) : des fichiers accumulés dont personne ne connaît l’origine, la fraîcheur ni la fiabilité. Les principaux risques :

  • des données difficiles à retrouver et à comprendre ;
  • une qualité non maîtrisée, qui fragilise les analyses ;
  • des données personnelles stockées sans contrôle, en contradiction avec le RGPD ;
  • des performances insuffisantes pour le reporting quotidien.

La réponse passe par une gouvernance des données solide : un catalogue qui documente chaque jeu de données, des responsables identifiés, des règles d’accès et des contrôles de qualité.

Le lakehouse : la convergence des deux mondes

Pour dépasser les limites du data lake sans renoncer à sa souplesse, l’architecture lakehouse ajoute au lac de données les fonctions d’un data warehouse : tables fiables, transactions, gestion des versions, contrôle des accès et performances adaptées à la BI. Portée notamment par Databricks, elle permet de servir le reporting, la data science et l’IA à partir d’une seule plateforme.

Faut-il mettre en place un data lake ?

Un data lake se justifie lorsque vous manipulez de gros volumes de données variées, que vous avez des projets de data science ou d’IA, ou que vous souhaitez conserver des données dont les usages ne sont pas encore définis. Si votre besoin porte essentiellement sur des tableaux de bord à partir de vos applications de gestion, un data warehouse bien conçu est souvent plus simple et plus efficace.

Choisir la bonne architecture et la mettre en œuvre est au cœur de notre expertise en data engineering. STERE Informatique vous aide à évaluer vos besoins, à concevoir votre plateforme de données et à l’exploiter dans vos outils de Business Intelligence.

Partager :

Découvrez d'autres sujets :

Contactez-nous

Retour en haut