Microsoft Fabric : comprendre OneLake, le lakehouse, les pipelines et le lien avec Power BI – illustration Microsoft Fabric

Microsoft Fabric : comprendre OneLake, le lakehouse, les pipelines et le lien avec Power BI

Thématique
Data & business intelligence
Mis à jour
Lecture
11 min
Formation
Apprendre à manipuler sur Microsoft Fabric : Le Guide Complet Data

L'essentiel en 30 secondes

  • Microsoft Fabric est la plateforme d'analyse de données SaaS de Microsoft, qui réunit intégration, ingénierie, entrepôt, science des données, temps réel et Power BI dans un même service.
  • OneLake est le lac de données unique de Fabric : toutes les charges de travail y stockent leurs données, principalement au format ouvert Delta Parquet.
  • Le lakehouse combine fichiers bruts et tables Delta interrogeables en SQL, tandis que le data warehouse offre un entrepôt relationnel complet en T-SQL.
  • Le mode Direct Lake permet à Power BI de lire directement les tables Delta de OneLake, sans importer une copie des données dans le modèle.
  • Fabric fonctionne avec des capacités : les espaces de travail y sont rattachés et consomment la puissance de calcul achetée ou d'essai.
Sommaire de l'article
  1. Qu’est-ce que Microsoft Fabric ?
  2. OneLake : le socle de Microsoft Fabric
  3. Pourquoi utiliser Microsoft Fabric ?
  4. Lakehouse vs Data Warehouse dans Fabric
  5. Comment démarrer avec Microsoft Fabric : les étapes
  6. Le data warehouse Fabric en pratique
  7. Les erreurs fréquentes avec Microsoft Fabric (et comment les éviter)
  8. Microsoft Fabric, Databricks et Power Platform : comment s’articulent-ils ?
  9. Comment apprendre Microsoft Fabric efficacement ?
  10. En résumé

Microsoft Fabric est la plateforme d’analyse de données tout-en-un de Microsoft : elle réunit dans un seul service en ligne l’intégration de données, le stockage dans un lac unique appelé OneLake, le lakehouse, l’entrepôt de données, la science des données, l’analyse en temps réel et Power BI. L’objectif est d’éviter l’assemblage de nombreux services séparés et les copies multiples des mêmes données.

Ce guide s’adresse aux analystes Power BI, aux data engineers, aux administrateurs BI et aux équipes informatiques qui veulent comprendre Fabric avant de s’y lancer. Vous y verrez les concepts clés, la différence entre lakehouse et data warehouse, la création d’un lakehouse pas à pas, la construction d’un modèle sémantique et d’un rapport Power BI, puis l’automatisation des actualisations.

Qu’est-ce que Microsoft Fabric ?

Microsoft Fabric est une plateforme d’analyse de données proposée en mode SaaS, c’est-à-dire entièrement hébergée et gérée par Microsoft. Elle regroupe plusieurs charges de travail qui partagent le même stockage (OneLake), la même sécurité, la même administration et le même modèle de facturation par capacité.

Les principales charges de travail (ou expériences) de Fabric sont :

Charge de travailRôleÉléments typiques
Data FactoryIngestion et transformation de donnéesPipelines, Dataflows Gen2 (Power Query), connecteurs
Data EngineeringTraitement de données à grande échelleLakehouse, notebooks Spark, définitions de tâches Spark
Data WarehouseEntrepôt relationnel en T-SQLWarehouse, requêtes SQL, procédures
Data ScienceMachine learningNotebooks, expériences et modèles suivis avec MLflow
Real-Time IntelligenceDonnées en flux et analyse en temps réelEventstreams, eventhouses, requêtes KQL
Power BIModélisation et visualisationModèles sémantiques, rapports, tableaux de bord

Fabric intègre également des bases de données opérationnelles et Copilot, selon les régions et les capacités. On y accède depuis le portail Fabric, qui est aussi celui du service Power BI : pour un utilisateur Power BI, l’environnement est familier.

OneLake : le socle de Microsoft Fabric

OneLake est le lac de données unique de l’organisation. Chaque organisation dispose d’un seul OneLake, organisé par espaces de travail, dans lequel toutes les charges de travail de Fabric lisent et écrivent. On le compare souvent à « un OneDrive pour les données ».

Trois caractéristiques le rendent central :

  • Un format ouvert : les tables sont stockées au format Delta Parquet. Une table créée par un notebook Spark est lisible par le warehouse en SQL et par Power BI, sans conversion ni copie.
  • Les raccourcis : un raccourci référence des données stockées ailleurs (un autre espace de travail, Azure Data Lake Storage, Amazon S3, Google Cloud Storage…) comme si elles étaient dans OneLake, sans les dupliquer.
  • La mise en miroir : certaines bases de données externes peuvent être répliquées en continu dans OneLake pour être analysées sans pipeline d’ingestion à maintenir.

Le principe à retenir : une seule copie des données, plusieurs moteurs pour les exploiter.

Pourquoi utiliser Microsoft Fabric ?

Avant Fabric, une chaîne de données Microsoft typique combinait plusieurs services Azure distincts (stockage, intégration, traitement Spark, entrepôt) et Power BI, chacun avec sa facturation, sa sécurité et ses copies de données. Fabric répond à plusieurs problèmes concrets :

  • Moins d’outils à assembler : ingestion, stockage, transformation et visualisation dans le même portail.
  • Moins de copies : grâce à OneLake et au format Delta, les données ne sont plus dupliquées entre le lac, l’entrepôt et Power BI.
  • Une gouvernance centralisée : espaces de travail, rôles, étiquettes de confidentialité et traçabilité des données (lignage) au même endroit.
  • Une continuité pour les équipes Power BI : les analystes retrouvent Power Query, les modèles sémantiques et les rapports qu’ils connaissent.
  • Un modèle de coût unique : une capacité partagée par toutes les charges de travail.

Fabric est particulièrement pertinent pour les organisations déjà équipées de Microsoft 365 et Power BI, qui veulent structurer leurs données sans multiplier les briques techniques.

Lakehouse vs Data Warehouse dans Fabric

C’est la première question que se posent les équipes. Les deux éléments stockent leurs tables dans OneLake au format Delta, mais ils ne s’adressent pas aux mêmes usages.

CritèreLakehouseData Warehouse
Données acceptéesFichiers de tous types (CSV, JSON, Parquet, images) et tablesTables structurées uniquement
Langages principauxSpark (Python, SQL, Scala, R), plus SQL en lectureT-SQL complet
Écriture en SQLNon : le point de terminaison d’analytique SQL est en lecture seuleOui : CREATE, INSERT, UPDATE, DELETE, transactions
Profil typeData engineers, data scientistsDéveloppeurs SQL, analystes BI
Usage idéalZones brutes et nettoyées, données variées, traitements SparkCouche finale modélisée en étoile, logique SQL existante
Lien avec Power BIModèle sémantique en mode Direct LakeModèle sémantique en mode Direct Lake

En pratique, beaucoup d’architectures combinent les deux : un lakehouse pour les couches brutes et nettoyées, un warehouse (ou un lakehouse) pour la couche finale consommée par Power BI. Cette organisation en couches rappelle l’architecture médaillon utilisée aussi sur Databricks, présentée dans notre guide pour apprendre Databricks.

Comment démarrer avec Microsoft Fabric : les étapes

Prenons un exemple concret : des fichiers CSV de ventes et un fichier de produits, que l’on veut centraliser, modéliser et restituer dans un rapport Power BI actualisé automatiquement.

Étape 1 — Activer Fabric et créer un espace de travail

Connectez-vous au portail Fabric avec votre compte professionnel. Si votre organisation n’a pas de capacité Fabric, vous pouvez démarrer un essai gratuit depuis votre profil (à condition que l’administrateur l’autorise).

Créez ensuite un espace de travail dédié au projet, et vérifiez dans ses paramètres qu’il est rattaché à une capacité Fabric (ou d’essai). Sans capacité, les éléments Fabric comme le lakehouse ne peuvent pas être créés.

Étape 2 — Découvrir l’interface

Le portail s’organise autour de quelques zones :

  • la barre de navigation à gauche : accueil, espaces de travail, catalogue OneLake, création d’éléments ;
  • le sélecteur d’expérience en bas à gauche, qui adapte l’accueil à la charge de travail (Power BI, Data Factory, Data Engineering…) ;
  • l’espace de travail, qui liste tous les éléments du projet : lakehouses, notebooks, pipelines, modèles sémantiques, rapports.

Le bouton Nouvel élément dans l’espace de travail permet de créer n’importe quel type d’élément.

Étape 3 — Créer et alimenter un lakehouse

Créez un élément Lakehouse, nommé par exemple LH_Ventes. Il comporte deux sections :

  • Files : une zone de fichiers bruts, où l’on dépose les CSV tels quels ;
  • Tables : les tables Delta, interrogeables en SQL et utilisables par Power BI.

Chargez vos fichiers CSV dans Files (menu Obtenir des données > Charger des fichiers). Puis, sur chaque fichier, utilisez l’option Charger dans les tables : Fabric crée une table Delta à partir du fichier.

Pour des transformations plus poussées (types de colonnes, nettoyage, fusion de fichiers), créez plutôt un Dataflow Gen2 : c’est Power Query dans Fabric, avec pour destination une table du lakehouse. Si vous connaissez déjà l’éditeur, notre guide Power Query dans Power BI s’applique directement.

Les data engineers peuvent aussi utiliser un notebook :

df = spark.read.option("header", True).option("inferSchema", True).csv("Files/ventes/*.csv")
df = df.dropDuplicates().na.drop(subset=["montant"])
df.write.mode("overwrite").format("delta").saveAsTable("ventes")

Étape 4 — Interroger les données en SQL

Chaque lakehouse dispose d’un point de terminaison d’analytique SQL. Basculez sur cette vue pour interroger les tables en T-SQL :

SELECT p.categorie,
       SUM(v.montant) AS chiffre_affaires,
       COUNT(*)       AS nb_ventes
FROM ventes AS v
JOIN produits AS p ON p.id_produit = v.id_produit
GROUP BY p.categorie
ORDER BY chiffre_affaires DESC;

Ce point de terminaison est en lecture seule : on peut créer des vues, mais pas modifier les tables en SQL. Pour cela, il faut le warehouse (ou Spark). Si le SQL vous est encore peu familier, notre guide pour apprendre SQL couvre les requêtes utiles ici.

Étape 5 — Construire le modèle sémantique et les relations

Depuis le lakehouse, créez un nouveau modèle sémantique et sélectionnez les tables utiles (ventes, produits, dates). Dans l’éditeur de modèle en ligne :

  1. Créez les relations en faisant glisser la clé de la table de faits (ventes.id_produit) vers la table de dimension (produits.id_produit) : cardinalité plusieurs-à-un, filtrage de la dimension vers les faits.
  2. Masquez les colonnes techniques inutiles aux utilisateurs.
  3. Ajoutez des mesures DAX, par exemple :
Chiffre d'affaires = SUM ( ventes[montant] )
Panier moyen = DIVIDE ( [Chiffre d'affaires], COUNTROWS ( ventes ) )

Ce modèle fonctionne en mode Direct Lake : Power BI lit directement les tables Delta de OneLake, avec des performances proches du mode import, sans copier les données dans le modèle. Pour aller plus loin dans l’écriture des mesures, consultez notre guide DAX dans Power BI.

Étape 6 — Créer le rapport Power BI en ligne

Depuis le modèle sémantique, choisissez Créer un rapport. L’éditeur de rapports Power BI s’ouvre dans le navigateur : ajoutez des cartes pour les indicateurs clés, un histogramme par catégorie, une courbe mensuelle et des segments. Enregistrez le rapport dans l’espace de travail, puis partagez-le ou publiez-le dans une application Power BI. Les principes de visualisation sont détaillés dans notre guide pour apprendre Power BI.

Étape 7 — Automatiser les rafraîchissements

Pour que le rapport reste à jour sans intervention :

  • Planifiez le Dataflow Gen2 ou le notebook qui charge les données, depuis ses paramètres d’actualisation.
  • Pour une chaîne complète, créez un pipeline Data Factory qui enchaîne les activités (copie des données, exécution du dataflow ou du notebook, notification en cas d’échec) et planifiez-le (par exemple chaque jour à 6 h).
  • Vérifiez les paramètres du modèle sémantique : en Direct Lake, les nouvelles données des tables Delta sont prises en compte automatiquement ou lors de l’actualisation du modèle, selon la configuration choisie.

Le moniteur de Fabric centralise l’historique des exécutions de pipelines, dataflows et notebooks : c’est le premier endroit à consulter en cas de données manquantes.

Le data warehouse Fabric en pratique

Si votre équipe travaille surtout en SQL, créez un élément Warehouse. Vous y écrivez du T-SQL complet :

CREATE TABLE dbo.dim_client (
    id_client INT,
    nom       VARCHAR(200),
    segment   VARCHAR(50)
);

INSERT INTO dbo.dim_client (id_client, nom, segment)
SELECT DISTINCT id_client, nom_client, segment
FROM LH_Ventes.dbo.clients;

Deux points utiles : le warehouse peut interroger directement les tables d’un lakehouse du même espace de travail (requêtes entre bases), et il se charge aussi par pipeline, par dataflow ou par l’instruction COPY INTO. Comme pour le lakehouse, on y crée ensuite un modèle sémantique avec ses relations, puis des rapports.

Les erreurs fréquentes avec Microsoft Fabric (et comment les éviter)

En formation, ces blocages reviennent souvent :

ErreurCauseSolution
Impossible de créer un lakehouseEspace de travail non rattaché à une capacité FabricAssocier l’espace à une capacité (ou d’essai) dans ses paramètres
Échec d’écriture en SQL dans le lakehouseLe point de terminaison SQL est en lecture seuleUtiliser Spark, un dataflow, ou créer un warehouse
Le rapport affiche des données anciennesChargement non planifié ou en échecPlanifier pipeline ou dataflow et consulter le moniteur
Totaux faux dans le rapportRelations absentes ou mal orientéesVérifier les relations plusieurs-à-un et le sens du filtrage
Tout le projet dans un seul espace de travailAucune séparation des environnementsSéparer développement et production, utiliser les pipelines de déploiement
Capacité saturée, rapports lentsTraitements lourds aux heures de consultationPlanifier les charges hors des heures de pointe, surveiller la consommation

Microsoft Fabric, Databricks et Power Platform : comment s’articulent-ils ?

Fabric n’est pas isolé dans l’écosystème des données :

  • Face à Databricks : les deux plateformes adoptent l’approche lakehouse et le format Delta. Databricks est multicloud et très orienté data engineering et machine learning ; Fabric est un service SaaS intégré à Microsoft, avec Power BI au cœur. Certaines organisations utilisent les deux, OneLake pouvant référencer des données produites ailleurs.
  • Face à Power BI seul : si vos sources sont simples et vos volumes modestes, Power BI Desktop et le service Power BI suffisent. Fabric devient utile quand il faut centraliser, historiser et transformer des données à plus grande échelle.
  • Avec la Power Platform : les applications Power Apps et les flux Power Automate produisent des données métier que Fabric peut analyser. Pour comprendre ces outils, lisez notre présentation de la Power Platform.

Comment apprendre Microsoft Fabric efficacement ?

Fabric est vaste : commencez par la chaîne la plus utile pour votre métier. Voici le parcours que nous recommandons :

  1. Les concepts (1 heure) : SaaS, capacités, espaces de travail, OneLake, lakehouse et warehouse.
  2. La prise en main (1 heure) : se connecter, explorer l’interface, créer un espace de travail et un lakehouse.
  3. La chaîne analytique (quelques heures) : charger des fichiers, créer des tables, un modèle sémantique avec relations, puis un rapport Power BI en ligne.
  4. L’automatisation : dataflows et pipelines planifiés, surveillance dans le moniteur.
  5. L’approfondissement : warehouse en T-SQL, notebooks Spark, gouvernance et déploiement.

Pour être guidé, la formation vidéo pour manipuler Microsoft Fabric d’EspritAcadémique dure deux heures dix, sans prérequis, avec des fichiers ressources pour pratiquer. Elle aborde notamment :

  • l’architecture de Fabric, le rôle de OneLake et la différence entre lakehouse et data warehouse ;
  • la connexion à l’outil et le tour d’horizon de l’interface ;
  • la création et l’alimentation d’un lakehouse ;
  • le modèle sémantique, les relations et la création d’un rapport Power BI en ligne ;
  • l’automatisation des rafraîchissements ;
  • la prise en main du data warehouse, de ses relations et de l’automatisation des flux.

En résumé

Microsoft Fabric réunit dans un même service l’ingestion, le stockage, la transformation et la visualisation des données, autour de OneLake et du format Delta. Pour démarrer, rattachez un espace de travail à une capacité, créez un lakehouse, chargez vos données, construisez un modèle sémantique en Direct Lake et publiez un rapport Power BI. Choisissez le warehouse quand vos équipes travaillent en SQL, et automatisez la chaîne avec des dataflows et des pipelines planifiés.

Questions fréquentes

Quelle est la différence entre Microsoft Fabric et Power BI ?

Power BI est l'outil de modélisation et de visualisation des données. Microsoft Fabric est une plateforme plus large qui intègre Power BI, mais ajoute tout ce qui se passe en amont : ingestion avec Data Factory, stockage dans OneLake, lakehouse, data warehouse, notebooks Spark, science des données et analyse en temps réel. Power BI est devenu l'une des charges de travail de Fabric.

Microsoft Fabric est-il gratuit ?

Microsoft propose un essai gratuit de Fabric d'une durée limitée, qui donne accès à une capacité d'essai. En production, Fabric est facturé selon la capacité choisie (références F de différentes tailles), au paiement à l'usage ou par réservation, avec des coûts de stockage OneLake. Consultez la page tarifaire officielle de Microsoft pour les montants à jour.

Qu'est-ce que OneLake dans Microsoft Fabric ?

OneLake est le lac de données unique et logique de chaque organisation utilisant Fabric, souvent comparé à un OneDrive pour les données. Toutes les charges de travail y lisent et y écrivent, au format ouvert Delta Parquet. Les raccourcis permettent d'y référencer des données stockées ailleurs, comme Azure Data Lake Storage ou Amazon S3, sans les copier.

Lakehouse ou data warehouse dans Fabric : lequel choisir ?

Le lakehouse convient aux données variées (fichiers bruts, semi-structurés) et aux équipes qui travaillent en Spark avec Python ou SQL ; son point de terminaison SQL est en lecture seule. Le data warehouse convient aux équipes SQL qui veulent créer, modifier et charger des tables en T-SQL avec des transactions complètes. Les deux stockent leurs tables dans OneLake.

Combien de temps faut-il pour apprendre Microsoft Fabric ?

Avec des bases en Power BI ou en SQL, quelques heures suffisent pour comprendre l'architecture, créer un lakehouse, charger des données et publier un rapport. Pour être autonome sur les pipelines, les notebooks, le data warehouse et la gouvernance, comptez plusieurs semaines de pratique. Les certifications Fabric demandent une expérience plus approfondie.

Faut-il savoir coder pour utiliser Microsoft Fabric ?

Pas nécessairement. Les Dataflows Gen2 reposent sur Power Query, les pipelines se construisent visuellement et les rapports Power BI se créent par glisser-déposer. Le SQL devient vite utile pour interroger les tables et le warehouse, et Python est nécessaire pour les notebooks de data engineering et de data science.