Logo QumuloLogo Qumulo

Blog

Modèles de maisons au bord du lac sur Qumulo avec Databricks

Qumulo et Databricks ont finalisé une intégration conjointe permettant aux lacs de données d'entreprise de couvrir l'ensemble du patrimoine de données d'une organisation. Où que se trouvent les données (sur site, en périphérie ou dans un cloud majeur), Databricks peut désormais les lire, les écrire et les gérer grâce au stockage Qumulo. (En savoir plus sur l'annonce de Databricks) ici.)

Le concept de « lakehouse » est devenu la pierre angulaire de l'analyse de données moderne, combinant l'ouverture d'un lac de données avec la gouvernance et la fiabilité d'un entrepôt de données. Les organisations l'adoptent pour s'affranchir de la dépendance vis-à-vis d'un fournisseur unique, réduire leurs coûts et unifier leurs analyses et leur IA sur une plateforme unique. Jusqu'à présent, les « lakehouses » étaient cependant largement confinés à un seul site ou au stockage objet d'un fournisseur cloud dans une seule région. Si cette approche a bien servi le secteur, la plupart des entreprises possèdent des données brutes et de niveau bronze disséminées un peu partout : capteurs d'usine, données de succursales, imagerie médicale, journaux d'applications, enregistrements transactionnels, toutes générées et conservées dans des centres de données, des sites périphériques et de multiples clouds. IDC prévoit une croissance annuelle composée d'environ 16 % pour les données non structurées des entreprises jusqu'en 2028, pour atteindre 10.5 ZB, alimentée par la prolifération des capteurs, l'IoT et les charges de travail d'IA. Déployer le « lakehouse »… tous L'exploitation de ces données, où qu'elles se trouvent, constitue la prochaine étape architecturale.

Qumulo est une plateforme de données définie par logiciel qui s'exécute sur site, en périphérie et dans le cloud au sein d'un espace de noms global unique. Associée à Databricks, elle permet au lac de données de s'étendre à l'ensemble du parc de données sans nécessiter de copie ni de consolidation des données dans un compartiment cloud unique. Les mêmes tables gouvernées peuvent être interrogées par Databricks dans une région, par une tâche d'apprentissage sur site et par un outil de BI dans un autre cloud, à partir d'une source unique de vérité.

Cet article présente trois modèles d'intégration validés entre Databricks et Qumulo pour différentes architectures de lac de données : (1) exécuter les analyses et l'IA de Databricks directement sur les données de Qumulo, sans migration ni changement de plateforme ; (2) intégrer les tables Qumulo à la gouvernance d'Unity Catalog pour une vue unique et gouvernée, quel que soit l'emplacement des données ; et (3) partager les données Qumulo en lecture seule avec d'autres espaces de travail Databricks, d'autres clouds et des outils non-Databricks via OpenSharing. Pour un guide de déploiement étape par étape, consultez la documentation. Note d'intégration de Qumulo et Databricks.

Figure 1. Architecture de haut niveau des modèles d'intégration Qumulo-Databricks 

Avantages pour les équipes Databricks

Ces modèles produisent trois résultats pour les organisations qui adoptent Databricks :

  • Résultats plus rapides. Les données existantes sur Qumulo (journaux bruts, images, télémétrie, génomique et enregistrements d'applications) sont lues directement par Databricks, éliminant ainsi les coûts, les délais et les frais d'API S3 par requête liés à une migration massive. Lors de tests de validation, Qumulo a constaté une réduction de 60 % ou plus des coûts de stockage liés à l'API et une compression de 40 % ou plus du délai d'obtention des premiers résultats, comparativement aux flux de travail équivalents qui stockaient les données au préalable dans le cloud.

  • Un seul exemplaire, de nombreux consommateurs. Les mêmes données sont utilisées simultanément par Databricks dans le cloud, par les tâches d'entraînement sur site, par les applications périphériques et par d'autres outils d'analyse et d'IA. Tous les acteurs travaillent à partir d'une source unique de vérité, évitant ainsi la dispersion de versions selon les environnements.

  • Gouvernance unifiée sans migration massive. Les tables sur Qumulo sont gérées via Unity Catalog, avec des autorisations, un audit et une traçabilité appliqués de manière cohérente aux analystes et aux équipes BI dans tous les notebooks et tableaux de bord.

Trois modèles validés

Chaque modèle positionne différemment les données et la gouvernance, et la plupart des déploiements en production les combinent. Il est à noter que les clients peuvent déployer une combinaison de ces intégrations. 

Modèle A. Qumulo contient les données brutes et historiques, Databricks contient les tables organisées. Databricks Compute lit les données sources sur Qumulo, applique les transformations Silver et Gold, puis écrit les tables Delta ainsi traitées dans le stockage géré par Unity Catalog. Serverless SQL Warehouse interroge les tables Gold à des fins de BI et d'analyse. Idéal lorsque une organisation débute avec Databricks et souhaite que sa première couche personnalisée soit gérée nativement par Unity Catalog.

Modèle B. Tous les niveaux de médaillons (Bronze, Argent, Or) sont disponibles sur Qumulo sous forme de tables Delta. Les tables sont enregistrées dans un métastore Hive que Databricks fédère dans Unity Catalog. Les ressources de calcul à usage général effectuent des lectures et des écritures via ce chemin ; les entrepôts de données SQL sans serveur interrogent Unity Catalog. Idéal lorsque l'organisation souhaite que l'ensemble de son infrastructure réseau reste sur Qumulo tout en bénéficiant de la gouvernance, de la traçabilité et de l'audit d'Unity Catalog.

Modèle C : Avec OpenSharing, Qumulo peut exposer les tables Delta en lecture seule à Unity Catalog et à d’autres consommateurs. Databricks et d'autres outils bénéficient d'un accès temporaire via le protocole OpenSharing, sans que les données ne soient copiées chez le consommateur. Cette solution est idéale pour partager les données Qumulo entre plusieurs utilisateurs (autres espaces de travail Databricks, Snowflake, outils de BI) et sur plusieurs clouds.

Les procédures étape par étape pour les trois modèles se trouvent dans le Note d'intégration de Qumulo et Databricks.