Logo QumuloLogo Qumulo

Blog

Qumulo : la solution de fichiers basée sur le cloud la plus rapide du secteur pour les charges de travail d'IA

Le monde de l' l'intelligence artificielle (IA) a connu une croissance exponentielle et a une soif insatiable de consommer des données. Des voitures autonomes aux chatbots qui imitent la conversation humaine, l’IA révolutionne les industries à un rythme effréné. La puissance de l’IA provient de sa base de données. L'accès aux données, la vitesse de leur traitement et les performances de stockage évolutives sont autant de facteurs essentiels qui déterminent l'efficacité d'un pipeline d'IA. C'est là que Qumulo s'est révélé être la meilleure solution de stockage de données au monde pour les charges de travail d'IA, en tant que solution de données de fichiers la plus performante et la plus rentable du secteur dans le cloud.

Pourquoi Qumulo est idéal pour les charges de travail d'IA basées sur des fichiers

Les applications d'IA, qu'il s'agisse de modèles d'apprentissage profond ou de réseaux de neurones, nécessitent un ensemble unique de caractéristiques de stockage, qui sont toutes satisfaites par Qumulo :

  1. Évolutivité: Les ensembles de données d'IA sont dynamiques. Ils augmentent avec le temps à mesure que davantage de données sont collectées et traitées. La capacité de Qumulo à évoluer avec des performances élevées et prévisibles garantit qu'à mesure que les charges de travail d'IA augmentent, Qumulo peut répondre à ses demandes à n'importe quelle échelle.

  2. Rentabilité: Financer des initiatives d’IA peut représenter un investissement important. Économiser sur les coûts de stockage sans compromettre les performances peut libérer des ressources pour d'autres domaines critiques, qu'il s'agisse de recherche, de développement ou de déploiements de production.

  3. Capacité d'adaptation partoutTM : Les responsables d'infrastructures et les data scientists bénéficient de la flexibilité offerte par la possibilité d'entraîner les modèles dans un centre de données et de les déployer dans un autre, le tout au sein d'une infrastructure hautement sécurisée. Le système de stockage défini par logiciel de Qumulo peut être déployé et exécuté n'importe où. Il est ainsi facile d'entraîner un modèle d'IA dans le centre de données principal et de le déployer en production depuis n'importe quel point du réseau.

  4. Performance : Les modèles d'IA, en particulier ceux utilisés dans des scénarios tels que les véhicules autonomes ou les transactions financières, nécessitent un accès aux données en temps réel pour la formation préalable et post-modèle. La récupération de données à grande vitesse de Qumulo garantit la disponibilité des données au moment où c'est nécessaire.

Examinons de plus près le point n° 4 et soulignons l’importance d’une récupération fluide et ultra-rapide des données et métadonnées. C’est essentiel pour les applications d’IA qui nécessitent un stockage de fichiers évolutif, sur site ou dans le cloud.

En testant des charges de travail d'IA synthétiques, nous avons constaté que nous sommes effectivement la solution cloud basée sur des fichiers la plus rapide du marché pour l'IA, où les scientifiques des données peuvent utiliser Qumulo pour la collecte de données, la pré-formation, la formation en production et l'inférence continue, quelle que soit l'échelle. .

Continuer à lire.

Benchmark d’IA largement applicable

Pour mettre en perspective les capacités de performances de Qumulo, examinons le dernier résultat obtenu avec Qumulo fonctionnant dans le cloud sur l'infrastructure AWS. Nous avons utilisé SPECstorage pour caractériser les performances de l'IA sur Qumulo. Ce benchmark (bien nommé AI_Image) exploite la taille des fichiers et les modèles d'E/S qui exercent de manière synthétique et précise les charges de travail d'IA courantes :

  • Basé sur Tensorflow les meilleures pratiques – le framework IA/ML le plus largement déployé au monde

  • Tracé à partir de 3 modèles différents : Resnet, VGG (Visual Geometry Group) et SSD (Single shot detector)

  • Utilisation d'ensembles de données open source de CityScape, ImageNet et COCO

En raison de l'omniprésence de Tensorflow dans l'espace de l'IA, le benchmark s'applique à un large éventail de charges de travail de modèles d'IA qui produisent des résultats d'IA pour :

  1. Classification d'images et détection d'objets

  2. Traitement du langage naturel (PNL)

  3. Reconnaissance vocale

  4. Systèmes de recommandation

  5. Modèles génératifs

  6. Santé et sciences de la vie

…et beaucoup plus

Description du benchmark et résultats obtenus

L'objectif de ce test de performance est de fournir rapidement des données depuis le stockage Qumulo vers la couche applicative (via GPU) exécutant les tâches d'IA. Ce test évalue les performances de stockage et la latence à partir d'un ensemble réaliste de modèles d'E/S provenant d'un lot de clients. Le nombre de tâches d'IA exécutées par les clients augmente progressivement jusqu'à atteindre la cible, soit 480 tâches dans le cadre de ce test. Le test comprend quatre opérations principales, chacune comportant quatre sous-charges de travail concurrentes indépendantes :

  • AI_SF – Lectures de petits fichiers image

  • AI_TF – Écrit des fichiers plus volumineux (idéalement plus de 100 Mo de fichiers)

  • AI_TR – Lit dans de grands TFRecords

  • AI_CP – Effectue des points de contrôle occasionnels

Résultats

La figure 1 ci-dessous affiche les résultats suivants :

  • L'axe X montre le nombre de tâches exécutant le benchmark IA au fil du temps

  • L'axe Y montre la latence globale pendant toute la durée du test

  • La latence montre les performances de stockage de manière rapide et prévisible à mesure que le nombre de tâches d'IA augmente !

Applicabilité sur site

Bien que les tests de référence SPECstorage aient utilisé un environnement basé sur le cloud, ces résultats peuvent être facilement extrapolés pour estimer les résultats en utilisant un matériel sur site similaire. Lorsque Qumulo publie ce benchmark sur le site Web de SPEC (ETA décembre/2023), les détails et le coût de l'environnement peuvent être trouvés, en notant les types d'instances EC2 (nombre de cœurs, mémoire disponible, etc.) utilisés et la bande passante disponible dans le réseau. environnement. En attendant, nous incluons les détails supplémentaires en annexe de ce blog pour les lecteurs curieux.

Data Scientists et Data Engineers, à vos marques ! Essayez-le vous-même !

Dans le monde en évolution rapide de l’IA, disposer d’une solution de stockage robuste, rapide et évolutive n’est pas un luxe mais une nécessité. Qumulo, avec ses performances et sa rentabilité de pointe, se distingue comme la solution de fichiers cloud de référence pour les charges de travail d'IA. Le benchmark souligne non seulement les prouesses de Qumulo, mais consolide également sa position de solution de stockage la plus rapide et la plus largement applicable pour l'IA.

Voir résultats complets publié sur Spec.org


Appendice

Performances

Temps de réponse global = 1.22 ms

Entreprise
Métrique
(Emplois_IA)Moyenne
Latence
(ms)Tâches_IA
Opérations/SecAI_Jobs
MB/Sec161.36069601565321.281139213127481.313208824691641.213278436255801.201348047822961.1474176593851121.1584872 6109501281.12355687125141441.12262648140821601.10969609156441761.14476570172081921.11783530187742081.1129049120340 2241.11297452218992401.121104413234702561.271111374250372721.143118335265982881.155125296281613041.197132257297293201.205139218312893361.257146178328593521.323153139344183681.430160100359843841.503167061375524001.63217402239112

Informations sur le produit et les tests

Qumulo – Référence Cloud Public Testé par Qumulo, Inc. Matériel disponible : novembre 2023 Logiciel disponible : novembre 2023 Date du test : novembre 2023 Numéro de licence : 6738 Localisation du titulaire de licence : Seattle, WA, États-Unis

Qumulo est une solution de stockage de fichiers hybride offrant une scalabilité de plus de l'exaoctet dans un espace de noms unique, des fonctionnalités identiques sur site et dans le cloud, ainsi qu'une prise en charge multiprotocole complète, garantissant flexibilité et compatibilité avec diverses applications. Grâce à son intégration transparente avec l'infrastructure cloud publique, Qumulo fournit un stockage de données non structurées à toute échelle, avec une visibilité en temps réel sur les performances de stockage et l'utilisation des données.

Le système de fichiers natif du cloud de Qumulo permet aux entreprises de migrer facilement leurs applications et charges de travail basées sur des fichiers vers le cloud public. Avec Qumulo, les entreprises peuvent gérer efficacement des exaoctets de données, que ce soit sur site ou dans le cloud. Les résultats suivants démontrent clairement que le système de fichiers Qumulo offre des performances exceptionnelles lorsqu'il est déployé sur AWS.

Solution en cours de test Nomenclature

Article N° Qté Type Fournisseur Modèle/Nom Description 1 16 Instances AWS EC2 AWSc5n.18xlarge Nœuds Qumulo – Instances Amazon c5n EC2 (les instances c5n.18xlarge disposent de 72 vCPU, 192 Gio de mémoire et d'une connectivité réseau de 100 Gbit/s) 2 16 Instances AWS EC2 AWSc5n.18xlarge Clients Ubuntu – Cluster Qumulo – Instances Amazon c5n EC2 (les instances c5n.18xlarge disposent de 72 vCPU, 192 Gio de mémoire et d'une connectivité réseau de 100 Gbit/s)

Schémas de configuration

Qumulo dans AWS

Logiciel composant

Élément N° Composant Type Nom et version Description 1 Système de fichiers Qumulo Core 6.2.2 Le système de fichiers natif du cloud de Qumulo permet aux organisations de migrer facilement leurs applications et charges de travail basées sur des fichiers vers le cloud public. 2 Système d'exploitation Ubuntu 22.04 Le système d'exploitation Ubuntu est déployé sur les seize nœuds de calcul c5n.18xlarge. Ils sont utilisés comme clients exécutant les benchmarks SPEC Storage 2020.

Configuration et réglage du matériel – Physique

Nom du composant : SR-IOV ; Nom du paramètre : Activé ; Valeur : Active la virtualisation du processeur ; Description : Vitesse du port : 100 GbE ; Chaque nœud dispose d'une connectivité 100 GbE

Notes de configuration et de réglage du matériel

Aucun

Configuration et réglage du logiciel – Virtuel

Paramètre réseau : Nom du paramètre : Valeur : Description : Trames jumbo : 9001 : Active les trames jumbo Ethernet jusqu'à 9001 octets. Paramètres de montage NFS des clients Ubuntu : Nom du paramètre : Valeur : Description : vers3 : Utiliser NFSv3 : nconnect : 16 : Augmenter le nombre de connexions client NFS jusqu'à 16 : TCP : Protocole de transport réseau TCP pour communiquer avec le cluster Qumulo : local_lockall : Le client suppose que les verrous flock et POSIX sont locaux. Paramètre de volume EBS : Nom du paramètre : Valeur : Description : IOPS : 16000 : IOPS max. pour le volume EBS : Débit max. : 1000 : Débit max. pour le volume EBS

Notes de configuration et de réglage du logiciel

Aucun

Remarques sur les SLA de service

AWS met en œuvre tous les efforts commercialement raisonnables pour garantir la disponibilité mensuelle des Produits et Services inclus, avec un taux de disponibilité d'au moins 99.99 %, et ce, pour chaque cycle de facturation mensuel. Ce taux est calculé en soustrayant de 100 % le pourcentage de minutes, au cours du mois, pendant lesquelles les Produits et Services inclus, le cas échéant, étaient indisponibles (région indisponible).

Stockage et systèmes de fichiers

Article n° Description Protection des données Stockage stable Qté 1 Volume Elastic Block Storage, capacité de 1 To gp3. Chaque nœud Qumulo dispose de 6 volumes EBS. Protection de 2 disques ou 1 nœud avec codage d'effacement AWS EBS96 Nombre de systèmes de fichiers 1 Capacité totale 78.54 To Type de système de fichiers Qumulo

Notes de création du système de fichiers

Le système de fichiers Qumulo Core est déployé sur AWS via un modèle CloudFormation ou Terraform. L'AMI Qumulo Core est déployée et le système de fichiers est configuré soit par le biais du processus CloudFormation automatisé, soit via Terraform. Aucune étape supplémentaire de création du système de fichiers n'est requise.

Notes sur le stockage et le système de fichiers

Aucun

Configuration du transport – Virtuel

Numéro d'article Type de transport Nombre de ports utilisés Remarques Carte réseau virtuelle Ethernet 1100 Gbps 16 Utilisée par les machines clientes Carte réseau virtuelle Ethernet 2100 Gbps 16 Utilisée par Qumulo Core pour les communications inter-nœuds ainsi que pour les communications avec tous les clients.

Remarques sur la configuration des transports

Aucun

Commutateurs – virtuels

N° d'article Nom du commutateur Type de commutateur Nombre total de ports Nombre de ports utilisés Remarques 1 AWS Ethernet 100 Gbit/s avec réseau amélioré 16 16 Utilisé par les machines clientes 2 AWS Ethernet 100 Gbit/s avec réseau amélioré 16 16 Utilisé par les nœuds Qumulo Core

Éléments de traitement – ​​virtuels

Article n° Qté Type Emplacement Description Fonction de traitement 1 1152v CPUc5n.18xlarge Qumulo Core Processeurs Intel Xeon Platinum 3.5 GHz Qumulo Core, Communication réseau, Fonctions de stockage 2 1152v CPUc5n.18xlarge Qumulo Core Processeurs Intel Xeon Platinum 3.5 GHz Spécifications Processeurs de test de stockage client

Notes sur les éléments de traitement

Aucun

Mémoire – Virtuelle

DescriptionTaille en GioNombre d'instancesMémoire non volatileTotale en GioAWS EC2 c5n.18xlarge 19216V3072Mémoire totale en Gibioctets 6144

Notes de mémoire

Aucun

Stockage stable

Qumulo Core utilise des périphériques de stockage par blocs élastiques (EBS) ; qui fournissent un stockage stable.

Notes de configuration de la solution en cours de test

La solution testée était un cluster distribué standard construit à l'aide de Qumulo Core. Les clusters Qumulo Core peuvent gérer les entrées/sorties de fichiers de toutes tailles, ainsi que les applications gourmandes en métadonnées. Aucun réglage spécifique n'est requis pour des charges de travail différentes ou mixtes.