Qu’est-ce que le système d’exploitation DGX ?
DGX OS est le système d'exploitation spécialement conçu par NVIDIA pour l'infrastructure d'IA. Basé sur Ubuntu Linux, il va bien au-delà d'une distribution standard en intégrant une pile logicielle d'IA entièrement optimisée, des fonctionnalités de sécurité d'entreprise et des outils de gestion de cluster dans une plate-forme unique et cohérente. Initialement disponible uniquement sur le matériel DGX de NVIDIA, DGX OS a étendu sa portée et prend désormais en charge certains systèmes partenaires, reflétant l'ambition de NVIDIA de devenir la plate-forme par défaut pour le calcul de l'IA à toutes les échelles.
Pour les ingénieurs en IA, DGX OS résout un problème persistant : l'écart entre l'installation d'un système d'exploitation et la disponibilité d'un environnement prêt pour la production pour la formation et l'inférence. Sur Ubuntu standard, la configuration des pilotes CUDA, de cuDNN, des environnements d'exécution des conteneurs, de la structure réseau et du stockage peut prendre des jours d'ingénierie et introduire de subtils problèmes de compatibilité. DGX OS élimine complètement cette friction.
Pile logicielle d'IA préconfigurée
La pièce maîtresse de DGX OS est sa pile logicielle d’IA préconfigurée et validée. Chaque composant est testé ensemble et garantit un fonctionnement optimal sur le matériel pris en charge.
Boîte à outils CUDA : DGX OS est livré avec la dernière version stable de CUDA, entièrement configurée avec des variables d'environnement, des chemins de bibliothèque et des chaînes d'outils de compilateur. Les versions des pilotes sont adaptées au noyau et testées par rapport aux modèles GPU spécifiques du système. Il n'y a pas d'installation manuelle du pilote, pas de débogage d'incompatibilité de version et pas de liens symboliques rompus.
cuDNN : La bibliothèque CUDA Deep Neural Network est préinstallée et optimisée pour l'architecture GPU présente dans le système. DGX OS inclut les profils de réglage automatique de cuDNN pour les architectures réseau courantes, ce qui signifie que votre première opération de convolution ou d'attention s'exécute à une vitesse presque optimale sans expériences de préchauffage.
TensorRT : Le moteur d'optimisation d'inférence de NVIDIA est inclus avec des plugins prédéfinis pour les architectures de modèles populaires. DGX OS configure TensorRT pour utiliser efficacement la mémoire GPU disponible, permettant ainsi l'inférence INT8 et FP16 prête à l'emploi avec des outils d'étalonnage prêts à être exécutés.
NCCL : La bibliothèque de communications collectives NVIDIA est essentielle pour la formation multi-GPU et multi-nœuds. DGX OS configure NCCL avec des paramètres tenant compte de la topologie qui correspondent à la structure NVLink, NVSwitch et InfiniBand du système. Sur un système DGX H100 avec huit GPU connectés via NVSwitch, NCCL atteint une bande passante presque maximale théorique pour les opérations de réduction totale sans aucun réglage manuel.
Runtime de conteneur et NGC
DGX OS utilise des conteneurs comme principal mécanisme de déploiement pour les charges de travail d'IA. Le NVIDIA Container Toolkit est préinstallé, permettant à Docker et à d'autres environnements d'exécution compatibles OCI d'accéder aux GPU de manière transparente. Lorsque vous exécutez un conteneur, les périphériques, pilotes et bibliothèques GPU sont automatiquement montés dans l'espace de noms du conteneur.
Le système est étroitement intégré à NVIDIA NGC, un catalogue de conteneurs optimisés pour GPU pour tous les principaux frameworks d'IA. Les conteneurs NGC pour PyTorch, TensorFlow, JAX, RAPIDS et des dizaines d'autres outils sont testés mensuellement par rapport au système d'exploitation DGX et publiés avec des tests de performances. Extraire et exécuter un conteneur NGC sur DGX OS est une seule commande :
docker run --gpus all nvcr.io/nvidia/pytorch:24.03-py3
Ce conteneur comprend PyTorch compilé avec les versions optimales de CUDA et cuDNN pour le système hôte, ainsi qu'Apex pour une formation à précision mixte, Transformer Engine pour un calcul efficace de l'attention et des utilitaires de formation distribués préconfigurés.
Gestionnaire de commandes de base pour l'orchestration de cluster
Pour les organisations exécutant plusieurs systèmes DGX, DGX OS s'intègre à Base Command Manager (anciennement Bright Cluster Manager). Cette couche d'orchestration permet la planification des tâches via Slurm ou Kubernetes, l'allocation de ressources multi-nœuds, la gestion des utilisateurs et des groupes et la surveillance de l'état de santé à travers le cluster.
Base Command Manager gère la tâche complexe de coordination des tâches de formation multi-nœuds. Lorsque vous soumettez une tâche de formation nécessitant 32 GPU sur quatre nœuds DGX, le gestionnaire alloue des ressources, configure la structure réseau, lance des processus sur chaque nœud et surveille les échecs. Si un GPU rencontre une erreur, le gestionnaire peut vérifier l'état de formation et redémarrer le travail sur un matériel sain.
Pour les équipes qui préfèrent Kubernetes, DGX OS prend en charge l'opérateur et l'opérateur réseau NVIDIA GPU, qui exposent les GPU et les interconnexions haut débit en tant que ressources Kubernetes. Cela permet aux équipes de plate-forme de fournir une infrastructure d'IA en libre-service via des Kubernetes API standard, tandis que DGX OS gère la complexité spécifique au matériel en dessous.
Fonctionnalités de sécurité
Les systèmes d'IA d'entreprise gèrent des données sensibles et des ressources de calcul coûteuses, faisant de la sécurité une préoccupation majeure dans DGX OS.
Démarrage sécurisé : DGX OS valide l'intégrité de la chaîne de démarrage, du micrologiciel au noyau jusqu'à l'espace utilisateur. Chaque composant est signé cryptographiquement, empêchant le chargement de noyaux ou de rootkits falsifiés. Ceci est particulièrement important dans les environnements partagés où plusieurs équipes accèdent au même matériel.
Stockage crypté : Le chiffrement complet du disque est disponible dès le départ, protégeant les données au repos sur les disques du système d'exploitation et sur le stockage NVMe haut débit. La gestion des clés s'intègre aux systèmes d'entreprise tels que HashiCorp Vault et aux modules de sécurité matériels.
Isolation du réseau : DGX OS prend en charge des politiques réseau précises qui isolent les tâches de formation les unes des autres et du trafic de gestion. Le trafic RDMA GPU-direct circule sur des partitions InfiniBand dédiées, empêchant ainsi les fuites de données entre les locataires sur les clusters partagés.
Journalisation d'audit : Toutes les actions administratives, les allocations GPU et les lancements de conteneurs sont enregistrés dans une piste d'audit inviolable. Ces journaux s'intègrent aux plates-formes SIEM standard pour la surveillance de la conformité.
Optimisation des performances prête à l'emploi
DGX OS comprend des centaines d'optimisations de performances qui prendraient des semaines à un administrateur système expert pour les mettre en œuvre manuellement. Le noyau est configuré avec des paramètres de gouverneur CPU optimaux, une allocation de mémoire compatible NUMA et des paramètres de pile réseau optimisés. Le mode de persistance GPU est activé par défaut, éliminant ainsi la latence de démarrage qui gêne les flux de travail de développement sous Linux standard. Des pages énormes sont pré-allouées pour les mappages de mémoire GPU. L'affinité IRQ est définie pour minimiser la surcharge CPU lors des transferts de données.
Le résultat est mesurable. Les comparaisons de référence montrent systématiquement que DGX OS offre un débit de formation supérieur de cinq à quinze pour cent à celui du même matériel exécutant Ubuntu avec des pilotes installés manuellement, une différence qui s'accroît au fil des formations sur plusieurs jours et se traduit par des économies de temps et d'argent significatives.
Qui a besoin du système d’exploitation DGX par rapport à Ubuntu standard ?
DGX OS n'est pas pour tout le monde, et il est important de comprendre quand il ajoute de la valeur. Si vous êtes un chercheur solo avec un seul GPU exécutant des expériences à partir de notebooks Jupyter, Ubuntu standard avec une boîte à outils CUDA installée manuellement est parfaitement adéquat. La surcharge des fonctionnalités d'entreprise de DGX OS ajouterait de la complexité sans aucun avantage.
DGX OS devient convaincant lorsque vous disposez de plusieurs GPU ou nœuds, lorsque plusieurs utilisateurs partagent du matériel, lorsque vous avez besoin d'environnements reproductibles entre le développement et la production, ou lorsque les exigences de conformité imposent des fonctionnalités de sécurité telles que le démarrage sécurisé et la journalisation d'audit. Dans ces scénarios, le temps gagné sur la configuration, la réduction des dérives de configuration et la tranquillité d'esprit grâce aux piles logicielles validées justifient l'investissement.
Système d'exploitation DGX sur Lenovo ThinkStation PGX
Dans le cadre d'une expansion significative de l'écosystème DGX, NVIDIA s'est associé à Lenovo pour intégrer le système d'exploitation DGX à la ThinkStation PGX, un système de classe poste de travail conçu pour le développement de l'IA. La ThinkStation PGX associe les NVIDIA GPU à la conception des stations de travail, à la gestion thermique et à l'infrastructure de support de Lenovo, tandis que le système d'exploitation DGX offre l'expérience logicielle auparavant disponible uniquement sur le matériel de marque NVIDIA.
Ce partenariat est important car il apporte les capacités d’IA d’entreprise dans un format qui tient sous un bureau. Les équipes qui ont besoin d'un logiciel de classe DGX mais ne peuvent pas justifier d'un rack de centre de données peuvent désormais déployer des systèmes ThinkStation PGX dans des environnements de bureau avec la même pile validée exécutée sur les systèmes DGX du centre de données.
Configuration et premiers pas
La prise en main de DGX OS dépend de votre matériel. Sur les systèmes NVIDIA DGX, le système d'exploitation est préinstallé. Sur le matériel partenaire pris en charge comme la ThinkStation PGX, vous installez le système d'exploitation DGX à partir d'une image USB amorçable fournie via le portail d'entreprise de NVIDIA.
Après l'installation, la première étape consiste à enregistrer le système auprès du serveur de licences NVIDIA pour activer le support entreprise et l'accès NGC. Ensuite, vérifiez la pile GPU en exécutant la suite de validation intégrée :
nvidia-smidgxos-validate --full
Cela effectue une vérification complète des pilotes, des bibliothèques, des interconnexions et du stockage. Une fois la validation réussie, extrayez votre premier conteneur NGC et exécutez une analyse comparative pour confirmer que tout fonctionne comme prévu. À partir de là, vous pouvez configurer des comptes d'utilisateurs, configurer Slurm ou Kubernetes pour la planification des tâches et commencer à intégrer vos charges de travail d'IA sur une plate-forme spécialement conçue pour les exécuter.