De l'évolutivité à l'évolution : Spectrum-XGS est le choix incontournable

Sep 25, 2025

Laisser un message

Les centres de données d'IA actuels sont confrontés à deux principaux goulots d'étranglement en matière de mise à l'échelle, et les modèles traditionnels de scale-up et de scale-out ont du mal à répondre aux demandes d'IA à grande échelle :

Limites de mise à l'échelle- : obtenu en mettant à niveau des systèmes ou des racks uniques (par exemple, en augmentant le nombre de GPU ou en améliorant les performances d'un seul-appareil), mais limité par les plafonds de puissance d'infrastructures telles que le refroidissement par eau. Les centres de données existants ont des seuils physiques pour la consommation d'énergie et la dissipation thermique, empêchant une augmentation infinie de la densité de calcul par rack ou centre de données.

Limites d'évolution-: étendu en ajoutant des racks et des serveurs pour faire évoluer les clusters, mais limité par l'espace physique dans un seul lieu, imposant des limites strictes à la capacité de l'équipement.

Pour surmonter ce dilemme, NVIDIA propose la nouvelle dimension du "scale-cross", en optimisant la communication réseau entre les centres de données géographiquement dispersés pour permettre aux clusters d'IA distribués de collaborer comme un seul. Le fondateur et PDG de NVIDIA, Jensen Huang, décrit cette super-usine d'IA inter-régionale comme une infrastructure clé pour la révolution industrielle de l'IA, avec Spectrum-XGS comme principal catalyseur technologique.

Spectrum-XGS

Technologies de base de Spectrum-XGS

Spectrum{{0}XGS n'est pas une plate-forme matérielle entièrement nouvelle, mais une évolution de l'écosystème Ethernet Spectrum-X existant de NVIDIA. Depuis son lancement en 2024, Spectrum-X a fourni des performances réseau d'IA génératives 1,6 fois supérieures à celles de l'Ethernet traditionnel via les commutateurs SN5600 de l'architecture Spectrum-4 et les DPU BlueField-3, devenant ainsi le choix courant pour les centres de données d'IA utilisant des GPU NVIDIA. La percée de Spectrum-XGS réside dans trois innovations algorithmiques et synergies matérielles qui répondent aux défis de latence de communication, de congestion et de synchronisation dans les clusters GPU interrégionaux.

1.Algorithmes de base : adaptation dynamique aux caractéristiques des réseaux-longue distance

Le cœur de Spectrum-XGS est un ensemble d'"algorithmes d'optimisation de réseau sensibles à la distance" qui analysent les paramètres clés de la communication entre les-centres de données-en temps réel-(distance, modèles de trafic, niveaux de congestion, mesures de performances) et ajustent dynamiquement les politiques de réseau :

Distance-Contrôle adaptatif des embouteillages :Contrairement au traitement uniforme de toutes les connexions par Ethernet traditionnel, les algorithmes Spectrum-XGS ajustent automatiquement les seuils de congestion en fonction des distances réelles entre les centres de données (prenant actuellement en charge des déploiements allant jusqu'à des centaines de kilomètres), évitant ainsi la perte de paquets ou l'accumulation de-transmissions longue distance.

Gestion précise de la latence :Grâce à un routage adaptatif à granularité fine-par paquet-, il élimine la gigue de latence liée aux retransmissions de paquets dans les réseaux traditionnels. La gigue est un risque critique dans les clusters d'IA : si un seul GPU est en retard en raison d'un retard, tous les GPU collaborant doivent attendre, ce qui a un impact direct sur les performances globales.

Fin-à-Fin de la télémétrie : La collecte-en temps réel de données-complètes sur les performances des liaisons depuis les GPU vers les commutateurs et les liens entre les-centres de données-fournit un retour d'information en millisecondes-pour les ajustements algorithmiques, garantissant ainsi une correspondance dynamique de l'état du réseau aux demandes de charge de travail de l'IA.

2. Synergies matérielles : tirer parti de la base de bande passante élevée-de l'écosystème Spectrum{{0}XX

Spectrum-XGS atteint des performances optimales lorsqu'il est associé à du matériel NVIDIA spécifique :

Spectre-Commutateurs X : en tant qu'épine dorsale du réseau sous-jacent, offrant une densité de ports élevée et un transfert à faible-latence.

ConnectX-8 SuperNIC : Adaptateur réseau dédié à l'IA 800 Gbit/s-pour le transfert de données à haut-transfert de données entre les GPU et les commutateurs.

Matériel d'architecture Blackwell : tels que les GPU B200 et les superpuces GB10, profondément intégrés à Spectrum-XGS pour réduire la latence de bout en bout-à-. NVIDIA validé via les tests NCCL (collective communications library) : Spectrum-XGS multiplie par 1,9 les performances de communication entre les GPU des-centres de données-tout en contrôlant la latence de bout en bout-à-à environ 200 millisecondes-par niveau. qui semble réactif et sans décalage-pour les interactions des utilisateurs, répondant aux-exigences en temps réel pour l'inférence de l'IA.

Optimisation complète de la-stack pour l'entraînement de l'IA et l'efficacité de l'inférence avec Spectrum-XGS

Spectrum-XGS n'est pas une technologie isolée, mais un ajout clé à l'écosystème d'IA full-pile de NVIDIA. Dans cette version, NVIDIA a également révélé des améliorations de performances au niveau logiciel-en synergie avec Spectrum-XGS pour la collaboration matérielle-algorithme-logicielle :

Mise à niveau du logiciel Dynamo: Optimisé pour l'architecture Blackwell (par exemple, les systèmes B200) pour multiplier par 4 les performances d'inférence de modèles d'IA, réduisant considérablement la consommation de calcul pour l'inférence de grands modèles.

Technologie de décodage spéculatif: utilise un petit brouillon de modèle pour prédire à l'avance le prochain jeton de sortie du modèle d'IA principal, réduisant ainsi le calcul du modèle principal et améliorant les performances d'inférence de 35 % supplémentaires. Ceci est particulièrement adapté aux scénarios d’inférence conversationnelle dans les grands modèles de langage (LLM).

Dave Salvator, directeur du département de calcul accéléré de NVIDIA, a déclaré que l'objectif principal de ces optimisations est de faire évoluer des applications d'IA agentique ambitieuses. Qu'il s'agisse de former de grands modèles-de paramètres ou de prendre en charge des services d'inférence d'IA pour des millions d'utilisateurs simultanés, la combinaison de Spectrum-XGS et de l'écosystème logiciel offre des performances prévisibles.

Premières applications et impact de Spectrum sur l'industrie-XGS

Premiers utilisateurs : CoreWeave Pioneers Cross-Domain AI Super FactoryCoreWeave, fournisseur de services cloud GPU, est l'un des premiers à adopter Spectrum-XGS. Le co-fondateur et directeur technique de l'entreprise, Peter Salanki, a souligné que cette technologie permettra à ses clients d'accéder à des capacités d'IA à grande échelle-, accélérant ainsi les percées dans tous les secteurs. Par exemple, prendre en charge des projets d'IA à très-grande-échelle comme l'initiative Stargate d'Oracle, SoftBank et OpenAI.

Tendances du secteur : Ethernet remplace InfiniBand en tant que réseau principal d'IABien qu'InfiniBand détenait environ 80 % du marché des réseaux backend d'IA en 2023, le secteur se tourne rapidement vers Ethernet. Le choix de NVIDIA de développer Spectrum-XGS sur Ethernet s'inscrit dans cette tendance :

Avantages de compatibilité et de coût :Ethernet est la norme universelle pour les centres de données mondiaux, plus familière aux ingénieurs réseau et moins chère à déployer qu'InfiniBand.

Projections à l’échelle du marché :Les données du groupe Dell'Oro montrent que le marché des commutateurs Ethernet pour centres de données atteindra près de 80 milliards de dollars au cours des cinq prochaines années.

La propre croissance de NVIDIA : 650 rapports du groupe indiquent que NVIDIA est le "fournisseur à la croissance la plus rapide-sur le marché des commutateurs pour centres de données 2024, avec un chiffre d'affaires de son activité de réseau atteignant 5 milliards de dollars au cours du trimestre2 2024 (se terminant le 27 avril), en hausse de 56 % d'une année-sur-année.

Le lancement de Spectrum-XGS étend la stratégie de monopole full-de NVIDIA dans l'infrastructure d'IA, tout en suscitant de nouvelles dynamiques concurrentielles :

Présentation de la pile-complète de NVIDIA : Des GPU (Blackwell), des interconnexions (NVLink/NVLink Switch), des réseaux (Spectrum-X/Spectrum-XGS, Quantum-X InfiniBand) jusqu'aux logiciels (CUDA, TensorRT-LLM, microservices NIM), NVIDIA a formé un boucle fermée couvrant le "logiciel de calcul-connexion-" pour l'infrastructure d'IA. Spectrum-XGS est en synergie avec NVLink pour une mise à l'échelle à trois-niveaux : intra-rack (NVLink), intra-centre de données-(Spectrum-X) et entre-centre de données- (Spectre-XGS).

Réponses des concurrents : La technologie SUE antérieure de Broadcom partage des objectifs similaires avec Spectrum-XGS, visant à optimiser les performances Ethernet pour combler l'écart avec InfiniBand. De plus, des fournisseurs comme Arista, Cisco et Marvell accélèrent le développement des commutateurs Ethernet dédiés à l'IA-, la concurrence se concentrant sur la compatibilité des écosystèmes en termes de performances-coût-.

La valeur fondamentale de Spectrum-XGS réside dans le fait de faire évoluer le centre de données d'IA des "contraintes d'un seul-site" à une "collaboration inter-régionale". À mesure que l'énergie et l'espace foncier deviennent des limites strictes pour les centres de données uniques, les super-usines d'IA à travers-villes et-pays deviendront la forme de base prenant en charge les applications d'IA de nouvelle-génération (par exemple, l'intelligence artificielle générale, les clusters d'agents à grande échelle{{9}).

Comme l'a expliqué Gilad Shainer, vice-président senior du département réseau de NVIDIA, lors de la conférence Hot Chips : "Les réseaux physiques à fibre optique entre-centres de données-existent depuis longtemps, mais les algorithmes logiciels comme Spectrum-XGS sont la clé pour libérer les véritables performances de ces infrastructures physiques."

Envoyez demande