Le cluster Huawei asent Wanka révèle: comment apprivoiser la "grande bête" de la puissance de calcul de l'IA?

Sina - 09/06
Le cluster Huawei asent Wanka révèle: comment apprivoiser la "grande bête" de la puissance de calcul de l'IA?

introduction

Avez-vous remarqué que l'IA devient de plus en plus "intelligente" de nos jours? Être capable d'écrire des romans, de faire des traductions et même d'aider les médecins à regarder des films CT est inséparable d'une "usine Super Brain" qui fonctionne silencieusement - un groupe de puissance de calcul de l'IA.

Alors que l'intelligence artificielle évolue du simple jugement de règles à un grand modèle qui peut traiter des milliards de paramètres, la puissance de calcul d'un seul ordinateur est comme un petit Sampan face au vaste océan, tandis que le cluster d'alimentation de calcul relie des dizaines de milliers ou même des centaines de milliers d'ordinateurs comme des blocs de construction.

Lorsque nous intégrons des dizaines de milliers d'ordinateurs dans un ensemble organique, nous devons résoudre une série de problèmes mondiaux: comment les faire fonctionner ensemble comme des horloges de précision? Comment maintenir un fonctionnement efficace lorsque certains équipements échouent? Comment résoudre rapidement les problèmes d'interruption dans la formation à grande échelle? Ensuite, nous révélerons ces fonctionnalités clés qui prennent en charge les grappes d'alimentation de l'informatique AI une par une, et verrons comment l'équipe Huawei utilise la sagesse d'ingénierie pour apprivoiser ce monstre de puissance de calcul.

Les super nœuds sont très disponibles: une usine intelligente qui n'arrête pas de travailler pendant 24 heures

Tout comme le système d'urgence de l'hôpital doit être en ligne tout le temps, la formation et le raisonnement de l'IA ne peuvent pas être facilement interrompus. Chaque ordinateur du cluster d'alimentation informatique a un "superviseur". Lorsqu'une machine échoue (comme une panne de courant soudaine ou des dommages matériels), le système démarrera immédiatement la machine de secours pour reprendre la tâche, tout comme la transmission de manière transparente du bâton dans une course de relais, garantissant que les tâches telles que la formation autonome et la reconnaissance vocale continuent de fonctionner et ne seront pas complètement arrêtées en raison de défaillances individuelles d'équipement.

Pour les super nœuds CloudMatrix 384, l'équipe Huawei a proposé une solution de tolérance aux défauts pour l'ensemble du super nœud, qui est divisé en "tolérance au niveau du niveau du système", "tolérance aux défauts au niveau commercial" et "tolérance de défaut de niveau d'entreprise". L'idée principale est de transformer les problèmes de défaut en problèmes de sous-santé et de les éliminer par le biais de méthodes de maintien de l'opération:

(1) Tolérance au défaut au niveau du système: tromper le commutateur de routage du réseau OS + dans les réponses Super ERA, empêcher les écrans bleus du système et éviter toute la défaillance au niveau du nœud.

(2) Tolérance aux pannes au niveau de l'entreprise: les locataires n'ont aucune perception et tolèrent les défaillances du flash du réseau par le biais de réessayer et de transformer les défaillances du système en sous-santé.

(3) Tolérance aux déf...
[Courte citation de 8% de l'article original]

Loading...