La série Huawei Ascend 960 doit s’appuyer sur UnifiedBus autant que sur les performances de ses accélérateurs. Cette architecture relie les unités de calcul, les processeurs, la mémoire et le stockage pour limiter les pertes de temps liées aux échanges de données dans les grandes grappes d’intelligence artificielle.
Huawei prévoit le 960DT au premier trimestre 2027 et le 960PR au troisième trimestre de la même année. L’Ascend 970 doit suivre en 2028, puis l’Ascend 980 en 2029. Ces dates et les capacités annoncées décrivent une feuille de route. Elles ne constituent pas encore une démonstration indépendante des performances obtenues en production.
Quand les échanges ralentissent une grappe
Dans un système d’IA composé de milliers d’accélérateurs, le calcul ne suffit plus à déterminer la vitesse réelle. Les NPU doivent échanger des données avec d’autres NPU, des CPU, la mémoire et le stockage. Si ces liaisons deviennent le facteur limitant, une partie de la capacité de calcul reste inutilisée.
Huawei avance qu’une grappe de 100 000 NPU peut n’utiliser qu’environ 20 % de sa capacité de calcul lorsque les communications prennent le dessus. Ce chiffre est une estimation du constructeur. Le problème technique décrit est toutefois concret : un modèle comportant 10 000 milliards de paramètres dépasse la mémoire d’un seul accélérateur et doit répartir ses données entre plusieurs composants.
Les applications agentiques ajoutent une contrainte. Elles peuvent interagir des centaines de fois par heure avec un modèle, appeler des outils et conserver des données intermédiaires. Le cache KV produit par ces échanges peut à son tour dépasser la mémoire disponible. L’infrastructure doit alors déplacer ces informations entre plusieurs niveaux de mémoire et de stockage.
UnifiedBus veut partager les ressources
UnifiedBus est l’architecture d’interconnexion que Huawei a présentée pour les liaisons à l’intérieur des armoires, entre les armoires et entre les grappes. Elle repose sur des protocoles communs et un adressage mémoire unifié afin de regrouper plus facilement les ressources de calcul et de stockage.
Huawei présente le SuperPoD comme une unité logique composée de serveurs physiques profondément interconnectés. Cette organisation doit permettre d’associer des CPU et des NPU en fonction de la charge, puis d’utiliser de la mémoire ou du stockage lorsque les ressources locales ne suffisent plus.
L’Atlas 960E illustre cette stratégie. Huawei annonce une configuration pouvant réunir jusqu’à 4 096 NPU, avec 8 EFLOPS de calcul en FP8 et la prise en charge de modèles allant jusqu’à 10 000 milliards de paramètres. L’entreprise associe cette architecture à la technologie optique Hi-ONE. Elle estime qu’environ 5 500 unités suffisent dans cette configuration, contre près de 48 000 modules optiques 800G conventionnels, avec une réduction de plus de 550 kilowatts pour la consommation de l’interconnexion.
Des grappes annoncées à une échelle supérieure
La feuille de route d’Atlas 960 prévoit un SuperPoD pouvant réunir jusqu’à 15 488 processeurs Ascend 960. Huawei lui attribue 30 EFLOPS en FP8, 60 EFLOPS en FP4, 4 460 téraoctets de mémoire et 34 pétaoctets par seconde de bande passante d’interconnexion. Le débit d’entraînement annoncé atteint 15,9 millions de jetons par seconde.
Plusieurs SuperPoD pourraient ensuite être reliés dans des SuperClusters. Huawei évoque une configuration de 512 000 NPU et une architecture capable d’évoluer à terme vers une grappe d’un million de NPU. Ces nombres indiquent une capacité d’extension annoncée. Ils ne prouvent pas que toutes ces configurations sont déjà déployées ou disponibles en volume.
Le calendrier annoncé pour l’Ascend 960, 970 et 980
Le 960DT doit arriver au premier trimestre 2027
Le 960DT est annoncé pour le premier trimestre 2027, soit trois trimestres plus tôt que dans la feuille de route précédente. Huawei lui attribue 2 PFLOPS en FP8 et 4 PFLOPS en FP4. L’accélérateur doit embarquer 288 Go de mémoire, avec une bande passante mémoire de 9,6 téraoctets par seconde et une interconnexion de 2,2 téraoctets par seconde.
Le 960PR est prévu pour le troisième trimestre 2027. Huawei ne présente donc pas la série 960 comme une puce unique, mais comme une famille de versions inscrites dans un calendrier de déploiement distinct.
Les générations 970 et 980 suivront
Huawei prévoit ensuite l’Ascend 970 en 2028 et l’Ascend 980 en 2029, selon un cycle d’une génération par an. Les chiffres détaillés de ces deux générations restent des éléments de feuille de route. Leur intérêt dépendra de la disponibilité effective des composants, de leur logiciel et des performances mesurées sur des charges réelles.
UnifiedBus vise aussi les installations plus petites
L’architecture ne se limite pas aux très grandes grappes. Huawei a présenté des appliances pouvant accueillir de une à huit unités de traitement neuronal. Deux serveurs Atlas 650E peuvent être reliés directement pour former un ensemble de 16 NPU sans commutateur intermédiaire, puis évoluer vers un SuperPoD de taille réduite.
Huawei destine cette configuration aux entreprises qui veulent exécuter localement des modèles à très grand nombre de paramètres. Le raccordement de plusieurs accélérateurs ne suffit toutefois pas à simplifier le déploiement : la mémoire disponible, les outils logiciels et l’administration d’une infrastructure distribuée restent déterminants.
L’entreprise dit également travailler avec des communautés open source pour accompagner la gestion des ressources, l’inférence et les applications agentiques. La compatibilité des frameworks, les outils de débogage et les bibliothèques de modèles seront à vérifier sur les systèmes réellement livrés.
Ce qu’il faudra vérifier avant de juger la plateforme
La proposition de Huawei déplace la comparaison du seul accélérateur vers l’ensemble de l’infrastructure. Les points les plus utiles à surveiller sont la disponibilité effective des 960DT et 960PR, les configurations réellement livrées, la bande passante mesurée sur des modèles courants, la consommation d’une grappe complète et la maturité du logiciel.
La capacité maximale d’un SuperPoD ne doit pas être confondue avec la performance d’une installation commerciale. Tant que ces mesures ne sont pas publiées dans des conditions comparables, UnifiedBus reste une réponse architecturale annoncée au problème des échanges de données, et non la preuve d’un avantage établi sur les autres plateformes.
Sources et références scientifiques
- Efosa Udinmwen. Huawei Ascend 960 SuperPoD aims to surpass Nvidia AI hardware in China, 960E with over 4,000 NPUs and an upgraded UnifiedBus Interconnect aims for 10 trillion parameters. 2026.
- Anton Shilov. Huawei details AI accelerator roadmap, pulls in next-generation Ascend NPUs by several quarters, FP4 performance of the Ascend 960PR doubles expectations. 2026.
- Huawei Unveils New UnifiedBus Computing Architecture for SuperPoDs and Clusters – Huawei.
- Huawei Launches Open-Access SuperPoD Architecture for All-Scenario Computing – Huawei.
- Huawei dévoile sa nouvelle architecture informatique UnifiedBus pour les SuperPoD et les grappes de serveurs. 2026.




