Tech Automation INSIGHT

Informazione e analisi per ICT, automazione e embedded

Chip & Elettronica • • ⏱️ 5 min di lettura • di Giorgio Fusari

SuperPoD con tecnologia NPO per accelerare i workload AI

L’infrastruttura modulare di supercalcolo di Huawei utilizza l’architettura d’interconnessione ottica near-packaged optics (NPO) ed ha l’obiettivo di accelerare il training e l’inferenza di modelli di fondazione con 10.000 miliardi di parametri

SuperPoD con tecnologia NPO per accelerare i workload AI
Atlas 960E SuperPoD, il superPoD di Huawei con tecnologie NPO

Si chiama ‘near-packaged optics’ (NPO) ed è la tecnologia su cui è basato Atlas 960E SuperPoD, il superPoD presentato in settembre da Huawei a Shanghai, durante Huawei Connect 2026, l’evento globale della società sulle tecnologie per l’intelligenza artificiale (AI).

Definito da Huawei come «il primo superPoD al mondo equipaggiato con tecnologia NPO», Atlas 960E SuperPoD è stato sviluppato con l’obiettivo di accelerare i workload di training e inferenza AI, nel contesto di continua evoluzione dei modelli di fondazione, che stanno raggiungendo i 10 mila miliardi di parametri (10 trillion).

Per inciso, il concetto di superPoD deriva dall’acronimo POD (point of delivery) che, nel contesto dei data center e del cloud computing, indica un’unità modulare standard, un blocco predefinito di hardware costituito da una certa quantità di server, storage, switch di rete e dispositivi di alimentazione. Quando un data center deve espandere la capacità, il POD consente agli ingegneri di non dover riprogettare tutto da capo, ma semplicemente di aggiungere e connettere all’infrastruttura un altro POD identico, come se fosse un mattoncino Lego. La denominazione Atlas 960E SuperPoD appare inoltre in analogia industriale e terminologica con DGX SuperPOD, l’architettura sviluppata da Nvidia per le applicazioni HPC (high performance computing).

Architettura d’interconnessione NPO

Man mano che i modelli di fondazione si avvicinano ai 10.000 miliardi di parametri, i SuperPoD, spiega Huawei, rappresentano la strada ottimale per lo sviluppo dell’infrastruttura di intelligenza artificiale. In particolare, l’approccio progettuale dei SuperPoD di Huawei si concentra sul collegamento di tutti i componenti del cluster tramite un unico protocollo con interconnessione peer-to-peer, supportando l’accesso alla memoria tra server fisici diversi e adottando connessioni in rame a corto raggio insieme a soluzioni ottiche a lungo raggio.

Inoltre, aggiunge Huawei, la costante innovazione a livello di sistema, ha permesso di applicare la pluriennale esperienza della società nella tecnologia ottica ai propri SuperPoD, introducendo Hi-One, «il primo motore ottico NPO al mondo prodotto in serie», in grado di fornire una capacità di trasmissione pari a 7,2 Tbit/s (terabit al secondo) e «attualmente l’unico NPO del settore dotato di una sorgente luminosa integrata».

Tra le caratteristiche principali, Atlas 960E SuperPoD pone in primo piano la scalabilità e la potenza di calcolo: in virtù dell’indirizzamento unificato della memoria consentito da UnifiedBus, un singolo SuperPoD può scalare fino a 4.096 NPU (neural processing unit), erogando 8 EFLOPS (exaflops) di potenza con precisione FP8 e 16 EFLOPS con precisione FP4. Integrando 5.500 unità Hi-One, questo SuperPoD, sottolinea Huawei, elimina la necessità dei 48.000 moduli ottici da 800G tradizionalmente richiesti per interconnettere tutte le NPU. In questo modo è possibile ridurre il consumo energetico di oltre 550 kilowatt (kW) e, al contempo, raddoppiare il tempo medio di funzionamento continuo senza guasti (fault-free), raggiungendo una disponibilità di sistema del 99,8%. Tutto ciò, complessivamente, aggiunge Huawei, consente al sistema di accelerare enormemente l’innovazione nelle fasi di addestramento e inferenza dei modelli di frontiera.

Tecnologia NPO, i benefici rispetto a CPO

La transizione del mercato verso i moduli ottici con tecnologia NPO, scrive in un documento tecnico sul proprio blog la società Link-PP, fornitore globale di connettività Ethernet e componenti di optical networking, è guidata dal degrado del canale fisico, intrinseco alla segnalazione elettrica ad alta velocità. A velocità dati per canale di 112 Gbps e 224 Gbps che utilizzano la modulazione ad ampiezza di impulso a 4 livelli (PAM4), precisa Link-PP, i materiali standard per circuiti stampati - come il comune FR-4 o i substrati avanzati a bassa perdita come il Megtron - mostrano gravi perdite di inserzione del canale (channel insertion loss) su distanze superiori a 10-12 pollici (circa 25-30 cm). Di conseguenza, le moderne architetture con moduli innestabili sul pannello frontale richiedono complessi retimer e processori di segnali digitali (DSP) per ricostruire i segnali elettrici degradati, con un conseguente aumento significativo del carico termico e della complessità di progettazione dei circuiti stampati.

NPO non è tuttavia l’unica architettura d’interconnessione ottica che permette di ovviare all’attenuazione del canale senza incorrere in densità termiche proibitive. Ad esempio, spiega la società, il settore delle reti ottiche ha ideato architetture come la tecnologia CPO (co-packaged optics), che consente di avvicinare le interfacce ottiche al chip di silicio dello switch.

Tuttavia, chiarisce Link-PP, sebbene la tecnologia CPO integri i chip ottici direttamente su un substrato condiviso con il dispositivo ASIC (application specific integrated circuit) ospitante (host ASIC), essa presenta gravi rischi in termini di resa produttiva, elevata complessità di riparazione e problemi di accoppiamento termico tra l’ASIC e i diodi laser sensibili. Ecco perché, conclude Link-PP, la tecnologia near-package optics ((NPO) si è affermata come alternativa standardizzata e modulare: NPO, in sostanza, è in grado di fornire i vantaggi in termini di potenza e integrità del segnale derivanti dall’accorciamento dei canali elettrici, ma al contempo mantiene domini indipendenti di assemblaggio, collaudo e gestione termica per il motore ottico e la host logic (ASIC).