Intel lancia ufficialmente Gaudi 3: il nuovo acceleratore AI | | | | Turtles AI

Intel lancia ufficialmente Gaudi 3: il nuovo acceleratore AI
Intel presenta Gaudi 3: L’ acceleratore AI per prestazioni avanzate e costi ottimizzati
Editorial Team25 settembre 2024

 


Intel ha annunciato oggi la disponibilità della sua nuova linea di acceleratori di AI Gaudi 3, con spedizioni a partire dal prossimo mese. Progettati per migliorare le prestazioni e il rapporto costo-efficienza nel settore dell’AI, i nuovi prodotti puntano a competere direttamente con le soluzioni già presenti sul mercato, offrendo capacità avanzate di elaborazione e memoria.

Punti chiave:

  •  Fino a 1835 TFLOPS di elaborazione FP8 di picco e 128 GB di memoria HBM2e.
  •  Configurazioni con supporto per PCIe Gen5 x16 e RDMA NIC da 200 GbE.
  •  Uplift del 9% in inferenza sui modelli LLaMA 3 8B e vantaggio competitivo di costi rispetto all’H100.
  •  Soluzione software integrata per il supporto dei principali framework di AI.

Intel ha ufficialmente rilasciato la nuova serie di acceleratori di AI Gaudi 3, che includerà diverse configurazioni, come le schede Accelerator HL-325L (OAM-compliant), Universal Baseboard HLB-325, e le PCIe CEM HL-388 Add-In-Card. Tra queste, l’Intel Gaudi 3 PCIe CEM rappresenta un’importante evoluzione tecnologica. Dotata di una potenza di elaborazione fino a 1835 TFLOPS FP8, dispone di 128 GB di memoria HBM2e, un TDP di 600W e una struttura con 8 motori di moltiplicazione di matrice, 64 Tensor Processing Core (TPC) e 22 NIC RDMA da 200 GbE, tutto racchiuso in un form factor a doppio slot. Per quanto riguarda la memoria interna, la soluzione OAM sarà equipaggiata con 96 MB di SRAM suddivisi in due stack, con una larghezza di banda complessiva di 3,67 TB/s per la HBM e 19,2 TB/s per la memoria SRAM on-die (L2). Ogni motore di moltiplicazione di matrici è caratterizzato da una struttura di array MAC 256x256 con accumulatori FP32, permettendo 64K MAC per ciclo sia per i dati BF16 che FP8.

Il Tensor Processing Core (TPC) dispone di un processore vettoriale SIMD da 256B programmabile, con il supporto di tipi di dati principali a virgola mobile e interi da 1, 2 e 4 byte. In parallelo, l’Universal Baseboard HLB-325 supporta fino a quattro acceleratori Gaudi 3 con collegamenti di interconnessione da 200 GbE e 400 GbE tramite controller QSFP-DD, con una larghezza di banda PCIe Gen5 x16 fino a 1800 GB/s per la scalabilità verticale e 800 GB/s per quella orizzontale. Questa piattaforma è ottimizzata per attività di inferenza e addestramento di modelli di AI di dimensioni ridotte.

Per quanto riguarda le prestazioni, Gaudi 3 offre miglioramenti concreti nei modelli di AI. Nella fase di inferenza su modelli come LLaMA 3 8B, si osserva un aumento del 9% nelle prestazioni rispetto a soluzioni concorrenti, come H100, mentre nel modello LLaMA 70B il throughput migliora del 19%, con una capacità di elaborazione che risulta due volte superiore per dollaro speso rispetto a H100. Il nodo di riferimento di Intel per Gaudi 3, l’HLS-3, sarà equipaggiato con CPU Intel Xeon 6900P e fino a otto schede OAM, garantendo una larghezza di banda totale fino a 67,2 Tb/s in configurazioni di scale-up.

A completare l’offerta, la piattaforma software di Intel per Gaudi 3 fornisce il supporto per le principali tecniche di quantizzazione, come FP16, BF16 e FP8, oltre ad essere compatibile con i principali framework utilizzati nell’AI generativa. Intel sta collaborando con diversi partner di settore, tra cui Dell Technologies, HPE e Supermicro per l’hardware, e con aziende come IBM, Infosys e LUMEN per l’ecosistema software. Il rilascio di Gaudi 3 rappresenta un passo importante nell’evoluzione delle soluzioni di accelerazione per l’AI, mirato a migliorare le prestazioni senza compromessi in termini di efficienza energetica e costi.

Intel rafforza così la sua presenza in un mercato altamente competitivo, puntando a offrire soluzioni più accessibili e performanti, in grado di rispondere alle crescenti esigenze del settore AI.