Etched rivoluziona l’AI: Sohu, il chip specializzato per transformers | Llm Cosa Sono | Chatgpt Italiano Login | Llm Italiano | Turtles AI
Un’azienda si prepara a rivoluzionare l’hardware AI con un chip specializzato per i transformers, promettendo prestazioni senza precedenti e costi ridotti.
Punti chiave:
- Sohu è il primo chip ASIC dedicato esclusivamente ai transformers.
- Offre prestazioni superiori e costi ridotti rispetto alle GPU tradizionali.
- Ottimizzazione software semplificata grazie alla specializzazione.
- Pronto per il lancio con partnership strategiche e ordini significativi già effettuati.
Etched ha intrapreso una scommessa coraggiosa, investendo nello sviluppo di Sohu, il primo chip ASIC (Application-Specific Integrated Circuit) al mondo dedicato esclusivamente ai modelli di transformers, come quelli utilizzati da ChatGPT. Questo approccio innovativo potrebbe cambiare radicalmente il panorama dell’AI, offrendo prestazioni senza pari e costi significativamente inferiori rispetto ai tradizionali GPU.
Nel 2022, Etched ha iniziato a sviluppare Sohu, un chip progettato per sfruttare al massimo l’architettura dei transformers. Mentre i chip GPU tradizionali, come quelli di NVIDIA, sono progettati per essere flessibili e supportare una vasta gamma di modelli di AI, Sohu è specificamente ottimizzato per i transformers. Questa specializzazione consente a Sohu di offrire prestazioni superiori, con una capacità di elaborazione di oltre 500.000 token al secondo per il modello Llama 70B, rendendolo notevolmente più veloce e più economico rispetto alle GPU di ultima generazione.
I modelli di AI basati su transformers, come ChatGPT, Sora e Gemini, sono attualmente i più avanzati nel campo dell’intelligenza artificiale. Questi modelli richiedono enormi risorse di calcolo per l’addestramento e l’inferenza, e l’approccio di Etched mira a risolvere proprio questo problema. Sohu non può eseguire modelli AI tradizionali come i DLRM per la pubblicità su Instagram o i modelli di piegatura delle proteine come AlphaFold 2, ma per i transformers offre prestazioni imbattibili.
La strategia di Etched si basa sul principio che la scala è fondamentale per l’intelligenza artificiale. Negli ultimi cinque anni, i modelli AI sono diventati più intelligenti grazie all’uso di quantità sempre maggiori di risorse di calcolo. Meta, ad esempio, ha utilizzato 50.000 volte più potenza di calcolo per addestrare Llama 400B rispetto a OpenAI per GPT-2. Questo aumento della scala ha portato a miglioramenti significativi nelle prestazioni dei modelli AI.
Tuttavia, l’espansione delle infrastrutture necessarie per sostenere questi modelli è estremamente costosa. I futuri data center richiederanno investimenti superiori al PIL di alcune nazioni. Attualmente, il problema non è la disponibilità dei dati, ma la capacità di elaborazione necessaria per gestirli efficacemente. Le GPU stanno raggiungendo i loro limiti, con miglioramenti nelle prestazioni ottenuti principalmente aumentando le dimensioni dei chip piuttosto che migliorandone l’efficienza.
Etched ha riconosciuto questa limitazione e ha puntato sulla specializzazione. I chip specializzati sono inevitabili in un panorama dove l’architettura dei modelli di AI tende a convergere verso i transformers. Con costi di addestramento dei modelli che superano il miliardo di dollari e costi di inferenza che arrivano a dieci miliardi, un miglioramento dell’1% giustifica ampiamente lo sviluppo di chip customizzati come Sohu.
Un confronto tra le prestazioni di Sohu e quelle delle GPU tradizionali mostra chiaramente i vantaggi del chip specializzato. Un server con otto chip Sohu può sostituire 160 GPU H100, offrendo un throughput superiore con un utilizzo più efficiente delle risorse. I dettagli tecnici del chip Sohu evidenziano come sia possibile ottenere un’elevata densità di operazioni matematiche grazie alla rimozione della logica di controllo superflua, raggiungendo un’utilizzazione dei FLOPS superiore al 90%, rispetto al circa 30% delle GPU.
La memoria e la larghezza di banda sono spesso considerate colli di bottiglia per l’inferenza dei modelli di AI. Tuttavia, per i modelli moderni come Llama-3, l’inferenza è limitata dal calcolo più che dalla larghezza di banda della memoria. Con tecniche come il batching continuo, è possibile massimizzare l’efficienza del calcolo, permettendo a Sohu di eseguire throughput enormi senza essere limitato dalla larghezza di banda della memoria.
Dal punto di vista del software, Sohu beneficia della sua specializzazione. Mentre le GPU e i TPU devono gestire codici complessi e flessibili, Sohu si concentra esclusivamente sui transformers, semplificando notevolmente lo sviluppo software. Le librerie di inferenza specifiche per transformers, come TensorRT-LLM e HuggingFace’s TGI, possono essere facilmente ottimizzate per Sohu, offrendo ulteriori miglioramenti nelle prestazioni.
Etched è fiduciosa che Sohu rappresenti il futuro dell’hardware AI. Con partnership strategiche con TSMC per il processo a 4nm e forniture assicurate di HBM e server, l’azienda è pronta per uno dei lanci di chip più veloci della storia. I principali ricercatori di AI e ingegneri hardware hanno lasciato importanti progetti di chip AI per unirsi a Etched, e i clienti iniziali hanno già riservato hardware Sohu per decine di milioni di dollari.
Il potenziale impatto di Sohu nel campo dell’AI è immenso. Modelli AI più veloci e meno costosi potrebbero rivoluzionare l’elaborazione video, i servizi di chat AI e molti altri settori, portando a miglioramenti drastici delle prestazioni e alla riduzione dei costi. La specializzazione di Sohu nei transformers rappresenta una svolta significativa nell’hardware AI, promettendo di superare le limitazioni delle GPU tradizionali e aprendo nuove possibilità per il futuro dell’AI.
