AMD prepara notebook con chip per modelli linguistici avanzati | Cpu Hardware Types | Hardware Computer | Cpu Hardware List | Turtles AI
Punti chiave:
- AMD punta a eseguire modelli linguistici da 30 miliardi di parametri a 100 token al secondo sui notebook.
- Le attuali limitazioni di memoria e larghezza di banda richiedono nuove soluzioni tecniche.
- Tecniche come i modelli a miscela di esperti e la decodifica speculativa possono aiutare a ridurre le esigenze di larghezza di banda.
- Il formato Block FP16 introdotto da AMD riduce l’impronta di memoria senza compromettere troppo la precisione.
AMD sta tracciando un percorso ambizioso per i suoi futuri processori destinati ai notebook, mirando a far girare modelli di grandi dimensioni dell’AI direttamente sui dispositivi locali. L’obiettivo è quello di eseguire modelli linguistici con 30 miliardi di parametri a una velocità di 100 token al secondo, con una latenza del primo token di 100 millisecondi. Attualmente, i processori Ryzen AI della serie 300 Strix Point, presentati al Computex, possono gestire modelli fino a 7 miliardi di parametri a 4 bit di precisione, raggiungendo circa 20 token al secondo con latenze che variano tra 1 e 4 secondi per il primo token.
L’ottimizzazione hardware e software sarà cruciale per raggiungere questi obiettivi ambiziosi. La memoria e la larghezza di banda diventano i fattori limitanti principali: il bus di memoria a 128 bit dei processori Strix Point, abbinato alla LPDDR5x, offre una larghezza di banda di circa 120-135 GBps. Tuttavia, per gestire un modello da 30 miliardi di parametri quantizzato a 4 bit, sarebbe necessario più di 1,5 TBps di larghezza di banda, simile a quella di una scheda Nvidia A100 PCIe da 40GB con HBM2, ma con un consumo di energia significativamente superiore.
AMD dovrà dunque affrontare diverse sfide tecniche per aumentare sia la capacità che la velocità della memoria LPDDR. L’uso della memoria ad alta larghezza di banda (HBM) potrebbe essere una soluzione, ma questo comporterebbe un aumento dei costi e del consumo energetico, rendendo i notebook meno accessibili.
Esistono diverse tecniche per ridurre le esigenze di larghezza di banda. Un esempio è l’uso di modelli a miscela di esperti (MoE), come il modello Mixtral di Mistral AI, che divide il modello in sottomodelli più piccoli. Un MoE costituito da sei modelli da cinque miliardi di parametri richiederebbe solo circa 250 GBps di larghezza di banda per raggiungere l’obiettivo di 100 token al secondo a 4 bit di precisione. Un’altra strategia è la decodifica speculativa, dove un modello leggero genera una bozza che viene poi affinata da un modello più grande, migliorando le prestazioni complessive.
I modelli odierni sono solitamente addestrati utilizzando dati in floating point 16 (FP16), che richiedono due byte per parametro. Pertanto, un modello da 30 miliardi di parametri necessiterebbe di 60GB di memoria per funzionare a precisione nativa. La quantizzazione a 8 o 4 bit riduce significativamente l’impronta di memoria, sebbene con una perdita di precisione e un aumento della probabilità di errori.
Per affrontare queste sfide, AMD ha introdotto nel suo NPU XDNA 2 il formato Block FP16, che utilizza 9 bit per parametro grazie all’uso di esponenti condivisi tra otto valori floating point. Questo formato offre una precisione simile all’FP16, ma con un consumo di spazio leggermente superiore all’Int8.
Tuttavia, senza notebook dotati di almeno 48GB di memoria, sarà necessario trovare modi più efficaci per ridurre l’impronta dei modelli. È plausibile che future NPU o GPU integrate di AMD possano supportare formati di floating point a blocchi più piccoli, come MXFP6 o MXFP4, simili a quelli già supportati dalle GPU CDNA per data center.
In sintesi, i notebook del futuro vedranno un cambiamento significativo dell’hardware, con AI che diventerà una componente fondamentale direttamente sui dispositivi. Questa evoluzione richiederà una sinergia tra ottimizzazioni hardware e software per soddisfare le crescenti esigenze di calcolo senza compromettere l’accessibilità e l’efficienza energetica.
