Apple utilizza i chip TPU di Google per l’addestramento dell’AI | Large language models wikipedia | Ia generativa online | Aziende ai quotate in borsa | Turtles AI
Punti chiave:
- Apple utilizza i chip TPU di Google per l’addestramento dell’AI, invece delle GPU di NVIDIA.
- L’Apple Foundation Model (AFM) è stato addestrato su 8192 chip TPUv4 e 2048 TPUv5p.
- Il modello server AFM ha un basso tasso di violazione di contenuti dannosi rispetto a GPT-4 di OpenAI.
- Elevate percentuali di soddisfazione per la sintesi di email, messaggi e notifiche con il modello sul dispositivo.
Apple utilizza i chip TPU di Google invece delle GPU di NVIDIA per l’addestramento dell’AI, confermando una scelta strategica innovativa. Un approccio tecnico che potrebbe sorprendere gli osservatori del settore.
Apple ha scelto una strada diversa per l’addestramento dei suoi modelli di AI, utilizzando i chip TPU (Tensor Processing Unit) di Google anziché le GPU di NVIDIA, leader del mercato. Questa decisione è dettagliata in un recente documento di ricerca che esplora le capacità di addestramento per l’AI, destinata a prodotti come l’iPhone e altre innovazioni presentate quest’anno. Il modello principale, denominato Apple Foundation Model (AFM), conta 2,73 miliardi di parametri e sfrutta i cluster di TPUv4 e TPUv5p di Google.
Il documento rivela che l’AFM, che supporta funzionalità cloud denominate Apple Cloud Compute, è stato addestrato utilizzando 8192 chip TPUv4, organizzati in pod di 4096 unità ciascuno. Questi chip fanno parte dell’infrastruttura cloud di Google, conosciuta per la sua capacità di elaborazione ad alte prestazioni. Per l’addestramento dei modelli destinati all’elaborazione sul dispositivo, come quelli utilizzati per la scrittura e la selezione delle immagini, Apple ha impiegato un modello con 6,4 miliardi di parametri, addestrato da zero con una configurazione simile a quella del server AFM. Per questi modelli sul dispositivo, Apple ha utilizzato 2048 chip TPUv5p, una versione avanzata rispetto ai TPUv4.
I dettagli tecnici del documento evidenziano anche come Apple abbia affrontato la valutazione dei modelli in termini di risposte dannose, correttezza dei fatti e soddisfazione dell’utente. I risultati sono impressionanti: il modello server AFM ha registrato un tasso di violazione di contenuti dannosi del 6,3%, significativamente inferiore rispetto al 28,8% di GPT-4 di OpenAI. Analogamente, il modello sul dispositivo ha mostrato un tasso di violazione del 7,5%, contro il 21,8% di Llama-3-8B, sviluppato da Meta.
Nell’analisi delle prestazioni per la sintesi di email, messaggi e notifiche, il modello AFM sul dispositivo ha ottenuto percentuali di soddisfazione rispettivamente del 71,3%, 63% e 74,9%. Questi risultati superano quelli di altri modelli come Llama, Gemma e Phi-3, confermando l’efficacia del modello di Apple in queste applicazioni.
Questa mossa strategica di Apple evidenzia una preferenza per le capacità di elaborazione specifiche dei TPU rispetto alle GPU, sottolineando l’importanza di scelte hardware diversificate per ottimizzare l’efficienza e le prestazioni dei propri modelli di AI. La selezione dei TPU di Google, con la loro capacità di elaborare grandi quantità di dati con alta efficienza energetica, rappresenta una decisione tecnica ponderata, soprattutto in un mercato dove le GPU di NVIDIA dominano tradizionalmente. Questa scelta potrebbe riflettere un desiderio di Apple di diversificare i propri fornitori di tecnologia, nonché di ottimizzare i costi e le prestazioni per le specifiche esigenze dei loro prodotti e servizi AI.
