Hugging Face sfida Nvidia con il nuovo servizio HUGS | Llm cosa e | Llm cosa sono | Large language models examples | Turtles AI
Hugging Face sfida Nvidia con la sua nuova offerta HUGS, promettendo costi inferiori e una compatibilità più ampia per i modelli AI. Grazie alla containerizzazione, gli utenti possono implementare modelli su vari hardware senza dover ottimizzare manualmente il sistema.
Punti chiave:
- Hugging Face lancia HUGS, concorrente dei NIM di Nvidia.
- HUGS offre costi inferiori e supporto per vari hardware.
- Gli utenti possono utilizzare container preconfigurati senza ottimizzazione complessa.
- Disponibilità di modelli open source popolari e prossima espansione.
Hugging Face ha recentemente introdotto HUGS, un nuovo servizio che mette in discussione le aspirazioni di Nvidia nel settore dei software per l’AI. Questo servizio si propone come una soluzione alternativa agli Inference Microservices (NIM) di Nvidia, offrendo la possibilità di eseguire e distribuire modelli di linguaggio di grandi dimensioni (LLM) su una varietà di hardware, riducendo significativamente i costi per i clienti. HUGS è essenzialmente composto da immagini di modelli containerizzati, pronte all’uso e progettate per semplificare il processo di implementazione. Gli utenti, piuttosto che dover affrontare le complessità di vLLM o TensorRT LLM per ottimizzare le performance, possono semplicemente avviare un contenitore preconfigurato tramite Docker o Kubernetes e interagire con esso utilizzando le consuete chiamate API di OpenAI. Questo approccio, basato su tecnologie open source come Text Generation Inference (TGI) e Transformers, offre la flessibilità di operare su diverse piattaforme hardware, comprese le GPU di Nvidia e AMD, con piani futuri per supportare anche acceleratori specializzati come Inferentia di Amazon o TPU di Google. Tuttavia, al momento, Intel Gaudi non sembra essere incluso nel supporto. È importante notare che, sebbene HUGS si fondi su tecnologie open source, non è un servizio gratuito; il costo per l’utilizzo su piattaforme cloud come AWS o Google Cloud è di circa 1 dollaro all’ora per contenitore. In confronto, Nvidia addebita una cifra simile per l’uso delle GPU in cloud, ma richiede un costo annuale notevole per l’implementazione on-premises. Per modelli più complessi come Llama 3.1 405B di Meta, la soluzione di Hugging Face risulta economicamente più vantaggiosa, con la possibilità di operare su un’ampia gamma di hardware, evitando così le limitazioni dell’ecosistema Nvidia. Per chi desidera testare HUGS su scala ridotta, le immagini saranno disponibili anche su DigitalOcean, sebbene i costi di elaborazione siano ancora applicabili. DigitalOcean ha recentemente lanciato macchine virtuali potenziate da GPU Nvidia H100, con costi che variano da 2,5 a 6,74 dollari all’ora. Inoltre, gli utenti abbonati all’Enterprise Hub di Hugging Face, pagando 20 dollari al mese, potranno implementare HUGS sulla propria infrastruttura. Hugging Face si mantiene prudente nella scelta dei modelli, focalizzandosi su alcuni dei più popolari nel panorama open source, come il Llama 3.1 di Meta e i modelli di Mistral AI. È prevista anche un’espansione futura con l’inclusione di altri modelli, come quelli della serie Phi di Microsoft. Nonostante l’offerta di Hugging Face, chi è interessato può sempre optare per sviluppare modelli containerizzati autonomamente, utilizzando strumenti come vLLM o TensorRT. La vera essenza di ciò che si paga, sia per HUGS che per i NIM, risiede nel tempo e nell’impegno necessari per configurare i contenitori affinché possano funzionare al meglio.
Nel panorama in continua evoluzione dell’AI, la competizione tra Hugging Face e Nvidia potrebbe segnare una svolta significativa.
