DeepSeek innova l’AI: nuovo metodo di ragionamento e attesa per il modello R2 | Llm informatica | Llm chatgpt | Chatgpt login | Turtles AI
DeepSeek, in collaborazione con l’Università di Tsinghua, ha sviluppato una tecnica innovativa che combina il Generative Reward Modeling (GRM) e il Self-Principled Critique Tuning (SPCT) per migliorare le capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM). Questa metodologia consente agli LLM di produrre risultati più accurati e in linea con le preferenze umane.
Punti chiave:
- Sviluppo di una nuova tecnica che integra GRM e SPCT per potenziare il ragionamento degli LLM.
- Collaborazione tra DeepSeek e l’Università di Tsinghua per questa innovazione.
- I modelli DeepSeek-GRM hanno superato i metodi esistenti, raggiungendo prestazioni competitive.
- DeepSeek prevede di rendere open source i modelli GRM, senza specificare una tempistica.
La start-up cinese DeepSeek, in collaborazione con l’Università di Tsinghua, ha introdotto una nuova metodologia per migliorare le capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM). Questa tecnica combina il Generative Reward Modeling (GRM) e il Self-Principled Critique Tuning (SPCT), come descritto in un articolo pubblicato su arXiv. L’approccio mira a guidare gli LLM verso risultati più accurati e allineati alle preferenze umane, consentendo risposte più precise alle query generali. I modelli risultanti, noti come DeepSeek-GRM, hanno superato i metodi esistenti, raggiungendo prestazioni competitive con solidi modelli di ricompensa pubblica. La modellazione della ricompensa è un processo che orienta un LLM verso le preferenze umane. DeepSeek intende rendere open source questi modelli, sebbene non sia stata fornita una tempistica precisa. Questo sviluppo avviene mentre si intensificano le speculazioni sul prossimo rilascio del modello di prossima generazione dell’azienda, il DeepSeek-R2, successore del DeepSeek-R1, che ha scosso la comunità tecnologica globale con le sue prestazioni paragonabili a modelli leader, ma a costi significativamente inferiori. DeepSeek, fondata nel 2023 da Liang Wenfeng, è finanziata dal fondo speculativo High-Flyer, anch’esso fondato da Liang. L’azienda ha recentemente aggiornato il suo modello V3, denominato DeepSeek-V3-0324, migliorando le capacità di ragionamento e la competenza nella scrittura cinese.
Inoltre, ha reso open source cinque dei suoi repository di codice, promuovendo la trasparenza e la collaborazione nella comunità di AI.
