DeepSeek-Prover-V2: il nuovo standard per la dimostrazione automatica in matematica formale | Large language models examples | Llm meaning | Llm informatica | Turtles AI
DeepSeek-Prover-V2 è un avanzato modello open source per la dimostrazione formale automatica in Lean 4. Combina decomposizione dei problemi, ragionamento informale e apprendimento per rinforzo, raggiungendo risultati eccellenti su benchmark matematici standard e problemi di competizione.
Punti chiave:
- Approccio ricorsivo alla dimostrazione: Utilizza DeepSeek-V3 per scomporre teoremi in sotto-obiettivi, facilitando la generazione di dimostrazioni passo-passo.
- Integrazione formale-informale: Combina catene di pensiero informali con prove formalizzate in Lean 4, creando un ponte tra ragionamento naturale e logica simbolica.
- Prestazioni da record: DeepSeek-Prover-V2-671B ottiene un tasso di successo dell’88,9% su MiniF2F e risolve 49 problemi da PutnamBench.
- Benchmark ProverBench: Introduce un nuovo dataset con 325 problemi formalizzati, inclusi esercizi tratti da competizioni AIME e testi scolastici, ampliando l’ambito di valutazione.
DeepSeek-Prover-V2 rappresenta un significativo passo avanti nell’automazione della dimostrazione formale di teoremi, integrando il ragionamento matematico informale e formale attraverso un modello linguistico di grandi dimensioni open source progettato per Lean 4. Sviluppato dal team di DeepSeek, il modello è stato addestrato utilizzando una pipeline di dimostrazione ricorsiva basata su DeepSeek-V3, che scompone problemi complessi in sotto-obiettivi, sintetizzando le dimostrazioni dei sotto-obiettivi risolti in un processo a catena di pensiero. Questa metodologia ha permesso di creare un dataset di avvio a freddo per l’apprendimento per rinforzo, migliorando la capacità del modello di collegare il ragionamento informale con la costruzione di dimostrazioni formali. Il risultato, DeepSeek-Prover-V2-671B, ha raggiunto prestazioni all’avanguardia nella dimostrazione di teoremi neurali, con un tasso di successo dell’88,9% nel test MiniF2F e la risoluzione di 49 problemi su 658 da PutnamBench. Inoltre, è stato introdotto ProverBench, un benchmark composto da 325 problemi formalizzati, inclusi 15 problemi selezionati dalle recenti competizioni AIME (anni 24-25), di cui il modello ne ha risolti con successo 6, evidenziando la riduzione del divario tra il ragionamento matematico formale e informale nei modelli linguistici di grandi dimensioni.
DeepSeek-Prover-V2 dimostra come l’integrazione sinergica tra linguaggio naturale, logica formale e tecniche di apprendimento avanzato possa aprire nuove prospettive nell’automazione del ragionamento matematico.


