OpenAI rilascia gpt‑oss: modelli open avanzati, leggeri e pronti all’uso su GPU standard | Large language models italiano | Llm wikipedia | Llm nlp | Turtles AI
OpenAI rende disponibili gpt‑oss‑120B e gpt‑oss‑20B, modelli open-weight di ragionamento avanzato, scaricabili gratuitamente e ottimizzati per GPU consumer. Entrambi offrono capacità competitive, documentazione completa sulla sicurezza e strumenti di fine-tuning responsabile.
Punti chiave:
- Open source con licenza Apache 2.0, utilizzabili commercialmente e redistribuibili.
- GPT‑oss‑120B eguaglia le performance di o4-mini pur funzionando su GPU da 80 GB.
- GPT‑oss‑20B funziona su dispositivi con sola 16 GB di memoria, ideale per edge.
- Test di sicurezza con fine-tuning avversarial simulato assicurano basso rischio di uso improprio.
OpenAI ha presentato oggi una nuova famiglia di modelli linguistici a pesi aperti, gpt‑oss‑120B e gpt‑oss‑20B, già disponibili su Hugging Face e altre piattaforme come Azure e AWS: il modello da 117 miliardi di parametri (attivi 5,1 B per token, attivando 4 esperti su 128 per layer) offre prestazioni paragonabili a o4‑mini nei benchmark di ragionamento, codifica, matematica competitiva e conversazioni complesse di salute, pur operando su una singola GPU da 80 GB; l’opzione da 21 miliardi di parametri (attivi 3,6 B, 4 esperti su 32 per layer) è ottimizzata per hardware consumer con almeno 16 GB di memoria e ottiene risultati simili a o3‑mini. Entrambi sono distribuiti sotto licenza Apache 2.0, consentendo download, adattamento e integrazione libera in progetti commerciali o accademici. OpenAI ha condotto valutazioni interne ed esterne di sicurezza, tra cui fine-tuning avversarial nei settori biologico e informatico, senza riscontrare capacità elevate di rischio anche sotto attacco simulato; la metodologia di “malicious fine-tuning” è stata esaminata da esperti esterni, e OpenAI pubblicherà carta di sicurezza, griglie di valutazione e codice usato. Dal punto di vista operativo, NVIDIA ha ottimizzato i modelli per le GPU GeForce RTX (inclusa RTX 5090) garantendo velocità fino a 256 token/sec sui PC con strumenti come llama.cpp e Ollama. Inoltre, AWS ha integrato gpt‑oss‑120B e gpt‑oss‑20B nei suoi servizi Bedrock e SageMaker, indicando un’efficienza costo‑prestazioni superiore a modelli come Gemini, DeepSeek‑R1 e persino o4‑mini. OpenAI sottolinea che si tratta del suo più ambizioso rilascio open-weight dalla pubblicazione di GPT‑2 nel 2019, con l’obiettivo di aumentare l’accessibilità dell’AI avanzata in ambienti con restrizioni di risorse o dove servono garanzie di trasparenza e controllo. Lo stack tecnico include quantizzazione 4‑bit (MXFP4), attenzione multi‑query e tokenizer o200k_harmony: tutto open source per supportare personalizzazione e compatibilità tra framework. Infine, grazie alla natura open-weight e alla rimozione delle barriere dell’accesso cloud, sviluppatori indipendenti e startup possono eseguire e tarare l’AI sulla propria infrastruttura locale, favorendo una nuova fase di sperimentazione responsabile e decentralizzata.
Un modello aperto, potente e ben documentato per progetti dove autonomia e trasparenza contano.


