Un problema tecnico è la causa del blocco dei servizi OpenAI per ore | ChatGPT app | OpenAI Playground | Chat GPT in italiano | Turtles AI
OpenAI attribuisce una lunga interruzione dei servizi a un problema tecnico legato a un nuovo sistema di telemetria, che ha sovraccaricato l’infrastruttura Kubernetes su cui si basano i suoi principali prodotti.
Punti chiave:
- Problema causato da un nuovo servizio di telemetria implementato da OpenAI.
- Interruzione durata circa tre ore, con impatto su ChatGPT, Sora e l’API.
- Sovraccarico dei server Kubernetes, sistema chiave per la gestione dell’infrastruttura.
- OpenAI pianifica misure per evitare il ripetersi di situazioni simili.
Mercoledì, una delle interruzioni più significative mai affrontate da OpenAI ha colpito la sua piattaforma di AI. Servizi chiave come ChatGPT, Sora e l’API dedicata agli sviluppatori sono stati coinvolti in un blocco che ha avuto inizio intorno alle 15:00, ora del Pacifico, e che ha richiesto circa tre ore per essere risolto. L’azienda ha identificato la causa principale in un nuovo sistema di telemetria, progettato per raccogliere metriche relative a Kubernetes, una tecnologia open source essenziale per la gestione dei container. Questi ultimi, che fungono da unità isolate per l’esecuzione di software, sono un pilastro fondamentale dell’infrastruttura di OpenAI.
In un rapporto pubblicato il giorno successivo, OpenAI ha chiarito che l’interruzione non è stata determinata da un problema di sicurezza né da un recente aggiornamento di prodotto. Piuttosto, il nuovo sistema di telemetria ha innescato un carico imprevisto sulle operazioni Kubernetes, in particolare sui server API utilizzati per il controllo e la gestione del cluster Kubernetes principale. Questo sovraccarico ha destabilizzato il sistema, compromettendo anche un componente critico: il servizio di risoluzione DNS. Questo sistema traduce gli indirizzi IP in nomi di dominio e permette, ad esempio, di accedere a siti web digitando nomi facili da ricordare anziché sequenze numeriche.
Un ulteriore aggravio è stato causato dalla memorizzazione nella cache DNS, che ha ritardato la diagnosi del problema. Quando un DNS memorizza temporaneamente informazioni sugli indirizzi, come quelli di siti web recentemente visitati, può fornire dati non aggiornati, rendendo più difficile individuare la portata di un errore. In questo caso, il sistema di telemetria è stato implementato completamente prima che l’impatto fosse pienamente compreso.
Nonostante il problema fosse stato individuato da OpenAI pochi minuti prima che diventasse evidente agli utenti, la risoluzione è stata lenta e complicata. I server Kubernetes, già sotto pressione, non consentivano interventi tempestivi, obbligando i tecnici a lavorare su soluzioni alternative. Secondo quanto riportato da OpenAI, il problema è stato il risultato di una combinazione di fattori: test infrastrutturali che non avevano evidenziato il rischio del sovraccarico, processi interni che hanno fallito simultaneamente e interazioni tra i vari sistemi che non erano state previste.
Per evitare futuri incidenti di questo tipo, OpenAI ha annunciato una serie di azioni correttive. Tra queste, una maggiore attenzione al monitoraggio delle modifiche apportate all’infrastruttura, l’introduzione di meccanismi più robusti per garantire accesso continuo ai server Kubernetes e una migliore gestione delle implementazioni graduali. In una nota conclusiva, l’azienda si è scusata per i disagi causati agli utenti, inclusi sviluppatori e aziende che si affidano ai suoi prodotti, sottolineando che l’incidente è stato al di sotto degli standard che OpenAI si prefigge di mantenere.
OpenAI rafforza il proprio impegno verso una gestione affidabile dell’infrastruttura, trasformando l’esperienza critica in un’opportunità di miglioramento per il futuro.
