7月25日傍晚,OpenAI的API、ChatGPT、Codex三條產品線同時報錯,31個服務組件性能下降,約1小時51分鐘後恢復。據鈦媒體7月26日報道,北京時間7月25日17時17分,OpenAI官方狀態頁發布調查通知,稱多項服務錯誤率升高;18時02分進入監控階段,緩解措施已生效;19時08分宣布全部恢復。

此次故障覆蓋三條產品線:API涉及12個組件、ChatGPT涉及15個組件、Codex涉及4個組件,合計31個服務組件性能下降。第三方監測站記錄的事故起點為UTC時間09時17分,與官方狀態頁完全吻合。用戶側表現為請求失敗、響應異常、任務中斷。其中Codex受到影響值得關注——編程Agent執行任務動輒需要數十分鐘,服務中斷可能導致大型項目整體失敗。

報道指出,將視角拉長至一個月,此次事故並非孤例。第三方狀態監測平台Bifrost的記錄顯示,從7月9日至今,OpenAI沒有一天處於「完全正常」狀態:7月12日和16日出現兩次重大故障,其餘日期在性能下降和部分故障之間反覆切換。另一監測站incidenthub的記錄同樣密集,僅7月23日一天,OpenAI就發布四起獨立事故,涉及ChatGPT錯誤率和延遲問題;24日Codex Review報錯;25日輪到三線同時崩潰。

故障原因方面,OpenAI官方尚未公布具體說明。報道提及,在Agent時代,服務中斷的影響已從聊天體驗擴展到生產系統,API背後連接著客服機器人、代碼流水線、自動化審計及Agent工作流,服務中斷直接影響生產線。對企業而言,連續17天的異常記錄將使SLA(服務等級協議)指標受到更多關注,多雲多模型路由可能從加分項變為企業AI架構的標準配置。