慕托小记慕托小记
OpenAI 服务故障速览:API/ChatGPT/Codex 同时告警
#openai#outage#api#chatgpt#codex

OpenAI 服务故障速览:API/ChatGPT/Codex 同时告警

2026/07/25

OpenAI 服务故障速览:API / ChatGPT / Codex 同时告警,开发者该做什么

故障概况

根据 OpenAI 官方状态页 status.openai.com 的截图,当前页面顶部出现黄色警示条:

截图 openai

We're currently experiencing issues 受影响服务:APIs、ChatGPT、Codex

具体事件描述为:

  • 事件名称:Elevated error rates(错误率升高)
  • 状态:Investigating(调查中)
  • 持续时间:截图时已持续 19 分钟
  • 影响范围:APIs、ChatGPT、Codex 三项同时标黄
  • 对照组:FedRAMP、Ads Platform 两项仍显示绿色✅,说明故障没有波及全部基础设施,大概率是核心推理/网关层面的问题,而非整体机房或全站级别的中断

这是一次服务可用性故障,状态页机制和 AWS、GitHub、Cloudflare 等大厂的 status page 是同一套逻辑——不代表公司经营出问题,纯粹是技术层面的服务中断。

从开发者角度看,这意味着什么

如果你的产品依赖 OpenAI API(含 Codex/编程相关调用),"Elevated error rates" 通常对应以下几种表现:

  1. 请求超时或 5xx 错误增多:调用成功率下降,而不是 100% 失败
  2. 响应延迟升高:P95/P99 延迟明显变差
  3. 部分区域/部分模型受影响更明显:不同模型、不同 endpoint 故障程度可能不一致

应对建议

  • 重试机制:确保客户端有指数退避(exponential backoff)+ 抖动(jitter)的重试逻辑,避免故障期间的重试风暴加重问题
  • 超时设置:适当调大超时阈值,但避免无限等待,建议配合熔断(circuit breaker)
  • 降级方案:核心链路可考虑接入备用模型供应商,或在故障期间切换到本地缓存/简化逻辑
  • 监控告警:接入 status.openai.com 的 RSS/Webhook 订阅,第一时间感知官方状态变化,而不是等用户反馈
  • 日志记录:故障期间保留详细请求日志,便于故障恢复后核对是否有数据丢失或重复提交问题

小结

这类"Elevated error rates"故障在大型 AI 服务商中并不罕见,通常几十分钟到几小时内会恢复,官方状态页会持续更新进展。建议开发者养成订阅 status page 更新的习惯,把第三方 API 依赖当作会出故障的外部系统来设计架构,而不是当作永远稳定的黑盒。