ESC
科技 1 分钟阅读

8月17日服务中断事件及后续工作

8月17日,GitHub遭遇持续7小时47分钟的服务中断,影响github.com、认证、Actions、API、拉取请求、Issues和Copilot,波及全球开发者。这是8月第二次重大事故,GitHub承诺加快可靠性改进,并已发布根因分析。

来源:Hacker News

8月17日,GitHub经历了一次持续7小时47分钟的服务中断。这次中断影响了github.com、身份认证、GitHub Actions、API、拉取请求、Issues和Copilot,波及全球各地的开发者和组织。如果你当天正试图发布软件,我们让你失望了。

这是我们在8月份第二次重大事故,此前8月6日曾发生一次Actions故障。在3月和4月,我曾分享过正在进行的提升GitHub可靠性的工作。我们取得了一些进展,但这些事故清楚地表明,我们必须加快这项工作。

我们的调查发现,这次中断始于流量达到新的峰值,而我们在美国中部数据中心的一个关键基础设施组件未能随之扩展。由此产生的容量压力在我们的系统中蔓延,导致身份认证失败,并扰乱了多项GitHub服务。

恢复需要多项协同行动。团队重新规划了流量路由,隔离了受影响的基础设施,并分阶段恢复了服务。大多数GitHub服务当天早些时候已恢复,但部分Copilot服务耗时更长。这些服务中的错误触发了客户端重试循环,在恢复期间增加了流量。我们必须先缓解这一行为,才能安全地恢复流量。完整的根因分析包括了详细的技术时间线。