Cloudflare 又一次大规模宕机导致半数互联网瘫痪。

  • Cloudflare 的 WAF 内部变更导致全球范围内的服务中断数分钟,影响了数百万个网站和在线服务。
  • LinkedIn、Canva、Zoom、Fortnite、数字银行以及 ChatGPT 或 Claude 等人工智能工具等平台都出现了访问错误,尤其是在欧洲和西班牙。
  • 该公司排除了网络攻击的可能性,并解释说此次调整是为了缓解 React 服务器组件中的一个漏洞。
  • 这是短短几周内发生的第二起重大事件,再次引发了关于世界对单一基础设施提供商依赖性的辩论。

Cloudflare大规模宕机

今天早上,Cloudflare网络再次发生大规模故障,导致全球数百万用户无法访问网站和数字服务。此次故障始于周五清晨,对欧洲和西班牙的影响尤为严重,许多平台在数分钟内都显示加载错误和故障信息。

问题大约在09:45-10:00(西班牙半岛时间)开始出现,各种类型的网站——从社交网络到网上银行或人工智能工具——开始返回诸如“500 内部服务器错误”、“错误网关”之类的消息,或者干脆保持空白而不加载。

Cloudflare到底出了什么问题?为什么问题如此严重?

根据该公司官方状态页面显示,此次事件源于其控制面板和多个内部API 。为加强安全性而部署的Web应用防火墙(WAF)保护系统的一项变更引发了故障,最终影响了其全球网络的大部分区域。

Cloudflare解释说,此次修改旨在缓解本周早些时候在React Server Component(一种被许多现代网站使用的技术)中发现的漏洞。然而,这一调整导致WAF解析请求的方式出现意外变化,使其基础设施的可用性在几分钟内下降。

官方数据显示,在故障高峰期,控制面板及其API的可用性严重受损,全球约15%的流量受到影响。尽管负责内容分发的CDN网络和许多边缘安全功能仍保持运行,但数百万个网站的实际访问量仍然受到影响。

这类事件表明,单个服务提供商的基础设施内部故障可以在几秒钟内转化为大范围的错误,而这些用户甚至不知道他们依赖于该公司。

对 Cloudflare 服务的全球影响

受影响的平台和服务:从社交网络到数字银行

整个上午,来自不同国家的用户纷纷在社交媒体和事件报告网站上反映,许多服务已停止正常运行。在西班牙和欧洲其他地区,以下服务也出现了问题:

  • 社交网络和专业服务LinkedIn出现了服务中断和运行缓慢的情况,部分页面甚至无法完全加载。
  • 创意和工作工具Canva 和 Zoom 都出现了间歇性故障,影响了个人用户和企业用户。
  • 视频游戏和娱乐平台:标题如下 Fortnite 他们反映网络连接出现困难,导致游戏和在线服务中断。
  • 数字银行和金融服务已检测到某些机构的网上银行系统出现访问故障,例如 CaixaBank 和 Bankinter无论是在网页上还是在移动应用程序上。
  • 在线商店和电子商务类似这样的企业 MediaMarkt、迪卡侬或Vinted 他们的网站出现了加载问题。
  • 配送和消费平台在最关键的时期,Deliveroo 等外卖服务运营极不稳定。
  • 人工智能工具广泛使用的服务,例如 ChatGPT、Claude、Perplexity 或 Gemini遭受了部分或全部中断。

情况已经变得非常严重,就连专门监控服务中断的网站 Downdetector也出现了错误和故障信息,因为它也依赖于 Cloudflare 的网络。其他一些使用 Cloudflare 作为中间层的网站也出现了类似的情况,它们的页面上显示了由 CDN 平台自身“签名”的警告信息。

在许多情况下,用户会遇到错误屏幕,提示由于中间系统出现问题,请求无法正确处理,即使受影响公司的最终服务器仍然开机运行。

除了知名的大品牌之外,数千家企业门户网站、小型商店、数字媒体机构和内部业务服务也受到了此次事件的影响,间歇性故障在 Cloudflare 推出修复程序后有所缓解。

服务中断和恢复时间

西班牙时间上午 09:45 前不久,问题开始显现,多个平台几乎同时出现故障。Cloudflare 的状态页面显示,该公司于格林威治标准时间上午 08:56确认正在“调查”控制面板及相关 API 的问题。

大约上午09点20分至10点12分(半岛时间) ,该公司宣布解决方案已实施,系统进入严密监控阶段。此后,许多服务开始逐步恢复。

在西班牙,众多用户报告称,最严重的网络中断持续了约45分钟,尽管部分网站在更长时间后仍出现间歇性故障。在全球范围内,Cloudflare报告称,网络中断持续数分钟,影响了相当大比例的全球互联网流量。

该公司表示,格林威治标准时间9:20过后不久,主网络服务已恢复正常,但仍持续进行技术监控,以确保此次故障不会留下任何后遗症。一份包含事件内部分析的更详细报告预计将于今日晚些时候发布。

与此同时,依赖这些服务的机构——从银行到电子商务平台——不得不逐一检查其关键应用程序,以确认一切已恢复正常运行。

Cloudflare是互联网基础设施的关键组成部分。

为了理解这类故障的影响范围,有必要了解 Cloudflare 在网络中扮演的具体角色。该公司提供云服务,充当用户和网站之间的中介:加速内容加载、抵御攻击并帮助管理数据流量。

其关键组成部分之一是内容分发网络 (CDN),它会在分布于世界各地的服务器上复制网站和资源。这样,当用户访问某个页面时,他们并不总是访问公司的原始服务器,而是访问距离最近的 Cloudflare 节点,从而降低延迟并提高加载速度。

除此之外,它还起到安全防护的作用:系统过滤流量、检测攻击尝试、阻止恶意模式,并应用规则来保护 Web 应用程序。WAF(Web 应用防火墙)正是导致今天问题的组件,它会在请求到达最终服务器之前对其进行分析,以查找可疑行为。

Cloudflare 声称支持数千万个网站,并管理着超过全球互联网流量 20% 的流量。如此庞大的规模解释了为什么一旦其基础设施受到影响,社交媒体、人工智能服务、支付平台和数字银行等领域都会受到波及。

这种模式虽然能帮助许多公司降低成本、提高效率,但也有其弊端:一旦中心服务提供商出现故障,影响就会成倍放大。最近亚马逊网络服务 (AWS) 和微软 Azure 等其他巨头的服务中断也印证了这一点。

这不是网络攻击:这是该公司的官方说法。

从一开始,Cloudflare 就极力澄清这并非网络攻击。该公司在其网站和支持账号上发布的声明中坚称,问题源于其团队部署的一项旨在提升安全性的内部变更。

具体来说,此次更新影响了Web应用程序防火墙分析请求的方式。其目的是加强对本周在React服务器组件中发现的行业通用漏洞的防护,React服务器组件是许多现代应用程序的基础技术。

然而,此次修改却引发了一个意想不到的副作用,最终影响了部分网络的可用性。据该公司称,这一变更导致某些合法请求被错误处理,产生了 500 错误以及一系列响应失败。

Cloudflare在公开声明中解释说,漏洞修复程序已经部署完毕,并且其系统正处于持续监控之下,以防止再次发生类似事件。该公司还承诺将在未来几个小时内发布详细报告,这符合其在处理全球安全事件后一贯秉持的透明政策。

官方的澄清消除了人们对网络攻击或外部入侵的怀疑,这种假设通常在互联网基础设施的重要参与者出现故障时很快出现。

短短几周内发生的第二次重大事件

今天的事件发生在几周前另一次大规模服务中断之后。11 月 18 日,Cloudflare 的内部系统出现另一个问题,导致西班牙的 X、ChatGPT、Canva、Spotify、Movistar 等热门服务和其他主要平台离线数小时。

当天,该公司将此次事件归咎于其数据库权限系统(也是内部原因)的变更,并宣布了一系列措施以防止类似事件再次发生:加强对配置加载的控制,增加应急机制,减少错误报告占用资源的可能性,并审查其核心代理模块的故障模式。

尽管本周五的故障持续时间较短,但再次引发了企业和用户的担忧。他们意识到,在如此短的时间内发生两起严重事件,暴露了高度集中式基础设施的脆弱性。在社交媒体上,许多业内人士表达了他们的不满,并质疑这种架构的可靠性——在这种架构下,单一服务提供商处理着全球近三分之一的网络流量

一些大型客户已经开始采取行动:部分公司宣布将加快向其他服务提供商(例如 Fastly 或 Akamai)迁移,以降低所谓的“Cloudflare 风险”。在金融和电子商务等领域,监管机构也正密切关注数字基础设施应对此类大规模故障的韧性。

Cloudflare、AWS 或 Azure 的一系列事故引发了一场超越单一故障的辩论:将重要的互联网服务集中在少数几家大型公司手中,这种做法在多大程度上是可持续的?

今天发生的事情再次表明,关键服务提供商配置中一个简单、校准不当的更改就足以让半个互联网在几分钟内瘫痪:网站宕机、应用程序无响应、银行业务被阻止,用户会怀疑这是 WiFi、手机的问题,还是他们看不到但支撑着他们大部分数字生活的更大因素的问题。

推特下
相关文章:
Twitter宕机:Cloudflare全球服务中断如何影响西班牙的X公司

在 Google 中将其添加为首选来源