Databricks 介绍 RADAR:用异常检测捕捉“灰色故障”
Databricks 博客介绍其内部系统 RADAR,用异常检测捕捉监控面板全绿却已影响部分用户的“灰色故障”。据其描述,该系统分四个阶段,官方称在自用场景中实现超过 90% 的精确率与 95% 的发现时间缩短。
核心事实
Databricks 在其官方博客发布文章,介绍一套名为 RADAR 的内部系统。据该文描述,RADAR 全称为 Reliability Anomaly Detection, Alerting, and Root-cause analysis(可靠性异常检测、告警与根因分析),用于捕捉所谓“灰色故障”(gray failure)。文章称,这类故障的特点是监控面板各项指标仍显示正常,但某一特定用户群体已在持续失败,且影响范围会逐步扩大。RADAR 被拆分为四个阶段:可靠性指标采集、异常检测、告警、根因分析。异常检测环节据称采用一种名为 SPOT 的无监督流式模型,该模型出自 Siffer 等人 2017 年 KDD 论文,以过去 14 天数据学习“正常”基线,只需一个风险参数而非人工设定阈值。
背景与影响
文章以一次假想事故说明问题:某次部署引入的缺陷导致约二十分之一使用信用卡支付的用户静默失败,而所有健康检查仍为绿色,直到数小时后才有客服工单出现。文章认为,仅依赖客户报告存在三个问题:依赖人工发现、存在延迟、且多数受影响用户不会提交工单。Databricks 称,将 RADAR 用于自身后,事故发现时间缩短了 95%,精确率超过 90%,且无需人工识别模式。文章还表示该模式不限于用户错误指标,也可用于支付与交易失败、结算异常、结账转化率、模型性能与数据分布漂移等场景。在 Databricks 平台上,四个阶段可分别对应 Zerobus、Unity Catalog、Delta Lake、MLflow、Model Serving、Workflows、Databricks SQL Alerts 以及 AI/BI Genie 等组件,并通过 Declarative Asset Bundle 整体部署。
限制与来源
上述 95% 与 90% 等数字均为 Databricks 博客自述,未提供第三方验证,本文亦未独立核实。RADAR 目前是 Databricks 的内部系统,文章描述的是其自用经验,并非已公开发布的产品功能。文中提到的组件可用性、区域支持、计费方式与具体能力,均可能随平台版本变化,请以 Databricks 官网当前信息为准。本文不构成任何采购、投资或技术选型建议。来源:Databricks 官方博客文章《RADAR: Catch gray failures with anomaly detection》。