首页 > 资讯 > Atlassian 通过关联指标、日志与追踪链路实现根因分析自动化

Atlassian 通过关联指标、日志与追踪链路实现根因分析自动化

InfoQ 2026-09-20 11:06 5 阅读 查看原文

Atlassian 提出了一种自动化根因分析的新方法,用于应对大规模云原生事故。该方法通过跨指标、日志、分布式追踪和服务拓扑的关联分析生成关于故障起源位置及传播路径的排序假设。这项成果发布云原生计算基金会(Cloud Native Computing Foundation),旨在解决事故响应中最耗时的环节之一:运维人员需要在不同仪表盘和工具之间切换,把零散的遥测信号串联成完整故障解释。

该系统将根因分析视为一个跨信号类型、时间和拓扑的多信号关联问题。平台不再要求值班工程师手动识别异常、搜索日志和追踪记录,再重建依赖链,而是独立检测每种信号中的异常,然后将它们对齐到统一时间线上,并通过服务依赖图进行追踪。最终输出一组排序后的假设,指出可能的故障起点、传播路径及支撑证据。

Atlassian 的方案首先是缩小搜索空间。系统不会分析大型生产环境中的所有服务,而是利用基于 OpenTelemetry 的服务地图识别出与受影响用户路径相关的服务子集。该依赖图根据真实生产流量构建,利用追踪跨度之间的父子关系展示服务间的实际通信方式,而非依赖静态的架构文档。

系统对指标、追踪和日志采用不同的检测方法。指标检测关注速率、错误和时延的变化;追踪分析关注异常、时延和结构性变化;日志则被分组处理,用于识别新增或异常的错误模式。这些检测结果随后被转换为统一的异常格式用于关联分析。

在时间上相近的异常可被归组为潜在的故障序列。例如,数据库问题之后出现的应用超时和前端错误可能被判定为同一起事故的不同表现。系统还使用序列指纹技术对重复出现的故障模式去重。

然而,仅靠时间关联无法确立因果关系。系统还会考虑服务依赖关系和异常出现的先后顺序,从受影响的服务向上游追踪,以定位故障的可能源头。由此生成一个排序假设,描述事故可能的起源和传播方式。

输出结果并非简单地罗列异常,而是总结疑似原因、受影响的服务以及支撑性遥测数据。工程师可以据此审查证据、验证诊断,再采取修复措施。

随着云原生系统的分布式程度不断提高,挑战已不再是采集遥测数据,而是能够快速完成数据关联分析,支撑高效的故障响应。

工具碎片化放大了这一难题。2026 年 CNCF 社区调查显示,许多组织仍在同时运行多个可观测性平台,工程师不得不手动跨不同工具桥接指标、日志和追踪数据。Atlassian 的架构试图通过统一异常模型与具备依赖感知能力的推理引擎,替代人工做数据关联的工作。

商业可观测性平台也在朝着相似目标发展。Grafana Cloud 正在构建基于知识图谱的方法,通过关联遥测数据与基础设施关系来呈现可能的故障根因;Dynatrace 则跨来源关联事件,结合日志、指标和追踪来识别问题及其潜在影响。Atlassian 方案的不同之处在于,它专注于模块化的信号归一化流水线——单个异常检测器可独立演进,而同一关联层对所有证据进行分析。

Atlassian 表示,他们正在探索下一阶段方向:利用基于 LLM 的编排实现排查过程的迭代化。智能体不再只是运行一次 RCA 引擎并给出固定答案,而是可以主动请求额外的遥测数据、检验相互竞争的假设,并根据现有证据动态调整排查方向。不过 Atlassian 也指出,这类系统需要围绕速率限制、执行环境和证据来源设置相应的管控机制。

随着云原生架构持续叠加服务、依赖关系和遥测数据,将成千上万条互不关联的信号自动转化为少数几个有证据支撑的假设,可能会成为现代可靠性工程中最有价值的能力之一。难点在于确保这些系统保持足够的可解释性,让工程师能够信任;同时必须扎根于真实的遥测数据,让自动化手段可以加速理解过程,而不是仅仅生成一个看似更可信的猜测。

查看英文原文:https://www.infoq.com/news/2026/09/atlassian-automated-rca/