面向运维的智能体 OpsAgent & 面向智能体的运维 AgentOps
议题背景:
本报告分为两个部分。
第一部分介绍面向运维的智能体 OpsAgent,系统阐述如何利用多智能体协同技术应对软件系统日益复杂的运维挑战,并介绍南开大学智能运维课题组与字节跳动、阿里巴巴等企业合作取得的研究成果,包括可解释、高准确率的根因定位基础模型 FoundRoot,以及面向操作系统故障诊断的 OScope 框架。
第二部分探讨面向智能体的运维 AgentOps。与传统信息系统不同,智能体系统的高度自主性与非确定性行为给传统运维技术带来了难以应对的新挑战。本部分将讨论如何针对复杂执行轨迹进行根因定位与可解释证据链构建,以及如何将诊断结论转化为对下一轮执行加以约束的修复动作。
内容大纲:
1. 开场与全局框架
2. OpsAgent背景与意义
2.1 现代IT系统复杂性挑战
2.2 现状对比
2.3 战略意义与国家需求
2.4 为什么选择OpsAgent
2.5 人机协同新范式
2.6 研究路线图
3. FoundRoot—微服务根因分析
3.1 问题与动机
3.2 架构核心—结构化深度思考
3.3 两阶段训练机制SFT+RL
3.4 性能突破
4. OScope—操作系统故障诊断
4.1 OS诊断的专业性门槛
4.2 OScope框架
4.3 Knowledge Aligner
4.4 Report Validator
4.5 企业部署成效
5. OpsAgent小结与展望
5.1 边界与局限
5.2 未来突破方向
6. AgentOps背景与意义
6.1 AgentOps的崛起
6.2 传统vs智能体系统对比
6.3 为什么AgentOps更难
6.4 AgentOps核心能力
6.5 路线图
7. PROBE—软件工程Agent失败恢复
7.1 AgentOps挑战
7.2 PROBE整体方法
7.3 Diagnosis Layer
7.4 Guidance Gate
7.5 性能结果
8. TraJudger—多智能体系统故障诊断
8.1 MAS诊断的现实挑战
8.2 TraJudger框架
8.3 神经-符号协同诊断
8.4 故障传播步骤设定
8.5 企业部署成效
9. AgentOps小结与展望
9.1 边界与局限
9.2 未来突破方向
10. 收尾与致谢
听众收益:
1. 建立统一的技术认知框架:厘清OpsAgent(面向运维的智能体)与AgentOps(面向智能体的运维)的对象、挑战、核心能力和演进路线,理解二者为何需要协同建设。
2. 掌握可复用的诊断与恢复方法:结合FoundRoot、OScope、PROBE和TraJudger,学习结构化推理、SFT+RL、知识对齐、报告校验、神经-符号协同、证据链构建和Guidance Gate等关键设计与技术取舍。
3. 获得工程落地的判断依据:结合性能结果、企业部署成效及边界与局限,理解各方案在微服务、操作系统、软件工程Agent和多智能体系统中的适用条件,以及如何把诊断结论转化为约束下一轮执行的修复动作。