1. 项目研发背景与架构全景
在现代化大型微服务、分布式数据库与 Kubernetes 云原生容器集群广泛部署的背景下,系统的拓扑调用链呈网状指数级扩张。当发生底层物理网络单通、中间件脑裂或线程池耗尽时,传统 APM 监控通常会瞬间喷涌上千条告警,引发严重的“告警风暴 (Alert Fatigue)”。一线 SRE 运维人员往往深陷海量噪音,定位单点始发火灾源头需要跨数个系统翻找抓包,平均故障恢复时间 (MTTR) 居高不下。
【企业多智能体协同运维排障与工单闭环系统】创新性地构建了由 SRE 协同编排智能体、日志聚类智能体、指标异动根因推导智能体、自动化自愈沙箱智能体与 SLA 工单闭环智能体 构成的协同多智能体集群(Agent Swarm)。系统基于 Vue 3.4 + Pinia + Vite 5 + Spring Boot 3.2 + Redis 7.0 + GraphRAG 因果拓扑图谱,提供包含 PC 管理后台 6 大工作台、1080P 全景指挥大屏以及 390×780 移动端值班响应中心 的全流程闭环运维矩阵。

▲ 图 1:AIOps 智能运维指挥驾驶舱(纳管 328 个服务、实时健康评分 98.6、告警降噪比 96.4%、MTTR 4.2分钟)
2. 多智能体协同工作台与思维链推理 (Agent Swarm)
系统摒弃了单一单体大模型的黑盒调用,采用多 Agent 职责隔离与流式协同通信总线。编排 Agent 负责统筹分发,日志 Agent 毫秒级提取异常模式正则,根因 Agent 调取拓扑图谱展开因果置信度打分,沙箱 Agent 负责前后置探针校验与执行,工单 Agent 维护全周期 SLA 倒计时。

▲ 图 2:多智能体协同工作台(5 大专业 Agent 状态总览、任务队列与通信矩阵参数配置)

▲ 图 3:智能体 Chain-of-Thought (CoT) 实时推理时序与工具调用调试沙盒
3. 全链路故障根因推导与拓扑下钻 (Root-Cause Radar)
结合微服务有向拓扑网络与分布式 Trace 链路,系统在 SVG 画布上动态高亮受损中继与嫌疑根因节点。通过 GraphRAG 因果推论计算各候选源的嫌疑概率,不仅精准输出 96.8% 置信度,而且列举完整排查证据链,彻底消除运维“瞎猜”现象。

▲ 图 4:微服务拓扑依赖辐射网络与 AI 根因嫌疑概率排行榜(自动锁定 Redis 哨兵丢包脑裂)
4. 自动愈合演练与安全审批沙箱 (Self-Healing Sandbox)
为防范传统自愈脚本误杀生产环境引发次生灾害,本系统强制引入预演演练沙箱。任何限流熔断、Pod水平扩容或配置倒换策略,在真实生效前均可在沙箱中预估延迟降幅与流量受损率,并强制开启双人多因素审批与逆向补偿熔断机制。

▲ 图 5:自愈演练沙箱(延迟从 1850ms 降至 35ms 模拟指标对比、双人会签门禁与紧急熔断机制)
5. SLA 工单闭环看板与 SOP 知识库中心
事故触发后系统全自动建单,关联当前排障现场拓扑并启动 SLA 倒计时。当自愈脚本执行成功并通过健康探针验证后,智能体自动提取时序记录生成标准化的事后复盘报告 (Post-Mortem),沉淀为企业运维规则库资产。

▲ 图 6:四列工单全生命周期泳道看板(待响应、排障中、自愈演练中、已复盘闭环与 SLA 倒计时)

▲ 图 7:运维 SOP 预案知识库管理(连接池熔断、Redis切流、K8s OOM排查与向量检索命中)
6. 1080P 全景态势指挥大屏 (Screen Cockpit)
为满足企业监控大厅与重大活动(如双11大促/重大版本上线)重保要求,系统提供自适应 1920×1080 暗夜科技蓝大屏。中央全息沙盘呈现多集群微服务拓扑辐射脉冲,实时广播特级故障自愈动向。

▲ 图 8:1080P AIOps 全景指挥大屏(跨集群服务沙盘、全网可用性半圆仪表盘、MTTR走势对比)
7. 移动端 390×780 随身值班与应急响应中心
值班 SRE 专家无论是否身处工位,均可通过 390×780 移动端真机外壳完成降噪待办查阅、自然语言协同会话、指纹滑块一键自愈授权及工单跟踪。
▲ 图 9:告警流待办卡片
▲ 图 10:智能协同对话
▲ 图 11:一键自愈审批
▲ 图 12:工单时效跟踪
▲ 图 13:值班日历效能
8. 工业级全套工程源码与 PRD 文档获取
本项目提供完整的工程级交付物,涵盖 8 章节工业级 PRD.md 规格说明书、Vue3 三端全套高保真源码(PC 6大工作台 + 1080P指挥大屏 + 移动端 5大高频场景)、Mock 数据字典与 Vite 生产构建配置,开箱即用支持二次商业交付。
