• 回答数

    0

  • 浏览数

    1

  • 收藏数

    0

作者:塞翁364 发表于 2 小时前
跳转到指定楼层

AI + SRE ≠ AISRE:AI 如何真正进入生产运维闭环|QCon上海

从「构建 AI」到「驾驭 AI」,100+ 实战案例拆解 AI Native 时代的工程新实践!

2026 年 QCon 全球软件开发大会大会 · 上海站

将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

在这一背景下,2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办,聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向,邀请全球技术社区与产业一线的实践者,系统性分享前沿洞察与实战经验,共同探索 AI 从能力到系统、从实验到生产的真实路径。

携程 & 大数据平台 SRE 总监周昕毅已确认出席 “理性驾驭 AI 的 SRE 可靠性工程” 专题,并发表题为《AI + SRE ≠ AISRE:AI 如何真正进入生产运维闭环》的主题分享。AI 正快速进入研发、测试与运维场景,但“给 SRE 加一个 AI”并不等于真正的 AISRE。尤其在大数据平台中,故障链路复杂、组件依赖繁多、运维知识高度依赖专家经验,AI 从“辅助分析”走向“生产执行”仍面临信任、知识与闭环等问题。本次分享将结合携程大数据平台的实践,围绕稳定性、运维效率与成本治理三个典型场景,分享 AI 如何真正进入 SRE 的生产闭环。

周昕毅,携程大数据平台 SRE 总监。毕业于同济大学软件学院,在云计算、大数据、基础设施运维及 SRE 等领域有 20 年工作经验。目前负责携程大数据基础平台建设及运维管理相关工作。参与编写 SREelite《SRE 实践白皮书》。他在本次会议的详细演讲内容如下:

演讲提纲

1. 开场:AI 到底能不能接管 SRE?

从三个真实问题切入:

  • 告警来了,AI 能不能自己判断?

  • 服务异常,AI 能不能自己修?

  • 存储成本上涨,AI 能不能自己找出浪费?

结论:AI 能回答 SRE 的问题,不代表 AI 能承担 SRE 的工作。

2. 从 AI 辅助到 AI 闭环:SRE 的 AI 化到底意味着什么?

  • AI 看懂告警、日志、指标

  • AI 关联上下文并定位根因

  • AI 生成处置方案

  • AI 调用工具执行操作

  • AI 验证执行结果并形成反馈

结论:真正的 AISRE,不是增加一个 AI Copilot,而是让 AI 进入完整的运维闭环。

3. 实践一:从“告警”走向“自愈”——AI 如何参与生产故障处置?

  • 痛点还原

    告警噪音大,定位慢,人工处置依赖经验

  • 闭环体系设计

    告警收敛与分级策略

    根因定位:从"报警"到"给答案"

    自愈执行:预案库加自动触发机制

    人工审核兜底:人监督 AI 的落地形式

  • 效果

    平台故障 MTTR 降低 50%

    关键踩坑点:自愈误操作的防护机制

4. 实践二:从“专家经验”到“智能诊断”——核心组件故障如何让 AI 真正理解?

  • 痛点还原

    组件种类多,问题现象分散,诊断依赖资深专家

  • 工具设计思路

    诊断知识的结构化沉淀,包含案例库、规则库

    AI 辅助分析:日志理解加指标关联

    工具化设计:诊断能力作为可调用服务

  • 效果与经验

    新人上手时间缩短,on-call 压力下降

    踩坑点:AI 给出错误诊断建议的处理机制

5. 实践三:从“资源监控”到“成本治理”——AI 如何参与存储优化决策?

  • 痛点还原

    存储成本持续膨胀,人工治理效率低

  • 工具建设思路

    数据访问特征采集与冷热识别模型

    自动化分级存储策略推荐

    与业务方的协作闭环

  • 效果

    存储单价下降 20%

    踩坑点:冷热判断误判对业务的影响及补救措施

6. 总结:从 AI 辅助走向 AI 原生运维

  • AISRE ≠ AI + SRE 的简单叠加

  • 三个实践背后的共同基础

  • 演进路径与未来展望

实践痛点

1. 自动化执行的信任建立需要过程

  • 告警自愈闭环上线初期,工程师对"AI 自动操作生产环境"普遍存在顾虑。需要经历"只看不动→人工确认后执行→低风险操作自动执行"的渐进式信任建立过程,不能一步到位

2. 知识沉淀是需要建立闭环机制而非一次性工程

  • 智能诊断工具的核心是知识库,但故障经验高度依赖老专家,提炼和结构化的过程阻力大、耗时长,且随着组件版本迭代需要持续维护,容易出现"知识库上线即过时"的问题。

3. 效果评估的量化存在难度

  • 目前虽然通过 MTTR 可以进行一定程度的量化,但 MTTR 的影响因素不能完全归因于 AISRE 的相关实践

演讲亮点

  • SRE 相关实践具有普适性,对其他 SRE 团队有参考价值,不只是晒成果,而是给同行一套可复用的方法论

听众收益

1. 一个可复用的方法论框架

  • “数据友好→开发友好→运维友好”三层递进模型,帮助听众评估自身团队的 AI 落地成熟度,避免跳步建设的陷阱

2. 三个可落地的工程实践

  • 告警+自愈闭环的设计思路与防误操作机制

  • 大数据组件智能诊断工具的知识结构化方法

  • Storage Insight 冷热数据识别的实现路径

  • 每个实践均来自携程生产环境,有具体踩坑经验可借鉴。

3. 一个清醒的认知校准

  • 明确“AISRE ≠ AI + SRE 简单叠加",帮助听众识别团队当前瓶颈到底是 AI 能力不足还是基础设施不够成熟,避免在错误的层面投入资源

4. 真实的效果数据参照

  • MTTR 降低 50%、存储单价下降 20%,为听众在内部推动类似项目时提供可引用的行业参照数据

除此之外,本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化:从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践:从研发提效到业务破局、AI Infra:算力效率决定规模化落地、AI Native 架构等 20 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。

查看更多详情可扫码或联系票务经理 18514549229 进行咨询。

分享:
0
收藏收藏 转播转播 分享淘帖
回复

使用道具

成为第一个回答人

您需要登录后才可以回帖 登录 | 立即注册
手机版|小黑屋|大厂乐乎 |京ICP备2021013067号-3|京公网安备 11010502048691号