论坛主席:王 磊
华为 基础软件AI技术专家。拥有二十年软件研发、架构设计和产品经验。在AI、Serverless和DevOps领域有丰富的实战经验,著有《微服务架构与实践》、《Serverless核心技术与实践》、《DevOps实践指南》。
当前主要研究方向是Harness工程、Agentic Infra以及企业级Agent系统的落地。
华为 AI技术专家/openEuler SIG-Intelligence Maintainer

Agentic驾驭工程与Loop工程

当前智能体规模化落地的核心瓶颈,正从模型能力转向工程体系。本论坛聚焦Agentic驾驭工程与Loop工程,深度剖析如何以目标定义、上下文构建与智能体编排,驾驭智能体正确做事;以及如何以执行、验证、反馈和改进闭环,驱动智能体持续做对。同时,分享生产级架构与规模化落地实践,解析可靠性、安全治理等关键难题,助力企业构建可靠、可控、持续演进的智能体系统。
在不确定性中重建软件工程确定性:Harness Engineering 与 SDD
邱 娟
英湃数字科技  Inspire Group  AI4SE首席顾问
内容简介:
本演讲基于大型企业AI4SE咨询项目一线共创提炼:调研基线、试点共创与赋能落地。主张模型提供可能性,Harness Engineering提供约束与可靠性,SDD将变更转为Agent可执行、可审查的规格闭环。将讲清Intake→Agentic→Harness→Operating四方向实践要点与收敛逻辑,并系统展开遗留系统(Brownfield)关键取舍与反模式。        

演讲提纲:
1.开场:真实落差与实践锚点(约4分钟)
1.1工具可用、局部跑通,但端到端尚未闭环;管理层期望与团队体感的ROI Gap
1.2 实践锚点:本场方法提炼自大型企业AI4SE咨询一线(调研基线→试点共创→赋能落地),案例脱敏,非概念推演
1.3核心观点:软件工程没有银弹;AI放大不确定性,企业需主动重建确定性
1.4 本场范围:聚焦工程方法与取舍,不进行商业推广
2.看见不确定性(约6分钟)
2.1从个人AI编程工具,到组织级AI-native研发操作系统
2.2不确定性来源:外部趋势快变、内部约束各异、试点假设待验证
2.3 确定性来源:在真实团队验证场景/流程/指标,沉淀可复用资产
2.4常见反模式:采购“银弹”、只追生码率、缺少Harness约束的Agent使用
3.四方向行动框架:各方向实践要点与收敛逻辑(约12分钟)
3.1Intake/Spec实践要点:Story→可验收Spec最小字段;准入标准(边界/场景/非目标/验收)
3.2 Agentic Engineering实践要点:AI进入真实任务流;人机责任链(谁批准、谁合入);任务类型与适用边界
3.3Harness Engineering实践要点(轻述):约束、门禁、反馈与知识回流;Guides×Sensors;Context Pack可版本化
3.4Operating Model实践要点:试点→复制的治理节奏;角色/所有权;度量与Decision Log;组织级扩展条件
3.5 Golden Path:将四方向串联为可执行、可治理、可度量的研发路径
3.6收敛逻辑:组织级确定性的两个瓶颈是“约束与可靠性”(Harness)与“可执行变更契约”(SDD);前三方向在本段给足方法坐标,后两节把瓶颈讲透
4.深挖一:Harness Engineering(约10分钟)
4.1 关键判断:模型能力是基础,Harness决定企业可用性
4.2 实践洞察(脱敏):User Harness/Context Pack应可版本化、可审查、可试加载
4.3Agent≈Model+Harness,以及模型选择与Harness的工程耦合
4.4角色转型:从“改这段代码”到治理AI流程,并维护Skill/Context反馈闭环
4.5可迁移清单:结构、所有权、试加载与Decision Log(原则级,工具中立)
5.深挖二:SDD×Brownfield关键取舍与反模式(约13分钟)
5.1关键判断:规格是AI可执行变更的契约面;缺规格将导致下游补偿性澄清
5.2Brownfield主战场(重点展开)
5.2.1 金句:只为即将改动的切片写规格(增量delta),禁止“全仓Spec化遗留系统”幻想
5.2.2 Spec组织:多仓/多服务如何拆Change;规格真相≠工程知识库≠聊天上下文
5.2.3遗留识别:领域术语/历史命名与现行表述不一致;同义词映射与Context Pack注入
5.2.4混合场景:新能力对接存量系统时,成对变更与共享集成场景如何写
5.3关键取舍:Spec与代码双真相源及漂移;小改动是否走SDD;何时先explore再propose
5.4与Harness咬合:规格产物如何进入上下文与质量门禁,避免“写完Spec就扔”
5.5反模式清单:超长不可审Spec;取消Spec Review;绕过SDD直接改代码;把Greenfield流程硬套Brownfield;一次写全遗留Spec
6.总结与问答(约5分钟讲述+5分钟提问)

听众收益:
1. 建立清晰判断:理解为何仅引入Coding Agent难以形成组织级确定性,以及四方向各自解决什么问题、为何收敛到Harness与SDD。
2. 获得可迁移框架:掌握“四方向+Golden Path”与Harness/SDD深挖路径,可用于本企业试点选题与反模式排查——方法来自大型企业AI4SE咨询一线提炼。
3. 对齐Brownfield关键取舍:掌握遗留/多服务场景下“只Spec切片”、术语与知识库边界、Context回流与常见反模式(原则级、工具中立)。      
博士,专家级咨询顾问,深耕软件工程、研发效能与企业架构逾十八年。研究与实践涵盖AIOps、AI赋能软件工程与组织级工程效能改进,发表多篇深度学习相关SCI/EI国际论文,并参与头部科技企业合作科研项目。产业实践方面,曾主导全球金融科技企业超大规模代码重构;亦曾与团队共同参加多项国内外Hackathon均有获奖;另具备创业公司CTO/首席架构师经历,完成SaaS产品特别是VoC/NLP智能分析平台产品化落地。现为中国计算机学会(CCF)高级会员、CCF CTO Club成员,中国信息通信研究院MLOps实践指南编写指导专家、华东师范大学素质素养基地讲师,并受邀于SECON+ AGENTX等行业会议分享。近年在大型企业AI4SE咨询项目中与客户研发组织一线共创:从调研基线、试点验证到赋能落地,帮助将AI Coding与Agent能力转化为可度量、可治理、可规模化的工程能力。本议题方法与取舍即提炼自上述咨询实践(客户与业务细节脱敏)。
基于 Agent可观测的AI应用与大语言模型双环自进化
付光荣
中兴 AI教练
内容简介:
提出以Agent可观测性为核心驱动力,构建Agent与LLM双环协同自进化的工程体系。通过全链路Trace记录Agent“感知-思考-行动”全过程,结合显式标注与隐式反馈进行数据清洗分类,构建优质语料;一方面将数据用于大模型SFT/DPO再训练以提升基座能力,另一方面将高质量调用链自动沉淀为Agent评测集,驱动Agent Harness的持续优化与防退化回归测试,形成Agent与LLM的双向进化闭环        

演讲提纲:
1.开场与背景引入
1.1破冰与核心痛点
1.1.1提问互动:在座各位在生产环境中部署Agent时,是否遇到过“上线即巅峰,随后效果持续衰减”的困境?
1.1.2痛点剖析:Agent的非确定性行为、多步推理的复杂性,使得传统的“开发-测试-上线”线性模式失效。线上长尾问题(Bad Case)难以被全面捕获,模型与Agent的迭代缺乏真实数据的喂养。
1.2破局之道:可观测性驱动自进化
1.2.1提出核心论点:Agent的可观测性不应仅仅停留在“监控与排障”层面,它更是驱动Agent与大模型持续进化的“数据飞轮”。
1.2.2演讲主线预告:从数据采集、清洗反馈、模型再训练到评测集沉淀,构建一套完整的自进化工程闭环。
2.基石:构建面向进化的Agent可观测体系
2.1超越传统APM的Agent可观测性
2.1.1传统监控的局限:仅关注系统健康(如延迟、错误率),无法衡量Agent的“智能表现”与“业务价值”。
2.1.2Agent可观测性的新内涵:以Trace(调用链)为核心,记录Agent的“感知-思考-行动”全链路(State → Observation → Thought → Action → Result)。
2.2标准化与全栈采集
2.2.1拥抱OpenTelemetry与GenAI语义约定:统一采集LLM调用、工具执行、RAG检索等Span信息。
2.2.2核心数据资产:不仅记录输入输出,更要完整记录Agent的推理轨迹和中间状态,为后续的数据清洗与评估提供“全息视角”。
3.核心引擎:基于多维反馈的数据清洗与分类
3.1海量Trace的“去伪存真”
3.1.1原始数据的挑战:线上Trace数据庞大且充满噪声,直接用于训练会引发“垃圾进,垃圾出”。
3.1.2数据治理Pipeline:遵循“先减后增”原则,通过字段提取、空值过滤、多级去重(精确、近似、语义)大幅缩减数据规模。
3.2挖掘高价值的“隐式反馈”
3.2.1 什么是隐式反馈:用户未明确说“错”,但行为上表达了不满。
3.2.2典型信号捕捉:
3.2.3主动打断对话 / 强制终止Agent执行。
频繁换一种方式提问。
另起新对话(Session重置)。
拒绝采纳Agent提供的操作建议或链接。
3.2.4隐式反馈的工程化:将上述行为转化为负样本标签,作为数据清洗的核心过滤条件。
3.3结合“显式标注”的精准分类
3.3.1显式反馈:用户的点赞/踩、修改后的最终答案、人工接管后的标准回复。
3.3.2数据分类矩阵:将清洗后的数据划分为“黄金正样本”、“典型负样本”、“边缘探索样本”与“无效噪声”,为下游任务精准投喂。
4.进化路径一:大语言模型的持续再训练
4.1从“通用智能”到“领域专家”
4.1.1为什么需要再训练:通用大模型在特定业务场景下缺乏深度,且容易随时间产生知识漂移。
4.1.2 优质语料的转化:将清洗出的“黄金正样本”构建为SFT数据集,将“典型负样本”构建为DPO/RLHF数据集。
4.2再训练的闭环验证
4.2.1离线评估:在测试集上验证新模型在特定任务上的准确率、Faithfulness(忠实度)提升情况。
4.2.2灰度发布与A/B测试:将新模型接入线上小流量,对比新旧模型在隐式反馈率、任务完成率上的差异。
4.2.3持续迭代:将线上表现优异的新数据再次回流,形成“数据-训练-部署-反馈”的LLM自进化飞轮。
5.进化路径二:Agent评测集的自动沉淀与回归
5.1评测集的痛点
5.1.1 传统痛点:人工编写评测集成本高、覆盖窄;离线评测集极易在线上真实场景面前“过期”。
5.2Trace到评测集的自动化转化
5.2.1自动沉淀机制:将经过清洗、且被线上实际验证为“高质量解决路径”的完整调用链,自动转化为标准评测用例。
5.2.2 动态扩充:随着业务演进,新的成功Trace不断补充进评测集,实现评测集的“自我生长”。
5.3 防退化回归测试
5.3.1门控机制:任何Prompt修改、工具变更或模型升级,上线前必须通过自动化评测集的回归测试。
5.3.2核心指标监控:确保Agent在演进过程中,不仅新能力得到提升,原有的核心任务成功率、路由准确率不产生偏差或下降。
6.进阶展望:迈向Agent Harness的自主进化
6.1 从“人类驱动”到“Agent驱动”
6.1.1引入Harness Engineering(驾驭工程)理念:不仅进化模型,还要进化包裹模型的“环境”(System Prompt、工具定义、中间件)。
6.1.2终极形态:利用Agent Debugger自动分析Trace,由Evolve Agent自主发现Bad Case的根因,并自动修改Harness组件,实现真正的无人值守自进化。
7.总结
7.1核心观点回顾
7.1.1可观测性是进化的眼睛,隐式反馈是进化的动力,再训练与回归测试是进化的双翼。
7.2行动倡议
7.2.1建议企业从建立标准化的Agent Trace采集开始,逐步搭建隐式反馈识别机制,迈出数据飞轮的第一步。

听众收益:
1.认知升级:重塑对“可观测性”的定位,不再把Agent可观测性仅仅视为“系统监控与排障工具”。
2.闭环构建:打通“数据-模型-应用”的进化链路,了解一套完整的自进化工程架构。
3.质量保障:建立防退化的“自动化门控”,学会如何让Agent的评测集“自我生长”。

毕业于四川大学信息与通信专业
14年+ 中兴通讯实战经验,深耕网管系统研发与运维
曾担任 Linux 基金会顶级开源社区 Holmes 项目 PTL
现专注 Agent & LLM 可观测理论及自进化系统研发
京ICP备2020039808号-4 京公网安备11011202100922号