论坛主席:郑丽君

美团 高级技术专家
15年以上测试技术研究经历,10年以上质量技术管理经验。带领团队在测试数字化及工具化、测试效能与度量洞察、AI测试工具搭建与应用等方面持续探索新能力,在以上领域具有多个典型实践项目案例。

大模型和AI应用评测

本论坛旨在深入探讨人工智能和大型语言模型(LLM)的性能评估方法。涵盖模型基准测试、评估指标、测试工具和框架、结果解释、模型比较、可解释性和透明度等关键主题。通过分享最新的评测技术和策略,致力于帮助参与者理解AI和LLM的性能,推动评估标准的制定和评测技术的进步。
Agent 自进化:企业级智能体全生命周期进化飞轮实践
夏 明
阿里云 高级产品专家
内容简介:
当企业级智能体从实验原型走向生产环境,真正的挑战才刚刚开始。当前大量 Agent 处于"裸奔"状态——没有可观测性,没有评估体系,没有优化闭环。这与 2010 年代微服务爆发初期的困境如出一辙,但 Agent 的非确定性行为使挑战更加严峻。本次分享将从行业实践出发,深入剖析企业级智能体面临的可观测性、评估体系、优化闭环三大空白,系统阐述"观测→评估→优化"三层进化飞轮的方法论与工程实践,并结合真实案例展示如何通过数据驱动的方式让智能体具备自我感知、自我评估、自我优化的持续进化能力,帮助企业构建从 Demo 到生产级的 Agent 工程体系        

演讲提纲:
1. 企业级 Agent 运行的核心痛点与解题思路
2. Agent 全栈数据无侵入采集,性能/成本/异常全链路追踪
3. Agentic Judge 驱动真实效果评估,用实验替代人工抽检
4. 上下文智能调优与自主进化双路径,驱动智能体越用越聪明

听众收益:
1. 掌握"观测→评估→优化"三层进化飞轮的方法论,获得可直接落地的实操路径
2. 获得评估器质量工程、数据集自动化构建、CI/CD 质量门禁等关键环节的最佳实践
3. 建立"Agent 自进化"的思维框架,思考如何让智能体从被动运维走向主动进化        
2016年华中科技大学硕士毕业,加入阿里中间件,从事可观测相关领域工作约10年,GitHub StabilityGuide 项目发起人。曾先后担任阿里巴巴 EagleEye & 阿里云 ARMS 研发负责人,现任阿里云 Agent 观测与优化 AgentLoop 产品负责人。
Agent-as-a-Judge 驱动的 AI 评测中台实践
罗钦玲
美团技术专家
内容简介:
大模型时代,被评测产物正从「传统排序列表等」演进为「多轮对话结果」,再到「任务Agent」。评测对象更开放、链路更长、维度更杂,单靠传统规则或纯 LLM-as-a-Judge 的「看文本打分」,已难以覆盖复杂评测诉求。本次分享 Agent-as-a-Judge 通用评测中台实践:Planner→Executor→Summary 贯通规划、评判与总结,调度 code/LLM/Agent,以工具取证、多轮追问增强评判能力,统一应对排序列表、离线数据、Chat、Agent等多类数据类型;对象、维度、评判逻辑配置化解耦,新业务核心关注Rubric 质量,助力业务迭代质效。        

演讲提纲:
1. 背景:被评对象从列表到 Chat 到 Agent 日益多样,接入成本需持续降低,且Agent-as-a-Judge 能力演进,通用、灵活、强大的评测中台建设诉求出现。
2. 中台架构:Agent-as-a-Judge 驱动的通用设计,配置化解耦、低成本接入。
3. 关键流程:规划 → 调度 → 评判 → 聚合,形成业务迭代闭环。
4. 实践:案例与踩坑经验。
5. 展望:评测 Agent自进化Loop优化;探索质量、效率、成本的优化边界

听众收益: 
1. 理解 Agent-as-a-Judge 的价值边界:与 LLM-as-a-Judge 相比,优劣势分别是什么
2. 掌握通用评测中台的设计思路:学习对象、维度、评判逻辑配置化解耦,以及 Planner→Executor→Summary 流水线,降低新业务接入成本。
3. 获得可落地的实践参考:借鉴实践案例,了解从「黑盒打分」到「白盒诊断」的评测闭环建设路径与常见踩坑。
先后就职于百度、美团,多年搜索推荐领域的算法效果质量保障经验,在传统时代的评测到Agent时代的评测浪潮中多次探索和实践。
Agent 能干多大活?长程任务评测的工程实践与挑战
李睿琪
美团 Agent稳定性负责人
内容简介:
某SOTA模型在长程任务中,13%自信完成但实际没做完,85%半途停下来等人确认——短程基准看不到这些失败。本演讲基于美团200+长程会话与EdgeBench、SWE-Marathon、NL2Repo-Bench三大基准,拆解长程任务评测体系:任务定义、两层判定、多通道验证器与防作弊设计,通过三平台对比揭示决定Agent长程成败的架构因素,展望从单次跑分到过程可观测的演进。

演讲提纲:
1.【背景】
SOTA模型长程任务13%自信完成但没做完,85%半途等人确认——只有长程评测能暴露的缺陷。
2.【What:长程任务是什么】
单条消息触发、持续数小时自主执行;时长=消息到Session idle墙钟时长(≥1h),须为真实复杂度自然产物。
3.【Why:为什么需要长程评测】
200+会话4类问题:上下文退化(延迟2.2倍)、编排失控(20.3%失联)、提前终止(49%过早结束)、碎片修补(低效2.7倍)。Plan-Act分层163K零中断 vs 单Context仅32%完成。
4.【How:怎么做长程评测】
三大基准:EdgeBench(标度律R²=0.998)、SWE-Marathon(13.8%作弊检测)、NL2Repo-Bench(200轮收益递减)。
自建:4场景+两层判定(时长一票否决+四项质量判据)+防作弊从正则到能力层隔离。
发现:aggregator事件数预测搜索成败;Plan-Act完胜单Context;todo_write频率正相关质量。
5.【演进】 过程可观测→返工反馈→验证升级→自建+外部交叉验证;
6.【总结】 时长门槛一票否决+多通道验证+迭代可观测,用真实复杂度逼出执行能力上限。

听众收益: 
1. 拿到一套可直接复用的长程任务评测框架:覆盖选题、定时长、验产物、防作弊、检测退化的完整工程链路,听众可以拿回去直接指导自建评测数据集。
2. 获得跨平台Agent架构对比的一手实证数据:Plan-Act分层还是单Context中转?aggregator枢纽还是coordinator开环?不同Harness设计如何直接决定任务成败——用真实数据而非理论推测指导架构选型。
3. 理解评测体系从"看分数"到"看过程"的演进趋势:掌握迭代日志追踪、工作流模式识别等方法论,提前布局下一代评测能力。
美团技术专家,CatX Agent长程稳定性负责人。主导构建覆盖编码、搜索、写作、数据分析四大场景的长程任务评测体系,带领团队完成三平台200+会话跨平台对比评测(累计5.48亿Token),引入EdgeBench、SWE-Marathon、NL2Repo-Bench等业界基准交叉验证,相关发现已驱动多个Agent架构优化与缺陷修复。
京ICP备2020039808号-4 京公网安备11011202100922号