第 21 章 Agent 黄金数据集¶
客服团队发现 Agent 漏答了一个关键步骤,研发补充 Prompt 后再问一次,回答完整了。接下来还需要知道:换一种问法是否仍然有效,其他问题有没有答差,以后换模型会不会再次漏掉这个步骤。
如果每次都临时找问题、凭印象判断,这项工作会越来越难。黄金数据集让团队把这些问题和判断标准保存下来,形成一套可以反复使用的业务题库。修改 Prompt、补充 Skill、调整知识库或更换模型时,都能拿同一批题检验效果。
在 Agent 观测与优化中,Dataset 是管理这套题库的地方。上一章中持续把运行数据整理进来,本章接着说明怎样选题、确认标准、建成黄金集,再把它用到日常调优中。
21.1 黄金数据集有什么用¶
黄金数据集是一组经过业务确认的任务:既有题目,也有判断任务是否完成的依据。 对知识问答,依据可以是参考答案和必须覆盖的要点;对退款、订票等操作任务,还要说明业务应达到的状态;对代码任务,则可以包含测试要求和验收条件。
“黄金”指题目与标准可信。Agent 曾经答错的任务,只要补齐了正确要求,同样可以成为黄金样本。保存这类题,往往比只收集漂亮的成功回答更能帮助团队改善产品。
| 团队要做的事 | 怎样用黄金集 | 对业务的帮助 |
|---|---|---|
| 确定什么算回答好 | 让业务人员确认同一批题的参考答案与评分要求 | 运营、研发、测试有共同标准,减少反复争论 |
| 选择模型或 Agent 方案 | 让候选方案执行同一批题,比较结果、成本和耗时 | 根据自己的业务选型,不只看通用榜单 |
| 验证一次修改 | 保留修改前后的逐题回答与得分 | 看清修复了什么,以及是否影响其他能力 |
| 防止老问题重现 | 把重要问题长期放进回归题库,升级前重复运行 | 已处理过的投诉与故障变成长期检查项 |
| 校准评估器 | 用人工已确认的样本检查机器评分 | 让持续评估更接近业务判断,减少无效 Badcase |
例如,产品客服经常回答“有哪些功能”和“如何配置评估”。两种问题需要的答案不同:前者强调能力覆盖,后者强调操作步骤。把题目和各自的要求保存下来,产品升级后只需更新对应条目,就能继续验证客服是否给出了准确、可执行的帮助。
黄金集的价值来自反复使用。一份从未进入评估、实验或发布检查的数据集,即使整理得很精细,也还没有参与改进 Agent。
21.2 Dataset 提供哪些日常能力¶
进入对应的 AgentSpace,在数据中心 → 数据集中管理样本。可以把 Dataset 理解为一张专门用于 Agent 评估与调优的业务表:一行放一道题或一个任务,一列放题目、回答、评分要求等信息。创建后可以继续补数据、改字段、做标注,也可以直接进入评估和实验。
| 需要做什么 | 在哪里操作 | 适合什么时候用 |
|---|---|---|
| 把已有题库放进来 | 创建数据集,选择“上传 CSV / Excel / JSONL 文件” | 已有 FAQ、测试用例或人工整理的表格 |
| 从实际运行中取题 | 选择从 Trace 数据处理或从轨迹导入;也可在轨迹详情“加入数据集” | 将投诉、失败任务和真实问法变成候选样本 |
| 从少量题开始 | 创建时选择“从空白开始”,定义字段后新增数据 | 先验证流程,或由专家编写关键案例 |
| 增加评分要求等内容 | “字段管理”增加列,在“数据详情”中编辑记录 | 给现有样本补参考答案、Rubric、场景等 |
| 批量整理与人工确认 | “AI 标注”与“标注管理” | 分类、预筛选,以及按统一要求逐条复核 |
| 留下可重复比较的一版题库 | 版本管理中的“创建版本” | 重要实验、回归或业务规则更新前 |
| 使用题库 | “发起评估”“发起实验”,并查看实验记录 | 检查已有回答,或让 Agent 重新做题 |
| 将样本交给其他工具 | 导出当前查询结果,或使用离线下载 | 外部分析、训练准备、归档与交付 |
第一版题库可以很简单。先把团队最关心的任务放进来,补清楚如何判断,再逐步增加标签和管理规则。
21.3 动手建立一份产品客服黄金集¶
下面沿用操作演示中的两道题:“Agent 观测与优化有哪些功能”和“Agent 观测与优化如何做评估”。目标是验证客服是否能完整介绍产品,并给出用户照着就能执行的评估步骤。两道题用于跑通建设与使用过程,正式题库再扩展到更多场景。
21.3.1 建候选集,集中收集值得检查的问题¶
在数据集列表点击创建数据集,名称可设为 customer_service_candidates,描述写清中文用途,例如“产品客服候选题库:收集真实咨询与低分回答,供产品专家复核”。随后按现有材料选择来源。
已有表格,就上传文件,预览识别出的列和几条内容,确认题目、回答没有串列,再创建。已有 Agent 轨迹,就先搜索目标应用和时间范围,在详情中将有代表性的任务加入这个候选集。需要每天持续收集,则使用 Pipeline,将整理后的问题、回答与轨迹引用写入工作集。
还没有线上流量时,也可以从空白开始,由产品或客服人员补入常见问题、难题和业务规则中的边界情况。专家编写的题与真实用户问题可以一起使用,在来源列中区分即可。
21.3.2 用少量字段把题目和标准说清楚¶
在字段管理中设置所需的列。下面是一种适合起步的结构,名称由团队自行定义;创建时使用对应的文本字段即可。
| 列 | 示例字段名 | 填什么 |
|---|---|---|
| 题目 | input |
用户原始问题;必要时补充完成任务所需的前提 |
| 原回答 | actual_output |
原 Agent 怎样回答,供分析错误与人工复核 |
| 参考答案 | expected_output |
业务认可的答案或应完成的结果 |
| 评分要求 | rubric |
必须覆盖什么、怎样判分、哪些错误不可接受 |
| 场景 | scenario |
功能介绍、操作指导、异常处理等 |
| 来源 | source_ref |
对应轨迹、文档版本或人工编写说明 |
“参考答案”与“评分要求”可以一起使用。参考答案给出一个合格示例,评分要求说明哪些内容必须做到,允许 Agent 用不同措辞作答。开放任务通常不宜要求逐字一致。
两道题可以这样整理。下面列的是编写方向,具体要求由产品负责人结合当期能力确认。
| 题目 | 参考答案的重点 | 评分要求的重点 |
|---|---|---|
| Agent 观测与优化有哪些功能? | 说明观测、数据处理、评估实验、经验使用等能力及用途 | 是否覆盖用户关心的能力;是否解释能解决什么问题;是否包含不准确承诺 |
| Agent 观测与优化如何做评估? | 说明准备数据、创建评估器、配置任务、查看结果与改进的步骤 | 是否说明入口;是否配置输入输出映射;是否解释评分结果怎样使用 |
演示最初把这两道题的要求写在同一个评估器里,后来改为在数据集中增加 rubric 列,分别填写要求。这样调整以后,低分能够对应到当前题目遗漏的内容,研发也更容易知道该补知识、步骤还是示例。
“如何做评估”这道题的 rubric 可以先填入下面这段示例,再由业务人员调整要求与权重:
按四项检查,每项满足得 0.25 分,否则得 0 分:①说明如何准备并选择评估数据;②说明如何选择或创建评估器;③说明用户输入、Agent 输出与轨迹的字段映射;④说明如何运行评估、查看解释并处理低分样本。输出逐项得分、总分及缺少的内容。若编造产品能力或操作入口,另标记为不通过并说明具体问题。
21.3.3 先手工确认几条,再让 AI 扩大整理范围¶
打开数据详情,逐条阅读题目、原回答与来源材料,补入参考答案和评分要求。例如,原回答只说“创建评估任务”,业务人员就需要把缺少的评估器选择、字段映射和结果查看补入要求,而不是只写一句“答案不完整”。
先选几条典型题一起讨论,能够提前发现标准分歧:功能介绍是否还要给使用建议?操作指导是否必须给出界面入口?这些约定明确后,再交给更多人或 AI 批量处理。
数据多起来时,在 AI 标注中选择它需要读取的“关注字段”,例如题目、原回答和相关说明,再选择已有标注配置,或描述分析目标让 AI 生成标签。可以先按“功能介绍、操作指导、异常处理”分类,也可以标出“可能遗漏步骤”的回答。填入业务识别规则,选择跳过已有结果还是重新标注并覆盖,然后创建任务。
只想补齐缺失标签,就选择跳过已有结果;业务分类体系整体变化时,再考虑重新标注。任务完成后,查看代表样本,检查 AI 是否理解了分类与业务要求。预标注适合减少整理工作,黄金题目的标准仍要由业务人员确认。
21.3.4 完成复核,把确认后的题选进黄金集¶
多人持续复核时,进入标注管理,选择或配置标注模板,将题目、原回答、参考材料映射到展示区域,再设置要填写的判断,例如“答案是否正确”“遗漏哪类信息”“是否需要补证”。保存配置后开始逐条标注,提交后继续下一条;有分歧时查看原内容与历史标注,再修订判断。
需要进入实验的参考答案和 rubric 应填写到约定字段中,让评估器可以直接读取。仅在讨论中留一句“这题应当这样答”,实验并不能自动使用它。
确认后,筛选并勾选这批样本,使用加入数据集将它们放进 customer_service_gold_v1,描述为“产品客服黄金集第一版”。确认目标字段映射保留了题目、参考答案、rubric 和来源,再提交并查看新集合中的内容。也可以导出后导入一个独立数据集。团队可以用自定义复核状态或标签管理选择依据。“黄金集”是团队赋予这份数据的用途,不需要等待一种特殊的数据集类型。
证据暂缺或还在争论的样本继续留在候选集,补齐后再收入。已经确认有问题的样本称为 Badcase;把它的正确要求补好,才能用于检验下一次修改。
21.4 题库怎样选,才对业务有帮助¶
只收集低分题,可能看不到正常能力的退化;只收集最常见问题,又容易漏掉代价很高的少数情况。选题时可以让客服运营、业务专家和研发一起检查覆盖范围。
| 应保留的题 | 为什么保留 | 产品客服的例子 |
|---|---|---|
| 高频问题 | 影响大量用户的日常体验 | 功能介绍、接入方式、常用配置 |
| 已发生过的问题 | 检查修复是否持续有效 | 回答遗漏步骤、引用过期功能 |
| 业务边界与高风险要求 | 防止少量但代价大的错误 | 无权限操作、不存在的能力、敏感信息处理 |
| 原本表现正常的题 | 发现改动带来的退化 | 过去能完整回答的标准操作问题 |
| 表述变化与多轮问题 | 检查是否只适配一种问法 | 简称、补充条件、上下文中的追问 |
用场景列筛选或汇总后,团队会看到哪些类别堆了很多题,哪些还没有代表案例。优先补空缺,比不断增加近似问题更有价值。同一句问题也不一定重复:账号权限、产品版本或上下文不同,正确答案可能不同,选题时应保留这些区别。
涉及实际操作时,还要写明任务的起始条件。例如“订单满足退款条件”可以作为新任务的输入;旧运行中的工具报错是分析原执行的材料。重新做题时应从约定的初始状态出发;专门测试失败恢复时,再设置相同的失败检查点。
第一批黄金题不必很多,但应有人能够解释每道题为何保留、怎样判定。之后每处理一类新的线上问题,就补入相应样本,并回看现有题库是否仍适用。
21.5 建好以后,怎样真正用起来¶
用法一:检查评分标准是否靠谱¶
选取人工确认过的好回答、坏回答和边界回答,点击发起评估。把题目、原回答、参考答案和评分要求映射给评估器,查看它的结论是否与业务人员一致。
如果坏回答得了高分,先看它是否拿到了正确字段、当前题目的要求是否清楚。修正后再评同一批材料。黄金集在这里是“校准题”,帮助团队建立后续持续评估可以信赖的标准。
用法二:比较 Prompt、模型或 Agent 版本¶
在黄金集上点击发起实验,选择评估器并配置映射。题目交给被测 Agent,参考答案与 rubric 交给评估器;本次新产生的回答作为被评价对象。先运行当前版本作为基线,再运行改进后的候选。
例如给产品客服补充了一份评估操作 Skill,就让两个版本都回答“如何做评估”,同时检查“有哪些功能”等原本正常的问题。看目标题是否补齐步骤,也看其他题是否变差、耗时和成本是否变化。黄金集提供共同题目与共同标准,实验负责重新执行并记录结果。
先查看逐题变化,再看总体趋势。一道关键操作题仍然失败,不能只因为平均分提高就忽略它。具体的实验配置与分析将在下一章展开。
用法三:把重要题长期作为回归检查¶
把历史故障、重要流程以及一部分正常题列为回归范围,在模型、Prompt、Skill 或知识库升级前重复运行,也可以通过实验执行端的定时调度持续检查。发现退化时,直接定位到具体题目、要求和历史表现。
同一条黄金样本可以承担回归用途。黄金强调题目和标准的质量,回归强调反复使用的目的;不必为每个称呼重新复制一遍数据。需要独立发布节奏或不同权限时,再分成多个数据集。
21.6 随业务更新题库,保留比较依据¶
正式比较开始前,在数据集版本管理中点击创建版本,填写版本号和描述,例如“v1.0,产品客服操作指导,按本月产品文档确认”。随后可以查看历史只读快照,回溯当时用了哪些题和标准。
当前控制台的历史版本视图用于查看快照,发起评估和实验需要回到最新数据。因此,一个直接的用法是:为本轮比较准备独立的黄金数据集,确认后创建版本留档,比较期间不再向它追加或修改数据。日常 Pipeline 继续写候选集,新题复核完成后进入下一版。
业务规则变化时,修改受影响的题目和要求,再创建新版本。参考产品文档时记下适用版本,外部文件也保留可重取的副本或稳定引用。导出交付时,确认导出的是当前筛选结果还是全量题库,避免接收方只拿到一小段样本。
还有一项简单但重要的安排:参与改写 Prompt、生成 Skill 或提炼经验的题,与最后独立检查效果的题分开。 将未参与优化的那部分留作独立验证。一旦反复查看这些题并据此修改 Agent,它们就已参与调优,应另留新的验证题。
业务人员持续补充真实需求和正确要求,研发用题库验证修改,测试与运营跟踪回归结果。这样,一次咨询、投诉或失败留下的不只是排障记录,还会成为下一轮改进可以直接使用的题目与标准。