AI 交付最大的坑是"演示惊艳、上线翻车"。原因往往不是模型不行,而是质量没有被定义:什么算对、什么算错、错到什么程度不能上线,全凭感觉。这个分类的两个 Skills 分别解决两个最常见的问题——RAG 系统的输出质量怎么度量,Agent 的工具边界怎么守住。我们的建议是:把这两个动作做进项目计划里,而不是出事后再补。
RAG 系统最怕"看起来能用"。我们建议在写第一行业务代码之前,先和客户一起把评测集(Golden Dataset)定下来:哪些问题必须答对、答到什么程度算合格。评估驱动开发(EDD)的核心就是把验收标准前置,让每次迭代都有数字可对照,而不是靠演示时的"感觉不错"。
Prompt/模型/知识库变更后必跑同一批样本,关键指标低于阈值不发布。
RAG 项目凭感觉调参,无法证明效果,客户不信任。
质量/效率/体验/风险/业务 → 可采集指标。
输入+期望+引用+风险等级+评分标准;含边界样本和失败样本。
Prompt/模型/知识库变更后必跑同一批样本,关键指标低于阈值不发布。
EDD 评估驱动开发落地;外部 rag-architect/langchain-rag 可参考。
.agents/skills/rag-architect.agents/skills/langchain-rag.agents/skills/rag-implementation触发信号:PoC/Beta/生产任一阶段出现「RAG PoC」相关诉求、阻塞或复盘需求。
关键动作:业务指标转评估指标
FDE 注意:避免 样本无代表性
成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。
触发信号:PoC/Beta/生产任一阶段出现「知识库上线前」相关诉求、阻塞或复盘需求。
关键动作:采集 20-50 样本
FDE 注意:避免 只评生成不评检索
成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。
触发信号:PoC/Beta/生产任一阶段出现「效果争议」相关诉求、阻塞或复盘需求。
关键动作:定义评分标准
FDE 注意:避免 无回归门禁
成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。
触发信号:PoC/Beta/生产任一阶段出现「版本升级回归」相关诉求、阻塞或复盘需求。
关键动作:建立基线
FDE 注意:避免 忽略引用准确率
成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。
资源:查看该 Skill 原文 | 下载完整技能包(ZIP,含 Prompt / 清单 / 模板)
Agent 接的工具越多,出事的面积越大。这个 Skill 提供一套审计与治理方法:盘点 Agent 挂载了哪些工具和 MCP、每个工具的权限边界在哪、误用后的影响面有多大,并给出收敛建议。上线前的工具清单评审,我们认为是标配动作。
Agent 工具权限过大、无审计、无熔断,一次误调用可造成业务损失。
Agent 工具权限过大、无审计、无熔断,一次误调用可造成业务损失。
审计清单:工具清单、权限、参数校验、超时、重试、审计日志、人审、熔断。 原则:最小权限、可追踪、可回滚。
与 mcp-builder 互补;生产上线门禁必查项。
.agents/skills/mcp-builder.agents/skills/mcp-apps-builder触发信号:PoC/Beta/生产任一阶段出现「Agent 接多系统」相关诉求、阻塞或复盘需求。
关键动作:盘点工具
FDE 注意:避免 工具无白名单
成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。
触发信号:PoC/Beta/生产任一阶段出现「MCP 上线前」相关诉求、阻塞或复盘需求。
关键动作:评权限与风险
FDE 注意:避免 无调用日志
成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。
触发信号:PoC/Beta/生产任一阶段出现「安全事故后」相关诉求、阻塞或复盘需求。
关键动作:测异常用例
FDE 注意:避免 高风险无人工确认
成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。
触发信号:PoC/Beta/生产任一阶段出现「工具膨胀时」相关诉求、阻塞或复盘需求。
关键动作:定义人审与熔断
FDE 注意:避免 工具无白名单
成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。
资源:查看该 Skill 原文 | 下载完整技能包(ZIP,含 Prompt / 清单 / 模板)
这两个 Skill 建议成对使用:评测集定义"什么是对的",工具审计定义"什么不能碰"。一个管质量下限,一个管风险上限,合起来才是完整的 AI 交付质量观。
本文为我们在实践中的整理与解读,方法论框架与技能包版权归 World Robots 所有,仅作学习交流之用。
查看全部 0 条评论