AI 交付别靠感觉:RAG 评估与 Agent 工具审计

微***R
发布时间:2026-09-14 21:57:03 浏览次数:24

AI 交付最大的坑是"演示惊艳、上线翻车"。原因往往不是模型不行,而是质量没有被定义:什么算对、什么算错、错到什么程度不能上线,全凭感觉。这个分类的两个 Skills 分别解决两个最常见的问题——RAG 系统的输出质量怎么度量,Agent 的工具边界怎么守住。我们的建议是:把这两个动作做进项目计划里,而不是出事后再补。

目录(3 节)
  1. RAG-Evaluation
  2. Tool-Audit
  3. 写在最后

RAG-Evaluation

RAG 系统最怕"看起来能用"。我们建议在写第一行业务代码之前,先和客户一起把评测集(Golden Dataset)定下来:哪些问题必须答对、答到什么程度算合格。评估驱动开发(EDD)的核心就是把验收标准前置,让每次迭代都有数字可对照,而不是靠演示时的"感觉不错"。

Prompt/模型/知识库变更后必跑同一批样本,关键指标低于阈值不发布。

适用场景

  • RAG PoC
  • 知识库上线前
  • 效果争议
  • 版本升级回归

问题定义

RAG 项目凭感觉调参,无法证明效果,客户不信任。

方法论框架

EDD 五层指标

质量/效率/体验/风险/业务 → 可采集指标。

Golden Dataset

输入+期望+引用+风险等级+评分标准;含边界样本和失败样本。

回归门禁

Prompt/模型/知识库变更后必跑同一批样本,关键指标低于阈值不发布。

输入 / 输出

输入

  • 业务指标定义
  • 历史问题样本
  • 知识库范围

输出

  • 评估指标表
  • Golden Dataset
  • 评测报告
  • 回归门禁规则

执行步骤

  1. 业务指标转评估指标
  2. 采集 20-50 样本
  3. 定义评分标准
  4. 建立基线
  5. 每轮迭代回归
  6. 上线门禁对齐

常见误区

  • 样本无代表性
  • 只评生成不评检索
  • 无回归门禁
  • 忽略引用准确率

交付物清单

  • 指标表
  • Golden Dataset
  • 评测报告

与国内 FDE 生态关联

EDD 评估驱动开发落地;外部 rag-architect/langchain-rag 可参考。

关联 Skill

推荐组合

外部工程参考

  • .agents/skills/rag-architect
  • .agents/skills/langchain-rag
  • .agents/skills/rag-implementation

场景深潜

场景 1:RAG PoC

触发信号:PoC/Beta/生产任一阶段出现「RAG PoC」相关诉求、阻塞或复盘需求。

关键动作:业务指标转评估指标

FDE 注意:避免 样本无代表性

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

场景 2:知识库上线前

触发信号:PoC/Beta/生产任一阶段出现「知识库上线前」相关诉求、阻塞或复盘需求。

关键动作:采集 20-50 样本

FDE 注意:避免 只评生成不评检索

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

场景 3:效果争议

触发信号:PoC/Beta/生产任一阶段出现「效果争议」相关诉求、阻塞或复盘需求。

关键动作:定义评分标准

FDE 注意:避免 无回归门禁

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

场景 4:版本升级回归

触发信号:PoC/Beta/生产任一阶段出现「版本升级回归」相关诉求、阻塞或复盘需求。

关键动作:建立基线

FDE 注意:避免 忽略引用准确率

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

资源:查看该 Skill 原文下载完整技能包(ZIP,含 Prompt / 清单 / 模板)

Tool-Audit

Agent 接的工具越多,出事的面积越大。这个 Skill 提供一套审计与治理方法:盘点 Agent 挂载了哪些工具和 MCP、每个工具的权限边界在哪、误用后的影响面有多大,并给出收敛建议。上线前的工具清单评审,我们认为是标配动作。

Agent 工具权限过大、无审计、无熔断,一次误调用可造成业务损失。

适用场景

  • Agent 接多系统
  • MCP 上线前
  • 安全事故后
  • 工具膨胀时

问题定义

Agent 工具权限过大、无审计、无熔断,一次误调用可造成业务损失。

方法论框架

审计清单:工具清单、权限、参数校验、超时、重试、审计日志、人审、熔断。 原则:最小权限、可追踪、可回滚。

输入 / 输出

输入

  • 工具列表
  • API 契约
  • RBAC 模型
  • 事故样本

输出

  • 工具审计报告
  • 风险分级
  • 整改计划
  • 人审节点图

执行步骤

  1. 盘点工具
  2. 评权限与风险
  3. 测异常用例
  4. 定义人审与熔断
  5. 整改
  6. 回归验证

常见误区

  • 工具无白名单
  • 无调用日志
  • 高风险无人工确认

交付物清单

  • 审计报告
  • 工具注册表
  • 整改清单

与国内 FDE 生态关联

与 mcp-builder 互补;生产上线门禁必查项。

关联 Skill

推荐组合

外部工程参考

  • .agents/skills/mcp-builder
  • .agents/skills/mcp-apps-builder

场景深潜

场景 1:Agent 接多系统

触发信号:PoC/Beta/生产任一阶段出现「Agent 接多系统」相关诉求、阻塞或复盘需求。

关键动作:盘点工具

FDE 注意:避免 工具无白名单

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

场景 2:MCP 上线前

触发信号:PoC/Beta/生产任一阶段出现「MCP 上线前」相关诉求、阻塞或复盘需求。

关键动作:评权限与风险

FDE 注意:避免 无调用日志

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

场景 3:安全事故后

触发信号:PoC/Beta/生产任一阶段出现「安全事故后」相关诉求、阻塞或复盘需求。

关键动作:测异常用例

FDE 注意:避免 高风险无人工确认

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

场景 4:工具膨胀时

触发信号:PoC/Beta/生产任一阶段出现「工具膨胀时」相关诉求、阻塞或复盘需求。

关键动作:定义人审与熔断

FDE 注意:避免 工具无白名单

成功标志:交付物清单勾选,evaluation.md 达标,AIBP/业务 Owner 书面确认。

资源:查看该 Skill 原文下载完整技能包(ZIP,含 Prompt / 清单 / 模板)

写在最后

这两个 Skill 建议成对使用:评测集定义"什么是对的",工具审计定义"什么不能碰"。一个管质量下限,一个管风险上限,合起来才是完整的 AI 交付质量观。

本文为我们在实践中的整理与解读,方法论框架与技能包版权归 World Robots 所有,仅作学习交流之用。

评论 0

推荐博文

更多 »

没有相关数据

温馨提示 ×
商品已成功加入购物车!
购物车共 0 件商品
去购物车结算