# FDE PoC 技术选型工作流 ## 总流程 ```text 场景/SOW/指标 ↓ 进入门禁:假设是否可证伪? ├─ 否 → 返回 Discovery / SOW ↓ 是 数据、安全、环境、团队约束 ↓ 强制最新检索 + 代表样本 bake-off ↓ L1 / L2 / L3 路径判断 ↓ 候选硬门禁 → 加权评分 ↓ 主方案 + 降级方案 + 淘汰方案 ↓ D0-D10 构建 + Golden Dataset ↓ Go / Conditional Go / Pivot / No-Go ↓ Beta/生产升级或停止 ``` --- ## Phase 0:进入门禁 ### 输入 - 场景卡; - SOW 范围; - Primary Metric; - 代表数据; - 部署与安全约束。 ### 决策 满足以下条件才进入选型: ```text 业务问题明确? ├─ 否 → Consultative-Problem-Solving 假设可在 PoC 周期证伪? ├─ 否 → 缩小范围 业务真值与指标可获得? ├─ 否 → AIBP 补 Ground Truth 数据和环境可获得? ├─ 否 → 升级阻塞 └─ 是 → Phase 1 ``` --- ## Phase 1:约束雷达 ### 约束画布 | 类别 | 问题 | 输出 | | --- | --- | --- | | 价值 | 验证哪个业务假设? | If/Then/Because | | 时间 | 首个可测 Demo 何时出现? | D0-D10 | | 数据 | 类型、规模、质量、敏感性? | 数据清单 | | 环境 | 云、内网、离线、信创? | 部署边界 | | 模型 | API 可用还是必须自部署? | 模型路径 | | 集成 | 哪些系统/权限必须接通? | 接口清单 | | 团队 | 会什么、能维护什么? | 能力约束 | | 生产 | PoC 后准备走多远? | 升级假设 | ### 阻塞升级 - 数据权限未批:不导出真实数据,先用脱敏/合成样本; - 算力未到:用获批 API 验证业务假设,硬件验证单列; - 接口未开:使用 Mock,但 D5 前必须确认真实接口风险; - Ground Truth 缺失:暂停模型“效果优化”。 --- ## Phase 2:最新技术检索 ### 并行检索流 ```text 模型/API ──────────┐ 平台/RAG/Agent ────┤ 推理/国产算力 ─────┤ 评估/可观测 ───────┼→ 证据表 → 候选长名单 Vibe Coding ───────┤ 许可证/安全 ───────┤ 国内同类实践 ──────┘ ``` ### 终止条件 关键候选必须至少有一个一手来源。若官方资料无法确认: - 标记“待厂商确认”; - 不作为唯一关键依赖; - 必须有降级替代。 --- ## Phase 3:代表样本 Bake-off 不要先做全量部署。用最能暴露差异的小样本验证。 ### RAG - 20–50 份代表文档; - 覆盖文本、表格、扫描件、长文和权限; - 50–100 条 Golden Q&A; - 比较解析成功率、Recall@K、引用和答案正确率。 ### Agent - 10–20 条典型任务; - 覆盖正常、缺参数、工具失败、超时和拒绝; - 比较任务成功率、工具选择、步骤数、成本和恢复。 ### 模型 - 20–100 条代表输入; - 固定 Prompt/参数和结构化 Schema; - 比较质量、稳定性、时延、成本与内容安全; - 不用单个“惊艳案例”决定模型。 ### 推理 - 固定硬件、模型、量化、上下文和并发; - 记录 TTFT、TPS、吞吐、显存、错误和稳定性; - 不跨不同配置直接比较公开 benchmark。 --- ## Phase 4:路径与候选决策 ### L1/L2/L3 决策树 ```text 平台内置能力能验证核心假设? ├─ 是 → L1 └─ 否 定制主要是 UI/API/少量逻辑? ├─ 是 → L2 └─ 否 是否需要复杂状态、核心算法、权限或可靠性? ├─ 是 → L3 └─ 否 → 重新检查是否过度设计 ``` ### 候选收敛 1. 长名单不超过 8; 2. 硬门禁后不超过 3; 3. Bake-off 后保留一个主方案、一个降级方案; 4. 其余明确淘汰。 --- ## Phase 5:技术决策包 必须同时生成: - `templates/tech-decision-record.md`; - Mermaid 架构图; - 分层技术栈; - 来源证据表; - D0-D10 计划; - 评估与 Go/No-Go; - 风险与降级; - PoC→Beta/生产清单。 ### 评审角色 | 角色 | 必须确认 | | --- | --- | | AIBP | 业务假设、Ground Truth、Primary Metric | | FDE | 技术方案、构建计划、降级与评估 | | IT/安全 | 数据、账号、网络、部署、Vibe 工具 | | 业务 Owner | 范围、用户、Go/No-Go | | 产品/研发 | Beta 接管与复用边界 | --- ## Phase 6:构建期间的动态切换 ### D3 检查 若出现以下任一情况,切换降级方案: - 核心链路仍不可运行; - 关键平台/模型/硬件兼容假设失败; - 数据或安全审批无法在 D5 前解决; - 团队无法定位关键故障; - 预计剩余周期不足以完成 Golden Dataset 评估。 ### D5 检查 - 有基线但效果差:进入 Issue Tree/RAG-Evaluation; - 无法测量:补 Ground Truth,不继续调 Prompt; - 业务流程不接受:优先修改流程/交互,不盲目换模型; - 成本/时延超标:先采集瓶颈,再决定模型或部署切换。 --- ## Phase 7:决策评审 ### Go 业务假设成立、指标达标、Guardrail 可接受、Beta 路径合理。 ### Conditional Go 只有少量、可在明确期限验证的阻塞。必须写负责人和截止日。 ### Pivot 业务价值存在,但当前技术路径不成立。复用数据、接口和评估集切换。 ### No-Go 假设不成立、风险不可接受或投入不值得。停止是合格结果。 --- ## Phase 8:PoC→Beta/生产 ### 保留 - 场景卡、SOW、Golden Dataset; - API 契约与 Adapter; - 评估脚本、决策记录和失败样本; - 可审计的 Prompt/配置; - 已验证的数据处理逻辑。 ### 通常需要重做 - Vibe Coding 快速生成但缺测试的代码; - 平台内临时凭证和手工配置; - 单租户/无权限 Demo UI; - 无容量、备份、灾备的存储; - 开发机模型服务和临时隧道。 ### 新增 - SSO/RBAC/租户/审计; - 模型网关、限流、内容安全; - CI/CD、漏洞与许可证检查; - 容量、SLA、监控、备份与 Runbook; - 评估回归、用户反馈和采纳看板。