影子验证 Skill
SkillAI & models'AI Native 产品方法论——影子验证的实操 Skill。
Available today. Use it from your connected AI after setup.
No other account needed.
Connect ahel once, and every AI you use reads what you have installed.
Then ask your AI: use the 影子验证 Skill skill
What this skill tells your AI
The instructions your AI receives, as published by gmaxxxie/ai-native-product-agent-skills in skills/p2e-shadow-validation/SKILL.md and read by ahel’s review.
使用场景
- 收敛决策已完成,需要在真实环境中验证系统是否具备进入工程化的条件
- 离线实验效果良好,但不确定真实流量下表现是否一致
- 需要为审计放行准备真实的、可量化的证据
核心概念
- 影子验证(Shadow Validation):让 AI 在真实场景中并行运行,但暂不直接接管业务结果
- 影子系统(Shadow System):承载这种验证方式的系统形态,与人工流程并行存在
- 离线评估:在样本集上检验能力边界
- 灰度上线:让系统在有限真实范围内直接影响业务结果
影子验证 vs 其他验证方式
| 验证方式 | 真实性 | 风险 | 证据质量 | 适用阶段 |
|---|---|---|---|---|
| 离线评估 | 最低 | 无 | 中(样本偏差) | 能力实验 |
| 影子验证 | 中 | 低 | 高(真实流量) | 放行前验证 |
| 灰度上线 | 高 | 中 | 最高 | 生产运行 |
影子验证流程
收敛决策通过
→ 影子系统设计
→ 并行运行方案
→ 人工对比机制
→ 失败模式沉淀
→ 审计放行证据
→ 灰度上线 / 继续影子验证
第一步:影子系统设计
影子系统的核心设计原则:
- 输出可见但不执行:AI 给出建议,但业务动作仍由人工执行
- 完整记录:每次 AI 输出都记录,包括输入、上下文、置信度、人工对比结果
- 可开关:发现重大问题时能快速切换到纯人工模式
影子系统架构
真实工单进入
→ 人工流程(正常执行)
→ 影子系统(并行生成建议)
→ 建议存储(不外发)
→ 周度人工对比
→ 失败模式沉淀
→ 系统优化
第二步:并行运行方案
运行参数设计:
| 参数 | 设计 | 理由 |
|---|---|---|
| 并行比例 | 从5%开始,逐步扩到50% | 控制初期风险 |
| 场景筛选 | 先从低风险场景开始 | 避免高风险场景先行暴雷 |
| 扩量节奏 | 采纳率连续2周>60%再扩 | 确保质量稳定后再放量 |
| 熔断机制 | 连续3次高风险误判自动暂停 | 防止持续出错 |
第三步:人工对比机制
每周人工对比:
- 随机抽取影子系统建议(≥50条)
- 人工标注:正确 / 可接受 / 错误 / 风险误判
- 计算采纳率、错误率、风险漏过率
第四步:失败模式沉淀
每次对比后沉淀失败案例:
| 失败类型 | 数量 | 占比 | 根因 | 改进方向 |
|---|---|---|---|---|
| 上下文丢失 | 12 | 24% | 会话状态未保留 | 补充记忆系统 |
| 风险漏过 | 5 | 10% | 边界规则不完善 | 收紧风险规则 |
| 知识缺失 | 8 | 16% | 知识库覆盖不足 | 补充知识库 |
第五步:审计放行证据准备
影子验证报告需包含:
- 运行概况:并行时长、工单量、场景分布
- 质量指标:采纳率、错误率、风险漏过率
- 失败模式分析:Top失败类型及根因
- 与离线评估对比:是否出现离线未发现的问题
- 放行建议:是否具备进入工程化/灰度上线条件
输出物:影子验证报告
- 影子系统配置:并行比例、场景选择、熔断规则
- 质量趋势图:采纳率、错误率随时间的变化
- 失败模式报告:Top问题、根因和改进建议
- 审计放行证据包:符合 @ai-native-audit-release 输入要求的完整证据
与其他 Skill 的关系
- 前置:@p2d-convergence-decision(收敛决策通过)
- 后置:@ai-native-audit-release(审计放行输入)、@ai-native-system-building(通过后进入工程化)
- 协同:@ai-native-production-ops(生产环境准备)
示例
用户输入
"客服 Copilot 收敛决策通过,准备进入影子验证"
Skill 执行
影子系统设计:
架构: 侧边栏建议面板(不外发)
记录: 每次建议+人工对比+采纳标记
熔断: 连续3次赔付类误判自动暂停
并行运行方案:
第1周: 5%工单(低风险场景:订单查询)
第2周: 20%工单(+物流解释)
第3周: 50%工单(全场景)
扩量条件: 采纳率连续2周>65%
人工对比(第1周结果):
样本: 60条
采纳率: 68%
错误率: 12%(主要:上下文丢失)
风险漏过率: 5%(主要:退款承诺)
失败模式:
Top1: 多轮上下文丢失(35%)→ 补充会话状态设计
Top2: 退款承诺误判(25%)→ 增加规则拦截
Top3: 知识库缺失(20%)→ 补充200条FAQ
审计放行证据:
✅ 采纳率68% > 60%阈值
⚠️ 风险漏过率5%(需强化规则后再放行高风险场景)
建议: 低风险场景先行灰度,高风险场景继续影子
Signals
- GitHub stars
- 46
- Last commit
- Sep 2026
Advanced
- Catalog kind
- skill
- Gateway key
p2e-shadow-validation- Source
- github.com/gmaxxxie/ai-native-product-agent-skills