试验展开概述 Skill

SkillAI & models

'AI Native 产品方法论——试验展开概述的实操 Skill。

Available today. Use it from your connected AI after setup.

Connect ahel once, and every AI you use reads what you have installed.

Then ask your AI: use the 试验展开概述 Skill skill

What this skill tells your AI

The instructions your AI receives, as published by gmaxxxie/ai-native-product-agent-skills in skills/p2a-experiment-overview/SKILL.md and read by ahel’s review.

使用场景

  • 方向定界已完成,需要进入试验展开阶段
  • 需要设计一套可验证、可比较、可放弃、可继承的实验体系
  • 需要理解能力实验、产品实验、商业实验三层关系

核心概念

  • 能力实验:验证某项 AI 能力在真实任务中是否成立
  • 产品实验:验证用户是否愿意以某种交互或流程使用这项能力
  • 商业实验:验证客户是否愿意为这类能力投入预算或试点资源
  • 评估(Evaluation):用样本、对照和失败案例判断能力是否成立

三层实验关系

能力实验(技术上限)
  → 产品实验(用户接受度)
    → 商业实验(价值密度)
      → 实验结论报告

能力实验是基础:先确认 AI 能力能否做到,再验证用户是否愿意用,最后验证客户是否愿意付费。

第一步:资料准备评估

试验前必须确认四类资料:

资料类型内容评估标准
外部资料行业知识、公开规则、产品文档覆盖度 > 80%
内部业务资料SOP、历史工单、对话记录代表性样本 > 200条
样本集正例、负例、边界案例、长尾问题边界案例 > 20%
评估标准(Rubric)什么算对、什么算错、什么算可接受已明确定义

资料不足时,应先补充资料,而非直接开始实验。

第二步:能力实验设计

原则:先用最强模型看能力上限,再压缩成本

  1. 用最强模型(GPT-4o/Claude Opus)测试能力天花板
  2. 确定能力上限足够高后,再用更便宜模型测试能否保住目标效果
  3. 如果最强模型也无法达到可接受水平,应放弃或重新定义问题

能力实验要验证的问题

  • AI 到底能做到什么深度
  • 哪些场景能够稳定成立
  • 哪些场景只能做到辅助,不能做到自动化
  • 哪些场景即使技术可行,也没有足够高的价值密度

第三步:产品实验设计

验证用户是否愿意以某种交互或流程使用这项能力:

  • 用户如何表达目标
  • 系统如何展示状态和建议
  • 用户如何纠偏或确认
  • 任务完成率和满意度

第四步:商业实验设计

验证价值密度:

  • 客户是否愿意付费试点
  • 续期意愿如何
  • 场景扩展可能性
  • 与现有解决方案的成本对比

第五步:建立评估 Rubric

评估不是看主观感觉,必须量化:

  • 准确率:正确输出 / 总输出
  • 边界案例通过率:长尾问题中正确处理的比例
  • 采纳率:用户接受 AI 建议的比例
  • 效率提升:相比纯人工的时长缩短比例

输出物:试验展开总体方案

  1. 资料准备清单:四类资料的覆盖度和缺口
  2. 能力实验方案:实验批次、模型选择、成功标准
  3. 产品实验方案:交互形式、验证指标
  4. 商业实验方案:定价假设、试点设计
  5. 评估 Rubric:定义明确的量化指标
  6. 实验节奏:各层实验的时间安排

与其他 Skill 的关系

  • 前置:@ai-native-direction-framing(提供 Direction Brief)
  • 后置:@p2b-product-form-exploration、@p2c-process-redesign、@p2d-convergence-decision、@p2e-shadow-validation(覆盖5个子阶段)
  • 协同:@ai-native-experiment-engine(整体包覆版,仍可独立使用)

示例

用户输入

"我们已完成方向定界,Direction Brief 是 AI 客服协同系统,需要设计试验展开方案"

Skill 执行

资料准备评估:
  已有: FAQ(500条)、工单样本(1000条)、物流规则文档
  缺口: 边界案例(仅8%)、情绪问题样本(缺失)
  建议: 补充100条边界案例和50条情绪问题样本后再开始实验

能力实验方案:
  第1批: GPT-4o 测试订单查询/物流解释/售后政策(目标>85%准确率)
  第2批: 边界案例测试(目标>70%通过率)
  第3批: 压缩成本测试(GPT-4o-mini,目标保住85%效果)

产品实验方案:
  形式: Copilot 影子模式(建议+人工确认)
  指标: 采纳率>60%、满意度>80分

商业实验方案:
  试点设计: 2个部门3个月试点
  定价锚: 首响时间缩短X分钟,培训周期缩短Y天

实验节奏:
  第1-2周: 补充资料
  第3-4周: 能力实验
  第5-6周: 产品实验
  第7周: 商业验证
  第8周: 汇总实验结论报告

Signals

GitHub stars
46
Last commit
Sep 2026
Advanced
Catalog kind
skill
Gateway key
p2a-experiment-overview
Source
github.com/gmaxxxie/ai-native-product-agent-skills