experiment-orchestrator — independently scanned and version-tracked by SaferSkills.
SaferSkills independently audited experiment-orchestrator (Agent Skill) and scored it 100/100 (green). The audit ran 55 deterministic rules across Security, Supply Chain, Maintenance, Transparency, and Community; it found 0 high-severity and 0 lower-severity findings. The full rule-by-rule trace and per-finding evidence are below. Free, methodology-open.
Findings & checks · 0 flagged
Every scanned point with the score it earned and what moved between them.
First recorded scan — no prior version to compare against.
The primary manifest — the file an agent reads to learn what this artifact does.
实验是学习的最快方式
每一个实验都是一次有控制的探索,目标不是证明假设正确,而是以最快速度获得可靠的学习。实验的价值在于学习速度,而非实验数量。
编排协议遵循 orchestrator-protocol.md 统一标准。
pipeline: experiment-orchestrator
version: 8.0
post_pipeline:
- action: stage-summary
output: output/phase-reports/pm-metrics-ops/experiment-orchestrator.md
stages:
- id: phase-1
name: "实验设计"
depends_on: []
skills: [experiment-design]
gate:
condition: "实验设计经人类审核确认"
fail_action: "阻止实验上线,修改后重新审核"
- id: phase-2
name: "实验执行"
depends_on: [phase-1]
skills: [experiment-execution]
gate:
condition: "样本量充足且统计检验完成、实验报告经人类审核确认"
fail_action: "延长实验周期或扩大流量"#### 调用 experiment-design
Skill: experiment-design
输入:
hypothesis: 用户提供(假设陈述)
available_traffic: 用户提供(可用流量)
metrics_system: metrics-system → metrics.json(可选)
historical_data: analysis-funnel/analysis-retention(可选)
输出: output/pm-metrics-ops/experiment-design/
验证: 假设已结构化(If-Then-Because-For);主指标与假设直接对应;护栏指标覆盖留存、收入、技术三个维度;样本量计算参数有据可依
模式: 🤖→👤#### 调用 experiment-execution
Skill: experiment-execution
输入:
experiment_design: output/pm-metrics-ops/experiment-design/experiment_design.json
experiment_data: 用户提供
termination_conditions: output/pm-metrics-ops/experiment-design/experiment_design.json
product_background: 用户提供(可选)
输出: output/pm-metrics-ops/experiment-execution/
验证: 实验分组流量分配正确;护栏指标未触发告警;实验数据采集完整;统计显著性计算正确;统计结论与数据一致;行动建议与结论一致;护栏指标全覆盖;异质性效应已分析(至少3个分群维度)
模式: 🤖→👤所有业务阶段执行完成后,必须立即生成阶段总结文档:
动作: 生成阶段总结
输入:
所有子Skill输出: output/pm-metrics-ops/
人类决策记录: 本轮执行中的人类决策点及结果
输出: output/phase-reports/pm-metrics-ops/experiment-orchestrator.md
验证: 阶段总结文档已生成,6项结构(执行概览/关键发现/决策记录/产出清单/风险与待办/下游衔接)均非空
下游衔接:
primary:
target: decision-orchestrator
reason: 实验完成,将实验结论转化为决策行动
input_mapping:
experiment_output: "output/pm-metrics-ops/experiment-execution/ → decision-dace输入"
alternatives:
- target: release-orchestrator
reason: 实验结果显著,建议全量发布
condition: 实验结果统计显著(p<0.05)且业务意义达标时
- target: analysis-orchestrator
reason: 实验结果需更深入的数据分析
condition: 实验结果存在异常或需多维下钻时
special_cases: []
模式: 🤖⏸ 阶段卡口:阶段总结文档已生成且6项结构均非空 → 未通过:补充缺失结构项后重新生成
| 卡口 | 条件 | 未通过处理 |
|---|---|---|
| 实验方案人类已审核 | 实验设计经人类审核确认 | 阻止实验上线,修改后重新审核 |
| 统计显著性已判断 | experiment-result输出文件已生成且非空 | 延长实验周期或扩大流量 |
| 实验报告已审核 | 实验报告经人类审核确认 | 补充分析或修改结论 |
| 阶段总结已生成 | output/phase-reports/pm-metrics-ops/experiment-orchestrator.md 已生成且6项结构均非空 | 补充缺失结构项后重新生成 |
| 决策点 | 触发条件 | 决策内容 |
|---|---|---|
| 实验方案审核 | 实验设计完成 | 审核假设合理性、指标选择、分流方案 |
| 全量/终止决策 | 实验结果分析完成 | 决定全量发布、终止实验或延长周期 |
| 实验报告确认 | 实验报告生成完成 | 确认报告结论和行动建议 |
| 条件 | Action |
|---|---|
| 样本量达到100% | 立即触发结果分析 |
| 统计显著(p < 0.05)且稳定 | 考虑提前终止 |
| 护栏指标显著下降 | 触发告警,考虑终止 |
| 新奇效应显著 | 延长实验周期 |
| 实验组持续负向 | 考虑提前终止 |
| 异常类型 | 处理策略 |
|---|---|
| 实验设计人类审核未通过 | 阻止实验上线,返回设计阶段修改,不进入执行阶段 |
| 护栏指标突破阈值 | 立即暂停实验执行,触发告警,提交人类决策是否终止实验 |
| 实验数据采集异常 | 标记数据异常,暂停统计检验,提示人类检查数据管道 |
| 实验报告人类审核未通过 | 返回执行阶段补充分析,不传递到下游 |
| 多实验流量冲突 | 按优先级排队,低优先级实验暂停,标注"流量冲突" |
| 阶段总结生成失败 | 基于已完成的子Skill输出生成部分总结,缺失项标注"数据缺失",不阻塞编排完成 |
~30 seconds. Free. No account. Every finding cites a rule and a line of evidence.