aios-prompt-compare — independently scanned and version-tracked by SaferSkills.
SaferSkills independently audited aios-prompt-compare (Agent Skill) and scored it 100/100 (green). The audit ran 55 deterministic rules across Security, Supply Chain, Maintenance, Transparency, and Community; it found 0 high-severity and 0 lower-severity findings. The full rule-by-rule trace and per-finding evidence are below. Free, methodology-open.
Findings & checks · 0 flagged
Every scanned point with the score it earned and what moved between them.
First recorded scan — no prior version to compare against.
The primary manifest — the file an agent reads to learn what this artifact does.
以 Daedalus(AI 研发工程师)的方式组织 Prompt / Skill 效果对比,把同一输入下的弱提示词、便携强提示词和真实 Skill 触发结果拆成三栏评估,判断哪一类输出更稳定、更可复核、更值得沉淀为 Skill。
本 Skill 是内部评估和治理入口,不替代具体业务 Skill 执行,也不直接把评测结论当作生产可用性承诺。普通用户比较两份文档、两个版本或两个 AI 输出哪份更专业时,应使用 aios-compare,不要触发本 Skill。
aios-prompt-compare,并要做 Prompt / Skill 测试。weakPrompt、prompts/basic-prompt.md 和 $aios-* Skill 真实运行结果。prompts/evaluations/*fixtures.json、run pack、run results 和 scorecard。不适用:
aios-compare。优先收集:
prompts/evaluations/engineering-business-basic-fixtures.json。对比报告必须保留三类输出的原始正文,不能只写摘要。
最低要求:
Raw Output Map,列出 weak、portable、skill-runtime 三类输出是否已提供、来源文件或运行记录、是否经过脱敏。原始输出附录,分别放入 weak 原始输出、portable 原始输出、skill-runtime 原始输出。未提供原始输出,并在结论中说明本次对比证据不足。[客户A]、[项目A]、[地点A]、[金额A]、[日期A]、[源文件A],再放入附录。摘要、scorecard 和沉淀判断只能基于这些原始输出得出;不能凭记忆、推测或二次转述补写原始输出。
默认使用三类输出,不要混在一个结论里:
weak:弱提示词结果。通常来自 fixture 中的 weakPrompt,用于暴露随口问的失败模式。portable:便携强提示词结果。通常来自 skills/*/prompts/basic-prompt.md,用于验证无 Skill runtime 时的最低可用版本。skill-runtime:真实 Skill 结果。必须来自宿主工具按 $aios-* 或自动 Skill 触发机制执行后的输出,而不是简单把 SKILL.md 当普通 prompt 粘贴。如果当前只有 weak/basic 两类结果,明确标注 skill-runtime: 未提供,不要假装完成了 Skill 运行对比。
已有工程业务管理评测链路:
npm run validate:prompts
npm run validate:prompt-run-pack
npm run build:prompt-run-pack
npm run validate:public-advisory-run-pack
npm run build:public-advisory-run-pack
npm run validate:prompt-run-results
npm run analyze:prompt-run-results -- --file prompts/evaluations/<results>.json --out prompts/evaluations/<report>.md这些脚本默认组织 weak / portable 对照。真实 skill-runtime 输出需要由宿主 Agent 实际触发对应 $aios-* Skill 后归档,再进入本 Skill 的三栏人工或半自动分析。
默认输出:
三栏摘要格式:
caseId:
输入:
weak:
portable:
skill-runtime:
关键差异:Raw Output Map 格式:
caseId:
weak 原始输出:已提供 / 未提供
portable 原始输出:已提供 / 未提供
skill-runtime 原始输出:已提供 / 未提供
脱敏状态:
证据缺口:Scorecard 条目格式:
维度:
weak:
portable:
skill-runtime:
证据:
判定:沉淀判断格式:
是否应升级为 Skill:
原因:
需要进入 SKILL.md 的规则:
仍保留为 portable prompt 的内容:
需要补的 fixture / scorecard:原始输出附录格式:
## 原始输出附录
### weak 原始输出
粘贴 weak 模型原始输出;如缺失,写“未提供原始输出”。
### portable 原始输出
粘贴 portable 模型原始输出;如缺失,写“未提供原始输出”。
### skill-runtime 原始输出
粘贴真实 Skill 触发后的原始输出;如缺失,写“未提供原始输出”。
SKILL.md 文本粘贴运行的结果称为真实 Skill 结果。[源文件A] 或公开 fixture 相对路径替代。~30 seconds. Free. No account. Every finding cites a rule and a line of evidence.