Your AI agent skill doctor - 5-dimension scoring + security gate + leaderboard
SaferSkills independently audited skill-evaluator (Agent Skill) and scored it 100/100 (green). The audit ran 55 deterministic rules across Security, Supply Chain, Maintenance, Transparency, and Community; it found 0 high-severity and 0 lower-severity findings. The full rule-by-rule trace and per-finding evidence are below. Free, methodology-open.
Findings & checks · 0 flagged
Every scanned point with the score it earned and what moved between them.
First recorded scan — no prior version to compare against.
The primary manifest — the file an agent reads to learn what this artifact does.
评估一个技能是否值得安装。两步走:安全门禁 → 类型评分。
用户没给路径 → 问文件路径或 .skill 文件位置。
使用 scripts/evaluate.sh --security <path> 自动扫描。如果 Bash 不可用(如 Claude.ai),逐项手动检查:
| # | 检查项 | 手动方法 |
|---|---|---|
| 1 | 脚本可读 | 打开 scripts/ 下所有文件看是否可读 |
| 2 | 网络外呼 | 全文搜索 curl/wget/fetch 等函数调用 |
| 3 | 凭证采集 | 搜索 api.key/token/secret/password |
| 4 | 远程代码 | 搜索 curl/wget 管道到 bash/sh |
| 5 | 安全绕过 | 搜索"自动批准/关掉权限" |
输出格式统一: ✅ 或 ❌ 逐项列出,任意 ❌ 则终止,输出"高风险"。
问用户:
"这是 普通技能(日常用)还是 元技能(用来创建/评估其他技能的)?"
用户不确定 → 看描述和目录结构辅助判断。
自动检查优先,主观项问用户。
每个维度的评分流程:
普通技能 → 读 references/consumer-card.md(v3.0),5 维度 元技能 → 读 references/meta-skill-card.md(v3.0),6 维度
重要评分原则:
═══════════════════════════════════════════
技能评估报告
═══════════════════════════════════════════
技能:xxx.skill
类型:普通技能
安全:✅ 通过
┌─ 维度 得分 理由
├ 触发精确度 20/25 描述清晰无负例
├ 执行-完整 12/15 指令有少量缺口
├ 执行-知识 9/12 scripts/ 提供自动化
├ 执行-可靠 6/8 无已知问题
├ 经济性 16/20 450行, 中密度
├ 可信度 8/12 社区来源+脚本完整
├ 理解成本 8/8 结构清晰有示例
└───────────────────────────
总分:79/100
评定:✅ 推荐安装
一句话:触发精准、有脚本支撑,值得试用。
同类对比:无现存同类如果用户提到同类对比,末尾追加:
同类对比:
┌ 此技能 79/100 优势:有脚本 劣势:无负例
├ 对比项A 82/100 优势:有benchmark 劣势:偏长
└ 对比项B 65/100 优势:免费 劣势:触发模糊
建议:选此技能,但如果需要 benchmarks 可考虑 AClaude Code(完整能力):
scripts/evaluate.sh --all 全自动Claude.ai(受限能力):
无头/Headless(中等能力):
应触发: "评估这个技能"、"值不值得装"、"帮我看看这个技能"、"新技能判断"
不触发: 纯概念讨论技能是什么、在创建/修改技能(走 skill-creator)、技术细节讨论
| 借口 | 真相 |
|---|---|
| "这个技能看起来很小,不用走门禁了吧" | 最小的技能可能藏最大的恶意。门禁不可跳过。 |
| "这是我写的技能,不用评了吧" | 自写技能更可能有盲点。评分能帮你客观审视。 |
| "先装再说,有问题再卸" | 恶意技能可能在第一次触发时就窃取数据。"先评再装"。 |
| "我只看触发描述就知道它好不好" | 触发描述好不代表执行力和安全性好。走完整流程。 |
| "这个分数还不到50但我觉得有用" | 铁律2允许用户坚持。但你知道风险了。 |
| "太长了不想读评分卡" | 所以我才先做自动检查。关键问题 1-2 个就好。 |
| 问题 | 做法 |
|---|---|
| 不确定类型 | 问用户 |
| 文件不存在 | 问路径 |
| 用户不想回答评分问题 | 按最佳判断打分,标注"未确认" |
| 脚本没有 Bash 环境 | 手动逐项检查 |
| 恶意技能有加密/压缩脚本 | 判断为 ❌,不需进一步分析 |
~30 seconds. Free. No account. Every finding cites a rule and a line of evidence.