auto-test-code — independently scanned and version-tracked by SaferSkills.
SaferSkills independently audited auto-test-code (Agent Skill) and scored it 100/100 (green). The audit ran 55 deterministic rules across Security, Supply Chain, Maintenance, Transparency, and Community; it found 0 high-severity and 0 lower-severity findings. The full rule-by-rule trace and per-finding evidence are below. Free, methodology-open.
Findings & checks · 0 flagged
Every scanned point with the score it earned and what moved between them.
First recorded scan — no prior version to compare against.
The primary manifest — the file an agent reads to learn what this artifact does.
bensz-collect-bugs 规范记录到 ~/.bensz-skills/bugs/,不要直接修改用户本地已安装的 skill 源码;若有 workaround,先记 bug,再继续完成任务。gh 上传新增 bug 到 huangwb8/bensz-bugs;不要 pull / clone 整个仓库。本技能的审查结论和验证证据必须落盘到目标代码项目的隔离工作区中,形成可追溯、可复核、后续可接续的会话文件。
默认交付根目录为 .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/;实际目录以 config.yaml 中的 directories.tmp 和 directories.tests 为准。
每个 A 轮或 B 轮会话目录都必须包含同一组文件:
REVIEW.md:审查报告。A 轮记录批判性代码审查的问题清单与改进计划;B 轮记录代码质量原则检查结果。TEST_PLAN.md:测试计划,说明本轮要验证的修复点、核心路径和预期证据。TEST_RUN.md:测试过程记录,包含实际执行的命令、关键输出摘录和关键决策。TEST_REPORT.md:测试结果报告,包含结论、证据、遗留问题和后续建议。_artifacts/:中间产物目录,用于保存命令输出、日志、截图、对比结果等证据。.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/,同一次技能执行的所有 A/B 轮必须复用同一个 run_id。vYYYYMMDDHHMM,使用分钟级时间戳。.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/vYYYYMMDDHHMM/。.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/b-vYYYYMMDDHHMM/,即在同类会话 ID 前增加 b- 前缀。verify_session.py 可识别历史目录名 tests/B轮-vYYYYMMDDHHMM/;新建目录必须使用 .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/b-vYYYYMMDDHHMM/。reviews/ 不再创建、不再写入;如目标项目中存在旧的 reviews/,只视为历史遗留并在审查时排除。.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/。.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/ 工作区内。TMPDIR、XDG_CACHE_HOME、PYTHONPYCACHEPREFIX 等重定向到当前 .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/ 工作区。.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/ 之外的位置,以免污染源软件项目。用户输入(目标代码路径)
↓
[A轮 × N]:静态分析 → 动态推理 → 安全分类审查 → 计划 → 优化 → 轻量测试
↓
B轮:代码质量原则检查 → 针对性优化 → 轻量验证
↓
完成(文档齐全 + 问题闭环)#### A.1 初始化会话(生成测试 ID + 目录)
目标:创建本轮的 .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/ 会话骨架(计划/过程/结果都在同一目录)。
推荐使用确定性脚本:
# 在目标代码根目录内执行(选择你实际的安装路径)
RUN_ID=YYYY-MM-DD-HH-MM
python3 ~/.codex/skills/auto-test-code/scripts/create_session.py --code-root . --run-id "$RUN_ID" --kind a --id vYYYYMMDDHHMM
# 或
RUN_ID=YYYY-MM-DD-HH-MM
python3 ~/.claude/skills/auto-test-code/scripts/create_session.py --code-root . --run-id "$RUN_ID" --kind a --id vYYYYMMDDHHMM最低要求:
.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/ 存在.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/vYYYYMMDDHHMM/REVIEW.md、TEST_PLAN.md、TEST_RUN.md、TEST_REPORT.md 和 _artifacts/ 存在#### A.2 批判性分析与计划生成(写入 .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/ 会话目录)
目标:使用批判性思维发现代码中的系统性问题,写成可执行计划,按 P0/P1/P2 排序。
输出:.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/vYYYYMMDDHHMM/REVIEW.md
⚠️ 批判性思维是核心要求:
references/CRITICAL_THINKING_FOR_CODE.md)质量要求(强制):
核心要求:
.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/ 工作区中的审查文件config.yaml:a_round_check.independent_review.scan_patterns 为准)tmp/ 等 skill 产物目录,以及 node_modules/、venv/、__pycache__/ 等依赖/缓存目录;目标项目的测试代码仍属于必须审查范围config.yaml:a_round_check.dimensions 为准);不得以“本轮不聚焦”为由跳过任何维度批判性思维框架(必读):
references/CRITICAL_THINKING_FOR_CODE.md ⚠️ 核心文档,必须使用references/A_ROUND_REVIEW_TEMPLATE.md ⚠️ 代码审查计划模板references/CODE_SMELLS.md 代码异味识别指南references/SECURITY_PATTERNS.md 安全漏洞模式库references/SECURITY_TAXONOMY.md 安全漏洞分类审查体系(必须用于安全维度)references/DESIGN_ANTI_PATTERNS.md 设计反模式识别指南#### A.3 执行优化与轻量测试(写入 .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/)
目标:按计划逐项修复,并用轻量测试验证。
输出:
.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/vYYYYMMDDHHMM/TEST_RUN.md.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/vYYYYMMDDHHMM/TEST_REPORT.md轻量测试原则:
.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/vYYYYMMDDHHMM/_artifacts/可选增强:
python3 ~/.codex/skills/auto-test-code/scripts/verify_session.py --require-review .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/vYYYYMMDDHHMM
# 或
python3 ~/.claude/skills/auto-test-code/scripts/verify_session.py --require-review .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/vYYYYMMDDHHMM说明:verify_session.py --strict 仅用于你已将会话文档中的模板占位符全部替换后的最终自检;新建骨架默认会失败(属于预期行为)。
#### A.4 是否进入下一轮
⚠️ 强制检查:
进入下一轮 A 轮的条件:
重要:A 轮结束后,必须进入 B 轮代码质量检查。
⚠️ 强制执行:B 轮代码质量检查是自动测试流程的强制性环节。
#### B.1 产出质量检查报告(写入 .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/ 会话目录)
目标:对 A 轮后的最新代码做系统性质量检查。
输出:.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/b-vYYYYMMDDHHMM/REVIEW.md
推荐使用确定性脚本创建 B 轮会话目录:
# 在目标代码根目录内执行(选择你实际的安装路径)
RUN_ID=YYYY-MM-DD-HH-MM
python3 ~/.codex/skills/auto-test-code/scripts/create_session.py --code-root . --run-id "$RUN_ID" --kind b --id vYYYYMMDDHHMM --a-test-id vYYYYMMDDHHMM
# 或
RUN_ID=YYYY-MM-DD-HH-MM
python3 ~/.claude/skills/auto-test-code/scripts/create_session.py --code-root . --run-id "$RUN_ID" --kind b --id vYYYYMMDDHHMM --a-test-id vYYYYMMDDHHMM检查维度(以 config.yaml 的 b_round_check.dimensions 为准):
模板:templates/B_ROUND_CODE_QUALITY_TEMPLATE.md
#### B.2 B 轮优化与验证(写入 .bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/)
⚠️ 强制修复要求:
完成条件:
.bensz-api/skills/auto-test-code/{yyyy-mm-dd-hh-mm}/output/tests/ 会话结构完整且可追溯(每轮都有 REVIEW.md、TEST_PLAN.md、TEST_RUN.md、TEST_REPORT.md 和 _artifacts/)config.yamltemplates/templates/CODE_REVIEW_TEMPLATE.mdtemplates/B_ROUND_CODE_QUALITY_TEMPLATE.mdtemplates/SESSION_TEST_PLAN_TEMPLATE.mdtemplates/SESSION_TEST_RUN_TEMPLATE.mdtemplates/SESSION_TEST_REPORT_TEMPLATE.mdreferences/references/CRITICAL_THINKING_FOR_CODE.md ⚠️references/A_ROUND_REVIEW_TEMPLATE.md ⚠️references/CODE_SMELLS.mdreferences/SECURITY_PATTERNS.mdreferences/SECURITY_TAXONOMY.md ⚠️references/BOUNDARY_CHECKLIST.mdreferences/DESIGN_ANTI_PATTERNS.mdscripts/create_session.pyscripts/verify_session.py~30 seconds. Free. No account. Every finding cites a rule and a line of evidence.