council-review — 评估测试框架
级别: 复合型(完整模式下编排 11 个并行 agent 调用)。 复合型技能无法进行行为层面的单元测试。本测试框架锁定的是设计契约——SKILL.md 必须在 README 和 CLAUDE.md 中明确列出每个顾问、模式及步骤。出现偏差即意味着声称的行为与实现不再匹配。
断言的内容
- SKILL.md 中命名的全部 5 个顾问角色(Contrarian、First Principles、Expansionist、Outsider、Executor)
- 全部 5 种 DMAD 推理方法(Inversion、Decomposition、Analogy、Naive questioning、Dependency graphing)
- 两种模式标志均已记录(
--quick、--adversarial) - 全部 6 个执行步骤(步骤 0 至步骤 5)
- 匿名化不变性存在(根据 CLAUDE.md 不可协商)
- 范围校验守卫存在
- README 命名了该技能并记录了安装方式
- LICENSE 文件已随附
运行
bash tests/eval.sh
退出码 0 = 契约完好。退出码 1 = 声称的契约出现回归。
本测试未测试的内容
- 5 个顾问 agent 是否真正生成(无运行时调用)
- 同行评审在运行时是否真正匿名化
- 主席综合意见质量是否高
- 分歧分类是否正确触发
这些属于行为属性,需要借助 LLM 作为评判者对照已录制的黄金运行记录进行验证。暂缓,待基线数据存在后再做。
扩展
- 如果未来的 PR 新增第 6 个顾问,请将其添加到顾问断言中。
- 如果某个模式标志被重命名,请更新评估测试。
- 每一次记录到的实际场景遗漏,都应在此产生一条新断言。