Files
2026-07-13 21:36:11 +08:00
..
2026-07-13 21:36:11 +08:00

council-review — 评估测试框架

级别: 复合型(完整模式下编排 11 个并行 agent 调用)。 复合型技能无法进行行为层面的单元测试。本测试框架锁定的是设计契约——SKILL.md 必须在 README 和 CLAUDE.md 中明确列出每个顾问、模式及步骤。出现偏差即意味着声称的行为与实现不再匹配。

断言的内容

  • SKILL.md 中命名的全部 5 个顾问角色(Contrarian、First Principles、Expansionist、Outsider、Executor
  • 全部 5 种 DMAD 推理方法(Inversion、Decomposition、Analogy、Naive questioning、Dependency graphing
  • 两种模式标志均已记录(--quick--adversarial
  • 全部 6 个执行步骤(步骤 0 至步骤 5)
  • 匿名化不变性存在(根据 CLAUDE.md 不可协商)
  • 范围校验守卫存在
  • README 命名了该技能并记录了安装方式
  • LICENSE 文件已随附

运行

bash tests/eval.sh

退出码 0 = 契约完好。退出码 1 = 声称的契约出现回归。

本测试未测试的内容

  • 5 个顾问 agent 是否真正生成(无运行时调用)
  • 同行评审在运行时是否真正匿名化
  • 主席综合意见质量是否高
  • 分歧分类是否正确触发

这些属于行为属性,需要借助 LLM 作为评判者对照已录制的黄金运行记录进行验证。暂缓,待基线数据存在后再做。

扩展

  • 如果未来的 PR 新增第 6 个顾问,请将其添加到顾问断言中。
  • 如果某个模式标志被重命名,请更新评估测试。
  • 每一次记录到的实际场景遗漏,都应在此产生一条新断言。