5.1 KiB
5.1 KiB
Benchmark Reproducibility
Generated at: 2026-06-14
Commit: 810885d70e6ed0fa6b19cd5a0edf971057215f9d
Working tree dirty at generation: true
Summary
- reproducibility ready:
true - methodology complete:
true - required artifacts:
20 - missing artifacts:
0 - output cases:
5 - disclosed failure cases:
3 - reproduction commands:
19 - provider evidence complete:
false - human review complete:
false - world-class ready:
false - changed files at generation:
42
This report proves local benchmark reproducibility only. It keeps external provider and human-review gaps visible instead of counting them as complete.
Methodology Sections
| Section | Status |
|---|---|
## Benchmark Types |
present |
## Sample Sources |
present |
## Evaluation Dimensions |
present |
## Weighting Rule |
present |
## Failure Disclosure |
present |
## Reproduction |
present |
Required Artifacts
| Label | Path | Status | SHA256 |
|---|---|---|---|
| methodology | reports/benchmark_methodology.md |
present | 57025e0123ce |
| failure_disclosure | evals/failure-cases.md |
present | 28833c0d4a21 |
| output_cases | evals/output/cases.jsonl |
present | a6ae96857116 |
| output_schema | evals/output/schema.json |
present | 8ee340c95064 |
| output_scorecard | reports/output_quality_scorecard.json |
present | 0806258a8e08 |
| output_execution | reports/output_execution_runs.json |
present | c85fa48112af |
| blind_review | reports/output_blind_review_pack.json |
present | bbe2db8ec277 |
| review_adjudication | reports/output_review_adjudication.json |
present | 5765254c4309 |
| trigger_scorecard | reports/route_scorecard.json |
present | c164e83e36d0 |
| runtime_conformance | reports/conformance_matrix.json |
present | 8251329e663d |
| trust_report | reports/security_trust_report.json |
present | 408b3a7c0921 |
| python_compatibility | reports/python_compatibility.json |
present | 809d07d66de3 |
| registry_audit | reports/registry_audit.json |
present | 2a086d469885 |
| package_verification | reports/package_verification.json |
present | 9a48d94965cc |
| install_simulation | reports/install_simulation.json |
present | 5e6e50170658 |
| skill_os2_audit | reports/skill_os2_audit.json |
present | ed1be043898a |
| world_class_evidence_plan | reports/world_class_evidence_plan.json |
present | ed1274b7c18c |
| world_class_evidence_ledger | reports/world_class_evidence_ledger.json |
present | 5ed043491c3d |
| world_class_evidence_intake | reports/world_class_evidence_intake.json |
present | 6eae947a6e2f |
| world_class_claim_guard | reports/world_class_claim_guard.json |
present | 608c954d1af9 |
Reproduction Commands
git rev-parse HEAD- evidence:
git commit hash
- evidence:
make eval-suite- evidence:
reports/eval_suite.json
- evidence:
python3 scripts/yao.py output-eval- evidence:
reports/output_quality_scorecard.json
- evidence:
python3 scripts/yao.py output-exec --runner-command '["python3","scripts/local_output_eval_runner.py"]'- evidence:
reports/output_execution_runs.json
- evidence:
python3 scripts/yao.py output-review- evidence:
reports/output_review_adjudication.json
- evidence:
python3 scripts/yao.py skill-ir . --output-json skill-ir/examples/yao-meta-skill.json- evidence:
skill-ir/examples/yao-meta-skill.json
- evidence:
python3 scripts/yao.py conformance .- evidence:
reports/conformance_matrix.json
- evidence:
python3 scripts/yao.py trust .- evidence:
reports/security_trust_report.json
- evidence:
python3 scripts/yao.py python-compat .- evidence:
reports/python_compatibility.json
- evidence:
python3 scripts/yao.py package . --platform openai --platform claude --platform generic --platform vscode --expectations evals/packaging_expectations.json --output-dir dist --zip- evidence:
dist/yao-meta-skill.zip
- evidence:
python3 scripts/yao.py package-verify . --package-dir dist --require-zip- evidence:
reports/package_verification.json
- evidence:
python3 scripts/yao.py install-simulate . --package-dir dist- evidence:
reports/install_simulation.json
- evidence:
python3 scripts/yao.py registry-audit .- evidence:
reports/registry_audit.json
- evidence:
python3 scripts/yao.py skill-os2-audit .- evidence:
reports/skill_os2_audit.json
- evidence:
python3 scripts/yao.py world-class-evidence .- evidence:
reports/world_class_evidence_plan.json
- evidence:
python3 scripts/yao.py world-class-ledger .- evidence:
reports/world_class_evidence_ledger.json
- evidence:
python3 scripts/yao.py world-class-intake .- evidence:
reports/world_class_evidence_intake.json
- evidence:
python3 scripts/yao.py world-class-claim-guard .- evidence:
reports/world_class_claim_guard.json
- evidence:
make ci-test- evidence:
CI target output
- evidence:
Failure Disclosure
- path:
evals/failure-cases.md - disclosed cases:
3 - policy: Keep representative failures visible and tied to regression checks.
Limits
- Local command-runner evidence is reproducible but does not replace provider-backed model holdout evidence.
- Pending blind-review decisions are visible but do not count as human adjudication.
- World-class readiness remains false until external and human evidence gaps close.