audit-benchmark-validity

SkillMonitoring & ops

Lets your agent check whether a benchmark actually measures what it claims, spotting contamination and flaws.

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the audit-benchmark-validity skill

About this skill

Treat benchmarks as scientific measurement instruments: audit construct validity, contamination, metric pathology, coverage, leaderboard dynamics, and protocol drift.

What this skill tells your AI

The instructions your AI receives, as published by yogsoth-ai/de-anthropocentric-research-engine in skills/audit-benchmark-validity/SKILL.md and read by ahel’s review.

Purpose

Treat benchmarks as scientific measurement instruments: audit construct validity, contamination, metric pathology, coverage, leaderboard dynamics, and protocol drift.

Input contract

required: [benchmark_spec, task_definition, metric_definition, evaluation_records]
optional: [leaderboard_history, protocol_versions, coverage_target]
constraints: [claims must be linked to benchmark evidence]

Execution protocol

Do not perform called SOP operations inline; each loaded SOP owns its contract and thresholds.

  1. You MUST load skill inventory-reference-items to inventory benchmark components and versions. You MUST load skill decompose-evaluation-metric to decompose the evaluation metric. You MUST load skill assess-construct-validity to assess the benchmark construct. You MUST load skill extract-evaluation-protocol to reconstruct protocol versions.
  2. Select validity, contamination, saturation, coverage, protocol-forensics, or evaluation-comparison mode.
  3. You MUST load skill audit-data-contamination to audit contamination. You MUST load skill map-coverage-space to map data and task coverage. You MUST load skill analyze-leaderboard-dynamics to analyze saturation and temporal dynamics. You MUST load skill compare-evaluation-protocols to compare protocol and metric variants. You MUST load skill probe-benchmark-artifact to probe artifacts and shortcut paths.
  4. You MUST load skill audit-reporting-quality to audit reporting quality and return the validity verdict with threats, evidence, and required repairs. If the audit exposes systematic coverage gaps, consider coverage-white-space-search. If the benchmark or metric may share assumptions with the tested system, consider audit-validator-independence.

Output contract

produces: [validity_verdict, threat_register, contamination_findings, coverage_map, protocol_drift_report, repair_actions]
delta_fields: [findings, evidence_updates, uncertainties, decisions, open_questions, recommended_jumps]

Thresholds and quality gates

  • Every source HARD-GATE remains mandatory; no exit with an untested construct, contamination path, metric pathology, coverage claim, or protocol change.
  • Resource and sampling gates use relative benchmark/target/evidence coverage rather than fixed benchmark, paper, or web counts. Declare the eligible universe, record numerator, denominator, batch increment, stopping reason, and source references.
  • Saturation claims require an explicit stopping criterion and evidence that additional search/testing no longer changes the conclusion; report marginal information gain and saturation state.
  • BetterBench-style criterion lists remain content checklists. Their item count is not converted into a percentage; the audit reports criterion coverage ratio over the declared applicable set and an independent-source ratio.
  • Evaluation comparisons must state the controlled protocol difference and its expected impact.

Failure and counterexamples

Reject "valid" when benchmark artifact probes are absent, contamination is unknown but ignored, or leaderboard gains cannot be separated from protocol drift. A high score is not evidence of construct validity by itself.

Provenance map

7 architecture old entries: archaeology, audit, saturation, validity probing, coverage mapping, protocol forensics, evaluation comparison. Provider-specific retrieval compressed.

Legacy context checkpoint / Delta notes

Append benchmark version, construct claims, probes, contamination evidence, coverage gaps, protocol diffs, verdict, and repair decisions.

Preserved source criteria ledger

sourcesource linekindsource criterion
benchmark-archaeology39numeric-table\
benchmark-archaeology72numeric-table\
benchmark-archaeology73numeric-table\
benchmark-archaeology74numeric-table\
benchmark-archaeology75numeric-table\
benchmark-archaeology76numeric-table\
benchmark-archaeology77numeric-table\
benchmark-audit28numeric-table\
benchmark-audit29numeric-table\
benchmark-audit30numeric-table\
benchmark-audit35textual
benchmark-audit38numeric-table\
benchmark-audit39numeric-table\
benchmark-audit40numeric-table\
benchmark-audit41numeric-table\
benchmark-audit42numeric-table\
benchmark-audit43numeric-table\
benchmark-audit44numeric-table\
benchmark-audit45numeric-table\
benchmark-audit46textual
benchmark-audit49numericCannot exit until 80% of all targets met.
benchmark-audit81numericbetterbench_score: float # 0-1, proportion of 46 criteria met
saturation-analysis28numeric-table\
saturation-analysis29numeric-table\
saturation-analysis30numeric-table\
saturation-analysis35textual
saturation-analysis38numeric-table\
saturation-analysis39numeric-table\
saturation-analysis40numeric-table\
saturation-analysis41numeric-table\
saturation-analysis42numeric-table\
saturation-analysis43numeric-table\
saturation-analysis44numeric-table\
saturation-analysis45numeric-table\
saturation-analysis46textual
saturation-analysis49numericCannot exit until 80% of all targets met.
saturation-analysis87numericestimated_time_to_ceiling: string # e.g., "6-12 months"
saturation-analysis89numericscore_compression: float # top-10 score range
validity-probing28numeric-table\
validity-probing29numeric-table\
validity-probing30numeric-table\
validity-probing35textual
validity-probing38numeric-table\
validity-probing39numeric-table\
validity-probing40numeric-table\
validity-probing41numeric-table\
validity-probing42numeric-table\
validity-probing43numeric-table\
validity-probing44numeric-table\
validity-probing45numeric-table\
validity-probing46textual
validity-probing49numericCannot exit until 80% of all targets met.
coverage-mapping21textualBuild a comprehensive map of "what we can and cannot measure" for a given AI capability domain. Identify white spaces where important capabilities lack rigorous evaluation, and redundancies where multiple benchmarks test the same narrow skill.
coverage-mapping27numeric-table\
coverage-mapping28numeric-table\
coverage-mapping29numeric-table\
coverage-mapping34textual
coverage-mapping37numeric-table\
coverage-mapping38numeric-table\
coverage-mapping39numeric-table\
coverage-mapping40numeric-table\
coverage-mapping41numeric-table\
coverage-mapping42numeric-table\
coverage-mapping43numeric-table\
coverage-mapping44numeric-table\
coverage-mapping45textual
coverage-mapping48numericCannot exit until 80% of all targets met.
protocol-forensics20textualExpose the "reproducibility gap" in benchmark evaluation by documenting how papers differ in their implementation of supposedly standardized evaluation protocols. Quantify the score variance attributable to protocol differences rather than model improvements.
protocol-forensics26numeric-table\
protocol-forensics27numeric-table\
protocol-forensics28numeric-table\
protocol-forensics33textual
protocol-forensics36numeric-table\
protocol-forensics37numeric-table\
protocol-forensics38numeric-table\
protocol-forensics39numeric-table\
protocol-forensics40numeric-table\
protocol-forensics41numeric-table\
protocol-forensics42numeric-table\
protocol-forensics43numeric-table\
protocol-forensics44textual
protocol-forensics47numericCannot exit until 80% of all targets met.
protocol-forensics61textual1. Target Selection: Choose 5 benchmarks with known reproducibility issues or high paper volume
protocol-forensics63numerica. Collect 10-15 papers that report results on the same benchmark
protocol-forensics76textual6. Synthesis: Produce per-benchmark forensics report with reproducibility recommendations
protocol-forensics98textualreproducibility_grade: A\
evaluation-protocol-comparison12textualCompare how different papers implement the same benchmark to expose hidden protocol variance that undermines cross-paper score comparability.
evaluation-protocol-comparison18numericCollect 10-15 papers that report results on the target benchmark:
evaluation-protocol-comparison36numeric-table\
evaluation-protocol-comparison48textual- Low: Minor variations (e.g., different random seeds)
evaluation-protocol-comparison82textualcross_paper_comparability: high\
evaluation-protocol-comparison91textual\
evaluation-protocol-comparison93numeric-table\
evaluation-protocol-comparison94numeric-table\
evaluation-protocol-comparison95numeric-table\
evaluation-protocol-comparison96numeric-table\

Context checkpoint / Delta notes

Append benchmark version, construct claims, probes, contamination evidence, coverage gaps, protocol diffs, verdict, and repair decisions.

Signals

GitHub stars
501
Forks
41
Last commit
Sep 2026
Advanced
Catalog kind
skill
Key
audit-benchmark-validity
Source
github.com/yogsoth-ai/de-anthropocentric-research-engine