audit-data-contamination
SkillDev toolsLets your agent check whether test data leaked into training data, which can make model evaluation results invalid.
Available today. Use it from your connected AI after setup.
No other account needed.
Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.
Then ask your AI: use the audit-data-contamination skill
About this skill
Audit train/test leakage, memorization artifacts, temporal leakage, and disclosure pathways that can invalidate evaluation.
What this skill tells your AI
The instructions your AI receives, as published by yogsoth-ai/de-anthropocentric-research-engine in skills/audit-data-contamination/SKILL.md and read by ahel’s review.
Purpose
Audit train/test leakage, memorization artifacts, temporal leakage, and disclosure pathways that can invalidate evaluation.
Input contract
required: [dataset_partitions, training_sources, evaluation_records]
optional: [release_history, deduplication_keys, access_logs]
constraints: [each contamination claim requires a matched record, pathway, and comparison basis]
Procedure
- Define partition, temporal, entity, and disclosure boundaries.
- Match evaluation items against training and public-source records using declared keys.
- Test suspected leakage pathways and compare affected with unaffected cases.
- Classify confirmed, plausible, and unassessed contamination with impact notes.
Output contract
produces: [contamination_matches, pathway_map, affected_case_set, impact_assessment, audit_uncertainties]
delta_fields: [findings, evidence_updates, uncertainties, decisions, open_questions]
Quality gates
- Matching keys and time boundaries are recorded.
- False-positive matches are sampled and documented.
Failure and counterexamples
Do not call lexical overlap contamination without a disclosure pathway, and do not infer clean separation from missing metadata.
Provenance map
resolved: knowledge-acquisition-contamination-audit
Signals
- GitHub stars
- 501
- Forks
- 41
- Last commit
- Sep 2026
Advanced
- Catalog kind
- skill
- Key
audit-data-contamination- Source
- github.com/yogsoth-ai/de-anthropocentric-research-engine