数据质量评估
SkillDatabases & dataEvaluate dataset trustworthiness and completeness. Checks granularity, freshness, nulls, duplicates, schema drift, referential integrity, and distribution anomalies, and provides a confidence rating of "deliverable / deliverable with reservations / needs rework." Trigger scenarios: is the data relia
Available today. Use it from your connected AI after setup.
No other account needed.
Connect ahel once, and every AI you use reads what you have installed.
Then ask your AI: use the 数据质量评估 skill
What this skill tells your AI
The instructions your AI receives, as published by rongxinzy/rongxinai in SKILLs/zhiyuan-expert-manager/presets/data-analyst/skills/data-quality-review/SKILL.md and read by ahel’s review.
目标
在分析开始前或交付前验证数据可信度,输出可复核的评估结论。先验数据,再谈结论。
输入
- 数据集路径或连接信息(CSV / Excel / SQLite / 数据库表)
- 分析用途与关键结论(用于定向检查)
工作流
Step 1:形状画像
读取样本与表结构,记录:
- 粒度(一行代表什么?是否存在一行多事件/多行一事件的混淆)
- 行数、列数、字段类型
- 时间范围与新鲜度(最新数据距今多久,是否覆盖决策窗口)
Step 2:完整性检查
- 空值率:逐列统计,标注 >5% 的列
- 重复:按业务主键查重(注意同一主键多状态行是否合法)
- 唯一性:主键是否唯一,join 键两侧基数是否匹配
Step 3:一致性检查
- 模式漂移:枚举/分类字段的值域与历史基线对比
- 数值合理性:极小值/极大值/负数/零值是否落在业务可解释区间
- 关联完整性:外键是否能全部命中维表
Step 4:结论评级
按以下标准输出评级与理由:
| 评级 | 标准 |
|---|---|
| 可交付 | 关键字段缺失 <1%,主键唯一,时间窗覆盖决策需求,无异常值 |
| 带保留交付 | 存在可解释的缺失/异常,已标注且不影响核心结论 |
| 需返工 | 关键维度缺失、粒度混乱或值域漂移无法解释 |
输出规范
- 每项问题附:字段、现象、样本证据、对分析的影响
- 结论先给评级,再给逐项发现
- 评级为"需返工"时,明确列出返工清单
工具建议
- 结构与小数据:
xlsx技能读取后直接检查 - 大数据与 SQL:
database-inspector技能 - 数值分布与异常:
code-to-chart技能输出直方图/箱线图佐证
Signals
- GitHub stars
- 151
- Forks
- 3
- Last commit
- Sep 2026
Advanced
- Catalog kind
- skill
- Gateway key
data-quality-review- Source
- github.com/rongxinzy/rongxinai