BZD 数学建模论文AI痕迹审计工具 v2.2

SkillDev tools

Performs a two-layer AI-trace audit of mathematical modeling competition papers — Layer 1: 9-dimension detection (linguistic level 60%: connectives/parallelism/exaggerated words/passive sentences/paragraph regularity/text complexity; factual level 40%: citation verification/numerical consistency/ter

Available today. Use it from your connected AI after setup.

Connect ahel once, and every AI you use reads what you have installed.

Then ask your AI: use the BZD 数学建模论文AI痕迹审计工具 v2.2 skill

What this skill tells your AI

The instructions your AI receives, as published by bzdmathclub/bzd-math-modeling-skills in skills/论文自查类/bzd-paper-aigc-auditor/SKILL.md and read by ahel’s review.

融合nature-AIGC检测方法 · 严格判分版

核心原理

两层递进式检查 + 9维融合检测

  1. 第一层:增强的9维框架(100分制)

    • 语言层面(权重60%):融合nature-detector的统计特征分析
      • 维度1: 高频连接词(Humanizer-zh)
      • 维度2: 排比/同构句式识别
      • 维度3: 拔高词与修饰词(5级分类)
      • 维度4: 被动句占比与语态分析
      • 维度5: 段落结构规律性
      • 维度6: 文本复杂度(熵值、n-gram、TTR)
    • 事实层面(权重40%):融合nature-detector的事实验证
      • 维度7: 引文验证(L1-L3三层检查)
      • 维度8: 数值一致性追踪(参数溯源)
      • 维度9: 术语一致性检测
  2. 第二层:数学建模逻辑审查(100分制)

    • 2.1 模型常用性判断:对标数模竞赛常用模型库
    • 2.2 复杂度vs收益评估:识别过度工程化
    • 2.3 华而不实识别:五大AI特征检查
    • 2.4 模型选择"三问法":逻辑论证验证
    • 2.5 建模路径风格:区分人主导的渐进建模与AI式复杂化倾向

最终评分 = (第一层 + 第二层) / 2 → 风险等级 → HTML分层报告

新增能力

  • ✨ 引文真实性验证(相比v2.0的"只是检查格式")
  • ✨ 数值参数追踪与一致性检查(发现虚构或计算错误)
  • ✨ 文本复杂度的科学度量(TTR、熵值、n-gram频率)
  • ✨ 段落结构规律性检测(识别模板堆砌)
  • ✨ 术语使用一致性追踪(发现概念混乱)

使用场景

参赛队员自检:快速诊断版,定位问题,按优先级改进 ✓ 指导老师评审:简洁版+完整版,全面了解论文问题 ✓ 社团评委存档:完整版,逐部分详细分析,存档决策 ✓ 论文盲审:用两层评分表判断是否涉及AI拼装


输入要求

最低输入:完整数学建模论文(PDF或Word格式)

增强输入(提高置信度):

  • 赛题及附件说明
  • 代码和中间结果文件
  • 参考文献清单
  • 问间对接说明

执行流程(9步)

第一阶段:五维基础框架评分

  1. 识别论文结构 标记摘要、问题重述、问题分析、假设、符号、模型建立(Q1-Q5)、求解、结果、检验、灵敏度、评价、参考文献、附录

  2. 阅读五维评分标准 参考 references/audit-framework.md,理解五个维度的0-100分评分规则

第二阶段:第一层 - 增强的9维检测框架(权重60%语言 + 40%事实)

v2.2 严格化说明:以下阈值较 v2.1 全面收严约 5–10 个百分点, 且引入"扣分项累加"机制。评审倾向:宁可标红后经人工复核撤销, 不可漏标。任何一项落入 🟠 及以上,报告中必须标红呈现并给出证据位置。

3. 语言层面检测(6维,权重60%)

3.1 高频连接词检测(维度1,权重20%)— 融合Humanizer-zh

  • 扫描全文,统计高频连接词密度(综上所述、此外、进一步、显然、具有特性等)
  • 计算: 密度 = (高频词总数) / (全文总句数)
  • 检查相同词的重复间隔(是否<5句)
  • 新增:检查"具有XX特性""相对而言""显然"等AI特化高频词
  • 判分(收严)
    • <8% → 100分 🟢
    • 8-12% → 85分 🟢
    • 12-16% → 60分 🟡(原15-20%才扣,现提前)
    • 16-20% → 35分 🟠 标红
    • 20-25% → 15分 🔴 标红
    • >25% → 0分 ⛔ 标红
  • 附加扣分:同一高频词在3页内出现>2次,每处额外 −5 分(下限0)

3.2 排比与同构句式识别(维度2,权重12%)

  • 标记三项以上的排比句,检查排比后是否有量化数据
  • 检查排比项的来源说明(赛题给出/推导/约束)
  • 标记"动词+宾语"结构相同的连续句子,检查是否标注了章节/对象
  • 判分(收严)
    • 全部为L3安全排比(有数据+有来源) → 100分 🟢
    • L3为主,个别L2 → 80分 🟢
    • L2为主(有数据但无来源说明) → 55分 🟡
    • 存在1处L1(抽象形容词堆砌) → 30分 🟠 标红
    • 存在2处及以上L1 → 0分 🔴 标红
  • 附加扣分(v2.2新增):同一组织词(如"其一/其二/其三"、 "首先/其次/最后")在 ≥4个不同章节 机械复用,额外 −20 分; ≥6个章节复用,额外 −30 分。此项即使各项内部有数据也照扣, 因为它是可观察的模板化痕迹。

3.3 拔高词与修饰词检测(维度3,权重12%)— 5级分类

  • 识别拔高词并分级:L1(绝对化+无数据) / L2(相对化+泛泛对比) / L3(定量无基准) / L4(定量有数字无对比) / L5(完整定量+充分对比)
  • 检查拔高词后是否有量化证据(数字、对比、百分比)
  • 判分(收严)
    • L5为主且拔高词密度<8% → 100分 🟢
    • L4-L5为主 → 80分 🟢
    • L3为主 → 55分 🟡
    • 存在 1个 L1或2个L2 → 30分 🟠 标红(原需>3个才归零)
    • 存在 2个及以上 L1 → 0分 🔴 标红
  • 参考资源:references/layer1-enhanced-detection.md §2.3

3.4 被动句占比与语态分析(维度4,权重9%)

  • 抽取论文5个代表段落,统计被动句占比(正常范围10-20%)
  • 检查是否出现连续>3句都是被动语态的"生硬段落"
  • 被动句中是否都有明确的执行者
  • 判分(收严)
    • <15% → 100分 🟢
    • 15-22% → 85分 🟢
    • 22-27% → 55分 🟡(原25-30%才扣到60)
    • 27-33% → 30分 🟠 标红
    • >33% → 0分 🔴 标红
  • 附加扣分:出现连续≥4句被动语态的段落,每处 −10 分

3.5 段落结构规律性检测(维度5,权重6%)

  • 抽取20段,统计段落开头词的重复率和段长分布
  • 检查开头方式是否多样化("根据""为了""利用前问的"等)
  • 段落间是否有明确的逻辑承接("由上可知""基于此"等)
  • 判分(收严)
    • 开头词重复率 <15% → 100分 🟢
    • 15-28% → 80分 🟢
    • 28-40% → 50分 🟡
    • 40-55% → 25分 🟠 标红
    • >55% → 0分 🔴 标红
  • 豁免:数模论文各建模章节遵循"建模思路→模型建立→求解→ 结果→检验"五段式属文体常规,该章节级结构重复不计入本项; 本项只统计段落级的开头方式重复。

3.6 文本复杂度分析(维度6,权重1%)

  • 计算词汇多样性TTR = 不同词数/总词数
  • 分析3-gram重复率("本文采用""通过...方法"等)
  • 观察熵值和n-gram频率是否过于规律
  • 判分(收严)
    • TTR>0.55 且 3-gram<4% → 100分 🟢
    • TTR 0.45-0.55 或 3-gram 4-8% → 65分 🟡
    • TTR 0.35-0.45 或 3-gram 8-13% → 30分 🟠 标红
    • TTR<0.35 或 3-gram>13% → 0分 🔴 标红

4. 事实层面检测(3维,权重40%)

⚠️ 本层任一维度触发"一票否决项"时,直接判定论文风险等级, 不再按加权分核算。详见 references/layer1-enhanced-detection.md §4.3。

4.1 引文验证(维度7,权重15%)— 融合nature-detector的L1-L3检查

  • L1【快速检查】(30秒):DOI格式、作者名、期刊名、发表年份规范性
  • L2【存在性验证】(2-3分钟):Google Scholar/知网验证文献是否存在,信息是否匹配
  • L3【主张-支撑匹配】(5分钟,抽查不少于5篇关键文献):
    • 论文引用该文献的方法/结论是否与原文一致
    • "数据集XXX"是否真的存在且规模一致
    • "按照XXX的方法"是否在原文中有明确描述
  • 判分(收严)
    • 全部通过L1-L3,且无未引用的"凑数文献" → 100分 🟢
    • 全部存在,但有1-2篇列入文献表却未在正文引用 → 80分 🟡
    • 有1篇作者/年份/期刊信息不符 → 25分 🔴 标红 + 触发否决
    • 有任1篇确认不存在 → 0分 ⛔ 标红 + 强制高风险
  • 附加检查:文献总数<6篇 或 >25篇,−10分;全为综述/教科书 而无具体算法论文,−15分

4.2 数值一致性追踪(维度8,权重15%)

  • 构建"参数溯源表":列出所有关键参数,逐一追踪其在全文的使用位置
  • 复算数值间的算术关系(占比、差值、合计是否自洽)
  • 验证参数来源层级(L1赛题给出 / L2前问推导 / L3物理约束)
  • 判分(收严)
    • 全部一致 + 算术自洽 + 来源清晰 → 100分 🟢
    • 一致但个别参数来源未说明 → 75分 🟡
    • 存在偏差1-5%且未加解释 → 35分 🟠 标红
    • 存在偏差>5%且未加解释 → 0分 🔴 标红 + 触发否决
  • 加分项(v2.2新增,上限+5):论文主动披露数值差异并解释 其来源(求解器容差、独立实现差异等),视为人工复算的正面证据。 此类披露不触发否决
  • 幽灵参数:任一关键参数无法追溯到L1/L2/L3任一层级,每个 −15分

4.3 术语一致性检测(维度9,权重10%)

  • 构建"术语追踪表":列出5-7个核心概念
  • 追踪各术语在全文的表述方式
  • 检查是否存在"一个东西多个名字"
  • 判分(收严)
    • 完全一致 → 100分 🟢
    • 仅存在领域公认同义词(如"粗差/过失误差") → 85分 🟢
    • 1个核心术语有2种表述 → 55分 🟡
    • 1个核心术语有3种及以上表述 → 25分 🟠 标红
    • 多个核心术语混乱(尤其算法名称) → 0分 🔴 标红

5. 综合评分汇总

第一层质量分 =
  维1×0.20 + 维2×0.12 + 维3×0.12 + 维4×0.09 + 维5×0.06 + 维6×0.01
+ 维7×0.15 + 维8×0.15 + 维9×0.10

第一层风险分 = 100 − 第一层质量分     ← 必须转换后再查等级表

第三阶段:第二层 - 数学建模逻辑审查(权重40%)

  1. 五项深度检查 对论文的每个模型,依次进行:

    • 2.1 模型常用性判断 对标[表9:数模常用模型库],判断该模型是否为竞赛常见模型,还是AI高频的"高大上"模型

    • 2.2 复杂度vs收益评估 该模型的时间/空间复杂度是否与问题规模匹配?能否用更简单的方法?复杂度提升的收益有多大?

    • 2.3 华而不实识别 检查五大特征:(1)模型名复杂但实现不透明,(2)无基线对比,(3)不必要的超参数调优,(4)通用化无边界,(5)模型数过多

    • 2.4 模型选择"三问法" 对每个模型:问1-本题问题性质?问2-本题数据特征?问3-为什么选这个而不选替代? 三问都能清晰回答 → 低风险;任何一问无法回答 → 中等风险

    • 2.5 建模路径风格对照 从建模路径、问题简化、模型选择、假设、数据适配、求解主线、结果解释、论文表达、稳健性和评审呈现十个方面,区分“人主导的渐进建模”与“AI式复杂化倾向”。详细规则见 references/audit-framework.md。该项只能作为组合证据:单独出现复杂模型、较多参数或较长篇幅,不得直接判定为AI生成。

  2. 第二层输出 综合2.1-2.5的检查结果,汇总成"建模逻辑评分表",给出建模逻辑风险等级

第四阶段:综合评分与报告生成

最终AI风险分 = (第一层风险分 + 第二层风险分) / 2 → 0-100

两层都必须先由质量分转换为风险分(风险分 = 100 − 质量分)再取平均。 直接对质量分取平均会得到方向相反的结论。

风险等级(v2.2 收严)

  • 0-15:🟢 低风险 — 可直接接收
  • 16-30:🟡 中低风险 — 可接收,需补充改进
  • 31-50:🟠 中风险 — 需深度检查后再决定
  • 51-70:🔴 中高风险 — 强烈建议强制改稿
  • 71-100:⛔ 高风险 — 建议拒稿

一票否决:触发 references/layer1-enhanced-detection.md §4.3 任一条件时,直接采用该条规定的等级,不再按加权分核算。


报告标红规范(v2.2强制)

报告必须让问题一眼可见,不得把风险项混在通过项里平铺呈现。

颜色语义(HTML报告统一使用):

状态色值触发条件呈现要求
🔴 严重#c0392b维度得分 <30 或触发一票否决红底红框卡片 + 置于报告最前 + 列出证据页码
🟠 警示#e67e22维度得分 30-54橙色左边框 + 明确写出改进动作
🟡 注意#f39c12维度得分 55-79黄色标记 + 一句话说明
🟢 通过#27ae60维度得分 ≥80常规呈现,不占视觉重心

强制要求

  1. 任一维度 <55 时,报告顶部必须有红色警示区,汇总全部标红项
  2. 每个标红项必须包含三要素:问题描述 + 证据位置(页/节)+ 具体改法
  3. 不得用"建议优化""可以更好"这类模糊措辞描述标红项
  4. 评分表中标红行使用红色背景,不能只靠一个小图标区分
  5. 若全部维度均 ≥80,才可在结论区使用绿色通过卡片

生成两个版本HTML报告

  • 简洁自检版:问题定位 + 优先级排序 + 快速改进指引
  • 完整审查版:按论文结构逐部分详细分析 + 具体修改建议 + 参数溯源表

所有报告均标注"BZD数模社制作",支持下载和打印


关键输出物

1. 第一层输出表(增强的9维融合框架)

【第一层评分汇总 v2.1】

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
【语言层面】(权重60%)         得分/100  权重    贡献
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
维度1: 高频连接词密度         XX/100   12%    XX%
维度2: 排比/同构句式          XX/100   7.2%   XX%
维度3: 拔高词(5级分类)       XX/100   7.2%   XX%
维度4: 被动句占比            XX/100   5.4%   XX%
维度5: 段落规律性            XX/100   3.6%   XX%
维度6: 文本复杂度(TTR/熵值)  XX/100   0.6%   XX%

语言小计                                60%    XX分

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
【事实层面】(权重40%)         得分/100  权重    贡献
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
维度7: 引文验证(L1-L3)       XX/100   15%    XX%
维度8: 数值一致性(参数追踪)  XX/100   15%    XX%
维度9: 术语一致性            XX/100   10%    XX%

事实小计                                40%    XX分

━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
第一层最终得分                          XX/100
风险等级                        [绿/黄/橙/红/黑]
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━

关键诊断:
🔴 高风险指标(需立即处理):
   - 拔高词"显著"XX次,后跟数据仅XX次
   - TTR值XX < 0.4(词汇极度重复)

🟡 中等风险指标(需改进):
   - 被动句占比XX% (目标15-20%)
   - 3-gram重复率XX% (目标<5%)

✅ 通过指标(无需改进):
   - 引文5篇全部验证通过
   - 关键参数追踪完全一致
   - 术语使用基本统一

增强说明(相比v2.0):

  • ✨ 引文验证不再只是"格式检查",而是真实性和支撑匹配度检查
  • ✨ 增加了数值参数追踪,能发现虚构数据或计算不一致
  • ✨ 增加了文本复杂度的科学度量(TTR、n-gram频率)
  • ✨ 增加了术语一致性检测,发现概念混乱

2. 第二层输出表(模型合理性审查)

【第二层评分汇总】

模型常用性判断:            XX/100
  Q1: 模型名 → 常用/自定义/AI高频

模型复杂度评估:            XX/100
  Q1: 复杂度 vs 问题规模 → 合理/过度

华而不实识别:              XX/100
  五大特征检查 → 无/少/多

模型选择"三问法":          XX/100
  Q1: 问题明确?Q2: 数据特征?Q3: 替代论证?

建模路径风格:              XX/100
  十项对照:渐进建模 / 混合 / AI式复杂化倾向

第二层总分 = XX/100

3. 最终AI风险评分

最终AI风险分 = (第一层 + 第二层) / 2 = XX/100
风险等级 = 🟢低 / 🟡中低 / 🟠中 / 🔴中高 / ⛔高
置信度 = 低/中/高(基于输入材料完整性)

关键发现:
  ✓ 建模逻辑清晰/✗ 模型选择有风险
  ✓ 参数溯源完整/✗ 参数来源模糊
  ✓ 问间对接明确/✗ 跨问联动不清
  ...

4. HTML分层报告

三个版本均自动生成,包含:

  • 学生自检版:5分钟快速诊断清单 + 高频陷阱对照表 + Top3改进
  • 老师评审版:两层评分表 + 问题清单 + 审查意见
  • 完整审计版:详细的五维分析 + 两层审查 + 逐板块建议 + 综合评分

特殊说明

关于"置信度"

  • 仅论文:置信度 = 中(±8-12分)
  • 论文+赛题:置信度 = 中(±6-10分)
  • 论文+赛题+代码/结果:置信度 = 高(±5-8分)
  • 再加版本历史或对话记录:置信度 = 高(但仍非身份鉴定)

关于"模型选择"的AI痕迹

本工具重点关注模型选择中的两类典型AI痕迹:

  1. 自证式论证:选择模型因为"该模型精度高、效率高"(不说明本题为什么需要)
  2. 高大上陷阱:使用深度学习、强化学习、复杂优化等不必要的复杂模型

这两类是AI生成论文最容易被识别的特征。

关于"参数溯源"

每个参数应能追溯到:

  • L1:赛题直接给出(标注*来自赛题)
  • L2:前问推导出(标注*来自问i的结果)
  • L3:物理约束推导(标注*由XXX约束推导)

无法追溯的参数 = 幽灵参数 = 高风险


文件清单

bzd-paper-aigc-auditor/
├── SKILL.md                          (本文件——skill定义)
├── README.md                         (项目说明)
├── references/
│   ├── audit-framework.md            (五维评分标准+检查表)
│   ├── humanizer-keywords.txt        (Humanizer-zh高频连接词表)
│   ├── models-zh.md                  (数模常用模型库vs AI高频模型)
│   └── patterns-zh.md                (AI常见自证式论证模式库)
└── templates/
    ├── BZD数模论文AI痕迹自查指南.html       (学生自检用户指南)
    └── BZD数模论文AI痕迹审计报告模板.html   (审计报告——简洁版+完整版)

快速开始

用户(学生/老师)流程

  1. 准备论文PDF或Word
  2. 打开"BZD数模论文AI痕迹自查指南.docx",按步骤操作
  3. 调用本skill进行审计
  4. 获得分层HTML报告
  5. 按报告中的建议改进论文

社团/评委流程

  1. 收集参赛论文 + 赛题 + 代码(可选)
  2. 批量调用本skill
  3. 汇总HTML报告,形成评审档案
  4. 用"老师评审版"或"完整审计版"进行决策

版本信息

  • 当前版本:v2.0(2024-XX)

  • 改进内容

    • 加入Humanizer-zh高频连接词检测
    • 增加第二层"模型合理性"审查
    • 从单一报告升级为分层HTML报告
    • 权重调整:语言60%+其他40%
    • 新增"三问法"和"华而不实"识别
  • 适用场景:CUMCM、美赛、国赛、校赛等数学建模竞赛

  • 支持平台:Claude Code、Codex均可使用


重要声明

⚠️ 本工具的限制

  • 该评分不是作者身份概率,也不能替代正式AIGC检测或查重服务
  • 仅凭成稿无法证明某句话由AI生成
  • 数学建模中的规范句式、模型名称、专业术语天然可能重复
  • 模型的创新性不等于AI拼装(本工具只判断模型选择的合理性)

本工具的优势

  • 专针对数学建模竞赛的AI痕迹识别
  • 融合Humanizer-zh的中文文本分析
  • 两层递进式检查,避免误判
  • 分层输出,适应不同用户
  • 可持续更新的模型库和模式库

Signals

GitHub stars
295
Forks
12
Last commit
Sep 2026
Advanced
Catalog kind
skill
Gateway key
bzd-paper-aigc-auditor
Source
github.com/bzdmathclub/bzd-math-modeling-skills