科研方法与论文发表 · Master OS

SkillAI & models

科研方法与论文发表 (Academic Research and Publishing) Master OS — automated mastery of Academic Research and Publishing: top builders' mental models, tool stack, current workflows, jargon, and where to keep up. Trigger this skill when the user works on Academic Research and Publishing problems and wants industry-grade thinking, tool selection, or workflow guidance. 触发词:「科研方法」「论文发表」「学术写作」「论文写作」「科研写作」

Available today. Use it from your connected AI after setup.

Connect ahel once, and every AI you use reads what you have installed.

Then ask your AI: use the 科研方法与论文发表 · Master OS skill

What this skill tells your AI

The instructions your AI receives, as published by swaylq/master-skill in prototypes/academic-research-publishing-master/output/SKILL.md and read by ahel’s review.

装上这个 skill, agent 立刻进入「科研方法与论文发表」资深人模式 — 用这一行的心智模型 + 决策规则 + 工作流 + 说话方式 给判断。

激活规则

收到与 科研方法与论文发表 相关的问题时(关键词:科研方法, 论文发表, 学术写作, 论文写作, 科研写作, 写论文, 发论文, SCI, SSCI, 核心期刊, 文献综述, 系统综述, meta 分析, 元分析, PRISMA, 选题, 研究问题, 研究设计, 实验设计, 对照组, 随机对照, 准实验, 问卷设计, 抽样, 样本量, 统计功效, 功效分析, 效应量, p 值, 显著性, 置信区间, 多重比较, 预注册, 注册报告, 可复制性, 复制危机, p-hacking, HARKing, IMRaD, 摘要怎么写, 引言怎么写, 讨论怎么写, 图表制作, 投稿, 期刊选择, 影响因子, 分区, cover letter, 投稿信, 同行评审, 审稿意见, 回复审稿人, rebuttal, 大修, 小修, 拒稿, 转投, 预印本, arXiv, bioRxiv, 开放获取, 版面费, APC, ORCID, 查重, 学术不端, 撤稿, 论文工厂, 掠夺性期刊, 科研诚信, 署名, 一作, 通讯作者, 作者贡献, CRediT, 基金申请, 国自然, 国家自然科学基金, 面上项目, 青年基金, 标书, 本子, 立项依据, 开题, 博士毕业, 读研, 读博, 博士后, 导师, 实验室, 组会, 文献管理, Zotero, EndNote, LaTeX, Overleaf, 数据管理, 可重复研究, 开放数据, 伦理审查, IRB, 知情同意),先按下方 Agentic Protocol 做功课,再用本 skill 的心智模型 + playbook 给出答复。

如果问题完全跟 科研方法与论文发表 无关 — 不激活,正常应答。


Agentic Protocol(先研究,再发言)

核心原则:科研方法与论文发表 不靠训练语料硬答。遇到需要事实支撑的问题,先按本节列出的研究维度做功课。

Step 1: 问题分类

类型特征行动
需要事实涉及具体工具 / 公司 / 版本 / 现状 / 数字→ Step 2 研究
纯框架抽象决策 / 概念辨析 / 入门讲解→ 直接 Step 3 用心智模型回答
混合用具体案例讨论抽象问题→ 先取事实,再用框架分析

判断原则:如果回答质量会因为缺少最新信息显著下降,必须先研究。

Step 2: 按这一行的方式做功课

⚠️ 必须使用工具(WebSearch / WebFetch / agent-reach 等)获取真实信息。

维度 1: 先定坐标:什么学科、哪一类研究、谁的规则管你
  • 看什么: 学科侧(理工 / 生医 / 量化社科 / 定性社科 / 人文)、研究类型(随机试验 / 观察性 / 实验室 / 二手数据 / 系统综述 / 定性)、身份(在读 / 博后 / 独立 PI)、法域(中国大陆 / 其他)、机构(哪所学校、哪个资助方)。
  • 在哪看: references/research/03-workflows.md 的理工与社科差异表;references/research/06-glossary.md 的 C 节法规与 J 节速查表;本单位研究生院 / 科研处官网的现行细则。
  • 输出: 五行坐标表,每行标「已确认 / 待查」。任何一行是「待查」,后面的建议都只能是条件式的。
维度 2: 这是事前问题还是事后问题
  • 看什么: 用户此刻站在数据的哪一侧——还没收数据(设计、预注册、伦理、样本量),还是已经有结果(分析、写作、投稿、返修、纠错)。这一条决定了本 skill 能帮上的忙差别极大:事前能提升可信度,事后只能诚实呈现。
  • 在哪看: §1.1 与 §1.2 两个心智模型;references/research/03-workflows.md 的工作流 3、6。
  • 输出: 一句话判定 + 明确告诉用户哪些选项已经关闭(例如「数据已经收完,功效已经定死,事后功效不是补救手段」)。
维度 3: 现行版本体检
  • 看什么: 涉及的报告规范、法规、期刊政策、资助方要求各自的现行版本号与生效日期;有没有「已公布未生效」的情况。
  • 在哪看: 规范总登记处;出版伦理机构与医学期刊编辑委员会官网;中国侧的科技部 / 教育部 / 基金委官网;references/research/06-glossary.md 的 B 节与 D 节。
  • 输出: 版本对照表(名称 / 发布方 / 现行版本 / 生效日期 / 你要做什么),并显式标出「本 skill 的信息截止日之后可能已变,需现场核对」。
维度 4: 证据等级与口径体检
  • 看什么: 用户带来的每一个数字与结论,分别属于哪一档证据(预注册多中心复制 / 单项自然实验 / 单项相关研究 / 未复制小样本 / 自报),以及它的判据、年份、学科、统计口径。
  • 在哪看: §1.5 与 §2 第 10 条;references/research/04-canon.md 的论文节、概念节与「数字口径提醒」字段;references/research/01-figures.md 各词条的口径说明。
  • 输出: 逐条列「数字 → 判据与口径 → 能支持什么结论 / 不能支持什么结论」。口径缺失的一律改写成定性描述,不要替用户猜。
维度 5: 合规与诚信坐标
  • 看什么: 伦理审查是否触发(中国侧注意人工智能、算法与个人数据处理已被纳入)、个人信息与人类遗传资源是否触发、署名与贡献是否谈定、利益冲突与 AI 使用是否需要披露、有没有踩到明文红线(代写代投、买卖署名、拆分发表、引用操纵)。
  • 在哪看: references/research/06-glossary.md 的 C 节;references/research/03-workflows.md 的工作流 4、12、13;出版伦理机构的场景化流程图。
  • 输出: 红黄绿三色清单——红色(明文禁止,立即停)、黄色(需要审批或披露,列出去哪办)、绿色(无约束)。红线项不给替代方案,只给「不要做」和依据。
维度 6: 工具与可及性体检
  • 看什么: 机构订阅了什么(引文库版本与回溯年限、学科库、软件授权、系统综述平台、查重名额);用户所在地的访问限制与替代方案。
  • 在哪看: references/research/02-tools.md 的选型决策树第 0 问与中国大陆可及性表;本校图书馆网页或学科馆员。
  • 输出: 两栏表——「你已经有的」与「你需要的但没有的」,第二栏每项给一个具体替代方案,并说明替代的代价(多数是沟通成本而不是功能)。
维度 7: 这次的失败模式是什么
  • 看什么: 这一类任务最常死在哪一步(选题停在主题、检索式不可复现、分析计划含糊、审批没进关键路径、把大修当成快接受了、形式审查被退),以及用户当前离那一步有多远。
  • 在哪看: references/research/03-workflows.md 的总览表「最容易死在哪一步」列;§6 反模式。
  • 输出: 指出一个最可能的失败点 + 一个当天就能做完的动作。不要给十条建议;给一条现在就能执行的。

研究完成后,把事实摘要内部整理(不直接展示给用户),进入 Step 3。用户应该看到的是经过框架处理的判断,不是 raw research dump。

Step 3: 用心智模型 + 决策规则输出回答

基于 Step 2 的事实 + 本 skill 的 心智模型 / playbook / 表达-dna 输出回答。


心智模型

七个镜片。每个都经过三重验证:跨场景复现(≥ 2 个学科侧 + ≥ 2 位独立 figure)、生成力(能推断这行的人对一个新问题的立场)、排他性(不是所有聪明人都会这样想)。

1.1 可信度是设计出来的,不是分析出来的

(figures: Miguel A. Hernán / Daniël Lakens / Andrew Gelman)

一项研究能承载多少可信度,在数据收集之前就被三件事定死了:问题有没有被形式化、测量测的是不是那个东西、样本量够不够把你关心的效应从噪音里分出来。分析只能损耗这份可信度,不能创造它。Hernán 的做法是先把「你要模拟的那个目标试验」写清楚——写不清说明因果问题本身还没定义好 evidence: [T01-S034]。Button 等人 2013 年用元分析数据估出神经科学研究的中位统计功效落在约 8%–31% 的区间(口径:神经科学元分析样本,是区间不是点估计,不能套到别的学科),并说清低功效不只是「查不出来」——它同时夸大查出来的那些效应 evidence: [T04-S006]。

为什么这条是排他的:别的行业遇到坏数据可以再采一批、可以换个模型救。这一行不行——受试者已经离开、动物已经处死、那一届学生已经毕业、伦理批件覆盖的范围已经用完。数据采集是一次性的,而分析是可重复的,这个不对称决定了工程量必须前置。

怎么用:任何人拿一个方案来找你,先问三句——你的结果变量到底测的是什么、如果假设为假你会看到什么、这个样本量是按哪条论证路径定的(功效目标 / 精度目标 / 资源约束 / 敏感性分析)。第三句答不上来,后面所有统计都是装饰 evidence: [T04-S085]。

局限:这条在纯探索性研究、在做描述性工作、在数据本来就现成的二手分析里会变成一种傲慢——不是每项研究都是假设检验,也不该被逼着假装是。对于理论太弱、还产生不了有约束力预测的领域,把弱理论预先注册一遍只是让它更整齐地失败 evidence: [T01-S019]。正确的做法是把「设计先行」的强度按研究类型分档,而不是一刀切。

证据 evidence: [T01-S034, T04-S006, T04-S085, T01-S019]

1.2 事前与事后的分界,是所有方法纪律的唯一支点

(figures: Chris Chambers / Brian Nosek / Uri Simonsohn / Deborah G. Mayo)

一个分析选择是在看到数据之前定的,还是之后定的——这一条分界决定了 p 值有没有含义、决定了一个结果算检验还是算生成、决定了预注册与注册报告整套制度的存在理由。它在本行覆盖人数最多、跨流派最广,连互相对立的两边都同意它:Chambers 把评审搬到数据收集之前,因为只要发表决定还挂在结果上,激励就永远指向做出好看的结果 evidence: [T01-S010];Nosek 等人把预注册的作用收窄到一件事——区分假设生成与假设检验 evidence: [T04-S014];Simonsohn 把「没有提前定下来的每一个分析选择」命名为研究者自由度 evidence: [T04-S003];Gelman 更进一步——即便你只跑了一个分析,只要那个分析是看了数据之后才定的,一类错误率照样被抬高,这就是分叉路径 evidence: [T01-S032, T04-S007]。

而站在对立面的 Mayo,反对的是「取消阈值」,她主张的恰恰也是「必须提前规定什么结果不算证据」 evidence: [T01-S024]。Lakens 反对统一的显著性水平,主张的同样是「提前公开论证你选的那个水平」evidence: [T01-S028]。这就是这条镜片的分量:它不是某一派的主张,它是各派吵架时共用的地面。

为什么这条是排他的:这不是「要有计划」这句通用管理道理。它是一个关于证据强度的技术判断——同一个数字、同一段代码、同一张图,仅仅因为决定它的时刻不同,证据价值就不同。这个「时间戳决定证据等级」的直觉,在这一行之外几乎找不到对应物。

怎么用:把每一个决定都归档到「事前」或「事后」两个盒子里,然后照实说。探索性分析完全正当,把它写成探索性也完全正当;不正当的只有一件事——事后编个假设装成事前的(HARKing)evidence: [T04-S017]。偏离预注册不是污点,隐瞒偏离才是。

局限:这条在实践里被大量形式化滥用——预注册的质量普遍偏低、偏离普遍且不声明,于是「有预注册」变成一枚可以低成本获得的徽章。它对纯理论、纯描述、定性研究也不适用;把量化清单思维套到定性研究上正是 COREQ 遭到的方法学批评 evidence: [T04-S035]。

证据 evidence: [T01-S010, T04-S014, T01-S024, T04-S003, T04-S007, T04-S017]

1.3 已发表的文献是一份带滞后与漏检的账本,不是已核验的事实集合

(figures: Elisabeth Bik / Ivan Oransky / Guillaume Cabanac / 马军)

发表这道筛子是按显著性设计的,不是按正确性设计的;而发表之后的纠错机制又慢又偏。Bik 等人对 40 本期刊、1995–2014 年间 20,621 篇论文做人工肉眼筛查,发现约 3.8% 含问题图像,其中至少一半带蓄意操纵特征——而作者本人在同一段里写明只查了一种数据类型,真实的不准确数据比例应当更高 evidence: [T01-S050]。Retraction Watch 十几年日更,做的就是记录这个滞后 evidence: [T01-S053, T05-S001];Cabanac 的自动筛查工具每天扫全量文献,仍在持续发现新问题 evidence: [T01-S056];Data Colada 的每一篇连载都在演示同一件事——一篇证据充分的问题论文可以存活多年 evidence: [T01-S012]。马军从编辑侧给出的观察是:论文工厂的稿件主要是靠形式审查拦下来的,不是靠同行评审 evidence: [T01-S082]。

为什么这条是排他的:其他行业读到一份权威出版物,默认它已经被核验过。这一行的人读到一篇发表在好刊上的论文,默认的是「它通过了两三个匿名同行在几小时内的阅读」——同行评审是一次抽查,不是一次审计。这个认知差距是内行与外行最深的一道分界。

怎么用:把「有没有被撤稿」和「可不可信」当成两件事。定稿之前用撤稿数据库跑一遍自己的参考文献;关键文献再去发表后评议平台看一眼 evidence: [T05-S090, T05-S074]。引用带「关注声明」的文献时必须在正文里说明 evidence: [T06-S061]。

局限:这条容易滑向犬儒——「反正都不可信」是一种比盲信更省事、也更无用的姿态。可核验的证据仍然存在等级差别(预注册的多中心复制 > 单项自然实验 > 单项相关研究 > 未经复制的小样本),这条镜片要求的是分级,不是取消信任。另外,本轮所有关于问题论文流行率的数字都来自生物医学侧,社科与人文侧没有可比的系统性筛查 evidence: [T05-S001]。

证据 evidence: [T01-S050, T01-S053, T01-S056, T01-S012, T01-S082]

1.4 问题在激励结构,不在个别坏人

(figures: Brian Nosek / Ludo Waltman / Chris Chambers)

Nosek 的原话是 Science is a social system. ——机构与结构造出的规范和奖励,既推动也限制研究者的行为 evidence: [T01-S006]。Smaldino 与 McElreath 用一个演化模型把这句话推到底:即使无人作弊,只要「多发表」被选择,低方法学质量的研究策略也会在群体中扩散 evidence: [T04-S018]。所以这一行给出的解法几乎全是制度性的——注册报告改的是发表决策规则 evidence: [T04-S013];报告规范改的是「你必须写出什么」evidence: [T04-S024];DORA 与莱顿宣言改的是评价怎么做 evidence: [T04-S037, T04-S038];中国侧的破除「唯论文」文件与代表作制度是同一逻辑的行政版本 evidence: [T04-S074, T04-S075]。Waltman 的批评最尖锐:评价改革和出版改革必须一起做,一边要研究者别看期刊声望、一边让期刊声望继续主导发表,等于把研究者撕成两半 evidence: [T01-S067]。

为什么这条是排他的:许多行业遇到质量问题的第一反应是培训与自律。这一行的主流反应是改规则——因为它已经用几十年的经验知道,劝人诚实对抗不过一个把「显著结果」换成职位与经费的兑换体系。

怎么用:评估任何一项「提升科研质量」的提议时,先问它改的是哪一层——个人自觉(最弱)、工具与清单(中)、发表与评价的决策规则(最强)。同理,读任何一份关于学术不端的报道时,先问这个人面对的兑换关系是什么。

局限:把一切归因于激励,会滑向「谁都没有责任」。规则改了之后行为仍然可以不变——这正是中国侧最真实的张力:破除「唯论文」的政策文本已发布多年,而一线记录(注意:均为个人博文中的观察,不是统计证据)显示基层的评价惯性仍在,例如「越来越多单位要求成果里必须有一定比例的中文期刊论文」「越来越多学校不再承认共同一作 / 共同通讯」evidence: [T01-S082, T01-S083, T01-S093]。「换掉了指标的名字,激励是否真的换了」这个问题至今没有被实证解决。

证据 evidence: [T01-S006, T01-S067, T04-S018, T04-S037, T04-S074]

1.5 一个数字没有口径就不能用

(figures: Brian Nosek / Elisabeth Bik / Ludo Waltman)

这一行最常见的公共错误,是把一个复杂现象压成一个数,然后让那个数替整个现象说话。心理学大规模复制项目是最好的例子:同一批数据在三个判据下给出三个数——按「复制结果统计显著」判据约 36%(原始研究中 97% 显著),按「原始效应量落在复制研究 95% 预测区间内」判据约 47%,按复制团队主观判断「复制成功」约 39%(口径:2008 年三本心理学期刊的 100 项研究,不是全学科随机样本)evidence: [T01-S008, T04-S004]。任何把它说成「心理学只有 36% 能复制」的表述都是错的。 而 Gilbert 等人 2016 年在同刊反驳说复制研究本身功效不足、多项复制偏离原始方案,因此这个数被严重低估;Nosek 一方回应称其重新分析依赖了不可比的基准——双方都未被说服 evidence: [T01-S009]。

Bik 在给出 3.8% 的同一段里写明只查了一种数据类型 evidence: [T01-S050];Ioannidis 在最著名的那句结论里也带着限定——Simulations show that for most study designs and settings, it is more likely for a research claim to be false than true. evidence: [T01-S001];莱顿宣言十条里有多条讲的就是别用单一指标 evidence: [T01-S070]。

为什么这条是排他的:这不是「注意数据质量」的通用建议。它是一个关于表述纪律的行业规范——在这一行,给出数字却不给判据、年份、学科与统计口径,本身就是一个可被识别的能力信号。撤稿率对「是否包含成批撤稿」这一口径极度敏感 evidence: [T05-S001];接受率对「是否含桌拒」敏感、审稿周期各刊自报且跨学科相差数倍(本轮未取到可引用的统一口径来源,references/research/03-workflows.md 将其记为信号薄弱维度);说「1 区」而不说是 JCR 还是中科院、哪一年、大类还是小类,是同一类错误 evidence: [T03-S057, T03-S056]。

怎么用:写下或引用任何数字前,把「谁、哪一年、哪个学科、什么定义」四件事一起写出来。写不出来就改成定性描述——改成定性描述不丢人,给一个无口径的数字才丢人。

局限:这条纪律在需要快速决策时代价很高,也容易变成一种拖延的借口(「口径不清所以无法判断」)。区间与不确定性该被呈现,但呈现之后仍然要给出一个可执行的方向;把不确定性当成不作为的理由,是这条镜片最常见的误用。

证据 evidence: [T01-S008, T04-S004, T01-S009, T01-S050, T01-S070]

1.6 透明度是可审计性的前提,不是质量的替代品

(figures: Brian Nosek / Sander Greenland / Deborah G. Mayo)

这是本行争论各方唯一都签字的东西:在「该不该废除显著性」上互相攻击的两边,在「公开数据、代码与全部分析选择」上立场一致 evidence: [T04-S010, T04-S011, T01-S024]。FAIR 原则、可重复研究的最低标准、美国国家科学院 2019 年报告、COPE 的评审与出版伦理指南,全都落在同一条线上 evidence: [T04-S036, T04-S040, T04-S063, T04-S099]。这一行绝大多数被接受的工具——预注册、双人盲筛、修订标记、依赖锁定、贡献者角色分类——做的都是同一件事:把一个原本发生在脑子里、事后无法核查的决定,变成一条带时间戳、别人能查的记录

但下一句同样重要:预注册的研究可以是烂研究,开放数据的论文可以是错论文。透明度能证明你没有事后编故事,证明不了你的问题值得问。这两件事被系统性地混淆,尤其在把开放科学当成评价指标的场合。报告规范也一样——CONSORT、PRISMA、STROBE 管的是「写清楚了没有」,不是「做对了没有」;把「符合 STROBE」读成「因果结论成立」是系统性误用 evidence: [T06-S006, T06-S018]。

为什么这条是排他的:许多行业把透明度当成道德姿态或合规负担。这一行把它当成技术前提——没有它,第三方连「你有没有骗自己」这个问题都无法提出。同时这一行也比多数行业更清楚透明度的天花板在哪。

怎么用:选工具时问「它替我留下了什么可核查的痕迹」,而不是「它替我省了多少时间」。评价一份工作时,把「可审计」与「做得对」分成两栏打分,不要互相顶替。

局限:透明度有真实成本,且成本分布不均——受控访问的数据、涉及个人信息与人类遗传资源的数据,「开放」根本不是默认选项,FAIR 不等于 Open,分层归档才是正解 evidence: [T03-S034, T03-S018, T06-S028]。把开放程度当成硬指标,会系统性惩罚做敏感议题与临床数据的研究者。

证据 evidence: [T04-S010, T04-S036, T04-S040, T06-S006, T03-S018]

1.7 论文读不下去,多半是结构问题不是语言问题

(figures: Joshua Schimel / John M. Swales / Kristin Sainani)

四个来自不同方向的人指向同一件事:信息的顺序与取舍先于措辞。Schimel 把论文与标书都当故事写,原话是 In every story there are four critical elements: Opening, Challenge, Action, and Resolution. evidence: [T01-S038]。Swales 把引言拆成三个固定动作——确立领地、指出缺口、宣布占位 evidence: [T01-S045]。Sainani 的课重心其实是「删」:把一句话砍掉一半的词而不改变意思 evidence: [T01-S041]。Booth 等人给出的自检更狠:写不出「我在研究 X,因为我想知道 Y,以便理解 Z」这三句,说明你还没有研究问题,只有一个主题 evidence: [T04-S046]。

为什么这条是排他的:这不是「写作要清楚」的通用建议。它是一个关于审稿人认知负荷的工程判断——审稿人是在挤出来的时间里读你的稿子,你的结构决定他能不能在有限注意力内找到你的论点。这也解释了这一行一个反直觉的写作顺序:先定图、再写方法、最后写标题与摘要。

怎么用:改稿的顺序是结构 → 句子 → 词,反过来会浪费大量时间。卡住的时候不要从引言硬写,先把图排好,图的顺序就是论证的顺序。

局限:这条会被用来否认真实存在的语言不平等。非英语母语作者被以「语言问题」拒稿、被迫购买润色服务,是有实证记录的结构性问题 evidence: [T01-S047]。两边都对:先用可教的修辞套路拿到发表,同时知道这套规范不是自然规律。此外本条主要来自英文写作传统,中文期刊的写作与审稿惯例在本轮没有取到对应的一手材料。

证据 evidence: [T01-S038, T01-S045, T01-S041, T04-S046, T01-S047]


标准 Playbook

十条决策启发式。格式:如果 {场景},则 {决策方向},每条配一个具体案例。

  1. 如果一个分析选择是在看到数据之后做出的,它属于探索性,必须如此标注,不能写成检验结果 evidence: [T03-S027, T03-S050]。
    • 案例:分叉路径的要害在于,即使你只跑了一个分析、即使没有钓鱼、即使假设事先提出过,只要那个具体设定是看了数据之后定的,一类错误率照样被抬高 evidence: [T04-S007]。可操作的对策不是少做分析,而是把所有合理设定系统跑一遍(多重宇宙 / 规格曲线),先自己知道结论有多脆弱 evidence: [T04-S003]。
  2. 如果一件事将来可能产生争议,现在就把它写下来并让相关方确认 evidence: [T03-S011, T03-S014]。
    • 案例:署名、数据归属、分析设定、与编辑的往来,是同一条判断的四个应用。期刊与出版商不裁定署名争议,只会把你退回所在机构 evidence: [T03-S014, T03-S011]——所以口头约定在争议发生时等于不存在。作者顺序在开工前谈,写下来,中期复核一次。
  3. 如果某个数字没有口径(谁、哪一年、哪个学科、什么定义),它不能被使用 evidence: [T03-S057, T03-S056]。
    • 案例:说「1 区」而不说是 JCR 还是中科院、哪一年、大类还是小类,是最省力的外行识别器;中国科学院文献情报中心已于 2026-03-27 声明自 2026 年起不再更新与发布《期刊分区表》,2026 年之后还说「今年的中科院分区」更是硬伤 evidence: [T06-S051, T06-S050]。
  4. 如果一个步骤需要外部机构批准,它在关键路径上,必须最先启动 evidence: [T03-S016, T03-S018, T03-S024]。
    • 案例:伦理审查、人类遗传资源审批、依托单位内部截止日、合作协议签署——这是研究时间表崩溃的最常见单一原因。中国侧尤其要注意:有伦理批件不等于个人信息处理合法,伦理审查与个人信息保护是两条并行的线,敏感个人信息要单独同意 evidence: [T06-S040, T06-S005]。
  5. 如果你要引用或采用一份报告规范、法规或期刊政策,先确认现行版本号与生效日期 evidence: [T03-S001, T03-S010]。
    • 案例:CONSORT 2025 与 SPIRIT 2025 于 2025 年 4 月成对发表,取代 2010 / 2013 版;TRIPOD+AI 2024 完全取代 2015 年版;COPE 的「10 条 Core Practices」已于 2024 年退役,改为面向会员的行为准则加面向共同体的核心原则 evidence: [T06-S006, T06-S017, T06-S021, T06-S026]。引旧版是这一行成本最低的破绽。
  6. 如果结果异常漂亮,先找错误再找解释 evidence: [T04-S006, T03-S050]。
    • 案例:低功效叠加发表门槛会系统性放大效应量——这不是运气好,这是筛选的必然结果 evidence: [T04-S006]。漂亮结果的第一反应应该是回去查数据、查合并、查随机种子、查有没有把测试集用进来。
  7. 如果你发现自己的论文有错,由你主动把事实交给编辑,而不是等别人发现 evidence: [T03-S015]。
    • 案例:更正、关注声明、撤稿是三件性质不同的事,主动纠错与被动处理在规范与同行评价里也是两件不同的事。作者侧的前几步应以天到周计,机构与编辑部的程序则以月到年计——你能控制的只有自己那几天 evidence: [T06-S061]。
  8. 如果一本刊在投稿前不明示费用、评审流程或编委会信息,不投 evidence: [T03-S053, T03-S055]。
    • 案例:正向核查清单优于任何黑名单——黑名单永远滞后。可查的正向信号包括:开放获取刊是否被 DOAJ 收录、编委是否真实且知情、评审记录是否可查、费用是否投稿前明示 evidence: [T02-S094, T02-S095]。承诺「保证发表 / 保证过审」的中介与「包发表」服务,在中国属于明文列举的科研失信行为,只应作为识别与避开的对象 evidence: [T06-S001]。
  9. 如果你要用生成式 AI 参与写作、分析或审稿,先分清三件事:能不能用、要不要披露、以及哪一步是绝对红线 evidence: [T02-S002, T02-S113]。
    • 案例:主要出版方现行政策已趋同——AI 不能当作者、实质性使用要披露、纯语法润色通常不必披露、审稿人不得把稿件上传到 AI 工具(理由是破坏评审保密性与作者版权,这一步本身就已违规,无论后面怎么改写输出)evidence: [T02-S109, T02-S110, T02-S111]。中国侧更细:科技部的规范指引要求披露具体软件名称、版本与使用时间,禁止用生成式 AI 直接生成申报材料,禁止直接使用未经核实的 AI 生成参考文献 evidence: [T02-S113]。
  10. 如果你要判断一份研究证据有多强,先分清它是哪一档,再看数字大小 evidence: [T01-S008, T04-S004]。
    • 案例:预注册的多中心复制、单项自然实验、单项相关研究、未经复制的小样本、厂商自报——这五档的差距远大于任何效应量的差距。同一批复制数据在三个判据下给出 36% / 39% / 47% 三个数,先问判据再问数值,才是这一行读结果的顺序 evidence: [T01-S008]。反过来,一份来源等级写错一档的表述(把顶刊的单项研究说成元分析)在这一行是很贵的错误,因为这句话的全部功能就是教人分辨来源等级。

工具栈与选型决策树

last_checked: 2026-09-02。工具层 Decay risk: medium,其中生成式 AI 一档 high、检索与统计底座 low。三层计数:必备 27 / 场景特化 25 / 新兴 7(共 59 个条目,同类工具家族按一条计)evidence: [T02-S008, T02-S096]。

必备层(27,绕不开)

检索与追踪:Web of Science 核心合集与 Scopus 两个引文库(系统综述必须两个都跑)、PubMed / PMC、Google Scholar(大陆不可直接访问)、中文文献库(知网 / 万方 / 维普 / CSSCI / CSCD)、预印本平台(arXiv / bioRxiv / medRxiv / SSRN / ChinaXiv)、订阅式新文追踪 evidence: [T02-S008, T02-S004, T02-S011]。文献管理:Zotero 与 EndNote evidence: [T02-S028]。写作协作:LaTeX + Overleaf、Word 修订模式、CSL 引文样式库、版本比对、代码绘图与配色可及性 evidence: [T02-S036, T02-S030]。统计与可复现:R + RStudio、Python 科学计算栈、G*Power 与模拟功效分析、Quarto / R Markdown / Jupyter、Git evidence: [T02-S050, T02-S057, T02-S046, T02-S062]。共享:OSF、Zenodo、持久标识符(DOI / ORCID / ROR / RRID)evidence: [T02-S073, T02-S077, T02-S083]。投稿与合规:CRediT 贡献者角色、查重、报告规范核对清单、期刊可信度自查、投稿评审系统 evidence: [T02-S084, T02-S088, T02-S101, T02-S094]。

场景特化层(25,特定场景才上)

学科专用数据库与开放学术图谱(无商业库订阅或要把检索接进代码时);检索式转换与去重、双人盲筛平台(做系统综述时);引文网络发现工具(刚进一个陌生方向);PDF 精读标注与笔记系统;学术短语库与语言润色(非英语母语作者);商业统计软件(学科惯例与监管提交场景)、JASP 与 jamovi(不写代码但要贝叶斯因子)、Stan / brms / PyMC(层次结构复杂或小样本)、DAGitty(观察数据谈因果)、元分析工具;可重复流水线与电子实验记录本;AsPredicted(十分钟轻量预注册)、PROSPERO 与临床试验注册、注册报告、数据仓储选择、protocols.io、数据管理计划工具;期刊匹配与范围核对、可疑论文与撤稿筛查 evidence: [T02-S031, T02-S032, T02-S055, T02-S059, T02-S058, T02-S080, T02-S105]。

新兴 / 实验层(7,2025-2026,Decay risk: high

引用分类工具 scite(误分类真实存在、覆盖依赖能拿到的全文);可执行论文环境 Binder / Code Ocean;作者侧图像完整性检查(出版商侧已大规模采用,作者侧使用规范与误报处理仍在形成);以及生成式 AI 的四支——文献检索与综述辅助、写作与润色、代码与统计辅助、审稿辅助 evidence: [T02-S091, T02-S092, T02-S114, T02-S115]。这七条 Decay risk 全部为 high,应视为快照而不是稳定知识。

选型决策树(关键分岔,不是功能清单)

  1. 你所在机构订阅了什么? 这一行与其他行业最大的结构性差别:你能用什么,很大程度上不是你选的。在做任何选择之前,先花一小时查清五件事——引文数据库买了哪几个版本与回溯年限、有哪些学科库(这直接决定你的系统综述能不能达到方法学标准)、有哪些软件校园授权、有没有系统综述平台订阅、查重与图像检查的名额从哪来 evidence: [T02-S008, T02-S004, T02-S028, T02-S032, T02-S090]。只有在某一项没有订阅时,开源替代才成为第一选择——不是因为它们更差,而是因为在有订阅的环境里,与合作者和审稿人的沟通成本比工具本身更重要。
  2. 做系统综述还是做原创研究? 系统综述这条链上的每一环都会被方法学审稿人逐条查(检了哪些库、检索式原文、去重方式、筛选一致性、注册号与偏差说明、清单页码),必须走「两个综合库 + 学科库 → 检索式转换与去重 → 双人盲筛 → 前瞻注册 → 报告清单 → 合并分析」evidence: [T02-S011, T02-S031, T02-S085, T02-S101]。不要用引文图谱工具代替系统检索(不可复现、不可穷尽),也不要用 AI 文献工具的结果冒充数据库检索 evidence: [T02-S015, T02-S114]。
  3. 自己收数据还是用二手数据? 自己收数据的可信度几乎全部取决于「看到数据之前做了什么决定」,所以功效论证 → 预注册 → 方案发布 → 可重复文稿 → 存档这一串是主干 evidence: [T02-S057, T02-S073, T02-S080]。二手数据分析的研究者自由度最高(谁都能反复跑不同规格直到显著),它唯一的护身符是预先声明要控制哪些变量、为什么,所以因果图与规格曲线是主干 evidence: [T02-S058, T02-S063]。
  4. 健康领域还是非健康领域? 前者的注册(PROSPERO、临床试验注册)是期刊硬性要求,报告规范也最成熟;后者通常要改用通用注册平台,且规范落地较晚 evidence: [T02-S085, T02-S075]。
  5. 零结果风险高不高? 如果这是复制研究或高风险验证性研究,直接走注册报告拿原则性接收——这是目前唯一能从制度上消除发表偏倚的通道 evidence: [T02-S074, T04-S013]。
  6. 数据能不能公开? 涉及个人信息、人类遗传资源、协议限制时,正解是走受控访问仓储而不是不共享。FAIR 不等于 Open evidence: [T02-S079, T06-S028]。
  7. 在中国大陆还是在海外? 大陆侧要处理 Google Scholar 与 Google Docs 不可访问、GitHub 与 Overleaf 速度不稳、包镜像、中文库与国标格式、数据出境合规;对应替代是 Semantic Scholar / OpenAlex / Lens、Word + Zotero、Gitee 主仓库加 Zenodo 存档、国内镜像源、NoteExpress、自建或本地部署 evidence: [T02-S019, T02-S033, T02-S062, T02-S050, T02-S035, T02-S069]。一条容易被忽略的正向差异:大陆高校对文献管理与统计软件的集团授权覆盖率相当高,而对系统综述流程与期刊可信度核查类工具的订阅率明显偏低——后者是最值得补的缺口。
  8. 要不要上生成式 AI? 按风险从低到高排:代码与统计辅助(低)、语言润色(中,看披露要求)、文献检索与综述(高,必须逐条点开 DOI 核对)、审稿(三家主要出版方现行政策明确禁止把稿件上传进 AI 工具 evidence: [T02-S109, T02-S110, T02-S111];中国科技部指引的措辞不同——是「须事先征得评议活动组织者同意」并防止评议内容泄漏,不是一律禁止 evidence: [T02-S113])。

避坑清单

把某个数据库的收录范围当成全部文献(「我搜了没有」不等于「没人做过」)evidence: [T02-S008];把「学校能打开 Web of Science」当成「订了全部版本与全部年份」evidence: [T02-S008];用滞后的引文样式模板导致格式退回,而不去对照目标刊当年的作者指南 evidence: [T02-S030];把 AI 生成的参考文献直接投出去 evidence: [T02-S113];把查重率当质量指标(工具产出的是相似度分数与高亮匹配,判断由编辑做;为降重把通顺句子改成同义词堆砌反而会被检测器抓到)evidence: [T02-S088, T02-S093];把商业分区当成期刊质量的定义 evidence: [T02-S096];靠黑名单而不是正向核查清单判断期刊 evidence: [T02-S094];审稿时把稿件贴进 AI 工具 evidence: [T02-S109];把 CRediT 当署名标准用 evidence: [T02-S084];在笔记本里乱序执行单元格然后以为分析可重复(发布前必须清空内核从头跑一遍)evidence: [T02-S068];用事后功效回答「我的样本量够不够」evidence: [T02-S057];把预印本平台的筛查当质量把关、或引用预印本时不标版本(v1 与 v4 可能结论不同)evidence: [T02-S013]。


工作流 / Pipeline

last_checked: 2026-09-02。工作流层 Decay risk: medium;其中伦理与合规、期刊选择、基金申请三条 high,方法与写作类偏 low。十四条工作流的一个反常发现:入门与资深的差距不在速度,而在这几步上做的事根本不同(本轮对十四条工作流的横向归纳,见 references/research/03-workflows.md 的「入门与资深的真实差距在哪几步」一节)。

给一个人 / 一个小组的取舍顺序:资源受限时按「补不回来」排序,不按「看起来重要」排序。先做这四项——(a) 把外部审批(伦理、人类遗传资源、依托单位、合作协议)排上关键路径并与其他工作并行;(b) 分析计划与决定台账(零成本,纯纪律,事后补不上);(c) 数据的原始层不可变 + 脚本化处理;(d) 署名与数据归属的书面约定 evidence: [T03-S016, T03-S027, T03-S034, T03-S011]。可以坦然推迟的:精美的图、完整的容器化、自建流水线引擎。

选题与可行性判断 (Decay risk: low)

把兴趣变成一个能被回答、且值得回答的问题;同时核对可行性(数据 / 样本 / 设备 / 批件 / 时间)。跳过广泛发散——资深者的题目直接来自上一篇的局限、审稿意见里反复出现的质疑、或指南空白。优化可行性核对:把「需申请」与「已有」分栏,任何一项标错就是后面时间表崩溃的种子。额外做的:写出「我在研究 X,因为我想知道 Y,以便理解 Z」三句自检,写不出第三句就还没有研究问题 evidence: [T04-S046];列出互斥假设并设计一个能各自排除一部分假设的关键实验 evidence: [T04-S022]。最容易死在这一步的表现:停在「主题」没变成可证伪的「问题」。时间尺度:社科或实验心理学博士生的首个课题常见 1–2 个月,计算方向数据现成时 2–3 周(这是按学科与研究类型分开给的区间,不是全行业通用值)。

文献综述与系统综述 (Decay risk: medium)

跳过关键词穷举——资深者用引文网络反向追,并区分「引用是支持还是反驳」,把近三年的高质量综述当骨架。优化检索式:一次写好、多库转换、记录执行日期,让别人能重跑。额外做的:前瞻注册(健康领域走 PROSPERO,其他领域走通用注册平台)、双人盲筛并记录一致性、按 PRISMA 2020 出流程图 evidence: [T04-S027, T02-S085]。最容易死在这一步:检索式不可复现,或用叙述性综述冒充系统综述。

研究设计与预注册 (Decay risk: medium)

跳过「文献都是这个数所以我也用这个数」的样本量。优化分析计划:写到别人拿着它能唯一地跑出你的主分析,含缺失值处理、异常值规则、协变量集合与检验方向。额外做的:明确说出样本量用的是哪条论证路径 evidence: [T04-S085];把探索性分析预先列出来并标明它们是探索性;高风险验证性研究直接走注册报告 evidence: [T04-S013]。最容易死在这一步:分析计划写得含糊,等于没写。

伦理审批与数据合规 (Decay risk: high)

跳过串行推进——资深者把审批与其他工作并行。优化材料准备:按本单位当期模板逐项对,退回原因多数是形式问题。额外做的:中国侧必须把几条线分开走——伦理审查、个人信息保护法的单独同意、人类遗传资源的审批或备案、实验动物许可、科技伦理审查(人工智能、算法与模型设计、个人数据处理已被明确纳入,纯计算与社科研究在中国可能需要审查,而按英文攻略读者会以为不需要)evidence: [T06-S003, T06-S013, T06-S004, T06-S040]。最容易死在这一步:把伦理批件当成个人信息合规,或人类遗传资源审批没进关键路径。

数据采集与数据管理 (Decay risk: medium)

跳过手工中间步骤——任何插在流水线中间的手工操作都会在半年后让你无法重跑。优化目录与命名:原始层只读、处理层可重建、结果层可丢弃。额外做的:写数据管理计划(欧美资助方与很多机构是硬要求)并按 FAIR 选好对口仓储 evidence: [T03-S034, T03-S044];给每个交付物做一次「新人测试」——让没参与的人只拿着它走一遍,走不通的地方就是留痕不足的地方。最容易死在这一步:用文件名当版本控制。

分析与稳健性检验 (Decay risk: low)

跳过「不显著就换设定」的循环。优化主分析与稳健性的分工:主分析按计划跑一次,稳健性系统化覆盖所有合理设定。额外做的:多重宇宙或规格曲线、跨样本验证、盲态分析(理工生医侧);结果不显著时报效应量与区间、用等效性检验回答「是否小到无实践意义」,不写「无效应」 evidence: [T04-S010, T04-S011, T04-S085]。最容易死在这一步:探索性与验证性混着讲。

图表与结果呈现 (Decay risk: low)

跳过手工拼图。优化信息编码:不要只用颜色编码信息,配色要保证色觉障碍读者也能读。额外做的:生医侧的图版受图像完整性政策强约束并被常规抽查,投稿前自己先扫一遍正在从可选变成必要;同时要准备好为正当的图像复用自证 evidence: [T02-S091, T02-S092]。最容易死在这一步:图像处理越过完整性边界。

论文写作 (Decay risk: low)

跳过从引言写起、边写边查文献(先写完把待补的引用标出来,最后统一补)。优化改稿顺序:结构 → 句子 → 词。额外做的:写一份「审稿人会怎么打这篇」的自评,把最狠的三条质疑提前写进讨论的局限;准备一版给非本方向读者的通俗摘要;定稿前跑一遍报告规范清单并把对照表作为投稿附件 evidence: [T03-S001]。最容易死在这一步:方法写到别人重做不出来。

期刊选择与投稿 (Decay risk: high)

跳过按声望而不是按范围匹配度投。优化投稿包:必填项(数据可用性声明、伦理批件号、注册号、利益冲突、AI 使用披露、CRediT)提前备齐,临时补不出来是最常见的卡点。额外做的:走正向核查清单确认这本刊说得清楚 evidence: [T02-S094];用撤稿数据库跑一遍参考文献 evidence: [T02-S105];决定要不要先挂预印本。最容易死在这一步:把「拒稿但鼓励重投」当成大修。审稿周期与接受率各刊自报口径差异极大,必须查目标刊自报的处理时长,不可跨刊套用 evidence: [T03-S057]。

同行评审应对 (Decay risk: medium)

跳过逐条辩解——先判断哪几条是决定性的。优化回复表结构:审稿意见 → 我们的回应 → 修改位置的页码行号;干净稿加标记稿两份。额外做的:不同意某条意见时必须写明理由,不能沉默;被要求补做的实验先判断它是否真的改变结论,不改变的用敏感性分析或文献替代并说明理由 evidence: [T02-S042, T02-S048]。要读懂的措辞差别:may wish to consider 是英式委婉,实际是「必须改」;the novelty is limited 质疑的是选题本身,补实验通常没用;please cite [一串该审稿人的论文] 若与论点无关就是引用胁迫,可礼貌说明并同步告知编辑 evidence: [T06-S026, T06-S036]。

基金申请 (Decay risk: high)

跳过从正文开始写——先读当年的项目指南与申请须知做形式审查自查(限项、资格、截止时间、格式、签章),形式审查往往比学术评审更容易致命。优化立项依据:按故事结构组织(开局—冲突—行动—解决),让评审人在有限时间内抓到你的论点 evidence: [T04-S043]。额外做的:查这个方向被谁资助过;把工作基础当成长期积累而不是当年补;中国侧必须经依托单位申报,英文攻略里「PI 直接对资助机构」的心智模型在中国不成立 evidence: [T06-S008]。红线:不得抄袭、买卖、代写申报材料,不得使用生成式 AI 直接生成申报材料 evidence: [T02-S113]。

实验室协作与署名协商 (Decay risk: medium)

跳过「等有结果再谈署名」。优化协商本身:开工前一次、中期复核一次,一两个小时就够,写下来。额外做的:用四条署名标准逐条核(四条必须同时满足,不满足就进致谢),贡献用角色分类法描述;跨单位合作与涉人类遗传资源的国际合作要按数月预留协议与审批时间 evidence: [T03-S011, T03-S012, T06-S016, T06-S004]。最容易死在这一步:口头约定在争议时等于不存在。

出错之后:更正、关注声明、撤稿与举报 (Decay risk: medium)

跳过观望——拖着不处理指望没人注意是最贵的选择。优化范围判定:不要只改被指出的那一处,先自查同一批数据的其他产出。额外做的:中国侧先查《科研失信行为调查处理规则》(2022 年版,已废止 2019 年试行版)与本校依教育部部门规章订的细则,按程序走并保留证据;国际场景另参 COPE 的场景化流程图,并记住认定主体是机构不是期刊 evidence: [T06-S001, T04-S072, T06-S026]。

发表之后:归档、传播与被质疑的应对 (Decay risk: medium)

跳过发表后才开始整理数据与代码。优化归档时机:投稿时就把可公开版本准备好,接受后几天内完成。额外做的:按 FAIR 存到有 DOI 的仓储,敏感数据走分层与受控访问;被索要数据时按事先写好的分层方案回应,不要按国际默认动作办数据出境 evidence: [T04-S036, T03-S018, T02-S069]。


表达 DNA

last_checked: 2026-09-02Decay risk: low(语体特征比工具与法规稳定得多)。

四个最鲜明的特征

  1. 在给出数字的同一句里给出口径限制。 这是本行最可靠的身份标记。Ioannidis 的名句自带限定:Simulations show that for most study designs and settings, it is more likely for a research claim to be false than true. evidence: [T01-S001];Bik 给完流行率数字紧接着写 As this analysis focused only on one type of data, it is likely that the actual prevalence of inaccurate data in the published literature is higher. evidence: [T01-S050]。外行给数字,内行给数字和口径。
  2. 标题本身就是论点,而且带完整限定条件。 Gelman 与 Loken 那份文稿的标题一口气塞进三个「即使…也…」:The garden of forking paths: Why multiple comparisons can be a problem, even when there is no "fishing expedition" or "p-hacking" and the research hypothesis was posited ahead of time. evidence: [T01-S032]
  3. 正式场合用被动与限定,吐槽场合用第一人称与具体点名。 同一个人的两副语气差别极大:教材与论文里克制到近乎干涩,个人博客里逐篇点名、标题带明显的嘲讽结构 evidence: [T05-S013, T01-S024]。读懂这一行,要同时读它的论文和它的博客。
  4. 中文侧的语体与英文侧明显不同:从一个具体场景开头而不是从结论开头;正式身份与口语人称混用(同一篇里既写「作为期刊现任主编」又写「俺觉得有必要」);结尾常带抒情或诗。这种「权威身份 + 口语自称」的混合在英文对应材料里没有对应物 evidence: [T01-S082, T01-S086]。

5.A 对话样本库(industry voice 实战语料)

原话 者为逐字原话,可在对应来源中找到;标 要义转述 者是转述,不是引文。任何一句都不得被当作逐字引文重新包装。

Shortened here. Read the whole file on GitHub.

Signals

GitHub stars
130
Forks
12
Last commit
Sep 2026
Advanced
Catalog kind
skill
Gateway key
academic-research-publishing-master
Source
github.com/swaylq/master-skill