闻刊科研 ×
首页›学术资讯›数据共享与开源成为发表新要求,作者该提前准备哪些材料,先看清数据政策再动
学术资讯

数据共享与开源成为发表新要求,作者该提前准备哪些材料,先看清数据政策再动

投稿前先查清目标期刊的数据政策,比写论文本身更容易踩坑。核心就三件事:数据有没有、能不能公开、怎么合规地公开。把这三件事在实验设计阶段就落成文档,后续投稿、返修、答辩都不会被卡。实务中,不少稿子被拒或反复返修,问题不在论证,而在数据可用性声明与仓库链接对不上,或者伦理审批号缺失。我们通常会建议,从选题那天起就建一个「数据合规档案」,而不是等录用通知下来再补材料。

数据共享与开源成为发表新要求,作者该提前准备哪些材料,先看清数据政策再动

1. 开题阶段就查清目标期刊的数据政策

别等到投稿前三天才翻作者指南。Elsevier 旗下多数期刊要求投稿时提交 Data Availability Statement,Springer Nature 部分刊甚至要求把数据存入指定仓库并给出 DOI。PLOS ONE 强制数据公开,否则直接退稿;而部分人文社科期刊只要求「可向通讯作者索取」,但会核查你是否真的保留了原始数据。先把近三年目标刊的作者指南下载下来,建一个表格:是否强制公开、是否指定仓库、是否有豁免条款、豁免需要什么理由。这个表格决定了你后面收集数据的粒度。

政策还分「鼓励」和「强制」两档。鼓励类刊,你不公开也能过,但审稿人可能追问;强制类刊,缺链接就是形式审查不过。区分这两档最省时间。我见过不少课题组,实验做了两年,投稿时才发现该刊要求原始测序数据上传到 SRA 或 GEO,而样本已无法补测。开题时花两小时查政策,能省掉后面两个月的返工。如果对期刊选择没把握,可以参考 南北核/SSCI/SCI论文辅导 里对投稿流程的拆解,先锁定三到五本候选刊再动手。

2. 数据可用性声明不是套话,逐句都要能兑现

Data Availability Statement 常见的写法有四种:数据在正文或补充材料中、数据存于公开仓库并附 DOI、数据可向通讯作者合理索取、数据因伦理或商业限制不可公开。选哪一种,取决于你的数据性质。选了「可索取」,就要保证通讯作者邮箱长期有效,且能提供去标识化后的数据集;选了仓库公开,就要提前拿到 DOI,因为投稿系统里要填。很多人写「数据可向作者索取」,结果审稿人真去要,邮箱已停用,直接给差评。

声明里的每一句话都要有对应动作。写「数据已上传 Figshare」,就附上 DOI;写「因涉及患者隐私不可公开」,就要说明去标识化方案和伦理批件编号。商业数据、第三方授权数据,要附授权范围说明。这部分与 硕博毕业论文全周期辅导 里强调的「材料与数据可追溯」逻辑一致:评审看的不是你写了什么,而是你能不能当场调出证据。

3. 选仓库之前,先分清「通用」和「学科专用」

通用仓库如 Zenodo、Figshare、OSF,适合没有学科强制要求的数据,上传后自动生成 DOI,引用方便。学科专用仓库则有硬性归属:基因序列进 GenBank 或 SRA,蛋白质结构进 PDB,社会科学定量数据可考虑 ICPSR,心理学常用 OSF。选错仓库,审稿人会要求迁移,迁移一次少则两周。仓库还分「可 embargo」和「即时公开」两类,如果你有专利申请或后续论文要发,选支持设置 embargo 期的仓库,通常可设 6 到 12 个月。

另一个细节是文件格式。CSV、TXT、TIFF 这类开放格式优先,Excel 专有格式在部分仓库会被建议转换。元数据要写清楚变量名、单位、缺失值编码,否则数据公开了也没人能用。仓库上传不是终点,README 文件往往决定复现成败。建议把 README 当作一篇小论文来写:数据来源、采集时间、变量说明、分析脚本运行环境,逐项列明。

4. 伦理审批与知情同意,时间线要往前压

涉及人的研究,伦理批件是数据公开的前置条件。国内高校伦理委员会受理到出批件,快则两周,慢则一两个月,涉及多中心研究还要各中心分别审批。知情同意书里如果只写了「数据仅用于本研究」,后续想公开数据就得重新联系受试者或申请豁免,难度极大。所以同意书阶段就要预留「去标识化后数据可用于学术共享」的条款,并说明共享范围。

动物实验需提供 IACUC 批号,涉及人类遗传资源的数据还要走备案或审批流程,周期更长。实务中常见的时间误判是:以为投稿前补伦理号就行,实际上很多期刊要求伦理批件日期早于数据采集日期。把伦理申请排进项目甘特图,和实验启动并行,而不是等数据收完再补。

5. 代码与脚本,别只交数据不交分析过程

越来越多期刊要求连同分析代码一起提交,尤其是涉及统计建模、机器学习的稿件。R 脚本、Python notebook、Stata do 文件都算。代码要能一键跑通,依赖包版本写清楚,最好附上 sessionInfo 或 requirements.txt。仓库选 GitHub 加 Zenodo 联动,可以给某个 release 版本分配 DOI,避免代码后续改动导致结果对不上。

如果代码涉及敏感路径或本地数据库,先做脱敏和路径参数化。审稿人复现失败,往往不是方法错,而是路径写死、随机种子没固定。把随机种子、软件版本、运行时间写进 README,是成本最低的加分项。部分刊还会要求提供原始图像、问卷原件、访谈提纲,这些在收集阶段就要归档,不要等返修通知再翻旧电脑。

6. 返修阶段被追问数据,怎么回应才不掉分

审稿人要求补数据或补代码,先判断是「必须补」还是「可解释」。如果数据确实无法公开,用伦理限制或商业保密条款回应,同时提供去标识化摘要、变量字典或模拟数据,证明分析可复现。回应信里逐条对应,不要笼统说「已按要求补充」。若仓库链接失效,第一时间更新 DOI 并在回应信中说明。

返修时限通常 30 到 60 天,数据迁移和伦理补充可能占掉大半。收到返修意见当天就列数据任务清单,按「能立即做」「需审批」「需重新采集」三档排序。需要重新采集的,尽早和编辑沟通延期,多数编辑接受合理说明。这一环节的沟通质量,直接决定稿件是进入下一轮还是被拒。

7. 投稿前的数据自查清单,逐项打勾再提交

提交前过一遍:数据可用性声明与仓库链接是否一致;DOI 是否可访问;伦理批号与同意书条款是否覆盖共享用途;代码能否在干净环境跑通;补充材料是否包含变量字典;作者贡献与数据归属是否写清。任何一项打不了勾,就先别点提交。形式审查被退回,浪费的是整轮周期。

把这份清单固化成本课题组的模板,下一届学生直接复用。数据合规不是一次性动作,而是从开题到见刊的连续流程。想系统了解各刊政策差异和材料准备节奏,可以关注 学术资讯 栏目里的政策解读,也可以参加 公益讲座 听编辑拆解真实返修案例。课题申报阶段同样涉及数据管理计划,可参考 课题/基金申报书撰写指导 中的材料组织思路,提前把数据管理计划写进申报书,评审时是加分项。

闻刊科研|专注科研服务的学术平台。如果你在数据政策解读、数据可用性声明打磨、仓库选择上拿不准,可以拨打热线 400-9953-660 沟通,我们会按学科和期刊要求给出准备清单。更多栏目内容见 wenkanky.com。

免责声明:本文所述流程、时限与政策要点为一般性经验整理,具体期刊要求以目标刊最新作者指南和所在单位科研管理部门规定为准。闻刊科研提供论文写作指导、材料打磨与申报辅导服务,不涉及代写、代投稿,亦不对录用结果作出承诺。

常见问题

数据可用性声明到底该写哪几种?随便选一种行吗?

常见四种:数据在正文或补充材料、存于公开仓库附 DOI、可向通讯作者索取、因伦理或商业限制不可公开。不能随便选,选「可索取」就要保证邮箱长期有效且能提供去标识化数据,选仓库公开就要提前拿到 DOI,否则审稿人一核查就露馅。

我的数据涉及患者隐私,是不是就完全不用公开了?

不是。可以走「不可公开」条款,但要在声明里说明去标识化方案和伦理批件编号,并尽量提供变量字典或汇总数据。审稿人关注的是可复现性,而不是逼你公开原始隐私数据。同意书阶段最好就预留共享条款。

通用仓库和学科专用仓库,选哪个更稳妥?

有学科强制要求的必须用专用库,比如基因序列进 GenBank 或 SRA、蛋白质结构进 PDB。没有强制要求的可用 Zenodo、Figshare、OSF,能自动生成 DOI。选错仓库会被要求迁移,一次迁移通常耗两周以上。

伦理批件能不能等投稿前再补?

风险很大。多数期刊要求伦理批件日期早于数据采集日期,补开的批件时间对不上会被质疑。国内高校伦理审批快则两周、慢则一两个月,多中心研究更久。建议把伦理申请和实验启动并行排进项目计划。

代码也要一起提交吗?只交数据行不行?

涉及统计建模或机器学习的稿件,越来越多期刊要求连代码一起提交。R 脚本、Python notebook、Stata do 文件都算,要能一键跑通,依赖包版本和随机种子写清楚。只交数据不交分析过程,审稿人复现失败很容易给负面意见。

✉

需要专业的论文润色或翻译服务?

联系学术顾问,获取免费报价与专业建议

立即咨询