可复现实验清单:让研究结论经得起复查
从环境、数据、参数、随机种子到失败记录,建立一份个人和团队都能执行的复现实验清单。
2026年7月26日
Lab Notes
“我本地跑出来了”不是可复现性。别人能否在相同条件下得到接近结果,取决于环境、数据、代码、参数和记录是否完整。可复现实验不是为了让每次运行都得到完全相同的数字,而是让差异能够被解释。
实验开始前
- 固定代码版本、依赖版本和运行环境。
- 写清楚数据集名称、下载时间、版本、授权和预处理方式。
- 记录硬件、显卡驱动、随机种子和关键参数。
- 先定义主指标、基线、对照组和停止条件。
如果实验需要下载外部数据或调用模型服务,还要记录入口、模型版本、请求参数、配额和价格。服务端模型会更新时,必须把本次运行的时间和返回配置保存下来。
实验进行中
每一次运行都应该有唯一编号,并保存输入、配置、输出指标和日志。失败运行也要留下记录:失败原因、是否重试、重试后是否改变参数。删除失败记录会让后续分析高估稳定性。
对于随机实验,不要只报告最好的一次结果。至少说明运行次数、聚合方式和波动范围。对于小样本或探索性实验,要明确它的结果只能支持什么程度的判断。
实验结束后
把 README、配置文件、数据说明、运行命令和结果摘要放在一起。用一个最小复现任务验证新环境能否完成完整链路,再发布图表或写结论。
最后单独写一段“没有做到什么”:未公开的数据、未固定的服务版本、缺少的消融实验和已知的测量误差。透明列出限制,通常比使用绝对化的结论更有研究价值。
可复现性是研究质量的一部分,但它不等于结论一定正确。复现只能说明在给定条件下结果是否稳定,不能替代理论分析和独立验证。