报告

AI生成引用失真:生物医学出版的信任危机,正外溢为全球科研治理议题

一项对PubMed Central开放获取生物医学论文的大规模审计发现,AI辅助写作、论文工厂与引用伪造正在共同侵蚀学术证据体系。这个问题不只是出版伦理,更关乎全球科研治理、医疗知识可靠性、发展中国家知识获取和AI时代的科学基础设施重建。

AI生成引用失真:生物医学出版的信任危机,正外溢为全球科研治理议题

一项看似属于学术出版内部的审计,正在揭示一个更广泛的全球发展问题:当生成式AI进入论文写作流程,知识生产的“低成本扩张”与证据质量的“高风险流失”开始同时发生。根据《柳叶刀》上的通信与相关报道,研究团队对PubMed Central开放获取数据库中约250万篇生物医学论文进行了审计,覆盖时间为2023年1月1日至2026年2月18日,最终在9710万条已验证参考文献中识别出4046条伪造引用,涉及2810篇论文。

这不是一个仅供出版界讨论的边缘问题。它关系到医学证据是否可信、系统综述是否稳健、临床指南是否可靠,也关系到全球南方研究机构在资源有限条件下如何使用被数字化平台放大的知识体系。更重要的是,它提醒政策制定者:AI带来的不只是生产力提升,也会重塑科研诚信、知识验证和国际合作的底层逻辑。

从“写作工具”到“证据污染源”

生成式AI最初被许多研究者视为提升效率的辅助工具:帮助润色语言、整理文献、生成提纲。然而,这次审计显示,当AI被不加约束地嵌入学术写作流程时,引用失真可能迅速从个别错误演化为规模化风险。

研究团队使用自动化验证流程,交叉比对PubMed、Crossref、OpenAlex和Google Scholar等数据库,并通过大语言模型辅助筛选可疑条目。这个方法本身具有现实意义:在百万级论文规模下,传统人工核查几乎不可行,自动化与人工复核结合已成为大规模科研治理的现实路径。

但问题也由此显现:一旦引用核查机制本身滞后,生成式AI就可能把“看起来像证据”的内容,批量注入知识体系。对医学领域而言,这种失真尤其危险,因为临床指南、药物评估和公共卫生研究都依赖可追溯、可验证的文献基础。错误引用并不只是格式瑕疵,它可能影响治疗建议、政策判断和资源配置。

为什么这不仅是科研诚信问题,也是全球发展问题

在全球发展视角下,科研诚信并非象牙塔内部事务,而是公共能力的一部分。对高收入国家而言,错误引用主要意味着学术声誉受损;对中低收入国家而言,它还可能意味着有限的研究经费被浪费、政策依据被污染、医疗系统吸收了不可靠证据。

世界银行、UNDP和多边开发机构近年来不断强调“制度能力”与“数据能力”是发展结果的重要决定因素。今天,这种能力已不再局限于财政管理或统计体系,也包括知识生产体系本身:论文是否可验证、研究是否可复现、引用是否可追踪、数据库是否可审计。

这与ESG中的“治理”维度高度相关。过去,ESG更多用于企业披露、供应链管理和资本市场评估;现在,围绕AI生成内容的治理问题也开始进入研究机构、出版社和平台公司的责任范围。学术出版机构若不能建立更强的参考文献校验机制,就相当于在知识供应链中留下了系统性治理缺口。

伪造引用的上升,折射出研究生态的结构压力

审计显示,伪造引用的发生率从2023年的每1万篇论文约4篇,上升到2026年初的每1万篇约57篇,增幅超过12倍。虽然单个比例看似不高,但在百万级论文和多层级知识转化链条中,其累积效应不容忽视。

这种上升并不只是技术问题,也与科研激励结构有关。全球范围内,论文数量、期刊影响因子、项目申报成功率和机构排名仍在强烈驱动“快产出”模式。对于部分研究者,AI写作工具提供了压缩成本、提升产量的诱因;对于论文工厂而言,它则可能成为批量生产“学术外观”的加速器。

问题在于,当发表压力与技术便利同时上升,而审稿、编辑和索引系统的验证能力没有同步升级时,科研生态就会形成典型的“质量外部性”。这也是为什么这一现象值得被放入全球治理框架来理解:它反映的不是单点失误,而是激励机制、平台技术和制度监管之间的不匹配。

对发展中国家意味着什么

对许多发展中国家的大学、医院和研究机构来说,生成式AI带来的双重效应更加复杂。一方面,它降低了语言门槛,帮助非英语研究者更快进入国际发表体系;另一方面,它也放大了对外部数据库、商业工具和不透明模型的依赖。

如果参考文献验证能力不足,本地学者更容易在快速发表中陷入“可见性竞争”而忽视证据质量。更现实的是,发展中国家的卫生系统、农业推广、气候适应和教育改革,往往要依赖国际文献与外部知识网络。一旦这些网络中混入大量伪造或不可追踪的引用,决策成本会被悄然抬高。

这也是数字鸿沟的新表现形式:过去,鸿沟体现为网络覆盖率和设备可及性;现在,鸿沟还体现为谁能使用高质量验证工具、谁能负担数据审计、谁能参与规则制定。

为什么出版社、索引平台和国际组织都必须介入

《柳叶刀》通信及相关机构建议出版社在投稿阶段进行引用核查,索引服务为可疑参考文献添加元数据标记,并建立专门类别追踪伪造引用。这些建议并不夸张,反而代表了AI时代学术基础设施的最低治理要求。

原因很直接:学术出版已经不是单一机构内部流程,而是一个跨平台、跨数据库、跨语种的全球知识网络。PubMed、Crossref、OpenAlex、Google Scholar等系统一旦成为事实上的知识入口,它们就承担了类似公共基础设施的角色。公共基础设施不能只追求覆盖率,还必须追求可验证性。

国际组织在这里也可以发挥作用。正如气候领域需要MRV(监测、报告、核证)体系,科研治理也需要类似的验证框架。未来,围绕AI辅助写作的透明披露、引用真实性标识、论文工厂识别和数据库联动预警,可能会逐步形成跨机构标准。这将是国际合作的新前沿。

ESG视角下的“治理”正在重新定义

在ESG语境中,学术出版与科研机构通常不被视作传统ESG资产。但如果把知识生产视为社会基础设施,就会发现其治理质量直接影响医疗、教育、公共政策和投资决策。

对投资者而言,AI时代的“治理风险”不再只包括董事会独立性或财务披露,还包括数据来源、模型使用和内容验证。对高校和研究机构而言,真正的竞争力不只是论文数量,而是证据链条的完整性。对出版社和数据库平台而言,未来的核心价值也不仅是收录规模,更是可信度管理能力。

这意味着ESG评价体系本身也可能演化:随着AI介入内容生产,治理指标需要覆盖算法透明度、来源可追溯性、错误纠正机制和平台责任。换句话说,治理维度将从“企业内部合规”扩展为“知识生态合规”。

未来的关键不在于禁止AI,而在于重建验证机制

这类问题的答案不是简单回到“无AI时代”。生成式AI在语言支持、知识检索和研究辅助方面确有价值,尤其对非英语科研群体具有现实帮助。真正的挑战是,如何在效率提升的同时,重建证据验证与责任追踪机制。

未来几年,值得关注的不是AI是否进入科研,而是三件事:

1. 出版社是否把参考文献核验前置到投稿环节; 2. 索引平台是否建立统一的伪造引用标识; 3. 研究机构是否将AI使用披露和引用审计纳入科研诚信制度。

如果这些机制不能建立,AI将继续推动科研产出增长,但知识体系的可信度会被持续稀释。对医学和公共卫生而言,这不是可接受的代价。

结语:知识可信度,正在成为新的发展能力

全球发展研究过去更关注资金、基础设施、教育和卫生,如今必须把“知识可信度”纳入同一框架。因为在一个高度数字化、模型化和自动化的时代,政策、医疗、教育与投资越来越依赖可验证的信息流。

这次针对生物医学论文的审计表明,AI时代最稀缺的资源之一,可能不是内容生成能力,而是内容验证能力。对全球南方国家而言,这一点尤其重要:如果无法建立可靠的知识基础设施,数字化不一定带来更平等的发展,反而可能放大原有的不平等。

从长周期看,真正决定科研体系竞争力的,不是写得多快,而是证据是否可被信任。

公开记录说明 · globaldevjournal

globaldevjournal 将这段说明放在「ESG 与政策 / 新兴地区」的站点语境中。读者复用摘要前应先打开来源链接;日期、名称和状态变化仍需重新核对 (「ESG 与政策 / 新兴地区」解释了本文的本地编辑角度)。

来源链接

  1. https://letsdatascience.com/news/audit-finds-ai-fabricated-citations-across-biomedical-papers-146e8f2a主要来源

相关文章

返回栏目