立即免费注册

数据和人工智能对科学生产的影响

从政策角度探讨 FAIR 数据和人工智能治理如何保障科学成果的可信度。

作者:

巴伦德·蒙斯的头像

巴伦德蒙斯莱顿大学荣誉退休教授、GO FAIR基金会董事会成员、莱顿公平公正科学倡议组织LIFES主任

Arie Baak 的头像

阿里·巴克公平公正科学生命协会理事会成员

科恩·琼克斯的头像

科恩·琼克斯欧盟委员会联合研究中心(JRC),布鲁塞尔,比利时

人工智能正在改变科学的开展、交流和验证方式。它拥有巨大的潜力,能够以人类研究人员无法企及的规模进行模式识别,从而加速工作流程并开辟新的发现途径。然而,人工智能速度虽快,但并非完美无缺,而且并非无差别,而科学本身的设计就耗时且严谨。这两种现实之间的矛盾已经造成了严重的弊端:人工智能生成的论文和数据泛滥,同行评审水平下降,出现虚假的研究结果,以及人们对科学记录的信任度降低。未来科学家所需的技能正在发生根本性的变化,而科学政策却未能跟上步伐。弥合这一差距迫在眉睫。

人工智能正在重塑科学的运作方式。

科学领域已以惊人的速度从数据稀少的环境转变为数据丰富的环境。过去,研究人员生成的数据集规模有限,主要通过易于理解的文章来交流研究成果;而如今,他们身处一个数据呈指数级增长的时代。这些数据大多是高维的、分布式的,只有机器才能处理。然而,这种趋势并未体现在实际的数据重用中。为了改变这种现状,数据本身必须被视为一流的科学产出,而非文章的副产品。

机器擅长在庞大而复杂的数据集中发现模式。但机器本身并没有与人类相关的现实概念模型。其结果是模式近乎无限地涌现,其中许多是虚假的,有些甚至具有误导性。下一代科学家面临的核心挑战之一,将是如何在这片模式丛林中穿梭:从统计噪声中区分出有意义的信号。人类的监督并非可有可无,而是结构性必需的。

政策制定者还应意识到,人工智能在科学领域的应用远不止目前主导公众讨论的大型语言模型。更广阔的领域还包括用于假设生成的机器学习、自动化实验工作流程以及基于知识图谱的推理,每一种应用都蕴含着独特的风险和机遇,需要制定相应的治理措施。

数据质量和基础设施是瓶颈所在

人工智能在科学领域的产出质量直接取决于数据质量。 输入FAIR 数据(可查找、可访问、可互操作和可重用,并且越来越多地被理解为完全适用于人工智能)是负责任的人工智能驱动科学的基础前提。没有 FAIR 数据,人工智能模型将基于原始的、未经整理的、可能带有偏见甚至捏造的内容进行训练,从而产生在临床环境中可能危及生命的幻觉,并系统性地破坏人们对科学的信任。尤其是在像目前的 LLM 公司这样的非科学机构大量重复使用易于查找的数据的情况下,这种风险更为严重。

同样重要的是使用 FAIR 概念模型来约束人工智能 输出通过提供结构化的语义框架,明确定义每个概念、它们之间的关系以及什么才算有效推理,这些模型显著降低了产生幻觉的风险,并有助于确保人工智能生成的研究结果对人类而言仍然是可解释的、可理解的和可验证的。

科学出版领域的诚信危机加剧了这些风险。人工智能系统现在几乎可以瞬间生成看似合理的文章、数据和评论。仅在2025年,一场顶尖的人工智能会议就收到了超过20,000万份投稿。应对措施(科学家使用人工智能来审查人工智能生成的论文)可能会形成一个封闭的噪声反馈循环,在这个循环中,有缺陷的系统相互评估,而没有任何有效的外部检验。在源头发布可验证来源的FAIR数据,是目前应对这一趋势最有效的工具之一。

这一切的根源在于激励机制的结构性缺陷。研究人员仍然主要根据文章数量和引用率获得奖励,而这些指标是为数据匮乏的时代设计的。发表高质量的 FAIR 数据几乎得不到任何专业认可,也无法保证获得资助。这种情况必须改变。

治理缺口十分严重。

科学数据的技术治理格局正处于危机之中。数十年来对少数大型云服务提供商的依赖,加上诸如美国《云法案》等法律工具,造成了数据主权问题,而鉴于近期美国政策的不稳定性及其对国际共享研究基础设施的影响,这一问题如今已变得尤为严峻。世界上许多核心科学数据资源实际上已超出其创建机构和社群的管辖范围。

FAIR 原则与 CARE 原则(旨在维护原住民在数据治理中的权利和利益)相辅相成,为负责任的数据管理提供了一个连贯的框架。它们共同界定了数据开放或受限、可重用和自主的条件。FAIR 数据和服务互联网 (IFDS) 的概念提供了一种切实可行的架构解决方案。在该模型中,数据保留在其源头,并由授权算法访问,而不是被复制和集中存储。在该模型中,计算查询会流向分布式数据节点;除非不可避免,否则数据不会流向集中式存储库。

公平参与人工智能驱动的科学研究也要求基础设施真正可及。全球南方地区的机构和社区不能被动地接受数据再利用。另一方面,数据密集型产业也不应被排除在外。分布式 FAIR 基础设施旨在避免供应商锁定和单点故障,是实现有意义参与的机制。

政策制定者应该做什么

制定协调一致的政策应对措施需要在多个方面采取行动:

  • 要求公共资助的研究必须符合 FAIR 数据标准。 资助机构应该将 FAIR 数据发布作为授予资助的条件,而不是建议。
  • 为数据发布和 FAIR 化提供符合条件的资助费用。 必须认识到并承担生成高质量、机器可操作数据所需的投资。
  • 将重复使用先前生成的数据和支持基础设施列为科研经费的合格项目申请书费用。存储和提供高质量、机器可操作的数据所需的投资必须得到认可和保障。
  • 支持社区制定的标准,而不是供应商主导的解决方案。 基于最低限度共享标准的开放、可互操作的基础设施可防止锁定效应,并确保公平竞争环境。
  • 投资于科学素养。 除了科学家之外,公民、记者和政策制定者也需要对人工智能的能力和局限性有一定的了解。公众认知与技术现实之间的差距会构成治理风险。
  • 强制要求科研中使用的人工智能具备来源和透明度要求。 任何对已发表的科学发现做出贡献的人工智能系统都应该被要求披露训练数据的来源、模型约束和局限性。

科学是一项全球公共产品。其完整性、公平性和开放性不能想当然地得到保障;它们需要积极的政策选择。目前为人工智能在科学生产中建立健全的治理机制正值良机,但这窗口不会永远开启。现在就数据标准、基础设施、激励机制和监管等方面做出的决策,将决定人工智能是会加速可信赖的科学发展,还是会系统性地破坏它。


图片由 Getty Images 提供 不飞溅+

本博客由国际科学理事会 (ISC) 和 Frontiers Policy Labs 合作主办,是以下项目的一部分: 21世纪科学的新治理模式该系列活动旨在打造一个充满活力的讨论论坛,汇聚思想领袖,共同探讨科学治理的未来。它摒弃了僵化的学术研究模式,汇集全球顶尖专家,发表精辟、发人深省且基于事实、具有前瞻性的观点文章。通过这些文章,该系列活动希望能够助力构建一个具有韧性、包容性和透明度的治理模式,以应对未来的挑战。

请查看原文 开始.

免责声明
我们客座博客中呈现的信息、观点和建议均来自撰稿人个人,并不一定反映国际科学理事会的价值观和信念。

随时了解我们的时事通讯