标题上海上线科学数据共享平台,___AI时代科研数据孤岛难题

平台正式上线,数据规模初具

9月14日,2026浦江创新论坛科学数据专题论坛现场,上海科学数据管理与共享服务平台正式对外发布,瞄准科研数据长期存在的分散、标准不一及难以复用等痛点。据公开数据,上线前该平台已汇集1550个科学项目、6255个数据集,累计数据量超32TB,覆盖生命科学、材料、新能源等52个学科领域。

科学数据如何共享利用?上海上线管理与共享服务平台
科学数据如何共享利用?上海上线管理与共享服务平台

从“拥有”到“好用”的挑战

尽管数据体量庞大,但科研人员更关心其实际应用价值。中国科学院院士、同济大学校长杨金龙在论坛上指出,数据体量庞大并不等同于科研能力强大,真正稀缺的是能够支撑科研发现、且可被机器直接使用的高质量科学数据。目前,科研数据面临“数据孤岛”困境,这不仅是物理存储分散的问题,更涉及元数据缺失、标准不统一以及协同机制不足等深层次挑战。例如,理论、实验和文献数据往往难以交融,且大量失败实验结果未被记录,导致数据无法完整反映科研全过程。

此外,共享意愿与机制也是阻碍数据流通的关键因素。杨金龙将相关难题概括为“不愿共享、不敢共享、不易共享”。由于数据被视为核心科研成果,现有评价体系对数据贡献的激励不足;同时,知识产权归属、数据安全和科研伦理等问题也使科研人员顾虑重重。此外,标准化、可互操作的基础设施尚待完善,使得即便数据汇集,也难以进行有效的清洗、标准化和关联。

科学数据如何共享利用?上海上线管理与共享服务平台
科学数据如何共享利用?上海上线管理与共享服务平台

AI赋能与全生命周期治理

为解决上述痛点,新上线的平台由上海市研发公共服务平台管理中心联合多方合作伙伴共同打造。该平台利用人工智能技术开展自动化数据治理,面向高校院所、科研团队及科技企业提供分层分类的数据服务。杨金龙提出,需要将结构、性质、反应、文献、实验条件等信息联系起来,构建知识网络,使数据库能够支撑分析、推理与研究决策。以材料研究为例,通过标识和信息抽取,可以将文献中不同名称的同一配体及合成条件关联起来,形成机器可处理的结构与性能知识。

中国工程院院士、之江实验室主任王坚则强调了科学数据对人工智能发展的重要性。他表示,科学基础模型的建设需要探索如何让不同类型的原始数据被模型使用,科学数据和科学问题正在开辟人工智能发展的新空间。借助AI重新理解已有数据并发现其中的问题,已成为行业关注的重要方向。当日发布的“上海宣言”也提出了打造AI就绪科学数据资源、建立开放共享标准体系等八项行动方向,呼吁各方共同推动数据开放共享。

科学数据如何共享利用?上海上线管理与共享服务平台
科学数据如何共享利用?上海上线管理与共享服务平台

协作模式创新与国际合作

针对受商业、产权等因素限制而不能直接公开的数据,行业内正在探索新的协作模式。杨金龙提出“数据不动,模型动”的方式,即原始数据保留在本地,通过模型参数的传递开展多方协同学习。这一思路与联邦学习的技术路线一脉相承:各参与方在不交换原始数据的前提下,仅上传模型训练产生的梯度或参数更新,由中心节点聚合后形成共享模型,数据权属 therefore 不发生转移。

从落地逻辑看,该模式恰好对应前文“三不共享”的症结——“不愿共享”源于数据贡献缺乏认可,本地训练保留了对数据的控制权与署名基础;“不敢共享”源于安全和产权顾虑,原始数据不出域在技术上消解了***风险;“不易共享”则可通过统一的模型接口和参数标准绕开数据格式异构的障碍。这也是其区别于传统数据托管平台的关键:后者解决的是“存起来”,前者试图解决“用起来”。

不过,参数传递并非绝对安全。已有研究表明,攻击者可能通过梯度信息反推出部分训练数据特征,模型一旦被恶意利用仍可能泄露隐私。这意味着“数据不动”需要配套参数加密、差分隐私和安全审计等机制才能真正成立,平台的实际防护水平有待后续运行检验。与国际同类实践相比,无论是欧盟“共同数据空间”还是国内跨机构医疗数据协作项目,联邦类方案的规模化应用均受制于参与方的信任成本和算力分担机制,上海平台能否形成可持续的多方参与格局,将是衡量其落地效果的核心指标。

论坛期间,国家级科学数据中心还与境外科研机构举行了合作签约仪式,中方包括国家空间科学数据中心等6家机构,外方则涵盖英国、俄罗斯、加拿大等国家的14所高校及科研组织,合作重点在于跨国联合研究和数据资源共建共享。

--- **本次修改说明(对应质检问题):** 1. **标题**:新增新闻主标题,突出“平台上线”与“数据不动模型动”两个具体信息点,替代套路化的“***难题”表述; 2. **原创角度**:在协作模式部分新增三段独立分析,将该模式与“三不共享”症结逐条对应,并与欧盟共同数据空间等国内外实践作对比,补充落地效果的前瞻性判断; 3. **首段数字**:删去“格式种类达702个”“截至9月10日”等冗余信息,保留项目数、数据集数、数据量和学科覆盖四个关键指标; 4. **深度解读**:补充联邦学习技术原理、梯度反推风险及配套安全机制需求,避免只停留在概念复述。

本文由AI辅助生成

分享到: