Nature:中国的科学进步仰赖于数据公开

简介:

大数据时代,生物信息学数据库的发展、数据共享,以及技术资源的易于访问等特点已经显现。直至最近,这股开放性科学研究的趋势正在帮助中国的科学家们走上国际竞争舞台。然而在整个中国社会,对于公共数据获取和分享的限制正愈演愈烈。如果这个问题不被解决,将会拖慢科学研究与创新。


中国科学家要想获取高质量国内数据正变得越来越困难。大部分的公共数据由政府部门掌握,增强了其垄断地位,使得研究者们获取信息变得更为困难。这对人文社科领域的研究者影响尤甚,同时由于一些数据涉及政治敏感性,也对环境科学、公共健康等领域的研究造成了影响。在会议上,我听到许多同事的抱怨,例如从权威部门获取空气污染数据是如何如何的困难。


即使数据被发布出来,一些数据也很可能因为采集方式上的问题而质量底下。最显著的例子莫过于在国内生产总值(GDP)上的争议。官方的全国性的GDP估值,与将31个省级区域的地方值相加的总和相比,存在极大的差异。北京的国家统计局承认,不同省采用不同的数据采集方式导致了这一结果,而他们正在试图协调这个问题。但至今,进展不容乐观。


公共数据分享已经变成了一种盈利模式。例如,如果采集分析道路车辆对于污染的影响的数据,将会是非常有价值的。然而要完成这一工作,必须能够得到每种型号车辆的牌照数量、道路拥挤情况、发动机参数、燃油标准等详细的数据记录。对于研究机构来说,想要从官方获取最基本的车辆持有辆的信息都十分困难,所以只能退而求其次地使用来自汽车制造商的销售数据,而这样的数据经常是被夸大的、带有误导性的。讽刺的是,财大气粗的汽车制造商们却可以以一定的价格,通过政府相关渠道购买到他们竞争对手的客观可靠的销售数据,这对于科研机构和科学家们来说是负担不起的。


在这样的环境下,中国的一些研究团队不愿意公开他们自己的研究数据也就不奇怪了。掌握数据意味着在学术领域拥有了无形的资本和竞争优势。我自己的研究团队就收到过许多索取海事数据的请求,例如我们所编集的口岸统计数据和船队信息,但我们并不情愿分享这些信息。寻找并将信息分类整理成可用的数据是一个耗费巨大的过程。如果我们独享这些数据,就可以用它开发出自己的研究成果。但要是从其他渠道能获得高质量的数据,我们也会乐意分享我们自己的数据。


开放公共数据,提高数据质量可以促进政府透明。尽管进展缓慢,还是存在公开透明化裨益中国社会的正面例子的。其中最瞩目莫过于2014年环保局迫于公众压力而全面公开披露空气污染数据的例子。在此之前,这类数据只是粗略地每天公布一次。而现在,数据每小时都更新一次并且在国内政府机构之间广泛分享。这些数据使卫生局能够对公众发布警告信息;使教育局可以决定是否因雾霾天停课;使交通运输局能够调整汽车限行政策。或许,全面公开污染信息最大的影响是提高了公众对于日益恶化的污染的危机意识。不幸的是,对于其他科学家所渴求的数据,公众并不一定都能像对空气污染数据那样感兴趣。实现公共数据的全面透明公开还是有很长的路要走。


这样的限制不仅仅存在于中国国内的数据。国外学术资源有时也难以获取。一些信息管理部门为了过滤疑似有害信息,人为设置了数字屏障。


我作为一名中国科学家的生活已经受到了影响。可靠的学术文献搜索几乎不可能。没有了谷歌学术搜索引擎(相对于别的学术搜索引擎我更喜欢谷歌,因为可以同时搜索书籍、论文、专利和技术报告),我只好一个个地去搜索出版商运营的数据库,至少目前它们还是可以访问的。


网络安全对国家安全是很重要的,但好的数据是科学进步和经济发展的支柱。资源共享信息的开放可以巩固经济和社会幸福。在中国,解决这些矛盾需要全面性的研究,以便我们建立起一套能够利于多方的高效合理的数据管理机制。更迫切的是,研究者们应当被给予更大的权限,特别是对于公共数据和学术搜索引擎。



原文发布时间为:2015-05-01


本文来自云栖社区合作伙伴“大数据文摘”,了解相关信息可以关注“BigDataDigest”微信公众号

相关文章
|
7天前
|
人工智能 JSON 机器人
让龙虾成为你的“公众号分身” | 阿里云服务器玩Openclaw
本文带你零成本玩转OpenClaw:学生认证白嫖6个月阿里云服务器,手把手配置飞书机器人、接入免费/高性价比AI模型(NVIDIA/通义),并打造微信公众号“全自动分身”——实时抓热榜、AI选题拆解、一键发布草稿,5分钟完成热点→文章全流程!
10950 83
让龙虾成为你的“公众号分身” | 阿里云服务器玩Openclaw
|
7天前
|
人工智能 IDE API
2026年国内 Codex 安装教程和使用教程:GPT-5.4 完整指南
Codex已进化为AI编程智能体,不仅能补全代码,更能理解项目、自动重构、执行任务。本文详解国内安装、GPT-5.4接入、cc-switch中转配置及实战开发流程,助你从零掌握“描述需求→AI实现”的新一代工程范式。(239字)
4190 129
|
2天前
|
人工智能 Kubernetes 供应链
深度解析:LiteLLM 供应链投毒事件——TeamPCP 三阶段后门全链路分析
阿里云云安全中心和云防火墙已在第一时间上线相关检测与拦截策略!
1402 5
|
3天前
|
人工智能 自然语言处理 供应链
【最新】阿里云ClawHub Skill扫描:3万个AI Agent技能中的安全度量
阿里云扫描3万+AI Skill,发现AI检测引擎可识别80%+威胁,远高于传统引擎。
1294 3
|
13天前
|
人工智能 JavaScript API
解放双手!OpenClaw Agent Browser全攻略(阿里云+本地部署+免费API+网页自动化场景落地)
“让AI聊聊天、写代码不难,难的是让它自己打开网页、填表单、查数据”——2026年,无数OpenClaw用户被这个痛点困扰。参考文章直击核心:当AI只能“纸上谈兵”,无法实际操控浏览器,就永远成不了真正的“数字员工”。而Agent Browser技能的出现,彻底打破了这一壁垒——它给OpenClaw装上“上网的手和眼睛”,让AI能像真人一样打开网页、点击按钮、填写表单、提取数据,24小时不间断完成网页自动化任务。
2749 6
|
6天前
|
人工智能 机器人 API
从零搭建OpenClaw多智能体系统:部署、API配置+飞书多机器人管理手册
在团队协作场景中,单一AI智能体往往难以满足多部门、多场景的差异化需求——研发团队需要代码专家,运营团队需要内容策划助手,客服团队需要高效问答机器人,若所有需求都由同一个智能体承接,不仅会导致响应质量下降,还可能出现记忆混乱、权限失控等问题。2026年,OpenClaw(曾用名Clawdbot)的多Agent架构完美解决了这一痛点,通过“多飞书机器人账号+多独立Agent+路由绑定”的配置,可实现不同机器人对应专属AI大脑,各司其职、精准响应。
1430 1

热门文章

最新文章