Nature:中国的科学进步仰赖于数据公开

简介:

大数据时代,生物信息学数据库的发展、数据共享,以及技术资源的易于访问等特点已经显现。直至最近,这股开放性科学研究的趋势正在帮助中国的科学家们走上国际竞争舞台。然而在整个中国社会,对于公共数据获取和分享的限制正愈演愈烈。如果这个问题不被解决,将会拖慢科学研究与创新。


中国科学家要想获取高质量国内数据正变得越来越困难。大部分的公共数据由政府部门掌握,增强了其垄断地位,使得研究者们获取信息变得更为困难。这对人文社科领域的研究者影响尤甚,同时由于一些数据涉及政治敏感性,也对环境科学、公共健康等领域的研究造成了影响。在会议上,我听到许多同事的抱怨,例如从权威部门获取空气污染数据是如何如何的困难。


即使数据被发布出来,一些数据也很可能因为采集方式上的问题而质量底下。最显著的例子莫过于在国内生产总值(GDP)上的争议。官方的全国性的GDP估值,与将31个省级区域的地方值相加的总和相比,存在极大的差异。北京的国家统计局承认,不同省采用不同的数据采集方式导致了这一结果,而他们正在试图协调这个问题。但至今,进展不容乐观。


公共数据分享已经变成了一种盈利模式。例如,如果采集分析道路车辆对于污染的影响的数据,将会是非常有价值的。然而要完成这一工作,必须能够得到每种型号车辆的牌照数量、道路拥挤情况、发动机参数、燃油标准等详细的数据记录。对于研究机构来说,想要从官方获取最基本的车辆持有辆的信息都十分困难,所以只能退而求其次地使用来自汽车制造商的销售数据,而这样的数据经常是被夸大的、带有误导性的。讽刺的是,财大气粗的汽车制造商们却可以以一定的价格,通过政府相关渠道购买到他们竞争对手的客观可靠的销售数据,这对于科研机构和科学家们来说是负担不起的。


在这样的环境下,中国的一些研究团队不愿意公开他们自己的研究数据也就不奇怪了。掌握数据意味着在学术领域拥有了无形的资本和竞争优势。我自己的研究团队就收到过许多索取海事数据的请求,例如我们所编集的口岸统计数据和船队信息,但我们并不情愿分享这些信息。寻找并将信息分类整理成可用的数据是一个耗费巨大的过程。如果我们独享这些数据,就可以用它开发出自己的研究成果。但要是从其他渠道能获得高质量的数据,我们也会乐意分享我们自己的数据。


开放公共数据,提高数据质量可以促进政府透明。尽管进展缓慢,还是存在公开透明化裨益中国社会的正面例子的。其中最瞩目莫过于2014年环保局迫于公众压力而全面公开披露空气污染数据的例子。在此之前,这类数据只是粗略地每天公布一次。而现在,数据每小时都更新一次并且在国内政府机构之间广泛分享。这些数据使卫生局能够对公众发布警告信息;使教育局可以决定是否因雾霾天停课;使交通运输局能够调整汽车限行政策。或许,全面公开污染信息最大的影响是提高了公众对于日益恶化的污染的危机意识。不幸的是,对于其他科学家所渴求的数据,公众并不一定都能像对空气污染数据那样感兴趣。实现公共数据的全面透明公开还是有很长的路要走。


这样的限制不仅仅存在于中国国内的数据。国外学术资源有时也难以获取。一些信息管理部门为了过滤疑似有害信息,人为设置了数字屏障。


我作为一名中国科学家的生活已经受到了影响。可靠的学术文献搜索几乎不可能。没有了谷歌学术搜索引擎(相对于别的学术搜索引擎我更喜欢谷歌,因为可以同时搜索书籍、论文、专利和技术报告),我只好一个个地去搜索出版商运营的数据库,至少目前它们还是可以访问的。


网络安全对国家安全是很重要的,但好的数据是科学进步和经济发展的支柱。资源共享信息的开放可以巩固经济和社会幸福。在中国,解决这些矛盾需要全面性的研究,以便我们建立起一套能够利于多方的高效合理的数据管理机制。更迫切的是,研究者们应当被给予更大的权限,特别是对于公共数据和学术搜索引擎。



原文发布时间为:2015-05-01


本文来自云栖社区合作伙伴“大数据文摘”,了解相关信息可以关注“BigDataDigest”微信公众号

相关文章
|
8月前
|
人工智能
ACM最新论文戳破大公司开源谎言,GenAI时代到底如何定义开源模型
【7月更文挑战第2天】ACM论文揭示GenAI开源真相,指出开源模型常缺乏开放数据集、完整代码与功能,质疑大公司仅借开源名义吸引利益。论文倡导重新定义开源,提议全面评估框架、加强监管及教育,确保真开源,促进领域健康发展。[链接:https://dl.acm.org/doi/3630106.3659005]
106 16
|
存储 机器学习/深度学习 传感器
Science与之江实验室联合发布:智能计算领域10个重大科学问题
Science与之江实验室联合发布:智能计算领域10个重大科学问题
187 0
|
机器学习/深度学习 数据库 异构计算
谷歌提前开源AlphaFold 2!Nature、Science同时公开两大蛋白质结构预测工具(二)
昨日,DeepMind和华盛顿大学分别在nature和Science两大顶级杂志发布了各自预测蛋白质结构的工具,并同时开源了代码。
433 0
谷歌提前开源AlphaFold 2!Nature、Science同时公开两大蛋白质结构预测工具(二)
|
机器学习/深度学习 人工智能 算法
谷歌提前开源AlphaFold 2!Nature、Science同时公开两大蛋白质结构预测工具(一)
昨日,DeepMind和华盛顿大学分别在nature和Science两大顶级杂志发布了各自预测蛋白质结构的工具,并同时开源了代码。
357 0
谷歌提前开源AlphaFold 2!Nature、Science同时公开两大蛋白质结构预测工具(一)
刚刚,2018年度中国科学十大进展正式发布!
“中国科学十大进展”评选迄今为止已经成功举办了14届。
333 0
|
机器学习/深度学习 人工智能 自然语言处理
KDD 2019 投稿要求出炉:结果出炉前不得发表 arXiv ,鼓励公开研究代码和数据
只有那些在文章中公开研究代码和数据的论文才有资格竞选「最佳论文」一奖。
1436 0
|
安全 算法 物联网

热门文章

最新文章