清华人工智能研究院成立「知识智能研究中心」,发布四大知识平台

简介: 2019 年 1 月 21 日,清华大学人工智能研究院知识智能研究中心(以下简称知识中心)成立仪式暨知识计算开放平台发布会在清华大学 FIT 楼举行。清华大学副校长、清华大学人工智能研究院管委会主任尤政院士,清华大学人工智能研究院院长张钹院士出席成立仪式并共同为中心揭牌。清华大学人工智能研究院常务副院长孙茂松教授主持成立仪式。

2019 年 1 月 21 日,清华大学人工智能研究院知识智能研究中心(以下简称知识中心)成立仪式暨知识计算开放平台发布会在清华大学 FIT 楼举行。清华大学副校长、清华大学人工智能研究院管委会主任尤政院士,清华大学人工智能研究院院长张钹院士出席成立仪式并共同为中心揭牌。清华大学人工智能研究院常务副院长孙茂松教授主持成立仪式。


65F9695C-F817-4830-B133-CDBB3816C8C9.jpeg


知识中心在成立仪式上发布了清华大学知识计算开放平台,内容涵盖语言知识、常识知识、世界知识和科技知识库,包括:(1)在我国著名机器翻译专家董振东先生毕三十年之功建立的语言和常识知识库《知网》(HowNet)基础上所研制的 OpenHowNet;(2)中英文跨语言百科知识图谱 XLORE;(3)科技知识挖掘平台 AMiner。董强先生、李涓子教授、唐杰教授、黄民烈副教授、刘知远副教授分别介绍了知识计算开放平台本次发布的相关资源及应用案例。成立仪式上,还发布了基于 AMiner 的《清华大学人工智能技术系列报告》(THUAITR)。


一、知识智能研究中心成立


7171DF66-F1C1-4283-9454-EA26BD0AD57D.jpeg


清华大学人工智能研究院成立于 2018 年 6 月,由清华大学计算机系教授、中国科学院院士张钹出任首任院长,清华大学交叉信息研究院院长、图灵奖获得者姚期智担任学术委员会主任。「知识中心」则是清华人工智能研究院成立的首个研究中心。


张钹院士在致辞中谈及成立「知识中心」的三个使命,简单来讲即:一个核心、两个融合。


张钹院士认为人工智能的研究大致可以分为两个阶段。第一个阶段为从人工智能研究出现到上世纪末,一般称为」传统人工智能时代」,这个阶段主要以知识为基础。第二阶段为从本世纪初到现在,以神经网络和深度学习为基础,这一阶段的特点即人工智能技术在社会中的大量应用。然而,目前的人工智能方法仍然缺乏可信性和鲁棒性。张钹院士指出知识是人类智能的重要特征,我们现在已经进入后深度学习时代,让计算机拥有大规模、高质量的形式化知识,是实现安全可信人工智能的重要使命,知识表示、获取、推理与计算将是新一代人工智能研究面临的核心问题。因此,知识中心将紧密围绕人工智能原创性基础理论研究,探索支持鲁棒可解释人工智能的大规模知识的表示、获取、推理与计算的理论和方法,打造国际一流的知识智能创新高地。


另一方面,张钹院士指出,目前我国研究学者对知识表示、知识推理和建立知识库的重视还不够。在人工智能顶级国际会议 IJCAI 上,关于深度学习的论文只占全部论文的 1/3,其中 60% 的论文来自中国;而另外 2/ 3 的关于知识表示、知识推理等的论文中,则几乎没有来自中国的论文。张钹院士认为我们的研究不能只是集中在某一个热点上,科学研究必须多样化,因此」知识中心」将建设知识计算服务平台,平台将包含语言知识、常识知识、世界知识、认知知识的大规模知识图谱以及典型行业知识库;同时也将举办开放的、国际化的与知识智能相关的学术活动,以增进学术交流,普及知识智能技术,促进产、学合作。


9B6A016F-1056-470D-9C9C-856E10F9FC03.jpeg 


知识中心将聘请清华大学李涓子教授为知识中心主任,「知网」创始人董振东为学术顾问。知识中心的学者将包括孙茂松、朱小燕、李涓子、唐杰、许斌、刘洋、黄民烈、刘知远等知名学者。

 

8D68DE7F-5459-42C2-87FD-1134D1E8DD3B.png

1D0C43C4-FE84-4535-9D65-090003C72978.png


二、清华大学知识计算开放平台(THUKC)


知识智能研究中心成立之后,由知识中心主任李涓子教授主持,发布了 XLORE、OpenHowNet、AMiner、THUAITR 四个知识计算平台。


79961D68-DC3C-414E-ACC4-F11AC4D345EE.jpeg


XLORE:中英文跨语言百科知识图谱


网址:https://xlore.org/


XLORE 是中英文知识规模平衡的大规模跨语言百科知识图谱。该图谱通过融合维基百科和百度百科,并对百科知识进行结构化和跨语言链接构建而成。该图谱以结构化形式描述客观世界中的概念、实例、属性及其丰富语义关系。XLORE 目前包含约 247 万概念、44.6 万属性/关系、1628 万实例和 260 万跨语言链接。XLORE 作为世界知识图谱,将为包括搜索引擎、智能问答等人工智能应用提供有力支撑。


CEB77E12-A820-49BD-83CD-550B05A3303C.jpeg

 

XLORE 集成了多项创新研究成果:(1)利用基于链接因子图模型的知识链接方法,实现对不同语言知识资源之间的实体知识关联;(2)利用跨语言概念层次关系的验证保证生成跨语言本体中概念关系的质量,并进一步研究了跨语言知识图谱的概念层次剪枝和优化算法以规范知识分类体系;(3)利用因子图模型建立跨语言属性间的对应关系,减少知识图谱的冗余;(4)联合使用 DBpedia 分类树、维基分类体系、百度百科词条标签对未分类实体进行类别标注。相关成果发表在 WWW、IJCAI、ACL、EMNLP 等人工智能和自然语言处理领域重要国际会议上。


与著名知识图谱 DBpedia 相比,XLORE 的中文实体数量是其的 3.6 倍,中英文跨语言链接增加 39%。XLORE 还提供多样化数据 API 服务,系统累计访问次数过亿次,访问来自 53 个不同国家或地区;2018 年 API 响应调用 160 万余次。XLORE 项目计划于 2019 年正式发布跨语言实体链接服务 XLINK。


在世界知识的获取、表示与计算方面,中心还研制发布了很多开源工具和评测数据集,如知识表示学习工具包 OpenKE(https://github.com/thunlp/OpenKE)、神经网络关系抽取工具包 OpenNRE(https://github.com/thunlp/OpenNRE)、Few shot learning 关系抽取数据集 FewRel(https://github.com/thunlp/FewRel)等,自发布以来获得学术界与产业界广泛使用。


OpenHowNet:基于义原的开放语言知识库


网址:openhownet.thunlp.org/


HowNet 是由董振东先生、董强先生父子毕三十年之功建立的一个以汉语和英语的词语所代表的概念为描述对象,以揭示概念与概念之间、以及概念所具有的属性之间的关系为基本内容的语言和常识知识库。知网 HowNet 秉承还原论思想,认为词义概念可以用更小的语义单位来描述,这种语义单位被称为「义原」(Sememe),是最基本的、不易于再分割的意义的最小单位。在不断标注的过程中,HowNet 逐渐构建出了一套精细的义原体系(约 2000 个义原)。HowNet 基于该义原体系累计标注了数十万词汇/词义的语义信息,自 1999 年正式发布以来引起了中文信息处理领域极大的研究热情,在词汇相似度计算、文本分类、信息检索等方面探索了 HowNet 的重要应用价值,建立了广泛而深远的学术影响力。


FE4AC120-5C3F-4BB7-8D30-980EB33BAD3C.jpeg

 

2017 年以来,清华大学研究团队系统探索 HowNet 知识库在深度学习时代的应用价值,并在词汇语义表示、句子语义表示、词典扩展等任务上均得到了验证。研究发现,HowNet 通过统一的义原标注体系直接精准刻画语义信息,一方面能够突破词汇屏障,深入了解词汇背后丰富语义信息;另一方面每个义原含义明确固定,可被直接作为语义标签融入机器学习模型,使自然语言处理深度学习模型具有更好的鲁棒可解释性。相关成果均发表在 AAAI、IJCAI、ACL、EMNLP 等人工智能和自然语言处理领域顶级国际会议上。


为了让 HowNet 知识库及其学术思想得到更广泛的应用,知识中心联合董氏父子共同开源 HowNet 知识库核心数据,研制了知识库的访问与计算工具包,并将在清华大学知识计算平台上持续地维护、更新和扩展。此外,董强等人创建的语知科技也以 HowNet 为核心,将其应用于各种自然语言理解任务。


AMiner:科技知识挖掘平台


网址:https://aminer.cn/


AMiner 作为科技情报网络大数据挖掘平台,包含超过 2 亿篇学术论文和专利以及 1.36 亿科研人员学术网络。该平台于 2006 年上线,已经累计吸引全球 220 个国家和地区的 800 多万 独立 IP 访问,数据下载量 230 万次,年度访问量超过 1000 万,成为学术搜索和社会网络挖掘 研究的重要数据和实验平台。


AMiner 项目团队与中国工程科技知识中心、微软学术搜索、ACM、IEEE、DBLP、美国艾伦研究所、英国南安普顿大学等机构建立了良好的合作关系,项目成果及核心技术应用 于中国工程院、科技部、国家自然科学基金委、华为、腾讯、阿里巴巴等国内外 20 多家企 事业单位,为各单位的专家系统建设及产品升级提供了重要数据及技术支撑。


AMiner 旨在为研究人员社交网络提供全面的搜索和数据挖掘服务,主要关注:


(1) 通过从分布式 Web 中提取信息为每个研究人员创建基于语义的配置文件;

(2) 从多个来源整合学术数据 (例如,书目数据和研究人员简介);

(3) 准确搜索异构网络;

(4) 从学术社交网络中分析和发现有价值的模式。


0083765B-4DC4-47EC-8876-F8C346BF506F.jpeg 


THUAITR:清华大学人工智能技术系列报告


网址:https://reports.aminer.cn/


THUAITR 以 AMiner 全球科技情报大数据挖掘服务平台为基础,聘请领域专家作为顾问,结合人工智能自动生成技术,以严谨、严肃、负责的态度制作发布的人工智能技术评论及人才分析。报告内容涵盖技术趋势、前沿预测、人才分布、实力对比、以及洞察情报等。


2018 年共发布 14 份技术报告(主题包括:自动驾驶 [基础版]、机器人、区块链、行为经济学、机器翻译、通信与人工智能、自动驾驶、自然语言处理、计算机图形学、超级计算机、3D 打印、智能机器人、人脸识别、人工智能芯片),累计阅读量超过 120 万人次。本次将新发布「知识图谱研究报告」和「数据挖掘研究报告」。60636A3A-EB43-4396-B6ED-F94D6EE78D50.png



本文为机器之心报道,转载请联系本公众号获得授权

相关文章
|
人工智能 自然语言处理 算法
生成式人工智能认证(GAI认证)与标准化进程协同发展及就业市场赋能研究
本文探讨生成式人工智能认证(GAI认证)在人工智能标准化进程中的重要性,分析其对就业市场的积极影响及未来发展趋势。GAI认证不仅是个人AI能力的权威认可,还推动行业标准化与技术创新。文章指出,随着技术融合加速和应用场景拓展,GAI认证标准需不断完善,以应对技术更新、数据安全等挑战,为AI健康发展贡献力量。
|
机器学习/深度学习 人工智能 自然语言处理
人工智能:有多少人工,才能有多少智能?
当下AI大模型的能力,特别是Agent领域,到底离不开多少“人工”的加持?本文将结合我的实际经验,深入探讨高质量数据与有效评价体系在Agent发展中的决定性作用,并通过编码Agent、Web Agent和GUI Agent的成熟度分析,揭示AI智能体发展面临的挑战与机遇。
445 89
|
11月前
|
机器学习/深度学习 人工智能 供应链
决策智能是新的人工智能平台吗?
决策智能融合数据、决策与行动,通过AI与自动化技术提升企业决策质量与效率,支持从辅助到自动化的多级决策模式,推动业务敏捷性与价值转化。
|
机器学习/深度学习 人工智能 自动驾驶
人机融合智能 | 以人为中心的人工智能伦理体系
本章探讨“以人为中心”的人工智能伦理体系,分析人工智能伦理与传统伦理学的关系、主要分支内容及核心原则。随着人工智能技术快速发展,其在推动社会进步的同时也引发了隐私、公平、责任等伦理问题。文章指出,人工智能伦理需融入传统伦理框架,并构建适应智能技术发展的新型伦理规范体系,以确保技术发展符合人类价值观和利益。
623 4
|
机器学习/深度学习 人工智能 运维
阿里云PAI人工智能平台介绍、优势及收费标准,手动整理
阿里云人工智能平台PAI是面向开发者和企业的机器学习与深度学习工程平台,提供数据标注、模型构建、训练、部署及推理优化等全链路服务。内置140+优化算法,支持PyTorch、TensorFlow等多种框架,具备高性能训练与推理能力,适用于自动驾驶、金融风控、智能推荐、智慧医疗等多个行业场景。PAI提供零代码开发、可视化建模、大模型一键部署等功能,助力企业快速构建AI应用。支持多种购买方式,如按量付费、预付费等,满足不同业务需求。
|
机器学习/深度学习 人工智能 算法
人机融合智能 | 以人为中心人工智能新理念
本文探讨了“以人为中心的人工智能”(HCAI)理念,强调将人的需求、价值和能力置于AI设计与开发的核心。HCAI旨在确保AI技术服务于人类,增强而非取代人类能力,避免潜在危害。文章分析了AI的双刃剑效应及其社会挑战,并提出了HCAI的设计目标与实施路径,涵盖技术、用户和伦理三大维度。通过系统化方法,HCAI可推动AI的安全与可持续发展,为国内外相关研究提供重要参考。
1123 3
|
人工智能
生成式人工智能认证(GAI认证)官网 - 全国统一认证中文服务平台上线
生成式人工智能(AI)正深刻改变职场规则,但系统化学习相关技术成为难题。近日,由全球知名教育公司培生推出的生成式人工智能认证(GAI认证)中文官网正式上线,为专业人士和学习者提供了权威解决方案。该认证涵盖核心技能、提示工程、伦理合规等内容,助力持证者紧跟技术前沿,在职场中脱颖而出。全国统一认证平台提供便捷报名与在线考试服务,考后快速出成绩并颁发证书。行动起来,开启AI职业新篇章!
|
机器学习/深度学习 人工智能 自然语言处理
人机融合智能 | 数据与知识双驱动式人工智能
本章系统介绍了数据驱动、知识驱动及双驱动人工智能的理论与应用。数据驱动方法依赖大数据和深度学习,在图像识别、自然语言处理等领域取得突破,但面临标注成本高、可解释性差等问题。知识驱动方法通过知识表示与推理提升系统理解能力,却在泛化性和适应性上受限。为弥补单一范式的不足,数据与知识双驱动融合两者优势,致力于构建更智能、可解释且安全可靠的AI系统,兼顾伦理与隐私保护。文章还回顾了AI发展历程,从早期神经网络到当前大规模语言模型(如GPT、BERT)的技术演进,深入解析了各类机器学习与深度学习模型的核心原理与应用场景,展望未来AI发展的潜力与挑战。
965 0
|
数据采集 机器学习/深度学习 人工智能
数据驱动智能,智能优化数据——大数据与人工智能的双向赋能
数据驱动智能,智能优化数据——大数据与人工智能的双向赋能
835 4

热门文章

最新文章