大讲堂 | 面向大数据的图聚类方法

简介: 在本次公开课中,我们针对大数据的需求,提出了一系列新的图聚类方法及优化方法。

雷锋网AI研习社讯:聚类是统计学、机器学习和数据挖掘领域的重要研究问题之一,其目的是将数据对象划分为多个类或簇(cluster),使同一簇中的对象之间有较高的相似度,而不同簇中的对象有较大的差异。聚类是数据分析的重要手段,在客户分群、基因识别、文本分析、空间数据处理、卫星照片分析、医疗影像自动检测等领域有着广泛的应用。基于图的聚类方法通过将带权无向图划分为两个或两个以上的最优子图,使子图内部尽量相似,而子图间距离尽量距离较远,以达到聚类的目的。与传统的聚类算法相比,它能工作在任意的空间、能对任意形状的数据进行聚类。但是,由于这类算法需要进行特征向量分解,具有较高的复杂度,所以在大数据时代面临巨大的挑战。我们针对大数据的需求,提出了一系列新的图聚类方法及优化方法。

分享主题

Graph-based Clustering of Large-scale Data(面向大数据的图聚类方法)

分享嘉宾

陈小军,深圳大学计算机与软件学院讲师,主要研究方向为无监督学习、特征选择、集成学习等。发表了40余篇学术论文,包括十余篇CCF A类文章,如SIGKDD、ICDE、ICCV、AAAI、IJCAI、TKDE、TNNLS等。

分享提纲

1、聚类

2、图聚类及归一化割

3、分享的工作:

        ISR: Improved Spectral Rotation [IJCAI 2017]

        DNC: Direct Normalized Cut [SIGKDD 2018]

        BKM: Balanced k-means for anchor generation [SIGKDD 2018]

 

分享时间

(北京时间 )  10 月 26 日(星期五)  20:00

直播链接

http://www.mooc.ai/open/course/584

TB1vS78kNnaK1RjSZFBXXcW7VXa.jpg

想了解更多雷锋网(公众号:雷锋网) AI 研习社直播?

欢迎移步雷锋网 AI 研习社社区~

雷锋网版权文章,未经授权禁止转载。详情见转载须知。

TB1kZ.HkRLoK1RjSZFuXXXn0XXa.jpg
相关实践学习
简单用户画像分析
本场景主要介绍基于海量日志数据进行简单用户画像分析为背景,如何通过使用DataWorks完成数据采集 、加工数据、配置数据质量监控和数据可视化展现等任务。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
3月前
|
机器学习/深度学习 数据采集 算法
大数据分析技术与方法探究
在当今信息化时代,数据量的增长速度远快于人类的处理能力。因此,如何高效地利用大数据,成为了企业和机构关注的焦点。本文将从大数据分析的技术和方法两个方面进行探究,为各行业提供更好的数据应用方向。
|
3月前
|
机器学习/深度学习 人工智能 自然语言处理
大数据分析的技术和方法:从深度学习到机器学习
大数据时代的到来,让数据分析成为了企业和组织中不可或缺的一环。如何高效地处理庞大的数据集并且从中发现潜在的价值是每个数据分析师都需要掌握的技能。本文将介绍大数据分析的技术和方法,包括深度学习、机器学习、数据挖掘等方面的应用,以及如何通过这些技术和方法来解决实际问题。
53 2
|
4月前
|
存储 SQL 分布式计算
数据计算MaxCompute读取外部表(数据在oss gz压缩)速度非常慢,有什么方法可以提升效率么?
数据计算MaxCompute读取外部表(数据在oss gz压缩)速度非常慢,有什么方法可以提升效率么?
49 1
|
4天前
|
SQL 分布式计算 资源调度
一文解析 ODPS SQL 任务优化方法原理
本文重点尝试从ODPS SQL的逻辑执行计划和Logview中的执行计划出发,分析日常数据研发过程中各种优化方法背后的原理,覆盖了部分调优方法的分析,从知道怎么优化,到为什么这样优化,以及还能怎样优化。
|
6月前
|
存储 数据采集 机器学习/深度学习
克服大数据障碍的三种方法
克服大数据障碍的三种方法
|
2月前
|
大数据 Java 编译器
关于 Python 在 for 循环里处理大数据的一些推荐方法
关于 Python 在 for 循环里处理大数据的一些推荐方法
41 0
|
3月前
|
算法 数据可视化 大数据
大数据分析的技术和方法——探究现代数据处理的未来方向
在当今信息化时代,海量数据已经成为企业和组织的重要资源。大数据分析技术的出现为数据处理提供了更高效、更准确的解决方案。本文将深入探讨大数据分析技术和方法,分析其优势和应用场景,以及未来发展方向。
|
3月前
|
存储 数据采集 机器学习/深度学习
大数据分析:挖掘数据价值的技术和方法
在数字化时代,大数据已经成为企业和科研机构的重要资源之一。然而,对于海量的数据如何进行分析和挖掘却是一个巨大的挑战。本文将介绍大数据分析的基本概念、技术和方法,帮助读者了解如何利用现代技术和工具,挖掘数据中蕴藏的价值。
114 0
|
4月前
|
分布式计算 资源调度 大数据
一图胜千言:大数据入门必备的16张数据流转图(建议收藏)
一图胜千言:大数据入门必备的16张数据流转图(建议收藏)
172 0
|
4月前
|
SQL 分布式计算 Hadoop
最新大数据集群安装方法CentOS7.6__大数据环境安装和配置
最新大数据集群安装方法CentOS7.6__大数据环境安装和配置
146 0

热门文章

最新文章