文档备案控制台

开发者社区问答正文

spark MLlib中操作向量需要注意的地方有哪些？

spark MLlib中操作向量需要注意的地方有哪些？

展开

收起

游客k7rjnht6hbtk6 2021-12-09 20:18:59 517 版权

版权声明：本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

1 条回答

写回答

取消提交回答

游客daliwbfb2wo66

1.向量由两种，稠密向量和稀疏向量，稠密向量把所有维度的值放在一个浮点数数组中，稀疏向量把各个维度的非0值存储下来，当最多10%元素为非零元素，考虑使用稀疏向量，减少内存，优化速度

2.创建向量的方式在各个语言中由细微差别，在python中，Numpy数组表示一个稠密向量，或者用mllib.linalg.Vectors类，的Vectors.dense([1.0,2.0])创建，数据也可以根据字典或者两个分别代表位置和值的list来传递Vectors.sparse(4,{0:1.0,2:2.0}),Vectors.sparse(4,[0,2],[1.0,2.0]),java,Scala也是用这个类,在java和scala中，MLlib的vector类只是用来为数据表示服务的。

2021-12-09 20:19:18

赞同展开评论

问答分类：

分布式计算 Spark

问答标签：

apache spark向量 apache spark操作 apache spark mllib MLlib spark

问答地址：

开发者社区 > 大数据 > 问答

相关问答

DataWorks最近有新增spark SQL相关支持，是需要重新初始化吗？有相关的操作文档吗？

159

1

0

大数据计算MaxCompute在spark程序里面操作表数据，应该一次查询多少条 ?

246

1

0

DataWorks中spark操作odps，写入时报的错，哪位给看看什么原因引起的？

388

2

0

你好，Dataworks中的 ODPS Spark，怎么安装和使用 MLlib？

237

3

0

我根据操作maxcompute spark 在idea调试，不能正常执行，这个是什么情况呢？

309

1

0

DataWorks里，odps spark支持操作redis吗，如何操作？

378

2

0

DataWorks怎么操作ODPS Spark节点？

394

1

0

spark 执行RDD操作中的Lazy Calculate有什么好处吗？

2505

1

0

spark 执行RDD操作的过程要注意什么吗？

2478

1

0

通过 Spark 实时写入数据至 Hologres 应该如何操作？

1214

1

0

问答排行榜

最热

最新

【大咖问答】对话PostgreSQL 中国社区发起人之一，阿里云数据库高级专家德哥

据说在家办公的程序员是这样写代码的？

如何升级配置

【藏经阁一起读（27）】本周推荐《Apache Flink案例集（2022版）》，你有哪些心得？

【精品问答】python技术1000问(1)

阿里云服务器多少钱一年？价格贵不贵？有优惠吗？

阿里云服务器问题解答，你关心的问题都在这！

阿里云 ECS 公网 IP有什么更换技巧？

idea 插件，更新记忆规则，经常死机

总是提示您已达到配额使用上限，请升级订阅计划，以获得更多使用资源。问题反馈。但已经购买了资源

相关文章

GPT-5.6 Sol & Subagent 不但聪明，更会分工

AI Slop 图鉴来了，TypeScript 7 快了 10 倍，MiniMax 市值蒸发近四分之三

阿里云大数据 AI 产品月刊-2026年6月

阿里云MaxCompute海量数据离线分析完全指南：从架构原理到性能调优

阿里云智能决策平台对接使用完全指南：从架构解析到生产级集成实战

还有其他疑问?