胖子哥的大数据之路(16):数据采集标准-我们到底需要什么样的数据?

简介: 一、前言      刚刚有一个好友向我咨询数据相关的问题,朋友目前是IT设备生产厂商的人。从好友的描述中,提到对用户特征获取的需求。包括:人的兴趣爱好、关注焦点等,在用户的描述中其实只是直觉性的列决出了几点,然后基于此作相应的后续产品或服务推荐。

一、前言

      刚刚有一个好友向我咨询数据相关的问题,朋友目前是IT设备生产厂商的人。从好友的描述中,提到对用户特征获取的需求。包括:人的兴趣爱好、关注焦点等,在用户的描述中其实只是直觉性的列决出了几点,然后基于此作相应的后续产品或服务推荐。朋友要表达的内容,在我理解,其实是想获取用户的完整的画像信息,只是她并不清楚,完整的用户标签体系应该是个什么样子而已,数据标签体系作为下一个系列,我们单独探讨。在此,我们讨论的问题聚焦到,要想实现业务目标,我们到底需要什么采集(此处不区分自有,还是外部采买)什么样的用户数据,才能支撑我们的业务目标,即数据采集标准的问题。

二、所需即所用-没有标准的标准

      世界上不会有完全相同的两条河流,同样也不会有两个完全相同的业务实体,即使是同一行业,同一领域,不同的企业,其业务模式也是有差异的,比如今日之华为和小米。业务目标驱动的数据需求采集,有其局限性,但也有其适用性,局限性在于时移世易,业务变了,数据需求也就变了;适用性在于,量出为入,不奢侈,不浪费。此话说起来简单,实施起来确实非常复杂,举例而言,苹果6plus(高档货,没用过,感觉很高档的样子)如果在投入市场之前,需要圈定预售目标群体,针对其推送响应的推广信息(貌似苹果不需要广告,人多钱傻东西贵的年代,苹果赚钱都赚的有点不好意思了)那么需要参考哪些数据指标,不需要参考哪些指标?评判需要和不需要的标准又是什么?用户特征维度示例如下图所示:

 

 其中每一项代表用户的一个标签特征,我没有穷举,而是用...省略号来进行处理,不是因为尚未形成体系,而是搜索引擎业务模型下的用户标签体系未必适合于其他领域。此处涉及一个标准的问题,这些特征标签够吗?判断够与不够的标准是什么(我也是醉了,一说起标准就成了说车轱辘话了)?数据领域有一个非常操蛋的东西,就是没有标准,其实很多问题,同样没有标准。之前和几个数据仓库领域的专家探讨数据仓库数据存储模型设计标准的问题的时候,我总结了几条:

1.用的爽吗?

   用的不爽是给别人找麻烦;

2.变的勤吗?

   变的勤是给自己找麻烦;业务未变,模型变,是你设计有问题;业务变了,模型变,是合理的场景。

数据采集的标准其实有点和上面的问题类似,也可以总结为几点:
1.数据拿来干什么?

2.数据拿来怎么用?

我想回答了以上两个问题,即明白数据采集的判断标准问题:业务驱动,量出为入,所需即所采。

三、预告

   下个专题写用户标签体系,在此预告吧。先放一张图,百度的用户画像示意图,感觉挺好看的。

 

 


作者:张子良
出处:http://www.cnblogs.com/hadoopdev
本文版权归作者所有,欢迎转载,但未经作者同意必须保留此段声明,且在文章页面明显位置给出原文连接,否则保留追究法律责任的权利。

相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
相关文章
|
6月前
|
机器学习/深度学习 传感器 分布式计算
数据才是真救命的:聊聊如何用大数据提升灾难预警的精准度
数据才是真救命的:聊聊如何用大数据提升灾难预警的精准度
434 14
|
6月前
|
传感器 人工智能 监控
数据下田,庄稼不“瞎种”——聊聊大数据如何帮农业提效
数据下田,庄稼不“瞎种”——聊聊大数据如何帮农业提效
219 14
|
5月前
|
传感器 人工智能 监控
拔俗多模态跨尺度大数据AI分析平台:让复杂数据“开口说话”的智能引擎
在数字化时代,多模态跨尺度大数据AI分析平台应运而生,打破数据孤岛,融合图像、文本、视频等多源信息,贯通微观与宏观尺度,实现智能诊断、预测与决策,广泛应用于医疗、制造、金融等领域,推动AI从“看懂”到“会思考”的跃迁。
427 0
|
6月前
|
机器学习/深度学习 传感器 监控
吃得安心靠数据?聊聊用大数据盯紧咱们的餐桌安全
吃得安心靠数据?聊聊用大数据盯紧咱们的餐桌安全
206 1
|
6月前
|
数据采集 自动驾驶 机器人
数据喂得好,机器人才能学得快:大数据对智能机器人训练的真正影响
数据喂得好,机器人才能学得快:大数据对智能机器人训练的真正影响
565 1
|
7月前
|
机器学习/深度学习 监控 大数据
数据当“安全带”:金融市场如何用大数据玩转风险控制?
数据当“安全带”:金融市场如何用大数据玩转风险控制?
254 10
|
7月前
|
机器学习/深度学习 自然语言处理 监控
大数据如何影响新兴市场投资决策?——数据才是真正的风向标
大数据如何影响新兴市场投资决策?——数据才是真正的风向标
173 3
|
8月前
|
数据采集 分布式计算 DataWorks
ODPS在某公共数据项目上的实践
本项目基于公共数据定义及ODPS与DataWorks技术,构建一体化智能化数据平台,涵盖数据目录、归集、治理、共享与开放六大目标。通过十大子系统实现全流程管理,强化数据安全与流通,提升业务效率与决策能力,助力数字化改革。
283 4
|
8月前
|
分布式计算 DataWorks 数据处理
在数据浪潮中前行:记录一次我与ODPS的实践、思考与展望
本文详细介绍了在 AI 时代背景下,如何利用阿里云 ODPS 平台(尤其是 MaxCompute)进行分布式多模态数据处理的实践过程。内容涵盖技术架构解析、完整操作流程、实际部署步骤以及未来发展方向,同时结合 CSDN 博文深入探讨了多模态数据处理的技术挑战与创新路径,为企业提供高效、低成本的大规模数据处理方案。
405 3
|
8月前
|
SQL 人工智能 分布式计算
ODPS:数据浪潮中的成长与突围
本文讲述了作者在大数据浪潮中,通过引入阿里云ODPS体系(包括MaxCompute、DataWorks、Hologres)解决数据处理瓶颈、实现业务突破与个人成长的故事。从被海量数据困扰到构建“离线+实时”数据架构,ODPS不仅提升了数据处理效率,更推动了技术能力与业务影响力的双重跃迁。