大数据应用之双色球算奖平台总体设计大纲篇一

本文涉及的产品
云原生大数据计算服务MaxCompute,500CU*H 100GB 3个月
云原生大数据计算服务 MaxCompute,5000CU*H 100GB 3个月
简介: 大数据应用之双色球算奖平台总体设计大纲篇一 作者:张子良 版权所有,转载请注明出处 引子:双色球延期开奖,你Hold住了吗   福利彩票走进百姓生活,每期的500w大奖吸引了千万彩民的眼球和关注,备受争议的双色球延期开奖也成了争议的焦点,成为继12306之后,又一个站在风口浪尖的悲催儿。

大数据应用之双色球算奖平台总体设计大纲篇一

作者:张子良

版权所有,转载请注明出处

引子:双色球延期开奖,你Hold住了吗

  福利彩票走进百姓生活,每期的500w大奖吸引了千万彩民的眼球和关注,备受争议的双色球延期开奖也成了争议的焦点,成为继12306之后,又一个站在风口浪尖的悲催儿。黑幕说,红会说,各种说甚嚣尘上。IT人只做技术事,至于类似美美卡里究竟几个零,一套内衣值几多银子的问题,还是交给干爹们去撕扯吧。当然福彩中心是不是红会,还是交给时间来证明吧。

一 概述

  本文作者试图从纯技术的角度解决双色球延迟开奖的问题,不考虑其他因素,用最新的云计算技术建立一套海量数据处理的技术解决方案。同时考虑到把这种想法付诸实践,搞一个开源海量数据处理平台,以双色球算奖问题,作为一个业务应用案例,指引我们前进的方向。本文是这一解决方案的第一篇,目的在于把整个平台当前面临的技术问题和未来发展方向做一个纲领性的界定,考虑到一个人的能力毕竟是有限的,群众的力量是无穷,本文仅定位于抛砖引玉,希望能够得到各位技术同行的支持和关注,让大家一起来共同完成整个解决方案的设计。开源社区的兄弟们,顶一个吧。

二 纲要

  1. 数据规模评估篇
    根据双色球历史销量数据,评估存储双色球历史购彩数据所需要的数据规模,按照全部存储、一年期存储、单期存储规模进行估算。
  2. 历史数据存储篇
    根据双色球历史投注数据(每一注的选号明细),按照存储时间的长短,评估存储双色球历史投注明细数据所需要的存储容量。根据其业务特点和存储容量,探讨实际采用的存储方案,是文件存储,还是数据库存储,亦或者是其他的存储方案。针对当前期算奖需要,评估存储该规模下的,该类型的数据所需要的内存空间或硬盘空间。
  3. 实时数据算奖篇
    面对2~3亿注的数据量级,7个数据项,6个中奖级别的设置,我们需要采用什么样的存储方式,存储待算奖期次的投注明细;我们需要采用什么样的算法,算法的时间复杂度和空间复杂度如何?计算一期中奖数据需要的时间和空间是多少?给出分省中奖统计数据的时间又是多少?
  4. 开奖算奖算法篇
    因为数据量级的问题,每一期的投注规模在2~3亿注之间,这样一个计算规模的数据量级,加上奖项级别的设置,算法的时间复杂度要求还是很高的。在这一篇需要针对当前的数据规模,给出一个优化的算法,并能够给出按照该算法进行,特定的硬件配置环境下,需要的计算时间和计算频次。以及相关算法的设计原理和规则。
  5. 数据分析BI篇
    关于历史投注明细数据的应用,商业价值的提炼和数据分析,目前还没有明确的概念,期望参与的园友能够给出答案。其一,数据可以用来做什么?其二 数据应该怎么来用?其三 这些应用将会带来什么样的商业价值。

以上内容仅为作者一人之浅见,算是从业务划分的角度,将要解决的问题,进行了一次分类。遗漏部分,需要各位园子里的兄弟指正完善,谢谢各位了。至于每一部分的内容结构暂时还没有具体的东西出来,待完善总体大纲后,再单独征询各位的意见和建议。

三 招募

    考虑到解决方案的设计和开源平台的开发,特征集对本项目感兴趣并在并行计算和大数据处理方向有独到见解的同仁参与进来。让大家为大数据的应用技术共同努力,在实践中进步,在进步中成熟。建了一个技术交流QQ群,群号:307807112

 

彩票算奖只是一个引子,真正要做的是海量数据的计算和分析,欢迎拍砖,感兴趣的话,请给个推荐,并畅所欲言。

 


作者:张子良
出处:http://www.cnblogs.com/hadoopdev
本文版权归作者所有,欢迎转载,但未经作者同意必须保留此段声明,且在文章页面明显位置给出原文连接,否则保留追究法律责任的权利。

相关实践学习
基于MaxCompute的热门话题分析
本实验围绕社交用户发布的文章做了详尽的分析,通过分析能得到用户群体年龄分布,性别分布,地理位置分布,以及热门话题的热度。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
相关文章
|
4月前
|
SQL 存储 分布式计算
ODPS技术架构深度剖析与实战指南——从零开始掌握阿里巴巴大数据处理平台的核心要义与应用技巧
【10月更文挑战第9天】ODPS是阿里巴巴推出的大数据处理平台,支持海量数据的存储与计算,适用于数据仓库、数据挖掘等场景。其核心组件涵盖数据存储、计算引擎、任务调度、资源管理和用户界面,确保数据处理的稳定、安全与高效。通过创建项目、上传数据、编写SQL或MapReduce程序,用户可轻松完成复杂的数据处理任务。示例展示了如何使用ODPS SQL查询每个用户的最早登录时间。
293 1
|
2月前
|
SQL 人工智能 自然语言处理
DataWorks年度发布:智能化湖仓一体数据开发与治理平台的演进
阿里云在过去15年中持续为268集团提供数据服务,积累了丰富的实践经验,并连续三年在IDC中国数据治理市场份额中排名第一。新一代智能数据开发平台DateWorks推出了全新的DateStudio IDE,支持湖仓一体化开发,新增Flink计算引擎和全面适配locs,优化工作流程系统和数据目录管理。同时,阿里云正式推出个人开发环境模式和个人Notebook,提升开发者体验和效率。此外,DateWorks Copilot通过自然语言生成SQL、代码补全等功能,显著提升了数据开发与分析的效率,已累计帮助开发者生成超过3200万行代码。
|
3月前
|
SQL 数据采集 分布式计算
【赵渝强老师】基于大数据组件的平台架构
本文介绍了大数据平台的总体架构及各层的功能。大数据平台架构分为五层:数据源层、数据采集层、大数据平台层、数据仓库层和应用层。其中,大数据平台层为核心,负责数据的存储和计算,支持离线和实时数据处理。数据仓库层则基于大数据平台构建数据模型,应用层则利用这些模型实现具体的应用场景。文中还提供了Lambda和Kappa架构的视频讲解。
400 3
【赵渝强老师】基于大数据组件的平台架构
|
2月前
|
机器学习/深度学习 人工智能 运维
智能化运维:AI与大数据在IT运维中的应用探索####
本文旨在探讨人工智能(AI)与大数据分析技术如何革新传统IT运维模式,提升运维效率与服务质量。通过具体案例分析,揭示AI算法在故障预测、异常检测及自动化修复等方面的实际应用成效,同时阐述大数据如何助力实现精准运维管理,降低运营成本,提升用户体验。文章还将简要讨论实施智能化运维面临的挑战与未来发展趋势,为IT管理者提供决策参考。 ####
|
3月前
|
机器学习/深度学习 存储 大数据
云计算与大数据技术的融合应用
云计算与大数据技术的融合应用
|
4月前
|
存储 分布式计算 druid
大数据-149 Apache Druid 基本介绍 技术特点 应用场景
大数据-149 Apache Druid 基本介绍 技术特点 应用场景
103 1
大数据-149 Apache Druid 基本介绍 技术特点 应用场景
|
4月前
|
机器学习/深度学习 监控 搜索推荐
电商平台如何精准抓住你的心?揭秘大数据背后的神秘推荐系统!
【10月更文挑战第12天】在信息爆炸时代,数据驱动决策成为企业优化决策的关键方法。本文以某大型电商平台的商品推荐系统为例,介绍其通过收集用户行为数据,经过预处理、特征工程、模型选择与训练、评估优化及部署监控等步骤,实现个性化商品推荐,提升用户体验和销售额的过程。
168 1
ly~
|
4月前
|
供应链 搜索推荐 安全
大数据模型的应用
大数据模型在多个领域均有广泛应用。在金融领域,它可用于风险评估与预测、智能营销及反欺诈检测,助力金融机构做出更加精准的决策;在医疗领域,大数据模型能够协助疾病诊断与预测、优化医疗资源管理和加速药物研发;在交通领域,该技术有助于交通流量预测、智能交通管理和物流管理,从而提升整体交通效率;电商领域则借助大数据模型实现商品推荐、库存管理和价格优化,增强用户体验与企业效益;此外,在能源和制造业中,大数据模型的应用范围涵盖从需求预测到设备故障预测等多个方面,全面推动了行业的智能化转型与升级。
ly~
472 2
ly~
|
4月前
|
供应链 搜索推荐 大数据
大数据在零售业中的应用
在零售业中,大数据通过分析顾客的购买记录、在线浏览习惯等数据,帮助零售商理解顾客行为并提供个性化服务。例如,分析网站点击路径以了解顾客兴趣,并利用历史购买数据开发智能推荐系统,提升销售和顾客满意度。此外,大数据还能优化库存管理,通过分析销售数据和市场需求,更准确地预测需求,减少库存积压和缺货现象,提高资金流动性。
ly~
678 2
|
27天前
|
SQL 数据可视化 大数据
从数据小白到大数据达人:一步步成为数据分析专家
从数据小白到大数据达人:一步步成为数据分析专家
210 92