大数据测试投入生产不会取代Vertica系统

简介:

在新建了四十个服务器之后,TurboTax IT专家发现了基于Vertica大数据搜索时代的漏洞,此时纳税期限也快到了。

当TurboTax数据专家开始注意到Vertica成为征税公司全新的服务器时,离美国税收的最后期限4月15日只剩几周的时间。

就在几个月前,Intuit公司的母公司TutboTax进行集群升级。企业从16戴尔服务器到40作为计划的一部分,将惠普 Vertica大数据分析平台投入生产。

所有公司的业务大多集中在税收季的三个月内,大约一半发生在10天里,这段时间客户会申请填写所得税申报单。

“不确定是输是赢,这是我们最大的挑战,”税收集团的首席数据科学家Massimo Mascaro说。

Vertica公司拥有190名活跃用户,每天有65000个问题。Inuit使用数据来获悉询问用户报税的相关问题。例如,它可以帮助解决退休人员不会问及的学校贷款年轻人不会问及他们的退休收入问题。

“问到这些问题时,会有很多统计推断正在进行,”Mascaro说。

TurboTax还可以预测纳税人是否应该详细列出他们的税收。公司预计这项功能节省了纳税人每年累计200万小时的时间。

去年,TurboTax用16服务器集群运行Vertica作为备份系统,计划进入2015年报税季节生产之前启用40服务器。2014年4月,公司用16个节点进行了一次季度测试,仅有几个生产查询系统利用它来运行,之后的12月份,就开始利用40个节点。

每个节点由一个机架单元的戴尔PowerEdge R620以及两个机架单元的戴尔PowerVault MD1220连接的存储设备组成。

此举仿佛是直觉中的咒语:“在防火测试和防火设施完善之前,是不会投入生产的”。

为了顺利过渡,惠普团队建议TurboTax在相同配置的硬件上运行Vertica来进行生产。新机器与之前的机器应该拥有一样的配置,Mascaro说。

但在今年3月,TurboTax员工发现Vertica的查询时间开始大幅飙升。

临近公司所谓的“第二高峰”——每年税务申报的第二次高峰期,最后一次在4月15日的最后期限之前。TurboTax开始担心,并希望得到惠普的支持。

惠普服务器做了全面分析,发现BIOS在某些机器中的配置不尽相同。48小时后,问题得到了解决,查询时间减少了80%。

“硬件是相同的,但BIOS的配置弄错了,”Mascaro说,“当生产量很大时,Vertica会变得紊乱。”

Intuit员工根本不知道这是一个硬件问题,后来他们才发现已经经历了最严重“性能危机”,Mascaro补充道。

“它看起来很正常,”Mascaro说,“我们可能需要独立地花一段时间把它搞清楚,我们会错过了我们的第二个高峰。”

大数据测试到生产问题

TurboTax遭遇的是从测试到生产过程可能出现众多问题中的一种,专门针对大数据项目和其他需要实时交互性能的应用程序,分析师Mike Matchett说。

在大型服务器环境中投入生产,创造了许多针对服务器配置问题的机会。例如,由于线程的约束,应用程序可能不会利用所有可用的内核和插槽进行适当地自动调整。投入生产也可能产生一些长时间运行的程序,根据低效的共享CPU内存和缓存一致性的理念,这些程序应固定在一个给定的插槽或内核中以避免不稳定。

从测试到生产可能还表明,生产中应用程序的可用内存并非以往认识的那样,也不像在测试中那样会得到最佳配置或分配。

其他IT人员应注意过渡中访问路径的变化,如用户ID和权限,Matchett说。此外,测试环境通常不在其他系统或分批处理的工作负载进行测试,所以服务器管理可以影响处于生产阶段的应用。

担任BMC软件公司UNIX首席性能顾问期间,Matchett始终致力于解决这些问题。

“关于配置错误的问题真是不胜枚举,几本书都写不完。”Matchett说。

原文发布时间为:2015年09月30日
本文来自云栖社区合作伙伴至顶网,了解相关信息可以关注至顶网。
相关实践学习
简单用户画像分析
本场景主要介绍基于海量日志数据进行简单用户画像分析为背景,如何通过使用DataWorks完成数据采集 、加工数据、配置数据质量监控和数据可视化展现等任务。
SaaS 模式云数据仓库必修课
本课程由阿里云开发者社区和阿里云大数据团队共同出品,是SaaS模式云原生数据仓库领导者MaxCompute核心课程。本课程由阿里云资深产品和技术专家们从概念到方法,从场景到实践,体系化的将阿里巴巴飞天大数据平台10多年的经过验证的方法与实践深入浅出的讲给开发者们。帮助大数据开发者快速了解并掌握SaaS模式的云原生的数据仓库,助力开发者学习了解先进的技术栈,并能在实际业务中敏捷的进行大数据分析,赋能企业业务。 通过本课程可以了解SaaS模式云原生数据仓库领导者MaxCompute核心功能及典型适用场景,可应用MaxCompute实现数仓搭建,快速进行大数据分析。适合大数据工程师、大数据分析师 大量数据需要处理、存储和管理,需要搭建数据仓库?学它! 没有足够人员和经验来运维大数据平台,不想自建IDC买机器,需要免运维的大数据平台?会SQL就等于会大数据?学它! 想知道大数据用得对不对,想用更少的钱得到持续演进的数仓能力?获得极致弹性的计算资源和更好的性能,以及持续保护数据安全的生产环境?学它! 想要获得灵活的分析能力,快速洞察数据规律特征?想要兼得数据湖的灵活性与数据仓库的成长性?学它! 出品人:阿里云大数据产品及研发团队专家 产品 MaxCompute 官网 https://www.aliyun.com/product/odps 
目录
相关文章
|
3月前
|
Ubuntu 测试技术 Linux
软件测试/测试开发|Ubuntu系统常用文件管理命令详解
软件测试/测试开发|Ubuntu系统常用文件管理命令详解
22 1
|
1月前
|
监控 物联网 大数据
智慧工地管理平台系统源码基于物联网、云计算、大数据等技术
智慧工地平台APP通过对施工过程人机料法环的全面感知、互联互通、智能协同,提高施工现场的生产效率、管理水平和决策能力,实现施工管理的数字化、智能化、精益化。
28 0
|
2月前
|
分布式计算 大数据 Hadoop
如何对大数据应用进行性能测试
如何对大数据应用进行性能测试
|
2月前
|
人工智能 自然语言处理 大数据
AI大数据智能导诊系统源码 Springboot框架
智能导诊系统是在医院中使用的引导患者自助就诊挂号,在就诊的过程中有许多患者不知道需要挂什么号,要看什么病,通过智慧导诊系统,可输入自身疾病的症状表现,或选择身体部位,再经由智能导诊系统多维度计算,AI智能引擎分析、准确推荐科室,引导患者挂号就诊,实现科学就诊,不用担心挂错号。
35 0
|
2月前
|
存储 分布式计算 大数据
【大数据分布并行处理】单元测试(八)
【大数据分布并行处理】单元测试(八)
46 1
|
2月前
|
SQL 分布式计算 HIVE
【大数据分布并行处理】单元测试(九)
【大数据分布并行处理】单元测试(九)
27 0
|
2月前
|
监控 Java 测试技术
基于springboot实现的个人性格测试系统(分前后端)
基于springboot实现的个人性格测试系统(分前后端)
|
3月前
|
SQL 数据可视化 关系型数据库
【大数据实训】基于Hive的北京市天气系统分析报告(二)
【大数据实训】基于Hive的北京市天气系统分析报告(二)
36 1
|
3月前
|
Oracle 关系型数据库 大数据
助力工业物联网,工业大数据之服务域:Shell调度测试【三十三】
助力工业物联网,工业大数据之服务域:Shell调度测试【三十三】
17 1
|
3月前
|
SQL Oracle 关系型数据库
助力工业物联网,工业大数据之ODS层构建:申明分区代码及测试【十】
助力工业物联网,工业大数据之ODS层构建:申明分区代码及测试【十】
24 0