非互联网与互联网数据平台的差异

简介: 本文对比传统企业与互联网数据平台的演进差异:用户、角色、技术栈与数据源迥异;梳理了1991—2011年传统五阶段四种架构及Inmon/Kimball模型思想;并解析互联网平台三阶段演进——从Hadoop引入、数据产品化到全员用数,伴随治理挑战升级。

我从2000年接触数据仓库,2008年进入互联网行业。不少从传统企业转来的同学都有同感:两类数据平台面向的用户群体明显不同。
非互联网数据平台的用户主要是老板和运营,依赖报表和BI分析师做分析挖掘;支撑者是ETL工程师、数据建模师、数据架构师和报表设计人员,他们同时是平台的建设方与使用方;技术框架由技术架构师、Java开发实现。数据源以结构化生产系统为主。
互联网数据平台则不同。员工更年轻、受教育程度更高,对计算机焦虑更低。平台由技术、数据产品推进建设,分析师直接参与建设的比重增加,原有数据仓库开发与模型架构师职能从建设转为服务与咨询。数据源更多样,包括日志、生产数据库数据、视频、音频等非结构化数据。
从发展历程看,非互联网时代大致经历五个阶段、四种架构:1991年前的全企业集成、1991年后的EDW时代、1994—1996年的数据集市、1996—1997年的架构之争、1998—2001年的合并年代。第一代架构以海尔BI项目为代表,ETL使用微软DTS;第二代以上海通用汽车为代表,采用准三范式建模,涉及十几种数据源,计划三年建成;此外还有银行数据集市、太平洋保险混合架构,以及2011年提出的OPDM操作型数据集市。
数据模型是平台建设的导航图,分概念、逻辑、物理三层。Inmon的EDW面向事务处理与数据管理,坚持最细粒度、保存历史;Kimball的DM面向分析过程,用星型、雪花模型提升查询性能。
互联网时代,数据平台服务方式大致经历三个阶段。2008—2011年,建设方式与非互联网相似,淘宝从2004年单节点起步,2010年引入Hadoop与Hive,模型采用退化、扁平化设计。2011—2014年,数据产品与数据产品经理兴起,平台分为面向用户的业务级产品和面向平台的工具型产品,部分ETL转换前置到业务系统。2014年后,用数据的角色直接参与数据整理与分析,平台全面开放,但也带来数据质量、重复存储、口径多样等问题,原有建设角色转向培训、咨询与落地支持。

相关文章
|
3天前
|
人工智能 弹性计算 自然语言处理
00后第一单77元,7年做到年入200万:AI云服务“卖铲人“OPC案例深度拆解
本文是「OPC一人公司通关手册」第27篇,拆解一位00后AI“卖铲人”真实路径:7年从77元首单做到年入近200万。他不挖金子,专为企业提供AI智能客服+云服务器一站式交付服务,以内容建立信任、借社区基础设施提效。核心启示:AI时代最稳的生意,是卖刚需工具,而非追风口产品。(239字)
|
10天前
|
数据采集 文字识别 数据可视化
数据可视化开发的七个实践要点
本文总结ClearStoryData提出的7大数据可视化实践要点:直面“脏数据”、优先选用柱状图、用真实数据测试、预留细节设计空间、慎用动画、区分可视化与统计分析、融合设计与技术。兼顾实用性与专业性。
|
22小时前
|
存储
四个 MCP 工具,30 秒验证一份密码学证据——iqa-mcp 上手
别信文档——把向量跑一遍。本文带你 30 秒跑通 iqa-mcp(PyPI/npm/crates 三注册表 1.0.1):published_vector 拿公开向量 → parse_envelope 结构解码 → verify_envelope 得 [PASS] → 翻一个字节得 REJECT。四个 MCP 工具,任何 MCP 兼容客户端可直接调用,无状态、离线、fail-closed。
42 1
四个 MCP 工具,30 秒验证一份密码学证据——iqa-mcp 上手
|
3天前
|
存储 人工智能 运维
阿里云轻量应用服务器是什么?轻量指南、优势、支持镜像、收费标准及使用限制说明
阿里云轻量应用服务器是面向建站、开发测试及小型AI应用的轻量级云服务器,支持一键部署、应用镜像(如宝塔、Dify)、HTTPS和Web SSH,2核2G起仅38元/年起,操作简单、成本透明、开箱即用。(239字)
|
3天前
|
人工智能
别只让AI解释,让它做个你能看懂的东西
大家对齐一下。做产品的人,对这句话应该不陌生。可嘴上都说懂了,脑子里的画面未必是同一张。
|
3天前
|
存储 人工智能 运维
阿里云轻量应用服务器是什么?新手指南:轻量优势、收费价格、限制及使用FAQ
阿里云轻量应用服务器是面向建站、开发测试及小型AI应用的轻量级云服务器,支持一键部署、应用镜像与HTTPS加密,2核2G起年付仅38元,适合低负载、突发型业务场景。
|
18天前
|
数据采集 数据管理 BI
业务系统上线前还是上线后?MDM实施时机的权衡
企业实施ERP/CRM/SRM时,MDM宜前置部署。原因有三:统一规范数据模型与编码;借助专业工具高效清洗主数据,保障上线质量;支撑期初数据自动导入与后续分发。若后置实施,则需重复治理、映射冗余,影响业务准确性与效率。
|
10天前
|
存储 监控 安全
大数据安全挑战升级:从隐私保护到信任构建
全球数据爆发式增长,80%为非结构化数据,传统安全防护失效。各行业需求各异:互联网重隐私、金融重风控、医疗重保密、政府重监管。当前面临移动安全、隐私泄露、存储隐患等六大挑战,亟需重构覆盖网络、数据、灾备、治理的全栈大数据安全架构。
|
1天前
|
存储 数据处理 iOS开发
【模拟键盘输入MacOS版】按fn + F9 工具就会像“有个隐形人在帮你打字“一样,把内容一个字一个字敲进光标位置
PasteTyper 是 macOS 菜单栏小工具,专治“无法粘贴”场景(如远程桌面、虚拟机、游戏聊天框)。按快捷键(默认 fn+F9),它将剪贴板内容逐字模拟键盘输入,支持中英文、符号、emoji及换行,完全离线、不联网、不泄露隐私。(239字)
48 0
|
23小时前
|
存储 缓存 分布式计算
Parquet、Lance、Vortex 争的,其实是一张行号到字节的映射表。
本文剖析Parquet、Lance与Vortex三种列存格式在随机访问(如按行号点查、随机采样)上的根本差异:Parquet为顺序扫描优化,页不可分导致“取一行读一整页”;Lance取消行组,引入细粒度迷你块索引,实现字节级定位;Vortex采用可配置布局树与多级裁剪,平衡灵活性与性能。三者之争,实为“行号→字节位置”映射精度与加载成本的博弈。(239字)
32 1

热门文章

最新文章