《深入解析sas:数据处理、分析优化与商业应用》一一2.3 通过IMPORT过程读取外部文件数据

本文涉及的产品
公共DNS(含HTTPDNS解析),每月1000万次HTTP解析
云解析 DNS,旗舰版 1个月
全局流量管理 GTM,标准版 1个月
简介: 本节书摘来自华章出版社《高并发Oracle数据库系统的架构与设计》一书中的第2章,第2.3节,作者 侯松,更多章节内容可以访问云栖社区“华章计算机”公众号查看 2.3 通过IMPORT过程读取外部文件数据 除了可以通过DATA步读取外部文本文件数据外,SAS还提供了IMPORT过程,通过它可以从外部数据源读取数据并写入SAS数据集中。

本节书摘来自华章出版社《深入解析sas:数据处理、分析优化与商业应用》一书中的第2章,第2.3节,作者 夏坤庄 徐唯 潘红莲 林建伟,更多章节内容可以访问云栖社区“华章计算机”公众号查看

2.3 通过IMPORT过程读取外部文件数据

除了可以通过DATA步读取外部文本文件数据外,SAS还提供了IMPORT过程,通过它可以从外部数据源读取数据并写入SAS数据集中。而且,如果使用SAS/ACCESS to PC Files,IMPORT过程除了可以导入带分隔符的文件外,还可以读取PC文件中的外部数据,包括Microsoft Access数据库文件、Miscrosft Excel工作簿、Lotus 1-2-3文件、dBase文件、JMP文件、SPSS文件、Stata文件、Paradox等。SAS变量的定义根据输入记录确定。
在SAS窗口环境选择菜单“文件”“导入数据”,可以打开“导入”窗口,通过“导入向导”可读取上述类型的数据。导入过程所生成的SAS语句也可以保存起来供以后使用。
对应于IMPORT过程和SAS窗口环境的IMPORT向导,SAS还提供了EXPORT过程和EXPORT向导(选择菜单“文件”“导出数据”),以便将SAS数据集中的数据导出到上述类型的文件。对此这里不做讲解,有兴趣的读者可以通过SAS帮助文档学习。
IMPORT过程的导入数据的基本形式如下:

PROC IMPORT
    DATAFILE=文件名|文件引用 | DATATABLE=表名
    DBMS=数据源标识符
    OUT=数据集名称;
RUN;

其中:
DATAFILE=指定输入文件的完整路径和文件名,或文件引用。文件引用通常通过FILENAME语句指定。
DATATABLE=指定输入DBMS表名。数据源可以通过DATAFILE或DATATABLE指定。
DBMS=指定要导入的数据类型。SAS支持多种数据类型,例如CSV、TAB、ACCESS、XLSX、XLS、EXCEL、JMP、DTA、SPASS等。其中CSV、TAB表示要导入的数据文件分别由逗号和tab符号分隔,ACCESS表示使用LIBNAME语句的Miscrosoft Access表,XLSX表示Micorsoft Excel 2007或2010的工作簿,等等。可参考SAS帮助文档了解关于导入数据类型和各类型的详细信息。
OUT=指定输出的数据集名称。该语句后面还可以添加数据集选项。
下面给出了几个例子,分别讲解通过IMPORT过程导入CSV文件、Microsoft Excel工作簿和Microsoft Access数据库文件中的数据。
1.?读取CSV文件
外部文件contact.csv的内容如下,文件第一行给出了各个数据行中数据值字段的名称,后面的各行则为对应的字段值。

Name,Age,Position,Marriage,Address
Greg William,42,Manager,Single,"14 Bridge St. San Francisco, CA"
Emily Cooker,33,Sales,Married,"42 Rue Marston"
Henry Cooper,,Office,Married,"52 Rue Marston Paris"
Jimmy Cruze,34,Manager,Single,"Box 100 Cary, NC"

使用IMPORT过程导入该文件的代码如下:

proc import out=saslib.contact
    datafile="c:\sas\data\contact.csv"
    dbms=csv replace;
    getnames=yes;
    datarow=2;
run;

proc print data=saslib.contact noobs;
run;

所生成的数据集为saslib逻辑库中的contact数据集,数据文件为c:sasdatacontact.csv,选项DBMS=指定数据库类型为csv。其中文件扩展名可以省略,SAS会根据DBMS=选项指定的据库类型自动加上。
代码中还使用了REPLACE选项,表示当OUT=指定的数据集存在时覆盖该数据集。GETNAMES语句表示是否从该文件中的第一行读取变量值,默认为YES,表示读取;值为NO表示不读取,这时IMPORT过程会自动产生名为F1、F2、F3等的变量。
DATAROW=语句也会经常使用,用于指定IMPORT语句开始读数据的行号。默认情况下,当GETNAMES=NO时,DATAROW=1,当GETNAMES=YES时,DATAROW=2。该选项用于跳过数据文件开始处的多行内容。
PRINT过程打印的数据集内容如图2.47所示。
image

2.?读取Miscosoft Excel工作簿
IMPORT过程可以导入Microsoft Excel工作簿中的数据。在Excel 2007中文件的工作簿pag的内容如图2.48所示。在该图中,共包含了A~E共5列,第一行为字段名称,从第二行开始为数据值。

image

下面使用IMPORT过程读入该工作簿的指定区域。

proc import out=saslib.contact
    datafile="c:\sas\data\contact.xlsx"
    dbms=xlsx replace;
    range='pag$A1:E5'n;
run;

proc print data=saslib.contact noobs;
run;

IMPORT过程中可以使用RANGE=语句指定所导入的区域。在使用IMPORT过程处理工作簿的数据之前,可先通过Microsoft Excel的“名称管理器”定义要处理的数据的区域,在IMPORT过程中,使用RANGE=语句指定该数据区域的名称,或直接在RANGE=语句中指定数据区域。本例中为直接指定,区域为工作簿pag中从A1到E5的矩形区域。PRINT过程打印的数据集的内容如图2.49所示。
image

1)DBMS=XLSX可以处理Microsoft Excel 2007或Microsoft Excel 2010的工作簿。对于其他更早版本的Microsoft Excel生成的工作簿,需使用其他类型,例如XLS、EXCEL4、EXCEL5。
2)还可使用EXCEL数据库类型EXELCS,并通过SAS PC文件服务器来读取相应版本的Excel工作簿。
3)也可以直接使用LIBNAME语句,通过SAS/ACCESS EXCEL引擎来访问Excel工作簿。
具体请参考SAS帮助文档。
通过DBMS=XLS或DBMS=XLSX来读取Excel文件中的数据还有一个好处,即可以直接在UNIX环境下读取Excel工作簿中的数据,不需要访问PC文件服务器。
3.?读取Microsoft Access数据库文件
Microsoft Access是一个桌面关系型数据库系统,通常使用Microsoft ACE引擎(.accdb文件格式)或Microsoft Jet引擎(.mdb文件格式)。在IMPORT过程中指定DBMS为ACCESS,SAS可以读取在Microsoft Access 97、Microsoft Access 2000、Microsoft Access 2003、Microsoft Access 2007和Microsoft Access 2010中的文件。例如:

proc import out=saslib.customer
    datatable='customer'
    dbms=access replace;
    database="c:\sas\data\customer.accdb";
RUN;

在IMPORT过程中使用access数据库类型,实际使用的是SAS/ACCESS LIBNAME引擎。也可以直接使用LIBNAME语句通过SAS/ACCESS ACCESS引擎来访问Microsoft Access数据库文件。这里不做介绍,有兴趣的读者可参考SAS帮助获取更新信息。

相关文章
|
21天前
|
机器学习/深度学习 文字识别 监控
安全监控系统:技术架构与应用解析
该系统采用模块化设计,集成了行为识别、视频监控、人脸识别、危险区域检测、异常事件检测、日志追溯及消息推送等功能,并可选配OCR识别模块。基于深度学习与开源技术栈(如TensorFlow、OpenCV),系统具备高精度、低延迟特点,支持实时分析儿童行为、监测危险区域、识别异常事件,并将结果推送给教师或家长。同时兼容主流硬件,支持本地化推理与分布式处理,确保可靠性与扩展性,为幼儿园安全管理提供全面解决方案。
|
1月前
|
弹性计算 运维 安全
优化管理与服务:操作系统控制平台的订阅功能解析
本文介绍了如何通过操作系统控制平台提升系统效率,优化资源利用。首先,通过阿里云官方平台开通服务并安装SysOM组件,体验操作系统控制平台的功能。接着,详细讲解了订阅管理功能,包括创建订阅、查看和管理ECS实例的私有YUM仓库权限。订阅私有YUM仓库能够集中管理软件包版本、提升安全性,并提供灵活的配置选项。最后总结指出,使用阿里云的订阅和私有YUM仓库功能,可以提高系统可靠性和运维效率,确保业务顺畅运行。
|
29天前
|
人工智能 API 开发者
HarmonyOS Next~鸿蒙应用框架开发实战:Ability Kit与Accessibility Kit深度解析
本书深入解析HarmonyOS应用框架开发,聚焦Ability Kit与Accessibility Kit两大核心组件。Ability Kit通过FA/PA双引擎架构实现跨设备协同,支持分布式能力开发;Accessibility Kit提供无障碍服务构建方案,优化用户体验。内容涵盖设计理念、实践案例、调试优化及未来演进方向,助力开发者打造高效、包容的分布式应用,体现HarmonyOS生态价值。
89 27
|
1月前
|
机器学习/深度学习 人工智能 JSON
Resume Matcher:增加面试机会!开源AI简历优化工具,一键解析简历和职位描述并优化
Resume Matcher 是一款开源AI简历优化工具,通过解析简历和职位描述,提取关键词并计算文本相似性,帮助求职者优化简历内容,提升通过自动化筛选系统(ATS)的概率,增加面试机会。
146 18
Resume Matcher:增加面试机会!开源AI简历优化工具,一键解析简历和职位描述并优化
|
1月前
|
数据采集 前端开发 JavaScript
金融数据分析:解析JavaScript渲染的隐藏表格
本文详解了如何使用Python与Selenium结合代理IP技术,从金融网站(如东方财富网)抓取由JavaScript渲染的隐藏表格数据。内容涵盖环境搭建、代理配置、模拟用户行为、数据解析与分析等关键步骤。通过设置Cookie和User-Agent,突破反爬机制;借助Selenium等待页面渲染,精准定位动态数据。同时,提供了常见错误解决方案及延伸练习,帮助读者掌握金融数据采集的核心技能,为投资决策提供支持。注意规避动态加载、代理验证及元素定位等潜在陷阱,确保数据抓取高效稳定。
70 17
|
1月前
|
数据采集 JSON 数据可视化
JSON数据解析实战:从嵌套结构到结构化表格
在信息爆炸的时代,从杂乱数据中提取精准知识图谱是数据侦探的挑战。本文以Google Scholar为例,解析嵌套JSON数据,提取文献信息并转换为结构化表格,通过Graphviz制作技术关系图谱,揭示文献间的隐秘联系。代码涵盖代理IP、请求头设置、JSON解析及可视化,提供完整实战案例。
167 4
JSON数据解析实战:从嵌套结构到结构化表格
|
1月前
|
供应链 项目管理 容器
深入探索 BPMN、CMMN 和 DMN:从定义到应用的全方位解析
在当今快速变化的商业环境中,对象管理组织(OMG)推出了三种强大的建模标准:BPMN(业务流程模型和符号)、CMMN(案例管理模型和符号)和DMN(决策模型和符号)。它们分别适用于结构化流程管理、动态案例处理和规则驱动的决策制定,并能相互协作,覆盖更广泛的业务场景。BPMN通过直观符号绘制固定流程;CMMN灵活管理不确定的案例;DMN以表格形式定义清晰的决策规则。三者结合可优化企业效率与灵活性。 [阅读更多](https://example.com/blog)
深入探索 BPMN、CMMN 和 DMN:从定义到应用的全方位解析
|
28天前
|
存储 弹性计算 安全
阿里云服务器ECS通用型规格族解析:实例规格、性能基准与场景化应用指南
作为ECS产品矩阵中的核心序列,通用型规格族以均衡的计算、内存、网络和存储性能著称,覆盖从基础应用到高性能计算的广泛场景。通用型规格族属于独享型云服务器,实例采用固定CPU调度模式,实例的每个CPU绑定到一个物理CPU超线程,实例间无CPU资源争抢,实例计算性能稳定且有严格的SLA保证,在性能上会更加稳定,高负载情况下也不会出现资源争夺现象。本文将深度解析阿里云ECS通用型规格族的技术架构、实例规格特性、最新价格政策及典型应用场景,为云计算选型提供参考。
|
30天前
|
数据采集 机器学习/深度学习 存储
可穿戴设备如何重塑医疗健康:技术解析与应用实战
可穿戴设备如何重塑医疗健康:技术解析与应用实战
73 4
|
1月前
|
JSON 监控 网络协议
Bilibili直播信息流:连接方法与数据解析
本文详细介绍了自行实现B站直播WebSocket连接的完整流程。解析了基于WebSocket的应用层协议结构,涵盖认证包构建、心跳机制维护及数据包解析步骤,为开发者定制直播数据监控提供了完整技术方案。

推荐镜像

更多