hadoop cascading demo-阿里云开发者社区

hadoop cascading demo

2017-12-07 911

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

Java 代码：

package com.xunjie.dmsp.olduser;

import java.util.Properties;

import cascading.flow.Flow;
import cascading.flow.FlowConnector;
import cascading.operation.regex.RegexSplitter;
import cascading.pipe.Each;
import cascading.pipe.Pipe;
import cascading.scheme.TextLine;
import cascading.tap.Hfs;
import cascading.tap.Tap;
import cascading.tuple.Fields;

/**
* test.txt：
* 1    a
* 2    b
* 3    c
*
* /data/hadoop/hadoop/bin/hadoop jar
*         dmsp_test_jar-1.0-SNAPSHOT-dependencies.jar
*             hdfs:/user/hadoop/test/lky/test.txt
*             file:///data/hadoop/test/lky/output
*/
public class Test2 {
     public static void main(String[] args) {

         // 设定输入文件
        String sourcePath = args[ 0 ];
         // 设置输出文件夹
        String sinkPath = args[ 1 ];

         // 定义读取列
        Fields inputfields = new Fields( " num " , " value " );
         // 定义分解正则，默认 \t
        RegexSplitter spliter = new RegexSplitter(inputfields);


         // 管道定义
        Pipe p1 = new Pipe( " test " );
         // 管道嵌套：
         // 分解日志源文件，输出给定字段
        p1 = new Each(p1, new Fields( " line " ) ,spliter);


         // 设定输入和输出，使用泛型Hfs
        Tap source = new Hfs( new TextLine(),  sourcePath );
        Tap sink = new Hfs( new TextLine() , sinkPath );



         // 配置job
        Properties properties = new Properties();
        properties.setProperty( " hadoop.job.ugi " , " hadoop,hadoop " );

        FlowConnector.setApplicationJarClass( properties, Main. class );
        FlowConnector flowConnector = new FlowConnector(properties);

        Flow importFlow = flowConnector.connect( " import flow " , source,sink,p1);

        importFlow.start();
        importFlow.complete();


    }
}

本文转自博客园刘凯毅的博客，原文链接：hadoop cascading demo，如需转载请自行联系原博主。

hadoop cascading demo

热门文章

最新文章

相关课程

相关电子书

相关实验场景

热门

活动广场

任务中心

开发者评测

高校计划

乘风者计划

训练营

阿里云MVP

话题

直播

下载

镜像站

技术资料

插件

hadoop cascading demo

热门文章

最新文章

相关课程

相关电子书

相关实验场景