Pig join用法举例

jnd = join a by f1, b by f2;

join操作默认的是内连接，只有两边都匹配才会保留

需要用null补位的那边需要知道它的模式：

如果是左外连接，需要知道右边的数据集的模式，不匹配的字段用null补位

如果是右外连接，需要知道左边的数据集的模式，不匹配的字段用null补位

如果是全外连接，需要知道两边的数据集的模式，不匹配的字段用null补位

触发reduce阶段

基本用法

a = load 'input1';

b = load 'input2';

jnd = join a by $0, b by $1;

多字段连接

a = load 'input1' as (username, age, city);

b = load 'input2' as (orderid, user, city);

jnd = join a by (username, city), b by (user, city);

:: join后的字段引用

a = load 'input1' as (username, age, address);

b = load 'input2' as (orderid, user, money;

jnd = join a by username, b by user;

result = foreach jnd generate a::username, a::age, address, b::orderid;

多数据集连接

a = load 'input1' as (username, age);

b = load 'input2' as (orderid, user);

c = load 'input3' as (user, acount);

jnd = join a by username, b by user, c by user;

外连接 仅限两个数据集

a = load 'input1' as (username, age);

b = load 'input2' as (orderid, user);

jnd = join a by username left outer, b by user;

jnd = join a by username right, b by user;

jnd = join a by username full, b by user;

自连接 需要加载自身数据集两次，使用不同的别名

a = load 'data' as (node, parentid, name);

b = load 'data' as (node, parentid, name);

jnd = join a by node, b by parentid;

Pig join用法举例的更多相关文章

Pig group用法举例
group语句可以把具有相同键值的数据聚合在一起,与SQL中的group操作有着本质的区别,在SQL中group by字句创建的组必须直接注入一个或多个聚合函数.在Pig Latin中grou ...
Pig load 用法举例
users = load '/users.data' using PigStorage() as (name:chararray, age:int, address:chararray); loa ...
Pig sample用法举例
some = sample data 0.1 遍历整个数据集,获取指定比例的行数的数据,获取的数据不确定,条数也不准确. 内部重写为filter data by random() <= ...
Pig limit用法举例
lmt = limit data 10; 只获取指定条数的数据,不能保证每次得到的结果一致,先执行order再limit可以保证一致. 输入数据全部载入. 会触发reduce阶段 a ...
Pig distinct用法举例
dst = distinct data: DISTINCT只能对整个记录(整行)去重,不能在字段级别去重. 触发reduce阶段 data = load 'data'; distinct ...
Pig store用法举例
store:将数据存储到HDFS等文件系统里将数据保存到/data目录 store data into '/data'; 以逗号为分隔符 store data into '/data' usin ...
Pig filter用法举例
filter:过滤数据,只有符合特定条件的数据才会被保留下来,然后进入下一个数据流. 1)等值比较 filter data by $0 == 1 filter data by $0 != 1 ...
Pig foreach用法举例
foreach:一行一行的遍历数据,处理一行的数据,然后返回一个tuple. users = load '/users.data'; 1)别名引用 f = foreach users genera ...
python join与split函数的用法举例
python join 和 split方法: join用来连接字符串,split恰好相反,拆分字符串的. 来看有关join.split方法的例子 1,join用法的例子复制代码代码示例: > ...

随机推荐

java验证码工具
工具类: package com.lhy.web.servlet; import java.awt.BasicStroke; import java.awt.Color; import java.aw ...
puppet的使用：安装puppet
最近项目要使用puppet,趁机赶紧学习下. 在家里的机器中搭建puppet环境,使用两台ubuntu 14.04: 准备工作时间同步两台设备先进行时间同步,我把要安装master的机器作为NTP ...
ruby：TypeError: 对象不支持此属性或方法（<%= stylesheet_link_tag 'application', media: 'all', 'data-turbolink）
我整理了一下目前有三种方法,我是windows 7 64位, 答案中很多人是win8也成功了. 方法1:找到当前项目下 app/javascripts/applications.js 把里面的// ...
MySQL的Sleep进程占用大量连接解决方法
第一部分为产生大量sleep进程的原理及对应解决方法第二部分为设置wait_timeout值,有效减少sleep进程 ========================================= ...
nginx 配置说明及优化
一.配置说明 1. worker_processes 8; nginx 进程数,建议按照cpu 数目来指定,一般为它的倍数 (如,2个四核的cpu计为8). 2. worker_cpu_affin ...
JS浮点数精确计算方法
function add(a, b) { var c, d, e; try { c = a.toString().split(".")[1].length; } catch (f) ...
svn合并分支到主干
将分支pear_For2.3的最终版本合并到主干pear,操作步骤如下:1.选中主干pear右击-> Team -> 合并,弹出如下所示: 到此分支合并到主干已完成,若代码有冲突需找到冲突 ...
lucene源码分析(4)Similarity相似度算法
lucene 7.5.0默认的评分Similarity是BM25Similarity (IndexSearcher.java) // the default Similarity private st ...
nginx 学习笔记(6) nginx配置文件中的度量单位
容量大小可以用比特(byte),千比特(kilobyte,后缀k或者K)或者兆(megabytes,后缀m或者M),例如:“1024”,“8k”,“1m”. 时间间隔可以用毫秒(millisecond ...
FSM有限状态机
1.什么是有限状态机有限状态机(Finite State Machine),简称FSM,它由一组有限个状态.输入和根据输入及现有状态转换为下一个状态的转换函数组成,当然,通常每个状态机都必须有一个初 ...

Pig join用法举例

Pig join用法举例的更多相关文章

随机推荐

热门专题