Apache Pig - Distinct Operator

Apache Pig Distinct Operator - 从概述，架构，安装，执行，Grunt Shell，Pig Latin Basics，读取数据，存储数据，诊断操作员，描述操作员，解释操作员，Illustrate操作员，组操作员，Cogroup操作员，加入，学习Apache Pig操作员，跨操作员，联合操作员，拆分操作员，过滤操作员，不同操作员，Foreach操作员，订单依据，限制操作员，评估函数，加载和存储函数，包和元组函数，字符串函数，日期时间函数，数学函数，用户定义的函数，运行脚本。

DISTINCT 运算符用于从关系中删除多余(重复)元组.

语法

给定以下是 DISTINCT 运算符的语法.

grunt> Relation_name2 = DISTINCT Relatin_name1;

示例

假设我们在HDFS中有一个名为 student_details.txt 的文件目录/pig_data/如下所示.

student_details.txt

001,Rajiv,Reddy,9848022337,Hyderabad002,siddarth,Battacharya,9848022338,Kolkata 002,siddarth,Battacharya,9848022338,Kolkata 003,Rajesh,Khanna,9848022339,Delhi 003,Rajesh,Khanna,9848022339,Delhi 004,Preethi,Agarwal,9848022330,Pune 005,Trupthi,Mohanthy,9848022336,Bhuwaneshwar006,Archana,Mishra,9848022335,Chennai 006,Archana,Mishra,9848022335,Chennai

我们已将此文件加载到具有关系名称的Pig中 student_details ，如下所示.

grunt> student_details = LOAD 'hdfs://localhost:9000/pig_data/student_details.txt' USING PigStorage(',')    as (id:int, firstname:chararray, lastname:chararray, phone:chararray, city:chararray);

现在让我们使用 DISTINCT 从名为 student_details 的关系中删除多余(重复)元组运算符，并将其存储为另一个名为 distinct_data 的关系，如下所示.

grunt> distinct_data = DISTINCT student_details;

验证

使用 DUMP distinct_data >运算符如下所示.

grunt> Dump distinct_data;

输出

它将产生以下输出，显示关系 distinct_data 如下.

(1,Rajiv,Reddy,9848022337,Hyderabad)(2,siddarth,Battacharya,9848022338,Kolkata) (3,Rajesh,Khanna,9848022339,Delhi) (4,Preethi,Agarwal,9848022330,Pune) (5,Trupthi,Mohanthy,9848022336,Bhuwaneshwar)(6,Archana,Mishra,9848022335,Chennai)