开发手册 欢迎您!
软件开发者资料库

Apache Pig - 存储数据

Apache Pig存储数据 - 从概述,架构,安装,执行,Grunt Shell,Pig拉丁基础知识,读取数据,存储数据,诊断运算符,描述运算符,解释运算符,说明运算符,组运算符,Cogroup运算符,加入,学习Apache Pig操作员,跨操作员,联合操作员,拆分操作员,过滤操作员,不同操作员,Foreach操作员,订单依据,限制操作员,评估函数,加载和存储函数,包和元组函数,字符串函数,日期时间函数,数学函数,用户定义的函数,运行脚本。

在上一章中,我们学习了如何将数据加载到Apache Pig中.您可以使用 store 运算符将加载的数据存储在文件系统中.本章介绍如何使用 Store 运算符在Apache Pig中存储数据.

语法

以下是语法Store语句.

 STORE Relation_name INTO'required_directory_path'[USING function];

示例

假设我们在HDFS中有一个文件 student_data.txt ,其中包含以下内容内容.

001,Rajiv,Reddy,9848022337,Hyderabad002,siddarth,Battacharya,9848022338,Kolkata003,Rajesh,Khanna,9848022339,Delhi004,Preethi,Agarwal,9848022330,Pune005,Trupthi,Mohanthy,9848022336,Bhuwaneshwar006,Archana,Mishra,9848022335,Chennai.

我们已经使用LOAD运算符将其读入关系 student ,如下所示.

grunt> student = LOAD 'hdfs://localhost:9000/pig_data/student_data.txt'    USING PigStorage(',')   as ( id:int, firstname:chararray, lastname:chararray, phone:chararray,    city:chararray );

现在,让我们将关系存储在HDFS目录"/pig_Output/"中,如下所示.

grunt> STORE student INTO ' hdfs://localhost:9000/pig_Output/ ' USING PigStorage (',');

输出

执行 store 语句后,您将获得以下输出.使用指定的名称创建目录,数据将存储在其中.

2015-10-05 13:05:05,429 [main] INFO  org.apache.pig.backend.hadoop.executionengine.mapReduceLayer.MapReduceLau ncher - 100% complete2015-10-05 13:05:05,429 [main] INFO  org.apache.pig.tools.pigstats.mapreduce.SimplePigStats - Script Statistics:   HadoopVersion    PigVersion    UserId    StartedAt             FinishedAt             Features 2.6.0            0.15.0        Hadoop    2015-10-0 13:03:03    2015-10-05 13:05:05    UNKNOWN  Success!  Job Stats (time in seconds): JobId          Maps    Reduces    MaxMapTime    MinMapTime    AvgMapTime    MedianMapTime    job_14459_06    1        0           n/a           n/a           n/a           n/aMaxReduceTime    MinReduceTime    AvgReduceTime    MedianReducetime    Alias    Feature        0                 0                0                0             student  MAP_ONLY OutPut folderhdfs://localhost:9000/pig_Output/  Input(s): Successfully read 0 records from: "hdfs://localhost:9000/pig_data/student_data.txt"  Output(s): Successfully stored 0 records in: "hdfs://localhost:9000/pig_Output"  Counters:Total records written : 0Total bytes written : 0Spillable Memory Manager spill count : 0 Total bags proactively spilled: 0Total records proactively spilled: 0  Job DAG: job_1443519499159_0006  2015-10-05 13:06:06,192 [main] INFO  org.apache.pig.backend.hadoop.executionengine.mapReduceLayer.MapReduceLau ncher - Success!

验证

您可以验证存储的数据,如下所示.

步骤1

首先,使用 ls 命令列出名为 pig_output 的目录中的文件,如下所示./p>

hdfs dfs -ls 'hdfs://localhost:9000/pig_Output/'Found 2 itemsrw-r--r-   1 Hadoop supergroup          0 2015-10-05 13:03 hdfs://localhost:9000/pig_Output/_SUCCESSrw-r--r-   1 Hadoop supergroup        224 2015-10-05 13:03 hdfs://localhost:9000/pig_Output/part-m-00000

您可以观察到执行后创建了两个文件商店语句.

第2步

使用 cat 命令,列出内容名为 part-m-00000 的文件如下所示.

$ hdfs dfs -cat 'hdfs://localhost:9000/pig_Output/part-m-00000' 1,Rajiv,Reddy,9848022337,Hyderabad2,siddarth,Battacharya,9848022338,Kolkata3,Rajesh,Khanna,9848022339,Delhi4,Preethi,Agarwal,9848022330,Pune5,Trupthi,Mohanthy,9848022336,Bhuwaneshwar6,Archana,Mishra,9848022335,Chennai