2019-02-14 14:05:04 423浏览
今天扣丁学堂大数据培训老师给大家介绍一下关于Hive实践分享之存储和压缩的坑介绍,首先我们在学习大数据技术的过程中,HIVE是非常重要的技术之一,但我们在项目上经常会遇到一些存储和压缩的坑,本文通过科多大数据的武老师整理,分享给大家。
CREATE TABLE CRM.DEMO(A INT) STORED AS PARQUET ;
desc formatted crm.demo;
# Storage Information SerDe Library: org.apache.hadoop.hive.ql.io.parquet.serde.ParquetHiveSerDe InputFormat: org.apache.hadoop.hive.ql.io.parquet.MapredParquetInputFormat OutputFormat: org.apache.hadoop.hive.ql.io.parquet.MapredParquetOutputFormat
ALTER TABLE crm.demo SET TBLPROPERTIES ('parquet.compression'='SNAPPY') ;
SET parquet.compression=SNAPPY ;
insert overwrite local directory '/home/etl/tmp/data' select * from crm.demo
hive> set mapred.map.output.compression.codec; mapred.map.output.compression.codec=org.apache.hadoop.io.compress.SnappyCodec
hive> set mapred.output.compression.codec; mapred.output.compression.codec=org.apache.hadoop.io.compress.SnappyCodec
set mapred.output.compression.codec=org.apache.hadoop.io.compress.GzipCodec;
-rw-r--r-- 1 etl etl 342094 May 10 11:13 000000_0.gz
【关注微信公众号获取更多学习资料】