大数据Presto（五）：Presto优化与Impala对比

Lansonli • 2023-01-02 • 云技术社区 • 273 阅读

Presto优化与Impala对比

一、Presto优化

1、数据存储

一般Presto与Hive整合使用，针对这种使用情况有如下几点优化建议：

合理设置分区

合理设置分区在读取数据时可以针对分区数据读取，可以减少Presto数据读取量，提升查询性能。

使用列式存储

Presto对ORC文件读取做了特定优化，因此在Hive中创建Presto使用的表时，建议采用ORC格式存储。相对于Parquet，Presto对ORC支持更好。

使用压缩

数据压缩可以减少节点间数据传输对IO带宽压力，对于即席查询需要快速解压，建议采用Snappy压缩。

2、查询优化

只查询必要的字段

由于采用列式存储，查询时指定字段进行查询分析，减少读取数据量，避免使用“*”查询。

过滤条件加上分区字段

这样可以减少全表扫描，加快查询速度。

Group By 语句优化

合理安排Group by语句中字段顺序对性能有一定提升。将Group By语句中字段按照每个字段distinct数据多少进行降序排列。

[GOOD]: SELECT col1,clo2 from tbl GROUP BY uid, gender

[BAD]: SELECT col1,clo2 from tbl GROUP BY gender, uid

Order By时使用Limit

Order by需要扫描数据到单个worker节点进行排序，导致单个worker需要大量内存。如果是查询TopN或者BottomN，使用limit可减少排序计算和内存压力。

使用Join语句时将大表放在左边

使用Join语句时将大表放在左边Presto中join的默认算法是broadcast join，即将join左边的表分割到多个worker，然后将join右边的表数据整个复制一份发送到每个worker进行计算。如果右边的表数据量太大，则可能会报内存溢出错误。

二、Presto与Impala对比

Impala性能比Presto相对来说要快一些，两者都对内存消耗比较大，虽然Impala速度快但是Presto支持的数据源丰富。

本站文章资源均来源自网络，除非特别声明，否则均不代表站方观点，并仅供查阅，不作为任何参考依据！
如有侵权请及时跟我们联系，本站将及时删除！
如遇版权问题，请查看本站版权声明

THE END

二维码

海报

大数据Presto（五）：Presto优化与Impala对比

合理设置分区在读取数据时可以针对分区数据读取，可以减少Presto数据读取量，提升查询性能。

CODING X 腾银财智｜助力金融科技研发体系全面升级

<<上一篇

腾讯云 CODING：2022 DevOps 领域年度极具影响力产品

下一篇>>

Thomas

12月20日

尊敬的站长您好，在这留下评论，如有造成不便，还望您能谅解。那这里我先简单的介绍一下。我是Thomas，代表Bl...

评论于 DigitalOcean VPS启用IPv6以及解决IPv6地址Ping不通问题

红油麻将

12月18日

请教下我在编译的时候出现问题 /opt/bin/gcc limit.c -o limit gcc: err...

评论于威联通套件版 qBittorrent: Too many open files 或者 No file descriptors available 的解决方案

maodoudou

11月14日

感谢分享

评论于梦幻西游H5游戏超详细图文架设教程

yugan

11月4日

请问这个方法支持微信的动画表情吗？我自己添加的表情可以，但是微信自带的表情显示一个Error: Empty S...

评论于【干货分享】在TG上聊微信

健康就好

9月5日

感谢

搜索内容

大数据Presto（五）：Presto优化与Impala对比

Presto优化与Impala对比

一、Presto优化

1、数据存储

2、查询优化

二、Presto与Impala对比

作者信息

近期文章

文章目录

句子

标签云

最新评论

大数据Presto（五）：Presto优化与Impala对比

Presto优化与Impala对比

一、Presto优化

1、​​​​​​​​​​​​​​数据存储

2、​​​​​​​​​​​​​​查询优化

二、​​​​​​​​​​​​​​Presto与Impala对比

作者信息

近期文章

文章目录

句子

标签云

最新评论

1、数据存储

2、查询优化

二、Presto与Impala对比