Hive
阅读 3
评论 1
点赞 0
Hive 架构与优化详解:从 SQL 到 MapReduce 的数据仓库
Hive是基于Hadoop的离线批处理工具,让分析师能用SQL处理PB级数据,与MySQL等OLTP数据库的本质区别在于:Hive不支持实时修改和索引,依赖全表扫描,适合“先存后算”的离线分析。其核心架构包括HiveServer2、Thrift Server、Driver(解析/编译/优化SQL)、MetaStore(元数据管理)及底层HDFS与YARN。表类型上,内部表删除时数据与元数据一并删除,外部表仅删元数据,生产环境推荐外部表。分区按维度切分数据避免全表扫描,分桶按Hash拆分提升Join与抽样效率。存储格式建议列式ORC或Parquet以提升查询性能,压缩可选择Snappy(快速)或Bzip2(高压缩率)。优化关键在于减少计算量:开启谓词下推、向量化查询、本地模式,并通过拆分倾斜Key解决数据倾斜。掌握这些可让非分布式专家高效处理海量数据。