首页
AI / 大模型
  • 智能体 Agent
  • 大模型工程
  • 模型原理
  • AI 应用
  • 检索增强 RAG
大数据
  • Flink
  • Kafka
  • ClickHouse
  • Hive
  • ZooKeeper
  • Hadoop
运维部署
  • 网站部署
  • 后端与工程
项目管理 关于本站
峰的个人知识库 菜单
  1. 首页
  2. AI / 大模型
    1. 智能体 Agent
    2. 大模型工程
    3. 模型原理
    4. AI 应用
    5. 检索增强 RAG
  3. 大数据
    1. Flink
    2. Kafka
    3. ClickHouse
    4. Hive
    5. ZooKeeper
    6. Hadoop
  4. 运维部署
    1. 网站部署
    2. 后端与工程
  5. 项目管理
  6. 关于本站
快捷操作
登录

Hive 架构与优化详解:从 SQL 到 MapReduce 的数据仓库
Hive 2025.07.12
阅读 3 评论 1 点赞 0

Hive 架构与优化详解:从 SQL 到 MapReduce 的数据仓库

Hive是基于Hadoop的离线批处理工具,让分析师能用SQL处理PB级数据,与MySQL等OLTP数据库的本质区别在于:Hive不支持实时修改和索引,依赖全表扫描,适合“先存后算”的离线分析。其核心架构包括HiveServer2、Thrift Server、Driver(解析/编译/优化SQL)、MetaStore(元数据管理)及底层HDFS与YARN。表类型上,内部表删除时数据与元数据一并删除,外部表仅删元数据,生产环境推荐外部表。分区按维度切分数据避免全表扫描,分桶按Hash拆分提升Join与抽样效率。存储格式建议列式ORC或Parquet以提升查询性能,压缩可选择Snappy(快速)或Bzip2(高压缩率)。优化关键在于减少计算量:开启谓词下推、向量化查询、本地模式,并通过拆分倾斜Key解决数据倾斜。掌握这些可让非分布式专家高效处理海量数据。

#Hive#数据仓库#大数据#SQL
DATA · LLM · DEVOPS DATA · LLM · DEVOPS DATA · LLM · DEVOPS DATA · LLM · DEVOPS
F Archive

沉淀后端底层、大数据工程与大模型落地实践,结构化归档技术学习笔记。

导航

  • 首页
  • AI / 大模型
  • 大数据
  • 运维部署
  • 项目管理
  • 关于本站

© 2026 峰的个人知识库. 保留所有权利.

用 ♥ 与氢气构建

Built with Theme 氢·简 CMS Halo