Hadoop
阅读 2
评论 0
点赞 0
HDFS 与 MapReduce 详解:存储架构、高可用与 YARN 运行流程
本文系统介绍Hadoop体系:HDFS 1.0中,NameNode管理元数据,DataNode存储数据块,写入采用pipeline方式,SecondaryNameNode辅助合并编辑日志。HDFS 2.0通过ZooKeeper、ZKFC和QJM解决单点故障,实现主备切换与元数据一致。YARN作为资源调度层,由ResourceManager、NodeManager和Container组成;MapReduce作业由ApplicationMaster申请资源,执行MapTask和ReduceTask。Shuffle机制核心为环形缓冲区溢写、分区归并与排序。文中还以作战比喻和Mapper/Reducer执行流程帮助理解。本文让读者掌握HDFS高可用原理、YARN调度流程以及MapReduce核心Shuffle机制。