Kafka
阅读 6
评论 0
点赞 0
Kafka 核心原理详解:架构、存储、可靠性与消费机制
Kafka是分布式流处理核心组件,融合点对点与发布订阅模式,通过消费者组实现组内独占分区、组间独立消费。架构由Broker集群、Topic、Partition、Replica及Zookeeper组成,Partition拆分为Segment文件对(.log+.index),利用稀疏索引与二分查找实现百万级消息毫秒级检索。可靠性依赖ACK机制(0/1/-1)和ISR副本同步,HW与LEO水位线确保数据一致性和安全Leader选举。生产者通过PID+SeqNumber实现幂等性,事务保证跨分区原子性。消费者采用拉取模式,支持Range、RoundRobin、Sticky分区分配策略,Offset存储于内部Topic。与Flume组合形成采集-缓冲-计算链路,能有效解决消息丢失、重复消费和性能瓶颈。