一、Kafka 概述

kafka是一个分布式的基于发布/订阅模式的消息队列，主要应用了大数据实时处理领域

1）传统消息队列的应用场景

2）使用消息队列的好处

解耦：发送和接受消息的双方并不一定要同时在线

削峰：解决生产 > 消费速度的情况

异步：允许用户将一个消息放入队列，但并不立即处理它

3）消息队列的两种模式

①、点对点模式（1对1，消费者消费消息后会删除）

消息生产者生产消息发送到Queue中，然后消息消费者从Queue中取出并且消费消息。

消息被消费以后，queue 中不再有存储，所以消息消费者不可能消费到已经被消费的消息。

Queue 支持存在多个消费者，但是对一个消息而言，只会有一个消费者可以消费。

②、发布、订阅模式（一对多，消费者消费消息后，不会清除消息）

消息生产者（发布）将消息发布到 topic 中，同时有多个消息消费者（订阅）消费该消

息。和点对点方式不同，发布到 topic 的消息会被所有订阅者消费

【注意】消费者主动拉取数据

【缺点】消费者维持一个常轮询，来询问kafka中，是否有消息，比较浪费资源

1）Producer ：消息生产者，就是向 kafka broker 发消息的客户端；

2）Consumer ：消息消费者，向 kafka broker 取消息的客户端；

3）Consumer Group （CG）：消费者组，由多个 consumer 组成。消费者组内每个消费者负

责消费不同分区的数据，一个分区只能由一个组内消费者消费；消费者组之间互不影响。所

有的消费者都属于某个消费者组，即消费者组是逻辑上的一个订阅者。

4）Broker ：一台 kafka 服务器就是一个 broker。一个集群由多个 broker 组成。一个 broker

可以容纳多个 topic。

5）Topic ：可以理解为一个队列，生产者和消费者面向的都是一个 topic；

6）Partition：为了实现扩展性，提高并发，一个非常大的 topic 可以分布到多个 broker（即服务器）上，

一个 topic 可以分为多个 partition，每个 partition 是一个有序的队列；

7）Replica：副本，为保证集群中的某个节点发生故障时，该节点上的 partition 数据不丢失，

且 kafka 仍然能够继续工作，kafka 提供了副本机制，一个 topic 的每个分区都有若干个副本，

一个 leader 和若干个 follower。

8）leader：每个分区多个副本的“主”，生产者发送数据的对象，以及消费者消费数据的对

象都是 leader。

9）follower：每个分区多个副本中的“从”，实时从 leader 中同步数据，保持和 leader 数据

的同步。leader 发生故障时，某个 follower 会成为新的 follower。

10）zookeeper帮助我们管理集群