在流式计算中,kafka一般用洪濑缓存数据,storm通过消费kafka的数据进行计算。
apache kafka是一个开源的消息系统,由scala写成。
kafka最初由linkedin公司开发。该项目的目标时为处理实时数据提供一个统一、高通量、低等待的平台
Kafka **是一个分布式消息队列。**Kafka对消息保存时根据Topic进行归类,发送消息者称为Producer,消息接受者称为Consumer,此外kafka集群有多个kafka实例组成,每个实例(server)称为broker。
无论是kafka集群还是consumer都依赖于zookeeper集群保存一些meta信息来确保系统可用性
Kafka架构中的角色:
producer:消息生产者,就是向kafka broker发消息的客户端consumer:消息消费者,向kafka broker取消息的客户端topic:可以理解为一个队列consumer group(CG): 这是kafka用来实现一个topic消息的广播(发给所有的consumer)和单播(发给任意一个consumer)的手段一个topic可以由多个GC,topic的消息会复制到所有的CG,但每个partition只会把消息发给该CG中的一个consumer如果要实现广播,只要每个consumer有一个独立的CG就可以了如果要实现单播,只要所有的consumer在同一个CG就可以了使用CG还可以将consumer进行自由分组而不用多次发送消息到不同的topic broker:一台kafka服务器就是一个broker。一个集群由多个broker组成,一个broker可以容纳多个topicpartition: 为了实现扩展性,一个非常大的topic可以分布到多个broker上,一个topic可以被分为多个partition,每个partition时一个有序队列partition中的每条消息都会被分配一个有序的id(offset)kafka至保证按一个partition中的顺序将消息发给consumer,不保证一个topic整体的顺序 offset:kafka的存储文件都是按照offset.kafka来命名,用offset做名字的好处时方便查找。 the first offset就是000000000000.kafka