python操作kafka

一、什么是kafka

kafka特性：

(1) 通过磁盘数据结构提供消息的持久化，这种结构对于即使数以TB的消息存储也能够保持长时间的稳定性能.

(2) 高吞吐量：即使是非常普通的硬件Kafka也可以支持每秒数百万的消息.

(3) 支持通过Kafka服务器和消费机集群来分区消息.

(4) 支持Hadoop并行数据加载.

术语：

Broker: Kafka集群包含一个或多个服务器，这种服务器被称为broker

Topic: 每条发布到Kafka集群的消息都有一个类别，这个类别被称为Topic。（物理上不同Topic的消息分开存储，逻辑上一个Topic的消息虽然保存于一个或多个broker上但用户只需指定消息的Topic即可生产或消费数据而不必关心数据存于何处）

Partition: Partition是物理上的概念，每个Topic包含一个或多个Partition.

Producer: 负责发布消息到Kafka broker

Consumer: 消息消费者，向Kafka broker读取消息的客户端。

Consumer Group: 每个Consumer属于一个特定的Consumer Group（可为每个Consumer指定group name，若不指定group name则属于默认的group）

二、安装

在pypi.python.org有很多关于操作kafka的组件，我们选择weight最高的kafka 1.3.5

有internet网的情况下执行如下命令安装:

pip install kafka

easy_install kafka

三、按照官网的样例，先跑一个应用

1、生产者:

from kafka import KafkaProducer

producer = KafkaProducer(bootstrap_servers=['xxx.xx.xx.xxx:9092']) #此处ip可以是多个['0.0.0.1:9092','0.0.0.2:9092','0.0.0.3:9092' ]

for i in range(3):

    msg = "msg%d" % i

    producer.send('test', msg)

    producer.close()

2、消费者(简单demo):

from kafka import KafkaConsumer

consumer = KafkaConsumer('test',

bootstrap_servers=['xxx.xx.xx.xx:9092'])

for message in consumer:

    print ("%s:%d:%d: key=%s value=%s" % (message.topic, message.partition,

    message.offset, message.key,

    message.value))

启动后生产者、消费者可以正常消费。

3、消费者(消费群组)

from kafka import KafkaConsumer

consumer = KafkaConsumer('test',

group_id='my-group',

bootstrap_servers=['xxx.xx.xx.xx:9092'])

for message in consumer:

    print ("%s:%d:%d: key=%s value=%s" % (message.topic, message.partition,

    message.offset, message.key,

    message.value))

启动多个消费者，只有其中可以可以消费到，满足要求，消费组可以横向扩展提高处理能力

4、消费者(读取目前最早可读的消息)

from kafka import KafkaConsumer

consumer = KafkaConsumer('test',

auto_offset_reset='earliest',

bootstrap_servers=['xxx.xx.xx.xxx:9092'])

for message in consumer:

    print ("%s:%d:%d: key=%s value=%s" % (message.topic, message.partition,

    message.offset, message.key,

    message.value))

auto_offset_reset:重置偏移量，earliest移到最早的可用消息，latest最新的消息，默认为latest

源码定义:{'smallest': 'earliest', 'largest': 'latest'}

5、消费者(手动设置偏移量)

from kafka import KafkaConsumer

from kafka.structs import TopicPartition

consumer = KafkaConsumer('test',

bootstrap_servers=['xxx.xx.xx.xxx:9092'])

print consumer.partitions_for_topic("test") #获取test主题的分区信息

print consumer.topics() #获取主题列表

print consumer.subscription() #获取当前消费者订阅的主题

print consumer.assignment() #获取当前消费者topic、分区信息

print consumer.beginning_offsets(consumer.assignment()) #获取当前消费者可消费的偏移量

consumer.seek(TopicPartition(topic=u'test', partition=0), 5) #重置偏移量，从第5个偏移量消费

for message in consumer:

    print ("%s:%d:%d: key=%s value=%s" % (message.topic, message.partition,

    message.offset, message.key,

    message.value))

6、消费者(订阅多个主题)

from kafka import KafkaConsumer

from kafka.structs import TopicPartition

consumer = KafkaConsumer(bootstrap_servers=['xxx.xx.xx.xxx:9092'])

consumer.subscribe(topics=('test','test0')) #订阅要消费的主题

print consumer.topics()

print consumer.position(TopicPartition(topic=u'test', partition=0)) #获取当前主题的最新偏移量

for message in consumer:

    print ("%s:%d:%d: key=%s value=%s" % (message.topic, message.partition,

    message.offset, message.key,

    message.value))

7、消费者(手动拉取消息)

from kafka import KafkaConsumer

import time

consumer = KafkaConsumer(bootstrap_servers=['xxx.xx.xx.xxx:9092'])

consumer.subscribe(topics=('test','test0'))

while True:

    msg = consumer.poll(timeout_ms=5) #从kafka获取消息

    print msg

    time.sleep(1)

8、消费者(消息挂起与恢复)

from kafka import KafkaConsumer

from kafka.structs import TopicPartition

import time

consumer = KafkaConsumer(bootstrap_servers=['xxx.xx.xx.xxx:9092'])

consumer.subscribe(topics=('test'))

consumer.topics()

consumer.pause(TopicPartition(topic=u'test', partition=0))

num = 0

while True:

    print num

    print consumer.paused() #获取当前挂起的消费者

    msg = consumer.poll(timeout_ms=5)

    print msg

    time.sleep(2)

    num = num + 1

    if num == 10:

        print "resume..."

        consumer.resume(TopicPartition(topic=u'test', partition=0))

        print "resume......"

pause执行后，consumer不能读取，直到调用resume后恢复。

python操作kafka的更多相关文章

kfka学习笔记一：使用Python操作Kafka
1.准备工作使用python操作kafka目前比较常用的库是kafka-python库,但是在安装这个库的时候需要依赖setuptools库和six库,下面就要分别来下载这几个库 https://p ...
使用python操作kafka
使用python操作kafka目前比较常用的库是kafka-python库安装kafka-python pip3 install kafka-python 生产者 producer_test.py ...
kafka实战教程(python操作kafka)，kafka配置文件详解
kafka实战教程(python操作kafka),kafka配置文件详解应用往Kafka写数据的原因有很多:用户行为分析.日志存储.异步通信等.多样化的使用场景带来了多样化的需求:消息是否能丢失?是 ...
python操作kafka实践
1.先看最简单的场景,生产者生产消息,消费者接收消息,下面是生产者的简单代码. ------------------------------------------------------------ ...
python操作kafka（confluent_kafka 生产）
#!/usr/bin/python # -*- coding:utf-8 -*- from confluent_kafka import Producer import json import tim ...
kafka--通过python操作topic
修改 topic 的分区数 shiyanlou:bin/ $ ./kafka-topics.sh --zookeeper localhost:2181 --alter --topic mySendTo ...
Python（九） Python 操作 MySQL 之 pysql 与 SQLAchemy
本文针对 Python 操作 MySQL 主要使用的两种方式讲解: 原生模块 pymsql ORM框架 SQLAchemy 本章内容: pymsql 执行 sql 增\删\改\查语句 pymsql ...
Python 【第六章】：Python操作 RabbitMQ、Redis、Memcache、SQLAlchemy
Memcached Memcached 是一个高性能的分布式内存对象缓存系统,用于动态Web应用以减轻数据库负载.它通过在内存中缓存数据和对象来减少读取数据库的次数,从而提高动态.数据库驱动网站的速度 ...
练习：python 操作Mysql 实现登录验证用户权限管理
python 操作Mysql 实现登录验证用户权限管理

随机推荐

BB网络层测试
网络层测试2020 问题 1 以下不属于网络层的协议是___A_______. A DHCP B ICMP C IGMP D ARP 10 分问题 2 如果目的网络.目的主机都对,但是 ...
使用numba加速python科学计算
技术背景 python作为一门编程语言,有非常大的生态优势,但是其执行效率一直被人诟病.纯粹的python代码跑起来速度会非常的缓慢,因此很多对性能要求比较高的python库,需要用C++或者Fort ...
《机器学习Python实现_10_02_集成学习_boosting_adaboost分类器实现》
一.简介 adaboost是一种boosting方法,它的要点包括如下两方面: 1.模型生成每一个基分类器会基于上一轮分类器在训练集上的表现,对样本做权重调整,使得错分样本的权重增加,正确分类的样本 ...
03- HTML基本结构
初始HTML HTML(英文Hyper Text Markup Language的缩写)中文译为"超文本标签语言",主要是通过HTML标签对网页中的文本.图片.声音等内容进行描述. ...
Laravel路由中不固定数量的参数如何实现？
前言 laravel是个好框架,我也在学习和使用,并且在公司里推广,最近在读 Laravel 源码的时候,发现了一个段特别有趣的代码,大家请看: ... 这三个点是做什么用的呢?我查了 PHP 的手册 ...
HTML5 表单新增元素与属性
1 form 属性和 formaction 属性本课时讲解在 HTML4 中,表单内的从属元素必须书写在表单内部,而在 HTML5 中,可以把他们书写在页面上任何地方,然后为该元素指定一个 form ...
Python实现Paramiko的二次封装
Paramiko是一个用于执行SSH命令的Python第三方库,使用该库可实现自动化运维的所有任务,如下是一些常用代码的封装方式,多数代码为半成品,只是敲代码时的备份副本防止丢失,仅供参考,目前本人巡 ...
DVWA之File Upload (文件上传漏洞)
目录 Low: Medium: 方法一:抓包修改文件的type 方法二:00截断 High: Impossible : Low: 源代码: <?php if( isset( $_POST[ 'U ...
POJ2391 Floyd+离散化+二分+DINIC
题意: 有n个猪圈,每个猪圈里面都有一定数量的猪(可能大于当前猪圈的数量),每个猪圈都有自己的容量,猪圈与猪圈之间给出了距离,然后突然下雨了,问多久之后所有的猪都能进圈. 思路: ...
Win64 驱动内核编程-15.回调监控注册表
回调监控注册表在 WIN32 平台上,监控注册表的手段通常是 SSDT HOOK.不过用 SSDT HOOK 的方式监控注册表实在是太麻烦了,要 HOOK 一大堆函数,还要处理一些 NT6 系统有而 ...

python操作kafka

python操作kafka

一、什么是kafka

术语：

二、安装

三、按照官网的样例，先跑一个应用

1、生产者:

2、消费者(简单demo):

3、消费者(消费群组)

4、消费者(读取目前最早可读的消息)

5、消费者(手动设置偏移量)

6、消费者(订阅多个主题)

7、消费者(手动拉取消息)

8、消费者(消息挂起与恢复)

python操作kafka的更多相关文章

随机推荐

热门专题