Python爬虫获取百度贴吧图片

#!/usr/bin/python
# -*- coding: UTF-8 -*-
import urllib
import re
文章来源：https://www.cnblogs.com/Axi8/p/5757270.html

class Spilder01(object):

    # page = urllib.urlopen('http://tieba.baidu.com/p/1753935195')
    # htmlcode = page.read()  # 读取页面源码
    # print htmlcode  # 在控制台输出
    #
    # pageFile = open('pageCode.txt','w')#以写的方式打开pageCode.txt
    # pageFile.write(htmlcode)#写入
    # pageFile.close()#开了记得关

    # 页面获取
    def get_html(url):
        page = urllib.urlopen(url)
        html = page.read()
        return html

    # 从get_html方法返回的辣么长一串字符串中 拿到满足正则表达式的字符串
    # reg = r'src="(.+?\.jpg)" width'  # 正则表达式
    # reg_img = re.compile(reg)  # 编译一下，运行更快
    # imglist = reg_img.findall(get_html('http://tieba.baidu.com/p/1753935195'))  # 进行匹配
    # x = 0
    # for img in imglist:
    #     urllib.urlretrieve(img, '%s.jpg' % x)
    #     x += 1
    #     # print img

    # urllib库中有一个  urllib.urlretrieve(链接, 名字)
    # 方法，它的作用是以第二个参数为名字下载链接中的内容，我们来试用一下
    def get_image(html_code):
        reg = r'src="(.+?\.jpg)" width'
        reg_img = re.compile(reg)
        img_list = reg_img.findall(html_code)
        x = 0
        for img in img_list:
            urllib.urlretrieve(img, '%s.jpg' % x)
            x += 1

    print u'-------网页图片抓取-------'
    print u'请输入url:',
    url = raw_input()
    if url:
        pass
    else:
        print u'---没有地址输入正在使用默认地址---'
        url = 'http://tieba.baidu.com/p/1753935195'

    print u'----------正在获取网页---------'
    html_code = get_html(url)
    print u'----------正在下载图片---------'
    get_image(html_code)
    print u'-----------下载成功-----------'
    raw_input('Press Enter to exit')

Python爬虫获取百度贴吧图片的更多相关文章

python爬虫获取百度图片（没有精华，只为娱乐）
python3.7,爬虫技术,获取百度图片资源,msg为查询内容,cnt为查询的页数,大家快点来爬起来.注:现在只能爬取到百度的小图片,以后有大图片的方法,我会陆续发贴. #!/usr/bin/env ...
Python爬虫+颜值打分，5000+图片找到你的Mrs. Right
一见钟情钟的不是情,是脸日久生情生的不是脸,是情项目简介本项目利用Python爬虫和百度人脸识别API,针对简书交友专栏,爬取用户照片(侵删),并进行打分. 本项目包括以下内容: 图片爬 ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...
如何用Python爬虫实现百度图片自动下载？
Github:https://github.com/nnngu/LearningNotes 制作爬虫的步骤制作一个爬虫一般分以下几个步骤: 分析需求分析网页源代码,配合开发者工具编写正则表达式或 ...
Python爬虫学习之爬美女图片
最近看机器学习挺火的,然后,想要借助业余时间,来学习Python,希望能为来年找一份比较好的工作. 首先,学习得要有动力,动力,从哪里来呢?肯定是从日常需求之中来.我学Python看网上介绍.能通过P ...
Python爬虫_百度贴吧（title、url、image_url）
本爬虫以百度贴吧为例,爬取某个贴吧的[所有发言]以及对应发言详情中的[图片链接] 涉及: request 发送请求获取响应 html 取消注释通过xpath提取数据数据保存思路: 由于各贴吧发言 ...
[Python]爬虫获取知乎某个问题下所有图片并去除水印
获取URL 进入某个知乎问题的主页下,按F12打开开发者工具后查看network面板. network面板可以查看页面向服务器请求的资源.资源的大小.加载资源花费的时间以及哪些资源加载失败等信息.还可 ...
Python爬虫获取知乎图片
前段时间想抓点知乎问题中的图片,了解了下爬虫,发现还是Python的简单方便,于是做了点尝试. #coding=utf-8 import urllib import re def getHtml(ur ...
Python爬虫获取异步加载站点pexels并下载图片(Python爬虫实战3)
1. 异步加载爬虫对于静态页面爬虫很容易获取到站点的数据内容,然而静态页面需要全量加载站点的所有数据,对于网站的访问和带宽是巨大的挑战,对于高并发和大访问访问量的站点来说,需要使用AJAX相关的技术 ...

随机推荐

什么？你正在学web自动化测试？那这些Selenium的基本操作你了解过吗？
在自动化测试中,我们都知道是通过定位元素来实现的,那么有时候我们定位元素定位不到是为什么呢? 1.页面出现了iframe 2.出现了新的窗口,没有实现句柄的切换 3.三种等待方式,没有选择其中之一来使 ...
C++ 线性筛素数
今天要写一篇亲民的博客了,尽力帮助一下那些不会线性筛素数或者突然忘记线性筛素数的大佬. 众所周知,一个素数的倍数肯定不是素数(废话).所以我们可以找到一个方法,普通的筛法(其实不算筛,普通的是判断一个 ...
Python 如何生成 200 个激活码
请用 Python 如何生成 200 个激活码. 激活码的格式为asqE-9xRK-lqWU-QkMT 要求1: 使用随机生成时,生成数字概率为1/5,大写字母和小写字母概率各为2/5 要求2: 这2 ...
Vue全家桶之一Vue(基础知识篇)
全家桶:Vue本身.状态管理.路由. 异步组件:
nginx的基础学习+实战
文章目录一.前言二.反向代理三.负载均衡四.动静分离参考视频:尚硅谷Nginx教程(2019发布) 参考链接:Windows下Nginx负载均衡实现一.前言 Nginx (engine x ...
004.Nginx日志配置及状态监控
一 Nginx请求简介 1.1 请求头部对于HTTP而言,客户端负责发起request请求,服务端负责response响应. request:包括请求行.请求头部.请求数据: response:包括 ...
Netty 学习笔记（3） ------ ChannelPipeline 和 ChannelHandler
ChannelPipeline通过责任链设计模式组织逻辑代码(ChannelHandler),ChannelHander就如同Servlet的Filter一样一层层处理Channel的读写数据. Ch ...
Learning in the Frequency Domain 解读
论文:Learning in the Frequency Domain, CVPR 2020 代码:https://github.com/calmevtime/DCTNet 实际的图像尺寸比较大,无法 ...
findViewByid一定要放在setContentView(R.layout.a..)之后
findViewByid一定要放在setContentView(R.layout.a..)之后否则还没布局,根本找不到这些控件setContentView(R.layout.activity_inpu ...
自定义placeholder样式
::-webkit-input-placeholder { /* WebKit, Blink, Edge */ color: #909; } :-moz-placeholder { /* Mozill ...

Python爬虫获取百度贴吧图片

Python爬虫获取百度贴吧图片的更多相关文章

随机推荐

热门专题