上一篇爬虫写了如何应付反爬的一些策略也简单的举了根据UA的例子，今天写一篇如何根据不同IP进行访问豆瓣网获取排行版

requests添加IP代理

如果使用代理的话可以通过requests中的方法proxies

def request(method, url, **kwargs):

    """Constructs and sends a :class:`Request <Request>`.

    :param proxies: (optional) Dictionary mapping protocol to the URL of the proxy.

太多了，删除了一些留下了主要

会有人问，这么多代理去哪里找？小编百度了找了一些发现西刺代理挺好用的。

随便从里面找1个进行发请求

# coding:utf-8

import requests

url ="http://httpbin.org/get"

proxy = '117.191.11.73:80'

proxies = {

    'http':'http://'+proxy,

    'https':'https://'+ proxy

           }

r  =requests.get(url,proxies=proxies)

print(r.text)

代码结果：

{

  "args": {},

  "headers": {

    "Accept": "*/*",

    "Accept-Encoding": "gzip, deflate",

    "Host": "httpbin.org",

    "User-Agent": "python-requests/2.21.0",

    "X-Via": "Cache-363"

  },

  "origin": "117.191.11.73, 117.191.11.73",

  "url": "https://httpbin.org/get"

}

通过代理抓取豆瓣网

1.通过requests请求地址：https://movie.douban.com/top250

2.添加代理IP

3.通过Beautiful Soup获取Html页面

4.进行分析Html页面，完成对导演，电影名称，评分的抓取

代码结果：

import requests

from  bs4 import BeautifulSoup

import re

# 请求头

headers = {

'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit'

              '/537.36 (KHTML, like Gecko) Chrome/53.0.2785.104 Safari/537.36 Core/1.53.2372.400 QQBrowser/9.5.10548.400'

}

# 添加代理

proxies = {

'http':'http://113.121.22.92:808',}

r = requests.get(url,headers=headers,proxies=proxies)

html = r.content.decode('utf-8')

blog = BeautifulSoup(html,'html.parser')

daoyan = blog.find_all('p',class_='')   # 导演

titles  = blog.find_all('div',class_='hd')    # 电影名称

pingfen = blog.find_all('span',class_='rating_num')    # 评分

for title,daoya, pingfe in zip(titles,daoyan,pingfen):

    m = title.get_text().split('\n')[2]

    x = daoya.get_text().strip()

    x1 = re.findall(r'导演: (.*?)\xa0',x)

    cc = pingfe.get_text()

    print(m)

    print(x1)

    print(cc)

代码执行完后发现只抓取了第一页的数据，而我们想要的时候全部数据，那么我们就继续分析URL路径

# 第一页的URL地址

https://movie.douban.com/top250

# 第二页的URL地址

https://movie.douban.com/top250?start=25&filter=

# 第三页的URL地址

https://movie.douban.com/top250?start=50&filter=

经过观察我们可以发现后面唯一变得数据就是start，那么我们可以通过拼接URL获取全部数据，并且把这么数据写入到TXT文件中

import requests

from  bs4 import BeautifulSoup

import re

page = 0

base_url = 'https://movie.douban.com/top250?start='

# 通过循环拼接URL

while page<10:

    url = base_url + str(25*page)

    page += 1

# 请求头

    headers = {

    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) '
'/Chrome/53.0.2785.104 Safari/537.36 Core/1.53.2372.400 QQBrowser/9.5.10548.400'

    }

# IP代理

    proxies = {

    'http':'http://113.121.22.92:808',}

    r = requests.get(url,headers=headers,proxies=proxies)

    html = r.content.decode('utf-8')

    blog = BeautifulSoup(html,'html.parser')

    daoyan = blog.find_all('p',class_='')   # 导演

    titles  = blog.find_all('div',class_='hd')    # 电影名称

    pingfen = blog.find_all('span',class_='rating_num')    # 评分

    for title,daoya, pingfe in zip(titles,daoyan,pingfen):

        m = title.get_text().split('\n')[2]

        x = daoya.get_text().strip()

        x1 = re.findall(r'导演: (.*?)\xa0',x)

        cc = pingfe.get_text()

# 写入到txt文件中

        with open('123.txt','a+',encoding='utf-8')as f :

            f.write('{m}\t{x1}\t{cc}\n'.format(m=m,x1=x1,cc=cc))

通过查看TXT文件，发现已经成功的获取到了豆瓣网的电影信息。

这个案例只是简单的表达我们可以通过IP代理的方式进行来完成爬虫（当然不用代理一样可以请求成功，只是简单的表达下思想，思想学会了，其他的都是简单的问题了）

以后我们如果遇到了封IP的网站都可以通过添加IP代理的方式进行爬取数据；

如果感觉安静写的内容对你有帮助，请点击个关注，内容持续更新中~~~~~

爬虫---Beautiful Soup 通过添加不同的IP请求的更多相关文章

爬虫---Beautiful Soup 反反爬虫事例
前两章简单的讲了Beautiful Soup的用法,在爬虫的过程中相信都遇到过一些反爬虫,如何跳过这些反爬虫呢?今天通过知乎网写一个简单的反爬中什么是反爬虫简单的说就是使用任何技术手段,阻止别人批 ...
爬虫---Beautiful Soup 初始
我们在工作中,都会听说过爬虫,那么什么是爬虫呢? 什么是网络爬虫爬虫基本原理所谓网络爬虫就是一个自动化数据采集工具,你只要告诉它要采集哪些数据,丢给它一个 URL,就能自动地抓取数据了.其背后的基 ...
爬虫-Beautiful Soup模块
阅读目录一介绍二基本使用三遍历文档树四搜索文档树五修改文档树六总结一介绍 Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通 ...
爬虫---Beautiful Soup 爬取图片
上一篇简单的介绍Beautiful Soup 的基本用法,这一篇写下如何爬取网站上的图片,并保存下来爬取图片 1.找到一个福利网站:http://www.xiaohuar.com/list-1-1. ...
Python爬虫利器：Beautiful Soup
Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.使用它来处理HTML页面就像JavaScript代码操作HTML DOM树一样方便.官方中文文档地址 1. 安 ...
python爬虫之解析库Beautiful Soup
为何要用Beautiful Soup Beautiful Soup是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文档的方式, 是一个 ...
python 爬虫利器 Beautiful Soup
python 爬虫利器 Beautiful Soup Beautiful Soup 是一个可以从HTML或XML文件中提取数据的Python库.它能够通过你喜欢的转换器实现惯用的文档导航,查找,修改文 ...
使用Beautiful Soup编写一个爬虫系列随笔汇总
这几篇博文只是为了记录学习Beautiful Soup的过程,不仅方便自己以后查看,也许能帮到同样在学习这个技术的朋友.通过学习Beautiful Soup基础知识完成了一个简单的爬虫服务:从all ...
网络爬虫: 从allitebooks.com抓取书籍信息并从amazon.com抓取价格(1): 基础知识Beautiful Soup
开始学习网络数据挖掘方面的知识,首先从Beautiful Soup入手(Beautiful Soup是一个Python库,功能是从HTML和XML中解析数据),打算以三篇博文纪录学习Beautiful ...

随机推荐

win10连接共享打印机
一.在运行中输入“\\共享打印机的主机ip”. 二.如果出现下面弹窗: 1.按Win键弹出开始菜单,直接在键盘上按zucelue,这个时候开始菜单里会检索到“编辑组策略”这个程序,按回车运行该程序.2 ...
lua 2 变量
变量在使用前,必须在代码中进行声明,即创建该变量. 编译程序执行代码之前编译器需要知道如何给语句变量开辟存储区,用于存储变量的值. Lua 变量有三种类型:全局变量.局部变量.表中的域. Lua 中的 ...
《阿里B2B技术架构演进详解》----阅读
B2B(Business To Business)是指一个市场的领域的一种,是企业对企业之间的营销关系.先来总结一下阿里B2B共分为三个阶段: 第一阶段,建立信息网站提供信息和营销服务平台,让买家更加 ...
在 React 组件中监听 android 手机物理返回/回退/back键事件
当前端页面嵌入到 webview 中运行时,有时会需要监听手机的物理返回按键事件来做一些自定义的操作. 比如我最近遇到的,在一个页面里面有批量选择的功能,当点击手机的返回键时,清除页面上的选中状态.我 ...
（二十五）golang--数组
数组:存放多个同一类型的数据.在Go中,数组也是一种值类型数组的基本定义: 数组的内存布局: 数组的地址可以用&取出,且它的地址就是第一个元素的地址数组不用被被初始化而默认是有值的: 数组中 ...
tensor 中mul_,add_解读
pytorch 中文网文档链接 https://ptorch.com/docs/1/Tensor 每一个张量tensor都有一个相应的torch.Storage保存其数据,张量类提供了一个多维的,横向 ...
python 中in 的用法
1. 作用为成员运算符在字符串内操作,如果字符串包含相关字符则返回True,如果不包含则返回False 当然处理不单单是只有单个字符,多个连续的字符也是可以处理的 # 单个字符 a= ...
vue开发 element的select下拉框设定初值后，不能重新选择的问题
问题描述: 用的element的select可多选的下拉选框,在回显后有初始值的情况下,不能修改,也不能再选择如图,明明点击了一般内勤主管,但没有任何反应 <el-select v-model ...
python正则图片爬取
# conding:utf8 import requests import re import time if __name__ == "__main__": # 所有的数据 ur ...
redis之布隆过滤器
布隆过滤器是什么? 布隆过滤器可以理解为一个不怎么精确的 set 结构,当你使用它的 contains 方法判断某个对象是否存在时,它可能会误判.但是布隆过滤器也不是特别不精确,只要参数设置的合理,它 ...

爬虫---Beautiful Soup 通过添加不同的IP请求

requests添加IP代理

通过代理抓取豆瓣网

爬虫---Beautiful Soup 通过添加不同的IP请求的更多相关文章

随机推荐

热门专题