Python3.x：获取代理ip以及使用

python爬虫浏览器伪装

#导入urllib.request模块

import urllib.request

#设置请求头

headers=("User-Agent","Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/49.0.2623.221 Safari/537.36 SE 2.X MetaSr 1.0")

#创建一个opener

opener=urllib.request.build_opener()

#将headers添加到opener中

opener.addheaders=[headers]

#将opener安装为全局

urllib.request.install_opener(opener)

#用urlopen打开网页

data=urllib.request.urlopen(url).read().decode('utf-8','ignore')

设置代理

#定义代理ip

proxy_addr="122.241.72.191:808"

#设置代理

proxy=urllib.request.ProxyHandler({'http':proxy_addr})

#创建一个opener

opener=urllib.request.build_opener(proxy)

#将opener安装为全局

urllib.request.install_opener(opener)

#用urlopen打开网页

data=urllib.request.urlopen(url).read().decode('utf-8','ignore')

同时设置用代理和模拟浏览器访问

#定义代理ip

proxy_addr="122.241.72.191:808"

#创建一个请求

req=urllib.request.Request(url)

#添加headers

req.add_header("User-Agent","Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko)

#设置代理

proxy=urllib.request.ProxyHandle("http":proxy_addr)

#创建一个opener

opener=urllib.request.build_opener(proxy,urllib.request.HTTPHandler)

#将opener安装为全局

urllib.request.install_opener(opener)

#用urlopen打开网页

data=urllib.request.urlopen(req).read().decode('utf-8','ignore')

获取代理ip

# python3

# 国内高匿代理IP网站：http://www.xicidaili.com/nn/

# 爬取首页代理IP地址

from bs4 import BeautifulSoup

import requests

import random

# 获取首页IP列表

def get_ip_list(url, headers):

    web_data = requests.get(url, headers=headers)

    soup = BeautifulSoup(web_data.text, 'lxml')

    ips = soup.find_all('tr')

    ip_list = []

    # 提取ip列表

    # range()的用法：range(1,5) #代表从1到5(不包含5)

    for i in range(1, len(ips)):

        ip_info = ips[i]

        tds = ip_info.find_all('td')

        ip_list.append(tds[5].text.lower() + '://' + tds[1].text + ':' + tds[2].text)

    return ip_list

# 随机获取一个ip

def get_random_ip(ip_list):

    # 随机获取一个ip（从返回的ip列表里面）

    proxy_ip = random.choice(ip_list)

    return proxy_ip

# 测试

if __name__ == '__main__':

    # 国内高匿代理IP

    url = 'http://www.xicidaili.com/nn/'

    headers = {

        'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/53.0.2785.143 Safari/537.36'

    }

    # 获取首页ip列表

    ip_list = get_ip_list(url, headers=headers)

    # 随机提取一个ip

    ip = get_random_ip(ip_list)

    print('代理ip地址：' + ip)

常用的代理ip地址：

1，西刺免费代理IP：http://www.xicidaili.com/

2，国内高匿代理IP：http://www.xicidaili.com/nn/

3，66免费代理网：http://www.66ip.cn/

作者：整合侠
链接：http://www.cnblogs.com/lizm166/p/8191305.html
来源：博客园
著作权归作者所有。商业转载请联系作者获得授权，非商业转载请注明出处。

Python3.x：获取代理ip以及使用的更多相关文章

Python3.x：代理ip刷评分
Python3.x:代理ip刷评分声明:仅供为学习材料,不允许用作商业用途: 一,功能: 针对某网站对企业自动刷评分: 网站:https://best.zhaopin.com/ 二,步骤: 1,获取 ...
Python3.x：代理ip刷点赞
Python3.x:代理ip刷点赞声明:仅供为学习材料,不允许用作商业用途: 一,功能: 针对某网站对企业自动刷点赞: 网站:https://best.zhaopin.com/ 二,步骤: 1,获取 ...
python编写的自动获取代理IP列表的爬虫-chinaboywg-ChinaUnix博客
python编写的自动获取代理IP列表的爬虫-chinaboywg-ChinaUnix博客 undefined Python多线程抓取代理服务器 | Linux运维笔记 undefined java如 ...
分享一个获取代理ip的python函数
分享一个获取代理ip的python函数 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 #coding:utf-8 from bs4 import Beaut ...
python爬虫之反爬虫（随机user-agent，获取代理ip，检测代理ip可用性）
python爬虫之反爬虫(随机user-agent,获取代理ip,检测代理ip可用性) 目录随机User-Agent 获取代理ip 检测代理ip可用性随机User-Agent fake_usera ...
Python学习笔记六(免费获取代理IP)
为获取网上免费代理IP,闲的无聊,整合了一下,免费从三个代理网站获取免费代理IP,目的是在某一代理网站被限制时,仍可从可以访问的其他网站上获取代理IP.亲测可用哦!^_^ 仅供大家参考,以下脚本可添 ...
python爬虫实战（一）——实时获取代理ip
在爬虫学习的过程中,维护一个自己的代理池是非常重要的. 详情看代码: 1.运行环境 python3.x,需求库:bs4,requests 2.实时抓取西刺-国内高匿代理中前3页的代理ip(可根据需求自 ...
python获取代理IP
利用requests库获取代理,用Beautiful库解析网页筛选ip # -*- coding: utf- -*- import requests from bs4 import Beautiful ...
批量获取代理ip
获取站大爷免费代理ip,然后打印出来,也可以把他存放在其他容器中 # coding:utf-8 import requests, re requests.packages.urllib3.disabl ...

随机推荐

【BZOJ5073】[Lydsy十月月赛]小A的咒语 DP（错解）
[BZOJ5073][Lydsy十月月赛]小A的咒语题解:沙茶DP,完全不用后缀数组. 用f[i][j]表示用了A的前i个字符,用了j段,最远能匹配到哪.因为显然我们能匹配到的地方越远越好,所以我们 ...
datatables如何把列设置成hidden隐藏域？
官网:https://datatables.net/reference/option/设置: visible: false如下: <!DOCTYPE html><html>&l ...
MySQL安装时出现Apply Security Settings错误的解决办法
windows版mysql安装执行程序下载地址: https://dev.mysql.com/downloads/file/?id=473605 点击下面的No thanks, just start ...
JS中的call、apply、bind 用法解疑
JS中的caller arguments.callee call apply bind方法一.call()和apply()方法 1.方法定义 call方法: 语法:call([thisObj ...
mysql 创建函数ERROR 1418 (HY000): This function has none of DETERMINISTIC, NO SQL, or READS SQL DATA in its declaration and binary logging is enabled (you *might* want to use the less safe log_bin_trust_f
mysql 创建函数的时候报错 ERROR 1418 (HY000): This function has none of DETERMINISTIC, NO SQL, or READS SQL D ...
日期Date 对象常用的方法
var mydate = new Date();//通过new方法创建对象 //alert(Date()); // 返回一个完整的日期时间 // alert(mydate.getDay());//返回 ...
git学习------>Git 分支管理最佳实践
ps:本文转载于 : https://www.ibm.com/developerworks/cn/java/j-lo-git-mange/index.html Git 是目前最流行的源代码管理工具.大 ...
python小数据池，代码块的最详细、深入剖析
代码块: Python程序是由代码块构造的.块是一个python程序的文本,他是作为一个单元执行的. 代码块:一个模块,一个函数,一个类,一个文件等都是一个代码块. 而作为交互方式输入的每个命令都是 ...
android 知识收集
1.无论是 Activity.BroadcastReceiver还是Service,只要是有长时间处理的任务,就需要重新开一个线程来处理,为什么会这样? 因为他们都是运行在主线程中的. 2.在使用Br ...
使用selenium实现简单网络爬虫抓取MM图片
撸主听说有个网站叫他趣,里面有个社区,其中有一项叫他趣girl,撸主点进去看了下,还真不错啊,图文并茂,宅男们自己去看看就知道啦~ 接下来当然就是爬取这些妹子的图片啦,不仅仅是图片,撸主发现里面的对话 ...

Python3.x：获取代理ip以及使用

Python3.x：获取代理ip以及使用

python爬虫浏览器伪装

设置代理

同时设置用代理和模拟浏览器访问

获取代理ip

Python3.x：获取代理ip以及使用的更多相关文章

随机推荐

热门专题