python + seleinum +phantomjs 设置headers和proxy代理

 
 

最近因为工作需要使用selenium+phantomjs无头浏览器,其中遇到了一些坑,记录一下,尤其是关于phantomjs设置代理的问题。

基本使用

首先在python中导入使用的包,其中webdriver是要创建无头浏览器对象的模块,DesiredCapabilites这个类是浏览器对象的一些选项设置。

  1.  
    from selenium import webdriver
  2.  
    from selenium.webdriver.common.desired_capabilities import DesiredCapabilities
  3.  
     
  4.  
    # 初始化浏览器对象
  5.  
    desired_cap = DesiredCapabilities.PHANTOMJS.copy()
  6.  
    driver = webdriver.PhantomJS(desired_capabilities=desired_cap)

修改请求头

在使用爬虫的过程中我们需要修改请求投中的user-agent防止被反爬,修改过程如下

  1.  
    desired_cap = DesiredCapabilities.PHANTOMJS.copy()
  2.  
    # 修改请求头中的UA
  3.  
    desired_cap['phantomjs.page.settings.userAgent'] = 'xxxxxx'
  4.  
    # 设置其他请求投信息,其中key为要修改的请求投键名
  5.  
    desired_cap['phantomjs.page.customHeaders.{}'.format(key)] = 'xxxx'
  6.  
    driver = webdriver.PhantomJS(desired_capabilities=desired_cap)

设置代理

在使用爬虫过程中,经常需要使用代理ip,网上关于这方面资料较少,我也是搜集了好久,记录一下

ip代理有静态ip代理和动态ip代理,先说静态ip,静态ip就是134.119.184.92:1080这样的代理,不需要使用验证信息,使用方法如下:

  1.  
    # 配置代理信息
  2.  
    proxy = [
  3.  
    '--proxy=%s' % "218.60.8.83:3129", # 设置的代理ip
  4.  
    '--proxy-type=http', # 代理类型
  5.  
    '--ignore-ssl-errors=true', # 忽略https错误
  6.  
    ]
  7.  
     
  8.  
    # 在初始化浏览器对象的时候可以接收一个service_args的参数,使用这个参数设置代理
  9.  
    drive = webdriver.PhantomJS(service_args=proxy)
  10.  
     
  11.  
    # 设置页面加载和js加载超时时间,超时立即报错,如下设置超时时间为10秒
  12.  
    drive.set_page_load_timeout(10)
  13.  
    drive.set_script_timeout(10)
  14.  
     
  15.  
    # 这样代理就设置成功了,可以向百度发送请求验证ip是否可用
  16.  
    drive.get('http://www.baidu.com')

以上是静态代理设置方法,但是我们时候使用的是动态代理,设置方法有所变化,需要在参数里加上验证使用的用户名和密码,代码如下:

  1.  
    # 代理设置如下:
  2.  
    proxy = [
  3.  
    '--proxy=%s:%s' % (proxyHost, proxyPort), # 代理服务器的域名
  4.  
    '--proxy-type=http', # 代理类型
  5.  
    '--proxy-auth=%s:%s' % (proxyUser, proxyPass), # 代理验证所需的用户名和密码
  6.  
    '--ignore-ssl-errors=true', # 忽略https错误
  7.  
    ]
  8.  
     
  9.  
    # 在初始化浏览器对象的时候可以接收一个service_args的参数,使用这个参数设置代理
  10.  
    drive = webdriver.PhantomJS(service_args=proxy)
  11.  
     
  12.  
    # 设置页面加载和js加载超时时间,超时立即报错,如下设置超时时间为10秒
  13.  
    drive.set_page_load_timeout(10)
  14.  
    drive.set_script_timeout(10)
  15.  
     
  16.  
    # 这样代理就设置成功了,可以向百度发送请求验证ip是否可用
  17.  
    drive.get('http://www.baidu.com')

以上就是使用selenium + phantomjs无头浏览器设置headers和代理的方法。

python + seleinum +phantomjs 设置headers和proxy代理的更多相关文章

  1. Python爬虫连载10-Requests模块、Proxy代理

    一.Request模块 1.HTTP for Humans,更简洁更友好 2.继承了urllib所有的特征 3.底层使用的是urllib3 4.​开源地址:https://github.com/req ...

  2. python爬虫scrapy之downloader_middleware设置proxy代理

    一.背景: 小编在爬虫的时候肯定会遇到被封杀的情况,昨天爬了一个网站,刚开始是可以了,在settings的设置DEFAULT_REQUEST_HEADERS伪装自己是chrome浏览器,刚开始是可以的 ...

  3. selenium phantomjs 设置代理ip方法

    最近遇到phantomjs动态更换ip的功能,在知乎上看到一篇不错的文章,顺手记下来以备后用 phantomjs selenium 如何动态修改代理? 可以这样做(Python代码): # 不使用代理 ...

  4. Python爬虫设置Headers

    Python设置Headers import urllib import urllib2 url = 'http://www.server.com/login' user_agent = 'Mozil ...

  5. C# 使用 Proxy 代理请求资源

    C# 使用 Proxy 请求资源,基于 HttpWebRequest 类 前言 这是上周在开发 C# 中使用 Proxy 代理时开发的一些思考和实践.主要需求是这样的,用户可以配置每次请求是否需要代理 ...

  6. ES6新特性:Proxy代理器

    ES6新特性:Proxy: 要使用的话, 直接在浏览器中执行即可, node和babel目前还没有Proxy的polyfill;,要使用的话,直接在浏览器中运行就好了, 浏览器的兼容性为:chrome ...

  7. Proxy 代理模式

    简介 代理模式是用一个简单的对象来代替一个复杂的或者创建耗时的对象. java.lang.reflect.Proxy RMI 代理模式是对象的结构模式.代理模式给某一个对象提供一个代理对象,并由代理对 ...

  8. 豌豆夹Redis解决方式Codis源代码剖析:Proxy代理

    豌豆夹Redis解决方式Codis源代码剖析:Proxy代理 1.预备知识 1.1 Codis Codis就不详细说了,摘抄一下GitHub上的一些项目描写叙述: Codis is a proxy b ...

  9. 豌豆夹Redis解决方案Codis源码剖析:Proxy代理

    豌豆夹Redis解决方案Codis源码剖析:Proxy代理 1.预备知识 1.1 Codis Codis就不详细说了,摘抄一下GitHub上的一些项目描述: Codis is a proxy base ...

随机推荐

  1. liunx 利用nginx 实现负载均衡

    一般采用软件实现负载均衡的有Nginx.apache.nginx 近年来使用频繁,其官网上面显示可以承载5万并发访问量,太牛了. nginx 相比 apache优势明显:Nginx 服务程序比较稳定, ...

  2. java 中int与integer的区别

    int与integer的区别从大的方面来说就是基本数据类型与其包装类的区别: int 是基本类型,直接存数值,而integer是对象,用一个引用指向这个对象 1.Java 中的数据类型分为基本数据类型 ...

  3. Confluence 6 管理协同编辑 - 代理和 SSL 的考虑

    对于你如何连接  Synchrony 是与你的环境有关的.我们知道绝大部分的 Confluence 站点是运行在反向代理后面的,同时还使用了 SSL.这里是帮助你在你环境中识别正确的配置的一些信息和一 ...

  4. Confluence 6 删除垃圾内容

    属性(profile)垃圾 属性垃圾的定义为,一个垃圾用户在 Confluence 创建了用户,但是这个用户在自己的属性页面中添加了垃圾 URL. 如果你有很多垃圾用户在你的系统中创建了属性,你可以使 ...

  5. 《剑指offer》斐波那契数列

    本题来自<剑指offer> 斐波那契数列 矩阵覆盖 题目一: 大家都知道斐波那契数列,现在要求输入一个整数n,请你输出斐波那契数列的第n项(从0开始,第0项为0).n<=39 思路: ...

  6. 利用vue-cli创建新项目

    1.安装vue-cli npm i vue-cli --gd 2.初始化一个项目 vue init webpack test //test 是个项目名称并且配置相应的配置,(测试部份的可以选择no) ...

  7. shell 排除目录

    1.新建文件 exclude.txt,在文件中写需要排除的目录(只需要目录名称,不需要路径) 2.--exclude-from='/data/www/vhosts/git_track/git-shel ...

  8. nunit单元测试详解

    在粗略看了代码后,下面就详细说明相应的测试标记(属性)的用法. [TestFixture(arguments)]属性标记类为测试类,若没有填写参数,则测试类必须含有无参构造函数,否则需要相应的有参构造 ...

  9. CCF-CSP 第三题字符串整理(模拟大法好)

    URL映射 规则的相邻两项之间用‘/’分开,所以我们先把所有项分开,然后依次把两个字符串的对应项匹配即可. 分离字符串这里用字符串流(stringstream)处理,先把所有的‘/’变为空格,然后一个 ...

  10. nginx error.log 提示 [error] 887#887: *58 FastCGI sent in stderr: "PHP message: PHP Warning: mysql_connect(): Headers and client library minor version mismatch. Headers:50556 Library:50637

    0. 1.问题 1.1现象: nginx error.log 提示 [error] 887#887: *58 FastCGI sent in stderr: "PHP message: PH ...