使用selenium爬取网站动态数据

处理页面动态加载的爬取

selenium

selenium是python的一个第三方库，可以实现让浏览器完成自动化的操作，比如说点击按钮拖动滚轮等

环境搭建：
- 安装:pip install selenium
- 获取浏览器的驱动程序：下载地址http://chromedriver.storage.googleapis.com/index.html
- 驱动与浏览器版本对应：https://blog.csdn.net/ezreal_tao/article/details/80808729
  
  设置chorme浏览器无界面模式：
编码流程：

from selenium import  webdriver

import time

# 创建一个浏览器对象 executable_path:驱动路径

bro = webdriver.Chrome(executable_path='./chromedriver')

# get方法可以指定一个url，让浏览器进行请求

bro.get('https://www.baidu.com')

# 让浏览器进行指定词条搜索

'''

#使用下面的方法，查找指定的元素进行操作即可

    find_element_by_id            根据id找节点

    find_elements_by_name         根据name找

    find_elements_by_xpath        根据xpath查找

    find_elements_by_tag_name     根据标签名找

    find_elements_by_class_name   根据class名字查找

'''

text = bro.find_element_by_id('kw')

text.send_keys('人民币') # send_keys表示向文本框中录入指定内容

time.sleep(3)

button = bro.find_element_by_id('su')

button.click()# click表示的是点击操作

time.sleep(5)

bro.quit()

phantomJs

phantomJs是一个无界面的浏览器，其自动化流程与上述操作谷歌自动化流程是一模一样的

from selenium import webdrvier

使用selenium爬取豆瓣电影搞笑排行榜动态数据

from selenium import webdriver

import time

from lxml import etree

bro = webdriver.Chrome('./chromedriver')

url = 'https://movie.douban.com/typerank?type_name=%E5%96%9C%E5%89%A7&type=24&interval_id=100:90&action='

bro.get(url)

# 等待五秒页面加载完毕

time.sleep(5)

# 重复20次使用页面滚轮

for i in range(20):

    time.sleep(2)

    bro.execute_script('window.scrollTo(0,document.body.scrollHeight)')

# 获取页面源代码，可以使用三种解析方式进行解析，这里使用xpath解析数据

text = bro.page_source

tree = etree.HTML(text)

div_list = tree.xpath('//div[@class="movie-info"]')

f = open('豆瓣喜剧电影排行榜.txt','w',encoding='utf-8')

count = 0

for div in div_list:

    # 获取电影具体数据，并进行持久化存储

    try:

        name = div.xpath('./div[@class="movie-name"]/span/a/text()')[0]

        link = div.xpath('./div[@class="movie-name"]/span/a/@href')[0]

        man = div.xpath('./div[@class="movie-crew"]/text()')[0]

        country = div.xpath('./div[@class="movie-misc"]/text()')[0]

        num = div.xpath('./div[@class="movie-rating"]/span[2]/text()')[0]

    except IndexError:

        continue

    f.write('电影名：'+name+'\n链接'+link+'\n'+'导演：'+man+'\n国家：'+country+'\n评分：'+num+'\n-----------------------------\n\n\n')

    print('写入成功:',name)

    count += 1

print('爬取完毕,共抓取%s跳数据'%count)

f.close()

time.sleep(5)

bro.quit()

使用selenium爬取网站动态数据的更多相关文章

使用Selenium爬取网站表格类数据
本文转载自一下网站:Python爬虫(5):Selenium 爬取东方财富网股票财务报表 https://www.makcyun.top/web_scraping_withpython5.html 需 ...
爬虫(十七)：Scrapy框架(四) 对接selenium爬取京东商品数据
1. Scrapy对接Selenium Scrapy抓取页面的方式和requests库类似,都是直接模拟HTTP请求,而Scrapy也不能抓取JavaScript动态谊染的页面.在前面的博客中抓取Ja ...
如何使用python爬取网页动态数据
我们在使用python爬取网页数据的时候,会遇到页面的数据是通过js脚本动态加载的情况,这时候我们就得模拟接口请求信息,根据接口返回结果来获取我们想要的数据. 以某电影网站为例:我们要获取到电影名称以 ...
利用selenium 爬取豆瓣武林外传数据并且完成数据可视化情绪分析
全文的步骤可以大概分为几步: 一:数据获取,利用selenium+多进程(linux上selenium 多进程可能会有问题)+kafka写数据(linux首选必选耦合)windows直接采用的是写my ...
python selenium爬取自如租房数据保存到TXT文件
# -*- coding: utf-8 -*-"""Created on Fri Aug 31 2018 @author: chenlinlab"" ...
scrapy框架 + selenium 爬取豆瓣电影top250......
废话不说,直接上代码..... 目录结构 items.py import scrapy class DoubanCrawlerItem(scrapy.Item): # 电影名称 movieName = ...
Python+Selenium爬取动态加载页面（1）
注: 最近有一小任务,需要收集水质和水雨信息,找了两个网站:国家地表水水质自动监测实时数据发布系统和全国水雨情网.由于这两个网站的数据都是动态加载出来的,所以我用了Selenium来完成我的数据获取. ...
selenium跳过webdriver检测并爬取天猫商品数据
目录简介编写思路使用教程演示图片源代码 @(文章目录) 简介现在爬取淘宝,天猫商品数据都是需要首先进行登录的.上一节我们已经完成了模拟登录淘宝的步骤,所以在此不详细讲如何模拟登录淘宝.把关 ...
Scrapy 框架使用 selenium 爬取动态加载内容
使用 selenium 爬取动态加载内容开启中间件 DOWNLOADER_MIDDLEWARES = { 'wangyiPro.middlewares.WangyiproDownloaderMidd ...

随机推荐

HTTP1.0、HTTP1.1 和 HTTP2.0 的区别
一.HTTP的历史早在 HTTP 建立之初,主要就是为了将超文本标记语言(HTML)文档从Web服务器传送到客户端的浏览器.也是说对于前端来说,我们所写的HTML页面将要放在我们的 web 服务器上 ...
python scrapy baidu image【转】
原 https://github.com/vivianLL/baidupictures #!/usr/bin/env Python # coding=utf-8 #__author__ = 'leil ...
2019年1月6日没有nainai吃习题1
1列举布尔值是False的所有值 0,False,'',[],{},(),None 2根据范围获取其中3和7整除的所有数的和,并返回调用者:符合条件的数字个数以及符合条件的数字的总和 def func ...
王之泰201771010131《面向对象程序设计（java）》第二周学习总结
王之泰201771010131<面向对象程序设计(java)>第二周学习总结第一部分:理论知识学习部分第三章第三章内容主要为Java语言的基础语法,主要内容如下 1.基础知识 1.1 ...
[BZOJ2298]problem a
Description 一次考试共有n个人参加,第i个人说:“有ai个人分数比我高,bi个人分数比我低.”问最少有几个人没有说真话(可能有相同的分数) Input 第一行一个整数n,接下来n行每行两个 ...
Machine Learning--week2 多元线性回归、梯度下降改进、特征缩放、均值归一化、多项式回归、正规方程与设计矩阵
对于multiple features 的问题(设有n个feature),hypothesis 应该改写成 \[ \mathit{h} _{\theta}(x) = \theta_{0} + \the ...
codeforce 955c --Sad powers 思路+二分查找
这一题的题意是定义一个数,该数特点是为a的p次方 (a>0,p>1) 再给你n个询问,每个询问给出一个区间,求区间内该数的数目. 由于给出的询问数极大(10e5) 所以,容易想到应该 ...
MSSQL 数据库 buildindex 出错
错误1: Executing the query "ALTER INDEX [IX_liveConfigState_Service_ServiceId_..." failed wi ...
react-native android 运行命令
debug模式运行 sudo react-native run-android release模式运行 sudo react-native run-android --variant=release ...
智能合约遇到的小错误 network up to date解决办法
https://blog.csdn.net/qindong564950620/article/details/68933678 说 network up to date .这个错误我刚开始不知道怎么解 ...

使用selenium爬取网站动态数据

selenium

phantomJs

使用selenium爬取豆瓣电影搞笑排行榜动态数据

使用selenium爬取网站动态数据的更多相关文章

随机推荐

热门专题