selenium+phantomjs爬取bilibili

首先我们要下载phantomjs 你可以到 http://phantomjs.org/download.html 这里去下载下载完之后解压到你想要放的位置你需要配置一下环境变量哦

如下图：

首先，我们怎么让浏览器模拟操作，也就是我们自己先分析好整个操作过程，哪个地方有什么问题，把这些问题都提前测试好，没问题了再进行写代码。

打开bilibili网站 https://www.bilibili.com/ 发现下图登陆弹窗

那么这里我们就得先把这个弹窗去除，怎么去呢？你刷新一下或者点一下首页就不会出现了，所以这里我们可以模拟再刷新一次或者点击首页。

接下来搜索关键词蔡徐坤打球这时就涉及到搜索输入框和搜索按钮

点击搜索后我们看到了下列内容，其中圈起来的就是要爬的信息啦这时就涉及到页面源码获取，数据元素定位

那么上面这个过程走完了的话我们也可以选择写入xls格式，同时这里还少了一个事，那就是我现在才爬了一页，那难道不写个自动化爬取全部吗？

那此时就得解决循环获取和写入xls 更重要的事怎么去操作页数和下一页按钮

大致的思路就是这样子了！！！

先导入这些模块

from selenium import webdriver

from selenium.common.exceptions import TimeoutException #一条命令在足够的时间内没有完成则会抛出异常

from selenium.webdriver.common.by import By #支持的定位器分类

from selenium.webdriver.support.ui import WebDriverWait  #等待页面加载完成，找到某个条件发生后再继续执行后续代码，如果超过设置时间检测不到则抛出异常

from selenium.webdriver.support import expected_conditions as EC #判断元素是否加载

from bs4 import BeautifulSoup

import xlwt

定义一个浏览器对象并设置其他功能

browser = webdriver.Chrome() #初始化浏览器对象

WAIT = WebDriverWait(browser,10)  #显式等待，等待的时间是固定的，这里为10秒 元素在指定时间内不可见就引发异常TimeoutException

browser.set_window_size(1400,900) #设置浏览器窗口大小

创建excel文件，再创建一张工作表，名为蔡徐坤篮球，并且设置支持覆盖原数据！

book=xlwt.Workbook(encoding='utf-8',style_compression=0) #创建excel文件，设置utf-8编码，这样就可以在excel中输出中文了

sheet=book.add_sheet('蔡徐坤篮球',cell_overwrite_ok=True) #添加一张工作表 cell_overwrite_ok=True 时可以覆盖原单元格中数据。

sheet.write(0,0,'名称')

sheet.write(0,1,'地址')

sheet.write(0,2,'描述')

sheet.write(0,3,'观看次数')

sheet.write(0,4,'弹幕数')

sheet.write(0,5,'发布时间')

打开网站

browser.get('https://www.bilibili.com/')

寻找 “首页” 元素

index = WAIT.until(EC.element_to_be_clickable((By.CSS_SELECTOR,'#primary_menu > ul > li.home > a')))

        # 配合WebDriverWait类的until()方法进行灵活判断 进行下一步操作

        # 通过EC进行判断某个元素中是否可见并且是enable的 这样的话叫clickable(可点击)

        # 使用CSS选择器选中页面中的 首页 进行点击 目的为了第一次有个登录弹窗 刷新就没有 那就点击下首页来实现刷新

        index.click() #点击！

先判断是否加载输入框再判断搜索按钮是否能点击达到条件后输入内容进行搜索

input = WAIT.until(EC.presence_of_element_located((By.CSS_SELECTOR,'#banner_link > div > div > form > input'))) #判断某个元素是否被加到DOM树里，并不代表该元素一定可见(元素可以是隐藏的)

        submit = WAIT.until(EC.element_to_be_clickable((By.XPATH,'//*[@id="banner_link"]/div/div/form/button'))) #判断搜索按钮是否能点击，这里使用Xpath来寻找元素

        input.send_keys('蔡徐坤 篮球') #用send_keys()方法进行搜索输入框中输入内容

        submit.click() #点击搜索！

这时搜索完是弹出新的窗口这时就得获取窗口句柄实现标签页跳转

all_h = browser.window_handles #获取所有窗口句柄

browser.switch_to.window(all_h[1]) #switch_to.window 标签页跳转

接下来就是获取页面源码了(此处非全部源码)

WAIT.until(EC.presence_of_element_located((By.CSS_SELECTOR,'#server-search-app > div.contain > div.body-contain > div > div.result-wrap.clearfix'))) #坚持是否加载完所有搜索结果

    html = browser.page_source #page_source方法可以获取到页面源码

然后搜索元素并提取内容进行保存

	#遍历所有搜索信息 并保存

    list = soup.find(class_='all-contain').find_all(class_='info')

    for item in list:

        item_title = item.find('a').get('title')

        item_link = item.find('a').get('href')

        item_dec = item.find(class_='des hide').text

        item_view = item.find(class_='so-icon watch-num').text

        item_biubiu = item.find(class_='so-icon hide').text

        item_date = item.find(class_='so-icon time').text

        print('爬取：' + item_title)

再最后就是循环获取每一页提取数据最后写入xls文件！！！

下面就直接贴出代码了

from selenium import webdriver

from selenium.common.exceptions import TimeoutException #一条命令在足够的时间内没有完成则会抛出异常

from selenium.webdriver.common.by import By #支持的定位器分类

from selenium.webdriver.support.ui import WebDriverWait  #等待页面加载完成，找到某个条件发生后再继续执行后续代码，如果超过设置时间检测不到则抛出异常

from selenium.webdriver.support import expected_conditions as EC #判断元素是否加载

from bs4 import BeautifulSoup

import xlwt

browser = webdriver.Chrome() #初始化浏览器对象

WAIT = WebDriverWait(browser,10)  #显式等待，等待的时间是固定的，这里为10秒 元素在指定时间内不可见就引发异常TimeoutException

browser.set_window_size(1400,900) #设置浏览器窗口大小

book=xlwt.Workbook(encoding='utf-8',style_compression=0) #创建excel文件，设置utf-8编码，这样就可以在excel中输出中文了

sheet=book.add_sheet('蔡徐坤篮球',cell_overwrite_ok=True) #添加一张工作表 cell_overwrite_ok=True 时可以覆盖原单元格中数据。

sheet.write(0,0,'名称')

sheet.write(0,1,'地址')

sheet.write(0,2,'描述')

sheet.write(0,3,'观看次数')

sheet.write(0,4,'弹幕数')

sheet.write(0,5,'发布时间')

n = 1

def seach():

    try:

        print('开始访问b站....')

        browser.get('https://www.bilibili.com/')

        index = WAIT.until(EC.element_to_be_clickable((By.CSS_SELECTOR,'#primary_menu > ul > li.home > a')))

        # 配合WebDriverWait类的until()方法进行灵活判断 进行下一步操作

        # 通过EC进行判断某个元素中是否可见并且是enable的 这样的话叫clickable(可点击)

        # 使用CSS选择器选中页面中的 首页 进行点击 目的为了第一次有个登录弹窗 刷新就没有 那就点击下首页来实现刷新

        index.click() #点击！

        input = WAIT.until(EC.presence_of_element_located((By.CSS_SELECTOR,'#banner_link > div > div > form > input'))) #判断某个元素是否被加到DOM树里，并不代表该元素一定可见(元素可以是隐藏的)

        submit = WAIT.until(EC.element_to_be_clickable((By.XPATH,'//*[@id="banner_link"]/div/div/form/button'))) #判断搜索按钮是否能点击，这里使用Xpath来寻找元素

        input.send_keys('蔡徐坤 篮球') #用send_keys()方法进行搜索输入框中输入内容

        submit.click() #点击搜索！

        print('跳转到新窗口')

        all_h = browser.window_handles #获取所有窗口句柄

        browser.switch_to.window(all_h[1]) #switch_to.window 标签页跳转

        get_source()

        total = WAIT.until(EC.presence_of_element_located((By.CSS_SELECTOR,"#server-search-app > div.contain > div.body-contain > div > div.page-wrap > div > ul > li.page-item.last > button"))) #等待加载后获取所有页数按钮

        return int(total.text) #返回页码数量

    except TimeoutException:

        return seach()

def get_source():

    WAIT.until(EC.presence_of_element_located((By.CSS_SELECTOR,'#server-search-app > div.contain > div.body-contain > div > div.result-wrap.clearfix'))) #坚持是否加载完所有搜索结果

    html = browser.page_source #page_source方法可以获取到页面源码

    soup = BeautifulSoup(html,'lxml')

    save_to_excel(soup)

def save_to_excel(soup):

    #遍历所有搜索信息 并保存

    list = soup.find(class_='all-contain').find_all(class_='info')

    for item in list:

        item_title = item.find('a').get('title')

        item_link = item.find('a').get('href')

        item_dec = item.find(class_='des hide').text

        item_view = item.find(class_='so-icon watch-num').text

        item_biubiu = item.find(class_='so-icon hide').text

        item_date = item.find(class_='so-icon time').text

        print('爬取：' + item_title)

        global n

        sheet.write(n, 0, item_title)

        sheet.write(n, 1, item_link)

        sheet.write(n, 2, item_dec)

        sheet.write(n, 3, item_view)

        sheet.write(n, 4, item_biubiu)

        sheet.write(n, 5, item_date)

        n = n + 1

def next_page(page_num):

    try:

        print('获取下一页数据')

        next_btn = WAIT.until(EC.element_to_be_clickable((By.CSS_SELECTOR, '#server-search-app > div.contain > div.body-contain > div > div.page-wrap > div > ul > li.page-item.next > button')))

        #等待加载 下一页 按钮

        next_btn.click() #点击下一页！

        WAIT.until(EC.text_to_be_present_in_element((By.CSS_SELECTOR,'#server-search-app > div.contain > div.body-contain > div > div.page-wrap > div > ul > li.page-item.active > button'),str(page_num)))

        #判断某个元素中的text是否包含了预期的字符串

        get_source()

    except TimeoutException:

        browser.refresh() #刷新页面

        return next_page(page_num)

def main():

    try:

        total = seach()

        for i in range(2,int(total+1)):

            next_page(i)

    finally:

        browser.close()

        browser.quit()

if __name__ == '__main__':

    main()

    book.save(u'蔡徐坤篮球.xls')  #在字符串前加r，声明为raw字符串，这样就不会处理其中的转义了。否则，可能会报错

selenium+phantomjs爬取bilibili的更多相关文章

Python3.x：Selenium+PhantomJS爬取带Ajax、Js的网页
Python3.x:Selenium+PhantomJS爬取带Ajax.Js的网页前言现在很多网站的都大量使用JavaScript,或者使用了Ajax技术.这样在网页加载完成后,url虽然不改变但 ...
selenium+phantomjs爬取京东商品信息
selenium+phantomjs爬取京东商品信息今天自己实战写了个爬取京东商品信息,和上一篇的思路一样,附上链接:https://www.cnblogs.com/cany/p/10897618. ...
python+selenium+PhantomJS爬取网页动态加载内容
一般我们使用python的第三方库requests及框架scrapy来爬取网上的资源,但是设计javascript渲染的页面却不能抓取,此时,我们使用web自动化测试化工具Selenium+无界面浏览 ...
selenium + PhantomJS 爬取js页面
from selenium import webdriver import time _url="http://xxxxxxxx.com" driver = webdriver.P ...
Selenium+PhantomJs 爬取网页内容
利用Selenium和PhantomJs 可以模拟用户操作,爬取大多数的网站.下面以新浪财经为例,我们抓取新浪财经的新闻版块内容. 1.依赖的jar包.我的项目是普通的SSM单间的WEB工程.最后一个 ...
selenium + phantomjs 爬取落网音乐
题记: 作为一个业余程序猿,最大的爱好就是电影和音乐了,听音乐当然要来点有档次的.落网的音乐的逼格有点高,一听听了10年.学习python一久了,于是想用python技术把落网的音乐爬下来随便听. 目 ...
Python3.x：Selenium+PhantomJS爬取带Ajax、Js的网页及获取JS返回值
前言现在很多网站的都大量使用JavaScript,或者使用了Ajax技术.这样在网页加载完成后,url虽然不改变但是网页的DOM元素内容却可以动态的变化.如果处理这种网页是还用requests库或者 ...
看我怎么扒掉CSDN首页的底裤（python selenium+phantomjs爬取CSDN首页内容）
这里只是学习一下动态加载页面内容的抓取,并不适用于所有的页面. 使用到的工具就是python selenium和phantomjs,另外调试的时候还用了firefox的geckodriver.exe. ...
selenium+phantomjs爬取动态页面数据
1.安装selenium pip/pip3 install selenium 注意依赖关系 2.phantomjs for windows 下载地址:http://phantomjs.org/down ...

随机推荐

Kali下安装rar
1.在kali中安装rar解压软件方法一: apt-get install rar 方法二: 下载RAR:wget https://www.rarlab.com/rar/rarlinux-x64-5 ...
后台任务利器之Hangfire
后台任务利器之Hangfire 一.简述 Hangfire作为一款高人气且容易上手的分布式后台执行服务,支持多种数据库.在.net core的环境中,由Core自带的DI管理着生命周期,免去了在NF4 ...
spring的2种类型转换器
spring有2种类型转换器,一种是propertyEditor,一种是Converter.虽然都是类型转换,但是还是有细微差别. 所以这里以一个例子的形式来分析一下这2种类型转换的使用场景和差别. ...
RabbitMQ使用教程（一）RabbitMQ环境安装配置及Hello World示例
你是否听说过或者使用过队列? 你是否听说过或者使用过消息队列? 你是否听说过或者使用过RabbitMQ? 提到这几个词,用过的人,也许觉得很简单,没用过的人,也许觉得很复杂,至少在我没使用消息队列之前 ...
Ubuntu 16.04 以太坊开发环境搭建
今天我们来一步一步从搭建以太坊智能合约开发环境. Ubuntu16.04 安装ubuntu16.04.下载链接 //先update一下(或者换国内源再update) sudo apt-get upda ...
VS2013使用EF6通过ADO.NET 连接mySql成功步骤
VS2013使用EF6通过ADO.NET 连接mySql成功步骤 1.安装mysql-for-visualstudio-1.2.6(我用的目前最新版,这个一般安装VS2013就已经有了,没有的话下载一 ...
集合、迭代器、增强for循环、泛型
1集合集合是java中提供的一种容器,可以用来存储多个数据. 数组的长度是固定的.集合的长度是可变的.集合中存储的元素必须是引用类型数据. 1.1ArrayList集合存储元素(复习) 例: pub ...
常用的 HTML 头部标签
曾几何时,我们已经不再手写 HTML 标签.Emmet.Markdown 等工具让我们「健步如飞」,但是我们真的了解这些标签了吗? 基本标签使用 HTML5 doctype,不区分大小写. < ...
postgresql+ C#+ DHTMLX 学习汇总
前台: dhtmlxgrid.显示数据其格式为: { rows:[ {id:1,data:[1,2,3]} ,{} ]} 如果在postgesql里直接生成这样的串呢?? 这是就今天要做的事. ...
Android 贝塞尔曲线的浅析
博客也开了挺长时间了,一直都没有来写博客,主要原因是自己懒---此篇博客算是给2017年一个好的开始,同时也给2016年画上一个句点,不留遗憾. 那就让我们正式进入今天的主题:贝塞尔曲线. 首先,让我 ...

selenium+phantomjs爬取bilibili

selenium+phantomjs爬取bilibili

selenium+phantomjs爬取bilibili的更多相关文章

随机推荐

热门专题