selenium+BeautifulSoup+phantomjs爬取新浪新闻

一下载phantomjs，把phantomjs.exe的文件路径加到环境变量中，也可以phantomjs.exe拷贝到一个已存在的环境变量路径中，比如我用的anaconda，我把phantomjs.exe文件加入到了Anaconda3这个文件夹中（Anaconda3已加入环境变量）

二 pip安装selenium+BeautifulSoup+phantomjs 命令pip install selenium，anaconda中已有BeautifulSoup，不用管

三爬取数据，目标是爬取新浪新闻下的公司下面的所有的新闻文本。如图是新闻文章的列表，我们首先要抓取文章对用的链接，然后进入链接抓取文本

由于采用的是js加载的，如果直接用beautifulsoup是解析不出的，这里采用selenium+phantomjs抓取。抓取的思路是首先模拟点击公司新闻按钮，进入公司新闻栏目下，抓取该页所有新闻文章对应的链接，然后点击模拟点击下一页进入下一页循环抓取

下面是粗糙的代码实现：

from selenium import webdriver

from selenium.webdriver.common.by import By

from bs4 import BeautifulSoup

from urllib.request import urlopen

import re

import time

def get_links(driver):

    '''

    爬取链接并写入txt中

    '''

    t1 = time.time()

    try:

        driver.find_element(By.LINK_TEXT, "下一页").click()#每爬取完一页点击下一页

    except NoSuchElementException:

        time.sleep(1)

        driver.find_element(By.LINK_TEXT, "下5页").click()#有可能遇到没有下一页，尝试点击下5页

    time.sleep(1)

    bs = BeautifulSoup(driver.page_source)#不知道怎么用selenium直接解析出href。把selenium的webdriver调用page_source函数在传入BeautifulSoup中，就可以用BeautifulSoup解析网页了

    links = []

    for i in bs.findAll('a',href=re.compile("http://finance.sina.com.cn/chanjing/gsnews/.")):#用正则表达式找出所有需要的链接

        link = i.get('href')

        if link not in links:#去掉重复链接

            links.append(link)

            f.write(link+'\n')

    t2 = time.time()

    page_num = bs.find('span',{'class','pagebox_num_nonce'}).text#找出当前页数

    page_num = int(page_num)

    if page_num>4:

        return

    print('爬取完第%d页,用时%d秒'%(page_num,t2-t1))

    get_links(driver)

def get_text(links,path):

    '''

    解析出所需文本，第一个参数为链接列表，第二个为保存路径

    '''

    n=0

    for link in links:

        html = urlopen(link)

        bsObj = BeautifulSoup(html)

        temp = ''

        try:

            for link in bsObj.find("div",{'id':re.compile('artibody')}).findAll('p'):

                temp = temp+link.text.strip()#把每一段都拼接在一起

            print(temp[:31])

            path.write(temp+'\n')

            n+=1

            print('爬取完第%d篇'%n)

            print('\n')

        except (AttributeError,UnicodeEncodeError,UnicodeEncodeError):#这里的处理可能有点暴力

            continue

if True:#我把爬取的链接保存了下，所分成了两部，第一次爬取链接，第二次爬取文本

    f = open('E:\hei.txt','w')

    driver = webdriver.PhantomJS()#如果phantomjs.exe所在路径没有加入环境变量，这里也可以直接把其路径作为参数传给PhantomJS()

    driver.get("http://finance.sina.com.cn/chanjing/")

    driver.find_element(By.LINK_TEXT, "公司新闻").click()

    time.sleep(2)

    get_links(driver)

    f.close()

    driver.close()

if True:#爬取文本

    xl = open('E:\heiii.txt','w')

    with open('E:\heii.txt') as f:

        links = [link.strip() for link in f]

    get_text(links,xl)

selenium+BeautifulSoup+phantomjs爬取新浪新闻的更多相关文章

python3爬虫-爬取新浪新闻首页所有新闻标题
准备工作:安装requests和BeautifulSoup4.打开cmd,输入如下命令 pip install requests pip install BeautifulSoup4 打开我们要爬取的 ...
Python3：爬取新浪、网易、今日头条、UC四大网站新闻标题及内容
Python3:爬取新浪.网易.今日头条.UC四大网站新闻标题及内容以爬取相应网站的社会新闻内容为例: 一.新浪: 新浪网的新闻比较好爬取,我是用BeautifulSoup直接解析的,它并没有使用J ...
Python 爬虫实例（7）—— 爬取新浪军事新闻
我们打开新浪新闻,看到页面如下,首先去爬取一级 url,图片中蓝色圆圈部分第二zh张图片,显示需要分页, 源代码: # coding:utf-8 import json import redis i ...
【转】Python爬虫：抓取新浪新闻数据
案例一抓取对象: 新浪国内新闻(http://news.sina.com.cn/china/),该列表中的标题名称.时间.链接. 完整代码: from bs4 import BeautifulSou ...
Python爬虫：抓取新浪新闻数据
案例一抓取对象: 新浪国内新闻(http://news.sina.com.cn/china/),该列表中的标题名称.时间.链接. 完整代码: from bs4 import BeautifulSou ...
php使用pthreads v3多线程的抓取新浪新闻信息
我们使用pthreads,来写一个多线程的抓取页面小程序,把结果存到数据库里. 数据表结构如下: CREATE TABLE `tb_sina` ( `id` int(11) unsigned NOT ...
python2.7 爬虫初体验爬取新浪国内新闻_20161130
python2.7 爬虫初学习模块:BeautifulSoup requests 1.获取新浪国内新闻标题 2.获取新闻url 3.还没想好,想法是把第2步的url 获取到下载网页源代码再去分析源 ...
python爬取新浪股票数据—绘图【原创分享】
目标:不做蜡烛图,只用折线图绘图,绘出四条线之间的关系. 注:未使用接口,仅爬虫学习,不做任何违法操作. """ 新浪财经,爬取历史股票数据 ""&q ...
python3使用requests爬取新浪热门微博
微博登录的实现代码来源:https://gist.github.com/mrluanma/3621775 相关环境使用的python3.4,发现配置好环境后可以直接使用pip easy_instal ...

随机推荐

eclipse及Java常用问题及解决办法汇总
junit-test 我觉得这点比idea好用,可以直接选中要测试的方法名,右击run as即可 http://www.cnblogs.com/brolanda/p/4532779.html 打开您的 ...
Azure Traffic Manager 现可与 Azure 网站集成！
编辑人员注释:本文章由 WindowsAzure 网站团队高级专家级工程师 Jim Cheshire撰写. AzureTraffic Manager 已经推出有一段时间,这是一种跨多个区域管理网 ...
python 在 for i in range() 块中改变 i 的值的效果
先上一段代码: for i in range(3): i = 2 print(i) 实际结果是: 2 2 2 可以发现实际效果就是在每次执行 for 语句块的内容后 i 会被重新赋值
swith
“开关”(Switch)有时也被划分为一种“选择语句”.根据一个整数表达式的值,switch语句可从一系列代码选出一段执行.它的格式如下: switch(整数选择因子) { case 整数值1 : 语 ...
使用java API查询java类
一.java API的下载地址前面列举了常用的java类,但只是介绍了功能,具体详细的用法(比如要知道该类的属性和方法)要需要调用java的API(Application Program Inter ...
<td style="word-break:break-all"> 在html中控制自动换行
在html中控制自动换行其实只要在表格控制中添加一句 <td style="word-break:break-all">就搞定了. 其中可能对英文换行可能会分开一 ...
CloudXNS首次使用体验
第一步:申请域名对于从事IT行业的同学,有一个属于自己的域名是一件再正常只是的事情了. 没有,都不好意思说自己是搞机的.赶紧去新网.万网申请一个吧. 第二步:配置域名DNS 域名解析须要用到域名se ...
XML 文档解析操作
sing System;using System.Data;using System.Configuration;using System.Web;using System.Web.Security; ...
c 查找A字符串在B字符串中是否存在，计算出现的次数
主要是应用了头文件<string.h>中的strstr函数 char * strstr(const char *s1, const char *s2); 查找是否存在: #include& ...
Linux Shell 学习笔记一目录结构
以Red Hat Enterprise Linux 各版本为例,RHEL中目录具体作用如下, /bin 存放普通用户使用的命令 /sbin 存放管理员可以执行的命令 /home ...

selenium+BeautifulSoup+phantomjs爬取新浪新闻

selenium+BeautifulSoup+phantomjs爬取新浪新闻的更多相关文章

随机推荐

热门专题