Python爬虫：用BeautifulSoup进行NBA数据爬取

爬虫主要就是要过滤掉网页中没用的信息。抓取网页中实用的信息

一般的爬虫架构为：

在python爬虫之前先要对网页的结构知识有一定的了解。如网页的标签，网页的语言等知识，推荐去W3School：

W3school链接进行了解

在进行爬虫之前还要有一些工具：

1.首先Python 的开发环境：这里我选择了python2.7，开发的IDE为了安装调试方便选择了用VS2013上的python插件，在VS上进行开发（python程序的调试与c的调试几乎相同较为熟悉）。

2.网页源代码的查看工具：尽管每个浏览器都能进行网页源代码的查看。但这里我还是推荐用火狐浏览器和FirBug插件（同一时候这两个也是网页开发者必用的工具之中的一个）；

FirBug插件的安装能够在右边的加入组件中安装；

其次来看试着看网页的源代码，这里我以我们要爬取的篮球数据为例：

如我要爬取网页中的Team Comparison表格内容为例：

watermark/2/text/aHR0cDovL2Jsb2cuY3Nkbi5uZXQvcXFfMjU4MTk4Mjc=/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/gravity/SouthEast" alt="这里写图片描写叙述" title="">

先右键选中如我要爬取的比分32-49。点击右键选择选择用firBug查看元素，（FirBug的另一个优点是在查看源代码时会在网页上显示源代码所显示的样式，在网页中我的位置及内容）网页下方就会跳出网页的源代码以及32-49比分所在的位置及源代码例如以下图：

能够看到32-49为网页的源代码为：

<td class="sdi-datacell" align="center">32-49</td>

当中td为标签的名字，class为类的名字，align为格式，32-49为标签的内容，为我们要爬取的内容；

但相似的标签以及类的名字在同一个网页中有非常多，光靠这两个元素无法爬下我们所须要的数据，这时就须要查看这一标签的父标签，或再上一级的标签来提取很多其它我们要爬取数据的特征。来过滤其它我们所不要爬取的数据。如我们这里选取这张表格所在的标签作为我我们进行筛选的第二个

特征：

<div class="sdi-so">

<h3>Team Comparison</h3>

再来我们来分析网页的URL：

如我们要爬取的网页的URL为：

http://www.covers.com/pageLoader/pageLoader.aspx?page=/data/nba/matchups/g5_preview_12.html

由于有搭站点的经验，所以能够这里

www.covers.com为域名。

/pageLoader/pageLoader.aspxpage=/data/nba/matchups/g5_preview_12.html。可能为放在服务器上的网页根文件夹的/pageLoader/pageLoader.aspx?

page=/data/nba/matchups/地址中的网页。

为了管理方便。同样类型的网页都会放在同一个文件夹下。以相似的命名方式命名：如这边的网页是以g5_preview_12.html命名的所以相似的网页会改变g5中的5，或者_12 中的12，通过改变这两个数字，我们发现相似网页能够改变12数字来得到，

再来学习爬虫：

这里python爬虫主要用到了

urllib2

BeautifulSoup

这两个库。BeautifulSoup的具体文档能够在下面站点中查看：

https://www.crummy.com/software/BeautifulSoup/bs4/doc/index.zh.html

在爬取网页时：

先要打开网页，然后在调用beautifulSoup库进行网页的分析，再用如.find函数找到要刚刚我们分析的特征所在的位置，并用.text来获取标签的内容即我们所要爬取的数据

如我们对比下面代码来进行分析：

  response=urllib2.urlopen(url)

    print response.getcode()

    soup=BeautifulSoup(

                                response,

                                'html.parser',

                                from_encoding='utf-8'

                                )

    links2=soup.find_all('div',class_="sdi-so",limit=2)

    cishu=0

    for i in links2:

        if(cishu==1):

            two=i.find_all('td',class_="sdi-datacell")

            for q in two:

                print q.text

                table.write(row,col,q.text)

                col=(col+1)%9

                if(col==0):

                    row=row+1

            row=row+1

            file.save('NBA.xls')

        cishu=cishu+1

urllib2.urlopen(url)为打开网页；

print response.getcode()为測试网页能否被打开；

soup=BeautifulSoup(

response,

‘html.parser’,

from_encoding=’utf-8’

)

为代用Beautiful进行网页的分析。

links2=soup.find_all(‘div’,class_=”sdi-so”,limit=2)为进行特征值的查询与返回

当中我们要查找’div’,class_=”sdi-so”,的标签，limit=2为限制找两个（这是为过滤其它相似的标签）

 for i in links2:

        if(cishu==1):

            two=i.find_all('td',class_="sdi-datacell")

            for q in two:

                print q.text

                table.write(row,col,q.text)

                col=(col+1)%9

                if(col==0):

                    row=row+1

            row=row+1

为在找到的’div’,class_=”sdi-so”,的标签中再进行对应的如’td’,class_=”sdi-datacell”标签的查找；

q.text为返回我们所要的数据

这里 row=row+1，row=row+1为我们将数据写入到excel文件时文件格式的整理所用的；

接下来是对抓取数据的保存：

这里我们用了excel来保存数据用到了包：

xdrlib,sys， xlwt

函数：

file=xlwt.Workbook()

table=file.add_sheet(‘shuju’,cell_overwrite_ok=True)

table.write(0,0,’team’)

table.write(0,1,’W/L’)

table.write(row,col,q.text)

file.save(‘NBA.xls’)

为最主要的excel写函数，这里不再累述；

最后我们爬下来数据保存格式后样式为：

watermark/2/text/aHR0cDovL2Jsb2cuY3Nkbi5uZXQvcXFfMjU4MTk4Mjc=/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/gravity/SouthEast" alt="这里写图片描写叙述" title="">

NICE

watermark/2/text/aHR0cDovL2Jsb2cuY3Nkbi5uZXQvcXFfMjU4MTk4Mjc=/font/5a6L5L2T/fontsize/400/fill/I0JBQkFCMA==/dissolve/70/gravity/SouthEast" alt="这里写图片描写叙述" title="">

我所觉得最深沉的爱。莫过于分开以后。我将自己，活成了你的样子。

Python爬虫：用BeautifulSoup进行NBA数据爬取的更多相关文章

Python爬虫教程-13-爬虫使用cookie爬取登录后的页面(人人网)（下）
Python爬虫教程-13-爬虫使用cookie爬取登录后的页面(下) 自动使用cookie的方法,告别手动拷贝cookie http模块包含一些关于cookie的模块,通过他们我们可以自动的使用co ...
[Python爬虫] 使用 Beautiful Soup 4 快速爬取所需的网页信息
[Python爬虫] 使用 Beautiful Soup 4 快速爬取所需的网页信息 2018-07-21 23:53:02 larger5 阅读数 4123更多分类专栏: 网络爬虫版权声明: ...
Python爬虫工程师必学——App数据抓取实战 ✌✌
Python爬虫工程师必学——App数据抓取实战 (一个人学习或许会很枯燥,但是寻找更多志同道合的朋友一起,学习将会变得更加有意义✌✌) 爬虫分为几大方向,WEB网页数据抓取.APP数据抓取.软件系统 ...
Python爬虫工程师必学APP数据抓取实战✍✍✍
Python爬虫工程师必学APP数据抓取实战整个课程都看完了,这个课程的分享可以往下看,下面有链接,之前做java开发也做了一些年头,也分享下自己看这个视频的感受,单论单个知识点课程本身没问题,大 ...
Python爬虫工程师必学——App数据抓取实战
Python爬虫工程师必学 App数据抓取实战整个课程都看完了,这个课程的分享可以往下看,下面有链接,之前做java开发也做了一些年头,也分享下自己看这个视频的感受,单论单个知识点课程本身没问题,大 ...
吴裕雄--天生自然PYTHON爬虫：安装配置MongoDBy和爬取天气数据并清洗保存到MongoDB中
1.下载MongoDB 官网下载:https://www.mongodb.com/download-center#community 上面这张图选择第二个按钮上面这张图直接Next 把bin路径添加 ...
Python爬虫小白入门（六）爬取披头士乐队历年专辑封面-网易云音乐
一.前言前文说过我的设计师小伙伴的设计需求,他想做一个披头士乐队历年专辑的瀑布图. 通过搜索,发现网易云音乐上有比较全的历年专辑信息加配图,图片质量还可以,虽然有大有小. 我的例子怎么都是爬取图片? ...
Python 爬虫练手项目—酒店信息爬取
from bs4 import BeautifulSoup import requests import time import re url = 'http://search.qyer.com/ho ...
Python爬虫教程-12-爬虫使用cookie爬取登录后的页面(人人网)（上）
Python爬虫教程-12-爬虫使用cookie(上) 爬虫关于cookie和session,由于http协议无记忆性,比如说登录淘宝网站的浏览记录,下次打开是不能直接记忆下来的,后来就有了cooki ...

随机推荐

kettle闪退问题
确定Java的配置环境没问题 kettle闪退的时候把spoon.bat里面的配置项改一下 if "%PENTAHO_DI_JAVA_OPTIONS%"=="" ...
C# linq左连接与分组
1.左连接使用DefaultIfEmpty(): 2.分组时候判断newper.FirstOrDefault() == null ? null: newper.ToList()这个经常出错误,如果不判 ...
jQuery.proxy() 函数详解
jQuery.proxy()函数用于改变函数的上下文. 你可以将指定函数传入该函数,该函数将返回一个新的函数,其执行代码不变,但函数内部的上下文(this)已经被更改为指定值. 该函数属于全局的jQu ...
vue初级学习--idea的环境搭建
一.导语最近接触了下idea,虽然我对于各种"代码界的神器"没有多大感冒,一个eclipse或者myeclipse,一个Notepad++ .一个就可以把我征服,但还是蛮喜欢id ...
C语言实现二叉树的基本操作
二叉树是一种非常重要的数据结构.本文总结了二叉树的常见操作:二叉树的构建,查找,删除,二叉树的遍历(包括前序遍历.中序遍历.后序遍历.层次遍历),二叉搜索树的构造等. 1. 二叉树的构建二叉树的基本 ...
centos7安装python3和Django后，ModuleNotFoundError: No module named '_sqlite3'
1.准备安装环境 yum groupinstall 'Development Tools' yum install zlib-devel bzip2-devel openssl-devel ncurs ...
有关数据传输GET和POST的方法的区别
有关前后端数据交互,主要是通过走http协议通过post或get的方法,拿angularJS来说:通过JS来发送http请求调用相关接口: $scope.apostDate=function(){ $ ...
table固定头部，表格tbody可上下左右滑动
当表格头部固定时,需要分为两个表格来做:一部分是thead,一部分是tbody,具体实现方式如下: html代码: <div class="table_box_big"> ...
chrony软件使用说明
1.1.1 chrony简介 Chrony是一个开源的自由软件,它能保持系统时钟与时钟服务器(NTP)同步,让时间保持精确. 它由两个程序组成:chronyd和chronyc. chronyd是一个后 ...
[转载] Rss 与 Feed 的概念区别
转载自http://www.chinaz.com/news/2011/0831/207961.shtml 可能很多刚刚接触博客的童鞋们,也和我一样不太了解:rss和feed概念或者说不了解rss和fe ...

Python爬虫：用BeautifulSoup进行NBA数据爬取

我所觉得最深沉的爱。莫过于分开以后。我将自己，活成了你的样子。

Python爬虫：用BeautifulSoup进行NBA数据爬取的更多相关文章

随机推荐

热门专题