虎扑是一个认真而有趣的社区,每天有众多JRs在虎扑分享自己对篮球、足球、游戏电竞、运动装备、影视、汽车、数码、情感等一切人和事的见解,热闹、真实、有温度。

受害者地址

https://nba.hupu.com/stats/players

本文知识点：

系统分析网页性质
结构化的数据解析
csv数据保存

环境介绍：

python 3.6
pycharm
requests
csv

爬虫案例的一般步骤

1.确定url地址(网页分析) 完成一半
2.发送网络请求 requests(js\html\css)
3.数据解析(筛选数据)
4.保存数据(本地文件\数据库)

部分代码

导入工具

import requests  # 第三方工具

import parsel  # 数据解析工具  (css\正则表达式\xpath)

import csv

确定url地址(网页分析) 完成一半 (静态网页\动态网页)

url = 'https://nba.hupu.com/stats/players/pts/{}'.format(page)

发送网络请求 requests(js\html\css)

response = requests.get(url=url)

html_data = response.text

数据解析(筛选数据)

selector = parsel.Selector(html_data)

    trs = selector.xpath('//tbody/tr[not(@class="color_font1 bg_a")]')

    for tr in trs:

        rank = tr.xpath('./td[1]/text()').get()  # 排名

        player = tr.xpath('./td[2]/a/text()').get()  # 球员

        team = tr.xpath('./td[3]/a/text()').get()  # 球队

        score = tr.xpath('./td[4]/text()').get()  # 得分

        hit_shot = tr.xpath('./td[5]/text()').get()  # 命中-出手

        hit_rate = tr.xpath('./td[6]/text()').get()  # 命中率

        hit_three = tr.xpath('./td[7]/text()').get()  # 命中-三分

        three_rate = tr.xpath('./td[8]/text()').get()  # 三分命中率

        hit_penalty = tr.xpath('./td[9]/text()').get()  # 命中-罚球

        penalty_rate = tr.xpath('./td[10]/text()').get()  # 罚球命中率

        session = tr.xpath('./td[11]/text()').get()  # 场次

        playing_time = tr.xpath('./td[12]/text()').get()  # 上场时间

        print(rank, player, team, score, hit_shot, hit_rate, hit_three,

              three_rate, hit_penalty, penalty_rate, session, playing_time)

        data_dict = {

            '排名': rank, '球员': player, '球队': team, '得分': score,

            '命中-出手': hit_shot, '命中率': hit_rate, '命中-三分': hit_three, '三分命中率': three_rate,

            '命中-罚球': hit_penalty, '罚球命中率': penalty_rate, '场次': session, '上场时间': playing_time}

        csv_write.writerow(data_dict)

        #  想要完整源码的同学可以关注我的公众号：松鼠爱吃饼干

        #  回复“虎扑NBA”即可免费获取

运行代码，效果如下

Python爬取NBA虎扑球员数据的更多相关文章

Python 爬取途虎养车全系车型轮胎保养数据
Python 爬取途虎养车全系车型轮胎保养数据 2021.7.27 更新增加标题.发布时间参数 demo文末自行下载,需要完整数据私聊我 2021.2.19 更新增加大保养数据 2020. ...
python 爬取天猫美的评论数据
笔者最近迷上了数据挖掘和机器学习,要做数据分析首先得有数据才行.对于我等平民来说,最廉价的获取数据的方法,应该是用爬虫在网络上爬取数据了.本文记录一下笔者爬取天猫某商品的全过程,淘宝上面的店铺也是类似 ...
Python爬取6271家死亡公司数据，一眼看尽十年创业公司消亡史！
小五利用python将其中的死亡公司数据爬取下来,借此来观察最近十年创业公司消亡史. 获取数据 F12,Network查看异步请求XHR,翻页. 成功找到返回json格式数据的url, 很多人 ...
Python 爬取大众点评 50 页数据，最好吃的成都火锅竟是它！
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: 胡萝卜酱 PS:如有需要Python学习资料的小伙伴可以加点击下方链 ...
Python爬取上交所一年大盘数据
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: 半个码农2018 PS:如有需要Python学习资料的小伙伴可以加点 ...
Python爬取6271家死亡公司数据，看十年创业公司消亡史
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: 朱小五凹凸玩数据 PS:如有需要Python学习资料的小伙伴可以加 ...
Python爬取某网站文档数据完整教程（附源码）
基本开发环境 (https://jq.qq.com/?_wv=1027&k=NofUEYzs) Python 3.6 Pycharm 相关模块的使用 (https://jq.qq.com/?_ ...
使用python爬取东方财富网机构调研数据
最近有一个需求,需要爬取东方财富网的机构调研数据.数据所在的网页地址为: 机构调研网页如下所示: 可见数据共有8464页,此处不能直接使用scrapy爬虫进行爬取,因为点击下一页时,浏览器只是发起了 ...
python爬取安居客二手房网站数据（转）
之前没课的时候写过安居客的爬虫,但那也是小打小闹,那这次呢, 还是小打小闹哈哈,现在开始正式进行爬虫书写首先,需要分析一下要爬取的网站的结构: 作为一名河南的学生,那就看看郑州的二手房信息吧! 在 ...

随机推荐

Linux下如何高效切换目录？
Linux 下对于目录的切换,大家肯定会想到一个命令:cd 命令.这个是 Linux 下再基本不过的命令,如果这个命令都不知道的话,赶紧剖腹自尽去吧. cd 命令确实很方便,但如果需要频繁在下面的目录 ...
List 集合的操作
如果当前id存在集合里去除当前id 如果不在集合里去除集合最后一个结果Long videoId = 0l; // 当前 IDList<VideoZoneReturnBean> ...
题解 P1407
建图方式:旧关系女人连男人,现关系男人连女人(当然,反过来也可以) 原因可以这样考虑: 如果一个男的把女的绿了,那么这个女人就会去找一个她曾经交往过的男人,也就是在这种情况下,某种"影响&q ...
mysql-5.7.xx在lcentos7下的安装以及mysql在windows以及linux上的性能差异
前言: 在centos上安装mysql,整整折腾了将近一天,因为是第一次安装,的确是踩了不少坑,这里详细记录下来,方便各位有同样需求的小伙伴参考. 该选择什么版本? mysql5.7有很多小版本,但是 ...
SweetAlert 弹框之后点击OK执行方法
swal( '审核通过!', '', 'success' ).then(function () { Return(); })
YApi——手摸手，带你在Win10环境下安装YApi可视化接口管理平台
手摸手,带你在Win10环境下安装YApi可视化接口管理平台 YApi YApi 是高效.易用.功能强大的 api 管理平台,旨在为开发.产品.测试人员提供更优雅的接口管理服务.可以帮助开发者轻松创建 ...
CAS和锁的相关面试题
CAS 锁锁的四种状态和升级锁的四种状态:无锁.偏向锁.轻量级锁和重量级锁无锁无锁就是没有真正意义上的上锁,所有的线程还是能访问并修改同一个资源,但是通过算法控制,实现同时只有一个线程修改成功 ...
IE浏览器连接WebSocket报错：java.lang.IllegalArgumentException: Invalid character found in the request target. The valid characters are defined in RFC 7230 and RFC 3986
在项目开发中整合了WebSocket,本来没什么问题了,但是偶尔发现用IE浏览器打开web端不能推送消息,因为PC端与服务器建立连接失败了.网上查了很多资料, 又看了看源码,都不对症:又怀疑是Spri ...
day38:MySQL数据库之约束&索引&外键&存储引擎
目录 part1:数据类型 part2:约束 part3:主键索引 PRI &唯一索引 UNI &普通索引 MUL part4:外键:foreign key part5:在外键中设置联 ...
WPF Devexpress控件库中ChartControl--实现不等距x轴
一.概要解决问题--ChartControl不等距x轴显示二.CS代码用过ChartControl的开发者们应该都知道,ChartControl中设置x轴间距间隔都是固定的数值. 比如(间隔10 ...

Python爬取NBA虎扑球员数据

部分代码

Python爬取NBA虎扑球员数据的更多相关文章

随机推荐

热门专题