深圳杯D题爬取电视收视率排行榜

深圳杯D题爬取电视收视率排行榜
- 站点分析
- 代码实现

站点分析

http://www.tvtv.hk/archives/category/tv

每天的排行版通过静态页面发布，先获取每天的排行榜链接，再进一步从链接里面获取数据

每天前10的信息发布在p标签内，存储的时候空格拆分一下

代码实现

获取每一页的静态链接

url = 'http://www.tvtv.hk/archives/category/tv/page/'

# 获取每一个网页的静态页面

for i in range(1, 100):

    href = {}

    print('正在爬取第' + str(i) + '页')

    print(url + str(i))

    doc = pq(url + str(i))

    sp = doc('.status-publish')

    for s in sp.items():

        ha = s.find('h2 a')

        href[ha.attr('title')] = ha.attr('href')

    with open('TV链接列表.csv', 'a') as f:

        for key in href.keys():

            if key.find('榜') > 0:

                f.write(key + ',' + href[key] + '\n')

从每天的静态页面中获取前十的数据

# 从每一个静态页面中获取数据

out = open('TV收视率.csv', 'w', encoding='utf-8')

with open('TV链接列表.csv', 'r') as f:

    for line in f:

        print(line)

        strs = line.split(',')

        out.write(strs[0])

        doc = pq(strs[1])

        p = doc.find('p:nth-child(1)').text().strip()

        ps = p.split(' ')

        count = 0

        for item in ps:

            count = count + 1

            if count <= 3:

                continue

            j = 0

            while '0' <= item[j] <= '9':

                j = j + 1

            out.write(',' + item[j:])

        out.write('\n')

运行结果

完整代码获取：https://github.com/sstealer/WebSpider/tree/master。感觉有帮助的话可以GitHub点个赞哦

# 深圳杯D题爬取电视收视率排行榜的更多相关文章

【个人】爬虫实践，利用xpath方式爬取数据之爬取虾米音乐排行榜
实验网站:虾米音乐排行榜网站地址:http://www.xiami.com/chart 难度系数:★☆☆☆☆ 依赖库:request.lxml的etree (安装lxml:pip install ...
python爬取b站排行榜
爬取b站排行榜并存到mysql中目的 b站是我平时看得最多的一个网站,最近接到了一个爬虫的课设.首先要选择一个网站,并对其进行爬取,最后将该网站的数据存储并使其可视化. 网站的结构目标网站:bil ...
Python爬虫使用lxml模块爬取豆瓣读书排行榜并分析
上次使用了BeautifulSoup库爬取电影排行榜,爬取相对来说有点麻烦,爬取的速度也较慢.本次使用的lxml库,我个人是最喜欢的,爬取的语法很简单,爬取速度也快. 本次爬取的豆瓣书籍排行榜的首页地 ...
Python爬取猫眼top100排行榜数据【含多线程】
# -*- coding: utf-8 -*- import requests from multiprocessing import Pool from requests.exceptions im ...
爬虫--requests爬取猫眼电影排行榜
'''目标:使用requests分页爬取猫眼电影中榜单栏目中TOP100榜的所有电影信息,并将信息写入文件URL地址:http://maoyan.com/board/4 其中参数offset表示其实条 ...
scrapy爬取猫眼电影排行榜
做爬虫的人,一定离不开的一个框架就是scrapy框架,写小项目的时候可以用requests模块就能得到结果,但是当爬取的数据量大的时候,就一定要用到框架. 下面先练练手,用scrapy写一个爬取猫眼电 ...
使用xpath爬取猫眼电影排行榜
最近在学习xpath,在网上找资料的时候,发现一个新手经常拿来练手的项目,爬取猫眼电影前一百名排行的信息,很多都是跟崔庆才的很雷同,基本照抄.这里就用xpath自己写了一个程序,同样也是爬取猫眼电影, ...
记录python爬取猫眼票房排行榜(带stonefont字体网页),保存到text文件,csv文件和MongoDB数据库中
猫眼票房排行榜页面显示如下: 注意右边的票房数据显示,爬下来的数据是这样显示的: 网页源代码中是这样显示的: 这是因为网页中使用了某种字体的缘故,分析源代码可知: 亲测可行: 代码中获取的是国内票房榜 ...
python3爬虫-爬取B站排行榜信息
import requests, re, time, os category_dic = { "all": "全站榜", "origin": ...

随机推荐

Centos安装成功后配置网络
一.设置IP地址.网关DNS 说明:CentOS 7.0默认安装好之后是没有自动开启网络连接的! cd /etc/sysconfig/network-scripts/ #进入网络配置文件目录 vi i ...
zookeeper系列（一）zookeeper图形化的客户端工具
追加一个zookeeper图形化的客户端工具: 1.zookeeper图像化客户端工具的下载地址:https://issues.apache.org/jira/secure/attachment/12 ...
20191114-4 Beta发布用户使用报告
20191114-4 Beta发布用户使用报告此作业要求参见:https://edu.cnblogs.com/campus/nenu/2019fall/homework/10007 组名:胜利点组 ...
TP-四种url访问的方式
url的4种访问方式 (这是重点!!) 1.PATHINFO 模式 --重点在后面使用非常多,如果想传多个参数可以使用键1/值1/键2/值2方法代码如下: http://域名/项目名/入口文 ...
python sqlalchemy 进行 mysql 数据库操作
1. 进行mysql数据库的创建,如果已经存在,就相当于进行数据库的连接操作 from sqlalchemy import create_engine from sqlalchemy.ext.decl ...
简单说 JavaScript实现雪花飘落效果
说明这次实现的雪花飘落的效果很简单,主要是为了练习练习JavaScript中的定时器,setTimeout 和 setInterval. 效果图解释setTimeout() setTimeout函 ...
关于oracle下提示ORA-00904:Invalid identifier错误的问题
转自:https://blog.csdn.net/suleil1/article/details/49471549 今天在建表后对数据进行插入,遇到这个恶心人的ORA-00904:Invalid id ...
Monkeyrunner 使用说明
monkeyrunner为android系统新公开的一个测试工具.有助于开发人员通过脚本部署较大规模的自动化测试. Monkeyrunner 本文档中包含一个简单的monkeyrunne ...
Django Auth模块及User对象方法
一:Django的用户认证 from django.contrib import auth django.contrib.auth中提供了许多方法,这里主要介绍其中的三个: 1:authenticat ...
配置文件中间件：config-lite
config-lite 是一个轻量的读取配置文件的模块. config-lite 会根据环境变量(NODE_ENV)的不同从当前执行进程目录下的 config 目录加载不同的配置文件. 如果不设置 N ...

# 深圳杯D题爬取电视收视率排行榜

深圳杯D题爬取电视收视率排行榜

站点分析

代码实现

# 深圳杯D题爬取电视收视率排行榜的更多相关文章

随机推荐

热门专题