python实战项目 — 爬取中国票房网年度电影信息并保存在csv

import pandas as pd

import requests

from bs4 import BeautifulSoup

import time

def spider(url, headers):

    print("正在抓取url:  " + url)

    datas = requests.get(url=url, headers=headers).text

    # 解析url

    soup = BeautifulSoup(datas, 'lxml')

    # 获取数据集合，find_all 返回的是集合类型，所以取[0], 找table标签下 的 属性是 id：tbContent

    moives_tables = soup.find_all('table', {'id': 'tbContent'})[0]

    # 获取每一个子节点 tr标签

    moives = moives_tables.findAll('tr')

    # 获取电影名字，电影名字在每个tr标签里面的第一个td标签里面，由于是有多个td所以要用for遍历

    names = [tr.find_all('td')[0].a.get('title') for tr in moives[1:]]

    # 获取电影的详情页url地址，而且下面提供给获取导演使用，因为导演信息不在主页面上

    hrefs = [tr.find_all('td')[0].a.get('href') for tr in moives[1:]]

    # 获取电影类型

    types = [tr.find_all('td')[1].string for tr in moives[1:]]

    # 获取票房数据

    box_offices = [int(tr.find_all('td')[2].string) for tr in moives[1:]]

    # 获取平均票价

    Average_fare = [tr.find_all('td')[3].string for tr in moives[1:]]

    # 获取上映日期

    show_time = [tr.find_all('td')[6].string for tr in moives[1:]]

    # print(names, hrefs, types, box_offices, Average_fare, show_time)

    # print(len(hrefs))

    daoyans = []

    for href in hrefs:

        try:

            daoyan_datas = requests.get(href)

            # 出现错误的原因是因为这里的daoyan_datas是requests对象，无法用BeautifulSoup解析，可以在daoyan_datas后面加上content

            soup = BeautifulSoup(daoyan_datas.content, 'lxml')

            # 获取导演，由于数据是带换行的，所以要用replace("\n","") 取消换行

            daoyan = soup.select('dl.dltext dd')[0].get_text().replace("\n", "")

            #print(daoyan)

            daoyans.append(daoyan)

            #print(len(daoyans))

            time.sleep(0.5)

        except:

            daoyans.append("获取失败")

    # 数据拼接,得到的数据类型是  <class 'pandas.core.frame.DataFrame'> ，所以要用 DataFrame() 函数来写入excel

    df = pd.DataFrame({

        'name': names,

        'href': hrefs,

        'type': types,

        'box_office': box_offices,

        'Average_fare': Average_fare,

        'show_time': show_time,

        'directors': daoyans

    })

    download(df)

'''

问题是不能连续存储，都是重新创建文件csv, os文件操作 mode='a'

'''

def download(df):

    df.to_csv('D://box_office.csv', mode='a', index=False, header=False)

    print("done")

if __name__ == "__main__":

    start_time = time.time()

    headers = {

        'Cookie': 'Hm_lvt_daabace29afa1e8193c0e3000d391562=1570691612; Hm_lpvt_daabace29afa1e8193c0e3000d391562=1570691612',

        'Host': 'www.cbooo.cn',

        'Upgrade-Insecure-Requests': '1',

        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/77.0.3865.90 Safari/537.36'

    }

    base_url = "http://www.cbooo.cn/year?year="

    for i in range(2008, 2020):

        url = base_url + str(i)

        spider(url, headers)

        time.sleep(2)

print(round((time.time() - start_time), 3))

python实战项目 — 爬取中国票房网年度电影信息并保存在csv的更多相关文章

Python爬取中国票房网所有电影片名和演员名字，爬取齐鲁网大陆所有电视剧名称
爬取CBO中国票房网所有电影片名和演员名字 # -*- coding: utf-8 -*- # 爬取CBO中国票房网所有电影片名 import json import requests import ...
python实战项目 — 爬取校花网图片
重点: 1. 指定路径创建文件夹,判断是否存在 2. 保存图片文件 # 获得校花网的地址,图片的链接 import re import requests import time import os ...
python实战项目 — 爬取妹子图网，保存图片到本地
重点: 1. 用def函数 2. 使用 os.path.dirname("路径保存") , 实现每组图片保存在独立的文件夹中方法1: import requests from l ...
python爬取中国知网部分论文信息
爬取指定主题的论文,并以相关度排序. #!/usr/bin/python3 # -*- coding: utf-8 -*- import requests import linecache impor ...
Python爬取中国天气网
Python爬取中国天气网基于requests库制作的爬虫. 使用方法:打开终端输入 “python3 weather.py 北京(或你所在的城市)" 程序正常运行需要在同文件夹下加入一个 ...
初识python 之爬虫：爬取中国天气网数据
用到模块: 获取网页并解析:import requests,html5lib from bs4 import BeautifulSoup 使用pyecharts的Bar可视化工具"绘制图表& ...
利用Python网络爬虫爬取学校官网十条标题
利用Python网络爬虫爬取学校官网十条标题案例代码: # __author : "J" # date : 2018-03-06 # 导入需要用到的库文件 import urll ...
python爬取当当网的书籍信息并保存到csv文件
python爬取当当网的书籍信息并保存到csv文件依赖的库: requests #用来获取页面内容 BeautifulSoup #opython3不能安装BeautifulSoup,但可以安装Bea ...
python爬虫项目-爬取雪球网金融数据（关注、持续更新）
(一)python金融数据爬虫项目爬取目标:雪球网(起始url:https://xueqiu.com/hq#exchange=CN&firstName=1&secondName=1_ ...

随机推荐

JS中注入eval, Function等系统函数截获动态代码
正文现在很多网站都上了各种前端反爬手段,无论手段如何,最重要的是要把包含反爬手段的前端javascript代码加密隐藏起来,然后在运行时实时解密动态执行. 动态执行js代码无非两种方法,即eval和 ...
大数据技术之kettle（2）——练习三个基本操作
一.同一数据库两表数据关联更新实现效果:把stu1的数据按id同步到stu2,stu2有相同id则更新数据步骤: 1.在mysql中创建两张表: mysql>create database ...
windows powershell学习
PowerShell,从名字可以知道,他首先是一个shell,shell的意思就是和Linux的bash等一样.和原来的cmd一样就是在里边敲命令(可执行文件)使用: 而Power就意味他是一个功能强 ...
Could not attach to pid : "xx"最近启动Xcode运行项目都会出现这个问题，再次启动或者多启动几次，就可以正常运行工程了。
最近启动Xcode运行项目都会出现这个问题,再次启动或者多启动几次,就可以正常运行工程了. 普及一下:PID(进程控制符)英文全称为Process Identifier,它也属于电工电子类技术术语. ...
git如何查找某个包含指定字符串的commit hash值?
答: git shortlog --format='%H|%cn|%s' | grep '需要查找的字符串内容'
Visual Studio 2019更新到16.2.2
Visual Studio 2019更新到16.2.2 此次更新的变化有以下几点: (1)修复了Visual Studio在关闭时的停止响应问题.(2)修复CVE-2019-1211权限提升漏洞.(3 ...
小D课堂 - 零基础入门SpringBoot2.X到实战_第1节零基础快速入门SpringBoot2.0_1、SpringBoot2.x课程介绍和高手系列知识点
1 ======================1.零基础快速入门SpringBoot2.0 5节课 =========================== 1.SpringBoot2.x课程全套介绍 ...
Spring mvc4 + ActiveMQ 整合【什么框架与什么框架的整合搜索】
一.配置部分二.代码部分三.页面部分四.Controller控制器五.效果展示六.加入监听器七.最最重要的,别忘了打赏一.配置部分 ActiveMQ的安装这就不说了,很简单, 这个例子采 ...
Spring cloud微服务安全实战-4-5搭建OAuth2认证服务器
现在可以访问我们的认证服务器,应用我们已经配置好了. 下面配置让用户可以访问我的认证服务器.再来重写一个方法. EndpointConfigure端点的配置. authenticationManage ...
微信小程序技巧记录
1.直接在app.json中添加pages,会自动按照路径生成page目录文件: 2.动态修改样式: /** * 页面的初始数据 */ data: { authorInfo: [], article: ...

python实战项目 — 爬取中国票房网年度电影信息并保存在csv

python实战项目 — 爬取中国票房网年度电影信息并保存在csv的更多相关文章

随机推荐

热门专题