python 爬虫系列04-电影天堂连接爬虫

学习的第四个爬虫

from lxml import etree

import requests

BASE_D = 'http://www.dytt8.net'

headers = {

    'User-Agent': "Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:62.0) Gecko/20100101 Firefox/62.0"

}

def get_detail_urls(url):

    response = requests.get(url, headers=headers)

    text = response.text

    html = etree.HTML(text)

    detail_urls = html.xpath("//table[@class='tbspan']//a/@href")

    detail_urls = map(lambda url: BASE_D+url, detail_urls)

    return detail_urls

def parse_detail_page(url):

    movie = {}

    response = requests.get(url, headers=headers)

    text = response.content.decode('gbk')

    html = etree.HTML(text)

    title = html.xpath("//div[@class='title_all']//font[@color='#07519a']/text()")[0]

    # for x in title:

    #     print(etree.tostring(x,encoding='utf-8').encode('utf-8'))

    movie['title'] = title

    zoomE = html.xpath("//div[@id='Zoom']")[0]

    imgs = zoomE.xpath(".//img/@src")

    cover = imgs[0]

   # screenshot = imgs[1]

    movie['cover'] = cover

    #movie['screenshot'] = screenshot

    def parse_info(info,rule):

        return info.replace(rule,"").strip()

    infos = zoomE.xpath(".//text()")

    for index,info in enumerate(infos):

        # print(info)

        # print(index)

        # print("="*30)

        if info.startswith("◎年　　代"):

            info = parse_info(info, "◎年　　代")

            movie['year'] = info

        elif info.startswith("◎产　　地"):

            info = parse_info(info, "◎产　　地")

            movie['country'] = info

        elif info.startswith("◎类　　别"):

            info = parse_info(info, "◎类　　别")

            movie['category'] = info

        elif info.startswith("◎豆瓣评分"):

            info = parse_info(info, "◎豆瓣评分")

            movie['category'] = info

        elif info.startswith("◎片　　长"):

            info = parse_info(info, "◎片　　长")

            movie['duration'] = info

        elif info.startswith("◎导　　演"):

            info = parse_info(info, "◎导　　演")

            movie['director'] = info

        elif info.startswith("◎主　　演"):

            info = parse_info(info, "◎主　　演")

            actors = [info]

            for x in range(index+1, len(infos)):

                actor = infos[x].strip()

                if actor.startswith("◎"):

                    break

                actors.append(actor)

            movie['actors'] = actors

        elif info.startswith("◎简　　介 "):

            info = parse_info(info, "◎简　　介 ")

            for x in range(index+1, len(infos)):

                profile = infos[x].strip()

                movie["profile"] = profile

    download_url = html.xpath("//td[@bgcolor='#fdfddf']/a/@href")[0]

    movie['download_url'] = download_url

    return movie

def spider():

    base_url = "http://www.dytt8.net/html/gndy/dyzz/list_23_{}.html"

    movies = []

    for x in range(1,8):

        # print("="*30)

        # print(x)

        url = base_url.format(x)

        detail_urls = get_detail_urls(url)

        for detail_url in detail_urls:

            movie = parse_detail_page(detail_url)

            movies.append(movie)

            print(movie)

if __name__ =='__main__':

    spider()

python 爬虫系列04-电影天堂连接爬虫的更多相关文章

Python多线程爬虫爬取电影天堂资源
最近花些时间学习了一下Python,并写了一个多线程的爬虫程序来获取电影天堂上资源的迅雷下载地址,代码已经上传到GitHub上了,需要的同学可以自行下载.刚开始学习python希望可以获得宝贵的意见. ...
Python爬虫 -- 抓取电影天堂8分以上电影
看了几天的python语法,还是应该写个东西练练手.刚好假期里面看电影,找不到很好的影片,于是有个想法,何不搞个爬虫把电影天堂里面8分以上的电影爬出来.做完花了两三个小时,撸了这么一个程序.反正蛮简单 ...
爬虫系列 | 6、详解爬虫中BeautifulSoup4的用法
bs4,全称BeautifulSoup 4 , 它是Python独有的一种解析方式.也就是说只有Python语言才可以通过这种方式去解析数据. BeautifulSoup 3 只支持Python2,所 ...
爬虫day 04(通过登录去爬虫解决django的csrf_token)
#通过登录去爬虫 #首先要有用户名和密码 import urllib.request import http.cookiejar from lxml import etree head = { 'Co ...
Python3爬虫系列：理论+实验+爬取妹子图实战
Github: https://github.com/wangy8961/python3-concurrency-pics-02 ,欢迎star 爬虫系列: (1) 理论 Python3爬虫系列01 ...
一篇文章教会你利用Python网络爬虫获取电影天堂视频下载链接
[一.项目背景] 相信大家都有一种头疼的体验,要下载电影特别费劲,对吧?要一部一部的下载,而且不能直观的知道最近电影更新的状态. 今天小编以电影天堂为例,带大家更直观的去看自己喜欢的电影,并且下载下来 ...
python 全栈开发，Day134(爬虫系列之第1章-requests模块)
一.爬虫系列之第1章-requests模块爬虫简介概述近年来,随着网络应用的逐渐扩展和深入,如何高效的获取网上数据成为了无数公司和个人的追求,在大数据时代,谁掌握了更多的数据,谁就可以获得更高的 ...
【Python】理想论坛帖子读取爬虫1.04版
1.01-1.03版本都有多线程争抢DB的问题,线程数一多问题就严重了. 这个版本把各线程要添加数据的SQL放到数组里,等最后一次性完成,这样就好些了.但乱码问题和未全部完成即退出现象还在,而且速度上 ...
scrapy电影天堂实战(二)创建爬虫项目
公众号原文创建数据库我在上一篇笔记中已经创建了数据库,具体查看<scrapy电影天堂实战(一)创建数据库>,这篇笔记创建scrapy实例,先熟悉下要用到到xpath知识用到的xpat ...

随机推荐

jquery表单数据验证扩展方法
/** 表单数据验证 **/ $.fn.Validform = function () { var Validatemsg = ""; var Validateflag = tru ...
Http Live Streaming 实现iphone在线播放视频[转]
http://hi.baidu.com/lphack/item/83865611c5f82c8988a956df 本人新手,难免会出错,请各位指点! 最近要做一个项目,是通过iphone来播放工厂摄像 ...
（转）XSS危害——session劫持
原文地址:http://www.cnblogs.com/dolphinX/p/3403027.html 在跨站脚本攻击XSS中简单介绍了XSS的原理及一个利用XSS盗取存在cookie中用户名和密码的 ...
[Lua快速了解一下]Lua运行
-Lua的Hello World print("Hello World") 分号可选 -类似python,进入Lua后再shell中打命令执行语句也可 > print(&qu ...
"window.location.href"、"location.href"是本页面跳转
"window.location.href"."location.href"是本页面跳转 "parent.location.href"是上一 ...
php代码审计2全局变量和超全局变量
全局变量:就是在函数外面定义的变量,不能在函数中直接使用,因为它的作用域不会到函数内部,所以在函数内部使用的时候尝尝看到类似global $a; 超全局变量:在所有脚本都有效,所以,在函数可以直接使用 ...
python-循环（while循环、for循环）
循环:循环会重复执行循环体里面的代码,python中循环可分为while循环和for循环. break 不管循环有没有完成,立即结束循环 continue 结束本次循环,继续进行下一次循环一.whi ...
题解 P3717 【[AHOI2017初中组]cover】
题目链接本题的大致思路就是搜索. 将矩阵初始化成false.先把灯塔标记.在搜一遍灯塔能照到的点并标记.最后搜一遍找被灯塔标记的个数. 详细解释见题解. 题解走起. #include<bits ...
关于pip无法安装scrapy的问题
安装scrapy时如果出现下列问题: building ' twisted. test. raiser' extension error: Microsoft Visual C++ 14.0 is r ...
PAT天梯赛L3-015 球队食物链
读题可以知道是DFS,注意一点,题目说的是赢过,所以str[i][j]=‘W',那么g[i][j]=1,str[i][j]='L',g[j][i]=1 然后就常规搜索即可,还有一点就是剪枝,如果没有可 ...

python 爬虫系列04-电影天堂连接爬虫

python 爬虫系列04-电影天堂连接爬虫的更多相关文章

随机推荐

热门专题