requests+BeautifulSoup | 爬取电影天堂全站电影资源

import requests

import urllib.request as ur

from bs4 import BeautifulSoup

import csv

import threading

class MovieHeven():

    def __init__(self):

        self.url="https://www.dytt8.net/html/gndy/dyzz/index.html"

        self.page=1

        self.No=1

        self.fobj=open("movies.csv", "wt", encoding="gbk", newline='')

    def spider(self):

        try:

            print("正在爬取第{}页...".format(self.page))

            # time.sleep(1)

            #获取网页链接并读取

            html = requests.get(self.url)#.Session()

            html.encoding="gbk"

            html=html.text

            #beautfulSoup装载文档

            root=BeautifulSoup(html,"lxml")

            #查找所需元素，获取tables列表

            tables=root.find("div",attrs={"class":"co_content8"}).find("ul").find_all("table")

            for table in tables:

                name = table.find("a").text

                href = "http://www.dytt8.net"+table.find("a")["href"]

                # 文件写入操作

                writer = csv.writer(self.fobj)

                writer.writerow([name, href])

                print("No:", self.No, name, href)

                self.No += 1

            # time.sleep(1)

            urls=root.find("div",attrs={"class":"co_content8"}).find("div",attrs={"class":"x"}).find_all("a")

            #寻找下一页的链接

            for u in urls:

                if u.text == "下一页":#如有下一页

                    self.url="https://www.dytt8.net/html/gndy/dyzz/"+u["href"]

                    print(self.url)

                    self.page += 1

                    self.spider()#爬取下一页

        # except:#没有下一页

        #     print("finished")

            # spider(url)

        except Exception as err:

            print(err)

    def main(self):

    ##    threading.Thread(target=spiderA(url)).start()

        import time

        begin_time = time.time()

        self.spider()  # 执行主程序

        self.fobj.close()

        end_time = time.time()

        time = end_time - begin_time

        m, s = divmod(round(time), 60)

        print("用时：{}min{}s".format(m, s))

if __name__ == '__main__':

    billie=MovieHeven()

    billie.main()

requests+BeautifulSoup | 爬取电影天堂全站电影资源的更多相关文章

使用requests+BeautifulSoup爬取龙族V小说
这几天想看龙族最新版本,但是搜索半天发现没有网站提供下载, 我又只想下载后离线阅读(写代码已经很费眼睛了).无奈只有自己爬取了. 这里记录一下,以后想看时,直接运行脚本下载小说. 这里是从 ...
python3 requests + BeautifulSoup 爬取阳光网投诉贴详情实例代码
用到了requests.BeautifulSoup.urllib等,具体代码如下. # -*- coding: utf-8 -*- """ Created on Sat ...
python 爬虫 requests+BeautifulSoup 爬取巨潮资讯公司概况代码实例
第一次写一个算是比较完整的爬虫,自我感觉极差啊,代码low,效率差,也没有保存到本地文件或者数据库,强行使用了一波多线程导致数据顺序发生了变化... 贴在这里,引以为戒吧. # -*- coding: ...
Python爬虫学习三------requests+BeautifulSoup爬取简单网页
第一次第一次用MarkDown来写博客,先试试效果吧! 昨天2018俄罗斯世界杯拉开了大幕,作为一个伪球迷,当然也得为世界杯做出一点贡献啦. 于是今天就编写了一个爬虫程序将腾讯新闻下世界杯专题的相关新 ...
python 爬虫（一） requests+BeautifulSoup 爬取简单网页代码示例
以前搞偷偷摸摸的事,不对,是搞爬虫都是用urllib,不过真的是很麻烦,下面就使用requests + BeautifulSoup 爬爬简单的网页. 详细介绍都在代码中注释了,大家可以参阅. # -* ...
requests+beautifulsoup爬取豆瓣图书
使用Xpath和BeautifulSoup来解析网页可以说真的很简便. import requests from bs4 import BeautifulSoup from random import ...
爬虫系列1：Requests+Xpath 爬取豆瓣电影TOP
爬虫1:Requests+Xpath 爬取豆瓣电影TOP [抓取]:参考前文爬虫系列1:https://www.cnblogs.com/yizhiamumu/p/9451093.html [分页]: ...
PYTHON 爬虫笔记八:利用Requests+正则表达式爬取猫眼电影top100（实战项目一）
利用Requests+正则表达式爬取猫眼电影top100 目标站点分析流程框架爬虫实战使用requests库获取top100首页: import requests def get_one_pag ...
使用Beautiful Soup爬取猫眼TOP100的电影信息
使用Beautiful Soup爬取猫眼TOP100的电影信息,将排名.图片.电影名称.演员.时间.评分等信息,提取的结果以文件形式保存下来. import time import json impo ...

随机推荐

oracle 11g打补丁错误（Missing command :fuser）
在给oracle 11g数据库打补丁的时候出现以下错误: [oracle@node01 31537677]$ $ORACLE_HOME/OPatch/opatch apply Oracle Inter ...
react第十八单元(redux中间件redux-thunk,redux工程目录的样板代码，规范目录结构)
第十八单元(redux中间件redux-thunk,redux工程目录的样板代码,规范目录结构) #课程目标中间件:中间件增强redux的可扩展性,实现功能复用的目的. redux-thunk异步逻 ...
C#中的深度学习（三）：理解神经网络结构
在这篇文章中,我们将回顾监督机器学习的基础知识,以及训练和验证阶段包括哪些内容. 在这里,我们将为不了解AI的读者介绍机器学习(ML)的基础知识,并且我们将描述在监督机器学习模型中的训练和验证步骤. ...
项目1_001_涉及知识点（Django任务追踪平台）
【进程/作业管理】篇章一：Linux进程及管理（专用内存监控类工具）------【vmstat、pmap】
主要讲解专用内存监控工具的使用:vmstat.pmap命令的使用. 命令概览: vmstat 显示虚拟内存状态 pmap 报告进程与内存映射关系 vmstat命令是最常见的Linux/Unix监控工具 ...
Prometheus从入门到精通：一、部署
一.Prometheus是什么? prometheus是一个开源指标监控解决方案,指标就是指的CPU的使用率.内存使用率等数据. 二.Prometheus的架构这里直接粘贴官网的架构图: 三.安装 ...
apk获取sha1值的方法
安卓应用都使用一个签名证书(.keystore或.jks文件)签名,签名证书可以由jdk生成.证书生成后,证书就有其sha1值. 使用此证书打包后的安卓应用,也有其一样的sha1值.md5值和sha2 ...
[leetcode]TwoSum系列问题
1.普通数组找两个数,哈希表建立数值和下标的映射,遍历时一边判断一边添加 /* 哇,LeetCode的第一题...啧啧 */ public int [] twoSum(int[] nums, int ...
[leetcode]罗马数字和阿拉伯数字相互转换
罗马转阿拉伯 public int romanToInt(String s) { /* 从左到右依次根据哈希表进行加法如果是"CM"900这种情况就要执行+M和-C处理 */ i ...
ubuntu系统64位dnw
/* dnw2 linux main file. This depends on libusb. * * * * Author: Fox <hulifox008@163.com> * * ...

requests+BeautifulSoup | 爬取电影天堂全站电影资源

requests+BeautifulSoup | 爬取电影天堂全站电影资源的更多相关文章

随机推荐

热门专题