Python爬虫实现抓取腾讯视频所有电影【实战必学】
前言
本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。
作者: Python新手学习之家
用python实现的抓取腾讯视频所有电影的爬虫

- # -*- coding: utf-8 -*-
- import re
- import urllib2
- from bs4 import BeautifulSoup
- import string, time
- import pymongo
- NUM = 0 #全局变量,电影数量
- m_type = u'' #全局变量,电影类型
- m_site = u'qq' #全局变量,电影网站
- #根据指定的URL获取网页内容
- def gethtml(url):
- req = urllib2.Request(url)
- response = urllib2.urlopen(req)
- html = response.read()
- return html
- '''
- 在学习过程中有什么不懂得可以加我的python学习交流扣扣qun,934109170,群里有不错的学习教程与开发工具。
- '''
- #从电影分类列表页面获取电影分类
- def gettags(html):
- global m_type
- soup = BeautifulSoup(html) #过滤出分类内容
- #print soup
- #<ul class="clearfix _group" gname="mi_type" gtype="1">
- tags_all = soup.find_all('ul', {'class' : 'clearfix _group' , 'gname' : 'mi_type'})
- #print len(tags_all), tags_all
- #print str(tags_all[1]).replace('\n', '')
- #<a _hot="tag.sub" class="_gtag _hotkey" href="http://v.qq.com/list/1_0_-1_-1_1_0_0_20_0_-1_0.html"title="动作" tvalue="0">动作</a>
- re_tags = r'<a _hot=\"tag\.sub\" class=\"_gtag _hotkey\" href=\"(.+?)\" title=\"(.+?)\" tvalue=\"(.+?)\">.+?</a>'
- p = re.compile(re_tags, re.DOTALL)
- tags = p.findall(str(tags_all[0]))
- if tags:
- tags_url = {}
- #print tags
- for tag in tags:
- tag_url = tag[0].decode('utf-8')
- #print tag_url
- m_type = tag[1].decode('utf-8')
- tags_url[m_type] = tag_url
- else:
- print "Not Find"
- return tags_url
- #获取每个分类的页数
- def get_pages(tag_url):
- tag_html = gethtml(tag_url)
- #div class="paginator
- soup = BeautifulSoup(tag_html) #过滤出标记页面的html
- #print soup
- #<div class="mod_pagenav" id="pager">
- div_page = soup.find_all('div', {'class' : 'mod_pagenav', 'id' : 'pager'})
- #print div_page #len(div_page), div_page[0]
- #<a class="c_txt6" href="http://v.qq.com/list/1_2_-1_-1_1_0_24_20_0_-1_0.html" title="25"><span>25</span></a>
- re_pages = r'<a class=.+?><span>(.+?)</span></a>'
- p = re.compile(re_pages, re.DOTALL)
- pages = p.findall(str(div_page[0]))
- #print pages
- if len(pages) > 1:
- return pages[-2]
- else:
- return 1
- def getmovielist(html):
- soup = BeautifulSoup(html)
- #<ul class="mod_list_pic_130">
- divs = soup.find_all('ul', {'class' : 'mod_list_pic_130'})
- #print divs
- for div_html in divs:
- div_html = str(div_html).replace('\n', '')
- #print div_html
- getmovie(div_html)
- def getmovie(html):
- global NUM
- global m_type
- global m_site
- re_movie = r'<li><a class=\"mod_poster_130\" href=\"(.+?)\" target=\"_blank\" title=\"(.+?)\"><img.+?</li>'
- p = re.compile(re_movie, re.DOTALL)
- movies = p.findall(html)
- if movies:
- conn = pymongo.Connection('localhost', 27017)
- movie_db = conn.dianying
- playlinks = movie_db.playlinks
- #print movies
- for movie in movies:
- #print movie
- NUM += 1
- print "%s : %d" % ("=" * 70, NUM)
- values = dict(
- movie_title = movie[1],
- movie_url = movie[0],
- movie_site = m_site,
- movie_type = m_type
- )
- print values
- playlinks.insert(values)
- print "_" * 70
- NUM += 1
- print "%s : %d" % ("=" * 70, NUM)
- #else:
- # print "Not Find"
- def getmovieinfo(url):
- html = gethtml(url)
- soup = BeautifulSoup(html)
- #pack pack_album album_cover
- divs = soup.find_all('div', {'class' : 'pack pack_album album_cover'})
- #print divs[0]
- #<a href="http://www.tudou.com/albumplay/9NyofXc_lHI/32JqhiKJykI.html" target="new" title="《血滴子》独家纪录片" wl="1"> </a>
- re_info = r'<a href=\"(.+?)\" target=\"new\" title=\"(.+?)\" wl=\".+?\"> </a>'
- p_info = re.compile(re_info, re.DOTALL)
- m_info = p_info.findall(str(divs[0]))
- if m_info:
- return m_info
- else:
- print "Not find movie info"
- return m_info
- def insertdb(movieinfo):
- global conn
- movie_db = conn.dianying_at
- movies = movie_db.movies
- movies.insert(movieinfo)
- if __name__ == "__main__":
- global conn
- tags_url = "http://v.qq.com/list/1_-1_-1_-1_1_0_0_20_0_-1_0.html"
- #print tags_url
- tags_html = gethtml(tags_url)
- #print tags_html
- tag_urls = gettags(tags_html)
- #print tag_urls
- for url in tag_urls.items():
- print str(url[1]).encode('utf-8') #,url[0]
- maxpage = int(get_pages(str(url[1]).encode('utf-8')))
- print maxpage
- for x in range(0, maxpage):
- #http://v.qq.com/list/1_0_-1_-1_1_0_0_20_0_-1_0.html
- m_url = str(url[1]).replace('0_20_0_-1_0.html', '')
- movie_url = "%s%d_20_0_-1_0.html" % (m_url, x)
- print movie_url
- movie_html = gethtml(movie_url.encode('utf-8'))
- #print movie_html
- getmovielist(movie_html)
- time.sleep(0.1)
Python爬虫实现抓取腾讯视频所有电影【实战必学】的更多相关文章
- 用python实现的抓取腾讯视频所有电影的爬虫
1. [代码]用python实现的抓取腾讯视频所有电影的爬虫 # -*- coding: utf-8 -*-# by awakenjoys. my site: www.dianying.atim ...
- 【Python3 爬虫】16_抓取腾讯视频评论内容
上一节我们已经知道如何使用Fiddler进行抓包分析,那么接下来我们开始完成一个简单的小例子 抓取腾讯视频的评论内容 首先我们打开腾讯视频的官网https://v.qq.com/ 我们打开[电视剧]这 ...
- 【转】Python爬虫:抓取新浪新闻数据
案例一 抓取对象: 新浪国内新闻(http://news.sina.com.cn/china/),该列表中的标题名称.时间.链接. 完整代码: from bs4 import BeautifulSou ...
- Python爬虫:抓取新浪新闻数据
案例一 抓取对象: 新浪国内新闻(http://news.sina.com.cn/china/),该列表中的标题名称.时间.链接. 完整代码: from bs4 import BeautifulSou ...
- Python爬虫,抓取淘宝商品评论内容!
作为一个资深吃货,网购各种零食是很频繁的,但是能否在浩瀚的商品库中找到合适的东西,就只能参考评论了!今天给大家分享用python做个抓取淘宝商品评论的小爬虫! 思路 我们就拿"德州扒鸡&qu ...
- python爬虫:抓取下载电影文件,合并ts文件为完整视频
目标网站:https://www.88ys.cc/vod-play-id-58547-src-1-num-1.html 反贪风暴4 对电影进行分析 我们发现,电影是按片段一点点加载出来的,我们分别抓取 ...
- python爬虫数据抓取方法汇总
概要:利用python进行web数据抓取方法和实现. 1.python进行网页数据抓取有两种方式:一种是直接依据url链接来拼接使用get方法得到内容,一种是构建post请求改变对应参数来获得web返 ...
- python爬虫批量抓取ip代理
使用爬虫抓取数据时,经常要用到多个ip代理,防止单个ip访问太过频繁被封禁.ip代理可以从这个网站获取:http://www.xicidaili.com/nn/.因此写一个python程序来获取ip代 ...
- Python爬虫:抓取手机APP的数据
摘要 大多数APP里面返回的是json格式数据,或者一堆加密过的数据 .这里以超级课程表APP为例,抓取超级课程表里用户发的话题. 1.抓取APP数据包 表单: 表单中包括了用户名和密码,当然都是加密 ...
随机推荐
- Secure CRT注册码
secure CRT 把记忆的东西放在这就行了,:) SecureCRT 5.2.2的注册码 Name: Apollo InteractiveCompany: Apollo ...
- docker入门篇
在网上的教程中,大多数是建议利用linux来安装docker,在此我也建议大家用linux安装,为什么?请看下图 docker使用go语言开发,并且运行在linux系统下,而如果想用window运行, ...
- libwebsocket协议切换状态机
libwebsocket为连接(connection)定义了一组状态机-lws_connection_states,通过状态机我们来看libwebsocket如何实现协议的切换.除了lws_conne ...
- Windows使用Java执行cmd代码
话不多说,直入正题 今天给大家分享下,怎么在Windows上使用Java执行Cmd代码! 首先默认大家都熟悉cmd代码,以及cmd的命令行操作. 直接在main方法中写这一行(需要抛出异常),可以直接 ...
- tomcat-9.0.20部署后输出窗口乱码解决方案
问题:启动tomcat的时候,窗口乱码,默认都是UTF-8的,但是控制台是GBK的,要保持一致 可以通过控制台查看本机的编码: : 936 代表 GB2312 解决办法:打开tomcat目录下的c ...
- HTML 空元素(转)
HTML 空元素 在 HTML 中,通常在一个空元素上使用一个闭标签是无效的.例如,<input type="text"> </input> 的闭标签是无效 ...
- 使用laravel快速构建vuepress管理器
使用laravel快速构建vuepress管理器 介绍 刚刚学了下laravel感觉很方便,最近也在用vuepress做个人博客,但是感觉每次写文章管理文章不是特别方便,就使用laravel写了这个v ...
- SpringBoot:带你认认真真梳理一遍自动装配原理
前言 Spring翻译为中文是“春天”,的确,在某段时间内,它给Java开发人员带来过春天,但是随着我们项目规模的扩大,Spring需要配置的地方就越来越多,夸张点说,“配置两小时,Coding五分钟 ...
- ES集群操作原理
路由 当你索引一个文档,它被存储在单独一个主分片上.Elasticsearch 是如何知道文档属于哪个分片的呢?当你创建一个新文档,它是如何知道是应该存储在分片 1 还是分片 2 上的呢? 进程不能是 ...
- 【RN - 基础】之React Native组件的生命周期
下图描述了React Native中组件的生命周期: 从上图中可以看到,React Native组件的生命周期可以分为初始化阶段.存在阶段和销毁阶段. 实例化阶段 实例化阶段是React Native ...