python爬虫基础应用----爬取校花网视频

一.爬虫简单介绍

　　爬虫是什么?

　　爬虫是首先使用模拟浏览器访问网站获取数据,然后通过解析过滤获得有价值的信息,最后保存到到自己库中的程序.

　　爬虫程序包括哪些模块?

　　python中的爬虫程序主要包括,requests请求库,seleium请求库,xpath和BeautSoup4解析库,

　　爬取校花网需要使用到哪些模块?

　　校花网结构简单,而且没有任何防爬手段,所在只需要使用requests就可以完成了=.=.

二.具体操作

　　1.获得网页

　　网站地址:http://www.xiaohuar.com/

　　我要爬取的视频网页主页为http://www.xiaohuar.com/list-3-0.html

　　下一页为http://www.xiaohuar.com/list-3-1.html

　　总共有五页所以,拼接生成五页主页.

url = 'http://www.xiaohuar.com/list-3-{}.html'

for line in range():

    index_url = url.format(line)

　　2.主页解析

　　主页中跳转到详情页的连接在这里

#使用正则可以获得详情页网址.

re.findall('<div class="items".*?<a href="(.*?)"',index_res,re.S)

　　3.详情页解析

　　详情页中的视频连接在这个位置

#正则匹配获得视频的网址

video_url = re.findall('<source src="(.*?)">',detail_page,re.S) 

# 顺便获得视频的名字

video_name = re.findall('<h1>(.*?)</h1>',detail_page,re.S)

　　4.保存视频

　　将上获得的网址与视频名传入函数,打开网址将内容保存到video中 "视频名字".mp4的文件中,

def save_video(video_dic):

    try:

        video_url=video_dic.get('url')

        video_name=video_dic.get('name')

        video = requests.get(video_url)

        with open(r'video/%s.mp4'%video_name,'wb') as f:

            f.write(video.content)

            f.flush()

    except Exception:

        pass

　　5.全部执行代码

import requests

import re

import uuid

#一.获取网页

url='http://www.xiaohuar.com/'

def get_page(url):

    index_res = requests.get(url)

    return index_res.text

#二.解析网站

# 解析主页

def parse_index(index_res):

    detail_url_list = re.findall('<div class="items".*?<a href="(.*?)"',index_res,re.S)

    return detail_url_list

#解析详情页

def parse_detail(detail_page):

    video_url = re.findall('<source src="(.*?)">',detail_page,re.S)

    video_name = re.findall('<h1>(.*?)</h1>',detail_page,re.S)

    print(video_url)

    print(video_name)

    if video_url:

        video_url=video_url[0]

        if video_name:

            video_name=video_name[0]

            return {'url': video_url, 'name': video_name}

        else:

            video_name=uuid.uuid4()

            return {'url':video_url,'name':video_name}

#三.保存视频

def save_video(video_dic):

    try:

        video_url=video_dic.get('url')

        video_name=video_dic.get('name')

        video = requests.get(video_url)

        with open(r'video/%s.mp4'%video_name,'wb') as f:

            f.write(video.content)

            f.flush()

    except Exception:

        pass

if __name__=='__main__':

    url = 'http://www.xiaohuar.com/list-3-{}.html'

    for line in range(5):

        index_url = url.format(line)

        print(index_url)

        # 获得主页文本

        index_res = get_page(index_url)

        # 解析主页,获得详情页网址列表

        detail_url_list = parse_index(index_res)

        print(detail_url_list)

        for detail_url in detail_url_list:

            detail_page = get_page(detail_url)

            video_dic=parse_detail(detail_page)

            save_video(video_dic)

python爬虫基础应用----爬取校花网视频的更多相关文章

Python爬虫训练：爬取酷燃网视频数据
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理项目目标爬取酷燃网视频数据 https://krcom.cn/ 环境 Py ...
Scrapy爬虫框架之爬取校花网图片
Scrapy Scrapy是一个为了爬取网站数据,提取结构性数据而编写的应用框架. 其可以应用在数据挖掘,信息处理或存储历史数据等一系列的程序中.其最初是为了页面抓取 (更确切来说, 网络抓取 )所设 ...
Python-爬取校花网视频(单线程和多线程版本)
一.参考文章 python爬虫爬取校花网视频,单线程爬取爬虫----爬取校花网视频,包含多线程版本上述两篇文章都是对校花网视频的爬取,由于时间相隔很久了,校花网上的一些视频已经不存在了,因此上述文 ...
python爬虫-基础入门-爬取整个网站《3》
python爬虫-基础入门-爬取整个网站<3> 描述: 前两章粗略的讲述了python2.python3爬取整个网站,这章节简单的记录一下python2.python3的区别 python ...
python爬虫-基础入门-爬取整个网站《2》
python爬虫-基础入门-爬取整个网站<2> 描述: 开场白已在<python爬虫-基础入门-爬取整个网站<1>>中描述过了,这里不在描述,只附上 python3 ...
python爬虫-基础入门-爬取整个网站《1》
python爬虫-基础入门-爬取整个网站<1> 描述: 使用环境:python2.7.15 ,开发工具:pycharm,现爬取一个网站页面(http://www.baidu.com)所有数 ...
Go语言实战-爬取校花网图片
一.目标网站分析爬取校花网http://www.xiaohuar.com/大学校花所有图片. 经过分析,所有图片分为四个页面,http://www.xiaohuar.com/list-1-0.htm ...
python实战项目 — 爬取校花网图片
重点: 1. 指定路径创建文件夹,判断是否存在 2. 保存图片文件 # 获得校花网的地址,图片的链接 import re import requests import time import os ...
scrapy爬取校花网男神图片保存到本地
爬虫四部曲,本人按自己的步骤来写,可能有很多漏洞,望各位大神指点指点 1.创建项目 scrapy startproject xiaohuawang scrapy.cfg: 项目的配置文件xiaohua ...

随机推荐

通过JS动态的修改HTML元素的样式和增添标签元素等
一. 通过JS动态的修改HTML元素的样式 1. 要想在js中动态的修改HTML元素的样式,首先需要写document, document我们称之为文档对象,这个对象中保存了当前网页中所有的 ...
SSH实现登陆拦截器
/** * 登录验证拦截器 * */ @SuppressWarnings("serial") public class LoginInteceptor implements Int ...
ElasticSearch head 插件安装
head 客户端可以很方便在上面创建索引,类型,文档,还有查询,使用它管理elasticsearch 提高效率. 在安装head 客户端之前必须安装node.js 环境,因为它是用node.js 编写 ...
axis根据wsdl生成java客户端代码
根据wsdl生成java客户端代码有多个方法,其中使用axis生成的代码比较友好,也是经常用的一种方法.首先下载axis jar包:axis-bin-1_4.zip 官方地址:http://ws.Ap ...
java：编程比赛中有用的方法整理（一）数组
我曾经参加过几次编程比赛,但是当时用的是c语言,现在学习了java,打算专攻java组,故以此整理. 数组无论在哪里都必不可少. 一.数组的拷贝: 使用Arrays类的copyOf方法: 1.将一个数 ...
在项目管理中如何保持专注，分享一个轻量的时间管理工具【Flow Mac版 - 追踪你在Mac上的时间消耗】
在项目管理和团队作业中,经常面临的问题就是时间管理和优先级管理发生问题,项目被delay,团队工作延后,无法达到预期目标. 这个仿佛是每个人都会遇到的问题,特别是现在这么多的内容软件来分散我们的注意力 ...
一篇文章了解Github和Git教程-AndroidStudio上传Github教程
前言为了方便保存自己的代码,下班后可以回家继续进行,自己的码农工作,介绍一下Github. 什么是Github呢? 作为一个编程人员,我觉得得了解一下Github吧! 当然,如果你放弃了码农或者技术 ...
Linux SVN安装
step1:检查是否已经安装Svn Server. svnserve --version step2:执行安装 step3:创建代码仓库进入对应目录: 说明: conf:配置文件 db:数据存储文件 ...
C#格式化
格式化表示的一般格式 { N [ , M ] [ :格式码 ] } N: 指定参数序列中的输出序号,比如{0} , {1}, {2}等. M: 指定参数输出的最小长度. 如果参数长度小于M,则空格填 ...
NTFS权限和共享权限的区别
共享权限共享权限有三种:完全控制.更改.读取共持本地安全性.换句话说,他在同一台计算机上以不同用户名登录,对硬盘上同一文件夹可以有不同的访问权限. 注意:NTFS权限对从网络访问和本机登录的用户都 ...

python爬虫基础应用----爬取校花网视频

python爬虫基础应用----爬取校花网视频的更多相关文章

随机推荐

热门专题