Python新手爬虫四：爬取视频

老样子，先上最后成功源码（在D盘下创建'好看视频'文件夹，直接运行即可获取视频）：

import sys

import re,os

import requests

from you_get import common as you_get

def getVideo(url,path,headers):

    demo = requests.get(url,headers=headers)　　# 获取网站信息

    data = demo.json()　　# 转换为JSON格式

    data_list = data['data']['response']['videos']　　# 获取每个视频的属性列表

    # 遍历，将每一个视频信息展示出来

    for i in data_list:

        title = i['title'] + '.mp4'　　# 获取视频名称(描述)，视频要修改为的名称，为后边改名做准备

        url1 = i['play_url']　　# 获取视频源url

        videoName = re.split('\?|/',url1)[5][:80]+'.mp4'　　# 视频下载后，会是一大串字母和数字的组合，这个主要就是获取视频下载后的原名称

        # 开始下载

        print('开始下载：' + title)

        try:

            sys.argv = ['you_get', '-o',path,url1]　　# 视频的属性编辑，选择路径等

            you_get.main()　　# 开始下载

            print('下载完成')

            os.rename(path + videoName, path + title)　　# 下载完成后，改名操作

        except:

            print(title + '下载失败!')

if __name__ == '__main__':

    url = 'https://haokan.baidu.com/videoui/api/videorec?tab=yingshi&act=pcFeed&pd=pc&num=20&shuaxin_id=1592551368953'

    headers = {

        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/83.0.4103.106 Safari/537.36 Edg/83.0.478.54',

        'cookie': 'BIDUPSID=517516CBF0261FA0AF6B039EAFEDF39C; PSTM=1589624436; BAIDUID=517516CBF0261FA090A0395C8BF0F31A:FG=1; BDORZ=B490B5EBF6F3CD402E515D22BCDA1598; PC_TAB_LOG=haokan_website_page; Hm_lvt_4aadd610dfd2f5972f1efee2653a2bc5=1592530622,1592545903; H_PS_PSSID=31906_1444_31671_21118_31254_32045_30823_32111; delPer=0; PSINO=2; yjs_js_security_passport=d270bf2526b634428ea81932e213c285b8e7cf21_1592546748_js; Hm_lpvt_4aadd610dfd2f5972f1efee2653a2bc5=1592550475; reptileData=%7B%22data%22%3A%22e3b78a008f54876b4fc19fe55faea5fb1ae054d9580474b00db252837ba6a6554cbfde0ada4567b9cad2322c5d972031cb300664e248e8f4a7b27fd91a479f4e02a1e7eceffa642289eba12075334687515e1451aa72eced7ac42e3fbb88a87139c95727da119f5dd9b85d281d98d4d98b943f43a06c3f13e6b63b812c5c40ce%22%2C%22key_id%22%3A%2230%22%2C%22sign%22%3A%2243b164d6%22%7D'}

    path = r'D:\好看视频\\'

    getVideo(url,path,headers)

下载过程：

视频展示：因为爬取的是推荐视频，每次执行会获取不同的视频。

先来介绍一下所用到的库

1、requests库：众所周知，爬虫神器

2、re库：主要用来split的

3、sys和you-get库：主要任务下载视频

4、os库：用来修改文件名

注意：库没安装记得pip install 库名

下边捋一下思路

1、进入好看视频网站—>影视（或者推荐随便哪个分类）—>随便找个视频右击—>检查

2、选择网络—>XHR—>选择包

获取到当前界面

3、展开data—>response—>videos层层扒开

会发现所有的视频id、title都在这里，格式是JSON

4、再来展开其中一条视频的信息，下边还有，截屏不全，视频所有的信息都在这了

5、我们主要用到的有title、play_url，你会发现，箭头所指的方向还有一个url标签，当你不确定url到底是哪个时，你可以直接复制到浏览器打开查看一下

6、到这里，视频的名称和url就已经获取到了，具体的实现过程就看上边的源码吧，基本都有注释

7、这里要简单说一下you-get库，是个非常强大的下载视频库，除了在脚本上应用，也可以直接在cmd中执行，先看下它支持的选项：

主要用到的有两个，一个是 -o 指定路径，另一个是--debug主要在错误时打印日志

比如随便找个B站视频下载下来：

是不是巨方便

Python新手爬虫四：爬取视频的更多相关文章

python之爬虫（爬取.ts文件并将其合并为.MP4文件——以及一些异常的注意事项）
//20200115 最近在看“咱们裸熊——we bears”第一季和第三季都看完了,单单就第二季死活找不到,只有腾讯有资源,但是要vip……而且还是国语版……所以就瞄上了一个视频网站——可以在线观看 ...
python爬虫（爬取视频）
爬虫爬视频爬取步骤第一步:获取视频所在的网页第二步:F12中找到视频真正所在的链接第三步:获取链接并转换成机械语言第四部:保存保存步骤代码 import re import request ...
利用python的爬虫技术爬取百度贴吧的帖子
在爬取糗事百科的段子后,我又在知乎上找了一个爬取百度贴吧帖子的实例,为了巩固提升已掌握的爬虫知识,于是我打算自己也做一个. 实现目标:1,爬取楼主所发的帖子 2,显示所爬去的楼层以及帖子题目 3,将爬 ...
python网络爬虫《爬取get请求的页面数据》
一.urllib库 urllib是python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在python3中的为urllib.request和urllib. ...
python网络爬虫--简单爬取糗事百科
刚开始学习python爬虫,写了一个简单python程序爬取糗事百科. 具体步骤是这样的:首先查看糗事百科的url:http://www.qiushibaike.com/8hr/page/2/?s=4 ...
Python网络爬虫_爬取Ajax动态加载和翻页时url不变的网页
1 . 什么是 AJAX ? AJAX = 异步 JavaScript 和 XML. AJAX 是一种用于创建快速动态网页的技术. 通过在后台与服务器进行少量数据交换,AJAX 可以使网页实现异步更新 ...
Python学习 —— 爬虫入门 - 爬取Pixiv每日排行中的图片
更新于 2019-01-30 16:30:55 我另外写了一个面向 pixiv 的库:pixiver 支持通过作品 ID 获取相关信息.下载等,支持通过日期浏览各种排行榜(包括R-18),支持通过 p ...
初识python 之爬虫：爬取双色球中奖号码信息
人生还是要有梦想的,毕竟还有python.比如,通过python来搞一搞彩票(双色球).注:此文仅用于python学习,结果仅作参考.用到知识点:1.爬取网页基础数据2.将数据写入excel文件3.将 ...
初识python 之爬虫：爬取中国天气网数据
用到模块: 获取网页并解析:import requests,html5lib from bs4 import BeautifulSoup 使用pyecharts的Bar可视化工具"绘制图表& ...
初识python 之爬虫：爬取某网站的壁纸图片
用到的主要知识点:requests.get 获取网页HTMLetree.HTML 使用lxml解析器解析网页xpath 使用xpath获取网页标签信息.图片地址request.urlretrieve ...

随机推荐

WPF/C#：在WPF中如何实现依赖注入
前言本文通过 WPF Gallery 这个项目学习依赖注入的相关概念与如何在WPF中进行依赖注入. 什么是依赖注入依赖注入(Dependency Injection,简称DI)是一种设计模式,用于 ...
SqlParameter,参数化查询问题
SqlParameter p = new SqlParameter("@pageIndex", (object)pageIndex); SqlParameter带有两个参数的构造函 ...
JS原生实现html转pdf / html转图片 (html2canvas.js + jspdf.js )
<button onclick="HtmlToPdf()"> 转储pdf </button> <button onclick="HtmlTo ...
Python爬虫Post请求返回值为-1000
今天写了一个简单的爬虫程序,为了爬取kfc官网的餐厅数据,代码如下 # ajax的post请求--肯德基官网 def create_request(page): url='http://www.kfc ...
Kubernetes 部署Dashboard UI
实践环境 CentOS-7-x86_64-DVD-1810 Docker 19.03.9 Kubernetes version: v1.20.5 发布Dashboard 可以通过运行以下命令部署Das ...
数据结构：Deuque
#include <iostream> #include <stdio.h> #include <string> using namespace std; stru ...
vue codemirror sql编辑器功能可自定义提醒（关键字，库名，表名），高亮，主题
工作中再一次需要开发sql编辑器,优化上篇文章内容 https://www.cnblogs.com/Lu-Lu/p/14388888.html 本次功能是tab页打开多个sql编辑器,效果图: 安装: ...
PHP转Go系列 | 推荐一个强大的Go语言工具函数库
大家好,我是码农先森. 从 PHP 转到 Go 的朋友,常常会因为没有便捷的工具函数而感到苦恼.PHP 写的多了就会形成路径依赖,在写 Go 的时候时不时就会想到 PHP 强大的数组函数.当然写 Go ...
修改PE文件来实现管理员权限
在Windows我们常用的方法就是给应用添加app.manifest清单文件,然后生成的Exe就会具有管理员权限. 近期我在使用Wix制作Exe安装包时,发现此方法不通,我在github上和Stack ...
CMake学习（一）
CMake学习(一) 1.简介 CMake是一个强大的软件构建系统,可以用简单的语句来描述所有平台的安装(编译过程) 可以编译源代码.制作程序库.产生适配器(wrapper).还可以用任意的顺序建构执 ...

Python新手爬虫四：爬取视频

Python新手爬虫四：爬取视频的更多相关文章

随机推荐

热门专题