【Python】【爬虫】【爬狼】004_正则规则模板及其应用

# 正则规则模板与应用（一）

先看这些视频，是在哪个div里面的

    for datapage in soup.find_all("div", class_="lpic"):

        # 一个li标签，包含一个视频

        for data in datapage.find_all("li"):

    # 不知道soup代表着什么，没关系，也别急着写，继续往后看

我们要获取的是

1.视频的标题

2.视频的类型

3.视频的介绍

4.视频的详情页链接

5.视频的封面图链接

正则规则模板

    # 正则规则开始

    gz_fan_title = re.compile(r'''<a href=".*?" title=".*?">(.*?)</a>''',re.S)

    gz_fan_url = re.compile(r'''<a href="(.*?)"''',re.S)

    gz_fan_url_img = re.compile(r'''referrerpolicy="no-referrer" src="(.*?)"''',re.S)

    gz_fan_type = re.compile(r'''<span>类型：(.*?)</span>''',re.S)

    gz_fan_message = re.compile(r'''<p>(.*?)</p>''', re.S)

    # 正则规则结束

应用正则规则模板

 		data = str(data)

                fan_title = re.findall(gz_fan_title, data)

                fan_url = re.findall(gz_fan_url, data)

                fan_img = re.findall(gz_fan_url_img, data)

                fan_type = re.findall(gz_fan_type, data)

                fan_message = re.findall(gz_fan_message, data)

那么上面的data是什么，怎么获得呢？

# 假设搜索love

pageNumber = xrilag_SearchAll("love")

# xrilag_SearchAll是自定义函数，想了解其具体代码的请查看博客https://www.cnblogs.com/mllt/p/python_pc_pl_edu_003.html

# pageNumber是搜索结果的总页数

# 使用for循环，一页一页进行处理

for page in range(pageNumber):

	# 根据页面跳转的地址改变规则写出页面含变量链接，然后进行源码获取，后面便可以对这一页展开分析与爬取数据了（https://www.cnblogs.com/mllt/p/python_pc_pl_edu_003.html）

    html_Document = xrilang_UrlToDocument("https://www.yhdmp.cc/s_all?kw=love&pagesize=24&pageindex=" + str(page))

    # xrilang_UrlToDocument是自定义函数，作用是获取网页源码。想了解其具体内容，请查看博客https://www.cnblogs.com/mllt/p/python_pc_pl_edu_002.html

    # 创建一个Beautiful Soup对象

    soup = BeautifulSoup(html_Document, "html.parser")  # parser是解释器

    # 使用了.kpic样式的div，包含且只包含了此页的所有视频列表

    for datapage in soup.find_all("div", class_="lpic"):

        # 一个li标签，包含一个视频

        for data in datapage.find_all("li"):

            # 应用正则规则模板

            data = str(data)

            fan_title = re.findall(gz_fan_title, data)

            fan_url = re.findall(gz_fan_url, data)

            fan_img = re.findall(gz_fan_url_img, data)

            fan_type = re.findall(gz_fan_type, data)

            fan_message = re.findall(gz_fan_message, data)

【Python】【爬虫】【爬狼】004_正则规则模板及其应用的更多相关文章

python爬虫—爬取英文名以及正则表达式的介绍
python爬虫—爬取英文名以及正则表达式的介绍爬取英文名: 一. 爬虫模块详细设计 (1)整体思路对于本次爬取英文名数据的爬虫实现,我的思路是先将A-Z所有英文名的连接爬取出来,保存在一个cs ...
Python爬虫 - 爬取百度html代码前200行
Python爬虫 - 爬取百度html代码前200行 - 改进版, 增加了对字符串的.strip()处理源代码如下: # 改进版, 增加了 .strip()方法的使用 # coding=utf-8 ...
用Python爬虫爬取广州大学教务系统的成绩（内网访问）
用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...
Python爬虫|爬取喜马拉雅音频
"GOOD Python爬虫|爬取喜马拉雅音频喜马拉雅是知名的专业的音频分享平台,用户规模突破4.8亿,汇集了有声小说,有声读物,儿童睡前故事,相声小品等数亿条音频,成为国内发展最快.规模 ...
python爬虫爬取内容中，-xa0，-u3000的含义
python爬虫爬取内容中,-xa0,-u3000的含义 - CSDN博客 https://blog.csdn.net/aiwuzhi12/article/details/54866310
Python爬虫爬取一篇韩寒新浪博客
网上看到大神对Python爬虫爬到非常多实用的信息,认为非常厉害.突然对想学Python爬虫,尽管自己没学过Python.但在网上找了一些资料看了一下,看到爬取韩寒新浪博客的视频.共三集,第一节讲爬取 ...
Python爬虫爬取全书网小说，程序源码+程序详细分析
Python爬虫爬取全书网小说教程第一步:打开谷歌浏览器,搜索全书网,然后再点击你想下载的小说,进入图一页面后点击F12选择Network,如果没有内容按F5刷新一下点击Network之后出现如下 ...
一个简单的python爬虫,爬取知乎
一个简单的python爬虫,爬取知乎主要实现爬取一个收藏夹里所有问题答案下的图片文字信息暂未收录,可自行实现,比图片更简单具体代码里有详细注释,请自行阅读项目源码: # -*- cod ...
python爬虫-爬取百度图片
python爬虫-爬取百度图片(转) #!/usr/bin/python# coding=utf-8# 作者 :Y0010026# 创建时间 :2018/12/16 16:16# 文件 :spider ...

随机推荐

仿函数（Functor）是什么？
仿函数(Functor) 仿函数是通过重载()运算符的类或结构体的对象.这样一个对象可以像普通函数一样被调用. 仿函数通常用于需要在对象内部保留状态或多次调用时有特定行为的情况. 特点: 仿函数是一个 ...
105份墨天轮“国产化迁移”干货文档汇总（含TiDB、openGauss、上云等）
当前国产数据库产品百花齐放,随着政策的推进.技术的迭代以及市场需求的逐步扩大,数据库国产化正在加速进行中,有越来越多的金融.通信.制造.互联网等企业机构以及政府机关单位将业务系统从Oracle.MyS ...
rocketmq安全漏洞
漏洞内容服务器支持 TLS Client-initiated 重协商攻击(CVE-2011-1473)[原理扫描] 该漏洞存在于SSL renegotiation的过程中.对于使用SSL重协商功能的 ...
kubernetes拉取私有镜像仓库的镜像
kubernetes拉取私有镜像仓库时需要使用镜像仓库的账号密码方式: apiVersion: v1 kind: Pod metadata: name: private-reg spec: cont ...
Codeforces 做题记录 2023-10-22
远古做题记录.大概是 22 年写的. CF1858E1 Rollbacks (Easy Version) Description 给定一个初始为空的数列 \(a\),你需要处理以下操作: + x 将数 ...
WTConv：小参数大感受野，基于小波变换的新型卷积 | ECCV'24
近年来,人们尝试增加卷积神经网络(CNN)的卷积核大小,以模拟视觉Transformer(ViTs)自注意力模块的全局感受野.然而,这种方法很快就遇到了上限,并在实现全局感受野之前就达到了饱和.论文证 ...
Machine Learning Week_1 Welcome
目录 0 Welcome 0.1 Video: Welcome to Machine Learning! Transcript unfamiliar words 0.2 Reading: Machin ...
TypeError: add_triangle_mesh(): incompatible function arguments. The following argument types are supported: 问题终于解决了!!!!
1 2024.10.12 14:52 Traceback (most recent call last): File "terrain_creation.py", line 119 ...
Antlr4 语法解析生成器(上)
简介 Spark SQL.Presto --> Antlr4 SQL 解析器 Flink SQL --> Apache Calcite(通过JavaCC 实现) Spark SQL如何进行 ...
9-4 vector对象是如何增长的
.size():容器中有多少元素 .capacity():不重新分配内存时,可容纳多少元素 .reserve(n):分配至少能容纳n个元素的内存 n>capacity时会分配使得capacity ...

【Python】【爬虫】【爬狼】004_正则规则模板及其应用

【Python】【爬虫】【爬狼】004_正则规则模板及其应用的更多相关文章

随机推荐

热门专题