python 嵌套爬取网页信息

当需要的信息要经过两个链接才能打开的时候，就需要用到嵌套爬取。

比如要爬取起点中文网排行榜的小说简介，找到榜单网址：https://www.qidian.com/all?orderId=&style=1&pageSize=20&siteid=1&pubflag=0&hiddenField=0&page=1

将榜单上的小说链接爬出来，在从小说链接里面爬小说简介

import pymysql

import requests

from hashlib import md5

import re

import os

#获取网页源代码

def get_one_page(url):

    # 设置请求头，防止被网站屏蔽

    headers = {

        'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; Win64; x64)\

         AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36',

    }

    try:

        r = requests.get(url, headers=headers)

        r.raise_for_status()

        r.encoding = r.apparent_encoding

        return r.text

    except requests.HTTPError as e:

        print("由于某种原因获取页面出现错误!"+str(e))

#爬出目标信息所在的网址

def parse_page1(url,list):

    #获取网页内容

    html=get_one_page(url)

    #将正则表达式编译成正则表达式对象

    pattern=re.compile('<h4><a href="(.*?)" target="_blank" data-eid',re.S)

    #正则表达式1匹配的是目标信息的网址

    contents = re.findall(pattern, html)

    for i in contents:

        list.append(i)#向列表添加对象

    return list

#从网址中爬出目标信息

def parse_page2(url,list):#信息

    #获取网页内容

    url='https:'+url#############要注意爬出的网址是否完整，不完整记得补全，否则会出错

    html=get_one_page(url)

    #将正则表达式编译成正则表达式对象

    pattern=re.compile('<p class="intro">(.*?)</p>',re.S)

    #正则表达式2匹配的是目标信息

    contents = re.findall(pattern, html)

    for i in contents:

        list.append(i)#向列表添加对象

    return list

# info_list存的是目标信息的网址

info_list=[]

start_url='https://www.qidian.com/all'

info_list=parse_page1(start_url,info_list)

# range()包头不包尾`

for i in range(,):#range(,,-),-1表示顺序递减

    url = 'https://www.qidian.com/all?orderId=&style=1&pageSize=20&siteid=1&pubflag=0&hiddenField=0&page=' + str(i)

    info_list = parse_page1(url, info_list)

#输出目标网址

cnt=

for i in info_list:

    cnt=cnt+

    i='https:'+i

    print(i)

#输出网址数量

print("一共有"+str(cnt)+"条数据")

# x_list存的是目标信息，从目标信息所在的网址爬出需要的目标信息

x_list=[]

for i in info_list:

    x_list=parse_page2(i,x_list)

#输出目标信息

for i in x_list:

    print(i)

#如果爬的数量比较多，要等久一会才有输出

python 嵌套爬取网页信息的更多相关文章

Python爬取网页信息
Python爬取网页信息的步骤以爬取英文名字网站(https://nameberry.com/)中每个名字的评论内容,包括英文名,用户名,评论的时间和评论的内容为例. 1.确认网址在浏览器中输入初 ...
[python] 常用正则表达式爬取网页信息及分析HTML标签总结【转】
[python] 常用正则表达式爬取网页信息及分析HTML标签总结转http://blog.csdn.net/Eastmount/article/details/51082253 标签: pytho ...
python学习之——爬取网页信息
爬取网页信息说明:正则表达式有待学习,之后完善此功能 #encoding=utf-8 import urllib import re import os #获取网络数据到指定文件 def getHt ...
常用正则表达式爬取网页信息及HTML分析总结
Python爬取网页信息时,经常使用的正则表达式及方法. 1.获取<tr></tr>标签之间内容 2.获取<a href..></a>超链接之间内容 3 ...
python之爬取网页数据总结（一）
今天尝试使用python,爬取网页数据.因为python是新安装好的,所以要正常运行爬取数据的代码需要提前安装插件.分别为requests Beautifulsoup4 lxml 三个插件 ...
Python简单爬取图书信息及入库
课堂上老师布置了一个作业,如下图所示: 就是简单写一个借书系统. 大概想了一下流程,登录-->验证登录信息-->登录成功跳转借书界面-->可查看自己的借阅书籍以及数量... 登录可以 ...
python动态爬取网页
简介有时候,我们天真无邪的使用urllib库或Scrapy下载HTML网页时会发现,我们要提取的网页元素并不在我们下载到的HTML之中,尽管它们在浏览器里看起来唾手可得. 这说明我们想要的元素是在我 ...
python爬虫——爬取网页数据和解析数据
1.网络爬虫的基本概念网络爬虫(又称网络蜘蛛,机器人),就是模拟客户端发送网络请求,接收请求响应,一种按照一定的规则,自动地抓取互联网信息的程序.只要浏览器能够做的事情,原则上,爬虫都能够做到. 2 ...
用shell脚本爬取网页信息
有个小需求,就是爬取一个小网站一些网页里的某些信息,url是带序号的类似的,不需要写真正的spider,网页内容也是差不多的需要取出网页中<h1></h1>中间的字符串,而且 ...

随机推荐

【剑指Offer面试编程题】题目1511：从尾到头打印链表--九度OJ
题目描述: 输入一个链表,从尾到头打印链表每个节点的值. 输入: 每个输入文件仅包含一组测试样例. 每一组测试案例包含多行,每行一个大于0的整数,代表一个链表的节点.第一行是链表第一个节点的值,依次类 ...
natapp 内网穿透服务
参考文章:https://www.jianshu.com/p/91a321e584b8 参考文章:https://www.jianshu.com/p/c4cb8666c96a 一.什么是内网穿透通过 ...
SystemVerilog基本语法总结（中）
Systemverilog 语法总结(中) 上一个博客分享了SV基本的概念,这一博客继续分享,等下一个博客分享一个公司的验证的笔试题目. l 事件背景: Verilog中当一个线程在一个事件上发生阻 ...
模板语法（DOM与Vue数据绑定）
Vue.js使用了基于HTML的模板语法,允许开发者声明式的将DOM绑定至底层Vue实例的数据. 插值文本:{{ }}数据绑定最常见的形式就是使用Mustache语法(双大括号)的文本插值,解释为普 ...
「NOIP2007」树网的核
传送门 Luogu 解题思路这里着重介绍 \(O(n^3)\) 的做法,毕竟考场上只有 \(N\le300\) \(Q \omega Q\) 首先我们要知道,对任意一条直径算偏心距都是一样的. 证明 ...
【LOJ2513】「BJOI2018」治疗之雨
题意你现在有 \(m+1\) 个数:第一个为 \(p\) ,最小值为 \(0\) ,最大值为 \(n\) :剩下 \(m\) 个都是无穷,没有最小值或最大值.你可以进行任意多轮操作,每轮操作如下: ...
四 Hibernate的一级缓存&事务管理及其配置
持久态对象: 自动更新数据库,原理是一级缓存. 缓存:是一种优化的方式,将数据存入内存,从缓存/内存中获取,不用通过存储源 Hibernate框架中提供了优化手段:缓存,抓取策略 Hibernate中 ...
HDU 3065 病毒侵袭持续中（模板题）
病毒侵袭持续中 Time Limit: 2000/1000 MS (Java/Others) Memory Limit: 32768/32768 K (Java/Others)Total Sub ...
Linux双网卡绑定bond详解--单网卡绑定多个IP
Linux双网卡绑定bond详解 1 什么是bond 网卡bond是通过多张网卡绑定为一个逻辑网卡,实现本地网卡的冗余,带宽扩容和负载均衡,在生产场景中是一种常用的技术.Kernels 2.4.12及 ...
Python测试进阶——（7）动手编写Bash脚本启动Python监控程序并传递PID
如下: #./cf_workload_functions.sh function timestamp(){ # get current timestamp sec=`date +%s` nanosec ...

python 嵌套爬取网页信息

python 嵌套爬取网页信息的更多相关文章

随机推荐

热门专题