爬虫（GET）——爬取多页的html

工具：python3

目标：将编写的代码封装，不同函数完成不同功能，爬取任意页数的html

新学语法：with open as

除了有更优雅的语法，with还可以很好的处理上下文环境产生的异常。

 # coding:utf-

 import urllib.request

 def loadPage(fullurl,filename):

     """作用：根据url发送请求，获取服务器响应请求"""

     ua_headers = {"User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/66.0.3359.181 Safari/537.36"}

     print("正在下载" + filename)

     request = urllib.request.Request(fullurl, headers=ua_headers )

     response = urllib.request.urlopen(request)

     return response.read()

 def writePage(html, filename):

     """

     作用：将html内容写入到本地

     html：服务器相应文件内容

     """

     print("正在写入" + filename)
       # 新建文件，存储html信息

     with open(filename, "wb") as f:

         f.write(html)

 def tiebaSpider(url, beginpage, endpage):

     """

     作用：贴吧爬虫调度器，负责组合处理每个页面的url

     url:贴吧url的前部分

     beginPage： 起始页

     endPage： 结束页

     :return:

     """
       # 构造每页的url和文件名

     for page in range(beginpage, endpage+):

         pn = (page-)*

         fullurl = url + "&" + "pn=" + str(pn)

         filename = "第" + str(page) + "页.html"

         html = loadPage(fullurl, filename)

         writePage(html, filename)

     print("完成！")

 if __name__ == "__main__":

     kw = input("请输入要爬取的贴吧名： ")

     beginPage = int(input("请输入起始页： "))

     endPage = int(input("请输入结束页： "))

     url = "http://tieba.baidu.com/f?"

     kw = urllib.parse.urlencode({"kw": kw})

     url = url + kw

     tiebaSpider(url, beginPage, endPage)

爬虫（GET）——爬取多页的html的更多相关文章

（java）Jsoup爬虫学习--获取智联招聘（老网站）的全国java职位信息，爬取10页
Jsoup爬虫学习--获取智联招聘(老网站)的全国java职位信息,爬取10页,输出职位名称*****公司名称*****职位月薪*****工作地点*****发布日期 import java.io.I ...
小爬虫。爬取网站多页的通知标题并存取在txt文档里。
爬取网页中通知标题的内容展示: this is 1 page!<精算学综合>科目考试参考大纲2016年上半年研究生开题报告评议审核结果公示[答辩]2016下半年研究生论文答辩及学位评定 ...
python爬虫系列之爬取多页gif图像
python爬取多页gif图像作者:vpoet mail:vpoet_sir@163.com #coding:utf-8 import urllib import ur ...
多线程爬虫爬取详情页HTML
注意:如果想爬取详情页的信息请按须添加方法 import requests import os import re import threading from lxml import etree #爬 ...
python 爬虫之爬取大街网（思路）
由于需要,本人需要对大街网招聘信息进行分析,故写了个爬虫进行爬取.这里我将记录一下,本人爬取大街网的思路. 附:爬取得数据仅供自己分析所用,并未用作其它用途. 附:本篇适合有一定爬虫基础 crawl ...
学习用java基于webMagic+selenium+phantomjs实现爬虫Demo爬取淘宝搜索页面
由于业务需要,老大要我研究一下爬虫. 团队的技术栈以java为主,并且我的主语言是Java,研究时间不到一周.基于以上原因固放弃python,选择java为语言来进行开发.等之后有时间再尝试pytho ...
[Python爬虫] Selenium爬取新浪微博客户端用户信息、热点话题及评论 (上)
转载自:http://blog.csdn.net/eastmount/article/details/51231852 一. 文章介绍源码下载地址:http://download.csdn.net/ ...
一起学爬虫——通过爬取豆瓣电影top250学习requests库的使用
学习一门技术最快的方式是做项目,在做项目的过程中对相关的技术查漏补缺. 本文通过爬取豆瓣top250电影学习python requests的使用. 1.准备工作在pycharm中安装request库 ...
scrapy进阶（CrawlSpider爬虫__爬取整站小说）
# -*- coding: utf-8 -*- import scrapy,re from scrapy.linkextractors import LinkExtractor from scrapy ...

随机推荐

批处理基本知识以及进阶 V2.0
批处理基本知识以及进阶将以要执行的程序指令 , 像在 dos 模式下一下写入记事本 , 保存成 bat 文件 , 就可以执行了一 . 简单批处理内部命令简介 1.Echo 命令打开回显或关闭请求 ...
OpenNi安装示例
1.下载OpenNi https://structure.io/openni 解压,点击运行选择安装目录,默认即可安装过程中有弹框,选择安装点击完成在相应的安装目录下即可找到
前端学习笔记2017.6.12 CSS控制DIV
前一篇文章中用div布局了豆瓣东西的页面,如果用html代码表示的话大概是这个样子的 <!DOCTYPE html><html><head></head> ...
数字图像处理实验（6）：PROJECT 04-02，Fourier Spectrum and Average Value 标签：图像处理MATLABfft 2017-05-07 23:1
实验要求: Objective: To observe the Fourier spectrum by FFT and the average value of an image. Main requ ...
oracle获取列的备注和数据类型
select column_name, data_type, data_precision, data_scale, nvl((select t_s.comments from all_col_com ...
Pig Latin程序设计1
Pig是一个大规模数据分析平台.Pig的基础结构层包括一个产生MapReduce程序的编译器.在编译器中,大规模并行执行依据存在.Pig的语言包括一个叫Pig Latin的文本语言,此语言有如下特性: ...
CodeForces 141C Queue (构造)
题意:n 个人在排队,然后给出每个人的前面比他身高高的人的数量hi,让你给出一种排列,并给出一种解. 析:首先,hi 小的要在前面,所以先进行排序,然后第一个人的 h1 必须为0,我们可以令身高为 1 ...
ElasticSearch安装拼音插件（pinyin）
环境介绍集群环境如下: Ubuntu14.04 ElasticSearch 2.3.1(3节点) JDK1.8.0_60 开发环境: Windows10 JDK 1.8.0_66 Maven 3.3 ...
shape不同版本这间的兼容
在做那个只有左边上面是圆角和只有右边下边是圆角的时候,出现了一个问题,那就是在android3.0以前,android:bottomLeftRadius与android:bottomRightRadi ...
关于文本PDG的字体
作者:马健邮箱:stronghorse_mj@hotmail.com发布:2008.08.03 有不少人在问为什么有些文本PDG在SSREADER里看到的是宋体,在Acobat里看到的是黑体,其实原因 ...

爬虫（GET）——爬取多页的html

爬虫（GET）——爬取多页的html的更多相关文章

随机推荐

热门专题