python爬虫爬取get请求的页面数据代码样例

废话不多说，上代码

#!/usr/bin/env python

# -*- coding:utf-8 -*-

# 导包

import urllib.request

import urllib.parse

# 如下两行代码表示忽略https证书，如果请求不是https则该两行代码可不用。

import ssl

ssl._create_default_https_context = ssl._create_unverified_context

if __name__ == "__main__":

    """指定爬取的网页URL"""

    url = 'https://www.baidu.com'

    """通过urlopen函数向指定url发起请求，返回响应对象"""

    response = urllib.request.urlopen(url)

    """通过调用相应对象中的read函数，反馈响应回客户端的数据值（爬到的数据）"""

    data = response.read()  # 获取响应中的数据值（字节类型）

    # data = response.geturl() # 获取请求的url

    # data = response.getcode() # 获取响应状态码

    # data = response.headers() # 获取响应头信息

    # data = str(data, encoding="utf-8")  # 方法一、使用str()函数将bytes类型转换为str类型

    # data = bytes.decode(data)  # 方法二、使用bytes.decode()函数将bytes类型转换为str类型

    data = response.read().decode()  # 方法三、decode()将响应中字节（byte）类型的数据值转成字符串类型

    with open('./baidu.html', 'w') as e:  #使用IO操作将data表示的数据值以'w'权限的方式写入到baidu.html文件中

        e.write(data)

    print('写入文件完毕')

"""

1、爬取网络上某张图片数据，且存储到本地

if __name__ == '__main__':

    url = 'http://image.baidu.com/search/detail?ct=503316480&z=0&ipn=d&word=%E5%9B%BE%E7%89%87&step_word=&hs=0&pn=5&spn=0&di=103290&pi=0&rn=1&tn=baiduimagedetail&is=0%2C0&istype=0&ie=utf-8&oe=utf-8&in=&cl=2&lm=-1&st=undefined&cs=3139953554%2C3011511497&os=282365737%2C413977936&simid=0%2C0&adpicid=0&lpn=0&ln=737&fr=&fmq=1564044690482_R&fm=&ic=undefined&s=undefined&hd=undefined&latest=undefined&copyright=undefined&se=&sme=&tab=0&width=undefined&height=undefined&face=undefined&ist=&jit=&cg=&bdtype=0&oriquery=&objurl=http%3A%2F%2Fpic30.nipic.com%2F20130619%2F9885883_210838271000_2.jpg&fromurl=ippr_z2C%24qAzdH3FAzdH3Fooo_z%26e3Bgtrtv_z%26e3Bv54AzdH3Ffi5oAzdH3F8AzdH3F9aAzdH3Fbdl0c0lhu9kvac8k_z%26e3Bip4s&gsm=0&rpstart=0&rpnum=0&islist=&querylist=&force=undefined'

    response = urllib.request.urlopen(url)

    data = response.read()  # 因为爬取的是图片数据值(二进制数据)，则无需使用decode进行类型转换。

    with open('./bird.jpg', 'wb') as e:  # 视频、图片等流式数据（二进制数据）使用'wb'进行写入

        e.write(data)

    print('写入完毕')

2、爬取使用百度根据指定词条搜索到的页面数据（例如爬取词条为‘蔡徐坤’的页面数据）

url的特性：url必须为ASCII编码的数据值。所以我们在爬虫代码中编写url时，如果url中存在非ASCII编码的数据值，则必须对其进行ASCII编码后，该url方可被使用

if __name__ == "__main__":

    #原始url中存在非ASCII编码的值，则该url无法被使用。

    #url = 'http://www.baidu.com/s?wd=蔡徐坤'

    #处理url中存在的非ASCII数据值

    url = 'http://www.baidu.com/s?'

    #将带有非ASCII的数据封装到字典中，url中非ASCII的数据往往都是'?'后面键值形式的请求参数

    param = {

        'wd':'蔡徐坤'

    }

    #使用parse子模块中的urlencode函数将封装好的字典中存在的非ASCII的数值进行ASCII编码

    param = urllib.parse.urlencode(param)

    #将编码后的数据和url进行整合拼接成一个完整可用的url

    url = url + param

    #伪装UA

    #将浏览器的UA数据获取，封装到一个字典中。该UA值可以通过抓包工具或者浏览器自带的开发者工具中获取某请求，从中获取UA的值

    headers={

        'User-Agent' : 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_12_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3440.106 Safari/537.36'

    }

    #自定义一个请求对象

    #参数：url为请求的url，headers为UA的值，data为post请求的请求参数（后续介绍）

    request = urllib.request.Request(url=url,headers=headers)

    #发送我们自定义的请求（该请求的UA已经进行了伪装）

    response = urllib.request.urlopen(request)

    data = response.read()

    with open('./蔡徐坤.html','wb') as e:

        e.write(data)

    print('写入文件完毕')

"""

python爬虫爬取get请求的页面数据代码样例的更多相关文章

02. 爬取get请求的页面数据
目录 02. 爬取get请求的页面数据一.urllib库二.由易到难的爬虫程序: 02. 爬取get请求的页面数据一.urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用 ...
爬虫（二）Python网络爬虫相关基础概念、爬取get请求的页面数据
什么是爬虫爬虫就是通过编写程序模拟浏览器上网,然后让其去互联网上抓取数据的过程. 哪些语言可以实现爬虫 1.php:可以实现爬虫.php被号称是全世界最优美的语言(当然是其自己号称的,就是王婆 ...
Python网络爬虫第三弹《爬取get请求的页面数据》
一.urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在Python3中的为urllib.request和urllib. ...
Python爬虫《爬取get请求的页面数据》
一.urllib库 urllib是Python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在Python3中的为urllib.request和urllib. ...
python网络爬虫第三弹(<爬取get请求的页面数据>)
一.urllib库 urllib是python自带的一个用于爬虫的库,其主要作用就是通过代码模拟浏览器发送请求,其常被用到的子模块在 python3中的为urllib.request 和 urllib ...
python网络爬虫《爬取get请求的页面数据》
一.urllib库 urllib是python自带的一个用于爬虫的库,其主要作用就是可以通过代码模拟浏览器发送请求.其常被用到的子模块在python3中的为urllib.request和urllib. ...
Python爬虫爬取异步加载的数据
前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理.作者:努力努力再努力爬取qq音乐歌手数据接口数据 https://y.qq ...
用Python爬虫爬取广州大学教务系统的成绩（内网访问）
用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code ...
使用Python爬虫爬取网络美女图片
代码地址如下:http://www.demodashi.com/demo/13500.html 准备工作安装python3.6 略安装requests库(用于请求静态页面) pip install ...

随机推荐

[LeetCode] 97. Interleaving String 交织相错的字符串
Given s1, s2, s3, find whether s3 is formed by the interleaving of s1and s2. Example 1: Input: s1 = ...
[LeetCode] 771. Jewels and Stones 珠宝和石头
You're given strings J representing the types of stones that are jewels, and S representing the ston ...
Oracle：时间字段模糊查询
需要查询某一天的数据,但是库里面存的是下图date类型将Oracle中时间字段转化成字符串,然后进行字符串模糊查询 select * from CAINIAO_MONITOR_MSG t WHERE ...
[转帖]关于一个 websocket 多节点分布式问题的头条前端面试题
关于一个 websocket 多节点分布式问题的头条前端面试题 https://juejin.im/post/5dcb5372518825352f524614 你来说说 websocket 有什么用? ...
[转帖]Socat 入门教程
https://www.hi-linux.com/posts/61543.html 现在安装k8s 必须带 socat 今天看一下socat 到底是啥东西呢. Socat 是 Linux 下的一个多功 ...
c++ 初始化
1. 内置类型默认初始化内置类型如果没有被显示初始化,则会被编译器默认初始化.初始化会根据①变量类型的不同②变量类型位置,来决定初始化之后的值.但是内置类型如果在函数体内部,则将不被初始化——也就是 ...
协议——SPI
SPI(Serial Peripheral interface)是由摩托罗拉公司定义的一种串行外围设备接口,是一种高速.全双工.同步的通信总线,只需要四根信号线即可,节约引脚,同时有利于PCB的布局. ...
UI测试用例设计，场景测试法
百度一番,没有发现详细的UI测试用例设计方法,只能自己整理一下,学习.改进. 那么正题来了,我们慢慢缕下思路: 1.整理要测实体中的,处理逻辑.触发规则.动作. 2.将场景测试抽象出来 3.到这个时候 ...
获取电脑 ip 地址及系统
public static void main(String[] args) throws UnknownHostException { //获取电脑系统结果:os.name:Windows 10 ...
CCF 2016-09-2 火车购票
CCF 2016-09-2 火车购票题目问题描述请实现一个铁路购票系统的简单座位分配算法,来处理一节车厢的座位分配. 假设一节车厢有20排.每一排5个座位.为方便起见,我们用1到100来给所有的 ...

python爬虫爬取get请求的页面数据代码样例

python爬虫爬取get请求的页面数据代码样例的更多相关文章

随机推荐

热门专题