python基础篇-爬虫urlparse使用及简单示例

>>> from urllib.parse import urlparse

>>> o = urlparse('http://www.cwi.nl:80/%7Eguido/Python.html')

>>> o

ParseResult(scheme='http', netloc='www.cwi.nl:80', path='/%7Eguido/Python.html',

            params='', query='', fragment='')

>>> o.scheme

'http'

>>> o.port

80

>>> o.geturl()

'http://www.cwi.nl:80/%7Eguido/Python.html'

>>> from urllib.parse import urlparse

 >>> urlparse('//www.cwi.nl:80/%7Eguido/Python.html')

 ParseResult(scheme='', netloc='www.cwi.nl:80', path='/%7Eguido/Python.html',

            params='', query='', fragment='')

 >>> urlparse('www.cwi.nl/%7Eguido/Python.html')

 ParseResult(scheme='', netloc='', path='www.cwi.nl/%7Eguido/Python.html',

            params='', query='', fragment='')

 >>> urlparse('help/Python.html')

 ParseResult(scheme='', netloc='', path='help/Python.html', params='',

            query='', fragment='')

Attribute	Index	Value	Value if not present
`scheme`	0	URL scheme specifier	scheme parameter
`netloc`	1	Network location part	empty string
`path`	2	Hierarchical path	empty string
`params`	3	Parameters for last path element	empty string
`query`	4	Query component	empty string
`fragment`	5	Fragment identifier	empty string
`username`		User name	`None`
`password`		Password	`None`
`hostname`		Host name (lower case)	`None`
`port`		Port number as integer, if present	`None`

>>>from urllib.parse import urljoin

>>>urljoin('http://www.cwi.nl/%7Eguido/Python.html', 'FAQ.html')
'http://www.cwi.nl/%7Eguido/FAQ.html'

>>> urljoin('http://www.cwi.nl/%7Eguido/Python.html',

...         '//www.python.org/%7Eguido')

'http://www.python.org/%7Eguido'

>>>urllib.request.quote('http://www.baidu.com')

'http%3A//www.baidu.com'

>>>urllib.request.unquote('http%3A//www.baidu.com')

'http://www.baidu.com'

简单的demo示例

思路如下：

爬取一个网页并将爬取到的内容读取出来赋给一个变量。
以写入的方式打开一个本地文件，命名为*.html等网页格式。
将步骤1中的变量写入该文件中。
关闭该文件

import urllib.request

import urllib.parse

url='http://www.baidu.com'

hearder={

'User-Agent':'Mozilla/5.0 (X11; Fedora; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36'

}

request=urllib.request.Request(url,headers=header)

reponse=urllib.request.urlopen(request).read()

h=open("./1.html","wb")

h.write(reponse)

h.close()

参考：https://docs.python.org/3/library/urllib.parse.html?highlight=urlparse#urllib.parse.urlparse

https://blog.csdn.net/fengxinlinux/article/details/77281253

https://www.runoob.com/python/python-func-open.html

python基础篇-爬虫urlparse使用及简单示例的更多相关文章

python基础篇（六）
PYTHON基础篇(六) 正则模块re A:正则表达式和re模块案例 B:re模块的内置方法时间模块time A:时间模块的三种表示方式 B:时间模块的相互转换随机数模块random A:随机数模 ...
面试题之第一部分(Python基础篇) 80题
第一部分(python基础篇)80题为什么学习Python?==*== # 1. python应用于很多领域,比如后端,前端,爬虫,机器学习(人工智能)等方面,几乎能涵盖各个开发语言的领域,同时它相 ...
python基础篇（五）
PYTHON基础篇(五) 算法初识什么是算法二分查找算法 ♣一:算法初识 A:什么是算法根据人们长时间接触以来,发现计算机在计算某些一些简单的数据的时候会表现的比较笨拙,而这些数据的计算会消耗大 ...
python基础篇（一）
PYTHON基础篇(一) 变量赋值输入,输出和导入 A:输入 B:输出 C:导入运算符 A:算数运算符 B:比较运算符 C:赋值运算符 D:位运算符 E:逻辑运算符 F:成员运算符 G:身份运算 ...
python基础篇（二）
PYTHON基础篇(二) if:else,缩进 A:if的基础格式和缩进 B:循环判断 C:range()函数和len()函数 D:break,contiue和pass语句 for,while循环函 ...
python基础篇（三）
PYTHON基础篇(三) 装饰器 A:初识装饰器 B:装饰器的原则 C:装饰器语法糖 D:装饰带参数函数的装饰器 E:装饰器的固定模式装饰器的进阶 A:装饰器的wraps方法 B:带参数的装饰器 C ...
python基础篇（四）
PYTHON基础篇(四) 内置函数 A:基础数据相关(38) B:作用域相关(2) C:迭代器,生成器相关(3) D:反射相关(4) E:面向对象相关(9) F:其他(12) 匿名函数 A:匿名函数基 ...
python基础篇(文件操作)
Python基础篇(文件操作) 一.初始文件操作使用python来读写文件是非常简单的操作. 我们使用open()函数来打开一个文件, 获取到文件句柄. 然后通过文件句柄就可以进行各种各样的操作了. ...
Python基础篇(格式化输出,运算符,编码):
Python基础篇(格式化输出,运算符,编码): 格式化输出: 格式:print ( " 内容%s" %(变量)) 字符类型: %s 替换字符串 %d 替换整体数字 ...

随机推荐

elasticsearch之多索引查询
一.问题源起在elasticsearch的查询中,我们一般直接通过URL来设置要search的index: 如果我们需要查询的索引比较多并且没有什么规律的话,就会面临一个尴尬的局面,超过URL的长度 ...
uniapp动态修改导航栏
1.修改导航栏buttons 如图动态修改角标 <template> <view> </view> </template> <script> ...
[c++]对vector<T>容器求交集，并集，去重
#include "iostream" #include "vector" #include "algorithm" //sort函数.交并 ...
Java高级程序设计笔记 • 【第4章网络编程】
全部章节 >>>> 本章目录 4.1 网络基础知识 4.1.1 IP地址 4.1.2 端口号 4.1.3 使用InetAddress 4.1.4 InetAddress 类 ...
k8s污点
https://www.iyunw.cn/archives/k8s-wu-dian-shi-yong-fang-fa-shi-li/ kubectl taint nodes node1 key=val ...
golang 算法题 : 两数相加
package mainimport "fmt"type ListNode struct { Val int Next *ListNode}func main() { l1 := ...
MapReduce和Hive学习文档链接学习顺序
1.<CentOS6.5下安装Hadoop-2.7.3(图解教程)> https://www.toutiao.com/i6627365258090512909/ 2.<CentOS6 ...
vue-cli axios封装（element-ui）
1.http.js /** * * http配置 */ import axios from 'axios'import { Loading, Message } from 'element-ui' / ...
phar反序列化
我们一般利用反序列漏洞,一般都是借助unserialize()函数,不过随着人们安全的意识的提高这种漏洞利用越来越来难了,但是在今年8月份的Blackhat2018大会上,来自Secarma的安全研究 ...
HTML、CSS、Javascript、jQuery、Xml
HTML HTML简介 Hyper Text Markup Language (超文本标记语言)简写:HTML.通过标签来标记要显示的网页中的各个部分.网页文件本身是一种文本文件,通过在文本文件中添加 ...

python基础篇-爬虫urlparse使用及简单示例

python基础篇-爬虫urlparse使用及简单示例的更多相关文章

随机推荐

热门专题