【py网页】urlopen的补充，完美

urllib 是 python 自带的一个抓取网页信息一个接口，他最主要的方法是 urlopen()，是基于 python 的 open() 方法的。下面是主要说明：

`1`	`urllib.urlopen('网址')`

这里传入urlopen()的参数有特别说要求，要遵循一些网络协议，比如http,ftp,也就是说，在网址的开头必须要有http://这样的说明，如：urllib.urlopen('http://www.baidu.com')。
要么就是本地文件，本地文件需要使用file关键字，比如 urllib.urlopen('file:nowamagic.py')，注意，这里的hello.py是指的是当前的classpath所指定的内容，如果对hello.py这里有什么疑问那一定是python寻找classpath的顺序不是很清楚了，当然也可以直接写全部路径，urllib.urlopen('file:F:\pythontest\nowamagic.py')。
打开 ftp 文件也是可以的，写法 urllib.urlopen(url='ftp://用户名:密码@ftp地址/') 等。

示例程序：

`1`	`import` `urllib`

`2`	`f` `=` `urllib.urlopen('file:F:\pythontest\nowamagic.py')`

`3`	`a` `=` `f.read()`

`4`	`print` `a`

如果传入的参数正确，比如该网站可以访问，没有特殊情况（比如需要代理，被墙等），那么将返回一个类似于文件对象的对象。即上面代码中的f，f对象有的方法一些操作方法，使用dir(f)：

`1`	`['__doc__',` `'__init__',` `'__iter__',` `'__module__',` `'__repr__',` `'close','fileno',` `'fp',` `'geturl',` `'headers',` `'info',` `'next',` `'read',` `'readline','readlines',` `'url']`

使用read()方法会将所有内容读取出来，并且同时f对象类似于先入先出的数据，在使用f.read()将得不到任何数据，也就是说，得到的数据在这个时候如果想在后面进行任何处理操作的话，需要另外定义一个对象来进行存储。如上例中的a。而info(),geturl()方法，也是基于f这个文档对象的，所以，使用

`1`	`>>>f.geturl()`

`2`	`'F://pythontest//nowamagic.py'`

接下来是urllib的代理设置：

`1`	`import` `urllib`

`2`	`proxies` `=` `{'http':'http://*...*:1984'}`

`3`	`filehandle` `=` `urllib.urlopen('http://www.需要代理才能访问的网站.com/',proxies=` `proxies)`

`4`	`a` `=` `filehandle.read()`

`5`	`print` `a`

以上是最基本代理，即代理访问到该网站，并且能够获得该网站的内容。但是如果遇到需要登录，或者需要cookie等的网站呢？

查看urllib的源码：

`01`	`def` `urlopen(url, data=None, proxies=None):`

`02`	`"""urlopen(url [, data]) -> open file-like object"""`

`03`	`global` `_urlopener`

`04`	`if` `proxies` `is` `not` `None:`

`05`	`opener` `=` `FancyURLopener(proxies=proxies)`

`06`	`elif` `not` `_urlopener:`

`07`	`opener` `=` `FancyURLopener()`

`08`	`_urlopener` `=` `opener`

09 else:

`10`	`opener` `=` `_urlopener`

`11`	`if` `data` `is` `None:`

`12`	`return` `opener.open(url)`

13 else:

`14`	`return` `opener.open(url, data)`

由上面urllib的urlopen的源码，可以看出，还可以传入一个data参数，data参数也应该是一个字典，因为在使用浏览器向服务器发送数据的时候，我们发送的就是字典类型的数据。

还有一点，就是代理支持是 python 2.3 以后加入的

【py网页】urlopen的补充，完美的更多相关文章

【py网页】urllib模块，urlopen
Python urllib 库提供了一个从指定的 URL 地址获取网页数据,然后对其进行分析处理,获取想要的数据. 下面是在 Python Shell 里的 urllib 的使用情况: 01 Pyth ...
利用PhantomJS进行网页截屏，完美解决截取高度的问题
关于PhantomJS PhantomJS 是一个基于WebKit的服务器端 JavaScript API.它全面支持web而不需浏览器支持,其快速,原生支持各种Web标准: DOM 处理, CSS ...
【py网页】urllib.urlretrieve远程下载
下面我们再来看看 urllib 模块提供的 urlretrieve() 函数.urlretrieve() 方法直接将远程数据下载到本地. 1 >>> help(urllib.urlr ...
web.py网页模板中使用jquery
由于$是web.py针对模板的保留字符,所以在模板文件内不能直接使用$("#id")的格式. 解决办法: 1.$$("#id")可以避免$被误解析 2.jque ...
【py网页】sitecopy代码
001 #coding:utf-8 002 import re,os,shutil,sys 003 import urllib2,socket,cookielib 004 from threading ...
Py修行路内置模块补充 datetime模块
Python提供了多个内置模块用于操作日期时间,像calendar,time,datetime.datetime模块用于是date和time模块的合集,他内部重新封装了time模块,相比于time ...
python--爬虫入门（八）体验HTMLParser解析网页，网页抓取解析整合练习
python系列均基于python3.4环境基本概念 html.parser的核心是HTMLParser类.工作的流程是:当你feed给它一个类似HTML格式的字符串时,它会调用goahead方法 ...
python3下urlopen解析中文url编码错误
这是在ipython下测试的结果: In [24]: x Out[24]: 'http://127.0.0.1:8000/xxx/?id=a45ex0bad3c9&game=五子棋' In [ ...
web.py学习心得
1.注意判断数字时,如果是get传递的参数,一定要用int转换.不然出错. 2.$var 定义时,冒号后的内容不是python内容,需加上$符号.如$var naviId:$naviId. 3.各个模 ...

随机推荐

link标签和script标签跑到body下面，网页顶部有空白
用UltraEdit的16进制编辑模式查看代码,都是EF BB BF开头的,说明都是带BOM的.我手动的将所有文件转成UTF-8 without BOM.页面终于正常了.link,script标签乖乖 ...
Windows下使用Git和GitHub.com
1.首先介绍一下什么是Git和GitHub Git是一个分布式的版本控制系统,最初由Linus Torvalds编写,用作Linux内核代码的管理.在推出后,Git在其它项目中也取得了很大 ...
我的工具箱之MyEclipse9.1
下载地址:http://pan.baidu.com/s/1bbuN1s 这个工具是用来开发Java程序,自带JDK和Tomcat,功能全面周到,使用方便. 市面上MyEclipse版本很多,但都需要破 ...
http文件的断点续传和下载
http://www.tuicool.com/articles/ZbyymqJ Content-Disposition:inline; filename= "c501b_01_h264_sd ...
COLUMN_VALUE Pseudocolumn
With below three situation, we can use the pseudocolumn column_value to refer the column value. an X ...
java 中集合和数组互相转换
package test; import java.util.Arrays;import java.util.List; /** * Created by Administrator on 2016/ ...
win2003下全自动快速安装php+mysql套件
导读:Windows 2003下一键快速安装PHP和MySql的安装包场景:wind2003 32位 php5.2 1.下载php+mysql套件地址1 http://pan.baidu.com/ ...
Linux 文件系统错误的修复方法 ddrescue替代dd的恢复软件备用超级块
Linux 文件系统错误的修复方法 ddrescue替代dd的恢复软件备用超级块最近处理的一件 linux 服务器断电导致文件系统启动后文件系统不可读写,数据不可用的案例,现总结下 Linux ...
android 线程学习
很多人觉得线程难理解,主要有两个问题: 线程休眠,既然线程已经休眠了,程序的运行速度还能提高吗? 线程体一般都进行死循环,既然线程死循环,程序就应该死掉了,就会没有反应. 1.关于线程休眠问题对线程 ...
MetInfo标签函数及参数
参数标签直接在页面中调用标签代码即可: 函数标签需要在页面PHP嵌入代码中通过参数定义转换方可使用,如$metlang=methtml_lang('-'),点击函数标签代码可查看函数标签详细使用方法: ...

【py网页】urlopen的补充，完美

【py网页】urlopen的补充，完美的更多相关文章

随机推荐

热门专题