python学习-爬虫

转载自静觅的博客

最普通下载网页

 import urrlib2

 response = urllib2.urlopen("http://www.baidu.com")

 print response.read()

Post方式

 import urllib

 import urllib2

 values = {"username":"*****", "password":"*****"}

 url = "   "

 request = urllib2.Request(url,urllib.urlencode(values))

 response = urllib2.urlopen(request)

 print response.read()

设置headers

import urllib

import urllib2  

url = 'http://www.server.com/login'

user_agent = 'Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)'

values = {'username' : 'cqc',  'password' : 'XXXX' }

headers = { 'User-Agent' : user_agent }

data = urllib.urlencode(values)

request = urllib2.Request(url, data, headers)

response = urllib2.urlopen(request)

page = response.read()

Get方式

 import urllib2

 import urllib

 values = {}

 values["username"] =

 values["password"] =

 data = urlencode(values)

 url =

 geturl = url + "?" + data

 request = urllib2.Request(geturl)

 response = urllib2.urlopen(request)

 print response.read()

设置代理

 import urllib2

 enable_proxy = True

 proxy_handler = urllib2.ProxyHandler({"http" : 'http://some-proxy.com:8080'})

 null_proxy_handler = urllib2.ProxyHandler({})

 if enable_proxy:

     opener = urllib2.build_opener(proxy_handler)

 else:

     opener = urllib2.build_opener(null_proxy_handler)

 urllib2.install_opener(opener)

设置延时

 import urllib2

 response = urllib2.urlopen('http://www.baidu.com',data, 10)

异常处理

 import urllib2

 req = urllib2.Request('http://blog.csdn.net/cqcre')

 try:

     urllib2.urlopen(req)

 except urllib2.URLError, e:

     if hasattr(e,"code"):

         print e.code

     if hasattr(e,"reason"):

         print e.reason

 else:

     print "OK"

设置cookie

 import urllib

 import urllib2

 import cookielib

 filename = 'cookie.txt'

 #声明一个MozillaCookieJar对象实例来保存cookie，之后写入文件

 cookie = cookielib.MozillaCookieJar(filename)

 opener = urllib2.build_opener(urllib2.HTTPCookieProcessor(cookie))

 postdata = urllib.urlencode({

             'stuid':'',

             'pwd':''

         })

 #登录教务系统的URL

 loginUrl = 'http://jwxt.sdu.edu.cn:7890/pls/wwwbks/bks_login2.login'

 #模拟登录，并把cookie保存到变量

 result = opener.open(loginUrl,postdata)

 #保存cookie到cookie.txt中

 cookie.save(ignore_discard=True, ignore_expires=True)

 #利用cookie请求访问另一个网址，此网址是成绩查询网址

 gradeUrl = 'http://jwxt.sdu.edu.cn:7890/pls/wwwbks/bkscjcx.curscopre'

 #请求访问成绩查询网址

 result = opener.open(gradeUrl)

 print result.read()

python学习-爬虫的更多相关文章

Python学习—爬虫篇之破解ntml登陆问题
之前帮公司爬取过内部的一个问题单网站,要求将每个问题单的下的附件下载下来.一开始的时候我就遇到一个破解登陆验证的大坑...... (╬￣皿￣)=○ 由于在公司使用的都是内网,代码和网站的描述 ...
Python学习——爬虫篇
requests 使用requests进行爬取下面是我编写的第一个爬虫的脚本 import requests # 导入reques ...
Python学习---爬虫学习[scrapy框架初识]
Scrapy Scrapy是一个框架,可以帮助我们进行创建项目,运行项目,可以帮我们下载,解析网页,同时支持cookies和自定义其他功能. Scrapy是一个为了爬取网站数据,提取结构性数据而编写的 ...
Python学习---爬虫学习[requests模块]180411
模块安装安装requests模块 pip3 install requests 安装beautifulsoup4模块 [更多参考]https://blog.csdn.net/sunhuaqiang1/ ...
Python学习 —— 爬虫入门 - 爬取Pixiv每日排行中的图片
更新于 2019-01-30 16:30:55 我另外写了一个面向 pixiv 的库:pixiver 支持通过作品 ID 获取相关信息.下载等,支持通过日期浏览各种排行榜(包括R-18),支持通过 p ...
python 学习爬虫教程~
思路:: (本文没有用xpath定位,xpath需要导入第三方库 from lxml import etree) 1.首先通过urllib类获取到网页的所有内容 2.通过partition获取其中 ...
python网络爬虫学习笔记
python网络爬虫学习笔记 By 钟桓 9月 4 2014 更新日期:9月 4 2014 文章文件夹 1. 介绍: 2. 从简单语句中開始: 3. 传送数据给server 4. HTTP头-描写叙述 ...
[Python学习] 简单网络爬虫抓取博客文章及思想介绍
前面一直强调Python运用到网络爬虫方面很有效,这篇文章也是结合学习的Python视频知识及我研究生数据挖掘方向的知识.从而简介下Python是怎样爬去网络数据的,文章知识很easy ...
Python学习之路（二）爬虫（一）
Python基础基础教程参考廖雪峰的官方网站https://www.liaoxuefeng.com/ 一."大数据时代",数据获取的方式 1. 企业生产的用户数据:大型互联网公司 ...

随机推荐

饿了么 openapi demo
http://merchant.openapi.eleme.io/merchant.html#id215 class Program { static void Main(string[] args) ...
Unity3d 保存和使用地形高度
TerrainHeightProcesser 地形高度存储工具 TerrainHeightData 地形高度数据 // class TerrainHeightProcesser using Unity ...
perl 从文件里读出变量无法使用解决办法
最近在写一个perl函数,把test case 放到配置文件里,读出来然后使用system运行. 我的本意是: 配置文件conf ping -c $count $ip #在主程序中定义$ip和$cou ...
Java中hashCode()方法以及HashMap()中hash()方法
Java的Object类中有一个hashCode()方法: public final native Class<?> getClass(); public native int hashC ...
解决X64操作系统PL/SQL连接报错问题 make sure you have the 32 bits oracle client installed
Windows 64位下装Oracle 11g 64位,PLSQL Developer使用出现以下问题: 1.Database下拉框为空: 2.强制输入用户名.密码及Database,登录弹出: In ...
WinForm相关注意点
1. //this.dgvEmployees.ColumnHeadersDefaultCellStyle.ForeColor = Color.Blue; //dgvEmployees.RowHeade ...
NEFU 169 步步惊心
Description 马尔泰·若曦是康熙年间镇西大将军马尔泰的小女儿,自幼失母,却深得父亲姐姐宠爱,性格活泼任性.张晓,本是21世纪一都市白领,聪慧谨慎,玲珑剔透.因车祸而灵魂穿越到若曦身上,自此开 ...
POJ 2965 The Pilots Brothers' refrigerator
题目链接题意:一个冰箱上有4*4共16个开关,改变任意一个开关的状态(即开变成关,关变成开)时,此开关的同一行.同一列所有的开关都会自动改变状态.要想打开冰箱,要所有开关全部打开才行. 输入:一个4 ...
51nod 1605 棋盘问题 (博弈)
题目:传送门. 题意:中文题.T组数据,每组给定一个n*m的棋盘,棋盘中的1代表黑色,0代表白色,每次可以将1或者非2质数的全黑色方形区域变为白色,不能操作者输,问谁能赢. 题解:每次可以将1或者非2 ...
会话控制（session、cookie）
1.session(1)session存储在服务器的(2)session每个人存一份(3)session有默认的过期时间(4)session里面可以存储任意类型的数据安全,对服务造成压力用法:1.当一 ...

python学习-爬虫

python学习-爬虫的更多相关文章

随机推荐

热门专题