Python 爬虫学习

#coding:utf-8

#author:Blood_Zero

'''

    1、获取网页信息

    2、解决编码问题，通过charset库(默认不安装这个库文件)

'''

import urllib

import urllib2

url = "http://192.168.1.135/myself/"

html = urllib.urlopen(url)

content = html.read()

print content

#如果网页中存在其他编码，就会出现乱码

#print content.decode('gbk').encode('utf-8')

'''

    简易获取网页信息

'''

#获取当前url

print "当前URL："+str(html.geturl())

#网页状态码

print "当前状态码："+str(html.code)

#print "当前状态码："+str(html.getcode())

#网站头信息

print "当前头信息：\n"+str(html.headers)

#print "当前头信息：\n"+str(html.info())

#获取网站编码

print "当前网站使用编码："+str(html.info().getparam("charset"))

#下载网页源码

urllib.urlretrieve(url,"E:\\Python_Code\\pyTools\\url.txt")

'''

    模拟浏览器访问网址

'''

#方法一

req=urllib2.Request(url)

# 添加头信息

req.add_header("User-Agent","Mozilla/5.0 (Windows NT 6.2; WOW64; rv:39.0) Gecko/20100101 Firefox/39.0")

req.add_header("Get",url)

req.add_header("Host","192.168.1.135")

new_html = urllib2.urlopen(req)

print new_html.read()

print req.headers.items()

#方法二

myheader={

    "User-Agent":"Mozilla/5.0 (Windows NT 6.2; WOW64; rv:39.0) Gecko/20100101 Firefox/39.0",

    "Host":"192.168.1.135",

    "Get":url

}

req1 = urllib2.Request(url,headers=myheader)

new_html_1 = urllib2.urlopen(req1)

print new_html_1.read()

print req1.headers.items()

'''

    在网页中查询指定文件

'''

def get_content(url):

    html = urllib.urlopen(url)

    content = html.read()

    html.close()

    return content

def get_file(self):

    #匹配php文件

    regex = r'a href=(.+?\.php)'

    pat=re.compile(regex)

    file_code = re.findall(pat,self)

    print str(file_code)+"\n"

info = get_content("http://192.168.1.135/myself/SQL_Injection/")

get_file(info)

Python 爬虫学习的更多相关文章

python 爬虫学习<将某一页的所有图片下载下来>
在我们日常上网浏览网页的时候,经常会看到一些好看的图片,我们就希望把这些图片保存下载,或者用户用来做桌面壁纸,或者用来做设计的素材. 我们最常规的做法就是通过鼠标右键,选择另存为.但有些图片鼠标右键的 ...
python爬虫学习(1) —— 从urllib说起
0. 前言如果你从来没有接触过爬虫,刚开始的时候可能会有些许吃力因为我不会从头到尾把所有知识点都说一遍,很多文章主要是记录我自己写的一些爬虫所以建议先学习一下cuiqingcai大神的 Pyth ...
python爬虫学习 —— 总目录
开篇作为一个C党,接触python之后学习了爬虫. 和AC算法题的快感类似,从网络上爬取各种数据也很有意思. 准备写一系列文章,整理一下学习历程,也给后来者提供一点便利. 我是目录听说你叫爬虫 - ...
Python爬虫学习：三、爬虫的基本操作流程
本文是博主原创随笔,转载时请注明出处Maple2cat|Python爬虫学习:三.爬虫的基本操作与流程一般我们使用Python爬虫都是希望实现一套完整的功能,如下: 1.爬虫目标数据.信息: 2.将 ...
Python爬虫学习：四、headers和data的获取
之前在学习爬虫时,偶尔会遇到一些问题是有些网站需要登录后才能爬取内容,有的网站会识别是否是由浏览器发出的请求. 一.headers的获取就以博客园的首页为例:http://www.cnblogs.c ...
Python爬虫学习：二、爬虫的初步尝试
我使用的编辑器是IDLE,版本为Python2.7.11,Windows平台. 本文是博主原创随笔,转载时请注明出处Maple2cat|Python爬虫学习:二.爬虫的初步尝试 1.尝试抓取指定网页 ...
《Python爬虫学习系列教程》学习笔记
http://cuiqingcai.com/1052.html 大家好哈,我呢最近在学习Python爬虫,感觉非常有意思,真的让生活可以方便很多.学习过程中我把一些学习的笔记总结下来,还记录了一些自己 ...
python爬虫学习视频资料免费送，用起来非常666
当我们浏览网页的时候,经常会看到像下面这些好看的图片,你是否想把这些图片保存下载下来. 我们最常规的做法就是通过鼠标右键,选择另存为.但有些图片点击鼠标右键的时候并没有另存为选项,或者你可以通过截图工 ...
python爬虫学习笔记（一）——环境配置（windows系统）
在进行python爬虫学习前,需要进行如下准备工作: python3+pip官方配置 1.Anaconda(推荐,包括python和相关库) [推荐地址:清华镜像] https://mirrors ...
[转]《Python爬虫学习系列教程》
<Python爬虫学习系列教程>学习笔记 http://cuiqingcai.com/1052.html 大家好哈,我呢最近在学习Python爬虫,感觉非常有意思,真的让生活可以方便很多. ...

随机推荐

BZOJ1785[USACO 2010 Jan Gold 3.Cow Telephones]——贪心
题目描述奶牛们建立了电话网络,这个网络可看作为是一棵无根树连接n(1 n 100,000)个节点,节点编号为1 .. n.每个节点可能是(电话交换机,或者电话机).每条电话线连接两个节点.第i条电话 ...
Educational Codeforces Round 23 B. Makes And The Product
B. Makes And The Product time limit per test 2 seconds memory limit per test 256 megabytes input sta ...
Partition Numbers的计算
partition numbers的定义 A000041 就是将正整数n分为k(\(1\le k\le n)\)个正整数相加,即\(n=a_1+a_2+...+a_k\)且\(a_1\le a_2\l ...
【BZOJ1998】[HNOI2010]物品调度（并查集，模拟）
[BZOJ1998][HNOI2010]物品调度(并查集,模拟) 题面 BZOJ,为啥这题都是权限题啊? 洛谷题解先不管\(0\)位置是个空,把它也看成一个箱子.那么最终的答案显然和置换循环节的个 ...
洛谷 P3965 [TJOI2013]循环格解题报告
P3965 [TJOI2013]循环格题目背景一个循环格就是一个矩阵,其中所有元素为箭头,指向相邻四个格子. 每个元素有一个坐标(行,列),其中左上角元素坐标为\((0,0)\).给定一个起始位\ ...
hdu 2845 Beans(最大不连续子序列和)
Problem Description Bean-eating is an interesting game, everyone owns an M*N matrix, which is filled ...
二分插入、bisect
在一个有序序列(从小到大)中查找一个元素每次将元素与序列中间位置的元素进行比较如果大于中点,则在后半段.如果小于中点,则在前半段.以此类推时间复杂度为O(logn) 有一个无序序列[37, 99 ...
zoj3707(Calculate Prime S)解题报告
1.计算(a/b)%c,其中b能整除a 设a=b*r=(bc)*s+b*t 则(b*t)为a除以bc的余数 r=c*s+t 而 (a/b)%c=r%c=t (a%bc)/b=(b*t)/b=t 所以对 ...
Quartz-中断正在执行的任务
转: Quartz-中断正在执行的任务 2017年11月15日 21:19:17 小小工匠阅读数:6715更多所属专栏: Quartz手札版权声明:[show me the code ,ch ...
03-body标签中相关标签
今日主要内容: 列表标签 <ul>.<ol>.<dl> 表格标签 <table> 表单标签 <fom> 一.列表标签列表标签分为三种. 1 ...

Python 爬虫学习

Python 爬虫学习的更多相关文章

随机推荐

热门专题