Python 爬虫学习

#coding:utf-8

#author:Blood_Zero

'''

    1、获取网页信息

    2、解决编码问题，通过charset库(默认不安装这个库文件)

'''

import urllib

import urllib2

url = "http://192.168.1.135/myself/"

html = urllib.urlopen(url)

content = html.read()

print content

#如果网页中存在其他编码，就会出现乱码

#print content.decode('gbk').encode('utf-8')

'''

    简易获取网页信息

'''

#获取当前url

print "当前URL："+str(html.geturl())

#网页状态码

print "当前状态码："+str(html.code)

#print "当前状态码："+str(html.getcode())

#网站头信息

print "当前头信息：\n"+str(html.headers)

#print "当前头信息：\n"+str(html.info())

#获取网站编码

print "当前网站使用编码："+str(html.info().getparam("charset"))

#下载网页源码

urllib.urlretrieve(url,"E:\\Python_Code\\pyTools\\url.txt")

'''

    模拟浏览器访问网址

'''

#方法一

req=urllib2.Request(url)

# 添加头信息

req.add_header("User-Agent","Mozilla/5.0 (Windows NT 6.2; WOW64; rv:39.0) Gecko/20100101 Firefox/39.0")

req.add_header("Get",url)

req.add_header("Host","192.168.1.135")

new_html = urllib2.urlopen(req)

print new_html.read()

print req.headers.items()

#方法二

myheader={

    "User-Agent":"Mozilla/5.0 (Windows NT 6.2; WOW64; rv:39.0) Gecko/20100101 Firefox/39.0",

    "Host":"192.168.1.135",

    "Get":url

}

req1 = urllib2.Request(url,headers=myheader)

new_html_1 = urllib2.urlopen(req1)

print new_html_1.read()

print req1.headers.items()

'''

    在网页中查询指定文件

'''

def get_content(url):

    html = urllib.urlopen(url)

    content = html.read()

    html.close()

    return content

def get_file(self):

    #匹配php文件

    regex = r'a href=(.+?\.php)'

    pat=re.compile(regex)

    file_code = re.findall(pat,self)

    print str(file_code)+"\n"

info = get_content("http://192.168.1.135/myself/SQL_Injection/")

get_file(info)

Python 爬虫学习的更多相关文章

python 爬虫学习<将某一页的所有图片下载下来>
在我们日常上网浏览网页的时候,经常会看到一些好看的图片,我们就希望把这些图片保存下载,或者用户用来做桌面壁纸,或者用来做设计的素材. 我们最常规的做法就是通过鼠标右键,选择另存为.但有些图片鼠标右键的 ...
python爬虫学习(1) —— 从urllib说起
0. 前言如果你从来没有接触过爬虫,刚开始的时候可能会有些许吃力因为我不会从头到尾把所有知识点都说一遍,很多文章主要是记录我自己写的一些爬虫所以建议先学习一下cuiqingcai大神的 Pyth ...
python爬虫学习 —— 总目录
开篇作为一个C党,接触python之后学习了爬虫. 和AC算法题的快感类似,从网络上爬取各种数据也很有意思. 准备写一系列文章,整理一下学习历程,也给后来者提供一点便利. 我是目录听说你叫爬虫 - ...
Python爬虫学习：三、爬虫的基本操作流程
本文是博主原创随笔,转载时请注明出处Maple2cat|Python爬虫学习:三.爬虫的基本操作与流程一般我们使用Python爬虫都是希望实现一套完整的功能,如下: 1.爬虫目标数据.信息: 2.将 ...
Python爬虫学习：四、headers和data的获取
之前在学习爬虫时,偶尔会遇到一些问题是有些网站需要登录后才能爬取内容,有的网站会识别是否是由浏览器发出的请求. 一.headers的获取就以博客园的首页为例:http://www.cnblogs.c ...
Python爬虫学习：二、爬虫的初步尝试
我使用的编辑器是IDLE,版本为Python2.7.11,Windows平台. 本文是博主原创随笔,转载时请注明出处Maple2cat|Python爬虫学习:二.爬虫的初步尝试 1.尝试抓取指定网页 ...
《Python爬虫学习系列教程》学习笔记
http://cuiqingcai.com/1052.html 大家好哈,我呢最近在学习Python爬虫,感觉非常有意思,真的让生活可以方便很多.学习过程中我把一些学习的笔记总结下来,还记录了一些自己 ...
python爬虫学习视频资料免费送，用起来非常666
当我们浏览网页的时候,经常会看到像下面这些好看的图片,你是否想把这些图片保存下载下来. 我们最常规的做法就是通过鼠标右键,选择另存为.但有些图片点击鼠标右键的时候并没有另存为选项,或者你可以通过截图工 ...
python爬虫学习笔记（一）——环境配置（windows系统）
在进行python爬虫学习前,需要进行如下准备工作: python3+pip官方配置 1.Anaconda(推荐,包括python和相关库) [推荐地址:清华镜像] https://mirrors ...
[转]《Python爬虫学习系列教程》
<Python爬虫学习系列教程>学习笔记 http://cuiqingcai.com/1052.html 大家好哈,我呢最近在学习Python爬虫,感觉非常有意思,真的让生活可以方便很多. ...

随机推荐

BZOJ1901Zju2112 Dynamic Rankings——树状数组套主席树
题目描述给定一个含有n个数的序列a[1],a[2],a[3]……a[n],程序必须回答这样的询问:对于给定的i,j,k,在a[i],a[i+1 ],a[i+2]……a[j]中第k小的数是多少(1≤k ...
图之强连通、强连通图、强连通分量 Tarjan算法
原文地址:https://blog.csdn.net/qq_16234613/article/details/77431043 一.解释在有向图G中,如果两个顶点间至少存在一条互相可达路径,称两个顶 ...
hud 1312
There is a rectangular room, covered with square tiles. Each tile is colored either red or black. A ...
NOIP2018退役记
退役失败*1. md可能只有一次啊.
使用kubeadm部署kubernetes1.9.1+coredns+kube-router(ipvs)高可用集群
由于之前已经写了两篇部署kubernetes的文章,整个过程基本一致,所以这篇只着重说一下coredns和kube-router的部署. kube version: 1.9.1 docker vers ...
MATLAB：图像的与、或、非、异或逻辑运算（&、|、~、xor）
图像的与.或.非.异或逻辑运算涉及到了&.|.~和xor符号 close all;%关闭当前所有图形窗口,清空工作空间变量,清除工作空间所有变量 clc; clear all; I=imrea ...
Netty 4.1 Getting Start （翻译） + Demo
一.先来官方入门页面的翻译(翻译不好请多包涵) 入门本章以简单的例子来介绍Netty的核心概念,以便让您快速入门.当您阅读完本章之后,您就能立即在Netty的基础上写一个客户端和一个服务器. 如果您 ...
HTML中的相对路径与绝对路径（转）
原文地址:http://www.cnblogs.com/heyonggang/archive/2013/03/01/2938984.html 在HTML里只要涉及文件的地方(如超级链接.图片等)就会涉 ...
python 压缩文件为zip后删除原文件
压缩.log 文件为zip后删除原文件需要注意:本人作为小白,该脚本需要和.log在一起,后面有时间需要改正. #!/usr/local/python/bin/python #-*-coding=u ...
PLSQL Developer 连接Linux 下Oracle的安装与配置
一.下载下载地址:http://www.oracle.com/technetwork/database/features/instant-client/index-097480.html 这是Ora ...

Python 爬虫学习

Python 爬虫学习的更多相关文章

随机推荐

热门专题