Python3爬虫学习

学了几天python3，发现目前学到的与爬虫还是关系不大，所以现在准备爬虫和语言同步学习。

2016.8.9晚

先从最简单的开始，爬取指定url的所有内容：

#encoding:UTF-8

import urllib.request

url = "http://www.selflink.cn/selflink"

data = urllib.request.urlopen(url).read()

data = data.decode('UTF-8')

print(data)

#encoding:UTF-8

import urllib.request

url = "http://www.cma.gov.cn/"

data = urllib.request.urlopen(url).read()

data = data.decode('gbk')

print(data)

编码不同，一个是utf-8，一个是gbk

另外，输出写入文件到的时候如果写入了一个html文件，打开可能会产生乱码，这个时候不要怀疑python的中文兼容性！（python中文兼容性超级好）其实可以用记事本打开一下爬取到的文件，编码是不是错了，可以另存为一下，重新设置一下编码（比如设置成utf-8），再把网页打开就发现不乱码了。比如这份代码：

import urllib.request

url = "http://www.douban.com/"

webPage=urllib.request.urlopen(url)

data = webPage.read()

data = data.decode('utf-8')

f = open("d:/1.html","w")

f.write(data)

print(type(webPage))

print(webPage.geturl())

print(webPage.info())

print(webPage.getcode())

因为python默认是以ASCII码存储文件的，所以在浏览器中爬取到的这个文件就显示了乱码。手动修改文件的编码就可以了。

当然，如果想自动设置文件编码，需要用到codecs库：

import urllib.request

import codecs

url = "http://www.douban.com/"

webPage=urllib.request.urlopen(url)

data = webPage.read()

data = data.decode('utf-8')

f = codecs.open("d:/1.html","w","utf-8")

f.write(data)

print(type(webPage))

print(webPage.geturl())

print(webPage.info())

print(webPage.getcode())

或者指定文件编码：

#coding:utf8

import urllib.request

import urllib

import re

s='你好 百度百科'

s=urllib.parse.quote(s)

url = "http://www.baidu.com/s?wd=%s"%(s)

webPage=urllib.request.urlopen(url)

data = webPage.read()

data = data.decode('utf-8')

k = re.split(r'\s+',data)

s = []

sr = []

sh=[]

for i in k :

    if (re.match(r'href',i)):

        if (not re.match(r'href="#"',i)):

            s.append(i)

f = open("D:/Pythoncode/simplecodes/bd.html","w",encoding='utf-8')

for i in s:

    if (re.match(r'href="http://www.baidu.com/link',i)):

        sr.append(i)

for it in sr:

    m = re.search(r'href="(.*?)"',it)

    iturl = m.group(1)

    sh.append(iturl)

iurl = sh[0]

webPage=urllib.request.urlopen(iurl)

data = webPage.read()

data = data.decode('utf-8')

f.write(data)

f.close()

当然还有一种方法，就是直接以二进制的方式写入文件。

import urllib.request

url = "http://www.douban.com"

webPage=urllib.request.urlopen(url)

data = webPage.read()

#data = data.decode('UTF-8')

f = open("d:/1.html","wb")

f.write(data)

这种方法同样适用于爬取图片或者其他文件：

import urllib.request

url = "http://www.selflink.cn/huoying/naruto.jpg"

webPage=urllib.request.urlopen(url)

data = webPage.read()

#data = data.decode('UTF-8')

f = open("d:/naruto.jpg","wb")

f.write(data)

Python3爬虫学习的更多相关文章

python3.4学习笔记(十七) 网络爬虫使用Beautifulsoup4抓取内容
python3.4学习笔记(十七) 网络爬虫使用Beautifulsoup4抓取内容 Beautiful Soup 是用Python写的一个HTML/XML的解析器,它可以很好的处理不规范标记并生成剖 ...
python3.4学习笔记(十三) 网络爬虫实例代码，使用pyspider抓取多牛投资吧里面的文章信息，抓取政府网新闻内容
python3.4学习笔记(十三) 网络爬虫实例代码,使用pyspider抓取多牛投资吧里面的文章信息PySpider:一个国人编写的强大的网络爬虫系统并带有强大的WebUI,采用Python语言编写 ...
python3.4学习笔记(十四) 网络爬虫实例代码，抓取新浪爱彩双色球开奖数据实例
python3.4学习笔记(十四) 网络爬虫实例代码,抓取新浪爱彩双色球开奖数据实例新浪爱彩双色球开奖数据URL:http://zst.aicai.com/ssq/openInfo/ 最终输出结果格 ...
python网络爬虫学习笔记
python网络爬虫学习笔记 By 钟桓 9月 4 2014 更新日期:9月 4 2014 文章文件夹 1. 介绍: 2. 从简单语句中開始: 3. 传送数据给server 4. HTTP头-描写叙述 ...
python爬虫学习笔记（一）——环境配置（windows系统）
在进行python爬虫学习前,需要进行如下准备工作: python3+pip官方配置 1.Anaconda(推荐,包括python和相关库) [推荐地址:清华镜像] https://mirrors ...
python3.4学习笔记(七) 学习网站博客推荐
python3.4学习笔记(七) 学习网站博客推荐深入 Python 3http://sebug.net/paper/books/dive-into-python3/<深入 Python 3& ...
python3爬虫（4）各种网站视频下载方法
python3爬虫(4)各种网站视频下载方法原创H-KING 最后发布于2019-01-09 11:06:23 阅读数 13608 收藏展开理论上来讲只要是网上(浏览器)能看到图片,音频,视频,都能够 ...
python爬虫学习(1) —— 从urllib说起
0. 前言如果你从来没有接触过爬虫,刚开始的时候可能会有些许吃力因为我不会从头到尾把所有知识点都说一遍,很多文章主要是记录我自己写的一些爬虫所以建议先学习一下cuiqingcai大神的 Pyth ...
python爬虫学习 —— 总目录
开篇作为一个C党,接触python之后学习了爬虫. 和AC算法题的快感类似,从网络上爬取各种数据也很有意思. 准备写一系列文章,整理一下学习历程,也给后来者提供一点便利. 我是目录听说你叫爬虫 - ...

随机推荐

ti processor sdk linux am335x evm /bin/setup-uboot-env.sh hacking
#!/bin/sh # # ti processor sdk linux am335x evm /bin/setup-uboot-env.sh hacking # 说明: # 本文主要对TI的sdk中 ...
Java [Leetcode 238]Product of Array Except Self
题目描述: Given an array of n integers where n > 1, nums, return an array output such that output[i] ...
省常中模拟 Test3 Day1
tile 贪心题意:给出一个矩形,用不同字母代表的正方形填充,要求相邻的方块字母不能相同,求字典序(将所有行拼接起来)最小的方案. 初步解法:一开始没怎么想,以为策略是每次填充一个尽量大的正方形.但 ...
【转】第一次使用Android Studio时你应该知道的一切配置
原文网址:http://www.cnblogs.com/smyhvae/p/4390905.html [声明] 欢迎转载,但请保留文章原始出处→_→ 生命壹号:http://www.cnblogs.c ...
【转】让apache支持中文路径或者中文文件
本帖最后由狂人阿川于 2013-4-12 19:13 编辑今天在给一美国VPS客户调试他的程序的时候.发现他的网站有中文名称.貌似apache无法认识中文路径,火狐下面能下载他的文件,IE下面不 ...
[King.yue]Ext.Net 正则表达式用法
例: .Regex("^[A-Za-z0-9]+$") //正则表达式 .InvalidText("只能输入英文字符和数字.")); //输入错误提示
我的Myeclipse黑色主题
Developer Tools（开发工具）
Google提供了使用Java和Python开发App Engine的免费工具.你可以从Google的网站上下载你所用语言和操作系统的软件开发包.Java用户可以以Eclipse集成开发环境的方式获取 ...
Windwos Server 2008: 当网卡有多个IP地址时，如何指定缺省地址？
这实际是一个当应用向外发起连接时,协议栈对源IP地址的选择问题.如果你的应用没有显式绑定一个本地地址,协议栈会选择一个"最佳"的本地地址来使用. 从 Vista 之后这个选择策略发 ...
Codeforces 381 简要题解
做的太糟糕了...第一题看成两人都取最优策略,写了个n^2的dp,还好pre-test良心(感觉TC和CF的pretest还是很靠谱的),让我反复过不去,仔细看题原来是取两边最大的啊!!!前30分钟就 ...

Python3爬虫学习

Python3爬虫学习的更多相关文章

随机推荐

热门专题