python：网络爬虫的学习笔记

如果要爬取的内容嵌在网页源代码中的话，直接下载网页源代码再利用正则表达式来寻找就ok了。下面是个简单的例子：

 import urllib.request

 html = urllib.request.urlopen('http://www.massey.ac.nz/massey/learning/programme-course/programme.cfm?prog_id=93536')

 html = html.read().decode('utf-8')

注意，decode方法有时候可能会报错，例如

 html = urllib.request.urlopen('http://china.nba.com/')

 html = html.read().decode('utf-8')

 Traceback (most recent call last):

   File "<ipython-input-6-fc582e316612>", line 1, in <module>

     html = html.read().decode('utf-8')

 UnicodeDecodeError: 'utf-8' codec can't decode byte 0xd6 in position 85: invalid continuation byte

具体原因不知道，可以用decode的一个参数，如下

 html = html.read().decode('utf-8','replace')

 html = urllib.request.urlopen('http://china.nba.com/')

 html = html.read().decode('utf-8','replace')

 html

 Out[9]: '<!DOCTYPE html>\r\n<html>\r\n<head lang="en">\r\n    <meta charset="UTF-8">\r\n    <title>NBA�й��ٷ���վ</title>\r\n    <meta http-equiv="X-UA-Compatible" content="IE=Edge,chrome=1">\r\n    <meta name="description" content="NBA�й��ٷ���վ">\r\n    <meta name="keywords"

replace表示遇到不能转码的字符就将其替换成问号还是什么的。。。这也算是一个折中的方法吧。我们继续回到正题。假如说我们想爬取上面提到的网页的课程名称

查看网页源代码。我用的谷歌浏览器，右键单击页面，再选择‘查看网页源代码’

再在这个页面上ctrl+F，查找你要爬取的字符：

这个就刚才截图所对应的代码（想看懂源代码还得学习一下html语言啊 http://www.w3school.com.cn/html/index.asp 这个网址挺不错的）

接下来就是用正则表达式把这个字符串扣下来了：

 re.findall('<h1>.*?</h1>',html)

 Out[35]: ['<h1>Master of Advanced Leadership Practice (<span>MALP</span>)</h1>']

剩下的就是对字符串的切割了：

 course = re.findall('<h1>.*?</h1>',html)

 course = str(course[0])

 course = course.replace('<h1>','')

 course = course.replace('(<span>MALP</span>)</h1>','')

结果：

 course = re.findall('<h1>.*?</h1>',html)

 course = str(course[0])

 course = course.replace('<h1>','')

 course = course.replace(' (<span>MALP</span>)</h1>','')

 course

 Out[40]: 'Master of Advanced Leadership Practice'

把它写成一个函数：

 def get_course(url):

     html = urllib.request.urlopen(url)

     html = html.read().decode('utf-8')

     course = re.findall('<h1>.*?</h1>',html)

     course = str(course[0])

     course = course.replace('<h1>','')

     course = course.replace(' (<span>MALP</span>)</h1>','')

     return course

这样输入该学校的其他课程的网址，同样也能把那个课程的名称扣下来（语文不好，请见谅）

 get_course('http://www.massey.ac.nz/massey/learning/programme-course/programme.cfm?prog_id=93059')

 Out[48]: 'Master of Counselling Studies (<span>MCounsStuds</span>)</h1>'

这就很尴尬了，原因是第二个replace函数，pattern是错误的，看来还得用正则改一下

 def get_course(url):

     html = urllib.request.urlopen(url)

     html = html.read().decode('utf-8')

     course = re.findall('<h1>.*?</h1>',html)

     course = str(course[0])

     course = course.replace('<h1>','')

     repl = str(re.findall(' \(<span>.*?</span>\)</h1>',course)[0])

     course = course.replace(repl,'')

     return course

再试试

 get_course('http://www.massey.ac.nz/massey/learning/programme-course/programme.cfm?prog_id=93059')

 Out[69]: 'Master of Counselling Studies'

搞定！

其实可以用BeautifulSoup直接解析源代码，使得查找定位更快。下一篇在说吧

这其实是我在广州第一份工作要干的活，核对网址是否存在，是否还是原来的课程。那个主管要人工核对。。。1000多个网址，他说他就是自己人工核对的，哈哈，我可不愿意干这活。当时也尝试用R语言去爬取课程名，试了很久。。。比较麻烦吧，后来学了python。现在要核对的话估计十分钟就能搞定1000多个网址了吧。就想装个b，大家可以无视

python：网络爬虫的学习笔记的更多相关文章

Python网络爬虫与信息提取笔记
直接复制粘贴笔记发现有问题文档下载地址//download.csdn.net/download/hide_on_rush/12266493 掌握定向网络数据爬取和网页解析的基本能力常用的 Pytho ...
《用Python写爬虫》学习笔记（一）
注:纯文本内容,代码独立另写,属于本人学习总结,无任何商业用途,在此分享,如有错误,还望指教. 1.为什么需要爬虫? 答:目前网络API未完全放开,所以需要网络爬虫知识. 2.爬虫的合法性? 答:爬虫 ...
《Python网络编程》学习笔记--使用谷歌地理编码API获取一个JSON文档
Foundations of Python Network Programing,Third Edition <python网络编程>,本书中的代码可在Github上搜索fopnp下载本 ...
《用Python写爬虫》学习笔记（二）编写第一个网络爬虫
1.首先,下载网页使用Python的urllib2模块,或者Python HTTP模块request来实现 urllib2会出现问题,解决方法1.重试下载(设置下载次数) 2.设置用户代理 2.其次, ...
《Python网络编程》学习笔记--从例子中收获的计算机网络相关知识
从之前笔记的四个程序中(http://www.cnblogs.com/take-fetter/p/8278864.html),我们可以看出分别使用了谷歌地理编码API(对URL表示地理信息查询和如何获 ...
《Python网络编程》学习笔记--UDP协议
第二章中主要介绍了UDP协议 UDP协议的定义(转自百度百科) UDP是OSI参考模型中一种无连接的传输层协议,它主要用于不要求分组顺序到达的传输中,分组传输顺序的检查与排序由应用层完成,提供面向事务 ...
关于Python网络爬虫实战笔记①
python网络爬虫项目实战笔记①如何下载韩寒的博客文章 python网络爬虫项目实战笔记①如何下载韩寒的博客文章 1. 打开韩寒博客列表页面 http://blog.sina.com.cn/s/ar ...
【python网络爬虫】之requests相关模块
python网络爬虫的学习第一步 [python网络爬虫]之0 爬虫与反扒 [python网络爬虫]之一简单介绍 [python网络爬虫]之二 python uillib库 [python网络爬虫] ...
python网络爬虫学习笔记
python网络爬虫学习笔记 By 钟桓 9月 4 2014 更新日期:9月 4 2014 文章文件夹 1. 介绍: 2. 从简单语句中開始: 3. 传送数据给server 4. HTTP头-描写叙述 ...

随机推荐

golang编写二叉树
最近开始找golang 开发工程师职位,针对算法相关二叉树相关常用面试题搞一遍: package tree import ( "math" "fmt&qu ...
MySQL导出数据到文件中
一.导出一张表数据把test_time表中的数据导出成txt 文件 mysql> show global variables like '%secure%'; +--------------- ...
进程、线程、协程的基本解析（python代码）
进程什么是进程?程序就是一堆放在磁盘上的代码,进程是一段程序的运行过程正规点说,进程一般由程序.数据集.进程控制块三部分组成什么进程切换?进程切换是,一个正在运行的进程被中断,操作系统指定另一个进程 ...
SpringBoot-整合Swagger2
swagger2是一个用于生成.并能直接调用的可是话restful风格的服务下面贴出springboot整合swagger2代码一.maven依赖这里使用的spring-boot版本是2.1.1 ...
关于STM32运行时程序卡在B.处的解决方法
文章转载自:https://blog.csdn.net/u014470361/article/details/78780444 背景: 程序运行时,发现程序卡死在B.处. 解决方法: 程序卡死在B.处 ...
python常用模块：标准文件及模块练习
1.请写出规范目录并解释各文件夹的作用 bin 执行文件core 核心业务逻辑conf 配置文件lib 库.公共代码.第三方模块db 数据分析log 日志文件readme 文本文档 2.改造atm+ ...
8.9.网络编程_Socket 远程调用机制
1.网络编程 1.1.网络编程概述: 通过通信线路(有线或无线)可以把不同地理位置且相互独立的计算机连同其外部设备连接起来,组成计算机网络.在操作系统.网络管理软件及网络通信协议的管理和协调下,可以 ...
java——比较难和底层的面试题
链接地址:https://mp.weixin.qq.com/s/lnbCysCQgfjF_kcB83KQZg 这是一个在线教育机构的文章,感觉大部分都不会,太难了. 一.自我介绍二.多线程相关: 线 ...
springboot中使用filter用配置类方式
在03-springboot-web的Filter包下,创建HeFilter类代码示例: package com.bjpowernode.springboot.filter; import java ...
22_5mybatis多表操作
1.表之间的关系一对多多对一一对一多对多举例: 用户和订单就是一对多订单和用户就是多对一一个用户可以下多个订单多个订单属于同一个用户人和身份证号就是一对一一个人只能有一个身份证号 ...

python：网络爬虫的学习笔记

python：网络爬虫的学习笔记的更多相关文章

随机推荐

热门专题