spider-抓取网页内容(Beautiful soup)

http://jingyan.baidu.com/article/afd8f4de6197c834e386e96b.html

http://cuiqingcai.com/1319.html

Windows下安装Beautifulsoup：

1.下载压缩包：https://www.crummy.com/software/BeautifulSoup/#Download

2.将其解压到Python目录下

3.导航到如下目录，然后运行如下命令：

setup.py build

setup.py install

4.进入Python，导入BS模块，表示安装成功

from bs4 import BeautifulSoup

实例：bs抓取天气预报：

# -*- coding: UTF-8 -*-

import urllib2,sys,json

from json import *

from bs4 import BeautifulSoup as bs

reload(sys)

sys.setdefaultencoding('utf-8')

url='http://www.weather.com.cn/weather/101010100.shtml'

req = urllib2.Request(url)

res = urllib2.urlopen(req).read()

soup = bs(res)

#print soup.prettify()

divsw = soup.find_all('div',class_='c7d',id='7d')[0]  #7天的预报内容都在该div下，查询结果为queryset，所以需要使用索引0

divs_date = divsw.find_all('h1') #find date

for h in divs_date:

    print h.string

divs_wea = divsw.find_all('p',class_='wea') #find weather

for p in divs_wea:

    print p.get('title')

divs_tem = divsw.find_all('p',class_='tem') #find weather

for tem in divs_tem:

    tem_max = tem.find('span').string

    tem_min = tem.find('i').string

    print tem_min,'-',tem_max

结果：

spider-抓取网页内容(Beautiful soup)的更多相关文章

paip.抓取网页内容--java php python
paip.抓取网页内容--java php python.txt 作者Attilax 艾龙, EMAIL:1466519819@qq.com 来源:attilax的专栏地址:http://blog ...
使用Jsoup函数包抓取网页内容
之前写过一篇用Java抓取网页内容的文章,当时是用url.openStream()函数创建一个流,然后用BufferedReader把这个inputstream读取进来.抓取的结果是一整个字符串.如果 ...
Asp.Net 之抓取网页内容
一.获取网页内容——html ASP.NET 中抓取网页内容是非常方便的,而其中更是解决了 ASP 中困扰我们的编码问题. 需要三个类:WebRequest.WebResponse.StreamRea ...
ASP.NET抓取网页内容的实现方法
这篇文章主要介绍了ASP.NET抓取网页内容的实现方法,涉及使用HttpWebRequest及WebResponse抓取网页内容的技巧,需要的朋友可以参考下一.ASP.NET 使用HttpWebRe ...
ASP.NET抓取网页内容
原文:ASP.NET抓取网页内容一.ASP.NET 使用HttpWebRequest抓取网页内容这种方式抓取某些页面会失败不过,有时候我们会发现,这个程序在抓取某些页面时,是获不到所需的内容的, ...
c#抓取网页内容乱码的解决方案
写过爬虫的同学都知道,这是个很常见的问题了,一般处理思路是: 使用HttpWebRequest发送请求,HttpWebResponse来接收,判断HttpWebResponse中”Content-Ty ...
C# 抓取网页内容的方法
1.抓取一般内容需要三个类:WebRequest.WebResponse.StreamReader 所需命名空间:System.Net.System.IO 核心代码: view plaincopy ...
ASP.NET 抓取网页内容
(转)ASP.NET 抓取网页内容 ASP.NET 抓取网页内容-文字 ASP.NET 中抓取网页内容是非常方便的,而其中更是解决了 ASP 中困扰我们的编码问题. 需要三个类:WebRequest. ...
爬虫学习一系列：urllib2抓取网页内容
爬虫学习一系列:urllib2抓取网页内容所谓网页抓取,就是把URL地址中指定的网络资源从网络中读取出来,保存到本地.我们平时在浏览器中通过网址浏览网页,只不过我们看到的是解析过的页面效果,而通过程 ...

随机推荐

jenkins 踩坑路之 jenkins ssh 脚本
背景: 由于公司业务调整,整个业务要从阿里云迁移到aws,自然 jenkins 也是要进行迁移的.jenkins 迁移过程中遇到的问题在此记录下,希望能给遇到类似问题的朋友些许帮助.也便于我后期遇到此 ...
Java并发编程笔记之ThreadLocalRandom源码分析
JDK 并发包中 ThreadLocalRandom 类原理剖析,经常使用的随机数生成器 Random 类的原理是什么?及其局限性是什么?ThreadLocalRandom 是如何利用 ThreadL ...
vim---打造Python IDE
1.文法高亮为了能在Vim中支持Python文法需要用到插件python.vim,该插件默认位于(/usr/share/vim/vim72/)<Vim安装目录>/<$VIMRUNT ...
[CQOI 2018]破解D-H协议
Description 题库链接给出 $A,B,P,g$ ,$g$ 是 $P$ 的原根,求出 $A\equiv g^a\pmod{P}$ , \(B\equiv g^b\pmod{P ...
16.Generator 函数的异步应用
Generator 函数的异步应用 Generator 函数的异步应用异步编程对 JavaScript 语言太重要.Javascript 语言的执行环境是"单线程"的,如果没有异 ...
OpenDigg前端开源项目月报201704
由OpenDigg 出品的前端开源项目月报第一期来啦.我们的前端开源月报集合了OpenDigg一个月来新收录的优质前端开源项目,方便前端开发人员便捷的找到自己需要的项目工具. reactide Rea ...
ionic组件清单
整理时间:2017-5-22 官网版本:v3.2.0 / 2017-05-10 / MIT Licensed / Release Notes
DOM-添加元素、节点
createElement()方法能够根据参数指定的标签名称创建一个新元素,并返回新建元素的引用,用法如下 var element=document.createElement("tagNa ...
why go
取自:http://www.weixinyidu.com/n_3502636 Go的核心贡献者 Go主要有静态语言.天生并发.内置GC.安全性高.语法简单.交叉编译和编译快速这几个方面的特性.这些特性 ...
[C语言] 数据结构-逻辑结构和物理结构
数据结构:相互之间存在一种或多种特定关系的数据元素的集合 1.数据结构分为逻辑结构和物理结构集合结构:集合结构中的数据元素除了同属于一个集合外,他们之间没有其他关系线性结构:线性结构中的数据元素之 ...

spider-抓取网页内容(Beautiful soup)

spider-抓取网页内容(Beautiful soup)的更多相关文章

随机推荐

热门专题