[Python]爬虫v0.1

#coding:utf-8

import urllib

######

#爬虫v0.1 利用urlib2 和 字符串内建函数

######

# 获取网页内容

def getHtml(url):

    page = urllib.urlopen(url)

    html = page.read()

    return html

def content(html):

    # 内容分割的标签

    str = '<article class="article-content">'

    content = html.partition(str)[2]

    str1 = '<div class="article-social">'

    content = content.partition(str1)[0]

    return content # 得到网页的内容

def title(content,beg = 0):

    # 思路是利用str.index()和序列的切片

    try:

        title_list = []

        while beg >=0:

            num1 = content.index('】',beg)

            num2 = content.index('</p>',num1)

            title_list.append(content[num1:num2])

            beg = num2

    except ValueError:

         return title_list

def get_title():

    # 利用循环更新num1和num2，从而匹配出全部title

    pass

content = content(getHtml("http://bohaishibei.com/post/10449/"))

#num = content.index('】')

title = title(content)

for i,e in enumerate(title):

    print '第%d个，title：%s' % (i,e)

# 今天爬的单个页面的title

只是粗略的记录写爬虫的过程和思路，本来打算直播的，但是我们十一点断电断网。明天续写这个文章，直播写爬虫。哈哈哈，虽然基础，但是也是写出来吧。

[Python]爬虫v0.1的更多相关文章

【Python】【爬虫】如何学习Python爬虫？
如何学习Python爬虫[入门篇]? 路人甲 1 年前想写这么一篇文章,但是知乎社区爬虫大神很多,光是整理他们的答案就够我这篇文章的内容了.对于我个人来说我更喜欢那种非常实用的教程,这种教程对于想直 ...
python 爬虫（转，我使用的python3）
原文地址:http://blog.csdn.net/pi9nc/article/details/9734437 [Python]网络爬虫(一):抓取网页的含义和URL基本构成分类: 爬虫 Pyt ...
小白学 Python 爬虫（2）：前置准备（一）基本类库的安装
人生苦短,我用 Python 前文传送门: 小白学 Python 爬虫(1):开篇本篇内容较长,各位同学可以先收藏后再看~~ 在开始讲爬虫之前,还是先把环境搞搞好,工欲善其事必先利其器嘛~~~ 本篇 ...
Python 爬虫模拟登陆知乎
在之前写过一篇使用python爬虫爬取电影天堂资源的博客,重点是如何解析页面和提高爬虫的效率.由于电影天堂上的资源获取权限是所有人都一样的,所以不需要进行登录验证操作,写完那篇文章后又花了些时间研究了 ...
python爬虫成长之路（一）：抓取证券之星的股票数据
获取数据是数据分析中必不可少的一部分,而网络爬虫是是获取数据的一个重要渠道之一.鉴于此,我拾起了Python这把利器,开启了网络爬虫之路. 本篇使用的版本为python3.5,意在抓取证券之星上当天所 ...
python爬虫学习(7) —— 爬取你的AC代码
上一篇文章中,我们介绍了python爬虫利器--requests,并且拿HDU做了小测试. 这篇文章,我们来爬取一下自己AC的代码. 1 确定ac代码对应的页面如下图所示,我们一般情况可以通过该顺序 ...
python爬虫学习(6) —— 神器 Requests
Requests 是使用 Apache2 Licensed 许可证的 HTTP 库.用 Python 编写,真正的为人类着想. Python 标准库中的 urllib2 模块提供了你所需要的大多数 H ...
批量下载小说网站上的小说（python爬虫）
随便说点什么因为在学python,所有自然而然的就掉进了爬虫这个坑里,好吧,主要是因为我觉得爬虫比较酷,才入坑的. 想想看,你可以批量自动的采集互联网上海量的资料数据,是多么令人激动啊! 所以我就被 ...
python 爬虫（二）
python 爬虫 Advanced HTML Parsing 1. 通过属性查找标签:基本上在每一个网站上都有stylesheets,针对于不同的标签会有不同的css类于之向对应在我们看到的标签可能 ...

随机推荐

推荐几款API文档集合工具
https://zealdocs.org/ 开源.免费,支持Linux.Windows http://velocity.silverlakesoftware.com/ https://kape ...
【由VerySky原创】由Number Range 导致凭证生成但无法保存的问题
工厂正常生产,但某天突然发生车辆下线失败销售入库报错( MFBF凭证不能保存\ 下线车无法产生131 )的问题: ST22发现程序dump信息分析 | SAPSQL_ARRAY_INSERT_DUP ...
Revit中如何自定义快捷键
最佳的绘图方式是左手键盘,右手鼠标,使用快捷键将大大提高绘图效率,Revit同样提供了自定义绘图工具快捷键的功能(Revit2011及以后版本),有两种方式调出自定义快捷键窗口,第一种是Revit窗口 ...
java list中的对象去重原理
/******************************************************************************* * * Copyright (c) W ...
C#代码像QQ的右下角消息框一样，无论现在用户的焦点在哪个窗口，消息框弹出后都不影响焦点的变化，那么有两种方法
你QQ的右下角消息框一样,无论现在用户的焦点在哪个窗口,消息框弹出后都不影响焦点的变化,那么有两种方法: 要么重写需要弹出的窗体的事件: protected override CreateParams ...
CDN技术分享
CDN技术分享目录网络应用服务发展 CDN技术 1.CDN是什么?为什么我们需要它?(简介) 2.CDN能做什么?(作用) 3.CDN是如何工作?(原理) 4.CDN有那些具体应用?(应用) 我们项 ...
sqlserver row_number 类似 mysql中 limit 用法
select * from ( select row_number() over(ORDER BY inspecdate desc,inspectime DESC,itemorder asc ) as ...
HDU 3874 Necklace （树状数组｜线段树的离线处理）
Necklace Time Limit: 15000/5000 MS (Java/Others) Memory Limit: 65536/32768 K (Java/Others)Total S ...
用户管理之用户（User）和用户组（Group）配置文件详解
用户(User)和用户组(Group)的配置文件,是系统管理员最应该了解和掌握的系统基础文件之一,从另一方面来说,了解这些文件也是系统安全管理的重要组成部份:做为一个合格的系统管理员应该对用户和用户组 ...
Android ImageView src与backgroud
在XML中添加ImageView时,有两个可以设置图片的地方,一个是android:src,一个是android:background,这两个的区别: src是图片内容,显示在前面的,backgrou ...

[Python]爬虫v0.1

[Python]爬虫v0.1的更多相关文章

随机推荐

热门专题