python爬虫-贴吧

#!/usr/bin/python
# coding=utf-8
# 作者      :Y0010026
# 创建时间  :2018/12/16 15:33
# 文件      :spider_03.py
# IDE       :PyCharm
import urllib2  # 用于进行中文编码
import urllib  # 用于进行爬虫核心处理

def load_url(url, file_name):
    '''
    作用：针对指定的url地址，进行数据的获取
    :param url: 需要爬取的具体url地址
    :param file_name: 要保存的文件名称；在当前函数中，只做提示使用
    :return: 爬取的数据
    '''

    print ('开始爬取%s的内容' % file_name)

    # 爬取程序
    my_headers = {
        'User-Agent': 'Mozilla/5.0(WindowsNT6.1;rv:2.0.1)Gecko/20100101Firefox/4.0.1'
    }
    requset = urllib2.Request(url, headers=my_headers)
    content = urllib2.urlopen(requset).read()
    print ('爬取%s的内容完成！' % file_name)
    return content

def save_data(data, file_name):
    '''
    作用：主要用于进行数据存储
    :param data: 要存储的数据
    :param file_name: 要存储的文件名称
    :return: 无
    '''
    print ('开始保存%s的内容' % file_name)
    with open(file_name, 'w') as f:
        f.write(data)
    print ('保存%s的内容完成！' % file_name)

# 定义函数，进行爬虫的核心处理功能
def spider(url, kw, begin, end):
    '''
    作用：用于进行核心爬虫功能的调度
    :param url: 要爬取的地址
    :param kw: 贴吧名称
    :param begin: 起始页码
    :param end: 结束页码
    :return: 无
    '''

    for page in range(begin, end + 1):
        # 计算需要的页码
        pn = (page - 1) * 50
        # 进行kw参数的编码
        kw = urllib.urlencode({'kw': kw})
        # 拼接url地址
        full_url = url + kw + '&pn=' + str(pn)
        # 定义一个保存文件的名称
        file_name = '网页' + str(page) + '.html'
        # 开始爬取数据
        html = load_url(full_url, file_name)
        # 保存数据到文件
        save_data(html, file_name)

# 主程序运行入口
if __name__ == '__main__':
    # 用户数据相关数据
    url = "http://tieba.baidu.com/f?"
    kw = raw_input('请输入要爬取的贴吧名称：')
    begin = int(raw_input('请输入开始页码：'))
    end = int(raw_input('请输入结束页码：'))
    # 调用爬虫开始执行
    spider(url, kw, begin, end)

python爬虫-贴吧的更多相关文章

Python 爬虫模拟登陆知乎
在之前写过一篇使用python爬虫爬取电影天堂资源的博客,重点是如何解析页面和提高爬虫的效率.由于电影天堂上的资源获取权限是所有人都一样的,所以不需要进行登录验证操作,写完那篇文章后又花了些时间研究了 ...
python爬虫成长之路（一）：抓取证券之星的股票数据
获取数据是数据分析中必不可少的一部分,而网络爬虫是是获取数据的一个重要渠道之一.鉴于此,我拾起了Python这把利器,开启了网络爬虫之路. 本篇使用的版本为python3.5,意在抓取证券之星上当天所 ...
python爬虫学习(7) —— 爬取你的AC代码
上一篇文章中,我们介绍了python爬虫利器--requests,并且拿HDU做了小测试. 这篇文章,我们来爬取一下自己AC的代码. 1 确定ac代码对应的页面如下图所示,我们一般情况可以通过该顺序 ...
python爬虫学习(6) —— 神器 Requests
Requests 是使用 Apache2 Licensed 许可证的 HTTP 库.用 Python 编写,真正的为人类着想. Python 标准库中的 urllib2 模块提供了你所需要的大多数 H ...
批量下载小说网站上的小说（python爬虫）
随便说点什么因为在学python,所有自然而然的就掉进了爬虫这个坑里,好吧,主要是因为我觉得爬虫比较酷,才入坑的. 想想看,你可以批量自动的采集互联网上海量的资料数据,是多么令人激动啊! 所以我就被 ...
python 爬虫（二）
python 爬虫 Advanced HTML Parsing 1. 通过属性查找标签:基本上在每一个网站上都有stylesheets,针对于不同的标签会有不同的css类于之向对应在我们看到的标签可能 ...
Python 爬虫1——爬虫简述
Python除了可以用来开发Python Web之后,其实还可以用来编写一些爬虫小工具,可能还有人不知道什么是爬虫的. 一.爬虫的定义: 爬虫——网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区 ...
Python爬虫入门一之综述
大家好哈,最近博主在学习Python,学习期间也遇到一些问题,获得了一些经验,在此将自己的学习系统地整理下来,如果大家有兴趣学习爬虫的话,可以将这些文章作为参考,也欢迎大家一共分享学习经验. Pyth ...
[python]爬虫学习（一）
要学习Python爬虫,我们要学习的共有以下几点(python2): Python基础知识 Python中urllib和urllib2库的用法 Python正则表达式 Python爬虫框架Scrapy ...
python爬虫学习(1) —— 从urllib说起
0. 前言如果你从来没有接触过爬虫,刚开始的时候可能会有些许吃力因为我不会从头到尾把所有知识点都说一遍,很多文章主要是记录我自己写的一些爬虫所以建议先学习一下cuiqingcai大神的 Pyth ...

随机推荐

luogu P2252 威佐夫博弈模板博弈
LINK:威佐夫博弈四大博弈我都没有好好整理不过大致可以了解一下. 在这个博弈中存在一些局面先手遇到必胜. 不过由于后手必胜的局面更具规律性这里研究先手遇到的局面后手必胜的情况. 这些局面分 ...
微信小程序订阅消息调研
相关资料背景:微信模板消息已正式下架,改为订阅消息,详情如下: 服务变更通知订阅消息:订阅消息相关内容如下: 订阅消息接口设计获取接口访问凭证 :根据appId和secret获取接口访问凭证a ...
Flask 框架小记
Flask 框架小记 Flask 实例创建示例的代码 from flask import Flask # __name__ 是模块名, 用于反射导入模块 app = Flask(__name__, ...
JavaScript 实用方法
1.按时间显示问候语 2.强制光标停留位置 3.保存页面文本 <!DOCTYPE HTML PUBLIC "-//W3C//DTD HTML 4.0 Transitional//EN& ...
Flutter 容器Container类和布局Layout类
1.布局和容器 [布局]是把[容器]按照不同的方式排列起来. Scaffold包含的主要部门:appBar,body,bottomNavigator 其中body可以是一个布局组件,也可以是一个容器组 ...
Flutter build apk 如何访问网络
将下列配置放到路径:your_project\android\app\src下的 main 文件夹下的 AndroidManifest.xml 和 profile 文件夹下的 AndroidManif ...
SpringBoot实现本地存储文件上传及提供HTTP访问服务
笔者计划为大家介绍分布式文件系统,用于存储应用的图片.word.excel.pdf等文件.在开始介绍分布式文件系统之前,为大家介绍一下使用本机存储来存放文件资源. 二者的核心实现过程是一样的: 上传文 ...
编译原理 First集和Follow集的求法
转载地址 https://blog.csdn.net/Alexander_Frank/article/details/51280798 自上而下分析: FIRST集求法 First集合最终是对产生式右 ...
精讲RestTemplate第6篇-文件上传下载与大文件流式下载
本文是精讲RestTemplate第6篇,前篇的blog访问地址如下: 精讲RestTemplate第1篇-在Spring或非Spring环境下如何使用精讲RestTemplate第2篇-多种底层H ...
HTML基础-01
HTML:超文本标记语言,是一种使用结构化Web网页(标准制定者:W3C)及其内容的标记语言. 发展过程:XHTML5,HTML5,XHTML1.0,HTML4.01,HTML3.2 HTML5特性: ...

python爬虫-贴吧

python爬虫-贴吧的更多相关文章

随机推荐

热门专题