Python 豆瓣日记爬取

无聊写了个豆瓣日记的小爬虫，requests+bs4。

cookies_src可填可不填，主要是为了爬取仅自己可见的日记。

url填写的是日记页面，即https://www.douban.com/people/***/notes

import requests

import re

from bs4 import BeautifulSoup

# cookies

cookies_src=''

# 日记页面

url=''

def parse_cookies(str):

    str_tmp=str.replace(' ','')

    str_list=str.split(';')

    cookies={}

    for item in str_list:

        item_list=item.split('=')

        key=item_list[0]

        value=item_list[1]

        cookies[key]=value

    return cookies

def get_html(url,cookies):

    r=requests.get(url,cookies=cookies)

    return r.text

# 解析日记页面，提取出标题，时间，内容

def parse_diary(src):

    soup=BeautifulSoup(web_html,'html.parser')

    note_container=soup.find('div','note-container')

    title=note_container.find('div','note-header note-header-container').h1.text

    time=note_container.find('span','pub-date').text

    content=''

    contents=note_container.find('div',id='link-report')

    text=str(contents).replace('<br>','\n')

    text=text.replace('<p>','')

    text=text.replace('</p>','\n')

    text=text.replace('<div class="note" id="link-report">','')

    text=text.replace('</div>','')

    content=content+text

    return (title,time,content)

cookies=parse_cookies(cookies_src)

# 提取处所有日记链接

next_page=url

diarys_link=[]

page_num=1

while True:

    print("正在获取第%d页的日记链接..."%page_num)

    web_html=get_html(next_page,cookies)

    soup=BeautifulSoup(web_html,'html.parser')

    # 将当前页面的日记链接保存于diarys_link中

    for rr in soup.find_all('div','rr'):

        diarys_link.append(rr.a['href'])

    try: # 到达最后一页

        next_page=soup.find('span','next').a['href']

    except:

        break

    page_num=page_num+1

# 解析每条日记

print('逐条解析日记...')

diarys=[]

num=1

for diary in diarys_link:

    web_html=get_html(diary,cookies)

    diarys.append(parse_diary(web_html))

    print('已解析:%d'%num)

    num=num+1

# 写入文件

print('写入文件中...')

with open('./diary.txt','w') as f:

    for diary in diarys:

        f.write(diary[0])

        f.write('\n')

        f.write(diary[1])

        f.write('\n')

        f.write(diary[2])

        f.write('\n---------------------------------\n')

print('写入成功')

关于日记内容的处理部分，本来是可以直接用.text来获取的，但<br><p>标签均被过滤掉，原文中的换行符就没了，所以只能转换成str再进行替换了。

Python 豆瓣日记爬取的更多相关文章

Python 豆瓣mv爬取
爬取网址:https://www.dbmeinv.com/ 豆瓣mv(现已更名) 注:自制力不好的同学,先去准备营养快线! import requests from bs4 import ...
python豆瓣250爬取
import requests from bs4 import BeautifulSoup from lxml import etree # qianxiao996精心制作 #博客地址:https:/ ...
Python登录豆瓣并爬取影评
上一篇我们讲过Cookie相关的知识,了解到Cookie是为了交互式web而诞生的,它主要用于以下三个方面: 会话状态管理(如用户登录状态.购物车.游戏分数或其它需要记录的信息) 个性化设置(如用户自 ...
Python爬虫之爬取慕课网课程评分
BS是什么? BeautifulSoup是一个基于标签的文本解析工具.可以根据标签提取想要的内容,很适合处理html和xml这类语言文本.如果你希望了解更多关于BS的介绍和用法,请看Beautiful ...
Python爬虫之爬取淘女郎照片示例详解
这篇文章主要介绍了Python爬虫之爬取淘女郎照片示例详解,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧本篇目标抓取淘宝MM ...
[python] 常用正则表达式爬取网页信息及分析HTML标签总结【转】
[python] 常用正则表达式爬取网页信息及分析HTML标签总结转http://blog.csdn.net/Eastmount/article/details/51082253 标签: pytho ...
[Python爬虫] Selenium爬取新浪微博客户端用户信息、热点话题及评论 (上)
转载自:http://blog.csdn.net/eastmount/article/details/51231852 一. 文章介绍源码下载地址:http://download.csdn.net/ ...
如何利用Python网络爬虫爬取微信朋友圈动态--附代码（下）
前天给大家分享了如何利用Python网络爬虫爬取微信朋友圈数据的上篇(理论篇),今天给大家分享一下代码实现(实战篇),接着上篇往下继续深入. 一.代码实现 1.修改Scrapy项目中的items.py ...
from appium import webdriver 使用python爬虫,批量爬取抖音app视频（requests+Fiddler+appium）
使用python爬虫,批量爬取抖音app视频(requests+Fiddler+appium) - 北平吴彦祖 - 博客园 https://www.cnblogs.com/stevenshushu/p ...

随机推荐

hadoop-eclipse插件编译及windows下运行wordcount项目
参考文章:http://www.360doc.com/content/16/0227/18/10529016_537828949.shtml, 配置修改:http://blog.csdn.net/lo ...
Redis list 数据类型
lpush()先进后出 //从头部加入元素 //栈 lrange 元素集合 0 -1 lpop 从list头部删除元素,并返回删除元素 rpush()先进先出 //从尾部加 ...
如何创建一个django工程与和mysql打通
1. 安装Django # 在指定解释器环境下安装django 1.11.x # 在真实python3环境下: pip3 install django==1.11.x # 查看django版本: dj ...
webpack环境搭建
环境搭建参考:Webpack+vue+element逐步搭建开发环境 webpack入门:http://www.jianshu.com/p/42e11515c10f ----------------- ...
System.Types.hpp(77): E2029 'TObject' must be a previously defined class or struct
System.Types.hpp System.Types.hpp(77): E2029 'TObject' must be a previously defined class or struct ...
深度学习原理与框架-Tensorflow基本操作-Tensorflow中的变量
1.tf.Variable([[1, 2]]) # 创建一个变量参数说明:[[1, 2]] 表示输入的数据,为一行二列的数据 2.tf.global_variables_initializer() ...
tomcat监控脚本（监控进程，测试接口，告警动作为发送邮件）
服务器环境:centos7.2 64位 tomcat8.5.6 tomcat 监控功能共需要两个脚本,如下: initMonitor.sh #!/bin/sh #初始化监控脚本相关变量 export ...
IntelliJ IDEA 自动导入包关闭重复代码提示
idea可以自动优化导入包,但是有多个同名的类调用不同的包,必须自己手动Alt+Enter设置设置idea导入包勾选标注 1 选项,IntelliJ IDEA 将在我们书写代码的时候自动帮我们优化 ...
django 之manytomany
https://www.cnblogs.com/changbaishan/p/8056762.html https://blog.csdn.net/hpu_yly_bj/article/details ...
spring集成mybatis的mybatis参考配置
<?xml version="1.0" encoding="UTF-8"?><!DOCTYPE configuration PUBLIC &q ...

Python 豆瓣日记爬取

Python 豆瓣日记爬取的更多相关文章

随机推荐

热门专题