使用requests+BeautifulSoup爬取龙族V小说

这几天想看龙族最新版本，但是搜索半天发现没有网站提供下载，我又只想下载后离线阅读（写代码已经很费眼睛了）。无奈只有自己爬取了。

这里记录一下，以后想看时，直接运行脚本下载小说。

这里是从 http://longzu5.co 这个网站下载的小说，如果需要更改存储路径，可以更改 FILE_URL 常量的值

如果爬取不到了，说明，此网站做了防爬虫，或者其渲染网页的 html 元素改变了。

# -*- coding: utf-8 -*-

# (C) rgc, 2018

# All rights reserved

# requirements list: [python3.6, requests, bs4]

import requests

from bs4 import BeautifulSoup

URL = "http://longzu5.co"

FILE_URL = 'E:\lz.txt'

def get_son_text(strs):

    # 获取文章内容

    soup = BeautifulSoup(strs, 'html.parser')

    body_soup = soup.find('div', 'post-body')

    result = body_soup.find_all('p')

    title = soup.find('h2', 'post-title')

    title = title.text

    final_txt = title + '\n'

    for item in result:

        txt = item.text

        final_txt += txt

    final_txt += '\n\n'

    with open(FILE_URL, 'a', encoding='utf-8') as f:

        f.write(final_txt)

def get_father_text():

    """

    获取文章列表

    :return:

    """

    res = requests.get(URL + "/")

    strs = res.text

    soup = BeautifulSoup(strs, 'html.parser')

    ul_soup = soup.find('ul', 'booklist')

    x = ul_soup.find_all('a')

    section_list = []

    for item in x:

        url = URL + item.get('href')

        section_list.append(url)

    section_list.reverse()

    for url in section_list:

        print(url)

        section = requests.get(url)

        sec_txt = section.text

        get_son_text(sec_txt)

if __name__ == '__main__':

    get_father_text()

# 如有版权，请及时联系我，我会及时删除，如有冒犯，请原谅。

使用requests+BeautifulSoup爬取龙族V小说的更多相关文章

爬虫入门实例：利用requests库爬取笔趣小说网
w3cschool上的来练练手,爬取笔趣看小说http://www.biqukan.com/, 爬取<凡人修仙传仙界篇>的所有章节 1.利用requests访问目标网址,使用了get方法 ...
python3 requests + BeautifulSoup 爬取阳光网投诉贴详情实例代码
用到了requests.BeautifulSoup.urllib等,具体代码如下. # -*- coding: utf-8 -*- """ Created on Sat ...
python 爬虫 requests+BeautifulSoup 爬取巨潮资讯公司概况代码实例
第一次写一个算是比较完整的爬虫,自我感觉极差啊,代码low,效率差,也没有保存到本地文件或者数据库,强行使用了一波多线程导致数据顺序发生了变化... 贴在这里,引以为戒吧. # -*- coding: ...
requests+BeautifulSoup | 爬取电影天堂全站电影资源
import requests import urllib.request as ur from bs4 import BeautifulSoup import csv import threadin ...
Python爬虫学习三------requests+BeautifulSoup爬取简单网页
第一次第一次用MarkDown来写博客,先试试效果吧! 昨天2018俄罗斯世界杯拉开了大幕,作为一个伪球迷,当然也得为世界杯做出一点贡献啦. 于是今天就编写了一个爬虫程序将腾讯新闻下世界杯专题的相关新 ...
python 爬虫（一） requests+BeautifulSoup 爬取简单网页代码示例
以前搞偷偷摸摸的事,不对,是搞爬虫都是用urllib,不过真的是很麻烦,下面就使用requests + BeautifulSoup 爬爬简单的网页. 详细介绍都在代码中注释了,大家可以参阅. # -* ...
requests+beautifulsoup爬取豆瓣图书
使用Xpath和BeautifulSoup来解析网页可以说真的很简便. import requests from bs4 import BeautifulSoup from random import ...
Python使用urllib,urllib3,requests库+beautifulsoup爬取网页
Python使用urllib/urllib3/requests库+beautifulsoup爬取网页 urllib urllib3 requests 笔者在爬取时遇到的问题 1.结果不全 2.'抓取失 ...
[实战演练]python3使用requests模块爬取页面内容
本文摘要: 1.安装pip 2.安装requests模块 3.安装beautifulsoup4 4.requests模块浅析 + 发送请求 + 传递URL参数 + 响应内容 + 获取网页编码 + 获取 ...

随机推荐

AI之旅（1）：出发前的热身运动
前置知识无知识地图自学就像在海中游泳当初为什么会想要了解机器学习呢,应该只是纯粹的好奇心吧.AI似乎无处不在,又无迹可循.为什么一个程序能在围棋的领域战胜人类,程序真的有那么聪明吗?如 ...
20164322 韩玉婷-----Exp6 信息搜索与漏洞扫描
1.实践目标掌握信息搜集的最基础技能与常用工具的使用方法. 2.实践内容 (1)各种搜索技巧的应用 (2)DNS IP注册信息的查询 (3)基本的扫描技术:主机发现.端口扫描.OS及服务版本探测.具 ...
bee: command not found问题解决之道
$ bee bash: bee: command not found 遇到这个错误的时候,我希望您是所有环境全部安装好的情况下遇到的,如果你的环境没有安装好请参考 beego环境搭建http://bl ...
Python项目依赖并生成requirements.txt
一起开发项目的时候总是要搭建环境和部署环境的,这个时候必须得有个python第三方包的list,一般都叫做requirements.txt. 如果一个项目使用时virtualenv环境,还好办 pip ...
【步步为营 Entity Framework+Reporting service开发】-(2) Code Fir
也许有人问,为什么要用EF创建爱你数据表,code first好处是什么? 使用EF创建数据库/表,只需要设计简单的C#类,再表内容变化的时候他会自动更新数据库结构,并且保留原有数据. EF很强大,支 ...
pytorch dataloader num_workers
https://discuss.pytorch.org/t/guidelines-for-assigning-num-workers-to-dataloader/813/5 num_workers 影 ...
学习笔记CB010:递归神经网络、LSTM、自动抓取字幕
递归神经网络可存储记忆神经网络,LSTM是其中一种,在NLP领域应用效果不错. 递归神经网络(RNN),时间递归神经网络(recurrent neural network),结构递归神经网络(recu ...
Python 找零问题
#coding = utf-8 def Change_Money(money): print('总金额:'+str(money)+'元') loop=True tmp=[] # 面值列表单位:元 t ...
CSS 关于权重的另类解说
众所周知,对于CSS中权重的顺序,从大到小依次如下: !important id class 标签在html标签中写入行内样式style,又大于link引入.相同类型的样式标记,在数量上多的大于数量 ...
python发送短信和发送邮件
先注册好发短信脚本内容 #接口类型:互亿无线触发短信接口,支持发送验证码短信.订单通知短信等. #账户注册:请通过该地址开通账户http://sms.ihuyi.com/register.html ...

使用requests+BeautifulSoup爬取龙族V小说

使用requests+BeautifulSoup爬取龙族V小说的更多相关文章

随机推荐

热门专题