Java爬虫框架 | 爬小说

Jsoup，Java爬虫解决方案，中文文档：jsoup

不得不说Java的生态真的好，原来我以为爬虫是只能用Pyhton来写的，结果发现Java的爬虫框架不要太多……

不过个人觉得Jsoup最好用，最直接也很简单

　写了一个Demo,爬取笔趣网的小说，格式已过滤。

public class CrawlText {

    /***

     * 获取文本

     *

     * @param autoDownloadFile

     *            自动下载文件

     * @param Multithreading

     *            多线程 默认false

     * @param Url

     *            网站链接

     * @throws IOException

     */

    public static void getText(boolean autoDownloadFile, boolean Multithreading, String Url) throws IOException {

        String rule = "abs:href";

        List<String> urlList = new ArrayList<String>();

        Document document = Jsoup.connect(Url)

                .timeout(4000)

                .ignoreContentType(true)

                .userAgent("Mozilla\" to \"Mozilla/5.0 (Windows NT 10.0; WOW64; rv:50.0)")

                .get();

        System.out.println(document.toString());

        Elements urlNode = document.select("a[href$=.html]");

        for (Element element : urlNode) {

            urlList.add(element.attr(rule));

        }

        CrawTextThread crawTextThread = new CrawTextThread(urlList);

        crawTextThread.start();

    }

}

package xyz.yangchaojie.JSOUP.service;

import java.io.File;

import java.io.FileOutputStream;

import java.io.IOException;

import java.io.RandomAccessFile;

import java.util.List;

import org.jsoup.Jsoup;

import org.jsoup.nodes.Document;

public class CrawTextThread extends Thread {

    List<String> UrlList;

    public CrawTextThread(List<String> urlList) {

        this.UrlList = urlList;

    }

    String rule = "";

    String rule_title = "h1";

    String rule_content = "content";

    public static String PATH = "D:\\JSOUP\\";

    /**

     * 创建文件

     *

     * @param fileName

     * @return

     */

    public static void createFile(File fileName) throws Exception {

        try {

            if (!fileName.exists()) {

                fileName.createNewFile();

            }

        } catch (Exception e) {

            e.printStackTrace();

        }

    }

    public static void writeTxtFile(String content, File fileName) throws Exception {

        RandomAccessFile mm = null;

        FileOutputStream o = null;

        try {

            o = new FileOutputStream(fileName);

            o.write(content.getBytes("UTF-8"));

            o.close();

        } catch (Exception e) {

            e.printStackTrace();

        } finally {

            if (mm != null) {

                mm.close();

            }

        }

    }

    @Override

    public void run() {

        currentThread().setName("一个都别跑:");

        String title;

        String content;

        for (String url : UrlList) {

                try {

                    Document document = Jsoup.connect(url).timeout(6000).get();

                    title = document.select("h1").toString();

                    content = document.select("#content").html();

                    System.out.println("线程:"+currentThread().getName()+"爬取URL—>"+url);

                    File file = new File(PATH+title.replaceAll("<h1>", "").replaceAll("</h1>", "")+".txt");

                    createFile(file);

                    System.out.println("创建文件:"+file.getPath());

                    writeTxtFile(FileterHtml(content), file);

                } catch (IOException e) {

                    e.printStackTrace();

                } catch (Exception e) {

                    e.printStackTrace();

                }

        }

    }

    public static String FileterHtml(String str) {

        return str.replaceAll(" ", "").replaceAll("<br>", "\r\n");

    }

}

public static void main( String[] args )

    {

        try {

            CrawlText.getText(true, true, "http://www.biquge.com.tw/0_66/");

        } catch (IOException e) {

            // TODO Auto-generated catch block

            e.printStackTrace();

        }

    }

RUN：

创建文件:D:\JSOUP\ 关于新书的种种，在此一并交代.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83312.html

创建文件:D:\JSOUP\ 第一章 失意相公.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83313.html

创建文件:D:\JSOUP\ 第二章 吊颈秀才.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83314.html

创建文件:D:\JSOUP\ 第三章 秦氏族叔.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83315.html

创建文件:D:\JSOUP\ 第四章 无妄之灾.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83316.html

创建文件:D:\JSOUP\ 第五章 游衙惊梦.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83317.html

创建文件:D:\JSOUP\ 第六章 运蹇时乖.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83318.html

创建文件:D:\JSOUP\ 第七章 白手起家（上）.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83319.html

创建文件:D:\JSOUP\ 第八章 白手起家（下）.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83320.html

创建文件:D:\JSOUP\ 第九章 江南才子.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83321.html

创建文件:D:\JSOUP\ 第十章 才子招财.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83322.html

创建文件:D:\JSOUP\ 第十一章 风靡江南.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83323.html

创建文件:D:\JSOUP\ 第十二章 原形毕露.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83324.html

创建文件:D:\JSOUP\ 第十三章 杜家危局.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83325.html

创建文件:D:\JSOUP\ 第十四章 流年不利.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83326.html

创建文件:D:\JSOUP\ 第十五章 化解危局（上）.txt

线程:一个都别跑:爬取URL—>http://www.biquge.com.tw/0_66/83327.html

创建文件:D:\JSOUP\ 第十六章 化解危局（中）.txt

Java爬虫框架 | 爬小说的更多相关文章

Java爬虫框架之WebMagic
一.介绍 WebMagic是一个简单灵活的Java爬虫框架.基于WebMagic,你可以快速开发出一个高效.易维护的爬虫. 二.如何学习 1.查看官网官网地址为:http://webmagic.io ...
java爬虫框架jsoup
1.java爬虫框架的api jsoup:https://www.open-open.com/jsoup/
Java爬虫一键爬取结果并保存为Excel
Java爬虫一键爬取结果并保存为Excel 将爬取结果保存为一个Excel表格官方没有给出导出Excel 的教程这里我就发一个导出为Excel的教程导包因为个人爱好我喜欢用Gradle所以这 ...
JAVA 爬虫框架webmagic 初步使用Demo
一想到做爬虫大家第一个想到的语言一定是python,毕竟python比方便,而且最近也非常的火爆,但是python有一个全局锁的概念新能有瓶颈,所以用java还是比较牛逼的, webmagic 官网 ...
Java爬虫框架WebMagic——入门（爬取列表类网站文章）
初学爬虫,WebMagic作为一个Java开发的爬虫框架很容易上手,下面就通过一个简单的小例子来看一下. WebMagic框架简介 WebMagic框架包含四个组件,PageProcessor.Sch ...
Java爬虫框架WebMagic入门——爬取列表类网站文章
初学爬虫,WebMagic作为一个Java开发的爬虫框架很容易上手,下面就通过一个简单的小例子来看一下. WebMagic框架简介 WebMagic框架包含四个组件,PageProcessor.Sch ...
Java爬虫框架调研
Python中大的爬虫框架有scrapy(风格类似django),pyspider(国产python爬虫框架). 除了Python,Java中也有许多爬虫框架. nutch apache下的开源爬虫程 ...
学习scrapy框架爬小说
一.背景:近期学习python爬虫技术,感觉挺有趣.由于手动自制爬虫感觉效率低,了解到爬虫界有先进的工具可用,尝试学学scrapy爬虫框架的使用. 二.环境:centos7,python3.7,scr ...
Java爬虫框架Jsoup学习记录
Jsoup的作用当你想获得某网页的内容,可以使用此框架做个爬虫程序,爬某图片网站的图片(先获得图片地址,之后再借助其他工具下载图片)或者是小说网站的小说内容我使用Jsoup写出的一款小说下载器,小 ...

随机推荐

学习kafka自己发生的几个小错误记录
一. The method iterator() is ambiguous ConsumerIterator<byte[],byte[]> it =stream.iterator(); ...
数据预处理之独热编码（One-Hot）：为什么要使用one-hot编码？
一.问题由来最近在做ctr预估的实验时,还没思考过为何数据处理的时候要先进行one-hot编码,于是整理学习如下: 在很多机器学习任务如ctr预估任务中,特征不全是连续值,而有可能是分类值.如下: ...
python工具函数
1. translate translate要比replace要高效,translate支持替换多使用translate之前必须要创建一个转换表.要创建转换表,可对字符串类型str调用方法maket ...
终于有人说清楚了--XGBoost算法
1. 什么是XGBoost XGBoost是陈天奇等人开发的一个开源机器学习项目,高效地实现了GBDT算法并进行了算法和工程上的许多改进,被广泛应用在Kaggle竞赛及其他许多机器学习竞赛中并取得了不 ...
JS高级程序设计第2章--精简版
前言:这次是二刷了,想暑假做一次完整的笔记,但用本子来写笔记的话太贵了,可能哪天还丢了..所以还是博客好== 第二章:在HTML中使用JavaScript 2.1 <script>元素: ...
HDU 2888：Check Corners（二维RMQ）
http://acm.hdu.edu.cn/showproblem.php?pid=2888 题意:给出一个n*m的矩阵,还有q个询问,对于每个询问有一对(x1,y1)和(x2,y2),求这个子矩阵中 ...
TCP/IP协议、三次握手、四次挥手
1.什么是TCP/IP协议 TCP/IP 是一类协议系统,它是用于网络通信的一套协议集合．传统上来说 TCP/IP 被认为是一个四层协议 1) 网络接口层: 主要是指物理层次的一些接口,比如电缆等． ...
ASP.NET Core Web Api之JWT(一)
前言最近沉寂了一段,主要是上半年相当于休息和调整了一段时间,接下来我将开始陆续学习一些新的技术,比如Docker.Jenkins等,都会以生活实例从零开始讲解起,到时一并和大家分享和交流.接下来几节 ...
Java底层技术系列文章-总揽
对于工作中经常用到的东西,还是多看看实现原理,这样用着才能放心. 源码思想学习计划: 1.java基础库 HashCode深入理解 java线程框架窥探 2.集合类 java枚举类使用递归 ...
Java编程思想：序列化基础部分
import java.io.*; import java.util.Date; import java.util.Random; public class Test { public static ...

Java爬虫框架 | 爬小说

Jsoup，Java爬虫解决方案，中文文档：jsoup

Java爬虫框架 | 爬小说的更多相关文章

随机推荐

热门专题