Java爬虫框架之WebMagic

一、介绍

WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic，你可以快速开发出一个高效、易维护的爬虫。

二、如何学习

1.查看官网

官网地址为:http://webmagic.io/
官网详细文档:http://webmagic.io/docs/zh/

2.跑通hello world示例(具体可以参考官网，也可以参考博客)

我下面写的单元测试案例，可作为Hello World示例。

注意需要导入Maven依赖:

<dependency>

    <groupId>us.codecraft</groupId>

    <artifactId>webmagic-core</artifactId>

    <version>0.7.3</version>

</dependency>

<dependency>

    <groupId>us.codecraft</groupId>

    <artifactId>webmagic-extension</artifactId>

    <version>0.7.3</version>

</dependency>

3.带着一个目的

说说我的目的，最近我开发的博客系统，其中有个导入第三方博客的插件，这个插件比较简单就是一个搜索框，在对应的搜索框里面填写URL，点击搜索即可导入到自己的博客。

以导入博客园单篇文章为例:

下面是我的源代码(单篇文章导入,我已经将其封装成一个工具类):

import cn.hutool.core.date.DateUtil;

import com.blog.springboot.dto.CnBlogModelDTO;

import com.blog.springboot.entity.Posts;

import com.blog.springboot.service.PostsService;

import org.springframework.beans.factory.annotation.Autowired;

import org.springframework.stereotype.Component;

import us.codecraft.webmagic.Page;

import us.codecraft.webmagic.Site;

import us.codecraft.webmagic.Spider;

import us.codecraft.webmagic.pipeline.ConsolePipeline;

import us.codecraft.webmagic.processor.PageProcessor;

import us.codecraft.webmagic.selector.Selectable;

import javax.annotation.PostConstruct;

/**

 * 导入博客园文章工具类

 */

@Component

public class WebMagicCnBlogUtils implements PageProcessor {

    @Autowired

    private PostsService postService;

    public static WebMagicCnBlogUtils magicCnBlogUtils;

    @PostConstruct

    public void init() {

        magicCnBlogUtils = this;

        magicCnBlogUtils.postService = this.postService;

    }

    private Site site = Site.me()

            .setDomain("https://www.cnblogs.com/")

            .setSleepTime()

            .setUserAgent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.99 Safari/537.36");

    @Override

    public void process(Page page) {

        Selectable obj = page.getHtml().xpath("//div[@class='post']");

        Selectable title = obj.xpath("//h1[@class='postTitle']//a");

        Selectable content = obj.xpath("//div[@class='blogpost-body']");

        System.out.println("title:" + title.replace("<[^>]*>", ""));

        System.out.println("content:" + content);

        CnBlogModelDTO blog = new CnBlogModelDTO();

        blog.setTitle(title.toString());

        blog.setContent(content.toString());

        Posts post = new Posts();

        String date = DateUtil.date().toString();

        post.setPostAuthor(1L);

        post.setPostTitle(title.replace("<[^>]*>", "").toString());

        post.setPostContent(content.toString());

        post.setPostExcerpt(content.replace("<[^>]*>", "").toString());

        post.setPostDate(date);

        post.setPostDate(date);

        post.setPostModified(date);

        boolean importPost = magicCnBlogUtils.postService.insert(post);

        if (importPost) {

            System.out.println("success");

        } else {

            System.out.println("fail");

        }

    }

    @Override

    public Site getSite() {

        return site;

    }

    /**

     * 导入单篇博客园文章数据

     *

     * @param url

     */

    public static void importSinglePost(String url) {

        Spider.create(new WebMagicCnBlogUtils())

                .addUrl(url)

                .addPipeline(new ConsolePipeline())

                .run();

    }

}

单元测试代码:

import com.blog.springboot.dto.CnBlogModelDTO;

import us.codecraft.webmagic.Page;

import us.codecraft.webmagic.Site;

import us.codecraft.webmagic.Spider;

import us.codecraft.webmagic.pipeline.ConsolePipeline;

import us.codecraft.webmagic.processor.PageProcessor;

import us.codecraft.webmagic.selector.Selectable;

public class WebMagicJunitTest implements PageProcessor {

    private Site site = Site.me()

            .setDomain("https://www.cnblogs.com/")

            .setSleepTime()

            .setUserAgent("Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.99 Safari/537.36");

    @Override

    public void process(Page page) {

        Selectable obj = page.getHtml().xpath("//div[@class='post']");

        Selectable title = obj.xpath("//h1[@class='postTitle']//a");

        Selectable content = obj.xpath("//div[@class='blogpost-body']");

        System.out.println("title:" + title.replace("<[^>]*>", ""));

        System.out.println("content:" + content);

    }

    @Override

    public Site getSite() {

        return site;

    }

    public static void importSinglePost(String url) {

        Spider.create(new WebMagicJunitTest())

                .addUrl(url)

                .addPipeline(new ConsolePipeline())

                .run();

    }

    public static void main(String[] args) {

        WebMagicJunitTest.importSinglePost("https://www.cnblogs.com/youcong/p/9404007.html");

    }

另外我是怎么知道要爬取哪些数据呢?
需求第一，然后通过Chrome或Firefox浏览器检查元素，如图:

Java爬虫框架之WebMagic的更多相关文章

JAVA 爬虫框架webmagic 初步使用Demo
一想到做爬虫大家第一个想到的语言一定是python,毕竟python比方便,而且最近也非常的火爆,但是python有一个全局锁的概念新能有瓶颈,所以用java还是比较牛逼的, webmagic 官网 ...
java爬虫框架jsoup
1.java爬虫框架的api jsoup:https://www.open-open.com/jsoup/
Java爬虫框架WebMagic——入门（爬取列表类网站文章）
初学爬虫,WebMagic作为一个Java开发的爬虫框架很容易上手,下面就通过一个简单的小例子来看一下. WebMagic框架简介 WebMagic框架包含四个组件,PageProcessor.Sch ...
Java爬虫框架WebMagic入门——爬取列表类网站文章
初学爬虫,WebMagic作为一个Java开发的爬虫框架很容易上手,下面就通过一个简单的小例子来看一下. WebMagic框架简介 WebMagic框架包含四个组件,PageProcessor.Sch ...
【java爬虫】利用webmagic框架实战demo
webmagic框架:http://webmagic.io/ WebMagic的结构分为Downloader.PageProcessor.Scheduler.Pipeline四大组件 PageProc ...
Java爬虫框架调研
Python中大的爬虫框架有scrapy(风格类似django),pyspider(国产python爬虫框架). 除了Python,Java中也有许多爬虫框架. nutch apache下的开源爬虫程 ...
Java爬虫框架 | 爬小说
Jsoup,Java爬虫解决方案,中文文档:jsoup 不得不说Java的生态真的好,原来我以为爬虫是只能用Pyhton来写的,结果发现Java的爬虫框架不要太多…… 一分钟你就可以写 ...
java爬虫框架webmagic学习（一）
1. 爬虫的分类:分布式和单机分布式主要就是apache的nutch框架,java实现,依赖hadoop运行,学习难度高,一般只用来做搜索引擎开发. java单机的框架有:webmagic和webc ...
Java爬虫框架Jsoup学习记录
Jsoup的作用当你想获得某网页的内容,可以使用此框架做个爬虫程序,爬某图片网站的图片(先获得图片地址,之后再借助其他工具下载图片)或者是小说网站的小说内容我使用Jsoup写出的一款小说下载器,小 ...

随机推荐

毕业两年半，入手人生第一款macbook pro
当程序员入手第一款macbook 大家好,我是灰大狼,你们可以叫我灰狼.大狼.甚至是小灰灰. 接下来我主要跟大家分享下作为程序员的我,刚入手一款mac的使用心得. 背景做程序员三年了,一直用的都是w ...
1052 卖个萌 (20 分)C语言
萌萌哒表情符号通常由"手"."眼"."口"三个主要部分组成.简单起见,我们假设一个表情符号是按下列格式输出的: [左手]([左眼][口][右 ...
DjangoCBV源码分析
目录 FBV CBV CBV基本写法 CBV源码分析 settings源码分析 FBV FBV是基于函数的视图 CBV CBV是基于类的视图 CBV基本写法朝login提交get请求会自动执行M ...
现状、趋势如何？——《2019 年度 SaaS 行业【企业愿景】展望 · 总结篇》
SaaS 行业产业地图和行业规模看完SaaS的概念介绍,聪明的小伙伴们应该都理解了SaaS到底是个什么东西,但TOB的应用一般会离生活比较远,这里直接上产业地图,让大家对常见的SaaS产品有一个直观 ...
Arduino_URO端口与AtMega328p引脚对应图
Arduino微控制器的数字端口和模拟端口与ATMEGA 328芯片引脚的对应关系图如下.标有0~13标号的引脚对应的是数字端口,在0~13前面有符号“~”的引脚对应的端口具有PWM输出功能.标有A0 ...
低功耗蓝牙（BLE）——概述
1. 概述蓝牙协议是由SIG制定并维护的无线通信协议,蓝牙协议栈是蓝牙协议的具体实现.各厂商都根据蓝牙协议实现了自己的一套函数库--蓝牙协议栈,所以不同厂商的蓝牙协议栈之间虽然存在差别,但是都遵 ...
python报错： invalid syntax
invalid syntax: 无效的语法. 解决办法:查看当前语句中的 , 如果当前行没找到错误,依次往上找,往上找时可以利用是否有输出进行快速查找. 原因:python语法很严格,少了左括号.右 ...
DP- 01背包问题
这个01背包 , 理解了一天才勉强懂点 , 写个博客 ( 推荐 http://blog.csdn.net/insistgogo/article/details/8579597) 题目 : 有N ...
获取当前URL
HttpContext.Current.Request.Url.ToString();
hadoop各版本hadoop.dll和winutils.exe缺少这两个文件
1.1 缺少winutils.exeCould not locate executable null \bin\winutils.exe in the hadoop binaries1.2 缺少had ...