JAVA爬虫实践（实践三：爬虫框架webMagic和csdnBlog爬虫）

WebMagic

WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic，你可以快速开发出一个高效、易维护的爬虫。

采用HttpClient可以实现定向的爬虫，也可以自己编写算法逻辑来实现多线程，创建链接池，自动解析网页代码获取请求链接，封装正则表达式等等。

但是如果使用框架，就不再需要考虑爬虫的逻辑，只需要专注HTML内容的解析和获取。

引用WebMagic后写一个爬虫只需要编写一个类实现PageProcessor接口，实现两个方法。

一个WebMagic例子

package csdnblog;

import java.io.File;

import java.io.FileWriter;

import java.io.IOException;

import java.io.PrintWriter;

import us.codecraft.webmagic.Page;

import us.codecraft.webmagic.Site;

import us.codecraft.webmagic.Spider;

import us.codecraft.webmagic.processor.PageProcessor;

public class MyPageProcessor implements PageProcessor {

    @Override

    public Site getSite() {

        // 重试3次,抓取间隔1S

        return Site.me().setRetryTimes(3).setSleepTime(1000);

    }

    @Override

    public void process(Page page) {

        page.addTargetRequests(page.getHtml().links().regex("http://blog\\.csdn\\.net/\\?&page=.*").all());

        try {

            // 创建新文件

            String path = "D:\\testFile\\"+getFileName(page.getUrl().toString())+".html";

            PrintWriter printWriter = new PrintWriter(new FileWriter(new File(path)));

            // 写内容

            printWriter.write(page.getHtml().toString());

            printWriter.close();

        } catch (IOException e) {

            e.printStackTrace();

        }

    }

    public static void main(String[] args) {

        Spider.create(new MyPageProcessor()).addUrl("http://blog.csdn.net").thread(5).run();

    }

    public String getFileName(String url) {

        return url.substring(20, url.length()).replace("?", "").replace("&", "");

    }

}

这个例子里实现了一个getSite方法，用来获取抓取网站的相关配置，包括：编码、抓取间隔、重试次数等

还实现了一个process方法，里面除了写文件的部分，就只有一个page.addTargetRequests()，它是用来为链接池添加爬虫需要的链接，当爬虫线程开启后，每个线程会到链接池中取链接，当链接池为空，爬虫结束。

page.addTargetRequests(page.getHtml().links().regex("http://blog\\.csdn\\.net/\\?&page=.*").all());

即将所有符合"http:blog.csdn.net?&page=数字"的链接放入链接池中

例子中可以看到page.getHtml()即获取页面上HTML内容，在此基础上用xpath就可以取得其中想要的数据

xpath是一种HTML标签元素的路径表达方式

使用火狐firebug和谷歌浏览器F12都可以右键标签直接复制标签的xpath

可以采用xpath的方式获取链接池链接

// 添加所有文章页

page.addTargetRequests(page.getHtml().xpath("//div[@class='blog_list_wrap']").links()// 限定文章列表获取区域

        .regex("http://blog\\.csdn\\.net/.*/article/details/.*")

        .all());

// 添加其他列表页

page.addTargetRequests(page.getHtml().xpath("//div[@class='page_nav']").links()// 限定其他列表页获取区域

        .regex("http://blog\\.csdn\\.net.*")

        .all());

使用xpath获取页面中想要的数据

package csdnblog;

import us.codecraft.webmagic.Page;

import us.codecraft.webmagic.Site;

import us.codecraft.webmagic.Spider;

import us.codecraft.webmagic.processor.PageProcessor;

public class MyPageProcessor implements PageProcessor {

    @Override

    public Site getSite() {

        // 重试3次,抓取间隔1S

        return Site.me().setRetryTimes(3).setSleepTime(1000);

    }

    @Override

    public void process(Page page) {

        // 添加所有文章页

        page.addTargetRequests(page.getHtml().xpath("//div[@class='blog_list_wrap']").links()// 限定文章列表获取区域

                .regex("http://blog\\.csdn\\.net/.*/article/details/.*")

                .all());

        // 添加其他列表页

        page.addTargetRequests(page.getHtml().xpath("//div[@class='page_nav']").links()// 限定其他列表页获取区域

                .regex("http://blog\\.csdn\\.net.*")

                .all());

        //如果当前页为文章页

        if(page.getUrl().regex("http://blog\\.csdn\\.net/.*/article/details/.*").match()){

            // 编号

            System.out.println("编号:" + page.getUrl().regex("http://blog\\.csdn\\.net/.*/article/details/(\\d+)").get());

            // 标题

            System.out.println("标题:" + page.getHtml().xpath("//div[@class='article_title']//span[@class='link_title']/a/text()").get());

            // 日期

            System.out.println("日期" + page.getHtml().xpath("//div[@class='article_r']/span[@class='link_postdate']/text()").get());

            // 标签

            System.out.println("标签" + page.getHtml().xpath("//div[@class='article_l']/span[@class='link_categories']/a/allText()").all().toString());

            // 类别

            System.out.println("类别" + page.getHtml().xpath("//div[@class='category_r']/label/span/text()").all().toString());

        }

    }

    public static void main(String[] args) {

        Spider.create(new MyPageProcessor()).addUrl("http://blog.csdn.net").thread(5).run();

    }

}

JAVA爬虫实践（实践三：爬虫框架webMagic和csdnBlog爬虫）的更多相关文章

Dubbo实践（三）框架设计
整体设计图例说明: 图中左边淡蓝背景的为服务消费方使用的接口,右边淡绿色背景的为服务提供方使用的接口,位于中轴线上的为双方都用到的接口: 图中从下至上分为十层,各层均为单向依赖,右边的黑色箭头代表层 ...
爬虫(十八)：Scrapy框架(五) Scrapy通用爬虫
1. Scrapy通用爬虫通过Scrapy,我们可以轻松地完成一个站点爬虫的编写.但如果抓取的站点量非常大,比如爬取各大媒体的新闻信息,多个Spider则可能包含很多重复代码. 如果我们将各个站点的 ...
JAVA 爬虫框架webmagic 初步使用Demo
一想到做爬虫大家第一个想到的语言一定是python,毕竟python比方便,而且最近也非常的火爆,但是python有一个全局锁的概念新能有瓶颈,所以用java还是比较牛逼的, webmagic 官网 ...
网络爬虫框架Webmagic
1 谈谈网络爬虫 1.1 什么是网络爬虫在大数据时代,信息的采集是一项重要的工作,而互联网中的数据是海量的,如果单纯靠人力进行信息采集,不仅低效繁琐,搜集的成本也会提高.如何自动高效地获取互联网中我 ...
爬虫框架webmagic与spring boot的结合使用--转
原文地址:http://www.jianshu.com/p/c3fc3129407d 1. 爬虫框架webmagic WebMagic是一个简单灵活的爬虫框架.基于WebMagic,你可以快速开发出一 ...
2018-2019-2 20175227张雪莹《Java程序设计》实验三《敏捷开发与XP实践》
2018-2019-2 20175227张雪莹<Java程序设计> 实验三 <敏捷开发与XP实践> 实验报告封面课程:Java程序设计班级:1752班姓名:张雪莹学号: ...
20155310 《Java程序设计》实验三（敏捷开发与XP实践）实验报告
20155310 <Java程序设计>实验三(敏捷开发与XP实践)实验报告实验内容 1.XP基础 2.XP核心实践 3.相关工具实验步骤 (一)敏捷开发与XP 1.敏捷开发敏捷开发( ...
20155337 《Java程序设计》实验三（敏捷开发与XP实践）实验报告
20155337 <Java程序设计>实验三(敏捷开发与XP实践)实验报告实验内容 XP基础 XP核心实践相关工具实验要求 1.没有Linux基础的同学建议先学习<Linux基 ...
20145207 《Java 程序设计》实验三（敏捷开发与XP实践）实验报告
<Java 程序设计>实验三 (敏捷开发与XP实践)实验报告目录改变敏捷开发与XP实践实验要求实验成果课后思考改变修改了之前仅仅是贴了图片,连代码都没粘的状态.增加了自己的思 ...

随机推荐

treeview插件使用：根据子节点选中父节点
鄙人公司没有专门的前端,所以项目开发中都是前后端一起抡.最近用bootstrap用的比较频繁,发现bootstrap除了框架本身的样式组件外,还提供了多种插件供开发者选择.本篇博文讲的就是bootst ...
ArcGIS API for JavaScript 4.2学习笔记[11] 官方第五章Popups（弹窗）概览与解释
直接跳过第三第四章了,第三章Layer和第四章可视化,怎么说呢,Layer是组织数据的,是Map的属性之一.可视化属于符号化编程,暂时不看. 第五章是对数据.结果的显示,类似于alert()..NET ...
ArcGIS 网络分析[2.3] 最近设施点
什么是最近设施点? 仍然举一个生动形象例子说明. 我在大街的某一个点儿上,我急需上厕所,问:我3分钟内能到的最近的厕所在哪? 这就是最近设施点分析(ClosestFacility)--给定搜索半径,基 ...
bzoj 4765: 普通计算姬
Description "奋战三星期,造台计算机".小G响应号召,花了三小时造了台普通计算姬.普通计算姬比普通计算机要厉害一些 .普通计算机能计算数列区间和,而普通计算姬能计算树中 ...
4.Nginx的URL重写应用
Nginx的URL重写应用 nginx的URL重写模块是用得比较多的模块之一,所以我们需要好好地掌握运用.常用的URL重写模块命令有if,rewrite,set,break等. if命令 if用于判断 ...
与apk签名有关的那些概念与命令
一.概念篇 1.消息摘要-Message Digest 消息摘要:在消息数据上,执行一个单向的hash函数,生成一个固定长度的hash值,这个Hash值就是消息摘要,也成为数字指纹. 消息摘要特点: ...
微信小程序生成带参数的二维码小程序二维码
我是用php写的先按照要求生成accesstoken $tokenUrl="https://api.weixin.qq.com/cgi-bin/token?grant_type=clien ...
jquery获取select选中的值
http://blog.csdn.net/renzhenhuai/article/details/19569593 误区: 一直以为jquery获取select中option被选中的文本值,是这样写的 ...
TreeMap 源码分析
简介 TreeMap最早出现在JDK 1.2中,是 Java 集合框架中比较重要一个的实现.TreeMap 底层基于红黑树实现,可保证在log(n)时间复杂度内完成 containsKey.get.p ...
从0到1搭建spark集群---企业集群搭建
今天分享一篇从0到1搭建Spark集群的步骤,企业中大家亦可以参照次集群搭建自己的Spark集群. 一.下载Spark安装包可以从官网下载,本集群选择的版本是spark-1.6.0-bin-hado ...

JAVA爬虫实践（实践三：爬虫框架webMagic和csdnBlog爬虫）

JAVA爬虫实践（实践三：爬虫框架webMagic和csdnBlog爬虫）的更多相关文章

随机推荐

热门专题