使用轻量级JAVA 爬虫Gecco工具抓取新闻DEMO

写在前面

最近看到Gecoo爬虫工具，感觉比较简单好用，所有写个DEMO测试一下，抓取网站
http://zj.zjol.com.cn/home.html，主要抓取新闻的标题和发布时间做为抓取测试对象。抓取HTML节点通过像Jquery选择器一样选择节点，非常方便，Gecco代码主要利用注解实现来实现URL匹配，看起来比较简洁美观。

Gecoo GitHub地址
https://github.com/xtuhcy/gecco
Gecoo 作者博客
http://my.oschina.net/u/2336761/blog?fromerr=ZuKKo3fH

添加Maven依赖

<dependency>

      <groupId>com.geccocrawler</groupId>

      <artifactId>gecco</artifactId>

      <version>1.0.8</version>

</dependency>

编写抓取列表页面

 @Gecco(matchUrl = "http://zj.zjol.com.cn/home.html?pageIndex={pageIndex}&pageSize={pageSize}",pipelines = "zJNewsListPipelines")

 public class ZJNewsGeccoList implements HtmlBean {

     @Request

     private HttpRequest request;

     @RequestParameter

     private int pageIndex;

     @RequestParameter

     private int pageSize;

     @HtmlField(cssPath = "#content > div > div > div.con_index > div.r.main_mod > div > ul > li  > dl > dt > a")

     private List<HrefBean> newList;

 }

 @PipelineName("zJNewsListPipelines")

 public class ZJNewsListPipelines implements Pipeline<ZJNewsGeccoList> {

     public void process(ZJNewsGeccoList zjNewsGeccoList) {

         HttpRequest request=zjNewsGeccoList.getRequest();

         for (HrefBean bean:zjNewsGeccoList.getNewList()){

             //进入祥情页面抓取

        SchedulerContext.into(request.subRequest("http://zj.zjol.com.cn"+bean.getUrl()));

         }

         int page=zjNewsGeccoList.getPageIndex()+1;

         String nextUrl = "http://zj.zjol.com.cn/home.html?pageIndex="+page+"&pageSize=100";

         //抓取下一页

         SchedulerContext.into(request.subRequest(nextUrl));

     }

 }

编写抓取祥情页面

 @Gecco(matchUrl = "http://zj.zjol.com.cn/news/{code}.html" ,pipelines = "zjNewsDetailPipeline")

 public class ZJNewsDetail implements HtmlBean {

     @Text

     @HtmlField(cssPath = "#headline")

     private String title ;

     @Text

     @HtmlField(cssPath = "#content > div > div.news_con > div.news-content > div:nth-child(1) > div > p.go-left.post-time.c-gray")

     private String createTime;

 }

 @PipelineName("zjNewsDetailPipeline")

 public class ZJNewsDetailPipeline implements Pipeline<ZJNewsDetail> {

     public void process(ZJNewsDetail zjNewsDetail) {

         System.out.println(zjNewsDetail.getTitle()+"  "+zjNewsDetail.getCreateTime());

     }

 }

启动主函数

 public class Main {

     public static void main(String [] rags){

         GeccoEngine.create()

                 //工程的包路径

                 .classpath("com.zhaochao.gecco.zj")

                 //开始抓取的页面地址

                 .start("http://zj.zjol.com.cn/home.html?pageIndex=1&pageSize=100")

                 //开启几个爬虫线程

                 .thread(10)

                 //单个爬虫每次抓取完一个请求后的间隔时间

                 .interval(10)

                 //使用pc端userAgent

                 .mobile(false)

                 //开始运行

                 .run();

     }

 }

抓取结果

项目完成代码

http://git.oschina.net/whzhaochao/geccoDemo

使用轻量级JAVA 爬虫Gecco工具抓取新闻DEMO的更多相关文章

Java爬虫，信息抓取的实现
转载请注明出处:http://blog.csdn.net/lmj623565791/article/details/23272657 今天公司有个需求,需要做一些指定网站查询后的数据的抓取,于是花了点 ...
（转）Java爬虫，信息抓取的实现
转载请注明出处:http://blog.csdn.net/lmj623565791/article/details/23272657 今天公司有个需求,需要做一些指定网站查询后的数据的抓取,于是花了点 ...
Java爬虫，信息抓取的实现（转）
转载请注明出处:http://blog.csdn.net/lmj623565791/article/details/23272657 今天公司有个需求,需要做一些指定网站查询后的数据的抓取,于是花了点 ...
java使用htmlunit工具抓取js中加载的数据
htmlunit 是一款开源的java 页面分析工具,读取页面后,可以有效的使用htmlunit分析页面上的内容.项目可以模拟浏览器运行,被誉为java浏览器的开源实现.这个没有界面的浏览器,运行速度 ...
教您使用java爬虫gecco抓取JD全部商品信息
gecco爬虫如果对gecco还没有了解可以参看一下gecco的github首页.gecco爬虫十分的简单易用,JD全部商品信息的抓取9个类就能搞定. JD网站的分析要抓取JD网站的全部商品信息, ...
python3.4学习笔记(十七) 网络爬虫使用Beautifulsoup4抓取内容
python3.4学习笔记(十七) 网络爬虫使用Beautifulsoup4抓取内容 Beautiful Soup 是用Python写的一个HTML/XML的解析器,它可以很好的处理不规范标记并生成剖 ...
selenium-java web自动化测试工具抓取百度搜索结果实例
selenium-java web自动化测试工具抓取百度搜索结果实例这种方式抓百度的搜索关键字结果非常容易抓长尾关键词,根据热门关键词去抓更多内容可以用抓google,百度的这种内容容易给屏蔽,用这 ...
使用wget工具抓取网页和图片及相关工具几个
想保存一些网页,最后找到这 wget 的 shell脚本,虽然不是太理想,亲测可用呢. 使用wget工具抓取网页和图片来源 https://my.oschina.net/freestyletim ...
PHP网络爬虫实践：抓取百度搜索结果，并分析数据结构
百度的搜索引擎有反爬虫机制,我先直接用guzzle试试水.代码如下: <?php /** * Created by Benjiemin * Date: 2020/3/5 * Time: 14:5 ...

随机推荐

关于ANDROID模拟器的一些事
转载请注明本文出自大苞米的博客(http://blog.csdn.net/a396901990),谢谢支持! 继上一篇Android Studio VS Eclipse的文章后接着来分享AnDevCo ...
老生常谈ajax
一,js中的ajax ajax(Asynchronous Javascript And XML)即为异步的JavaScript和XML,顾名思义,这个技术是和我们当前页面刷新无关的,因为它是异步的,在 ...
Swift之沙盒与数据存储
应用沙盒结构分析 1.应用程序包:包含了所有的资源文件和可执行文件 2.Documents:保存应用运行时生成的需要持久化的数据,iTunes同步设备时会备份该目录 3.tmp:保存应用运行时所需要的 ...
HDU5087 Revenge of LIS II (LIS变形)
题目链接:pid=5087">http://acm.hdu.edu.cn/showproblem.php?pid=5087 题意: 求第二长的最长递增序列的长度分析: 用step[i ...
[Git] An efficient GIT workflow for mid/long term projects
reference : http://fle.github.io/an-efficient-git-workflow-for-midlong-term-projects.html Our full-w ...
Makefile 选项 CFLAGS 、LDFLAGS 、LIBS
CFLAGS 表示用于C编译器的选项 CXXFLAGS 表示用于C++编译器的选项这两个变量实际上涵盖了编译和汇编的两个步骤 CFLAGS:指定头文件(.h)的路径,如:CFLAGS=-I/usr/ ...
共享锁&排它锁 || 乐观锁&悲观索
1.共享锁只用于表级,排他锁用于行级. 2.加了共享锁的对象,可以继续加共享锁,不能再加排他锁.加了排他锁后,不能再加任何锁. 3.比如一个DML操作,就要对受影响的行加排他锁,这样就不允许再加别的锁 ...
使用HTML5开发离线应用 - cache manifest
HTML5 是目前正在讨论的新一代 HTML 标准,它代表了现在 Web 领域的最新发展方向.在 HTML5 标准中,加入了新的多样的内容描述标签,直接支持表单验证.视频音频标签.网页元素的拖拽.离线 ...
Java 动态向 JTable 中添加数据
import java.awt.Toolkit; import javax.swing.SwingUtilities; import javax.swing.UIManager; import jav ...
Style 的查找 FindResource
1)根据名称查找 PrintPreview fe = new PrintPreview(new Summary()); string strResourceHeader = "headerS ...

使用轻量级JAVA 爬虫Gecco工具抓取新闻DEMO

写在前面

添加Maven依赖

编写抓取列表页面

编写抓取祥情页面

启动主函数

抓取结果

项目完成代码

使用轻量级JAVA 爬虫Gecco工具抓取新闻DEMO的更多相关文章

随机推荐

热门专题