phpspider爬虫框架的使用

这几天使用PHP的爬虫框架爬取了一些数据，发现还是挺方便的，先上爬虫框架的文档 phpspider框架文档

使用方法其实在文档中写的很清楚而且在demo中也有使用示例，这里放下我自己的代码做个笔记

<?php

include "./autoloader.php";

use phpspider\core\phpspider;

/* Do NOT delete this comment */

/* 不要删除这段注释 */

$configs = array(

    'name' => '中国保温网',

    'domains' => array(

        'www.cnbaowen.net',

        'cnbaowen.net'

    ),

    'scan_urls' => array(

        'http://www.cnbaowen.net/news/list-3720-1.html'

    ),

    'export' => array(

        'type' => 'db',

        'table' => 'articles_mc',

    ),

    'db_config' => array(

        'host'  => '127.0.0.1',

        'port'  => 3306,

        'user'  => 'root',

        'pass'  => '123456',

        'name'  => 'spider',

    ),

    'content_url_regexes' => array(

        "http://www.cnbaowen.net/news/show-\d+.html"

    ),

    'list_url_regexes' => array(

        "http://www.cnbaowen.net/news/list-3720-\d+.html"

    ),

    'fields' => array(

        array(

            // 抽取内容页的文章内容

            'name' => "title",

            'selector' => "//h1[@id='title']",

            'required' => true

        ),

        array(

            // 抽取内容页的文章作者

            'name' => "content",

            'selector' => "//div[@id='content']",

            'required' => true

        ),

        array(

            // 抽取内容页的文章作者

            'name' => "type"

        ),

        array(

            // 抽取内容页的文章作者

            'name' => "site_id"

        ),

    ),

);

$spider = new phpspider($configs);

$spider->on_list_page = function($page, $content, $spider){

    for ($i = 2; $i < 24; $i++)

    {

        $url = "http://www.cnbaowen.net/news/list-3720-{$i}.html";

        $spider->add_url($url);

    }

};

$spider->on_extract_field = function($fieldname, $data, $page){

    if($fieldname == "type"){

        return 2;

    }elseif($fieldname == "content"){

        $s = preg_replace("/<div style=\"float:right[\s\S]*?div>/","",$data);

        $s = preg_replace('/<a .*?href="(.*?)".*?>/is',"<a href='#'>",$s);

        $data = preg_replace('/<img.*?>/is',"",$s);

        return $data;

    }elseif($fieldname == "site_id"){

        return 1;

    }else{

        return $data;

    }

};

$spider->start();

注释：这里需要说明一点，抓取页面数据时我只需要标题和内容的部分，但是存入数据库时我需要使用到另外两个字段，所以定义字段的时候多定义了`type`和`site_id`两个字段，但是这两个字段的实际赋值是在 `on_extract_field` 回调函数中完成的

附带sql语句

CREATE TABLE `articles_mc` (

  `id` int(10) unsigned NOT NULL AUTO_INCREMENT,

  `title` varchar(200) DEFAULT NULL,

  `content` text,

  `type` int(5) DEFAULT '' COMMENT '文章类型 1行业资讯 2技术资料',

  `site_id` int(5) DEFAULT NULL COMMENT '站点id',

  PRIMARY KEY (`id`)

) ENGINE=InnoDB AUTO_INCREMENT=4887 DEFAULT CHARSET=utf8mb4;

phpspider爬虫框架的使用的更多相关文章

php 爬虫框架
发现两款不错的爬虫框架,极力推荐下: phpspider 一款优秀的PHP开发蜘蛛爬虫官方下载地址:https://github.com/owner888/phpspider 官方开发手册:http ...
php爬虫框架选用什么
php爬虫框架选用什么一.总结一句话总结:phpspider:官方下载地址:https://github.com/owner888/phpspider 1.phpspider能够帮我们解决哪些问题 ...
爬虫框架--webmagic
官方有详细的使用文档:http://webmagic.io/docs/zh/ 简介:这只是个java爬虫框架,具体使用需要个人去定制,没有图片验证,不能获取js渲染的网页,但简单易用,可以通过xpat ...
教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神
本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http://www.xiaohuar.com/,让你体验爬取校花的成就感. Scr ...
Python之Scrapy爬虫框架安装及简单使用
题记:早已听闻python爬虫框架的大名.近些天学习了下其中的Scrapy爬虫框架,将自己理解的跟大家分享.有表述不当之处,望大神们斧正. 一.初窥Scrapy Scrapy是一个为了爬取网站数据,提 ...
[开源 .NET 跨平台数据采集爬虫框架: DotnetSpider] [一] 初衷与架构设计
[DotnetSpider 系列目录] 一.初衷与架构设计二.基本使用三.配置式爬虫四.JSON数据解析与配置系统为什么要造轮子同学们可以去各大招聘网站查看一下爬虫工程师的要求,大多是招JA ...
使用Scrapy爬虫框架简单爬取图片并保存本地(妹子图）
初学Scrapy,实现爬取网络图片并保存本地功能一.先看最终效果保存在F:\pics文件夹下二.安装scrapy 1.python的安装就不说了,我用的python2.7,执行命令pip ins ...
【转载】教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神
原文:教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http:/ ...
再次分享 pyspider 爬虫框架 - V2EX
再次分享 pyspider 爬虫框架 - V2EX block

随机推荐

java 测试框架 TestNG
Java中print.printf.println的区别 printf主要是继承了C语言的printf的一些特性,可以进行格式化输出 print就是一般的标准输出,但是不换行 println和prin ...
Swift 条件语句
条件语句通过设定的一个或多个条件来执行程序,在条件为真时执行指定的语句,在条件为 false 时执行另外指定的语句. 可以通过下图来简单了解条件语句的执行过程: Swift 提供了以下几种类型的条件语 ...
ES6深入浅出-1 新版变量声明：let 和 const-2.视频 let和const
以前的var方式声明不好用 a=1回声明一个全局变量, 输出了1 说明a=1确实声明了一个全局变量. 但是你把放在其他的地方,就不是声明全局变量了. 如果外面有个全局变量a 那么函数里面就是给a赋值 ...
scikit-learn机器学习(一)简单线性回归
# -*- coding: utf-8 -*- import numpy as np import matplotlib.pyplot as plt ## 设置字符集,防止中文乱码 import ma ...
JAVA 基础编程练习题44 【程序 44 偶数的素数和】
44 [程序 44 偶数的素数和] 题目:一个偶数总能表示为两个素数之和. package cskaoyan; public class cskaoyan44 { @org.junit.Test pu ...
Pocsuite3--编写破壳CVE-2014-6271_Shellshock的POC
前言编写破壳CVE-2014-6271_Shellshock的POC,把公开出来的路径封装起来,作为Pocsuite3的验证POC 情况1:网站无法访问,返回失败情况2:网站可以访问,无漏洞情况 ...
swift 第六课 scrollview xib 的使用
现在 xib,stroyBoard 这种图形话的编辑写代码,越来越简单.以前scrollview 这样的控件不会用xib ,网上查了好多的资料.现在把步骤逐渐的写出来, 这里顺便写个Demo ,是一 ...
阿里巴巴java规则p3c结合sonar使用
sonar插件位置: jar包放至$SONAR_HOME/extensions/plugins下,重启sonar即可如何在sonarqube的pmd插件中整合阿里开发规范 alibaba p3c s ...
最新易车java校招面经（含整理过的面试题大全）
从6月到10月,经过4个月努力和坚持,自己有幸拿到了网易雷火.京东.去哪儿.易车等10家互联网公司的校招Offer,因为某些自身原因最终选择了易车.6.7月主要是做系统复习.项目复盘.LeetCode ...
C#实现多线程的方式：Task——任务
简介 .NET 4包含新名称空间System.Threading.Tasks,它包含的类抽象出了线程功能. 在后台使用ThreadPool. 任务表示应完成的某个单元的工作. 这个单元的工作可以在单 ...

phpspider爬虫框架的使用

phpspider爬虫框架的使用的更多相关文章

随机推荐

热门专题