php采集

采集思路

采集程序的思路很简单大体可以分为以下几个步骤：

1. 获取远程文件源代码（file_get_contents或用fopen）.

　　 2.分析代码得到自己想要的内容（这里用正则匹配，一般是得到分页）。

　　 3.跟根得到的内容进行下载入库等操作。

　　在这里第二步有可能要重复的操作好几次，比如说要先分析一下分页地址，在分析一下内页的内容才能取得我们想要的东西。


<?php

/****获取远程文件源代码常用三种方法***/

/***方法一、 fopen()，stream_context_create()方法****/

$opts = array(

  'http'=>array(

    'method'=>"GET",

    'header'=>"Accept-language: en\r\n" .

              "Cookie: foo=bar\r\n"

  )

);

$context = stream_context_create($opts);

$fp = fopen('http://www.example.com', 'r', false, $context);

fpassthru($fp);

fclose($fp);

 

/******方法二、 socket*******/

function get_content_by_socket($url, $host){

    $fp = fsockopen($host, 80) or die("Open ". $url ." failed");

    $header = "GET /".$url ." HTTP/1.1\r\n";

    $header .= "Accept: */*\r\n";

    $header .= "Accept-Language: zh-cn\r\n";

    $header .= "Accept-Encoding: gzip, deflate\r\n";

    $header .= "User-Agent: Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; Maxthon; InfoPath.1; .NET CLR 2.0.50727)\r\n";

    $header .= "Host: ". $host ."\r\n";

    $header .= "Connection: Keep-Alive\r\n";

    //$header .= "Cookie: cnzz02=2; rtime=1; ltime=1148456424859; cnzz_eid=56601755-\r\n\r\n";

    $header .= "Connection: Close\r\n\r\n";

    fwrite($fp, $header);

    while (!feof($fp)) {

        $contents .= fgets($fp, 8192);

    }

    fclose($fp);

    return $contents;

}

/******方法三、file_get_contents ()，stream_context_create() 方法三********/

$opts = array(

        'http'=>array(

        'method'=>"GET",

        'header'=>"Content-Type: text/html; charset=utf-8" 

            )

        );        

$context = stream_context_create($opts);        

$file = file_get_contents('http://www.sohu.com/', false, $context);        

/******方法四、 PHP的cURL http://www.chinaz.com/program/2010/0119/104346.shtml*******/

$ch = curl_init();

// 2. 设置选项，包括URL

curl_setopt($ch, CURLOPT_URL, "http://www.sohu.com");

curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);

curl_setopt($ch, CURLOPT_HEADER, 0);

curl_setopt($ch,CURLOPT_HTTPHEADER,array ("Content-Type: text/xml; charset=utf-8","Expect: 100-continue"));

// 3. 执行并获取HTML文档内容

$output = curl_exec($ch);

var_dump($output);

// 4. 释放curl句柄

curl_close($ch);

/*注意

1.使用file_get_contents和fopen必须空间开启allow_url_fopen。方法：编辑php.ini，设置 allow_url_fopen = On，allow_url_fopen关闭时fopen和file_get_contents都不能打开远程文件。

2. 使用curl必须空间开启curl。方法：windows下修改php.ini，将extension=php_curl.dll前面的分号去掉，而且需 要拷贝ssleay32.dll和libeay32.dll到C:/WINDOWS/system32下；Linux下要安装curl扩展。

*/

?>

采集范例程序


/*一个图片下载函数*/

function getimg($url,$filename){

　　　　/*判断图片的url是否为空，如果为空停止函数*/

　　　　if($url==""){

　　　　　　　　return false;

　　　　}

　　　　/*取得图片的扩展名，存入变量$ext中*/

　　　　$ext=strrchr($url,".");

　　　　/*判断是否是合法的图片文件*/

　　if($ext!=".gif" && $ext!=".jpg"){

　　　　　　　　return false;

　　　　}

　　　　/*读取图片*/

　　　　$img=file_get_contents($url);

　　　　/*打开指定的文件*/

　　　　$fp=@fopen($filename.$ext,"a");

　　　　/*写入图片到指点的文件*/

　　　　fwrite($fp,$img);

　　　　/*关闭文件*/

　　　　fclose($fp);

　　　　/*返回图片的新文件名*/

　　　　return $filename.$ext;

}

采集图片php程序

除了以上方法还可以用Snoopy，也不错。

Snoopy是什么? （下载snoopy）

Snoopy是一个php类，用来模仿web浏览器的功能，它能完成获取网页内容和发送表单的任务。

Snoopy的一些特点:

* 方便抓取网页的内容

* 方便抓取网页的文本内容 (去除HTML标签)

* 方便抓取网页的链接

* 支持代理主机

* 支持基本的用户名/密码验证

* 支持设置 user_agent, referer(来路), cookies 和 header content(头文件)

* 支持浏览器转向，并能控制转向深度

* 能把网页中的链接扩展成高质量的url(默认)

* 方便提交数据并且获取返回值

* 支持跟踪HTML框架(v0.92增加)

* 支持再转向的时候传递cookies (v0.92增加)

php采集的更多相关文章

C#+HtmlAgilityPack+XPath带你采集数据(以采集天气数据为例子)
第一次接触HtmlAgilityPack是在5年前,一些意外,让我从技术部门临时调到销售部门,负责建立一些流程和寻找潜在客户,最后在阿里巴巴找到了很多客户信息,非常全面,刚开始是手动复制到Excel, ...
再谈C#采集，一个绕过高强度安全验证的采集方案？方案很Low，慎入
说起采集,其实我是个外行,以前拔过阿里巴巴的客户数据,在我博客的文章:C#+HtmlAgilityPack+XPath带你采集数据(以采集天气数据为例子) 中,介绍过采集用的工具,其实很Low的,分析 ...
iOS从零开始学习直播之2.采集
直播的采集由采集的设备(摄像头.话筒)不同分为视频采集和音频采集,本篇文章会分别介绍. 1.采集步骤 1.创建捕捉会话(AVCaptureSession),iOS调用相机和话筒之前都需要创建捕 ...
让OMCS支持更多的视频采集设备
有些OMCS用户在他的系统使用了特殊的视频采集卡作为视频源(如AV-878采集卡),虽然这些采集卡可以虚拟为一个摄像头,但有些视频采集卡需要依赖于自带了sdk才能正常地完成视频采集工作.在这种情况下, ...
NodeJs+http+fs+request+cheerio 采集,保存数据,并在网页上展示(构建web服务器)
目的: 数据采集写入本地文件备份构建web服务器将文件读取到网页中进行展示目录结构: package.json文件中的内容与上一篇一样:NodeJs+Request+Cheerio 采集数据 ...
NodeJs+Request+Cheerio 采集数据
目的:采集网站文章. 两个依赖项: request :https://github.com/request/request cheerio:https://github.com/cheeriojs/c ...
Hawk 3. 网页采集器
1.基本入门 1. 原理(建议阅读) 网页采集器的功能是获取网页中的数据(废话).通常来说,目标可能是列表(如购物车列表),或是一个页面中的固定字段(如JD某商品的价格和介绍,在页面中只有一个).因此 ...
火车头dede采集接口，图片加水印，远程图片本地化，远程无后缀的无图片本地化
<?php /* [LocoySpider] (C)2005-2010 Lewell Inc. 火车采集器 DedeCMS 5.7 UTF8 文章发布接口 Update content: 图片加 ...
STM32F412应用开发笔记之三：SPI总线通讯与AD采集
本次我们在NUCLEO-F412ZG试验模拟量输入采集.我们的模拟量输入采用ADI公司的AD7705,是一片16位两路差分输入的AD采集芯片.具有SPI接口,我们将采用SPI接口与AD7705通讯.两 ...
【Hawk】高级教程——post参数采集万方医学网论文
目标——万方医学网论文列表 http://med.wanfangdata.com.cn/Author/General/A000000001 和普通网页不一样的地方在于点击下一页的时候,URL没有发生变 ...

随机推荐

apply 判定变量类型
js 数据类型 6大类:object ,undefined,boolean,string,number,null,但是有时候我们经常要更准确的判断,比如,是数组,还是单例... 那么就用apply吧, ...
redis-3.0.6安装
此redis用来缓存跨屏账户绑定信息,安装步骤如下: ssh root@redis.td.com ,注意是root用户 tar -xzvf /nfs/install/softs/redis-3.0.4 ...
java部署ubuntu后中文显示问号问题
1.首先先回忆自身项目的编码格式,即在本地进行编码时使用的编码格式.UTF-82.检测tomcat的设置问题,在web.xml和server中的设置:server.xml中: <Connecto ...
微软公布带外安全更新MS14-068
11月19日,微软公布了带外更新MS14-068以解决Windows 系统中的一个安全漏洞,该补丁安全等级为"严重". MS14-068 | Kerberos 中的漏洞可能同 ...
pip使用代理下载
sudo pip install <packageName>的时候有时候会遇到connection error,原因是sudo的环境变量没有继承普通用户的环境变量,这样会导致普通用户设置的 ...
Projects\image_match3图像特征匹配调试记录
D:\文件及下载相关\文档\Visual Studio \Projects\image_match3\image_match #include "opencv2/core/core.hpp& ...
浏览器同源策略及Cookie的作用域
from:https://blog.csdn.net/wang379275614/article/details/53333054 如题,本文主要介绍两方面内容:首先简单介绍浏览器的同源策略与其带来的 ...
CF678D(Iterated Linear Function)
题目链接:传送门题目大意:略题目思路:用题目所给函数推出表达式,然后用等比求和公式得到关系式套用即可(需用乘法逆元),也可直接构造矩阵,用矩阵快速幂求解. 感受:做题时一定要仔细,需要仔细注意什么 ...
活动窗口(Active)，焦点窗口(Focus)和前景窗口(Foreground)之间的关系
活动窗口(Active),焦点窗口(Focus)和前景窗口(Foreground)之间的关系任何一个时候,我们的Windows桌面上总有一个最前台的窗口,其实说简单的,就是标题栏变成深蓝色的那个窗口 ...
CodeForces 668B Little Artem and Dance
B. Little Artem and Dance time limit per test 2 second memory limit per test 256 megabytes input sta ...

php采集

php采集的更多相关文章

随机推荐

热门专题