用PHP获取网页上的信息相对于xpath效率低点

用php实现对网页的抓取，及信息的收集，其实就是爬数据，具体实现步骤如下，首先应引入两个文件curl_html_get.php和save_file.php文件，两个文件具体代码是这样的curl_html_get.php内代码为

<?php

function curl_get_file_contents($url)

{

$c = curl_init();

curl_setopt($c, CURLOPT_RETURNTRANSFER, 1);

curl_setopt($c, CURLOPT_URL, $url);

$contents = curl_exec($c);

curl_close($c);

if ($contents)

return $contents;

else

return FALSE;

}

save_file.php文件内容是

<?php

/**

* 连续创建目录

* @param string $dir 目录字符串

* @param int $mode 权限数字

* @return boolean

function make_dir($dir, $mode = "0777") {

if (!$dir)

return false;

if(!file_exists($dir)) {

return mkdir($dir,$mode,true);

} else {

return true;

}

/**

* 保存文件

* @param string $fileName 文件名（含相对路径）

* @param string $text 文件内容

* @return boolean

function save_file($filename, $text) {

if (!$filename || !$text)

return false;

$dirname = dirname($filename);

if (make_dir($dirname)) {

// file_put_contents($filename, $text, FILE_APPEND);

file_put_contents($filename, $text);

// if (is_resource($fp = fopen($filename, "w+"))) {

// if (@fwrite($fp, $text)) {

// fclose($fp);

// return true;

// } else {

// fclose($fp);

// return false;

// }

}

return false;

}

其实就是一个是获取网页内容的，另一个是创建文件的。

然后就是PHP代码了，自己定义一个函数函数内代码基本是这样的

echo "==================start=======================<br />";

// 1、获取网页

$path = THIS_PATH . "download";

$url = "http://10.maigoo.com/list_1187.html";

$pathinfo = pathinfo($url);

$html_pathname = $path . DS;

$html_filename = $html_pathname . "list_1187.htm";

if (!file_exists($html_filename)) {

$text = curl_get_file_contents($url);

save_file($html_filename, $text);

} else {

$text = file_get_contents($html_filename);

}

// 2、获取区域

//start pos

$start = '<div class="b-brand-nlist hoverdetail">';

//end pos

$end = '<div id="copyright">';

$pos_start = strpos($text, $start);

$pos_end = strpos($text, $end, $pos_start);

$pos_end += strlen($end);

$content = substr($text, $pos_start, $pos_end-$pos_start);

save_file($html_pathname."list_1187.html", $content);

// 3、获取所有的一级

$pattern = '@<div class="aclist">.*<div class="clear"></div>@Usi';

if (!preg_match_all($pattern, $content, $matches)) {

die("===============not match anything===================<");

}

echo "=========================================<br />";

$index = 0;

foreach ($matches[0] as $pinpai_cate) {

save_file($html_pathname. $index . ".html", $pinpai_cate);

// 获得一级分类 url 和 name

get_level1_url_and_name($pinpai_cate, $cate1_url, $cate1_name);

// echo "==================$一个品牌=======================<br />";

$pattern = '@<li addbg="#400143".*</li>@Usi';

if (preg_match_all($pattern, $content, $matches)) {

foreach($matches[0] as $one_brand);

}

echo "==================end=======================<br />";

}

基本原理就是先获取下载网页到本地，然后截取，最后用正则匹配。自己做得过程中没有对代码进行调优，导致代码太长，重复的地方太多，若截取的地方用正则还是无法判断，或者说区域有很多重复点，就需要再次截取接着排除干扰，比较繁琐，另外需要多写函数，把所有代码优化之后才能更深入提高自己水平。

用PHP获取网页上的信息相对于xpath效率低点的更多相关文章

获取网页上数据（图片、文字、视频）－b
Demo地址:http://download.csdn.net/detail/u012881779/8831835 获取网页上所有图片.获取所有html.获取网页title.获取网页内容文字... . ...
如何获取网页上的LOGO
一般公司网页上的图片都会禁止右键另存为,用截图工具接下来的图会带背景色,PS成背景透明有点费时间. 用Google Chrome 或Firefox 打开目标网页,右键点击审查元素,将鼠标放在图片上,一 ...
我的第一个爬虫程序：利用Python抓取网页上的信息
题外话我第一次听说Python是在大二的时候,那个时候C语言都没有学好,于是就没有心思学其他的编程语言.现在,我的毕业设计要用到爬虫技术,在网上搜索了一下,Python语言在爬虫技术这方面获得一致好 ...
Thinkphp5获取文件上传信息
Thinkphp5内置有处理文件上传的方法,因在开发文档没有找到获取上传文件基本信息的说明,故在这里做一下记录. $file = request()->file('input类型为file的na ...
Android获取网页上的图片的代码
public Bitmap getWebBitmap(String imgUrl) { Bitmap bitmap =null; try { InputStream inputStream = nul ...
php用get_meta_tags轻松获取网页的meta信息
之前没发现php还有这个函数,get_meta_tags()直接就可以获取文件中meta标签的属性值,返回数组: <?php $metas = get_meta_tags('http://www ...
获取网页上的所有QQ号码，并生成exel报表
需要的jar如下: package jsoup.zr.com.utils; /** * * @author LF * */ public class Constant { /** * 网站链接地址ַ ...
js获取网页上选中的部分，包含html代码
function getSelectedContents(){ if (window.getSelection) { //chrome,firefox,opera var ra ...
C#获取网页信息并存入数据库
1,获取以及商品分类信息给一网页获取网页上商品信息的分类 using Skay.WebBot; using System; using System.Collections.Generic; usi ...

随机推荐

Salesforce 产品 | 协同办公“大魔王”，Salesforce Quip的使用攻略！
Salesforce帮助企业渡过疫情难关,支持在线远程办公.7.5亿美金收购的动态文档共享平台Quip,即刻开放给所有Salesforce老客户还有非营利组织免费使用至2020年9月30日. Quip ...
python字节码，java字节码，十六进制相互转换
下面是互相转换的代码: 有想要了解更多关于python知识的请在下方评论或私信小编
ROM定制开发教程-Android adb命令用法与实例解析
一.什么是ADB Android Debug Bridge(adb)是一个命令行工具,可让您与模拟器或连接的Android设备进行通信.您可以在android sdk / platform-tools ...
JavaScript_Array
Array 概念特点值的有序集合: 每一个值叫一个元素: 每个元素在数组中有一个位置,以数字表示,称为索引(下标): 元素可以是任何类型索引从0开始,最大为2的32次方数组的创建数组直接量 v ...
PHP代码审计理解(三)---EMLOG某插件文件写入
此漏洞存在于emlog下的某个插件---友言社会化评论1.3. 我们可以看到, uyan.php 文件在判断权限之前就可以接收uid参数.并且uid未被安全过滤即写入到了$uyan_code中. 我们 ...
[linux][mysql] 命令更改表结构：添加、删除、修改字段、调整字段顺序
原文出处:http://www.phpernote.com/MySQL/1120.html 查看表结构: desc tabl_name; show columns fromtable_name: 常用 ...
js中string转map的方法
例如: var r = "{'msg':'你好'}" ; var map = eval("("+r+")"); //r为String类型的数 ...
docker企业级镜像仓库Harbor管理
Harbor概述 Harbor是由VMWare公司开源的容器镜像仓库.事实上,Harbor是在Docker Registry上进行了相应的企业级扩展,从而获得了更加广泛的应用,这些新的企业级特性包括: ...
Tomcat实现Session复制
Tomcat实现Session复制需要三台虚拟机一台Nginx两台Tomcat 关闭相关的安全机制 systemctl stop firewalldiptables -Fsetenforce 0 首 ...
oracle获取表字段及表注释的相关操作
一.获取表字段: select * from user_tab_columns where Table_Name='用户表' user_tab_columns 为当前用户的columns,除此之外还有 ...

用PHP获取网页上的信息相对于xpath效率低点

用PHP获取网页上的信息相对于xpath效率低点的更多相关文章

随机推荐

热门专题