php利用curl获取网页title内容

/**$html = curl_get_file_contents($url);

$title = get_title_contents($html);

var_dump($title);*/

function curl_get_file_contents($url,$referer='') {

	static $curl_loops = 0;//避免死了循环必备

	static $curl_max_loops = 3;

	$useragent = "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/56.0.2924.87 Safari/537.36";

	$ch = curl_init();

	curl_setopt($ch,CURLOPT_URL,$url);

	curl_setopt($ch,CURLOPT_HEADER,true);

	curl_setopt($ch, CURLOPT_SSL_VERIFYPEER, false); //不验证证书

	curl_setopt($ch, CURLOPT_SSL_VERIFYHOST, false); //不验证证书

	curl_setopt($ch,CURLOPT_USERAGENT,$useragent);

	curl_setopt($ch,CURLOPT_RETURNTRANSFER,true);

	curl_setopt($ch,CURLOPT_REFERER,$referer);

	$data = curl_exec($ch);

	$ret = $data;

	list($header,$data) = explode("\r\n\r\n",$data,2);

	$http_code = curl_getinfo($ch,CURLINFO_HTTP_CODE);

	$last_url = curl_getinfo($ch,CURLINFO_EFFECTIVE_URL);

	curl_close($ch);

	if ($http_code == 301 || $http_code == 302) {

		$matches = array();

		preg_match('/Location:(.*?)\n/',$header,$matches);

		$url = @parse_url(trim(array_pop($matches)));

		if (!$url) {

			return $data;

		}

		$new_url = $url['scheme'] . '://' . $url['host'] . $url['path'] . (isset($url['query']) ? '?' . $url['query'] : '');

		if ($curl_loops++ >= $curl_max_loops) {

			return false;

		}else {

			$new_url = stripslashes($new_url);

			return curl_get_file_contents($new_url);

		}

	} else {

		list($header,$data) = explode("\r\n\r\n",$ret,2);

		return $data;

	}

}

function get_title_contents($html){

	// 解析 HTML 的 <head> 区段

//	<meta http-equiv="Content-type" content="text/html; charset=utf-8" />

//	<meta content="text/html; charset=gb2312" http-equiv="Content-Type">

	preg_match("/<head.*>(.*)<\/head>/smUi",$html, $htmlHeaders);

	//var_dump($output);die();

	if(!count($htmlHeaders)){

		$title = "无法解析数据中的 <head> 区段";

	}

// 取得 <head> 中 meta 设置的编码格式<meta charset="gb2312">

	if(preg_match('/<meta.*charset=(("){0,1}[a-zA-Z0-9-]*("){0,1})/',$htmlHeaders[1], $results)){

		$charset =  $results[1];

	}else{

		$charset = "None";

	}

	$charset = str_replace('"','',$charset);

// 取得 <title> 中的文字

	if(preg_match("/<title>(.*)<\/title>/Ui",$htmlHeaders[1], $htmlTitles)){

		if(!count($htmlTitles)){

			$title = "无法解析 <title> 的内容";

			exit;

		}

		// 将  <title> 的文字编码格式转成 UTF-8

		if($charset == "None"){

			$title=$htmlTitles[1];

		}else{

			$title=iconv($charset, "UTF-8", $htmlTitles[1]);

		}

	}

	return html_entity_decode($title);

}

　　支持https，302跳转

php利用curl获取网页title内容的更多相关文章

selenium常用的API（三）获取网页title、html源码
获取网页title 获取页面title的方法可以直接用driver.title获取到,然后可以把获取到的结果用做断言. #encoding=utf-8 from selenium import web ...
c#利用HttpWebRequest获取网页源代码
c#利用HttpWebRequest获取网页源代码,搞了好几天终于解决了,直接获取网站编码进行数据读取,再也不用担心乱码了! 命名空间:Using System.Net private static ...
Python获取网页指定内容(BeautifulSoup工具的使用方法)
Python用做数据处理还是相当不错的,如果你想要做爬虫,Python是很好的选择,它有很多已经写好的类包,只要调用,即可完成很多复杂的功能,此文中所有的功能都是基于BeautifulSoup这个包. ...
curl获取远程文件内容
curl获取远程文件内容 ** 获取远程文件内容 @param $url 文件http地址 * function fopen_url($url) { if (function_exists(& ...
telnet建立http连接获取网页HTML内容
利用telnet可以与服务器建立http连接,获取网页,实现浏览器的功能.它对于需要对http header进行观察和测试到时候非常方便.因为浏览器看不到http header. 步骤如下: 1. 运 ...
黄聪：C#获取网页HTML内容的三种方式
C#通常有三种方法获取网页内容,使用WebClient.WebBrowser或者HttpWebRequest/HttpWebResponse. 方法一:使用WebClient static void ...
linux下利用curl监控网页shell脚本
#!/bin/bash smail() {mail -s "$1" gjw_apparitor@gmail.com <<EOF$1$2====report time: ...
java 获取网页指定内容
import java.io.BufferedReader; import java.io.InputStreamReader; import java.net.HttpURLConnection; ...
python3 利用正则获取网页中的想保存下来的内容
需要获取某个网页中表格部分中某个产品的成份分析在html中成份的元素代码 <a href="/composition/4c3060178d1184935a48c4e51be4f63f ...

随机推荐

Sasha and Interesting Fact from Graph Theory CodeForces - 1109D (图论,计数,Caylay定理)
大意: 求a->b最短路长度为m的n节点树的个数, 边权全部不超过m 枚举$a$与$b$之间的边数, 再由拓展$Caylay$定理分配其余结点拓展$Caylay$定理 $n$个有标号节点生成k ...
字符串 dfs
1222: FJ的字符串 [水题] 时间限制: 1 Sec 内存限制: 128 MB 提交: 52 解决: 9 状态题目描述 FJ在沙盘上写了这样一些字符串: A1 = “A” A2 = “ ...
巧妙利用SVN 实现复制需要部署的文件。
http://blog.csdn.net/xiaoding133/article/details/39252357 http://blog.csdn.net/sinat_29173167/articl ...
普通Region中动态设置poplist的值跟着当前区域的某些值动态变化
//控件设置 ID Catergory1 Item Style messageChoice Picklist View Definition Cux.oracle.apps.po.poplist.se ...
spring-mvc---Controller参数绑定的类型
Controller参数绑定的类型 Controller的绑定参数类型6种.没有参数(系统默认类型):简单类型(Intager,Double)等:pojo类(对象):数组:集合:HashMap等. 我 ...
各种格式的压缩包解压，7zip 命令行
由于7z.exe所在路径,以及解压目录中可能包含中文特殊字符,导致解压失败,所以最好将各部分路径使用双引号包含起来. 如:CString str; str.Format(L"\"% ...
快速切题 sgu119. Magic Pairs
119. Magic Pairs time limit per test: 0.5 sec. memory limit per test: 4096 KB “Prove that for any in ...
Python 数据类型--集合（set）
一.集合(set) 集合也是一种数据类型,一个类似列表的,无序的,不重复的.它主要有两大作用 1.把一个列表变为集合,就自动去重了,不需要写额外的代码 2.关系测试,测试两组数据之间的交际.差集.并集 ...
【DevExpress v17.2新功能预告】DevExtreme ASP.NET MVC新的强类型HTML Helpers
在ASP.NET MVC中构建视图时,强类型HTML helpers非常有用.像@Html.TextBoxFor(m => m.FirstName)这样内置的Helper方法已经存在很长时间了, ...
【数据库】MFC ODBC(三)
4.SQL查询记录集的建立实际上是一个查询过程,SQL的SELECT语句用来查询数据源.在建立记录集时,CRecordset会根据一些参数构造一个SELECT语句来查询数据源,并用查询的结果创建记录 ...

php利用curl获取网页title内容

php利用curl获取网页title内容的更多相关文章

随机推荐

热门专题