用PHP抓取淘宝商品的用户晒单评论+图片实例

为什么想起来做这个功能？是因为前段时间在做一个淘客网站的时候，想到是否能抓取到淘宝商品的买家秀呢？经过一番折腾发现，淘宝商品用户评价信息是通过Ajax来调取的，通过嗅探网址发现，评论数据的请求接口是：

https://rate.tmall.com/list_detail_rate.htm?itemId=524394294771&spuId=341564036&sellerId=100414600&order=3&currentPage=1&append=0&content=1&tagId=&posi=&picture=1&callback=jsonp2339

其实上面很多参数也很容易理解，itemId是商品的ID，currentPage是当前页，picture为1时显示有图的评价，既然是抓取买家秀，那么picture参数一定要为1了。

如果你直接去访问上面的接口时，会得到如下图所示的请求结果：

看到请求结果是jsonp格式我就蛋碎了，我不知道如何去解析，但是换种思路，直接用PHP的正则去解析也未尝不可嘛，通过尝试，已经正确的能够解析到评论内容和买家秀的图片内容，如图：

效果不错，代码实现了评论内容的抓取、买家秀图片的抓取，代码奉上：

<?php

$url = "https://rate.tmall.com/list_detail_rate.htm?itemId=524394294771&spuId=341564036&sellerId=100414600&order=3&currentPage=1&append=0&content=1&tagId=&posi=&picture=1&callback=jsonp2339";

$ch2 = curl_init();

curl_setopt($ch2, CURLOPT_URL, $url);

curl_setopt($ch2, CURLOPT_FOLLOWLOCATION, TRUE);

curl_setopt($ch2, CURLOPT_SSL_VERIFYHOST, FALSE);

curl_setopt($ch2, CURLOPT_SSL_VERIFYPEER, false);

curl_setopt($ch2, CURLOPT_RETURNTRANSFER, TRUE);

$texts = curl_exec($ch2);

curl_close($ch2);

//echo $texts;

$pattern = '/"pics"(.+?)","reply"/is';

preg_match_all($pattern, $texts, $match);

for($i=0;$i<count($match[0]);$i++){

    $pattern2 = '/"rateContent":"(.+?)."reply"/is';

    preg_match($pattern2, $match[0][$i], $matchcomments_only);

    echo "<p>".str_replace('","rateDate":"',' ',str_replace('","reply"','',str_replace('"rateContent":"','',$matchcomments_only[0])))."</p>";

    $pattern3 = '/img.alicdn(.+?).jpg/is';

    preg_match($pattern3, $match[0][$i], $matchpic_only);

    echo '<img src="http://'.$matchpic_only[0].'" width=120>';

}

/*匹配一张图片

$pattern = '/"pics"(.+?)","position"/is';

preg_match_all($pattern, $texts, $matchpic);

for($i=0;$i<count($matchpic[0]);$i++){

    $pattern3 = '/img.alicdn(.+?).jpg/is';

    preg_match($pattern3, $matchpic[0][$i], $matchpic_only);

    echo "<p>".$matchpic_only[0]."</p>";

}*/

/*匹配所有图片

$pattern = '/"pics"(.+?)","position"/is';

preg_match_all($pattern, $texts, $matchpic);

for($i=0;$i<count($matchpic[0]);$i++){

    $pics_str=str_replace('"pics":["//','',str_replace('"],"picsSmall":"","position"','',$matchpic[0][$i]));

    $arr = explode('","//',$pics_str);

    echo "<p>";

    foreach($arr as $newstr){

        echo '<img src=http://'.$newstr.' width=100 >';

    }

    echo "</p>";

}*/

?>

用PHP抓取淘宝商品的用户晒单评论+图片实例的更多相关文章

Python爬虫学习==>第十二章：使用 Selenium 模拟浏览器抓取淘宝商品美食信息
学习目的: selenium目前版本已经到了3代目,你想加薪,就跟面试官扯这个,你赢了,工资就到位了,加上一个脚本的应用,结局你懂的正式步骤需求背景:抓取淘宝美食 Step1:流程分析搜索关键字 ...
3.使用Selenium模拟浏览器抓取淘宝商品美食信息
# 使用selenium+phantomJS模拟浏览器爬取淘宝商品信息 # 思路: # 第一步:利用selenium驱动浏览器,搜索商品信息,得到商品列表 # 第二步:分析商品页数,驱动浏览器翻页,并 ...
16-使用Selenium模拟浏览器抓取淘宝商品美食信息
淘宝由于含有很多请求参数和加密参数,如果直接分析ajax会非常繁琐,selenium自动化测试工具可以驱动浏览器自动完成一些操作,如模拟点击.输入.下拉等,这样我们只需要关心操作而不需要关心后台发生了 ...
使用Pyquery+selenium抓取淘宝商品信息
配置文件,配置好数据库名称,表名称,要搜索的产品类目,要爬取的页数 MONGO_URL = 'localhost' MONGO_DB = 'taobao' MONGO_TABLE = 'phone' ...
使用Selenium模拟浏览器抓取淘宝商品美食信息
代码: import re from selenium import webdriver from selenium.webdriver.common.by import By from seleni ...
爬虫实战--使用Selenium模拟浏览器抓取淘宝商品美食信息
from selenium import webdriver from selenium.webdriver.common.by import By from selenium.common.exce ...
python3编写网络爬虫16-使用selenium 爬取淘宝商品信息
一.使用selenium 模拟浏览器操作爬取淘宝商品信息之前我们已经成功尝试分析Ajax来抓取相关数据,但是并不是所有页面都可以通过分析Ajax来完成抓取.比如,淘宝,它的整个页面数据确实也是通过A ...
使用selenium模拟浏览器抓取淘宝信息
通过Selenium模拟浏览器抓取淘宝商品美食信息,并存储到MongoDB数据库中. from selenium import webdriver from selenium.common.excep ...
简单的抓取淘宝关键字信息、图片的Python爬虫|Python3中级玩家：淘宝天猫商品搜索爬虫自动化工具（第一篇）
Python3中级玩家:淘宝天猫商品搜索爬虫自动化工具(第一篇) 淘宝改字段,Bugfix,查看https://github.com/hunterhug/taobaoscrapy.git 由于Gith ...

随机推荐

Docker常见问题解决
一.Docker中运行ubuntu容器,字体颜色太深导致无法看清解决方案: 1. 利用dircolors命令,查看我们的系统当前的文件名称显示颜色的值,然后利用管道重定向到用户目录下的任意一个文件( ...
k近邻
k近邻(k-NearestNeighbor)算法简称kNN.基本思想简单直接,对于一个需要分类的数据实例x,计算x与所有已知类别的样本点在特征空间中的距离.取与x距离最近的k个样本点,统计这些样本点所 ...
VB.net中Ajaxpro的使用
1:从网上下载:AjaxPro.2.DLL文件,下载地址: http://files.cnblogs.com/wequst/AjaxPro.2.zip 2:解压之后把DLL放到程序bin目录下进行参照 ...
启动windows bat文件出现错误，直接关闭
如果执行运行run.bat,提示错误直接退出后,可以直接使用cmd命令进入当前目录,运行,会显示错误信息.
JQuery_DOM 节点操作之创建节点、插入节点
一.创建节点为了使页面更加智能化,有时我们想动态的在html 结构页面添加一个元素标签,那么在插入之前首先要做的动作就是:创建节点 <script type="text/javasc ...
Mysql执行大文件sql语句 -- 未测试
如果.sql文件过大,mysql会直接断开连接解决方法: 在mysql的配置文件my.cnf 中加入一行max_allowed_packet = 100M(该大小>=mysql.sql文件大 ...
folder、source folder、package 区别与联系
在eclipse下,package,source folder,folder都是文件夹. 它们的区别如下: package:当你在建立一个package时,它自动建立到source folder下 ...
卸载mysql
如果你的电脑里装过MySQL,想再重新安装MySQL的时候可能就会因为前一版本卸载不彻底而出现错误.最常见的就是安装好后设置参数的最后一步验证时,会在Execute configurattion步骤中 ...
html文件里引入文件html文件
导入通用的代码除了使用php外 iframe在很多界面使用起来比较方便比如说要写导航在好几个界面都要用这个导航可以用iframe引用实例:这个header.html是我写的一个导航界面在in ...
[HTML/HTML5]1 HTML文档设置
1.1 创建HTML文件本质上,HTML文件就是具有下列两个特征的简单文本文件: HTML文件的扩展名为.html或者.htm.文件扩展名是一个缩写,它可将文件正确地关联到需要访问它的程序或工具. ...

用PHP抓取淘宝商品的用户晒单评论+图片实例

用PHP抓取淘宝商品的用户晒单评论+图片实例的更多相关文章

随机推荐

热门专题