python爬虫——与不断变化的页面死磕和更新换代（3）

　　经过上一次的实战，手感有了，普罗西（雾）池也有了，再战taobao/tmall

　　试着使用phantomJS爬手机端，结果发现爬来的tmall页面全是乱码，taobao页面xpath识别错误。一顿分析了之后才发现：TMD我的python2会把编码搞乱，phantomJS不支持手机独有的tap()操作！！！

　　幸好之前还分析了下taobao的sign。sign是一串数字组合再进行md5的32bit加密。md5(c.token + "&" + new Date().getTime() + "&" + appKey + "&" + b.data)，里面的token = new Date().getTime()+":"+Math.random()（麻烦在于这玩意儿是页面代码，就是说必须先获得主页面的token才能进去，这样这个JS的解析步骤就不能少，更惨的是老夫还不会在phantomJS里抓包），这是解开taobao商品页面sign的关键；kissy的_ksTS里前面一段是unix时间戳，右边是随机数字，jsonp右边的数字就是这个随机数字+1

　　某些关键词的大多数商品是tmall，所以数据损失倒也不大。taobao先慢慢phantomjs吧。

　　然后就升级了python3，以破解乱码

　　之后经过了蛋疼的写入文件乱码，在write()加入encoding='utf-8'就解决了

　　爬电脑端淘宝咯~~结果页面的xpath老是解析错误？？

　　而且每次的出错信息还不带重样的？看情况，返回的页面class名还不一样？

　　回去研究下解决了，如果重复载入同一url太多，后面几个页面都是只留一半商品信息，下一页按钮都不加载出来的。

　　偏偏这个按钮的class是唯一的（这个在爬虫正常运作时是优势，但是爬虫爬到的网页稍有差错就直接崩）

　　后来用原url做了下实验，发现如果慢慢下拉了n次，路径点上的信息就会加载出来。

　　等待几秒再刷新，也可以完整加载（上述现象的原因可能仅仅是这个。。。）

python爬虫——与不断变化的页面死磕和更新换代（3）的更多相关文章

Python爬虫 | re正则表达式解析html页面
正则表达式(Regular Expression)是一种文本模式,包括普通字符(例如,a 到 z 之间的字母)和特殊字符(称为"元字符"). 正则表达式通常被用来匹配.检索.替换和 ...
python 爬虫之requests爬取页面图片的url，并将图片下载到本地
大家好我叫hardy 需求:爬取某个页面,并把该页面的图片下载到本地思考: img标签一个有多少种类型的src值?四种:1.以http开头的网络链接.2.以“//”开头网络地址.3.以“/”开头绝对 ...
python爬虫之路——初识基本页面构造原理
通过chrome浏览器的使用简单介绍网页构成 360浏览器使用右键审查元素,Chrome浏览器使用右键检查,都可查看网页代码. 网页代码有两部分:HTML文件和CSS样式.其中有<script& ...
Python 爬虫-爬取京东手机页面的图片
具体代码如下: __author__ = 'Fred Zhao' import requests from bs4 import BeautifulSoup import os from urllib ...
python爬虫主要就是五个模块：爬虫启动入口模块，URL管理器存放已经爬虫的URL和待爬虫URL列表，html下载器，html解析器，html输出器同时可以掌握到urllib2的使用、bs4（BeautifulSoup）页面解析器、re正则表达式、urlparse、python基础知识回顾（set集合操作）等相关内容。
本次python爬虫百步百科,里面详细分析了爬虫的步骤,对每一步代码都有详细的注释说明,可通过本案例掌握python爬虫的特点: 1.爬虫调度入口(crawler_main.py) # coding: ...
python爬虫爬取页面源码在本页面展示
python爬虫在爬取网页内容时,需要将内容连同内容格式一同爬取过来,然后在自己的web页面中显示,自己的web页面为django框架首先定义一个变量html,变量值为一段HTML代码 >&g ...
python爬虫的页面数据解析和提取/xpath/bs4/jsonpath/正则(1)
一.数据类型及解析方式一般来讲对我们而言,需要抓取的是某个网站或者某个应用的内容,提取有用的价值.内容一般分为两部分,非结构化的数据和结构化的数据. 非结构化数据:先有数据,再有结构, 结构化数 ...
Python爬虫教程-13-爬虫使用cookie爬取登录后的页面(人人网)（下）
Python爬虫教程-13-爬虫使用cookie爬取登录后的页面(下) 自动使用cookie的方法,告别手动拷贝cookie http模块包含一些关于cookie的模块,通过他们我们可以自动的使用co ...
Python爬虫教程-12-爬虫使用cookie爬取登录后的页面(人人网)（上）
Python爬虫教程-12-爬虫使用cookie(上) 爬虫关于cookie和session,由于http协议无记忆性,比如说登录淘宝网站的浏览记录,下次打开是不能直接记忆下来的,后来就有了cooki ...

随机推荐

MySQL之SQL注入
1.SQL注入? 通过SQL命令插入到Web表单提交或输入域名或页面请求的查询字符串,最终达到欺骗服务器执行恶意的SQL命令. 2.防止SQL注入,我们需要注意以下几个要点: ①永远不要信任用户的输入 ...
PXC 57 二进制安装
1.准备阶段 1.1 在三个节点上分别创建:用户组用户组目录 --用户组用户组 #/usr/sbin/groupadd mysql #/usr/sbin/useradd -g mysql mys ...
使用AS-REP Roasting和kerberoasting攻击kerberos
准备工作 ''' PowerView是PowerSploit框架的一个子集,里面继承了很多和渗透相关的powershell脚本下载地址:https://github.com/PowerShellMaf ...
浅析 <路印协议--Loopring> 及整体分析 Relay 源码
作者:林冠宏 / 指尖下的幽灵前序: 路印协议功能非常之多及强大,本文只做入门级别的分析. 理论部分请细看其白皮书,https://github.com/Loopring/whitepaper 实际 ...
Linux下的awk文本分析命令详解
一.简介 awk是一种编程语言,用于在linux/unix下对文本和数据进行处理.数据可以来自标准输入.一个或多个文件,或其它命令的输出.它支持用户自定义函数和动态正则表达式等先进功能,是linux/ ...
Namespace declaration statement has to be the very first statement in the script-去除bom头
今天准备测试小程序的签名加密,但是刚引入官方的“加密数据解密算法”文件到项目里,然后为每个文件添加命名空间的时候,不管怎么加都报“Namespace declaration statement has ...
axios 中断请求
1 <button onclick="test()">click me</button> <script src="https://unpk ...
10.vue框架
vue框架易用.灵活.高效 https://cn.vuejs.org/ mvc M model 数据模型 V view 视图 dom操作 C controller 控制器路由 C oBtn.on ...
thinkphp 百度地图Api坐标计算 A坐标距离B坐标多少公里并按照距离近的排序坐标排序外部字段排序
感谢我磊哥函数封装方法: //计算距离 /* **$a 可多数坐标就是可数组类型的 ***$b 是登录者的坐标 ***ps: lat经度 lng纬度经度在前纬度在后 *** ***/ funct ...
python学习之旅（二）
Python基础知识(1) 一.变量变量名可以由字母.数字.下划线任意组合而成. 注意:1.变量名不能以数字开头: 2.变量名不能为关键字: 3.变量名尽量起有意义的,能够通过变量名知道代表的是什么 ...

python爬虫——与不断变化的页面死磕和更新换代（3）

python爬虫——与不断变化的页面死磕和更新换代（3）的更多相关文章

随机推荐

热门专题