爬虫（AJEX）——豆瓣动态页面

工具：python3

解释：Ajax 是一种用于创建快速动态网页的技术，在无需重新加载整个网页的情况下，能够更新部分网页的技术。

目标：爬取使用Ajex结束的豆瓣网页

import urllib.request


# url为抓包（get请求）获取的，而不是web页面上的

url = "https://movie.douban.com/j/search_subjects?type=movie&tag=%E7%83%AD%E9%97%A8&sort=recommend&page_limit=20&page_start=80"

headers = {

    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/66.0.3359.181 Safari/537.36",

           }
# fiddle中webforms中得到的表格数据

formdata ={

    "page_limit": "",

    "page_start": "",

    "sort": "recommend",

    "tag"    : "热门",

    "type": "movie"

}

data = urllib.parse.urlencode(formdata)

data = bytes(data, "utf8")

request = urllib.request.Request(url, data=data, headers=headers)

response = urllib.request.urlopen(request).read()

# response = response.decode("utf-8")

with open("douban.json","w") as f:

    f.write(str(response))

执行上述代码后，将得到的内容在json.cn中转码，出现如下错误：

说明文件格式不对，没能正确转码，尝试将返回值response进行解码：response=response.decode("utf-8")

得到正确的json格式的文件：

观察发现url中包含了formdata中的全部数据，尝试将formdata删除：

import urllib.request

url = "https://movie.douban.com/j/search_subjects?type=movie&tag=%E7%83%AD%E9%97%A8&sort=recommend&page_limit=20&page_start=80"

headers = {

    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/66.0.3359.181 Safari/537.36",

           }

# formdata ={

#     "page_limit": "20",

#     "page_start": "80",

#     "sort": "recommend",

#     "tag"    : "热门",

#     "type": "movie"

# }

# data = urllib.parse.urlencode(formdata)

# data = bytes(data, "utf8")

request = urllib.request.Request(url, headers=headers)

response = urllib.request.urlopen(request).read()

response = response.decode("utf-8")

with open("douban.json","w") as f:

    f.write(str(response))

运行结果与之前相同！

爬虫（AJEX）——豆瓣动态页面的更多相关文章

Python爬虫——爬豆瓣登录页面
直接上代码 import urllib.request import http.cookiejar from lxml import etree # from spiderImg import get ...
【图文详解】scrapy爬虫与动态页面——爬取拉勾网职位信息（2）
上次挖了一个坑,今天终于填上了,还记得之前我们做的拉勾爬虫吗?那时我们实现了一页的爬取,今天让我们再接再厉,实现多页爬取,顺便实现职位和公司的关键词搜索功能. 之前的内容就不再介绍了,不熟悉的请一定要 ...
Python爬虫-05：Ajax加载的动态页面内容
1. 获取AJAX加载动态页面的内容 1.1. Introduction 如果所爬取的网址是通过Ajax方式加载的,就直接抓包,拿他后面传输数据的文件有些网页内容使用AJAX加载,只要记得,AJAX ...
爬虫系列5：scrapy动态页面爬取的另一种思路
前面有篇文章给出了爬取动态页面的一种思路,即应用Selenium+Firefox(参考<scrapy动态页面爬取>).但是selenium需要运行本地浏览器,比较耗时,不太适合大规模网页抓 ...
爬虫之动态HTML处理（Selenium与PhantomJS ）动态页面模拟点击
动态页面模拟点击 #!/usr/bin/env python # -*- coding:utf-8 -*- # python的测试模块 import unittest from selenium im ...
Hawk 3.1 动态页面,ajax,瀑布流
不少朋友反映,Hawk的手气不错,好像没法处理动态页面.其实很容易,比其他软件都容易,让我慢慢道来. 1. 什么是动态页面很多网站,在刷新的时候会返回页面的全部内容,但实际上只需要更新一部分,这样可 ...
利用scrapy-splash爬取JS生成的动态页面
目前,为了加速页面的加载速度,页面的很多部分都是用JS生成的,而对于用scrapy爬虫来说就是一个很大的问题,因为scrapy没有JS engine,所以爬取的都是静态页面,对于JS生成的动态页面都无 ...
Spring MVC 学习总结（七）——FreeMarker模板引擎与动态页面静态化
模板引擎可以让程序实现界面与数据分离,业务代码与逻辑代码的分离,这就提升了开发效率,良好的设计也使得代码复用变得更加容易.一般的模板引擎都包含一个模板解析器和一套标记语言,好的模板引擎有简洁的语法规则 ...
c#抓取动态页面WebBrowser
在ajax横行的年代,很多网页的内容都是动态加载的,而我们的小爬虫抓取的仅仅是web服务器返回给我们的html,这其中就跳过了js加载的部分,也就是说爬虫抓取的网页是残缺的,不完整的,下面可以看下博 ...

随机推荐

http之pragma
关于Pragma:no-cache,跟Cache-Control: no-cache相同.Pragma: no-cache兼容http 1.0 ,Cache-Control: no-cache是htt ...
spark减少提交jar包处理
spark一个应用,算上依赖一百多兆.每一次都如此,坑. 首先是<packing>jar</packing>这只为打包为jar,在plugin中增加一个assembly插件,这 ...
mongodb 的命令操作（转）
成功启动MongoDB后,再打开一个命令行窗口输入mongo,就可以进行数据库的一些操作. 输入help可以看到基本操作命令: show dbs:显示数据库列表 show collections:显 ...
【转】 Pro Android学习笔记（四三）：Fragment（8）：再谈Transaction和管理器
目录(?)[-] Transaction的一些操作再谈FragmentManager 调用其他fragment的方法唤起activity 唤起fragment和相互通信一些其它 Transact ...
【转】 Pro Android学习笔记（三四）：Menu（5）：动态菜单
目录(?)[-] OptionsMenu的创建方式如何再次创建OptionsMenu 每次访问都重新填充菜单项 OptionsMenu的创建方式 OptionMenu在第一次访问该菜单时调用,只调用 ...
ES6学习之Iterator和For...of循环
一.Iterator(它是一种接口,为各种不同的数据结构提供统一的访问机制.Iterator 接口主要供for...of消费) 默认Iterator接口(默认的 Iterator 接口部署在数据结构的 ...
AxInterop.ShockwaveFlashObjects.dll 问题
在实际项目中引用此dll加载项目启动动画(swf),但在64位上此dll并不支持,解决办法有待商讨,个人在项目中,把加载动画的部分给注释掉了,不给项目中签入,他们用的都是32位系统,我的是64位的.请 ...
String／ StringBuilder／ StringBuffer
1. 首先String不属于8种基本数据类型,String是一个对象. 因为对象的默认值是null,所以String的默认值也是null:但它又是一种特殊的对象,有其它对象没有的一些特性. 2. ne ...
[poj3250]单调栈 Bad Hair Day
解题关键:将每头牛看到的牛头数总和转化为每头牛被看到的次数,然后用单调栈求解,其实做这道题的目的只是熟悉下单调栈此题为递减栈 #include<cstdio> #include<c ...
【mongodb】json与bson区别
bson是由10gen开发的一个数据格式,目前主要用于mongoDB中,是mongoDB的数据存储格式.bson基于json格式,选择json进行改造的原因主要是json的通用性及json的schem ...

爬虫（AJEX）——豆瓣动态页面

爬虫（AJEX）——豆瓣动态页面的更多相关文章

随机推荐

热门专题