python爬虫学习(8) —— 关于4399的一个小Demo

堂弟喜欢各种游戏，在没有网络的情况下，上4399显得很无力。

另外，4399广告好多，，而且加载慢。。

怎么办，，写个爬虫吧，，把4399上的“好玩”游戏爬下来。

1. 分析阶段

4399上的游戏，都是 .swf 格式的 flash

想 玩 到一个游戏，我们需要跳转若干的链接：

选择一个游戏 -> 进入到游戏介绍
选择开始游戏 -> 跳转到游戏界面
再仔细在html代码中寻找，最终可能会找到swf源文件所在的地址
有一些地址在html代码的 src 中直接给出，有一些则是给出的相对路径
那么我们抛弃掉一些吧，反正游戏非常多，忽略掉一些也无所谓

2. 动手吧

直接贴出代码，没什么过多的解释，算是一个crawler的小练习。

#coding=utf-8

#爬取4399所有好玩的游戏

import re

import os

import requests

# 基础url

host_url = 'http://www.4399.com'

swfbase_url = 'http://szhong.4399.com/4399swf'

hw_url = 'http://www.4399.com/flash/gamehw.htm'

if not os.path.exists('./swf'):

    os.mkdir(r'./swf')

# 需要的正则表达式

tmp_pat = re.compile(r'<ul class="tm_list">(.*?)</ul>',re.S)

game_pat = re.compile( r'<li><a href="(/flash.*?)"><img alt=.*?src=".*?"><b>(.*?)</b>.*?</li>', re.S )

swf_pat = re.compile(r'_strGamePath="(.*?swf)"',re.S)

game_html = requests.get(hw_url)

game_html.encoding = 'gb2312'

tt = tmp_pat.search(game_html.text,re.S).group(1)

game_list = game_pat.findall(tt)

for l in game_list:

    # print l[0], l[1]

    game_page = requests.get(host_url + l[0]).text

    src_url = swf_pat.search(game_page)

    if src_url == None:

        continue;

    src = requests.get( swfbase_url + src_url.group(1) ).content

    print "正在保存游戏:" , l[1]

    open( "./swf/"+ l[1] + ".swf", "wb" ).write( src )

效果如下：

python爬虫学习(8) —— 关于4399的一个小Demo的更多相关文章

学习react，动手实现一个小demo（仿知乎问答）
学习react也有一周的时间,最近自己做了个仿知乎问答的小demo,项目源码在github上:https://github.com/yang302/reactQa 使用技术:bower+gulp+re ...
python爬虫学习 —— 总目录
开篇作为一个C党,接触python之后学习了爬虫. 和AC算法题的快感类似,从网络上爬取各种数据也很有意思. 准备写一系列文章,整理一下学习历程,也给后来者提供一点便利. 我是目录听说你叫爬虫 - ...
python爬虫学习(1) —— 从urllib说起
0. 前言如果你从来没有接触过爬虫,刚开始的时候可能会有些许吃力因为我不会从头到尾把所有知识点都说一遍,很多文章主要是记录我自己写的一些爬虫所以建议先学习一下cuiqingcai大神的 Pyth ...
Python爬虫学习：四、headers和data的获取
之前在学习爬虫时,偶尔会遇到一些问题是有些网站需要登录后才能爬取内容,有的网站会识别是否是由浏览器发出的请求. 一.headers的获取就以博客园的首页为例:http://www.cnblogs.c ...
python爬虫学习视频资料免费送，用起来非常666
当我们浏览网页的时候,经常会看到像下面这些好看的图片,你是否想把这些图片保存下载下来. 我们最常规的做法就是通过鼠标右键,选择另存为.但有些图片点击鼠标右键的时候并没有另存为选项,或者你可以通过截图工 ...
python爬虫学习笔记（一）——环境配置（windows系统）
在进行python爬虫学习前,需要进行如下准备工作: python3+pip官方配置 1.Anaconda(推荐,包括python和相关库) [推荐地址:清华镜像] https://mirrors ...
python爬虫学习01--电子书爬取
python爬虫学习01--电子书爬取 1.获取网页信息 import requests #导入requests库 ''' 获取网页信息 ''' if __name__ == '__main__': ...
Python爬虫学习02--pyinstaller
Python爬虫学习02--打包exe可执行程序 1.上一次做了一个爬虫爬取电子书的Python程序,然后发现可以通过pyinstaller进行打包成exe可执行程序.发现非常简单好用 2.这是上次写 ...
Python爬虫学习第一记 (翻译小助手)
1 # Python爬虫学习第一记 8.24 (代码有点小,请放大看吧) 2 3 #实现有道翻译,模块一: $fanyi.py 4 5 import urllib.request 6 import u ...

随机推荐

一个技术汪的开源梦 —— 基于 .Net Core 的公共组件之 Http 请求客户端
一个技术汪的开源梦 —— 目录想必大家在项目开发的时候应该都在程序中调用过自己内部的接口或者使用过第三方提供的接口,咱今天不讨论 REST ,最常用的请求应该就是 GET 和 POST 了,那下面开 ...
Apworks框架实战（六）：使用基于Entity Framework的仓储基础结构
在前面的章节中,我们已经设计了一个简单的领域模型,接下来我们希望能够实现领域模型的持久化及查询.在Apworks中,实现了面向Entity Framework.NHibernate以及MongoDB的 ...
利用Python进行数据分析(3) 使用IPython提高开发效率
一.IPython 简介 IPython 是一个交互式的 Python 解释器,而且它更加高效. 它和大多传统工作模式(编辑 -> 编译 -> 运行)不同的是, 它采用的工作模式是:执 ...
一种开发模式：ajax + ashx + UserControl
一.ajax+ashx模式的缺点在web开发过程中,为了提高网站的用户体验,或多或少都会用到ajax技术,甚至有的网站全部采用ajax来实现,大量使用ajax在增强用户体验的同时会带来一些负 ...
.Net语言 APP开发平台——Smobiler学习日志：如何快速实现快递信息流的效果
最前面的话:Smobiler是一个在VS环境中使用.Net语言来开发APP的开发平台,也许比Xamarin更方便样式一一.目标样式我们要实现上图中的效果,需要如下的操作: 1.从工具栏上的&qu ...
C#开发微信门户及应用(31)--微信语义理解接口的实现和处理
微信语义理解接口提供从用户自然语言输入到结构化解析的技术实现,使用先进的自然语言处理技术给开发者提供一站式的语义解析方案.该平台覆盖多个垂直领域的语义场景,部分领域还可以支持取得最终的展示结果.开发者 ...
口碑外卖系统架构图（li）
《连载 | 物联网框架ServerSuperIO教程》- 11.实现设备（驱动）与设备（驱动）交互和级联控制。注：设备驱动模拟金三与普京的对话
1.C#跨平台物联网通讯框架ServerSuperIO(SSIO)介绍 <连载 | 物联网框架ServerSuperIO教程>1.4种通讯模式机制. <连载 | 物联网框架Serve ...
Web Service随笔
什么是Web Service? WebService是一个SOA(面向服务的编程)的架构,它是不依赖于语言,不依赖于平台,可以实现不同的语言间的相互调用,通过Internet进行基于Http协议的网络 ...
什么是WebPack，为什么要使用它？
1.什么是Webpack WebPack可以看做是模块打包机:它做的事情是,分析你的项目结构,找到JavaScript模块以及其它的一些浏览器不能直接运行的拓展语言(Scss,TypeScript等) ...

python爬虫学习(8) —— 关于4399的一个小Demo

1. 分析阶段

2. 动手吧

效果如下：

python爬虫学习(8) —— 关于4399的一个小Demo的更多相关文章

随机推荐

热门专题