python爬虫学习(8) —— 关于4399的一个小Demo

堂弟喜欢各种游戏，在没有网络的情况下，上4399显得很无力。

另外，4399广告好多，，而且加载慢。。

怎么办，，写个爬虫吧，，把4399上的“好玩”游戏爬下来。

1. 分析阶段

4399上的游戏，都是 .swf 格式的 flash

想 玩 到一个游戏，我们需要跳转若干的链接：

选择一个游戏 -> 进入到游戏介绍
选择开始游戏 -> 跳转到游戏界面
再仔细在html代码中寻找，最终可能会找到swf源文件所在的地址
有一些地址在html代码的 src 中直接给出，有一些则是给出的相对路径
那么我们抛弃掉一些吧，反正游戏非常多，忽略掉一些也无所谓

2. 动手吧

直接贴出代码，没什么过多的解释，算是一个crawler的小练习。

#coding=utf-8

#爬取4399所有好玩的游戏

import re

import os

import requests

# 基础url

host_url = 'http://www.4399.com'

swfbase_url = 'http://szhong.4399.com/4399swf'

hw_url = 'http://www.4399.com/flash/gamehw.htm'

if not os.path.exists('./swf'):

    os.mkdir(r'./swf')

# 需要的正则表达式

tmp_pat = re.compile(r'<ul class="tm_list">(.*?)</ul>',re.S)

game_pat = re.compile( r'<li><a href="(/flash.*?)"><img alt=.*?src=".*?"><b>(.*?)</b>.*?</li>', re.S )

swf_pat = re.compile(r'_strGamePath="(.*?swf)"',re.S)

game_html = requests.get(hw_url)

game_html.encoding = 'gb2312'

tt = tmp_pat.search(game_html.text,re.S).group(1)

game_list = game_pat.findall(tt)

for l in game_list:

    # print l[0], l[1]

    game_page = requests.get(host_url + l[0]).text

    src_url = swf_pat.search(game_page)

    if src_url == None:

        continue;

    src = requests.get( swfbase_url + src_url.group(1) ).content

    print "正在保存游戏:" , l[1]

    open( "./swf/"+ l[1] + ".swf", "wb" ).write( src )

效果如下：

python爬虫学习(8) —— 关于4399的一个小Demo的更多相关文章

学习react，动手实现一个小demo（仿知乎问答）
学习react也有一周的时间,最近自己做了个仿知乎问答的小demo,项目源码在github上:https://github.com/yang302/reactQa 使用技术:bower+gulp+re ...
python爬虫学习 —— 总目录
开篇作为一个C党,接触python之后学习了爬虫. 和AC算法题的快感类似,从网络上爬取各种数据也很有意思. 准备写一系列文章,整理一下学习历程,也给后来者提供一点便利. 我是目录听说你叫爬虫 - ...
python爬虫学习(1) —— 从urllib说起
0. 前言如果你从来没有接触过爬虫,刚开始的时候可能会有些许吃力因为我不会从头到尾把所有知识点都说一遍,很多文章主要是记录我自己写的一些爬虫所以建议先学习一下cuiqingcai大神的 Pyth ...
Python爬虫学习：四、headers和data的获取
之前在学习爬虫时,偶尔会遇到一些问题是有些网站需要登录后才能爬取内容,有的网站会识别是否是由浏览器发出的请求. 一.headers的获取就以博客园的首页为例:http://www.cnblogs.c ...
python爬虫学习视频资料免费送，用起来非常666
当我们浏览网页的时候,经常会看到像下面这些好看的图片,你是否想把这些图片保存下载下来. 我们最常规的做法就是通过鼠标右键,选择另存为.但有些图片点击鼠标右键的时候并没有另存为选项,或者你可以通过截图工 ...
python爬虫学习笔记（一）——环境配置（windows系统）
在进行python爬虫学习前,需要进行如下准备工作: python3+pip官方配置 1.Anaconda(推荐,包括python和相关库) [推荐地址:清华镜像] https://mirrors ...
python爬虫学习01--电子书爬取
python爬虫学习01--电子书爬取 1.获取网页信息 import requests #导入requests库 ''' 获取网页信息 ''' if __name__ == '__main__': ...
Python爬虫学习02--pyinstaller
Python爬虫学习02--打包exe可执行程序 1.上一次做了一个爬虫爬取电子书的Python程序,然后发现可以通过pyinstaller进行打包成exe可执行程序.发现非常简单好用 2.这是上次写 ...
Python爬虫学习第一记 (翻译小助手)
1 # Python爬虫学习第一记 8.24 (代码有点小,请放大看吧) 2 3 #实现有道翻译,模块一: $fanyi.py 4 5 import urllib.request 6 import u ...

随机推荐

ASP.NET MVC5+EF6+EasyUI 后台管理系统（60）-系统总结
系列目录前言: 起初写这个框架的时候,可以说在当时来说并不是很流行的设计模式,那是在2012年,面向对象的编程大家都很熟悉, 但是“注入.控制反转(DI,IOC,依赖注入).AOP切面编程”新兴名词 ...
Android开发之自定义的ListView(UITableViewController)
Android开发中的ListView, 顾名方法思义,就是表视图.表示图在iOS开发中就是TableView.两者虽然名称不一样,但是其使用方法,使用场景以及该控件的功能都极为相似,都是用来展示大量 ...
MAVEN学习笔记-maven的获取和安装
windows下maven的安装步骤: 1.下载压缩包http://maven.apache.org/download.cgi选择apache-maven-3.3.9-bin.zip下载 ...
eclipse打开文件所在目录
设置添加扩展工具,添加步骤如下: Run-->External Tools-->External Tools Configurations... new 一个 programlocati ...
HTML5 学习总结（四）——canvas绘图、WebGL、SVG
一.Canvas canvas是HTML5中新增一个HTML5标签与操作canvas的javascript API,它可以实现在网页中完成动态的2D与3D图像技术.<canvas> 标记和 ...
JavaScript instanceof vs typeof
Use instanceof for custom typesvar ClassFirst = function () {};var ClassSecond = function () {};var ...
Scala集合和Java集合对应转换关系
作者:Syn良子出处:http://www.cnblogs.com/cssdongl 转载请注明出处用Scala编码的时候,经常会遇到scala集合和Java集合互相转换的case,特意mark一 ...
用SignalR 2.0开发客服系统[系列2:实现聊天室]
前言交流群:195866844 上周发表了用SignalR 2.0开发客服系统[系列1:实现群发通讯] 这篇文章,得到了很多帮助和鼓励,小弟在此真心的感谢大家的支持.. 这周继续系列2,实现聊天室 ...
仅此一文让你明白ASP.NET MVC原理
ASP.NET MVC由以下两个核心组成部分构成: 一个名为UrlRoutingModule的自定义HttpModule,用来解析Controller与Action名称: 一个名为MvcHandler ...
[unity]UGUI界面滑动,ScrollRect嵌套滑动
原因:老板蛋痛,让我去抄皇室战争. 思路:我大概知道ngui(后来改成UGUI的)里面有个ScrollView.于是我就想一个横着的SV加上5个竖的SV不就好了吗. 过程: 于是但是有个问题就是UI ...

python爬虫学习(8) —— 关于4399的一个小Demo

1. 分析阶段

2. 动手吧

效果如下：

python爬虫学习(8) —— 关于4399的一个小Demo的更多相关文章

随机推荐

热门专题