#!/usr/env  python
#-*- coding: utf-8  -*-

import urllib

import urllib2

import random

import requests

import os,sys

import MySQLdb

from sgmllib import SGMLParser

import re

num=0

def main():

    try:

        conn=MySQLdb.connect(host='localhost',user='root',passwd='123456',db='addressbookdb',charset="utf8")

        conn.query("set names utf8")

    except Exception,e:

        print e

        sys.exit()

    cursor=conn.cursor()

    for k in range(1,2574):

        url="http://apk.gfan.com/apps_7_1_"+str(k)+".html"

        html=requests.get(url)

        result=html.content

        pattern=re.compile('<a href="([http://apk.gfan.com]?/Product/App\d{1,8}.html)"')

        dataresult=re.findall(pattern,result)

        dataresult=list(set(dataresult))

        for i in dataresult:

            t="http://apk.gfan.com"+i

            print t

            html=requests.get(t)

            result=html.content

            pattern=re.compile('<div class="appdiscrib">[\s\S]*?<h4>(.+?)</h4>')

            data0=re.findall(pattern,result)

            print data0[0]

            pattern=re.compile('版 本 号(.+?)</li>')

            data1=re.findall(pattern,result)

            pattern=re.compile('开 发 者(.+?)</li>')

            data2=re.findall(pattern,result)

            pattern=re.compile('发布时间(.+?)</li>')

            data3=re.findall(pattern,result)

            pattern=re.compile('文件大小(.+?)</li>')

            data4=re.findall(pattern,result)

            pattern=re.compile('支持固件(.+?)</li>')

            data5=re.findall(pattern,result)

            pattern=re.compile('应用介绍</h3>[\s\S]*?<div class="intro">([\s\S]*?)</div>')

            data6=re.findall(pattern,result)

            for items in data6:

                pass#print re.sub('<br />',' ',items)

            sql="insert into address(name,version,developer,pubtime,filesize,support,introduction) values(%s,%s,%s,%s,%s,%s,%s)"

            for items in data6:

            

                if(data5):

                    values=(data0[0],data1[0],data2[0],data3[0],data4[0],data5[0],re.sub('<br />',' ',items))

                else:

                    values=(data0[0],data1[0],data2[0],data3[0],data4[0],'NULL',re.sub('<br />',' ',items))

                #print values

                #print sql % values

                try:

                    cursor.execute(sql,values)

                    conn.commit()

                except:

                    pass

            pattern=re.compile(' <div class="appTitle clearfix">[\s\S]*?<img src=(.+?)/>')

            data=re.findall(pattern,result)

            for j in data:

                print j

      #temp = urllib2.urlopen(i[10:])

        # 这个是保存函数,第一个参数是地址,第二个是保存的文件名,让地址的倒数8位,当做文件名

                #urllib.urlretrieve(j[1:-2], j[-40:])

                temp=requests.get(j[1:-2])

                global num

                f=file("picture/"+str(num),"w+")

                num=num+1

                print num

                f.write(temp.content)

                

    #sql="select * from address"

    #cursor.execute(sql)

    #conn.commit()

    #finalresult=cursor.fetchall()

    #if finalresult:

        #for x in finalresult:

            #pass #print x[0:]

    cursor.close()

    conn.close()

    f.close()

    

if  __name__=="__main__":

       main()

python crawler0723.py的更多相关文章

  1. python调用py中rar的路径问题。

    1.python调用py,在py中的os.getcwd()获取的不是py的路径,可以通过os.path.split(os.path.realpath(__file__))[0]来获取py的路径. 2. ...

  2. python gettitle.py

    #!/usr/bin/env python # coding=utf-8 import threading import requests import Queue import sys import ...

  3. Python pydoc.py

    1. 查看帮助,我们可以在python命令行交互环境下用 help函数,比如: 查看 math 模块: >>> help('math')Help on built-in module ...

  4. django 1.7之后python manage.py syncdb没有了

    在命令行输入python manage.py createsuperuser按照提示输入即可记得先初始化表. django>1.7 python manage.py makemigrations ...

  5. Python安装mysql-python错误提示python setup.py egg_info

    做python项目,需要用到mysql,一般用python-mysql,安装时遇到错误提示如下: Command "python setup.py egg_info" failed ...

  6. python __init__.py用途

    转自http://www.cnpythoner.com/post/2.html Python中的Module是比较重要的概念.常见的情况是,事先写好一个.py文 件,在另一个文件中需要import时, ...

  7. python setup.py uninstall

    I have installed a python package with python setup.py install How do I uninstall it? ============== ...

  8. python 运行python manege.py runserver时报错:“no module named djangorestframework” 的解决方案

    python 运行python manege.py runserver时报错:“no module named djangorestframework” 的解决方案 importerror:no mo ...

  9. Python Web.py

    安装Web.py root@bt:~# sudo pip install web.py Downloading/unpacking web.py Downloading web.py-0.37.tar ...

随机推荐

  1. IT玄幻小说

    职业 设计:菜鸟  美工<初级,中级,高级,资深>  设计师<初级,中级,高级,资深>  大神 前端:菜鸟  前端<初级,中级,高级,资深> 架构师<初级,中 ...

  2. tomcat部署两个相同的项目报错不能访问

    需要在同一个tomcat上搭建一个项目的两个版本,都要能跑起来   直接复制两个项目部署,会出现两个错误: 1,webAppKey 冲突 2,tomcat启动会有内存溢出(OutOfMemoryErr ...

  3. UVa 11489 (博弈) Integer Game

    一个数字能被3整除就等价于这个数的各个数字之和被3整除. 所以一开始的时候先要拿一个能使剩下的数字是3的倍数的数. 然后就一直拿0.3.6.9直到某人不能再拿为止. #include <cstd ...

  4. CodeForces Round #296 Div.2

    A. Playing with Paper 如果a是b的整数倍,那么将得到a/b个正方形,否则的话还会另外得到一个(b, a%b)的长方形. 时间复杂度和欧几里得算法一样. #include < ...

  5. UVa 11859 (Nim) Division Game

    把每一行m个数所有的素因子看做一堆,就把问题转化为n堆的Nim游戏. 然后预处理一下10000以内每个数素因数的个数,再根据书上的Bouton定理,计算一下n行素因数个数的异或和. 为0是先手必败局面 ...

  6. android webview js alert对话框 不能弹出 解决办法

    在配置了webview的 setting属性后,以前设置的都是可以直接弹出来的,今天写一个小demo时候莫名其妙的发现alert怎么也出来,即使设置了这么多也不行: webSettings.setJa ...

  7. C语言深入学习系列 - 字节对齐&内存管理

    用C语言写程序时需要知道是大端模式还是小端模式. 所谓的大端模式,是指数据的低位保存在内存的高地址中,而数据的高位,保存在内存的低地址中:所谓的小端模式,是指数据的低位保存在内存的低地址中,而数据的高 ...

  8. 一次library cache pin故障的解决过程

    内容如下: 今天接到同事的电话,说他的一个存储过程已经run了一个多小时了,还在继续run,他觉得极不正常,按道理说不应该run这么长时间. 我说那我去看一下吧. 这个库是一个AIX上的10.2.0. ...

  9. 【转】Android之NetworkOnMainThreadException异常

    看名字就应该知道,是网络请求在MainThread中产生的异常 先来看一下官网的解释: Class Overview The exception that is thrown when an appl ...

  10. Oracle 课程八之性能优化之10053事件

    一. 10053事件 当一个SQL出现性能问题的时候,可以使用SQL_TRACE 或者 10046事件来跟踪SQL. 通过生成的trace来了解SQL的执行过程. 我们在查看一条SQL的执行计划的时候 ...