爬虫爬oj用户头像

import requests

import Queue

import urllib

import urllib2

import re

import requests

alreadyImg = set()

s = requests.session()

s.post("http://acm.hrbust.edu.cn/index.php?m=User&a=login"

, data={

    "user_name": "",

    "password": ""

})

r = s.get("http://acm.hrbust.edu.cn/index.php?m=User&a=userInfo&user_name=1404020214")

print r.text

urllist = Queue.Queue(maxsize = -1)

already = set()

url = "http://acm.hrbust.edu.cn/index.php?m=Ranklist&a=showRatingrank"

urllist.put(url)

reg = r'a href="(.+?)"'

httpre = re.compile(reg)

#reg = r'src="(.+?\.jpg)"'

reimg = r'img class="large_avatar" src="([^>]+?\.(png|jpg))>?"'

imgre = re.compile(reimg)

def putUrl(html):

    httplist = re.findall(httpre, html)

    for url in httplist:

        realurl = url

        if 'http' not in url:

            realurl = "http://acm.hrbust.edu.cn/"+url

        #print realurl

        if url not in already:

            already.add(url)

            urllist.put(realurl)

x = 0;

def getImg(html):

    Imglist = re.findall(imgre, html)

    global x

    for Img in Imglist:

        Img = Img[0]

        if Img in alreadyImg:

            continue

        else:

            alreadyImg.add(Img)

        print Img

        if Img[0] != 'h':

            Img = "http://acm.hrbust.edu.cn/" + Img

        #print "Img == " +Img

        try:

            urllib.urlretrieve(Img, 'C:/%s.jpg' % x)

        except urllib2.URLError, e:

            pass

        else:

            #print "http://acm.hrbust.edu.cn/"+Img

            x += 1

while True != urllist.empty():

    url = urllist.get(urllist)

    print url

    try:

        r = s.get(url)

        html = r.text

        if "index.php?m=Ranklist&a=showRatingrank" in url:

            putUrl(html)

        getImg(html)

    except urllib2.URLError, e:

        pass

    except urllib2.HTTPError, e:

        pass

    else:

        pass

    #else:

    #    print url

    #print html

    #break

爬虫爬oj用户头像的更多相关文章

利用爬虫爬取指定用户的CSDN博客文章转为md格式，目的是完成博客迁移博文到Hexo等静态博客
文章目录功能爬取的方式: 设置生成的md文件命名规则: 设置md文件的头部信息是否显示csdn中的锚点"文章目录"字样,以及下面具体的锚点默认false(因为csdn中是集 ...
google搜索引擎爬虫爬网站原理
google搜索引擎爬虫爬网站原理一.总结一句话总结:从几个大站开始,然后开始爬,根据页面中的link,不断爬从几个大站开始,然后开始爬,根据页面中的link,不断加深爬 1.搜索引擎和数据库检 ...
node：爬虫爬取网页图片
代码地址如下:http://www.demodashi.com/demo/13845.html 前言周末自己在家闲着没事,刷着微信,玩着手机,发现自己的微信头像该换了,就去网上找了一下头像,看着图片 ...
用Python爬虫爬取广州大学教务系统的成绩（内网访问）
用Python爬虫爬取广州大学教务系统的成绩(内网访问) 在进行爬取前,首先要了解: 1.什么是CSS选择器? 每一条css样式定义由两部分组成,形式如下: [code] 选择器{样式} [/code ...
简单的python爬虫--爬取Taobao淘女郎信息
最近在学Python的爬虫,顺便就练习了一下爬取淘宝上的淘女郎信息:手法简单,由于淘宝网站本上做了很多的防爬措施,应此效果不太好! 爬虫的入口:https://mm.taobao.com/json/r ...
python爬虫之User-Agent用户信息
python爬虫之User-Agent用户信息爬虫是自动的爬取网站信息,实质上我们也只是一段代码,并不是真正的浏览器用户,加上User-Agent(用户代理,简称UA)信息,只是让我们伪装成一个浏览 ...
python3爬虫爬取网页思路及常见问题（原创）
学习爬虫有一段时间了,对遇到的一些问题进行一下总结. 爬虫流程可大致分为:请求网页(request),获取响应(response),解析(parse),保存(save). 下面分别说下这几个过程中可以 ...
Python爬虫|爬取喜马拉雅音频
"GOOD Python爬虫|爬取喜马拉雅音频喜马拉雅是知名的专业的音频分享平台,用户规模突破4.8亿,汇集了有声小说,有声读物,儿童睡前故事,相声小品等数亿条音频,成为国内发展最快.规模 ...
Python爬虫爬取数据的步骤
爬虫: 网络爬虫是捜索引擎抓取系统(Baidu.Google等)的重要组成部分.主要目的是将互联网上的网页下载到本地,形成一个互联网内容的镜像备份. 步骤: 第一步:获取网页链接 1.观察需要爬取的多 ...

随机推荐

visualvm监控jvm及远程jvm监控方法(转)
VisualVM是Sun的一个OpenJDK项目,其目的在于为Java应用创建一个整套的问题解决工具.它集成了多个JDK命令工具的一个可视化工具,它主要用来监控JVM的运行情况,可以用它来查看和浏览H ...
使用DateDiff方法获取日期时间的间隔数
一:用DateDiff方法获取日期时间的间隔数,截图二:代码 using System; using System.Windows.Forms; using Microsoft.VisualBasi ...
hdu 4705 dfs统计更新节点信息
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=4705 #pragma comment(linker, "/STACK:16777216&qu ...
Threading Module源码概述(二)
在threading 模块中,提供了列举当前所有子线程的操作.threading.enumerate.这个操作很简单,就是将_active和_limbo中维护的线程集合的信息输出. def enume ...
Linux 环境变量 $PATH
我们知道查阅文件属性的指令 ls 完整文件名为:/bin/ls(这是绝对路径),那为什么可以在任何地方执行/bin/ls 这个指令呢? 为什么在任何目录下输入 ls 就一定可以显示出一些讯息而不会说 ...
【Java】Java8新增的Lambda表达式_学习笔记
一.Lambda表达式可以简化创建匿名内部类对象 1.不需要new XXX(){}这种繁琐代码. 2.不需要指出重写的方法名. 3.不要给出重写的方法的返回值类型. 4.Lambda相当于一个匿名方法 ...
JVM 调优
JVM内存,由三个部分构成年轻代+老年代+永久代: 需要调试的是年轻代和老年代的参数: 先解释几个JVM参数: -XMx : 最大可用内存: -Xms:初始化内存: -xss: 线程栈的大小: ...
Demo_塔防（自动生成怪物，导航，炮塔攻击，怪物掉血死忙）
using UnityEngine; using System.Collections; public struct WaveMsg { //该波次生成的怪物 public GameObject mo ...
[AWS] Install the AWS cli
On Windows, just download the installer and install it. Configure: aws configure In your aws console ...
Lucene中string docvalues使用utf-16的优化
原来的string docvalues使用utf-8编码,载入时转码花费大量时间,我们把转码实现从new String(bytes, "UTF-8")改用lucene的bytesR ...

爬虫爬oj用户头像

爬虫爬oj用户头像的更多相关文章

随机推荐

热门专题