IP+IDC-chinaz抓取

#-*-coding:gbk-*-

#code by anyun.org

import urllib

import re

import time

def getHtml(url):

    page = urllib.urlopen(url)

    html = page.read()

    html = html.replace('\n', '')

    html = html.replace('       ', ' ')

    html = html.replace('   ', '')

    html = html.replace('   ', '')

    # html = html.replace(' ','')

    return html

def getcontext(html):

    reg = (r'<span class="Whwtdhalf w15-0">(.*?)</span>')

    listre = re.compile(reg)

    mylist = re.findall(listre, html)

    return mylist

def getadd(html):

    reg = (r'<span class="Whwtdhalf w50-0">(.*?)</span>')

    listre = re.compile(reg)

    mylist = re.findall(listre, html)

    return mylist

def geterr(html):

    reg = (r'<div class="col-red lh30 fz14 jspu">(.*?)</div>')

    listre = re.compile(reg)

    mylist = re.findall(listre, html)

    return mylist

if __name__ == '__main__':

	f =open('list.txt','r')

	for i in f.readlines():

		i=i.strip()

		try:

			Url='http://ip.chinaz.com/?ip=http://'+i

		except:

			print 'error'

		Html = getHtml(Url)

	#	print (getcontext(Html))

		if len(geterr(Html))==0:

			print getcontext(Html)[0],getcontext(Html)[3] \

			,getcontext(Html)[1],getcontext(Html)[4] \

			,getcontext(Html)[2],getcontext(Html)[5] \

			,getadd(Html)[0],getadd(Html)[1]

			f1 = open('ok.txt','a')

			print >>f1,getcontext(Html)[0],getcontext(Html)[3] \

			,getcontext(Html)[1],getcontext(Html)[4] \

			,getcontext(Html)[2],getcontext(Html)[5] \

			,getadd(Html)[0],getadd(Html)[1]

			f1.close()

		else:

			print i,'解析失败'

			f2=open('err.txt','a')

			print >>f2,i,'解析失败'

			f2.close()

		time.sleep(0.5)

	print 'over'

IP+IDC-chinaz抓取的更多相关文章

php 使用代理IP进行数据抓取
什么是代理?什么情况下会用到代理IP?代理服务器(Proxy Server),其功能就是代用户去取得网络信息,然后返回给用户.形象的说:它是网络信息的中转站.通过代理IP访问目标站,可以隐藏用户的真实 ...
如何使用代理IP进行数据抓取，PHP爬虫抓取亚马逊商品数据
什么是代理?什么情况下会用到代理IP? 代理服务器(Proxy Server),其功能就是代用户去取得网络信息,然后返回给用户.形象的说:它是网络信息的中转站.通过代理IP访问目标站,可以隐藏用户的真 ...
WireShark系列：使用WireShark过滤条件抓取特定数据流(zz)
应用抓包过滤,选择Capture | Options,扩展窗口查看到Capture Filter栏.双击选定的接口,如下图所示,弹出Edit Interface Settints窗口. 下图显示了Ed ...
关于python抓取google搜索结果的若干问题
关于python抓取google搜索结果的若干问题前一段时间一直在研究如何用python抓取搜索引擎结果,在实现的过程中遇到了很多的问题,我把我遇到的问题都记录下来,希望以后遇到同样问题的童 ...
c#批量抓取免费代理并验证有效性
之前看到某公司的官网的文章的浏览量刷新一次网页就会增加一次,给人的感觉不太好,一个公司的官网给人如此直白的漏洞,我批量发起请求的时候发现页面打开都报错,100多人的公司的官网文章刷新一次你给我看这个, ...
一站式学习Wireshark（八）：应用Wireshark过滤条件抓取特定数据流
应用抓包过滤,选择Capture | Options,扩展窗口查看到Capture Filter栏.双击选定的接口,如下图所示,弹出Edit Interface Settints窗口. 下图显示了Ed ...
如何让Python爬虫一天抓取100万张网页
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: 王平源自:猿人学Python PS:如有需要Python学习资料的 ...
Python 3.6 抓取微博m站数据
Python 3.6 抓取微博m站数据 2019.05.01 更新内容 containerid 可以通过 "107603" + user_id 组装得到,无需请求个人信息获取: 优 ...
python爬虫成长之路（二）：抓取代理IP并多线程验证
上回说到,突破反爬虫限制的方法之一就是多用几个代理IP,但前提是我们得拥有有效的代理IP,下面我们来介绍抓取代理IP并多线程快速验证其有效性的过程. 一.抓取代理IP 提供免费代理IP的网站还挺多的, ...
抓取代理IP
写脚本从指定网站抓取数据的时候,免不了会被网站屏蔽IP.所以呢,就需要有一些IP代理.随便在网上找了一个提供免费IP的网站西刺做IP抓取.本次实践抓取的是其提供的国内匿名代理.可以打开网站查看一下源码 ...

随机推荐

UnityShader之顶点片段着色器Vertex and Fragment Shader【Shader资料】
顶点片段着色器 V&F Shader:英文全称Vertex and Fragment Shader,最强大的Shader类型,也是我们在使用ShaderLab中的重点部分,属于可编程管线,使用 ...
float类型转对象对象转float类型（一）
//float类型转化为对象CGFloat fValue = 1.f;NSNumber *objNo = [NSNumber numberWithFloat:fValue];数值.BOOL型都可以转成 ...
iOS网络-03-NSURLSession与NSURLSessionTask
简介 NSURLSession也能完成网络请求 NSURLConnection在iOS9中不推荐使用,NSURLSession是iOS9中推荐使用的网络请求方式 NSURLSession需要与NSUR ...
windows 和 linux ssh互连
从windows连接到linux: linux开启sshd服务即可,主要是windows的配置如下: 1.使用软件,putty可以直接使用 2.使用cmd控制台连接linux,安装SSH Secure ...
strcat()函数常见问题
strcat(char *_Destination,const char *_Source)函数的功能是将后一个字符串粘贴到前一个字符串的末尾原型 char *strcat(char *_Desti ...
第二章 Mysql 数据类型简介--（整数类型、浮点数类型和定点数类型，日期与时间类型，字符串类型，二进制类型）
第一节:整数类型.浮点数类型和定点数类型 1,整数类型 2,浮点数类型和定点数类型 M 表示:数据的总长度(不包括小数点):D 表示:小数位:例如 decimal(5,2) 123.45存入数据的时候 ...
CSS盒模型重新理解篇
最近比较闲,思索着怎么提高下JS技术,于是找到了昵称为豪情的这哥们的一篇文章,应该是哥们吧,详细了解了下,发现其中的试题CSS部分有些做起来很吃力,于是乎各种google恶补盒模型,找到了这哥们的一文 ...
js 操作select和option
js 操作select和option 1.动态创建select function createSelect(){ var mySelect = document.createElement_x(&qu ...
[学习嵌入式开发板]iTOP-4412实现NFS网络文件系统
本文转自迅为:http://www.topeetboard.com 学习平台:iTOP-4412开发板本文讲解如何在 iTOP-4412 开发板上实现 NFS 网络文件系统. 我们使用的软硬件环境是 ...
python Quicksort demo
__author__ = 'student' ''' quicksort step 1, choose one pivot, such as pivot=la[0] step 2, scan the ...

IP+IDC-chinaz抓取

IP+IDC-chinaz抓取的更多相关文章

随机推荐

热门专题