利用page_source抓取网页中的URL，进行链接测试

selenium的page_source方法可以获取到页面源码，下面就把它应用到链接测试中。

# coding:utf-8

__author__ = 'helen'

import re,requests

from selenium import webdriver

# 爬取网页资源，并用正则表达式匹配出URL

def get_urlList(target_page):

    driver = webdriver.Firefox()

    driver.get(target_page)

    # 获取网页资源

    page = driver.page_source

    # 用正则表达式匹配URL集

    url_context = re.findall('href=\"(.*?)\"',page,re.S)

    url_list = []

    for url in url_context:

        # 因为url_context中匹配的内容有些不是URL，所以加个if来过滤一下

        if 'http'in url:

            url_list.append(url)

    # 因为网页中的URL基本是正确的，下面我们可以加入一个不存在的URL，检查异常URL的输出

    url_list.append('http://www.cnblogs.com/helenMemery/p/35.html')

    return url_list

# 通过request.get检查URL的返回编码状态，以确认URL返回正常

def test_url(url_list):

    try:

        for url in url_list:

            r = requests.get(url=url)

            if r.status_code !=200:

                print url

    except requests.HTTPError,e:

        e.strerror

if __name__ == '__main__':

    target_page = 'http://www.cnblogs.com/helenMemery/'

    url_list = get_urlList(target_page)

    test_url(url_list)

在此感谢悠总的分享：http://www.cnblogs.com/yoyoketang/p/6512604.html

利用page_source抓取网页中的URL，进行链接测试的更多相关文章

Java 抓取网页中的内容【持续更新】
背景:前几天复习Java的时候看到URL类,当时就想写个小程序试试,迫于考试没有动手,今天写了下,感觉还不错内容1. 抓取网页中的URL 知识点:Java URL+ 正则表达式 import jav ...
利用Crowbar抓取网页异步加载的内容 [Python俱乐部]
利用Crowbar抓取网页异步加载的内容 [Python俱乐部] 利用Crowbar抓取网页异步加载的内容在做 Web 信息提取.数据挖掘的过程中,一个关键步骤就是网页源代码的获取.但是出于各种原因 ...
php抓取网页中的内容
以下就是几种常用的用php抓取网页中的内容的方法.1.file_get_contentsPHP代码代码如下:>>>>>>>>>>>&g ...
Python抓取页面中超链接(URL)的三中方法比较(HTMLParser、pyquery、正则表达式) <转>
Python抓取页面中超链接(URL)的3中方法比较(HTMLParser.pyquery.正则表达式) HTMLParser版: #!/usr/bin/python # -*- coding: UT ...
浅谈如何使用python抓取网页中的动态数据
我们经常会发现网页中的许多数据并不是写死在HTML中的,而是通过js动态载入的.所以也就引出了什么是动态数据的概念, 动态数据在这里指的是网页中由Javascript动态生成的页面内容,是在页面加载到 ...
Python抓取网页中的图片到本地
今天在网上找了个从网页中通过图片URL,抓取图片并保存到本地的例子: #!/usr/bin/env python # -*- coding:utf- -*- # Author: xixihuang # ...
用正则表达式抓取网页中的ul 和 li标签中最终的值！
获取你要抓取的页面 const string URL = "http://www.hn3ddf.gov.cn/price/GetList.html?pageno=1& ...
python抓取网页中图片并保存到本地
#-*-coding:utf-8-*- import os import uuid import urllib2 import cookielib '''获取文件后缀名''' def get_file ...
python 解决抓取网页中的中文显示乱码问题
关于爬虫乱码有很多各式各样的问题,这里不仅是中文乱码,编码转换.还包括一些如日文.韩文 .俄文.藏文之类的乱码处理,因为解决方式是一致的,故在此统一说明. 网络爬虫出现乱码的原因源网页编码和爬取下来 ...

随机推荐

MyBitis(iBitis)系列随笔之二：类型别名(typeAliases)与表-对象映射(ORM)
类型别名(typeAliases): 作用:通过一个简单的别名来表示一个冗长的类型,这样可以降低复杂度. 类型别名标签typeAliases中可以包含多个typeAlias,如下 < ...
android 清除缓存功能
本应用数据清除管理器 DataCleanManager.java 是从网上摘的忘了名字了对不住了载入一个webview 产生缓存众所周知的webview是产生缓存的主要原因之中的一 ...
收集各种在线HTTP网站载入速度（响应时间）站长测试（检测）工具
收集各种在线HTTP网站载入速度(响应时间)站长测试(检测)工具名称\详情简单功能描述推荐星级演示/示例监控宝从中国多地对你提交的URL进行载入速度(响应时间)测试 ★★★★★ 17C ...
【IIS】IIS 7.0/7.5 无法启动 w3svc 服务
一般情况下,window IIS安装完毕后,会启动C:\inetpub\ 产生类似C:\inetpub\temp\apppools的文件夹,如果IIS被改动过,此文件夹不会自动生成.需要手动添加. ...
oracle如何用sql查看触发器？
ORACLE查出表所有的触发器及触发器详细信息一.查all_triggers表得到trigger_name Sql代码 select trigger_name from all_triggers w ...
vue-router scrollBehavior无效的问题
在使用vue做单页面应用开发时候使用vue-router作为路由控制器在使用过程中发现每个页面打开都在原来的位置不能返回到页面顶部位置 ,然后查看api文档滚动行为发现如下代码: con ...
利用jsPerf优化Web应用的性能
在前端开发的过程中,掌握好浏览器的特性进行有针对性的性能调优是一项基本工作,jsperf.com是一个用来发布基于HTML的针对性能比较的测试用例的网站,你可以在jsPerf上在线填写和运行测试用例, ...
160428、JavaScript知识总结—cookie及其应用
一.cookie基本介绍 cookie是document的对象.cookie可以使得JavaScript代码能够在用户的硬盘上持久地存储数据,并且能够获得以这种方式存储的数据.cookie还可以用于客 ...
Servlet------>ServletConfig和ServletContext
原理图: 之一--------->servletConfig 有些时候,有些参数不适合写死,而且初始化servlet要用,可以通过这个头来调用servletConfig 例如:serlet数据库 ...
UIScrollView 去掉下面的滚动条
[_scrollView setShowsHorizontalScrollIndicator:NO];

利用page_source抓取网页中的URL，进行链接测试

利用page_source抓取网页中的URL，进行链接测试的更多相关文章

随机推荐

热门专题