python爬虫 ----文章爬虫（合理处理字符串中的\n\t\r........）

import urllib.request

import re

import time

num=input("输入日期（20150101000）：")

def openpage(url):

    html=urllib.request.urlopen(url)

    page=html.read().decode('gb2312')

    return page

def getpassage(page):

    passage = re.findall(r'<p class="MsoNormal" align="left">([\s\S]*)</FONT>',str(page))

    passage1=re.sub("</?\w+[^>]*>", "", str(passage))

    passage2=passage1.replace('\\r', '\r').replace('\\n', ' \n').replace('\\t','\t').replace(']','').replace('[','').replace('&nbsp;','   ')

    print(passage2)

    with open(load,'a',encoding='utf-8') as f:

        f.write("-----------------------------"+"日期"+str(date)+"---------------------------------\n"+passage2+"----------------------------------------------------\n")

for i in range(1,32):

    date=int(num)+int(i)

    print(date)

    load="C:/Users/home/Desktop/新建文本文档.txt"

    url=("http://www.hbuas.edu.cn/news/xyxw/news_"+str(date)+".htm")

    
　　
    try:

        page=openpage(url)

        getpassage(page)

        print("第"+str(i)+"号有文章，----已下载")

    except:

        print("第"+str(i)+"号无文章。")

    time.sleep(2)

写了一个爬学校新闻网的爬虫，

主要涉及 re正则 urllib.request 文件的写入

在爬取文章时通常会返回很多影响美感的代码

如下：

优化：

两次正则

passage = re.findall(r'<p align="left">([\s\S]*)</FONT>',str(page))       #第一次匹配字段

passage1=re.sub("</?\w+[^>]*>", "", str(passage))　　　　　　　　　　　　　　# 第二次去掉html标签

替换

passage2=passage1.replace('\\r', '\r').replace('\\n', ' \n').replace('\\t','\t').replace(']','').replace('[','').replace('&nbsp;','   ')

效果如下：

over！

python爬虫 ----文章爬虫（合理处理字符串中的\n\t\r........）的更多相关文章

python经典算法题：求字符串中最长的回文子串
题目给定一个字符串 s,找到 s 中最长的回文子串.你可以假设 s 的最大长度为 1000. 示例 1: 输入: "babad" 输出: "bab" 注意: ...
python 实现查找某个字符在字符串中出现次数，并以字典形式输出
把字符串'aenabsascd'中的字符出现的次数统计出来,并以字典形式输出方法一: def count_str(str): dic={} for i in str: dic[i]=str.coun ...
python处理dict转json，字符串中存在空格问题，导致url编码时，存在多余字符
在进行urlencode转换请求的参数时,一直多出一个空格,导致请求参数不正确,多了一个空格,解决方法一种是将dict中key-value键值对的value直接定义为字符串,另一种是value仍然为字 ...
PYTHON 写函数，计算传入字符串中【数字、字母、空格、以及其他的个数】
def func1(s): al_num = 0 spance_num = 0 digit_num = 0 others_num = 0 for i in s: if i.isdigit(): # i ...
Python：用正则表达式，提取字符串中的所有中文
import re def clean(line): pattern = re.compile(u'[^\u4e00-\u9fa5]') #中文的范围为\u4e00-\u9fa5 line = re. ...
Linux c字符串中不可打印字符转换成16进制
本文由 www.169it.com 搜集整理如果一个C字符串中同时包含可打印和不可打印的字符,如果想将这个字符串写入文件,同时方便打开文件查看或者在控制台中打印出来不会出现乱码,那么可以将字符串中的 ...
Python基础笔记系列七：字符串定义和访问
本系列教程供个人学习笔记使用,如果您要浏览可能需要其它编程语言基础(如C语言),why?因为我写得烂啊,只有我自己看得懂!! 字符串定义和访问 1.字符串基础 a.字符串可以用单引号.双引号.三引号( ...
利用Python编写网络爬虫下载文章
#coding: utf-8 #title..href... str0='blabla<a title="<论电影的七个元素>——关于我对电影的一些看法以及<后会无期 ...
教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神
本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http://www.xiaohuar.com/,让你体验爬取校花的成就感. Scr ...

随机推荐

JRE vs OpenJDK vs Oracle JDK
JRE vs OpenJDK vs Oracle JDK 在我们继续了解如何安装Java之前,让我们快速地了解JRE.OpenJDK和Oracle JDK之间的不同之处. JRE(Java Runti ...
airflow 实战
def print_hello(*a,**b): print a print "=========" print b print 'Hello world!' raise Valu ...
LeetCode 496 Next Greater Element I 解题报告
题目要求 You are given two arrays (without duplicates) nums1 and nums2 where nums1’s elements are subset ...
GIt如何安装使用
一:公式git服务器地址:192.168.1.16 . 采用https协议,建议大家编辑本机hosts文件,将此地址映射到域名git.penseesoft.com,已防止出现的SSL证书警告. Hos ...
封装一个axios请求后台的通用方法
import axios from 'axios'; import constant from '@/js/const'; import alert from '@/js/alertView'; le ...
Redis分布式锁服务（转）
原文:http://www.cnblogs.com/mushroom/p/4752499.html 概述在多线程环境下,通常会使用锁来保证有且只有一个线程来操作共享资源.比如: object obj ...
安装sqlserver2008中出现的问题小结
安装完sqlserver2008时报了几个错,但是好歹装上了,但是我想使用sa用户登录,给我出现了这么一个错标题: 连接到服务器------------------------------ 无法连接 ...
ubuntu上make menuconfig出错
如果使用make menuconfig的方式配置内核,又碰巧系统没有安装ncurses库(ubuntu系统默认就没有安装此库),就会出现错误,错误信息大体上如下: *** Unable to find ...
cors与jsonp
在.net中,可以在webApiConfig代码里写,也可以在web.config里配置,但都需要引入System.Web.Cors.这些都是服务器端的配置,对整个项目有效. {若只想对某个请求有效, ...
sql server误删数据恢复delete（低效版）
关键词:sql server误删数据恢复,mssql误删数据恢复,delete --切换数据库 use master --构建函数 Create PROCEDURE Recover_Deleted_D ...

python爬虫 ----文章爬虫（合理处理字符串中的\n\t\r........）

python爬虫 ----文章爬虫（合理处理字符串中的\n\t\r........）的更多相关文章

随机推荐

热门专题