【python】版本35 正则-非库-爬虫-读写xlw文件
#交代:代码凌乱,新手一个,论坛都是高手,我也是鼓了很大勇气,发出来就是被批评和进步的
from urllib import request
from urllib import request
from urllib import error
import io
import sys
import re
from functools import reduce
import xlrd,xlwt
import numpy as np
import time
from xlutils.copy import copy
from openpyxl import Workbook
from openpyxl import load_workbook
#python 35
#
class Spider():
new_excel_file = xlwt.Workbook(encoding='utf-8')
readbook1 = xlrd.open_workbook(r'C:\\Users\\Administrator\\Desktop\\mingshi1.xlsx')
url = 'http://m******?id='
one_pattern = '<div id="artDiv" style="border:0; background-color:#fff; font-size:14px;line-height:180%">([\s\S]*?)</div>'
lieshu=0 #one1_pattern = '>([\s\S]*?)<' def fetch_content(self,url1):#正则匹配
while(1):
try:
r = request.urlopen(url1)
htmls = r.read()
htmls = str(htmls,encoding='utf-8')
#print(htmls)
return htmls
break except error.HTTPError as e:
print(e.code)
self.Error_input() except error.URLError as e:
print(e.reason)
self.Error_input() def Error_input(self):#遇到URL或者HTTP错误提示
Error_if = input("Some Error, (enter)here we go?**************************(everything) Exit")
if Error_if:
sys.exit()
else:
pass def analysis(self,htmls):#处理正则后的数据
one_html = re.findall(Spider.one_pattern,htmls)
#print (one_html)
if one_html:
for html in one_html:
content = html
# content = re.findall(Spider.one_pattern,html)
print(len(content))
if len(content):
t1 = reduce(lambda x,y:x+y,content)
else:
t1 = ' '
else:
t1= ' '
#print(t)
return t1 def go(self):#循环 读 xlw和循环 写 xlw
"""
循环读xlw
"""
#定义循环 读 xlw的变量
readbook = xlrd.open_workbook(r'C:\\Users\\Administrator\\Desktop\\mingshi.xlsx')
table = readbook.sheets()[0]
start=1 #开始的行
end=639 #结束的行 list_values=[]
#执行循序 1.1循环 读 第1列xlw的代码块,上面变量有行数的开始行和结束行
#
for x in range(start,end):
values=[]
row =table.row_values(x)
for i in range(1):
values.append(row[i])
list_values.append(values)
datamatrix=list(np.array(list_values))
#print(type(datamatrix))
"""
循环写xlw
"""
#定义循环 写 xlw的变量
wb = load_workbook(r'C:\\mingshi11111.xlsx')
ws=wb.active
hangshu = 1 #行
lieshu = 5 #列
rows=[]
for row in ws.iter_rows():#获取所有行
rows.append(row)
"""
#抛弃使用xlsw库,缺点:写xlw会有大小限制,超过限制会出错
# 写xls w for循环外
# book1 = xlrd.open_workbook(r'路径')
# book2 = copy(book1)#拷贝一份原来的excel
# sheet = book2.get_sheet(0)#获取第几个sheet页,book2现在的是xlutils里的方法,不是xlrd的
"""
#循环读xlw的代码块和url+id处理
for y in datamatrix:
url1=("http://m******px?id="+str(int(y)))
#url1=("http://m******x?id=20131210120041954")
#
print(('*')*127)
print("url:"+url1) #执行循序2.1 打印第一个url
print(('*')*127)
htmls = self.fetch_content(url1) #执行循序2.2 正则htmls
self.analysis(htmls) #执行循序2.3 过滤htmls放入list后使用reduce追加内容,变成一体连续内容 """
openpyxl_start
"""
#执行循序3.1 写xlw文件
print('正在写入第'+str(hangshu)+'行')
if hangshu == 639:# break
else:
rows[hangshu][lieshu].value = self.analysis(htmls) #[hangshu][lieshu]第hangshu行,第lieshu列
wb.save("C:\\mingshi111111.xlsx")
print('已写入第'+str(hangshu)+'行')
hangshu+=1 #
"""
写xls w 循环内
""" """
if lieshu==639: #写循环次数 break
else:
sheet.write(lieshu, 5, self.analysis(htmls))
book2.save('c:\\ms.xls')
lieshu+=1
"""
"""
注释
"""
print(('*')*127)
print('sleep 1秒')
print(('*')*127)
time.sleep(1) spider = Spider()
spider.go()
【python】版本35 正则-非库-爬虫-读写xlw文件的更多相关文章
- Python 实现 Excel 里单元格的读写与清空操作
#coding=utf-8 # coding=utf-8 作用是声明python代码的文本格式是utf-8,python按照utf-8的方式来读取程序. # 如果不加这个声明,无论代码中还是注释中有中 ...
- 使用 pyenv 可以在一个系统中安装多个python版本
Installl related yum install readline readline-devel readline-static -y yum install openssl openssl- ...
- Mac OS下使用pyenv管理Python版本
问题的由来 在开发过程中,可能会遇到多个版本同时部署的情况. Mac OS自带的Python版本是2.x,自己开发需要Python3.x 系统自带的是2.6.x,开发环境是2.7.x 由于Mac机器系 ...
- 使用 pyenv 管理 Python 版本
http://einverne.github.io/post/2017/04/pyenv.html Posted on 04/22/2017 by Ein Verne | View revisio ...
- linux下面升级 Python版本并修改yum属性信息
最近需要在linux下使用python,故需要升级一下python版本,上网查询了一下相关资料,更新了一下linux下面的python环境,记录如下: linux下面升级 Python版本并修改yum ...
- 编程读写CAD文件验证
背景 B/S应用系统,根据用户上传数据:业务数据和CAD坐标数据,经过一系列运筹算法运算后,输出一批坐标数据,作为给用户的规划结果.此时需要方便直观的给用户展示坐标数据.可选方式有两个: web页面画 ...
- python版本及ML库
一:关于Python版本的选择问题 关于Python的选择问题:要看学术界能不能把科学库迁移到Python3. 1:多个版本共用: 最近发现SciPy的最高版本是3.2,只能是退而求其次,不使用最新版 ...
- 【归纳】正则表达式及Python中的正则库
正则表达式 正则表达式30分钟入门教程 runoob正则式教程 正则表达式练习题集(附答案) 元字符\b代表单词的分界处,在英文中指空格,标点符号或换行 例子:\bhi\b可以用来匹配hi这个单词,且 ...
- Hadoop streaming使用自定义python版本和第三方库
在使用Hadoop的过程中,遇到了自带python版本比较老的问题. 下面以python3.7为例,演示如何在hadoop上使用自定义的python版本以及第三方库. 1.在https://www.p ...
随机推荐
- ACM(数学问题)——UVa202:输入整数a和b(0≤a≤3000,1≤b≤3000),输出a/b的循环小数表示以及循环节长度。
主要思路: 通过模拟除法运算过程,来判断循环节结束的位置,不断将余数*10再对除数取余得到新的余数,并记录下来,知道出现的余数之前出现过,此时小数开始循环. 例如: 假设 -> a ...
- Robot Framework+python的安装,配置,环境搭建(纯白篇)
弄了大半天 终于把-Robot Framework-弄好了,总是一个发现问题,一个一个去解决的过程,只是时间嘛,咳咳咳咳 言归正传 第一. 记住了 Robot Framework 的库 只支持 pyt ...
- 通俗易懂--SVM算法讲解(算法+案例)
1.SVM讲解 新闻分类案例 SVM是一个很复杂的算法,不是一篇博文就能够讲完的,所以此篇的定位是初学者能够接受的程度,并且讲的都是SVM的一种思想,通过此篇能够使读着会使用SVM就行,具体SVM的推 ...
- Finish final project
一.项目地址:https://github.com/Joyce45/final-project 二.团队成员陈述: 于浩: 张雨: 遇到的问题:1.通过relativepanel解决了刚开始设计上使用 ...
- jmeter本身的一个bug记录
1.使用jmeter测http接口 2.断言接口返回的内容是否包含某串文本 3.结果:总是返回断言失败,即使接口返回的内容包含了该文本 接口返回的值为: {"code":" ...
- Python几周学习内容小结
环境配置 学习python首先是要配置环境,我们选择了Anaconda. 什么是Anaconda:专注于数据分析的python发行版本. 为什么选择Anaconda:省事省心,分析利器 至于下载和安装 ...
- KVM 虚拟机的热迁移
热迁移:顾名思义在虚拟机不关机的情况下将KVM虚拟机进行迁移 准备工作:两台KVM虚拟机,一台nfs虚拟机,centos7.4系统 主机 IP地址 主机名 KVM01 10.00.11 kvm01 K ...
- nodejs + 小程序云函数 生成小程序码
前言:这个东西坑死我了 业务需求要生成小程序码 然后我找了两天的资料 运行 生成一堆的乱码 死活就是不能生成 最后看了一遍博客 套用了一下 自己又简单的改了一下 nodejs 我是刚刚接触 有很多 ...
- 编写shell脚本kill掉占用cpu超过90%以上的程序
由于集群用户经常会不懂如何提交作业,将作业直接运行到登录节点上,这样导致登录节点的cpu及内存占用很大,导致其他用户甚至无法登录.所以就想到了一种解决方法,写一个shell脚本,常驻登录节点,监控cp ...
- linux 值安装yum包
1. 创建文件,挂载 rhel7-repo-iso [root@rhel7 ~]# mkdir /media/rhel7-repo-iso [root@rhel7 ~]# mount /dev/cd ...