python 简单抓取网页并写入excel实例

# -*- coding: UTF-8 -*-

import requests

from bs4 import BeautifulSoup

import xlwt

import time 

#获取第一页的内容

def get_one_page(url):

    headers = {

        'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/64.0.3282.140 Safari/537.36'

    }

    response = requests.get(url,headers=headers)

    if response.status_code == 200:

        return response.text

    return None  

#解析第一页内容，数据结构化

def parse_one_page(html):  

    soup = BeautifulSoup(html,'lxml')

    i = 0

    for item in soup.select('tr')[2:-1]:  

        yield{

            'time':item.select('td')[i].text,

            'issue':item.select('td')[i+1].text,

            'digits':item.select('td em')[0].text,

            'ten_digits':item.select('td em')[1].text,

            'hundred_digits':item.select('td em')[2].text,

            'single_selection':item.select('td')[i+3].text,

            'group_selection_3':item.select('td')[i+4].text,

            'group_selection_6':item.select('td')[i+5].text,

            'sales':item.select('td')[i+6].text,

            'return_rates':item.select('td')[i+7].text

        }  

#将数据写入Excel表格中

def write_to_excel():

    f = xlwt.Workbook()

    sheet1 = f.add_sheet('3D',cell_overwrite_ok=True)

    row0 = ["开奖日期","期号","个位数","十位数","百位数","单数","组选3","组选6","销售额","返奖比例"]

    #写入第一行

    for j in range(0,len(row0)):

        sheet1.write(0,j,row0[j]) 

    #依次爬取每一页内容的每一期信息，并将其依次写入Excel

    i=0

    for k in range(1,247):

        url = 'http://kaijiang.zhcw.com/zhcw/html/3d/list_%s.html' %(str(k))

        html = get_one_page(url)

        print('正在保存第%d页。'%k)

        #写入每一期的信息

        for item in parse_one_page(html):

            sheet1.write(i+1,0,item['time'])

            sheet1.write(i+1,1,item['issue'])

            sheet1.write(i+1,2,item['digits'])

            sheet1.write(i+1,3,item['ten_digits'])

            sheet1.write(i+1,4,item['hundred_digits'])

            sheet1.write(i+1,5,item['single_selection'])

            sheet1.write(i+1,6,item['group_selection_3'])

            sheet1.write(i+1,7,item['group_selection_6'])

            sheet1.write(i+1,8,item['sales'])

            sheet1.write(i+1,9,item['return_rates'])

            i+=1  

    f.save('3D.xls')  

def main():

    write_to_excel()

if __name__ == '__main__':

    main()

python 简单抓取网页并写入excel实例的更多相关文章

python 处理抓取网页乱码
python 处理抓取网页乱码问题一招鲜相信用python的人一定在抓取网页时,被编码问题弄晕过一阵前几天写了一个测试网页的小脚本,并查找是否包含指定的信息. 在html = urllib2. ...
Python -- 网络编程 -- 简单抓取网页
抓取网页: urllib.request.urlopen(url).read().decode('utf-8') --- (百度是utf-8,谷歌不是utf-8,也不是cp936,ascii也不行 ...
python分布式抓取网页
呵呵,前两节好像和python没多大关系..这节完全是贴代码, 这是我第一次写python,很多地方比较乱,主要就看看逻辑流程吧. 对于编码格式确实搞得我头大..取下来页面不知道是什么编码,所以先找c ...
python 处理抓取网页乱码问题一招鲜
FROM: http://my.oschina.net/012345678/blog/122355 相信用python的人一定在抓取网页时,被编码问题弄晕过一阵前几天写了一个测试网页的小脚本,并查找 ...
python 解决抓取网页中的中文显示乱码问题
关于爬虫乱码有很多各式各样的问题,这里不仅是中文乱码,编码转换.还包括一些如日文.韩文 .俄文.藏文之类的乱码处理,因为解决方式是一致的,故在此统一说明. 网络爬虫出现乱码的原因源网页编码和爬取下来 ...
python从数据库取数据后写入excel 使用pandas.ExcelWriter设置单元格格式
用python从数据库中取到数据后,写入excel中做成自动报表,ExcelWrite默认的格式一般来说都比较丑,但workbook提供可以设置自定义格式,简单记录个demo,供初次使用者参考. 一. ...
从urllib和urllib2基础到一个简单抓取网页图片的小爬虫
urllib最常用的两大功能(个人理解urllib用于辅助urllib2) 1.urllib.urlopen() 2. urllib.urlencode() #适当的编码,可用于后面的post提交 ...
selenium配合phantomjs实现爬虫功能，并把抓取的数据写入excel
# -*- coding: UTF-8 -*- ''' Created on 2016年5月13日 @author: csxie ''' import datetime from Base impor ...
python多线程抓取网页信息
#!/usr/env python #-*- coding: utf-8 -*- import urllib import urllib2 import random import requ ...

随机推荐

vcsa6.5安装部署配置（vSphere vsan 6.5）
首先您最好先了解下vcenter和vcsa是啥:VMware Vsphere 几个不同的组件 esxi是在物理服务器安装的服务端,所有虚拟机是安装再esxi里面的,是服务端:vcenter是管理端是 ...
机器学习实战笔记-2-kNN近邻算法
# k-近邻算法(kNN) 本质是(提取样本集中特征最相似数据(最近邻)的k个分类标签). K-近邻算法的优缺点例优点:精度高,对异常值不敏感,无数据输入假定: 缺点:计算复杂度高,空间复杂度高: ...
Python3-问题整理
TypeError: a bytes-like object is required, not 'str' json.decoder.JSONDecodeError: Extra data json文 ...
排序算法三：堆排序（Heapsort）
堆排序(Heapsort)是一种利用数据结构中的堆进行排序的算法,分为构建初始堆,减小堆的元素个数,调整堆共3步. (一)算法实现 protected void sort(int[] toSort) ...
IDF-CTF-cookie欺骗 writeup
题目链接: http://ctf.idf.cn/index.php?g=game&m=article&a=index&id=40 知识点:base64解码, cookie欺骗 ...
jmeter 非GUI执行测试，没有响应数据保存到jtl文件办法
估计是jmeter为了减轻客户机负担,就没又默认把这些信息保存,如果想要保存,也可以,需要做出如下配置: 修改bin目录下的user.properties文件,追加配置: jmeter.save.sa ...
创建配置中心服务端(Spring Cloud Config)
创建配置中心服务端创建好项目后添加配置文件内容 server.port=9004 spring.application.name=spring-cloud-config-server-01 #git ...
seaborn教程4——分类数据可视化
https://segmentfault.com/a/1190000015310299 Seaborn学习大纲 seaborn的学习内容主要包含以下几个部分: 风格管理绘图风格设置颜色风格设置绘 ...
P5445 [APIO2019]路灯（树套树）
P5445 [APIO2019]路灯转化为平面上的坐标(x,y),set维护连续区间. 用树套树维护矩阵加法,单点查询. 注意维护矩阵差分的时候, $(x,y,v)$是对$(x,y)(n+1,n+1 ...
C#面试笔试题六
1.String str=new String("a")和String str = "a"有什么区别? String str = "a"; ...

python 简单抓取网页并写入excel实例

python 简单抓取网页并写入excel实例的更多相关文章

随机推荐

热门专题