python爬取数据保存到Excel中

 # -*- conding:utf-8 -*-

 # 1.两页的内容

 # 2.抓取每页title和URL

 # 3.根据title创建文件，发送URL请求，提取数据

 import requests

 from lxml import etree

 import time, random, xlwt

 # 专家委员会成员的xpath（‘//tbody//tr[@height='29']’）

 class Doc_spider(object):

     def __init__(self):

         self.base_url = 'http://www.bjmda.com'

         self.url = 'http://www.bjmda.com/Aboutus/ShowClass.asp?ClassID=12&page={}'

         self.headers = {

             'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36'}

     def get_request(self, url):

         '''发送请求，返回html'''

         response = requests.get(url, headers=self.headers).content.decode('gbk')

         # time.sleep(random.random())

         html = etree.HTML(response)

         return html

     def parse_page_html(self, html, url):

         '''提取列表页的专家委员会title和URL'''

         url_lists = html.xpath('//tr/td[2]/a[2]/@href')[1:]

         temp_lists = html.xpath('//tr/td[2]/a[2]/text()')[1:]

         title_lists = [title.rstrip() for title in temp_lists]

         urls = []

         titles = []

         for i in range(len(title_lists)):

             url = self.base_url + url_lists[i]

             title = title_lists[i]

             urls.append(url)

             titles.append(title)

         return urls, titles

     def parse_detail(self, html):

         '''详细页的提取数据,返回每组列表信息'''

         lists = html.xpath("//td[@id='fontzoom']//tr")

         content_list = []

         for list in lists:

             contents = list.xpath('.//td//text()')

             new = []

             for i in contents:

                 new.append(''.join(i.split()))

             content_list.append(new)

         return content_list

     def save_excel(self, sheet_name, contents, worksheet, workbook):

         '''保存数据到Excel'''

         # 创建一个workbook 设置编码

         #workbook = xlwt.Workbook()

         # 创建一个worksheet

         #worksheet = workbook.add_sheet(sheet_name)

         try:

             for i in range(len(contents)):

                 if len(contents[i+1])>1:

                     content_list = contents[i + 1]

                     # 写入excel

                     # 参数对应 行, 列, 值

                     worksheet.write(i, 0, label=content_list[0])

                     worksheet.write(i, 1, label=content_list[1])

                     worksheet.write(i, 2, label=content_list[2])

                     if len(contents[i+1])>3:

                         worksheet.write(i, 3, label=content_list[3])

                     # 保存

                     #workbook.save(sheet_name + '.xls')

                     # time.sleep(0.1)

         except:

             print(sheet_name,'保存OK')

             pass

     def run(self):

         # 1.发送专家委员会列表页请求

         urls = [self.url.format(i + 1) for i in range(2)]

         # 创建一个workbook 设置编码

         workbook = xlwt.Workbook()

         for url in urls:

             html = self.get_request(url)

             # 2.提取委员会的title和URL

             list_urls, titles = self.parse_page_html(html, url)

             for i in range(len(list_urls)):

                 url_detail = list_urls[i]

                 # 每个委员会的名称

                 title_detail = titles[i]

                 # 3.创建每个委员会文件，发送每个委员会的请求

                 html_detail = self.get_request(url_detail)

                 # 4.提取专家委员会详细页的内容

                 contents = self.parse_detail(html_detail)

                 # 保存每个委员会的所有人

                 # 创建一个worksheet

                 worksheet = workbook.add_sheet(title_detail)

                 self.save_excel(title_detail, contents,worksheet,workbook)

         workbook.save('专家委员会.xls')

         print('保存结束，请查看')

 if __name__ == '__main__':

     doc = Doc_spider()

     doc.run()

这个小程序可以爬取该网站的医生专家的信息，分不同的专科保存到同一个Excel中。

# -*- conding:utf-8 -*-

import xlwt

# 创建工作workbook

workbook = xlwt.Workbook()

# 创建工作表worksheet,填入表名

worksheet = workbook.add_sheet('表名')

# 在表中写入相应的数据

worksheet.write(0, 0, 'hello world')

worksheet.write(1, 1, '你好')

# 保存表

workbook.save('hello.xls')

python爬取数据保存到Excel中的更多相关文章

「拉勾网」薪资调查的小爬虫，并将抓取结果保存到excel中
学习Python也有一段时间了,各种理论知识大体上也算略知一二了,今天就进入实战演练:通过Python来编写一个拉勾网薪资调查的小爬虫. 第一步:分析网站的请求过程我们在查看拉勾网上的招聘信息的时候 ...
python之scrapy爬取数据保存到mysql数据库
1.创建工程 scrapy startproject tencent 2.创建项目 scrapy genspider mahuateng 3.既然保存到数据库,自然要安装pymsql pip inst ...
关于爬取数据保存到json文件,中文是unicode解决方式
流程: 爬取的数据处理为列表,包含字典.里面包含中文, 经过json.dumps,保存到json文件中, 发现里面的中文显示未\ue768这样子查阅资料发现,json.dumps 有一个参数.ens ...
将爬取的数据保存到mysql中
为了把数据保存到mysql费了很多周折,早上再来折腾,终于折腾好了安装数据库 1.pip install pymysql(根据版本来装) 2.创建数据打开终端键入mysql -u root -p ...
1.scrapy爬取的数据保存到es中
先建立es的mapping,也就是建立在es中建立一个空的Index,代码如下:执行后就会在es建lagou 这个index. from datetime import datetime fr ...
Excel文件数据保存到SQL中
1.获取DataTable /// <summary> /// 查询Excel文件中的数据 /// </summary> /// <param name="st ...
c# 抓取和解析网页，并将table数据保存到datatable中（其他格式也可以，自己去修改）
使用HtmlAgilityPack 基础请参考这篇博客:https://www.cnblogs.com/fishyues/p/10232822.html 下面是根据抓取的页面string 来解析并保存 ...
Sql数据保存到Excel文件中
public string ExportExcel( DataSet ds,string saveFileName) { try { if (ds == null) return "数据库为 ...
爬取伯乐在线文章（四）将爬取结果保存到MySQL
Item Pipeline 当Item在Spider中被收集之后,它将会被传递到Item Pipeline,这些Item Pipeline组件按定义的顺序处理Item. 每个Item Pipeline ...

随机推荐

P4097 [HEOI2013]Segment
传送门简单来说就是对于每条线段,先把它拆成\(O(logn)\)条,然后对于每一条再\(O(logn)\)判断在所有子区间的优劣程度 //minamoto #include<bits/stdc ...
Math teacher's homework
Title:[Math teacher's homework] Description 题目大意:给你n个数m1,m2...mn,求满足X1 xor X2 xor ... xor Xn=k,0< ...
Snackbar：用它来替换Toast 显示短提示
简介 Snackbar 它是Toast的子类.主要用来提示短暂的提示信息后,然后它自动消失. 它寄生在普通view上,具有一些基本功能. 它寄生在 CoordinatorLayout 时,有以下两个特 ...
java list遍历三种方法
JSONArray jsonArray = new JSONArray(); jsonArray.add("1"); jsonArray.add("2"); j ...
.Net实战之反射操作篇
1.上一讲中描述了反射中常见的类,仅仅是描述类与反射之间的关系. 但是实际是对数据的操作, 在反射中,数据如何操作? [MyTable("T_UserInfo")] publ ...
JavaScript（十）基本包装类
基本包装类都具有对象的基本方法 toString 和 valueOf Number 数字是原始类型,那为啥还有方法? 因为他在执行方法的时候会创建一个对应的包装类对象,这个对象有这种方法, ...
Ubuntu下查看服务器cpu是否支持VT
http://blog.51cto.com/zhangmingqian/1249522 Ubuntu下查看服务器cpu是否支持VT 原创wazjajl 2013-07-15 16:25评论(0)119 ...
全3D模具设计自动化解決方案
sql server truncate table 删除表数据限制条件
truncate 注释注释TRUNCATE TABLE 在功能上与不带 WHERE 子句的 DELETE 语句相同:二者均删除表中的全部行.但 TRUNCATE TABLE 比 DELETE 速度快 ...
Windows开启ICMP包回显

python爬取数据保存到Excel中

python爬取数据保存到Excel中的更多相关文章

随机推荐

热门专题