【python】用python爬取中科院院士简介信息

018/07/09 23:43
项目名称：爬取中科院871个院士的简介信息

1.爬取目的：中科院871个院士的简介信息

2.爬取最终结果：

3.具体代码如下：

 import re # 不用安装（注意！！）

 import os # 文件夹等的操作（注意！！）

 import time

 import requests # http urllib2

 url = 'http://www.cae.cn/cae/html/main/col48/column_48_1.html'

 html = requests.get(url)

 # print(html.status_code) # 状态码200 404 500 502

 html.encoding = 'utf-8'

 # print(html.text) # 以文本形式返回网页

 # 提取数据

 # + 一次或多次 大于等于一次

 # findall返回的是列表（注意！！）

 number = re.findall(

 '<a href="/cae/html/main/colys/(\d+).html" target="_blank">', html.text)

 i = 1 # 这里的i变量是由我创造进行明确区分所抓取的院士的数量的；

 for m in number[:871]:

 # for m in number[:4]: # 这里控制要爬取的个数

 # for m in number[28:88]:

 nextUrl = 'http://www.cae.cn/cae/html/main/colys/{}.html'.format(m)

 # 再次请求数据

 nexthtml = requests.get(nextUrl)

 nexthtml.encoding = 'utf-8'

 # 注意正则表达式：

 # () 提取数据

 # . 匹配除了换行\n的任意单个字符

 # * 匹配前面的表达式任意次 {1,5}

 # ? 如果前面有限定符 非贪婪模式，注意！！！

 # 尽量可能少的匹配所搜索的字符串

 text = re.findall('<div class="intro">(.*?)</div>', nexthtml.text, re.S) # re.S匹配换行的

 text2 = re.sub(r'<p>|&ensp;|&nbsp;|</p>', '', text[0]).strip() # .strip()清楚空格

 # 保存数据

 with open(r'E:\02中科院院士信息爬取结果.txt', mode='a+', encoding="utf-8") as f: # 特别注意这里的要以编码utf-8方式打开

 f.write('{}. '.format(i) + text2 + '\n')

 i += 1

 # 不要下载太快

 # 限制下载的速度

 time.sleep(1)

 # 程序运行到这个地方 暂停1s

【python】用python爬取中科院院士简介信息的更多相关文章

[Python爬虫] Selenium爬取新浪微博客户端用户信息、热点话题及评论 (上)
转载自:http://blog.csdn.net/eastmount/article/details/51231852 一. 文章介绍源码下载地址:http://download.csdn.net/ ...
Python爬虫项目--爬取自如网房源信息
本次爬取自如网房源信息所用到的知识点: 1. requests get请求 2. lxml解析html 3. Xpath 4. MongoDB存储正文 1.分析目标站点 1. url: http:/ ...
【Python项目】爬取新浪微博个人用户信息页
微博用户信息爬虫项目链接:https://github.com/RealIvyWong/WeiboCrawler/tree/master/WeiboUserInfoCrawler 1 实现功能这个 ...
python之scrapy爬取某集团招聘信息以及招聘详情
1.定义爬取的字段items.py # -*- coding: utf-8 -*- # Define here the models for your scraped items # # See do ...
Python爬虫项目--爬取某宝男装信息
本次爬取用到的知识点有: 1. selenium 2. pymysql 3 pyquery 正文 1. 分析目标网站 1. 打开某宝首页, 输入"男装"后点击"搜索&q ...
python之crawlscrapy爬取某集团招聘信息以及招聘详情
针对这种招聘信息,使用crawlscrapy很适合. 1.settings.py # -*- coding: utf-8 -*- # Scrapy settings for gosuncn proje ...
python之scrapy爬取某集团招聘信息
1.创建工程 scrapy startproject gosuncn 2.创建项目 cd gosuncn scrapy genspider gaoxinxing gosuncn.zhiye.com 3 ...
Python爬虫之爬取慕课网课程评分
BS是什么? BeautifulSoup是一个基于标签的文本解析工具.可以根据标签提取想要的内容,很适合处理html和xml这类语言文本.如果你希望了解更多关于BS的介绍和用法,请看Beautiful ...
python爬取 “得到” App 电子书信息
前言文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理. 作者: 静觅崔庆才 PS:如有需要Python学习资料的小伙伴可以加点击下 ...

随机推荐

【洛谷P1314】[NOIP2011]聪明的质监员
聪明的质监员题目链接:https://www.luogu.org/problemnew/show/P1314 Y(W)随W的值增大而减小二分W的值,找到最小的W使得Y(W)>S: 比较Y(W ...
hadoop分类输出
import org.apache.hadoop.io.Text; import java.io.IOException;import java.util.Iterator;import java.u ...
.NET向WebService传值为decimal、double、int、DateTime等非string类型属性时，服务器端接收不到数据的问题
最近在做CRM项目时,使用C#调用SAP PI发布的WebService服务时遇到的问题: 向WebService传值为decimal.double.int.DateTime等非string类型数据时 ...
基于PHP的微信公众平台开发（TOKEN验证，消息回复）
微信公众平台开发实现步骤: 第一步:填写服务器配置登录微信公众平台官网后,在公众平台后台管理页面 - 开发者中心页,点击“修改配置”按钮,填写服务器地址(URL).Token和EncodingAE ...
zabbix服务端安装配置
1.安装好httpd,mysql,php yum install httpd php mysql mysql-devel php-xmlwriter php-gd php-mbstring php-b ...
AWS CentOS7 实例修改主机名
问题描述: AWS EC2 实例在升级到CentOS7以后,我们发现主机名的修改不再像之前的版本(CentOS 5/6)一样简单. 每次新建实例之后,修改好主机名,重启或者克隆之后的机器,主机名还是会 ...
php jsonp实例 mip无限滚动组件接口注意事项
在改造mip的过程中,很多同学遇到这样一个问题.mip无限滚动问题异步请求数据接口(仅支持 JSONP 请求) 异步请求接口需要规范 callback 为 'callback' 那么什么是JSONP ...
python中的文件操作小结2
''' #-----------文件修改---------- f=open("test_1",'r',encoding="utf-8") f2=open(&qu ...
python scrapy实战糗事百科保存到json文件里
编写qsbk_spider.py爬虫文件 # -*- coding: utf-8 -*- import scrapy from qsbk.items import QsbkItem from scra ...
python系列3之内置函数和文件操作
目录自定义函数内置函数文件的操作练习题一. 自定义函数 1. 函数的创建函数的创建 1.def关键字 2.函数名+() 3.冒号 4.缩进 5. return返回值,可以不写,默认的返回值 ...

【python】用python爬取中科院院士简介信息

【python】用python爬取中科院院士简介信息的更多相关文章

随机推荐

热门专题