python+selenium 爬取中国工业园网
import math
import re import requests from lxml import etree type = "https://www.cnrepark.com/gyy/park{}/"
urlList = []
for i in range(1,8):
url = type.format(i)
urlList.append(url) from time import sleep
from selenium import webdriver
from selenium.webdriver.chrome.options import Options
options = Options()
options.add_argument('--headless')
br = webdriver.Chrome(chrome_options=options) class ChanyeList(object): User_Agent = "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/79.0.3945.88 Safari/537.36"
Refer = "https://www.cnrepark.com" # 初始化
def __init__(self,br):
self.br = br # 使用selenium下载内容
def selenium_download(self,url):
br.get(url)
content = self.br.page_source
return content def get_total_numbers(self,url):
content = self.selenium_download(url)
html = etree.HTML(content)
totalNumbersTxt = html.xpath('.//div[@class="nw_num"]/text()')
import re
totalNumbers = re.findall(r'\d+',totalNumbersTxt[0])
return totalNumbers[0]
# 解析出列表
def html_parse_list(self,content):
html = etree.HTML(content)
listObj = html.xpath('.//div[@class="area"]//div[@class="con_lst"]')
list = []
for item in listObj:
src = item.xpath('./div/a/img/@src')
href = item.xpath('./div//h2/a/@href')
title = item.xpath('./div//h2/a/text()')
list.append({'title':title[0],'href':href[0],"src":src[0]})
return list def optimizeContent(self,res):
res = res.replace('b\'', '')
res = res.replace('\\n', '')
res = res.replace('\'', '')
return res # 解析出详情
def html_parse_detail(self,content):
html = etree.HTML(content)
detail = html.xpath('.//div[@class="right_nr"]/div[1]//div[@class="kfq_box"]/ul')
detail = etree.tostring(detail[0])
detail = self.optimizeContent(str(detail)) # 区域优势
regionalAdvantages = html.xpath('.//div[@id="tbc_81"]')
regionalAdvantages = etree.tostring(regionalAdvantages[0])
regionalAdvantages = self.optimizeContent(str(regionalAdvantages)) # 基础配套
basicConfiguration = html.xpath('.//div[@id="tbc_82"]')
basicConfiguration = etree.tostring(basicConfiguration[0])
basicConfiguration = self.optimizeContent(str(basicConfiguration)) # 优惠政策
preferentialPolicy = html.xpath('.//div[@id="tbc_83"]')
preferentialPolicy = etree.tostring(preferentialPolicy[0])
preferentialPolicy = self.optimizeContent(str(preferentialPolicy)) # 规划建设
planningInformation = html.xpath('.//div[@id="tbc_84"]')
planningInformation = etree.tostring(planningInformation[0])
planningInformation = self.optimizeContent(str(planningInformation)) res = {'detail': detail,
"regionalAdvantages": regionalAdvantages,
"basicConfiguration": basicConfiguration,
"preferentialPolicy": preferentialPolicy,
"planningInformation": planningInformation,
} return res; def crawl_url(self,url):
print("crawl page {}".format(url))
listContent = self.selenium_download(url)
list = self.html_parse_list(listContent)
return list def get_name(self,index):
nameList = [
"特色园区",
"创意园",
"孵化基地",
"商务园区",
"生态园区",
"综合乐园",
"产业园转移区"
]
return nameList[index] # 保存list 获取到详情 保存为html
def save_list(self,list,type_index):
try:
for item in list:
url = item['href']
print("crawl url :"+url)
content = self.selenium_download(url)
detailList = self.html_parse_detail(content)
item['title'] = self.validateTitle(item['title'])
type_name = self.get_name(type_index)
with open("./txt/"+type_name+"-"+item['title']+".html","w") as f:
f.write("<h2>{}</h2>".format(item['title']))
f.write("<div> <a href='{}'><img style='height:80px;height:80px;' src={} /></a></div>".format(item['href'],item['src']))
f.write("<p>{}</p>".format(detailList['detail']))
f.write("<p>{}</p><h3>区位优势:</h3>{}".format(detailList['detail'],detailList['regionalAdvantages']))
f.write("<p>{}</p><h3>基础配套:</h3>{}".format(detailList['detail'],detailList['basicConfiguration']))
f.write("<p>{}</p><h3>优惠政策:</h3>{}".format(detailList['detail'],detailList['preferentialPolicy']))
f.write("<p>{}</p><h3>规划建设:</h3>{}".format(detailList['detail'],detailList['planningInformation']))
f.write("<br>")
f.close()
except Exception as e:
print("Exception:"+str(e))
def validateTitle(self,title):
rstr = r"[\/\\\:\*\?\"\<\>\|\(\)]" # '/ \ : * ? " < > |'
new_title = re.sub(rstr, "_", title) # 替换为下划线
return new_title
if __name__ == "__main__":
try: rootUrl = "https://www.cnrepark.com/gyy/park{}/" for k in range(1,8):
chanyeList = ChanyeList(br)
baseUrl = "https://www.cnrepark.com/gyy/park"+str(k)+"/?publishtime=desc&page={}"
pageUrl = "https://www.cnrepark.com/gyy/park"+str(k)+"/"
# 获取总页数
totalNumbers = chanyeList.get_total_numbers(pageUrl)
totalPage = math.ceil( int(totalNumbers) / 13)
result = []
for page in range(1,int(totalPage) + 1 ):
realUrl = baseUrl.format(page)
list = chanyeList.crawl_url(realUrl)
result.extend(list)
chanyeList.save_list(result,k-1) br.quit()
except Exception as e:
print(str(e))
python+selenium 爬取中国工业园网的更多相关文章
- Python爬取中国天气网
Python爬取中国天气网 基于requests库制作的爬虫. 使用方法:打开终端输入 “python3 weather.py 北京(或你所在的城市)" 程序正常运行需要在同文件夹下加入一个 ...
- 初识python 之 爬虫:爬取中国天气网数据
用到模块: 获取网页并解析:import requests,html5lib from bs4 import BeautifulSoup 使用pyecharts的Bar可视化工具"绘制图表& ...
- Python+Selenium爬取动态加载页面(1)
注: 最近有一小任务,需要收集水质和水雨信息,找了两个网站:国家地表水水质自动监测实时数据发布系统和全国水雨情网.由于这两个网站的数据都是动态加载出来的,所以我用了Selenium来完成我的数据获取. ...
- selenium爬取煎蛋网
selenium爬取煎蛋网 直接上代码 from selenium import webdriver from selenium.webdriver.support.ui import WebDriv ...
- Python+Selenium爬取动态加载页面(2)
注: 上一篇<Python+Selenium爬取动态加载页面(1)>讲了基本地如何获取动态页面的数据,这里再讲一个稍微复杂一点的数据获取全国水雨情网.数据的获取过程跟人手动获取过程类似,所 ...
- Python Scrapy 爬取煎蛋网妹子图实例(一)
前面介绍了爬虫框架的一个实例,那个比较简单,这里在介绍一个实例 爬取 煎蛋网 妹子图,遗憾的是 上周煎蛋网还有妹子图了,但是这周妹子图变成了 随手拍, 不过没关系,我们爬图的目的是为了加强实战应用,管 ...
- Python爬取中国票房网所有电影片名和演员名字,爬取齐鲁网大陆所有电视剧名称
爬取CBO中国票房网所有电影片名和演员名字 # -*- coding: utf-8 -*- # 爬取CBO中国票房网所有电影片名 import json import requests import ...
- python爬取中国知网部分论文信息
爬取指定主题的论文,并以相关度排序. #!/usr/bin/python3 # -*- coding: utf-8 -*- import requests import linecache impor ...
- scrapy实例:爬取中国天气网
1.创建项目 在你存放项目的目录下,按shift+鼠标右键打开命令行,输入命令创建项目: PS F:\ScrapyProject> scrapy startproject weather # w ...
随机推荐
- [LeetCode]364. 加权嵌套序列和 II (DFS)
题目 给一个嵌套整数序列,请你返回每个数字在序列中的加权和,它们的权重由它们的深度决定. 序列中的每一个元素要么是一个整数,要么是一个序列(这个序列中的每个元素也同样是整数或序列). 与 前一个问题 ...
- c#中的ReadOnlySequenceSegment<T>和ReadOnlySequenceSegment<T>
关于.net core高性能编程中的Span<T>和Memory<T>网上资料很多,这里就不说了.今天一直在看ReadOnlySequenceSegment<T>和 ...
- Video.js + HLS 在production环境下webpack打包后出错的解决方案
Video.js是一个非常强大的视频播放库,能在微信下完美提供inline小窗口播放模式,但当涉及到hls格式视频播放时就比较麻烦,出现的数种现象都不好解决. 错误现象: 1. PC Chrome ...
- SSM获取SqlSessionFactory
1.实现类获取session //根据id 修改阈值 public int altThers(threshold threshold) { SqlSessionFactoryBuilder build ...
- (专题一)03 matlab变量及其操作
给内存单元取名字就可以访问内存单元 变量的命名:变量名区分大小写 标准函数名以及命名方式必须用小写字母 matlab赋值语句有两种表达式 变量的管理 1.预定义变量 ans 是默认赋值变 ...
- java8的interface的方法定义
转自https://www.cnblogs.com/zhenghengbin/p/9398682.html Java8新特性(一)_interface中的static方法和default方法 为什 ...
- DeRPnStiNK靶机渗透
DeRPnStiNK靶机渗透 常规的信息搜集 扫到了phpmyadmin以及wordpress并在后台发现弱密码,即admin,admin 这里对wordpress进行了扫描: 扫描插件: searc ...
- spring注解(Component、依赖注入、生命周期、作用域)
1.注解 注解就是一个类,使用@加上注解名称,开发中可以使用注解取代配置文件 2.@Component 取代<bean class="">,@Component 取代 ...
- Typora操作总结
Typora 1. Markdown 是一种轻量级标记语言,它允许人们使用易读易写的纯文本格式编写文档 1.1 目录 [toc] 2. 结构类操作 2.1 多级标题 # 一级标题 ...
- 嘿!Mybatis
简介 什么是Mybatis MyBatis 是一款优秀的持久层框架 它支持自定义 SQL.存储过程以及高级映射. MyBatis 免除了几乎所有的 JDBC 代码以及设置参数和获取结果集的工作. My ...