[Selenium2+python2.7][Scrap]爬虫和selenium方式下拉滚动条获取简书作者目录并且生成Markdown格式目录

预计阅读时间： 15分钟

环境： win7 + Selenium2.53.6+python2.7 +Firefox 45.2 (具体配置参考 http://www.cnblogs.com/yoyoketang/p/selenium.html)

FF45.2 官方下载地址： http://ftp.mozilla.org/pub/firefox/releases/45.2.0esr/win64/en-US/

痛点：爸爸的一个朋友最近简书上面更新了20多篇文章，让我添加目录。每次手动查找链接再添加标题太麻烦了，30多篇就需要半个多小时，而且链接可能会变换。

解决办法：由于简书支持markdown 格式，爬取作者目录然后生成Markdown格式文档即可

原始思路一：采用urllib2方式爬取目录

步骤：

1.使用urllib2模拟header request打开页面

2. 采用正则匹配href的链接，然后用列表推导式生成链接

3. 采用正则获取标题

4. 生成目录

 #coding=utf-8

 import urllib2,re

 def getHtml(url):

     header = {"User-Agent":'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/53.0.2785.101 Safari/537.36'}

     request = urllib2.Request(url,headers=header)  #init user request with url and headers

     response = urllib2.urlopen(request)            #open url

     text = response.read()

     return text

 def getTitleLink(html):

     pattern1 = re.compile('<a class="title" target="_blank" href="/p/(\w{0,12})"', re.S)

     links = re.findall(pattern1,html)

     urls = ["www.jianshu.com/p/"+str(link) for link in links]

     pattern2 = re.compile('<a class="title" target="_blank" href="/p/.*?">(.*?)</a>',re.S)

     titles = re.findall(pattern2,html)

     for title,url in zip(titles,urls):

         if r'目录' not in title:

             print "["+title+"](" + url + ")"

     #return urls

 #sample test menu

 url = 'http://www.jianshu.com/u/73632348f37a'

 html = getHtml(url)

 getTitleLink(html)

测试发现如果作者文章只有五六篇，能正确生成。

但是如果文章20篇以上，发现问题：

这种办法只爬取了当前页面加载的文章链接，手工拖拽滚动条动态加载的标题内容无法直接获取到，网上建议用selenium来解决

思路二：采用selenium打开网页，调用js模拟鼠标点击滚动条，加载全部页面

步骤：

1. 使用selenium打开网页

2. 循环调用js模拟鼠标点击下拉滚动条，直至加载全部页面

3. 使用find_elements_by_xpath查找标题tag

4. 将标题tag解析后写入目录并打印

注：步骤3获取的为WebElement 类型对象

 #coding=utf-8

 #refer to http://www.cnblogs.com/haigege/p/5492177.html

 #Step1: scroll and generate Markdown format Menu

 from selenium import webdriver

 import time

 def scroll_top(driver):

     if driver.name == "chrome":

         js = "var q=document.body.scrollTop=0"

     else:

         js = "var q=document.documentElement.scrollTop=0"

     return driver.execute_script(js)

 # 拉到底部

 def scroll_foot(driver):

     if driver.name == "chrome":

         js = "var q=document.body.scrollTop=100000"

     else:

         js = "var q=document.documentElement.scrollTop=100000"

     return driver.execute_script(js)

 def write_text(filename, info):

     """

     :param info: 要写入txt的文本内容

     :return: none

     """

     # 创建/打开info.txt文件，并写入内容

     with open(filename, 'a+') as fp:

         fp.write(info.encode('utf-8'))

         fp.write('\n'.encode('utf-8'))

         fp.write('\n'.encode('utf-8'))

 def sroll_multi(driver,times=5,loopsleep=2):

     #40 titles about 3 times

     for i in range(times):

         time.sleep(loopsleep)

         print "Scroll foot %s time..." % i

         scroll_foot(driver)

     time.sleep(loopsleep)

 #Note: titles is titles_WebElement type object

 def write_menu(filename,titles):

     with open(filename, 'w') as fp:

         pass

     for title in titles:

         if r'目录' not in title.text:

             print "[" + title.text + "](" + title.get_attribute("href") + ")"

             t = title.text.encode('utf-8')

             t = title.text.replace(":", "：")

             t = title.text.replace("|", "丨")

             t = title.text.decode('utf-8')

             write_text(filename, "[" + t + "](" + title.get_attribute("href") + ")")

             #assert type(title) == "WebElement"

             #print type(title)

 def main(url):

     # eg. <a class="title" href="/p/6f543f43aaec" target="_blank"> titleXXX</a>

     driver = webdriver.Firefox()

     driver.implicitly_wait(10)

     # driver.maximize_window()

     driver.get(url)

     sroll_multi(driver)

     titles = driver.find_elements_by_xpath('.//a[@class="title"]|.//a[target="_blank"]')

     write_menu(filename, titles)

 if __name__ == '__main__':

     # sample link

     url = 'http://www.jianshu.com/u/73632348f37a'

     filename = r'info.txt'

     main(url)

注：

1. 参考链接： http://www.cnblogs.com/haigege/p/5492177.html

2. 环境下载:Firefox45: https://ftp.mozilla.org/pub/firefox/releases/45.0esr/win64/en-US/

3. 如果编码格式报错，添加

reload(sys)

sys.setdefaultencoding('utf8')

[Selenium2+python2.7][Scrap]爬虫和selenium方式下拉滚动条获取简书作者目录并且生成Markdown格式目录的更多相关文章

selenium操作下拉滚动条的几种方法
数据采集中,经常遇到动态加载的数据,我们经常使用selenium模拟浏览器操作,需要多次下拉刷新页面才能采集到所有的数据,就此总结了几种selenium操作下拉滚动条的几种方法我这里演示的是Java ...
python中selenium操作下拉滚动条方法汇总
UI自动化中经常会遇到元素识别不到,找不到的问题,原因有很多,比如不在iframe里,xpath或id写错了等等:但有一种是在当前显示的页面元素不可见,拖动下拉条后元素就出来了. 比如下面这样一个网页 ...
python中selenium操作下拉滚动条方法
场景:在当前显示的页面元素不可见,拖动下拉条后元素就出来了. 解决方法: 在python中有几种方法解决这种问题,简单介绍下,给需要的人: 方法一)使用js脚本直接操作,方法如下: #将页面滚动条拖到 ...
[Python爬虫] Selenium +phantomjs 模拟下拉滚动条
在爬虫中,有时会遇到这种情况,数据的展示是不是一页一页的,而是通过不断的下拉滚动条来加载数据.例如一点咨询(http://www.yidianzixun.com/)和微博(在未登录的状态下:http: ...
selenium的下拉选择框
今天总结下selenium的下拉选择框.我们通常会遇到两种下拉框,一种使用的是html的标签select,另一种是使用input标签做的假下拉框. 后者我们通常的处理方式与其他的元素类似,点击或使用J ...
selenium之下拉选择框Select
今天总结下selenium的下拉选择框.我们通常会遇到两种下拉框,一种使用的是html的标签select,另一种是使用input标签做的假下拉框. 后者我们通常的处理方式与其他的元素类似,点击或使用J ...
Java+selenium 如何下拉移动滚动条【实战】
一.场景:在编写脚本过程中需要定位的元素,在界面的底部,需要拖拽下拉滚动条,再进行定位元素. 实现思路:用Selenium 里面的 scrollTo 方法实现二.脚本示例: 1. 用例设计 @The ...
selenium下拉滚动条
selenium下拉滚动条制作人:全心全意谷歌浏览器下拉滚动条 chrome = webdriver.Chrome() //创建谷歌浏览器对象 url="http://www.baidu ...
自动化测试-11.selenium的下拉框处理类Select
前言最近由于工作原因,更新慢了一点,今天终于抽出一点时间给大家继续更新selenium系列,学习的脚本不能停止,希望小伙伴能多多支持. 本篇以百度设置下拉选项框为案例,详细介绍select下拉框相关 ...

随机推荐

NodeJs本地搭建服务器，模拟接口请求，获取json数据
最近在学习Node.js,虽然就感觉学了点皮毛,感觉这个语言还不错,并且也会一步步慢慢的学着的,这里实现下NodeJs本地搭建服务器,模拟接口请求,获取json数据. 具体的使用我就不写了,这个博客写 ...
centos7.5安装图形界面
1.centos7.4安装图形界面 yum check-update && yum install epel-release && yum groupinstall & ...
gunicorn的log如何传递给django，由django管理
gunicorn配置文件为gunicorn_config.py里面有日志的配置 # errorlog = '/home/admin/output/erebus/logs/gunicorn_error. ...
Win10利用CodeBlocks搭建Objective-C开发环境（二）
工程文件已经建好:但此时会发现main.m文件为灰色,且无法点击,此时需右键点击main.m文件,在option选项中勾选 compile file和 link file选项. 设置完成后,双击mai ...
charles 白名单
本文参考:charles 白名单 charles 白名单白名单工具,允许您阻止除选定位置之外的所有请求. 注意:如果一个请求与"黑名单"和"白名单"同时匹配成 ...
Java中用FileInputStream和FileOutputStream读写txt文件，文件内容乱码的问题，另附循环代码小错误
乱码问题大概就是编码格式不一样,搜了很多都是这么说的,修改编码解决乱码问题链接: https://blog.csdn.net/weixin_42496466/article/details/81189 ...
js中实现base64加密、解密
//base64加密解密 /* //1.加密 var result = Base.encode('125中文'); //--> "MTI15Lit5paH" //2.解密 ...
记：联调安卓设备的神药-无需usb数据线即可直连
前言最近需要调试公司的安卓服务,正常情况下,我们调试都是减安卓设备通过usb连接在我们座位旁,再不济就是我们扛笔记本到硬件旁边,这样调试屡试不爽,但是有一天你突然发现你带的数据线因为各种原因总是终端 ...
通过 Spring Session 实现新一代的 Session 管理
长期以来,session 管理就是企业级 Java 中的一部分,以致于我们潜意识就认为它是已经解决的问题,在最近的记忆中,我们没有看到这个领域有很大的革新. 但是,现代的趋势是微服务以及可水平扩展的原 ...
【CodeForces】1172E. Nauuo and ODT
题解看了一遍题解(以及代码)但是没写代码-- 后来做梦的时候忽然梦到了这道题--意识到我需要补一下-- 这道题就是,对于每种颜色,把没有染成这种颜色的点标成黑点,然后计算每个联通块的平方然后每个点 ...

[Selenium2+python2.7][Scrap]爬虫和selenium方式下拉滚动条获取简书作者目录并且生成Markdown格式目录

[Selenium2+python2.7][Scrap]爬虫和selenium方式下拉滚动条获取简书作者目录并且生成Markdown格式目录的更多相关文章

随机推荐

热门专题