展开阅读全文 js 爬虫操作

from selenium import webdriver

import time

import random

from bs4 import *

browser = webdriver.Chrome()

url = 'https://so.gushiwen.org/shiwenv_ee16df5673bc.aspx'

browser.get(url)

ck_l_ori_len = len(browser.find_elements_by_link_text('展开阅读全文 ∨'))

ck_l_ori_ok = 0

try:

    for isc in range(100):

        if ck_l_ori_ok == ck_l_ori_len:

            break

        time.sleep(1)

        js = 'window.scrollTo(0,document.body.scrollHeight)'

        js = 'window.scrollTo(0,100*{})'.format(isc)

        browser.execute_script(js)

        ck_l = browser.find_elements_by_link_text('展开阅读全文 ∨')

        for i in ck_l:

            try:

                i.click()

                ck_l_ori_ok += 1

            except Exception as e:

                print(e)

except Exception as e:

    print('window.scrollTo-->', e)

# ck_l=browser.find_elements_by_link_text('展开阅读全文 ∨')

# for i in ck_l:

#     try:

#         i.click()

#     except Exception as e:

#         print(e)

xp_l = ['//*[@id="fanyi967"]/div/div[3]/a', ]

myhtml = 'D:\\myhtml\\{}gushiwen.tmp.html'.format(random.randint(123, 999))

with open(myhtml, 'w', encoding='utf-8') as fw:

    fw.write(browser.page_source)

sql = 'INSERT INTO parent_url (page_title,page_url,children_url) VALUES '

with open(myhtml, 'r', encoding='utf-8') as myhtml_o:

    bs = BeautifulSoup(myhtml_o, 'html.parser')

    dd = 9

a_=document.getElementsByTagName('a');le=a_.length;for(i=0;i<le;i++){if(a_[i].text=='展开阅读全文 ∨'){a_[i].click()}}

a_=document.getElementsByTagName('a');le=a_.length;for(i=0;i<le;i++){if(a_[i].text=='展开阅读全文 ∨'){try{a_[i].click()}catch(err){console.log(err)}}}

from selenium import webdriver

import time

import random

from bs4 import *

browser = webdriver.Chrome()

url = 'https://so.gushiwen.org/shiwenv_ee16df5673bc.aspx'

browser.get(url)

# ck_l_ori_len = len(browser.find_elements_by_link_text('展开阅读全文 ∨'))

# ck_l_ori_ok = 0

# try:

#     for isc in range(100):

#         if ck_l_ori_ok == ck_l_ori_len:

#             break

#         time.sleep(1)

#         js = 'window.scrollTo(0,document.body.scrollHeight)'

#         js = 'window.scrollTo(0,100*{})'.format(isc)

#         browser.execute_script(js)

#         ck_l = browser.find_elements_by_link_text('展开阅读全文 ∨')

#         for i in ck_l:

#             try:

#                 i.click()

#                 ck_l_ori_ok += 1

#             except Exception as e:

#                 print(e)

# except Exception as e:

#     print('window.scrollTo-->', e)

js = "a_=document.getElementsByTagName('a');le=a_.length;for(i=0;i<le;i++){if(a_[i].text=='展开阅读全文 ∨'){try{a_[i].click()}catch(err){console.log(err)}}}"

try:

    browser.execute_script(js)

except Exception as e:

    print(e)

    ck_l_ori_len = len(browser.find_elements_by_link_text('展开阅读全文 ∨'))

    ck_l_ori_ok = 0

    try:

        for isc in range(100):

            if ck_l_ori_ok == ck_l_ori_len:

                break

            time.sleep(1)

            js = 'window.scrollTo(0,document.body.scrollHeight)'

            js = 'window.scrollTo(0,100*{})'.format(isc)

            browser.execute_script(js)

            ck_l = browser.find_elements_by_link_text('展开阅读全文 ∨')

            for i in ck_l:

                try:

                    i.click()

                    ck_l_ori_ok += 1

                except Exception as e:

                    print(e)

    except Exception as e:

        print('window.scrollTo-->', e)

from selenium import webdriver

import time

import random

from bs4 import *

from pyquery import PyQuery as pq

browser = webdriver.Chrome()

url = 'https://so.gushiwen.org/shiwenv_ee16df5673bc.aspx'

browser.get(url)

js = "a_=document.getElementsByTagName('a');le=a_.length;for(i=0;i<le;i++){if(a_[i].text=='展开阅读全文 ∨'){try{a_[i].click()}catch(err){console.log(err)}}}"

try:

    browser.execute_script(js)

except Exception as e:

    print(e)

    ck_l_ori_len = len(browser.find_elements_by_link_text('展开阅读全文 ∨'))

    ck_l_ori_ok = 0

    try:

        for isc in range(100):

            if ck_l_ori_ok == ck_l_ori_len:

                break

            time.sleep(1)

            js = 'window.scrollTo(0,document.body.scrollHeight)'

            js = 'window.scrollTo(0,100*{})'.format(isc)

            browser.execute_script(js)

            ck_l = browser.find_elements_by_link_text('展开阅读全文 ∨')

            for i in ck_l:

                try:

                    i.click()

                    ck_l_ori_ok += 1

                except Exception as e:

                    print(e)

    except Exception as e:

        print('window.scrollTo-->', e)

doc = pq(browser.page_source)

pq_r_d = {'xmlns="http://www.w3.org/1999/xhtml"': ''}

r_k, r_v = 'xmlns="http://www.w3.org/1999/xhtml"', ''

article_ = doc('.left>:nth-child(2).sons>.cont>.contson').html().replace(r_k, r_v)

title_d = {'h1': doc('.left>:nth-child(2).sons>.cont>:nth-child(2)').html().replace(r_k, r_v)}

author_d = {'h3': doc('.left>:nth-child(2).sons>.cont>:nth-child(3)').text()}

translation_ = doc('.left>:nth-child(4)>.contyishang>:nth-child(2)').html().replace(r_k, r_v)

explanation_ = doc('.left>:nth-child(4)>.contyishang>:nth-child(3)').html().replace(r_k, r_v)

refer_ = doc('.left>:nth-child(4)>.cankao').html().replace(r_k, r_v)

author_img_url = doc('.left>.sonspic>.cont>.divimg>:nth-child(1)').html().split('src="')[-1].split('"')[0]

d = 4

展开阅读全文 js 爬虫操作的更多相关文章

JS脚本实现CSDN免登陆免关闭广告插件自动展开“阅读更多”内容
最近在CSDN查资料,总是弹出以下弹窗,然后就自动跳转到登录页面,蛋疼! 于是重新捣腾了一下,修改了原来的脚本,最新的脚本代码如下: 温馨提示:在打开CSDN页面后立刻执行以下脚本即可免登陆免关闭广告 ...
jquery实现点击展开列表同时隐藏其他列表 js 对象操作对象原型操作把一个对象A赋值给另一个对象B 并且对象B 修改不会影响 A对象
这篇文章主要介绍了jquery实现点击展开列表同时隐藏其他列表的方法,涉及jquery鼠标事件及节点的遍历与属性操作技巧,具有一定参考借鉴价值,需要的朋友可以参考下本文实例讲述了jquery实现点击 ...
Node.js爬虫-爬取慕课网课程信息
第一次学习Node.js爬虫,所以这时一个简单的爬虫,Node.js的好处就是可以并发的执行这个爬虫主要就是获取慕课网的课程信息,并把获得的信息存储到一个文件中,其中要用到cheerio库,它可以让 ...
吐槽CSDN--想钱想疯了--阅读全文需要关闭广告屏蔽
吐槽CSDN 想钱想疯了–阅读全文需要关闭广告屏蔽近来csdn开始主推博客皮肤升级,说白了就是有一套新的盈利模式,具体怎么操作呢: 1. 采用信息流方式,博客内容变成类似朋友圈.微博.知乎那样的信息 ...
页面循环绑定（变量污染问题），js面向对象编程（对象属性增删改查），js字符串操作，js数组操作
页面循环绑定(变量污染问题) var lis = document.querySelectorAll(".ul li") for ( var i = 0 ; i < lis. ...
CSDN不登录阅读全文（最新更新
CSDN真的烦...然而没卵用用stylus加两行css就行了: .article_content{height:auto!important} .hide-article-box{display: ...
vue实现文章内容过长点击阅读全文功能
直接上代码: html: <div class="bodyFont clearfloat" id="bodyFont" ref="bodyFon ...
js简单操作Cookie
贴一段js简单操作Cookie的代码: //获取指定名称的cookie的值 function getCookie(objName) { var arrStr = document.cookie.spl ...
使用HTML5的JS选择器操作页面中的元素
文件命名为:querySelector.html,可在Chrome浏览器中预览效果. 1 <!DOCTYPE html> 2 <html lang="en"> ...

随机推荐

vue开发调试工具vue-devtools安装
vue开发调试工具别人总结的非常好,所以直接把链接拿过来了,就当做个笔记了,也希望能帮到有需要的人,感谢“沉着前进”,来源(https://www.cnblogs.com/fighxp/p/78150 ...
(C/C++学习)17.bitset(位操作)
说明:bitset 就像 vector 一样,是 C++ 的一个类模板库,用来对一个数的二进制位进行管理.判断等操作,使用时需要包含头文件 #include<bitset>. 1.声明及定 ...
CSU 2018年12月月赛 B 2214: Sequence Magic
Description 有一个1到N的自然数序列1,2,3,...,N-1,N. 我们对它进行M次操作,每次操作将其中连续的一段区间 [Ai,Bi][Ai,Bi] (即第Ai个元素到第Bi个元素之间的 ...
笔试算法题（57）：基于堆的优先级队列实现和性能分析（Priority Queue based on Heap）
议题:基于堆的优先级队列(最大堆实现) 分析: 堆有序(Heap-Ordered):每个节点的键值大于等于该节点的所有孩子节点中的键值(如果有的话),而堆数据结构的所有节点都按照完全有序二叉树排.当 ...
树莓派 - 驱动hello
树莓派上Linux驱动,从hello world 开始 ... hello.c #include <linux/init.h> #include <linux/module.h> ...
error trying to exec 'cc1plus': execvp: 没有那个文件或目录
出现这个问题,有两种可能: 第一,你没有安装g++ 第二,你的gcc的版本和g++版本不相符合安装gcc和g++及一些依赖包 sudo apt-get install build-essential ...
Python之模块和包的创建与使用
一.模块的概念在计算机的开发过程中,随着程序代码越写越多,在一个文件里代码就越来越长,越来越不容易维护. 为了编写可维护的代码,我们把很多函数分组,放在不同的文件里面,这样,每个文件包含的代码就相对 ...
poj2325 大数除法+贪心
将输入的大数除以9 无法整除再除以 8,7,6,..2,如果可以整除就将除数记录,将商作为除数继续除9,8,...,3,2. 最后如果商为1 证明可以除尽将被除过的数从小到大输出即可 #includ ...
舒适的路线（codevs 1001）
题目描述 Description Z小镇是一个景色宜人的地方,吸引来自各地的观光客来此旅游观光.Z小镇附近共有N(1<N≤500)个景点(编号为1,2,3,…,N),这些景点被M(0<M≤ ...
hdu - 1565 方格取数(1) && 1569 方格取数(2) (最大点权独立集)
http://acm.hdu.edu.cn/showproblem.php?pid=1565 两道题只是数据范围不同,都是求的最大点权独立集. 我们可以把下标之和为奇数的分成一个集合,把下标之和为偶数 ...

展开阅读全文 js 爬虫操作

展开阅读全文 js 爬虫操作的更多相关文章

随机推荐

热门专题