# -*- coding: utf-8 -*-
import scrapy
import json
import os
import urllib
import time from scrapy.http import Request
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.common.exceptions import (
TimeoutException,
WebDriverException,
NoSuchElementException,
StaleElementReferenceException
) def gen_browser(driver_path):
'''实例化一个driver'''
options = webdriver.ChromeOptions()
options.add_argument("--headless")
options.add_argument('--no-sandbox')
options.add_argument('--disable-gpu')
options.add_argument('--ignore-certificate-errors')
options.add_argument('disable-infobars')
options.add_argument("--disable-plugins-discovery")
user_agent = "Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.99 Safari/537.36"
options.add_argument('user-agent="{0}"'.format(user_agent))
# ############### 专业造假 *************************** def send(driver, cmd, params={}):
'''
向调试工具发送指令
from: https://stackoverflow.com/questions/47297877/to-set-mutationobserver-how-to-inject-javascript-before-page-loading-using-sele/47298910#47298910
'''
resource = "/session/%s/chromium/send_command_and_get_result" % driver.session_id
url = driver.command_executor._url + resource
body = json.dumps({'cmd': cmd, 'params': params})
response = driver.command_executor._request('POST', url, body)
if response['status']:
raise Exception(response.get('value'))
return response.get('value') def add_script(driver, script):
'''在页面加载前执行js'''
send(driver, "Page.addScriptToEvaluateOnNewDocument", {"source": script})
# 给 webdriver.Chrome 添加一个名为 add_script 的方法
webdriver.Chrome.add_script = add_script # 这里(webdriver.Chrome)可能需要改,当调用不同的驱动时
# *************** 专业造假 ###################
browser = webdriver.Chrome(
executable_path=driver_path,
chrome_options=options
)
# ################## 辅助调试 *********************
existed = {
'executor_url': browser.command_executor._url, # 浏览器可被远程连接调用的地址
'session_id': browser.session_id # 浏览器会话ID
}
print(existed)
# ********************* 辅助调试 ##################
# ############### 专业造假 ***************************
browser.add_script("""
Object.defineProperty(navigator, 'webdriver', {
get: () => false,
});
window.navigator.chrome = {
runtime: {},
};
Object.defineProperty(navigator, 'languages', {
get: () => ['zh-CN', 'zh']
});
Object.defineProperty(navigator, 'plugins', {
get: () => [0, 1, 2],
});
""")
# *************** 专业造假 ###################
return browser class XuexingSpider(scrapy.Spider):
name = 'xuexing'
allowed_domains = ['www.manhuatai.com']
start_urls = ['https://www.mh1234.com/wap/comic/9683/262424.html'] def parse(self, response):
driver_path = self.settings.get('DRIVER_PATH')
# import ipdb; ipdb.set_trace()
browser = gen_browser(driver_path)
# 获取当前章节名
next_url = response.url
i = 0
while bool(next_url):
i += 1
print(str(i).center(60, '*'))
next_url = self.get_item(browser, next_url) def get_item(self, browser, url=None):
if url is not None:
browser.get(url) # 打开页面
van1 = browser.find_elements_by_xpath('//a[@class="BarTit"]')
van = van1[0].text.split('(')[0].strip()
if '/' in van:
van = '-'.join(van.split('/'))
# import ipdb; ipdb.set_trace()
if not os.path.exists('斗罗大陆'):
os.mkdir('斗罗大陆')
if not os.path.exists(van):
os.mkdir(r'斗罗大陆/{0}'.format(van))
m = 0
_url = browser.find_element_by_xpath('//*[@id="qTcms_pic"]')
img_url = _url.get_attribute('src')
# 保存图片到指定路径
if img_url != None:
m += 1
#保存图片数据
data = urllib.request.urlopen(img_url).read()
f = open('斗罗大陆/{0}/{1}.jpg'.format(van, m), 'wb')
f.write(data)
f.close()
ye = int(browser.find_element_by_xpath('//*[@id="k_total"]').text)
for yei in range(1, ye):
time.sleep(0.5)
browser.find_element_by_xpath('//*[@id="action"]/ul/li[3]/a').click()
_url = browser.find_element_by_xpath('//*[@id="qTcms_pic"]')
img_url = _url.get_attribute('src')
# 保存图片到指定路径
if img_url != None:
m += 1
#保存图片数据
data = urllib.request.urlopen(img_url).read()
f = open('斗罗大陆/{0}/{1}.png'.format(van, m), 'wb')
f.write(data)
f.close() xia = browser.find_element_by_xpath('//*[@id="action"]/ul/li[4]/a').get_attribute('href')
return xia

scrapy 爬取斗罗大陆漫画的更多相关文章

  1. Scrapy爬取美女图片 (原创)

    有半个月没有更新了,最近确实有点忙.先是华为的比赛,接着实验室又有项目,然后又学习了一些新的知识,所以没有更新文章.为了表达我的歉意,我给大家来一波福利... 今天咱们说的是爬虫框架.之前我使用pyt ...

  2. 【转载】教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神

    原文:教你分分钟学会用python爬虫框架Scrapy爬取心目中的女神 本博文将带领你从入门到精通爬虫框架Scrapy,最终具备爬取任何网页的数据的能力.本文以校花网为例进行爬取,校花网:http:/ ...

  3. scrapy爬取西刺网站ip

    # scrapy爬取西刺网站ip # -*- coding: utf-8 -*- import scrapy from xici.items import XiciItem class Xicispi ...

  4. scrapy爬取豆瓣电影top250

    # -*- coding: utf-8 -*- # scrapy爬取豆瓣电影top250 import scrapy from douban.items import DoubanItem class ...

  5. scrapy爬取极客学院全部课程

    # -*- coding: utf-8 -*- # scrapy爬取极客学院全部课程 import scrapy from pyquery import PyQuery as pq from jike ...

  6. scrapy爬取全部知乎用户信息

    # -*- coding: utf-8 -*- # scrapy爬取全部知乎用户信息 # 1:是否遵守robbots_txt协议改为False # 2: 加入爬取所需的headers: user-ag ...

  7. Scrapy爬取Ajax(异步加载)网页实例——简书付费连载

    这两天学习了Scrapy爬虫框架的基本使用,练习的例子爬取的都是传统的直接加载完网页的内容,就想试试爬取用Ajax技术加载的网页. 这里以简书里的优选连载网页为例分享一下我的爬取过程. 网址为: ht ...

  8. Scrapy爬取静态页面

    Scrapy爬取静态页面 安装Scrapy框架: Scrapy是python下一个非常有用的一个爬虫框架 Pycharm下: 搜索Scrapy库添加进项目即可 终端下: #python2 sudo p ...

  9. 用scrapy爬取京东的数据

    本文目的是使用scrapy爬取京东上所有的手机数据,并将数据保存到MongoDB中. 一.项目介绍 主要目标 1.使用scrapy爬取京东上所有的手机数据 2.将爬取的数据存储到MongoDB 环境 ...

随机推荐

  1. peewee 通俗易懂版

    Peewee作为Python ORM之一 优势:简单,小巧,易学习,使用直观 不足之处:需要手动创建数据库 基本使用流程 1⃣️根据需求定义好Model(表结构类) 2⃣️通过create_table ...

  2. python-web自动化-Js-日历操作

    日历控件是web网站上经常会遇到的一个场景,有些输入框是可以直接输入日期的,有些不能:以12306网站为例,讲解如何解决日历控件为readonly属性的问题. 基本思路:先用js去掉readonly属 ...

  3. 爬虫之scrapy

    一.项目简单流程 1.创建项目 scrapy startproject 项目名 2.创建Spider cd 项目名 scrapy genspider 爬虫名 域名 class YokaSpider(s ...

  4. 201772020113 李清华《面向对象程序设计(java)》第十五周学习总结

    1.实验目的与要求 (1) 掌握Java应用程序的打包操作: (2) 了解应用程序存储配置信息的两种方法: (3) 掌握基于JNLP协议的java Web Start应用程序的发布方法: (5) 掌握 ...

  5. QT项目添加现有文件后不能运行,MFC在类视图中自动隐藏类

    解决方案:1)QT 5.6版本的QtCreator打开pro文件,在最后加一行空行或者删除一行空行,保存即可: 2)在隐藏的类对应的头文件中增加一行或删除一行(空格也可以),即可自动出现.

  6. windows安装composer

    Composer 是 PHP 的一个依赖管理工具(不是一个包管理器).它允许你申明项目所依赖的代码库,它会在你的项目中为你安装他们. 在windows下安装的方法 方法一:使用安装程序 这是将 Com ...

  7. JS数据类型之Number类型

    Number类型的转换及方法 var num = 10; num.toString() //"10"转字符串,参数表示几进制 num.toFixed(2) //10.00 自动舍入 ...

  8. tensorflow models api:ValueError: Tensor conversion requested dtype string for Tensor with dtype float32: 'Tensor("arg0:0", shape=(), dtype=float32, device=/device:CPU:0)'

    tensorflow models api:ValueError: Tensor conversion requested dtype string for Tensor with dtype flo ...

  9. winfrom中pictureBox控件的部分使用方法

    一.后台属性 1.pictureBox1.Image显示图片 2.pictureBox1.ImageLocation存储和提取图片路径 二.面板属性 1.Picturebox控件SizeMode属性 ...

  10. Game Engine Architecture 10

    [Game Engine Architecture 10] 1.Full-Screen Antialiasing (FSAA) also known as super-sampled antialia ...