scrapy爬取简书整站文章

在这里我们使用CrawlSpider爬虫模板，通过其过滤规则进行抓取，并将抓取后的结果存入mysql中，下面直接上代码：

jianshu_spider.py

 # -*- coding: utf-8 -*-

 import scrapy

 from scrapy.linkextractors import LinkExtractor

 from scrapy.spiders import CrawlSpider, Rule

 from jianshu.items import JianshuItem

 import html

 class JianshuSpiderSpider(CrawlSpider):

     name = 'jianshu_spider'

     allowed_domains = ['jianshu.com']

     start_urls = ['http://jianshu.com/']

     rules = (

         Rule(LinkExtractor(allow=r'.*/p/[0-9a-z]{12}.*'), callback='parse_article', follow=True),

     )

     def parse_article(self, response):

         article_code = response.url.split("?")[0].split("/")[-1]

         title = response.xpath('//h1[@class="title"]/text()').get().strip()

         author = response.xpath('//div[contains(@class, "author")]/div[@class="info"]//span[@class="name"]/a/text()').get().strip()

         head_img = response.xpath('//div[contains(@class, "author")]/a[@class="avatar"]/img/@src').get()

         pub_time = response.xpath('//span[@class="publish-time"]/text()').get().strip().replace('*','')

         head_img_url = "http:{}".format(head_img)

         # 存储到数据库中，需要对‘/’转义

         # content = html.escape(response.xpath('//div[@class="show-content"]').get())

         content = response.xpath('//div[@class="show-content"]').get()

         yield JianshuItem(

             article_code = article_code,

             title = title,

             author = author,

             head_img_url = head_img_url,

             content = content,

             pub_time = pub_time,)

items.py

# -*- coding: utf-8 -*-

# Define here the models for your scraped items

#

# See documentation in:

# https://doc.scrapy.org/en/latest/topics/items.html

import scrapy

class JianshuItem(scrapy.Item):

    # define the fields for your item here like:

    # name = scrapy.Field()

    article_code = scrapy.Field()

    title = scrapy.Field()

    author = scrapy.Field()

    pub_time = scrapy.Field()

    head_img_url = scrapy.Field()

    content = scrapy.Field()

pipelines.py

# -*- coding: utf-8 -*-

# Define your item pipelines here

#

# Don't forget to add your pipeline to the ITEM_PIPELINES setting

# See: https://doc.scrapy.org/en/latest/topics/item-pipeline.html

from jianshu import model

class JianshuPipeline(object):

    def __init__(self):

        self.session = model.DBSession()

    def process_item(self, item, spider):

        # 这里的item属于字典类型

        article = model.Article(**item)

        try:

            self.session.add(article)

            self.session.commit()

        except Exception as e:

            print("="*100)

            print("INSERT ERROR!")

            self.session.rollback()

        return item

    def open_spider(self, spider):

        pass

    def close_spider(self, spider):

        self.session.close()

model.py

from sqlalchemy import create_engine

from sqlalchemy.ext.declarative import declarative_base

from sqlalchemy import String, Text, Time, Column, Integer, VARCHAR

from sqlalchemy.orm import sessionmaker

# 创建数据库链接接口

engine = create_engine("mysql+pymysql://jianshu:jianshu@localhost:3306/jianshu?charset=utf8mb4", echo=False)

# 声明映像， 即实际数据库表的基本准则的映射类

# 其维持类和数据库表关系目录

Base = declarative_base()

class Article(Base):

    __tablename__ = "jianshu_article"

    id = Column(Integer, autoincrement=True, primary_key=True)

    article_code = Column(String(16), nullable=False)

    title = Column(Text)

    author = Column(String(16))

    pub_time = Column(Time)

    head_img_url = Column(VARCHAR(256))

    content = Column(Text)

DBSession = sessionmaker(bind=engine)

if __name__ == '__main__':

    Base.metadata.create_all(engine)

scrapy爬取简书整站文章的更多相关文章

python2.7 爬取简书30日热门专题文章之简单分析_20170207
昨天在简书上写了用Scrapy抓取简书30日热门文章,对scrapy是刚接触,跨页面抓取以及在pipelines里调用settings,连接mysql等还不是很熟悉,今天依旧以单独的py文件区去抓取数 ...
Scrapy+selenium爬取简书全站
Scrapy+selenium爬取简书全站环境 Ubuntu 18.04 Python 3.8 Scrapy 2.1 爬取内容文字标题作者作者头像发布日期内容文章连接文章ID 思路分 ...
Node爬取简书首页文章
Node爬取简书首页文章博主刚学node,打算写个爬虫练练手,这次的爬虫目标是简书的首页文章流程分析使用superagent发送http请求到服务端,获取HTML文本用cheerio解析获得的 ...
python3 爬取简书30日热门，同时存储到txt与mongodb中
初学python,记录学习过程. 新上榜,七日热门等同理. 此次主要为了学习python中对mongodb的操作,顺便巩固requests与BeautifulSoup. 点击,得到URL https: ...
Python爬取简书主页信息
主要学习如何通过抓包工具分析简书的Ajax加载,有时间再写一个Multithread proxy spider提升效率. 1. 关键点: 使用单线程爬取,未登录,爬取简书主页Ajax加载的内容.主要有 ...
Scrapy爬取伯乐在线的所有文章
本篇文章将从搭建虚拟环境开始,爬取伯乐在线上的所有文章的数据. 搭建虚拟环境之前需要配置环境变量,该环境变量的变量值为虚拟环境的存放目录 1. 配置环境变量 2.创建虚拟环境用mkvirtualen ...
【python3】爬取简书评论生成词云
一.起因: 昨天在简书上看到这么一篇文章<中国的父母,大都有毛病>,看完之后个人是比较认同作者的观点. 不过,翻了下评论,发现评论区争议颇大,基本两极化.好奇,想看看整体的评论是个什么样, ...
爬取简书图片(使用BeautifulSoup)
import requests from bs4 import BeautifulSoup url_list = [] kv = {'User-Agent':'Mozilla/5.0'} r = re ...
python 爬取简书评论
import json import requests from lxml import etree from time import sleep url = "https://www.ji ...

随机推荐

【SQL】从待选项中随机选一个
由于SQL Server没有数组类型,所以在面对“从若干待选项中选一个”这种需求时,往往要采取变通办法,比如弄个‘a|b|c’这样的字符串然后对字符串进行处理:又或者把待选项塞进一个临时表,然后把问题 ...
在reset css后两个input之间还是出现默认间隔的问题。
<div class="search_box fl"> <input type="text" class="search_text& ...
虚拟机下安装 CentOS 7 的几个小问题
※ 网络问题(Destination Host Unreachable) 安装时网络选择的"桥接"模式, 安装完毕,并配置IP地址后,发现只能ping通自己,局域网内的其他IP无法 ...
使用过Fetch之后，你还想使用AJAX吗
之前做数据交互的时候,请求数据一直使用ajax,看到网上有使用Fetch,所以也想拿来尝尝鲜本次介绍只涉及fetch相关,传统的ajax基本上不涉及当然你也要考虑兼容.浏览器支持情况. 一会这个只 ...
iOS Programming Subclassing UITableViewCell
iOS Programming Subclassing UITableViewCell 1.Creating BNRItemCell UITableViewCell is a UIView subc ...
tomcat添加访问的ip限制
在如下位置添加如下代码: 代码: <Valve className="org.apache.catalina.valves.RemoteAddrValve" allow=&q ...
循环冗余校验（CRC）算法入门
http://blog.csdn.net/liyuanbhu/article/details/7882789 前言 CRC校验(循环冗余校验)是数据通讯中最常采用的校验方式.在嵌入式软件开发中,经常要 ...
CAD交互绘制圆弧（com接口）
在CAD设计时,需要绘制圆弧,用户可以在图面点圆弧起点,圆弧上的一点和圆弧的终点,这样就绘制出圆弧. 主要用到函数说明: _DMxDrawX::DrawArc2 由圆弧上的三点绘制一个圆弧.详细说明如 ...
vue的[__ob__: Observer]
为什么会获取不到里面的值因为:vue data 里面值都是有这个属性的.这是被vue接管的数据,observer是Vue核心中最重要的一个模块(个人认为),能够实现视图与数据的响应式更新,底层全凭o ...
vue列表排序实现中的this问题
最近在看vue框架的知识,然后其中有个例子中的this的写法让我很疑惑 <!DOCTYPE html> <html> <head> <meta charset ...

scrapy爬取简书整站文章

在这里我们使用CrawlSpider爬虫模板， 通过其过滤规则进行抓取， 并将抓取后的结果存入mysql中，下面直接上代码：

scrapy爬取简书整站文章的更多相关文章

随机推荐

热门专题

在这里我们使用CrawlSpider爬虫模板，通过其过滤规则进行抓取，并将抓取后的结果存入mysql中，下面直接上代码：