如何将爬取的数据写入ES中

前面章节一直在说ES相关知识点，现在是如何实现将爬取到的数据写入到ES中，首先的知道ES的python接口叫elasticsearch dsl

链接：https://github.com/elastic/elasticsearch-dsl-py

什么是elasticsearch dsl:

Elasticsearch DSL是一个高级库，其目的是帮助编写和运行针对Elasticsearch的查询

安装：

pip install elasticsearch-dsl

首先我们在项目文件中新建一个名为models的包，然后在包里新建一个名为es.types.py的文件，用于定义ES的数据的定义

# !/usr/bin/env python

# -*- coding:utf-8 -*-

from datetime import datetime

from elasticsearch_dsl import  Date,DocType,Text,Integer,analyzer,Completion,Keyword,Integer

from elasticsearch_dsl.connections import connections

connections.create_connection(hosts=["localhost"])

class ActicleType(DocType):

      #伯乐在线文章类型

      title = Text(analyzer ="ik_max_word")

      create_date = Date()

      url = Keyword()

      url_object_id = Keyword()

      front_image_url = Keyword()

      front_image_path = Keyword()

      praise_nums = Integer()

      comment_nums = Integer()

      fav_nums = Integer()

      tags = Text(analyzer="ik_max_word")

      content = Text(analyzer="ik_max_word")

      class Meta:

            index = "jobbile"

            doc_type = "article"

if __name__=="__main__":

      ActicleType.init()

然后再items中编写如下文件：

# !/usr/bin/env python

# -*- coding:utf-8 -*-

from models.es_types import ArticleType

def save_to_es(self):

    artcle = ArticleType()

    artcle.title = self['title']

    artcle.cteate_date = self['cteate_date']

    artcle.content = remove_tags(self['content'])

    artcle.front_image_url = self['front_image']

    if "front_image_path" in self:

        artcle.front_image_path = self['front_image_path']

    artcle.praise_nums = self['praise_nums']

    artcle.fav_nums = self['fav_nums']

    artcle.comment_nums = self['comment_nums']

    artcle.url = self['url']

    artcle.tags = self['tags']

    artcle.meta.id = self['url_object_id']

    artcle.save()

    return

然后再pipeline中编写如下文件：

# !/usr/bin/env python

# -*- coding:utf-8 -*-

from models.es_types import ArticleType

from w3lib.html import remove_tags

class ElasticsearchPipeline(object):

    #将数据写入到es中

    def process_item(self,item,spider):

        #将item转换为es数据

        item.save_to_es()

        return item

最后再settings中编写如下文件：

# !/usr/bin/env python

# -*- coding:utf-8 -*-

ITEM_PIPELINES = {

   'ArticleSpider.pipelines.ElasticsearchPipeline': 300,

}

如何将爬取的数据写入ES中的更多相关文章

使用webdriver+urllib爬取网页数据(模拟登陆，过验证码)
urilib是python的标准库,当我们使用Python爬取网页数据时,往往用的是urllib模块,通过调用urllib模块的urlopen(url)方法返回网页对象,并使用read()方法获得ur ...
python爬取拉勾网数据并进行数据可视化
爬取拉勾网关于python职位相关的数据信息,并将爬取的数据已csv各式存入文件,然后对csv文件相关字段的数据进行清洗,并对数据可视化展示,包括柱状图展示.直方图展示.词云展示等并根据可视化的数据做 ...
python爬虫爬取天气数据并图形化显示
前言使用python进行网页数据的爬取现在已经很常见了,而对天气数据的爬取更是入门级的新手操作,很多人学习爬虫都从天气开始,本文便是介绍了从中国天气网爬取天气数据,能够实现输入想要查询的城市,返回该 ...
MATLAB爬虫爬取股票数据
近年来,大数据盛行,有关爬虫的教程层次不穷.那么,爬虫到底是什么呢? 什么是爬虫? 百度百科是这样定义的: 网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种 ...
python之爬取网页数据总结（一）
今天尝试使用python,爬取网页数据.因为python是新安装好的,所以要正常运行爬取数据的代码需要提前安装插件.分别为requests Beautifulsoup4 lxml 三个插件 ...
吴裕雄--天生自然PYTHON爬虫：安装配置MongoDBy和爬取天气数据并清洗保存到MongoDB中
1.下载MongoDB 官网下载:https://www.mongodb.com/download-center#community 上面这张图选择第二个按钮上面这张图直接Next 把bin路径添加 ...
scrapy架构与目录介绍、scrapy解析数据、配置相关、全站爬取cnblogs数据、存储数据、爬虫中间件、加代理、加header、集成selenium
今日内容概要 scrapy架构和目录介绍 scrapy解析数据 setting中相关配置全站爬取cnblgos文章存储数据爬虫中间件和下载中间件加代理,加header,集成selenium 内 ...
毕设之Python爬取天气数据及可视化分析
写在前面的一些P话:(https://jq.qq.com/?_wv=1027&k=RFkfeU8j) 天气预报我们每天都会关注,我们可以根据未来的天气增减衣物.安排出行,每天的气温.风速风向. ...
Node.js爬取豆瓣数据
一直自以为自己vue还可以,一直自以为webpack还可以,今天在慕课逛node的时候,才发现,自己还差的很远.众所周知,vue-cli基于webpack,而webpack基于node,对node不了 ...

随机推荐

ios --指纹TouchID
最近在做一套登录系统,包括指纹登录.手势登录以及账号密码登录,在此简单记录一下指纹的处理逻辑. 指纹处理: 1.处理iOS 9.0之后,指纹被锁不会自动弹出密码解锁的情况: 2.处理iOS 10.*系 ...
【常用配置】Spring框架web.xml通用配置
<web-app xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xmlns="http://java. ...
海西 · 云交付 DevOps实践落地方案
一.背景概述 (一)产品背景 1.互联网+的需要在信息越来越繁杂的互联网时代,公司所运行的项目越来越多,项目相关服务繁多,服务之间存在复杂的依赖关系,运维与管理任务越来越繁重,手工交付需要花 ...
【代码笔记】Web-HTML-CSS
一,效果图. 二,代码. <!DOCTYPE html> <html> <head> <meta charset="utf-8"> ...
docker第一章：docker核心概念及centos6下安装
Docker三大核心概念镜像容器仓库镜像 docker镜像类似于虚拟机镜像,可以将它理解为一个面向Docker引擎的只读模板,包含了文件系统. 容器 1.容器是从镜像创建的应用运行实例,容器和 ...
Java抽象类和接口的比较
一个软件设计的好坏,我想很大程度上取决于它的整体架构,而这个整体架构其实就是你对整个宏观商业业务的抽象框架,当代表业务逻辑的高层抽象层结构合理时,你底层的具体实现需要考虑的就仅仅是一些算法和一些具体 ...
SG Input 软件安全分析之逆向分析
前言通过本文介绍怎么对一个 windows 程序进行安全分析.分析的软件版本为 2018-10-9 , 所有相关文件的链接链接:https://pan.baidu.com/s/1l6BuuL-HP ...
Android事件总线（一）EventBus3.0用法全解析
前言 EventBus是一款针对Android优化的发布/订阅事件总线.简化了应用程序内各组件间.组件与后台线程间的通信.优点是开销小,代码更优雅,以及将发送者和接收者解耦.如果Activity和Ac ...
SpringMVC的启动
Spring MVC中的Servlet Spring MVC中Servlet一共有三个层次,分别是HttpServletBean.FrameworkServlet和DispatcherServlet. ...
使用katalon自带Spy功能获取/验证控件Selector、XPath
背景最近刚接手一个katalon编写的UI自动化项目,页面最近刚改版,已有用例很多查找元素失败.了解到katalon元素定位支持xpath,所以直接使用chrome开发者工具打开目标页面+获取xpa ...

如何将爬取的数据写入ES中

如何将爬取的数据写入ES中的更多相关文章

随机推荐

热门专题