基于EasyExcel的大数据量导入并去重

源码：https://gitee.com/antia11/excel-data-import-demo

背景：客户需要每周会将上传一个 Excel 数据文件，数据量单次为 20W 以上，作为其他模块和报表的基础数据。

客户需求分析：

数据量为 20W 条左右。
数据需要去重。
等待时间不能太长。
文件中会有错误数据存在，错误数据跳过不进入数据库。

注意点：

为提高导入速度，选择分批插入，每次插入 1000 条数据。
在读取数据时判断数据是否正确，不正确不插入。
对数据进行去重。

实现逻辑：

首先使用 EasyExcel 实现分批插入数据。
数据插入完成后，在数据库使用 SQL 的方式进行去重，避免内存溢出。

package com.antia1.demo.service;

import com.alibaba.excel.EasyExcel;

import com.antia1.demo.entity.ExcelDataEntity;

import com.antia1.demo.listener.ExcelDataListener;

import com.antia1.demo.mapper.ExcelDataMapper;

import com.antia1.demo.util.RespBean;

import lombok.extern.slf4j.Slf4j;

import org.springframework.beans.factory.annotation.Autowired;

import org.springframework.stereotype.Service;

import org.springframework.web.multipart.MultipartFile;

import java.io.IOException;

import java.util.Map;

/**

 * Author: anti

 * Date: 2022/7/23 16:13

 */

@Service

@Slf4j

public class ExcelDataService {

    @Autowired

    private ExcelDataMapper excelDataMapper;

    public RespBean importData(MultipartFile file) throws IOException {

        //0.获取数据库中的最大id

        Map<String, Object> idMap = excelDataMapper.getMaxId();

        int maxId = Integer.parseInt(idMap.get("maxId") + "");

        //1.读取excel

        EasyExcel.read(file.getInputStream(), ExcelDataEntity.class,new ExcelDataListener(excelDataMapper,maxId)).sheet().doRead();

        //2.开始去除重复数据

        log.debug("全部导入完成，开始进行数据去重");

        int count = excelDataMapper.deleteDuplicates();

        log.debug("去除重复数据:{}条",count);

        return RespBean.ok("导入完成");

    }

}

package com.antia1.demo.listener;

import com.alibaba.excel.context.AnalysisContext;

import com.alibaba.excel.event.AnalysisEventListener;

import com.antia1.demo.entity.ExcelDataEntity;

import com.antia1.demo.mapper.ExcelDataMapper;

import lombok.extern.slf4j.Slf4j;

import java.util.ArrayList;

import java.util.List;

/**

 * Author: anti

 * Date: 2022/7/23 16:10

 */

@Slf4j

public class ExcelDataListener extends AnalysisEventListener<ExcelDataEntity> {

    private static final int BATCH_COUNT = 1000;

    private List<ExcelDataEntity> list = new ArrayList<>();

    private ExcelDataMapper excelDataMapper;

    private int primaryKey;

    private int totalCount;

    public ExcelDataListener(ExcelDataMapper excelDataMapper, int primaryKey) {

        this.excelDataMapper = excelDataMapper;

        this.primaryKey = primaryKey;

    }

    @Override

    public void invoke(ExcelDataEntity excelDataEntity, AnalysisContext analysisContext) {

        primaryKey ++ ;

        excelDataEntity.setId(String.valueOf(primaryKey));

        list.add(excelDataEntity);

        if(list.size() >= BATCH_COUNT){

            saveData();

            list.clear();

        }

    }

    @Override

    public void doAfterAllAnalysed(AnalysisContext analysisContext) {

        saveData();

        System.out.println(String.format("数据同步完成,总数量为:%s",totalCount));

    }

    public void saveData(){

        if(list.size()>0){

            int count = excelDataMapper.insertBatch(list);

            totalCount += count;

        }

    }

}

<?xml version="1.0" encoding="UTF-8" ?>

<!DOCTYPE mapper

        PUBLIC "-//mybatis.org//DTD Mapper 3.0//EN"

        "http://mybatis.org/dtd/mybatis-3-mapper.dtd">

<mapper namespace="com.antia1.demo.mapper.ExcelDataMapper">

  <!--数据插入-->

  <insert id="insertBatch" parameterType="java.util.List">

    INSERT INTO `demo`.`tb_exceldata` (

    `id`,

    `code`,

    `desc`,

    `objectCode`,

    `projectCode`,

    `other`

    )

    VALUES

    <foreach collection="list" item="item" separator=",">

      (#{item.id}, #{item.code}, #{item.desc}, #{item.objectCode},#{item.projectCode},#{item.other})

    </foreach>

  </insert>

  <!--查询最大id-->

  <select id="getMaxId" resultType="java.util.Map">

    SELECT IFNULL(MAX(CAST(id AS SIGNED)),0) AS maxId FROM `demo`.`tb_exceldata`

  </select>

  <!--去除重复数据-->

  <delete id="deleteDuplicates">

    DELETE

    FROM

    `tb_exceldata`

    WHERE

    id NOT IN (

    SELECT

    t.id

    FROM

    ( SELECT MIN( id ) AS id FROM `tb_exceldata` GROUP BY `code`,`desc`,`objectCode`,`projectCode`,`other`) t

    )

  </delete>

</mapper>

基于EasyExcel的大数据量导入并去重的更多相关文章

Mysql 大数据量导入程序
Mysql 大数据量导入程序<?xml:namespace prefix = o ns = "urn:schemas-microsoft-com:office:office" ...
java excel大数据量导入导出与优化
package com.hundsun.ta.utils; import java.io.File; import java.io.FileOutputStream; import java.io.I ...
JAVA JDBC大数据量导入Mysql
转自https://blog.csdn.net/q6834850/article/details/73726707?tdsourcetag=s_pctim_aiomsg 采用JDBC批处理(开启事务. ...
【Java POI】POI基于事件驱动解析大数据量2007版本Excel，空值导致列错位问题
1.目前测试了20M的文件,可以读取. 2.支持单个工作表1万+的数据行数,耗时如图. 3.以下是关键地方处理的代码 //Accepts objects needed while parsing. / ...
SQL Server 使用bcp进行大数据量导出导入
转载:http://www.cnblogs.com/gaizai/archive/2010/04/17/1714389.html SQL Server的导出导入方式有: 在SQL Server中提供了 ...
使用OPENROWSET、Microsoft.ACE.OLEDB实现大数据量的高效导入
首先说明使用的环境是:java和Sqlserver. 最近公司需要进行大数据量的导入操作.原来使用的是Apache POI,虽然可以实现功能,但是因为逻辑处理中需要进行许多校验,处理速度太慢,使用多线 ...
MYSQL数据库导入大数据量sql文件失败的解决方案
1.在讨论这个问题之前首先介绍一下什么是"大数据量sql文件". 导出sql文件.选择数据库-----右击选择"转储SQL文件"-----选择"结构和 ...
MySQL数据库如何解决大数据量存储问题
利用MySQL数据库如何解决大数据量存储问题? 各位高手您们好,我最近接手公司里一个比较棘手的问题,关于如何利用MySQL存储大数据量的问题,主要是数据库中的两张历史数据表,一张模拟量历史数据和一张开 ...
利用MySQL数据库如何解决大数据量存储问题？
提问:如何设计或优化千万级别的大表?此外无其他信息,个人觉得这个话题有点范,就只好简单说下该如何做,对于一个存储设计,必须考虑业务特点,收集的信息如下:1.数据的容量:1-3年内会大概多少条数据,每条 ...

随机推荐

Spring 源码（9）Spring Bean的创建过程的前期准备
回顾总结到目前为止,Spring源码中AbstractApplicationContext#refresh方法的已经解读到第11个方法finishBeanFactoryInitialization, ...
js项目案例
2021.04.12 --mouseover抖动情况之一
linux下运行crm
linux下运行crm 1.从windows把crm代码拷贝到linux服务器上 2.学习virtualenvwrapper工具升级版 1.安装 pip3 install virtualenvwrap ...
python二分法、牛顿法求根
二分法求根思路:对于一个连续函数,左值f(a)*右值f(b)如果<0,那么在这个区间内[a,b]必存在一个c使得f(c)=0 那么思路便是取中间点,分成两段区间,然后对这两段区间分别再比较,跳 ...
824. Goat Latin - LeetCode
Questioin 824. Goat Latin Solution 题目大意:根据要求翻译句子思路:转换成单词数组,遍历数组,根据要求转换单词 Java实现: 用Java8的流实现,效率太低 pu ...
linxu篇-centos搭建ftp服务器
1安装vsftpd 2备份配置文件 3修改配置文件 vi /etc/vsftpd/vsftpd.conf anonymous_enable=NO #允许匿名用户访问为了安全选择关闭 local_ena ...
用Repo管理自己的本地仓库
AOSP使用Repo工具管理项目源码.而Repo工具则依赖一个名叫manifest的git仓库来记录Android源码中都包含哪些子仓库. 进入Android源码根目录下的.repo目录,可以看到ma ...
开源LIMS系统miso LIMS（适用于NGS基因测序）
开源地址 https://github.com/miso-lims/miso-lims github加速可使用:https://kfqbvpat.fast-github.tk/-----https:/ ...
einsum函数介绍-张量常用操作
einsum函数说明 pytorch文档说明:\(torch.einsum(equation, **operands)\) 使用基于爱因斯坦求和约定的符号,将输入operands的元素沿指定的维数求和 ...
spring boot 在控制台打印banner
转自 SpringBoot系列--花里胡哨的banner.txt - huanzi-qch - 博客园 (cnblogs.com) <div id="cnblogs_post_body ...

基于EasyExcel的大数据量导入并去重

客户需求分析：

注意点：

实现逻辑：

基于EasyExcel的大数据量导入并去重的更多相关文章

随机推荐

热门专题