ORACLE数据挖掘之 MSET-SPRT
虽然是熟悉的Oracle数据库,但关于机器学习、数据挖掘这方面的知识笔者起初也是不了解的,文中MSET相关设置来源于同事提供的sample,在测试过程中边查资料边学习吸收,也因此看到了别样的Oracle。
Oracle 的 MSET-SPRT 主要用于 高精度异常检测和预测性维护,尤其适用于关键业务系统,如数据库、存储、工业控制系统和数据中心运营环境。
MSET-SPRT翻译成中文是:多变量状态估计技术 - 序列概率比检验。
个人感觉这个名词翻译过来有些绕口.. 下面还是以英文简写词来代替。
在ORACLE官方文档中,是这样描述 MSET-SPRT 的:
The Multivariate State Estimation Technique - Sequential Probability Ratio Test (MSET-SPRT) algorithm monitors critical processes and detects subtle anomalies.
下面记录下MSET的测试过程,这里直接复用之前用于测试TPC-H的环境来验证:
- 1.新建测试表和配置表
- 2.创建构造测试数据的存储过程
- 3.模拟不同规模测试数据并插入
- 4.创建数据挖掘模型
- 5.查询预测结果
- 6.其他测试建议
1.新建测试表和配置表
这里只选择有实际意义的字段,构建TBL_IOT表:
CREATE TABLE "TPCH"."TBL_IOT"
("B1_T1" NUMBER(38,0),
"B1_T2" NUMBER(38,0),
"B1_T3" NUMBER(38,0),
"B2_T1" NUMBER(38,0),
"B2_T2" NUMBER(38,0),
"B2_T3" NUMBER(38,0),
"B3_T1" NUMBER(38,0),
"B3_T2" NUMBER(38,0),
"B3_T3" NUMBER(38,0),
"B4_T1" NUMBER(38,0),
"B4_T2" NUMBER(38,0),
"B4_T3" NUMBER(38,0),
"B5_T1" NUMBER(38,0),
"B5_T2" NUMBER(38,0),
"B5_T3" NUMBER(38,0),
"B6_T1" NUMBER(38,0),
"B6_T2" NUMBER(38,0),
"B6_T3" NUMBER(38,0),
"B7_T1" NUMBER(38,0),
"B7_T2" NUMBER(38,0),
"B7_T3" NUMBER(38,0),
"B8_T1" NUMBER(38,0),
"B8_T2" NUMBER(38,0),
"B8_T3" NUMBER(38,0),
"B9_T1" NUMBER(38,0),
"B9_T2" NUMBER(38,0),
"B9_T3" NUMBER(38,0),
"B10_T1" NUMBER(38,0),
"B10_T2" NUMBER(38,0),
"B10_T3" NUMBER(38,0),
"B11_T1" NUMBER(38,0),
"B11_T2" NUMBER(38,0),
"B11_T3" NUMBER(38,0),
"B12_T1" NUMBER(38,0),
"B12_T2" NUMBER(38,0),
"B12_T3" NUMBER(38,0),
"S" NUMBER(38,1),
"K_TS" TIMESTAMP (6)
);
创建 MSET_IOT_SETTINGS 表,用于存储数据挖掘算法的配置,插入 MSET-SPRT 算法的关键参数:
- 选择 MSET-SPRT 算法
- 开启自动数据准备
- 设置向量存储大小
- 设定 Alpha(假阳性)概率
- 设定异常警报阈值(次数 & 窗口大小)
-- Create setting table
CREATE TABLE MSET_IOT_SETTINGS(SETTING_NAME VARCHAR2(30),
SETTING_VALUE VARCHAR2(128));
-- Populate setting table
BEGIN
-- Select MSET-SPRT as the algorithm
INSERT INTO MSET_IOT_SETTINGS
VALUES(DBMS_DATA_MINING.ALGO_NAME,
DBMS_DATA_MINING.ALGO_MSET_SPRT);
-- Turn on automatic data preparation
INSERT INTO MSET_IOT_SETTINGS
VALUES(DBMS_DATA_MINING.PREP_AUTO,
DBMS_DATA_MINING.PREP_AUTO_ON);
-- Set memory vector
INSERT INTO MSET_IOT_SETTINGS
VALUES(DBMS_DATA_MINING.MSET_MEMORY_VECTORS, 100);
-- Set alpha
INSERT INTO MSET_IOT_SETTINGS
VALUES(DBMS_DATA_MINING.MSET_ALPHA_PROB, 0.1);
-- Set alert count
INSERT INTO MSET_IOT_SETTINGS
VALUES(DBMS_DATA_MINING.MSET_ALERT_COUNT, 3);
-- Set alert window
INSERT INTO MSET_IOT_SETTINGS
VALUES(DBMS_DATA_MINING.MSET_ALERT_WINDOW, 5);
-- Examples of other possible settings are:
-- (dbms_data_mining.mset_beta_prob, 0.1)
-- (dbms_data_mining.mset_adb_height, 0.01)
-- (dbms_data_mining.mset_std_tolerance, 3)
-- (dbms_data_mining.mset_heldaside, 500)
COMMIT;
END;
/
2.创建构造测试数据的存储过程
具体创建一个存储过程,传入行数作为参数,这样方便随时插入不同规模的数据。
这里模拟IOT场景,要求每秒一条数据。
插入数据前需要手工清空表,因为防止误操作,我没有将truncate表的高危命令直接写入到存储过程中,在执行存储过程之前,由人工来执行truncate表操作,用于插入数据的存储过程如下:
CREATE OR REPLACE PROCEDURE INSERT_IOT_DATA(p_total_rows IN NUMBER) AS
v_start_time TIMESTAMP := TO_TIMESTAMP('2025-03-01 00:00:00', 'YYYY-MM-DD HH24:MI:SS');
BEGIN
FOR i IN 1..p_total_rows LOOP
INSERT INTO TBL_IOT (
B1_T1, B1_T2, B1_T3, B2_T1, B2_T2, B2_T3, B3_T1, B3_T2, B3_T3,
B4_T1, B4_T2, B4_T3, B5_T1, B5_T2, B5_T3, B6_T1, B6_T2, B6_T3,
B7_T1, B7_T2, B7_T3, B8_T1, B8_T2, B8_T3, B9_T1, B9_T2, B9_T3,
B10_T1, B10_T2, B10_T3, B11_T1, B11_T2, B11_T3, B12_T1, B12_T2, B12_T3,
S, K_TS
) VALUES (
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55), DBMS_RANDOM.VALUE(50, 55),
DBMS_RANDOM.VALUE(2, 5),
v_start_time + INTERVAL '1' SECOND * i
);
IF MOD(i, 1000) = 0 THEN
COMMIT;
END IF;
END LOOP;
COMMIT;
END;
/
注意:这里构建数据我预期是插入50到55之间的随机整数,但使用DBMS_RANDOM.VALUE(50,55),实际随机是带小数的,但结果是符合预期的。这是因为当向 NUMBER(38,0) 类型的列插入带小数的数据时,Oracle 并不会报错,而是会自动截断小数部分,只保留整数部分。可手工验证数据是否符合预期。
3.模拟不同规模测试数据并插入
下面需要分别测试不同数据规模:86w、130w、260w。
插入不同规模的数据之前,需要手工truncate表:
-- 插入数据前,确保已清空表数据,高危操作手工执行:
truncate table TBL_IOT;
-- 按需求插入不同规模数据:
-- 插入86万行
EXEC INSERT_IOT_DATA(860000);
-- 插入130万行
EXEC INSERT_IOT_DATA(1300000);
-- 插入260万行
EXEC INSERT_IOT_DATA(2600000);
-- 查询表占用空间
select SEGMENT_NAME, BYTES / 1024 / 1024 "MB" from dba_segments where SEGMENT_NAME = 'TBL_IOT';
4.创建数据挖掘模型
创建数据挖掘模型IOTMSET_MODEL,如果之前存在就删除掉再创建:
-- 删除数据挖掘模型IOTMSET_MODEL
exec dbms_data_mining.drop_model('IOTMSET_MODEL');
-- 创建数据挖掘模型IOTMSET_MODEL
BEGIN
dbms_data_mining.create_model(model_name => 'IOTMSET_MODEL',
mining_function => 'CLASSIFICATION',
data_table_name => 'TBL_IOT', --表名
case_id_column_name => 'K_TS', --时间戳列名
target_column_name => '',
settings_table_name => 'mset_iot_settings'); --配置表名
END;
/
创建模型完成后,会发现当前用户下的对象多了一系列以 DM$ 前缀命名的表和视图,这是 Oracle 数据挖掘(Oracle Data Mining, ODM)自动创建的模型存储对象,它们用于存储 MSET-SPRT 模型的相关数据。
5.查询预测结果
查询预测测试数据集的结果:
SELECT rownum, K_TS, pred FROM (SELECT K_TS, prediction(IOTMSET_MODEL using *)
over (ORDER BY K_TS) pred FROM tbl_iot)
where pred < 1 --异常
order by 2, 1 ;
6.其他测试建议
建议在测试开始和结束,创建awr的snapshot:
- exec DBMS_WORKLOAD_REPOSITORY.create_snapshot();
测试完成获取AWR报告:
- @?/rdbms/admin/awrrpt
- awrrpt_1_220_221.html
测试结果略。
ORACLE数据挖掘之 MSET-SPRT的更多相关文章
- MapReduce: 一个巨大的倒退
前言 databasecolumn 的数据库大牛们(其中包括PostgreSQL的最初伯克利领导:Michael Stonebraker)最近写了一篇评论当前如日中天的MapReduce 技术的文章, ...
- 【基于WPF+OneNote+Oracle的中文图片识别系统阶段总结】之篇一:WPF常用知识以及本项目设计总结
篇一:WPF常用知识以及本项目设计总结:http://www.cnblogs.com/baiboy/p/wpf.html 篇二:基于OneNote难点突破和批量识别:http://www.cnblog ...
- 【基于WPF+OneNote+Oracle的中文图片识别系统阶段总结】之篇二:基于OneNote难点突破和批量识别
篇一:WPF常用知识以及本项目设计总结:http://www.cnblogs.com/baiboy/p/wpf.html 篇二:基于OneNote难点突破和批量识别:http://www.cnblog ...
- 【基于WPF+OneNote+Oracle的中文图片识别系统阶段总结】之篇三:批量处理后的txt文件入库处理
篇一:WPF常用知识以及本项目设计总结:http://www.cnblogs.com/baiboy/p/wpf.html 篇二:基于OneNote难点突破和批量识别:http://www.cnblog ...
- 【基于WPF+OneNote+Oracle的中文图片识别系统阶段总结】之篇四:关于OneNote入库处理以及审核
篇一:WPF常用知识以及本项目设计总结:http://www.cnblogs.com/baiboy/p/wpf.html 篇二:基于OneNote难点突破和批量识别:http://www.cnblog ...
- 你搞懂 ORACLE、 SQLSERVER、MYSQL与DB2的区别了吗
ORACLE. SQLSERVER.MYSQL与DB2的区别--平台性: Oracle.MYSQL与DB2可在所有主流平台上运行: SQL Server只能在Windows下运行: --安 ...
- Oracle数据库11g各版本介绍及功能比较
.标准版和企 业版.所有这些版本都使用相同的通用代码库构建,这意味着企业的数据库管理软件可以轻松地从规模较小的单一处理器服务器扩展到多处理器服务器集 群,而无需更改一行代码.Oracle数据库11g企 ...
- [转]oracle 分析函数over
oracle 分析函数over 分析函数(OVER) 目录: =============================================== 1.Oracle分析函数简介 2. O ...
- ORACLE优化器RBO与CBO介绍总结
RBO和CBO的基本概念 Oracle数据库中的优化器又叫查询优化器(Query Optimizer).它是SQL分析和执行的优化工具,它负责生成.制定SQL的执行计划.Oracle的优化器有两种,基 ...
- oracle直通车第二周习题
1.教材第二章课后作业 1,2,3,4题. 答:1. 创建一查询,显示与Blake在同一部门工作的雇员的项目和受雇日期,但是Blake不包含在内. 2. 显示位置在Dallas的部门内的雇员姓名.变化 ...
随机推荐
- echo输出
linux中不免经常使用echo进行输出,或输出到屏幕,或输出到文件.但是使用的时候会发现,在想要输出一些需要转义的字符时,例如\t等,它却原样不动的输出了. 使用man命令查看echo的帮助文档,会 ...
- Python调用ChatTTS API接口
Python调用ChatTTS API接口: #********************************************* #author:wgscd #date:2024-7-27 ...
- 微服务实战系列(九)-注册中心与网关高可用架构设计-copy
1. 微服务关系架构图 简要说明: (1)所有应用或者服务要想对外提供服务(包括网关),必须首先到注册中心进行注册. (2)所有访问通过服务网关进行访问,然后由服务网关路由到对应服务中心进行交互访问. ...
- 对比使用DeepSeek与文新一言,了解DeepSeek的关键技术论文
DeepSeek是国内大模型技术的新秀,最近也在业界和媒体界火爆出圈,所以想学习一下其技术. 大模型时代,学习知识,当然首先想到利用大模型,由于在过去一年,对DeepSeek使用不多,所以想和文新一言 ...
- Java虚拟线程探索
在Java 21中,引入了虚拟线程,这是一个非常非常重要的特性,之前一直苦苦寻找的Java协程,终于问世了.在高并发以及IO密集型的应用中,虚拟线程能极大的提高应用的性能和吞吐量. ## 什么是虚拟线 ...
- [图形绘制/流程图] Mermaid : 开源的低代码图形绘制语言、协议及工具
概述:Mermaid Mermaid是一种基于Javascript的.开源的文本驱动图表生成工具/绘图工具,,使用类似于Markdown的低代码语法,它允许用户使用简单的文本语言来创建各种类型的图表 ...
- Iceberg治理服务Amoro---配置Prometheus + Grafana看板
一.基础资料 1.mac安装Prometheus + Grafana https://www.cnblogs.com/robots2/p/18689540 2.配置文档 https://amoro.a ...
- [国家集训队] Tree2 题解
加边删边 \(LCT\),标记下放同 \(luogu\) 线段树 \(2\) 一题. 时间复杂度 \(O(n\log n)\),第一次交的时候我维护 \(sum\) 不维护 \(sz\ WA\) 完了 ...
- DeepSeek本地部署
一.ollama ollama是一个管理和运行所有大模型.开源大模型的平台.在官网的Models中可以看到deepseek-r1的AI模型 1.在官网中下载对应系统的ollama,下载时需要开墙,或者 ...
- AD22 PCB导出Gerber文件详细步骤
PCB绘制好,检查完成后,就可以把文件交给PCB工厂生产了,一般有两种方式: 第一种最简单就是直接将PCB文件压缩打包,发给工厂. 第二种生成Gerber等相关资料,再压缩打包,发给工厂. 这里以AD ...