Hbase建模选择
|
日期 2017年3月17日 |
HBase建模记录 |
|
OLTP 应用场景: |
|
|
OLAP 应用场景: |
|
|
语音分析系统的应用场景 |
|
|
基于HBase的建模考虑 |
|
|
1.话单为主来考虑hbase的rowkey的生成规则: |
|
|
1.1 原始语音文件的命名规则 |
|
|
dxaudio_$(ID)_$(CallNum)_$(CalledNum)_$(starttime)_$(stoptime)_$(Type)_$(rec).voc |
|
|
表示规则: |
|
|
$(ID)表示通话唯一标识; |
|
|
$(CallNum)表示主叫号码 |
|
|
$(CalledNum)表示被叫号码 |
|
|
$(starttime)为通话开始时间; |
|
|
|
|
$(stoptime)为通话结束时间,型同$(starttime) |
|
|
$(datetime)为文件生成时间,型同$(starttime),文件入库时间 |
|
|
$(Type)表示信道类型,见附录B |
|
|
$(rec)为流水号,从00000至99999循环使用 |
|
|
相同$(datetime)的各个文件的$(rec)不相同 |
|
|
1.2业务上支持的字段 |
|
|
1.3 如何支持一条记录对不同结构的查询 |
|
|
1.4 倒排索引&搜索引擎 |
|
|
关键词查找的方法已经到了极限 |
|
|
互联网上的资料生成索引,总共分为三步 |
|
|
1)把资料编号; |
|
|
2)把每篇资料内容切分成词 |
|
|
3)把词和资料编号的对应关系处理成 |
|
|
需考虑的问题: |
|
|
1)资料(网页)收集的全、快、稳、新、 |
|
|
2)建立索引时要考虑质量、效率、赋权、周期、时效性、资源消耗问题 |
|
|
3)query的时候要考虑的问题 query分析、排序、筛选、展示、性能、、广告、推荐、个性化、 |
|
|
统计 |
|
|
4)整体上要考虑地域性、容灾、国际化、当地法律、返作弊、垂直需求、移动互联网等 |
|
|
1.5开源搜索引擎技术 |
|
|
1)Lucene, |
|
|
他不是一个引擎产品而是一个类库,至今开源搜索引擎最好没有之一 |
|
|
使用java语音开发 |
|
|
基本涵盖了搜索引擎中的索引和检索两个核心部分的全部功能 |
|
|
抽象程度较好 |
|
|
2)solr |
|
|
一个完整的搜索引擎产品 |
|
|
底层是基于Lucene |
|
|
3) elasticSearch |
|
|
产品级开源项目, |
|
|
底层基于Lucene |
|
|
提供Restful API的服务 |
|
|
Restful 就是直接通过HTTP协议收发请求和响应,接口比较清晰简单,是一种架构规则 |
|
|
|
|
|
结论: |
|
|
搜索类应用程序的检索可以通过es来进行检索。 |
|
Hbase建模选择的更多相关文章
- Hbase建模
转自:http://blog.itpub.net/28912557/viewspace-1119865/ 什么情况下使用Hbase?1,成熟的数据分析主题,查询模式已经确定并且不易轻易改变.(主要还是 ...
- Hbase写入hdfs源码分析
版权声明:本文由熊训德原创文章,转载请注明出处: 文章原文链接:https://www.qcloud.com/community/article/258 来源:腾云阁 https://www.qclo ...
- Hbase的安装测试工作
Hbase的安装测试工作: 安装:http://www.cnblogs.com/neverwinter/archive/2013/03/28/2985798.html 测试:http://www.cn ...
- Hadoop集群中Hbase的介绍、安装、使用
导读 HBase – Hadoop Database,是一个高可靠性.高性能.面向列.可伸缩的分布式存储系统,利用HBase技术可在廉价PC Server上搭建起大规模结构化存储集群. 一.Hbase ...
- HBase的安装与使用
1.安装 由于还是学习阶段,所以没有在生产环境练习,就在本地建了个虚拟机进行HBase的安装. 下载地址http://www.apache.org/dyn/closer.cgi/hbase/,选择一个 ...
- HBase安装inAction
在安装Hbase之前,需要有hadoop的运行环境,关于hadoop的安装过程,请查看我之前的blog:hadoop安装笔记:或者另一个博主的超详细文章http://weixiaolu.iteye.c ...
- 阿里云HBase携X-Pack再进化,重新赋能轻量级大数据平台
一.八年双十一,造就国内最大最专业HBase技术团队 阿里巴巴集团早在2010开始研究并把HBase投入生产环境使用,从最初的淘宝历史交易记录,到蚂蚁安全风控数据存储.持续8年的投入,历经8年双十一锻 ...
- 阿里云HBase全新发布X-Pack 赋能轻量级大数据平台
一.八年双十一,造就国内最大最专业HBase技术团队 阿里巴巴集团早在2010开始研究并把HBase投入生产环境使用,从最初的淘宝历史交易记录,到蚂蚁安全风控数据存储.持续8年的投入,历经8年双十一锻 ...
- HBase案例:HBase 在人工智能场景的使用
近几年来,人工智能逐渐火热起来,特别是和大数据一起结合使用.人工智能的主要场景又包括图像能力.语音能力.自然语言处理能力和用户画像能力等等.这些场景我们都需要处理海量的数据,处理完的数据一般都需要存储 ...
随机推荐
- 团队作业之404 Note Found Team
如果记忆是一个罐头的话,我希望这一罐罐头不会过期----<重庆森林> 404 Note Found Team 如果记忆是一个备忘录的话,别说了,它不会过期----<404 Note ...
- String 类 常用函数
构造方法摘要: String(byte[] bytes) 通过使用平台的默认字符集解码指定的 byte 数组,构造一个新的 String. String(char[] value) ...
- 未能加载文件或程序集“Microsoft.ReportViewer.WebForms, Version=10.0.0.0, Culture=neutral, PublicKeyToken=b03f5f7f11d50a3a”或它的某一个依赖项。系统找不到指定的文件
发布的打包项目在本机测试好使,部署到客户服务器上报错 分析器错误消息: 未能加载文件或程序集“Microsoft.ReportViewer.WebForms, Version=10.0.0.0, Cu ...
- TCP/IP协议三次握手和四次挥手大白话解说
前言 昨天晚上被一位师傅问到了TCP/IP的工作机制,心里很清楚三次握手,然而对于四次挥手却忘了,这是大学习里学过的,奋而翻阅书籍和网络对之前所学的做一个温顾,算是夯实自我吧. TCP(Transmi ...
- java static{}块
java中static{}块只有在类加载是才会被调用. 这说明:static只有可能被调用一次. 原因:首先理解什么是类加载,区分类加载和申明对象的区别. public class StaticTes ...
- CentOS 7 上安装(LAMP)服务 Linux,Apache,MySQL,PHP
介绍 LAMP 是现在非常流行的 WEB 环境, 是 Linux,Apache,MySQL,PHP 的缩写.数据存储在 MySQL 中,动态内容由 PHP 处理. 在本指南中,我们将演示如何在 Cen ...
- BZOJ5312 冒险(线段树)
记录区间and/or,修改时如果对整个区间影响都相同就打标记,否则递归.复杂度不太会证. #include<iostream> #include<cstdio> #includ ...
- BZOJ2339 HNOI2011卡农(动态规划+组合数学)
考虑有序选择各子集,最后除以m!即可.设f[i]为选i个子集的合法方案数. 对f[i]考虑容斥,先只满足所有元素出现次数为偶数.确定前i-1个子集后第i个子集是确定的,那么方案数为A(2n-1,i-1 ...
- BZOJ4519 CQOI2016不同的最小割(最小割+分治)
最小割树:新建一个图,包含原图的所有点,初始没有边.任取两点跑最小割,给两点连上权值为最小割的边,之后对于两个割集分别做同样的操作.最后会形成一棵树,树上两点间路径的最小值即为两点最小割.证明一点都不 ...
- STL Set和multiset 容器
STL Set和multiset 容器 set/multiset的简介 set是一个集合容器,其中所包含的元素是唯一的,集合中的元素按一定的顺序排列. 元素插入过程是按排序规则插入,所以不能指定插入位 ...