2016-ccf-data-mining-competition 搜狗用户画像构建
| 想法1: | |
| 分成147(3*7*7)类, 后来觉得这样效果不好,后来看了看竞赛要求的也是分别预测,分别评分,而不是一次就把3类的标签都给出 | |
| 所有后来我们改进了当时的想法,决定对年龄,性别,学历进行分别预测 | |
| 想法2: | |
| 我们先对所有的单词进行分类,分成比如体育,经济,教育等等,一些大类别,然后看看每个用户搜索的关键词属于哪一类。作为特征 | |
| 后来,因为无法确定分为多少类,,所以否定了这个想法。 | |
| 想法3: | |
| Step1:进行文本分词处理,提取出搜索词中的关键词; | |
| Step2:建立向量空间模型 (1)权值计算(布尔权值,词频权值,TF/IDF,TFC,ITC等方法) | |
| (2) 向量相似度量(内积,绝对值距离,切比雪夫距离等) ; | |
| Step3:对文本进行分类(概率分类器,决策树分类器,神经网络分类器等) | |
| Step4:进行数据测试,根据给定的查询词,首先也对它先分词,提取关键词,然后和一个大类进行相关性测量, | |
| VSM中的(两个向量的夹角越小说明关联度越大),然后决定出它是属于哪一个类, | |
| 之后再和这个类别下的关键词进行相关性对比,然后逐个决定出人物属性(年龄,性别,学历) | |
| 确定了思路之后,我用skleran 这个机器学习包进行了实现。 | |
| 初赛思路v1: | |
| 一 Preprocessing | |
| 1分词 采用结巴分词 | |
| 2数据清洗,删掉缺失数据,例如数据中的未知(标签为0) | |
| 二 Feature extraction | |
| 1 countvector:计算词频 | |
| 2 tfidfvector: 计算tfidf作为权重值 | |
| 3 hashvector: 利用hash 算法将单词映射到向量空间 | |
| 三 Feature selection | |
| 选择特征的数量,也就是数据矩阵的维度。v1没有使用算法,直接指定特征的维度。 | |
| 四 Feature union | |
| 初赛中没有使用特征融合 | |
| 五 Model selection | |
| KNN | |
| SVM 效果最好 | |
| 贝叶斯 | |
| 六 Model Evaluation and Optimization | |
| 利用准确率衡量分类的结果 | |
| 初赛思路v2: | |
| 在特征提取的时候,我们担心数据过拟合,所以进行特征选择 | |
| 我们的特征选择的方法主要是卡方跟LDA主题模型 | |
| 但是经过测试,LDA+TFIDF的效果不如单纯的tfidf | |
| TFIDF+卡方的效果稍好一点点 | |
| 特征提取我们也试过n-gram效果也不是很好 | |
| 最终初赛思路(v2): | |
| 1.jieba分词 | |
| 2.特征提取:tfidf | |
| 3.特征选择:卡方 | |
| 4.分类:SVM |
github:
https://github.com/zle1992/2016-ccf-data-mining-competition
2016-ccf-data-mining-competition 搜狗用户画像构建的更多相关文章
- 【转】4w+1h 教你如何做用户画像
记得14年开始做用户画像的时候,对于用户画像完全没有概念,以为是要画一幅幅图画,经过两年多的学习和理解,渐渐的总结出了一些方法和技巧,在这里就通过4个W英文字母开头和1个H英文字母开头的单词和大家分享 ...
- (转载)2016 CCF大数据与计算智能大赛 开源资料整理
本文转载自:http://blog.sina.com.cn/s/blog_5399b8660102wxks.html 2016 CCF 大数据与计算智能大赛已经落下帷幕,11个赛题由众多大神包揽奖项, ...
- 论文翻译:Data mining with big data
原文: Wu X, Zhu X, Wu G Q, et al. Data mining with big data[J]. IEEE transactions on knowledge and dat ...
- Datasets for Data Mining and Data Science
https://github.com/mattbane/RecommenderSystem http://grouplens.org/datasets/movielens/ KDDCUP-2012官网 ...
- data mining,machine learning,AI,data science,data science,business analytics
数据挖掘(data mining),机器学习(machine learning),和人工智能(AI)的区别是什么? 数据科学(data science)和商业分析(business analytics ...
- 数据挖掘(data mining),机器学习(machine learning),和人工智能(AI)的区别是什么? 数据科学(data science)和商业分析(business analytics)之间有什么关系?
本来我以为不需要解释这个问题的,到底数据挖掘(data mining),机器学习(machine learning),和人工智能(AI)有什么区别,但是前几天因为有个学弟问我,我想了想发现我竟然也回答 ...
- 用Mirror,搞定用户画像
Mirror产品概述 Mirror是专为金融行业设计的全面用户画像管理系统.该系统基于星环多年来为多个金融企业客户构建用户画像的经验,深入契合业务需求,实现对用户全方位全维度的刻画.Mirror内置银 ...
- Conference-Web Search and Data Mining
Conference WSDM(Web Search and Data Mining)The ACM WSDM Conference Series 不像KDD.WWW或者SIGIR,WSDM因为从最开 ...
- Tinghua Data Mining
Learning Resources 书籍: 期刊: 业界先驱: 开阔视野,掌握业界最新动态. 工具: 数据挖掘是很多学科的综合体: 甭管叫什么名字,归根到底都是数据挖掘: Comprehensive ...
随机推荐
- Extjs不错的博客
http://www.cnblogs.com/fangsui/category/372751.html http://www.cnblogs.com/WangJinYang/tag/EXT.NET/ ...
- PHP防止跨站表单提交与同站跨页伪造表单的攻击
在以前的防止跨站攻击的时候,使用了验证提交的页面是否是同一个站点,这样可以防止普通的攻击,ereg("blog.qita.in",$_SERVER['HTTP_REFERER']) ...
- 时序数据库技术体系 – InfluxDB 多维查询之倒排索引
本文转自: http://hbasefly.com/2018/02/09/timeseries-database-5/ 在时序数据库概述一文中,笔者提到时序数据库的基础技术栈主要包括高吞吐写入实现.数 ...
- Microchip编译器产品线—MPLAB XC简介
以下为Microchip最新编译器产品线—MPLAB-XC简介 MPLAB-XC:适合所有PIC单片机和项目的编译器解决方案 Microchip最新编译器产品线—MPLAB-XC为项目开发的软件需求提 ...
- js插件---->jquery通知插件toastr的使用
toastr是一款非常棒的基于jquery库的非阻塞通知提示插件,toastr可设定四种通知模式:成功,出错,警告,提示,而提示窗口的位置,动画效果都可以通过能数来设置.toastr需要jquery的 ...
- 三、微信小游戏开发 --- 小游戏API调用Platform
微信小游戏API Platform主要是Egret用于来调用平台的SDK的. 在Egret中使用接口定义Platform. Egret项目中默认的platform值是DebugPlatform. 发布 ...
- 【BZOJ3362-3365】USACO水题四连A
[BZOJ3362][Usaco2004 Feb]Navigation Nightmare 导航噩梦 Description 农夫约翰有N(2≤N≤40000)个农场,标号1到N,M(2≤M≤ ...
- eclipse 安装Subversion1.82(SVN)插件
Eclipse下SVN插件的安装,可以选择在线安装和离线安装两种方式: 2.(可选①)使用本地安装包安装插件 --填写插件名(可随意取名) --插件来源地址(①安装包,②使用网址) →Archie→选 ...
- shell脚本备份日志
#!/bin/sh # back tomcat catalina.out cd /home/log_bak #the file DATE=`date '+%Y%m%d-%H%M'` ARCHIVE=$ ...
- Linux系统修改编码(转)
Windows的默认编码为GBK,Linux的默认编码为UTF-8.在Windows下编辑的中文,在Linux下显示为乱码.为了解决此问题,修改Linux的默认编码为GBK.方法如下: 方法1: vi ...