2016-ccf-data-mining-competition 搜狗用户画像构建

想法1：
	分成147（377）类，后来觉得这样效果不好，后来看了看竞赛要求的也是分别预测，分别评分，而不是一次就把3类的标签都给出
	所有后来我们改进了当时的想法，决定对年龄，性别，学历进行分别预测
想法2：
	我们先对所有的单词进行分类，分成比如体育，经济，教育等等，一些大类别，然后看看每个用户搜索的关键词属于哪一类。作为特征
	后来，因为无法确定分为多少类，，所以否定了这个想法。
想法3:

	Step1:进行文本分词处理，提取出搜索词中的关键词；
	Step2:建立向量空间模型（1）权值计算（布尔权值，词频权值,TF/IDF，TFC，ITC等方法）
	(2) 向量相似度量（内积，绝对值距离，切比雪夫距离等）；
	Step3:对文本进行分类（概率分类器，决策树分类器，神经网络分类器等）
	Step4:进行数据测试，根据给定的查询词，首先也对它先分词，提取关键词，然后和一个大类进行相关性测量，
	VSM中的（两个向量的夹角越小说明关联度越大），然后决定出它是属于哪一个类，
	之后再和这个类别下的关键词进行相关性对比，然后逐个决定出人物属性（年龄，性别，学历）

	确定了思路之后，我用skleran 这个机器学习包进行了实现。
初赛思路v1：
	一 Preprocessing
	1分词采用结巴分词
	2数据清洗，删掉缺失数据，例如数据中的未知（标签为0）
	二 Feature extraction
	 1 countvector：计算词频
	2 tfidfvector: 计算tfidf作为权重值
	3 hashvector: 利用hash 算法将单词映射到向量空间
	三 Feature selection 
	选择特征的数量，也就是数据矩阵的维度。v1没有使用算法，直接指定特征的维度。
	四 Feature union
	初赛中没有使用特征融合
	五 Model selection
	KNN
	SVM 效果最好
	贝叶斯
	六 Model Evaluation and Optimization
	利用准确率衡量分类的结果

初赛思路v2：

	在特征提取的时候，我们担心数据过拟合，所以进行特征选择
	我们的特征选择的方法主要是卡方跟LDA主题模型
	但是经过测试，LDA+TFIDF的效果不如单纯的tfidf
	TFIDF+卡方的效果稍好一点点
	特征提取我们也试过n-gram效果也不是很好


最终初赛思路（v2):
	1.jieba分词
	2.特征提取：tfidf
	3.特征选择：卡方
	4.分类：SVM

github:

https://github.com/zle1992/2016-ccf-data-mining-competition

2016-ccf-data-mining-competition 搜狗用户画像构建的更多相关文章

【转】4w+1h 教你如何做用户画像
记得14年开始做用户画像的时候,对于用户画像完全没有概念,以为是要画一幅幅图画,经过两年多的学习和理解,渐渐的总结出了一些方法和技巧,在这里就通过4个W英文字母开头和1个H英文字母开头的单词和大家分享 ...
(转载)2016 CCF大数据与计算智能大赛开源资料整理
本文转载自:http://blog.sina.com.cn/s/blog_5399b8660102wxks.html 2016 CCF 大数据与计算智能大赛已经落下帷幕,11个赛题由众多大神包揽奖项, ...
论文翻译：Data mining with big data
原文: Wu X, Zhu X, Wu G Q, et al. Data mining with big data[J]. IEEE transactions on knowledge and dat ...
Datasets for Data Mining and Data Science
https://github.com/mattbane/RecommenderSystem http://grouplens.org/datasets/movielens/ KDDCUP-2012官网 ...
data mining，machine learning，AI，data science，data science，business analytics
数据挖掘(data mining),机器学习(machine learning),和人工智能(AI)的区别是什么? 数据科学(data science)和商业分析(business analytics ...
数据挖掘(data mining)，机器学习(machine learning)，和人工智能(AI)的区别是什么？数据科学(data science)和商业分析(business analytics)之间有什么关系？
本来我以为不需要解释这个问题的,到底数据挖掘(data mining),机器学习(machine learning),和人工智能(AI)有什么区别,但是前几天因为有个学弟问我,我想了想发现我竟然也回答 ...
用Mirror，搞定用户画像
Mirror产品概述 Mirror是专为金融行业设计的全面用户画像管理系统.该系统基于星环多年来为多个金融企业客户构建用户画像的经验,深入契合业务需求,实现对用户全方位全维度的刻画.Mirror内置银 ...
Conference-Web Search and Data Mining
Conference WSDM(Web Search and Data Mining)The ACM WSDM Conference Series 不像KDD.WWW或者SIGIR,WSDM因为从最开 ...
Tinghua Data Mining
Learning Resources 书籍: 期刊: 业界先驱: 开阔视野,掌握业界最新动态. 工具: 数据挖掘是很多学科的综合体: 甭管叫什么名字,归根到底都是数据挖掘: Comprehensive ...

随机推荐

WAS创建虚拟主机和传输链
一.配置虚拟主机 1.登录控制台
《C++ Primer Plus》第9章内存模型和名称空间学习笔记
C++鼓励程序员在开发程序时使用多个文件.一种有效的组织策略是,使用头文件来定义用户类型,为操纵用户类型的函数提供函数原型,并将函数定义放在一个独立的源代码文件中.头文件和源代码文件一起定义和实现了用 ...
piblog 0.2
在一个Web App中,所有的数据,包括用户的信息,日志,评论等,都存在数据库中.在piblog中使用MySQL作为数据库.Web App中由很多地方需要使用数据库.访问数据库需要创建数据库连接.游标 ...
使用jQuery操作元素属性
在jQuery中,提供了attr函数来操作元素属性,具体如下: 函数名说明例子 attr(name) 取得第一个匹配元素的属性值. $("input").attr(" ...
浅析HTTPS与SSL原理
版权声明:本文由盛旷原创文章,转载请注明出处: 文章原文链接:https://www.qcloud.com/community/article/134 来源:腾云阁 https://www.qclo ...
使用CDN的网络访问过程
CDN是指内容分发网络,在网络各处架设节点服务器,当用户访问时,CDN系统会根据网络流量.到用户的距离等因素将请求导向离用户最近的节点上. 访问过程是: 1.用户向浏览器提供要访问的域名. 2.浏览器 ...
Linux应急响应思路详谈
一.主机篇: 1.自动化初筛,建议使用RootkitHunter (1)安装 $sudo wget https://jaist.dl.sourceforge.net/project/rkhunter/ ...
sort排序和uniq统计命令
author:headsen chen date: 2018-08-13 11:08:09 1,sort:排序的功能,默认安装ASCII码来排序,-n 安装数值排,-r 按照倒序来排 [root@b ...
mysql如何查询当前周的第一天的日期？
转自:http://blog.csdn.net/zzhongcy/article/details/43016685 select date_sub(curdate(),INTERVAL WEEKDAY ...
windows dos 常用命令行
有关某个命令的详细信息,请键入 HELP 命令名 dir (directory) :列出当前目录下的文件以及文件夹 md (make directory): 创建目录 rd (remove direc ...

2016-ccf-data-mining-competition 搜狗用户画像构建

2016-ccf-data-mining-competition 搜狗用户画像构建的更多相关文章

随机推荐

热门专题