天池大数据周冠军分享|附移动推荐算法赛答辩会Top5选手PPT
上周是淘宝穿衣搭配算法大赛开始评测后的第一周,周冠军是来自浙江大学的"FUC AUTH"队。他们在夺得本周冠军之后,还将自己的获胜经验分享给了大家,究竟有什么秘诀呢?
阿里巴巴天池大数据竞赛在浙大师兄们的口碑中一直很不错,它真正意义上地为我们提供了海量数据源和大数据处理平台,尤其是大数据处理平台是在高校实验室中很难提供。对于以后走向大数据方向的研究人员而言也很具备科研价值,大数据比赛确实也锻炼大数据挖掘算法和程序优化,让我们受益匪浅。
由于我们团队也差不多都是新手,能取得这样的成绩,确实激励我们,让我们更有信心面对将来的挑战。在高兴的同时我们也深刻地意识到到目前比赛刚开始,许多大牛还未真刀真枪开始干,我们现在取得的成绩也不可骄傲。
而在比赛期间,我们确实遇到过很多困难:
1程序运行时间过长
程序运行时间过长,尤其是本文挖掘部分,由于我们采用的比较词向量TF/IDF的相似度的方法,然而词向量维度太高,计算量大。如果采用常规方法计算需要整整1天多,为了解决计算速度问题,我们采用能预先计算的结果预先缓存到内存字典中,线下用python实现类似基于内存迭代的多进程Map/Reduce方案,开出16进程进行计算,将时间缩短到1.5小时左右。
2评价想法的可行性
想法很多,如何评价想法的可行性,我们将套餐数据分开为训练数据和测试数据,并生成测试数据的标准答案,在线下搭建一个线下评价系统。经过第一天的提交结果反馈,我们发现我们的线下评价系统是合理且有效的,线上领先线下0.2%。评价系统能评价出我们的想法的好坏。比赛就是不断验证想法,提出去好的想法并分析其中的原因,并加以改变。
3关于调参问题
关于调参问题,之前一直是手工调参,发现效率太低,人工干预麻烦。我们就采用暴力调参法,先粗条后细调,或者直接采用爬山法以及模拟退火法,甚至我们也开发出一套随机蒙特卡洛方法。发现蒙特卡洛的方法效率最低,参数维度较少优先选择暴力法,参数维度较多选用爬山法或者模拟退火法。
4团队协作
最后关于团队协作问题,由于大家习惯的编程语言不同,有C/C++、matlab、python等,为了更好的协作需要有人能翻译其他人的编程语言实现统一版本的语言,比如python,版本统一能很多好处,集体参数调优。相对而言我觉得python非常适合作为编程工具,抛开其运行效率问题不说,是一种很好的交互式语言,相对于C/C++而言,可以分步执行,随时查看结果,与matlab类似。但是matlab有没有类似python的强大数据结构,字典和列表,还有python机器学习支持很强大,编程非常方便,代码简洁。
5给大家的建议
结合上述的困难,我主要给其他选手的建议:
1. 不断优化代码,能预先计算的可重复使用的数据尽量预先计算好,多用类似hash字典的数据结构缓存变量数据,运行效率提升很大一部分都是在于数据的查询
2. 想法可以很多,都需要建立有效的线下评价系统对其进行验证
3. 模型之前的重要程度可以简单设置参数体现,并通过程序调参选择出最佳参数,每次迭代过程要往评价好的方向走
4. 尽量不要重造机器学习算法,一般来说各大语言算法都有写好的计算学习版本,比如python的sklearn,里面就封装好本次要使用的TF/IDF模型。
文/天池大数据科研平台
移动推荐算法赛答辩会Top5选手PPT截图
(下载方式见底部)
天池大数据周冠军分享|附移动推荐算法赛答辩会Top5选手PPT的更多相关文章
- 超人学院Hadoop大数据技术资源分享
超人学院Hadoop大数据技术资源分享 http://bbs.superwu.cn/forum.php?mod=viewthread&tid=807&fromuid=645 很多其它精 ...
- 大数据学习路线分享-Hbase shell的基本操作完整流程
HBase的命令行工具,最简单的接口,适合HBase管理使用,可以使用shell命令来查询HBase中数据的详细情况.安装完HBase之后,启动hadoop集群(利用hdfs存储),启动zookeep ...
- 【天池大数据赛题解析】资金流入流出预测(附Top4答辩ppt)
http://mp.weixin.qq.com/s?__biz=MzA3MDg0MjgxNQ==&mid=208451006&idx=1&sn=532e41cf020a0673 ...
- 【大数据系列】MapReduce示例好友推荐
package org.slp; import org.apache.hadoop.io.LongWritable; import org.apache.hadoop.io.Text; import ...
- 天池移动推荐算法赛--https://github.com/PnYuan/Tianchi-BigData
参考: https://blog.csdn.net/Snoopy_Yuan/article/details/75808006
- Kaggle大数据竞赛平台入门
Kaggle大数据竞赛平台入门 大数据竞赛平台,国内主要是天池大数据竞赛和DataCastle,国外主要就是Kaggle.Kaggle是一个数据挖掘的竞赛平台,网站为:https://www.kagg ...
- Storm 实战:构建大数据实时计算
Storm 实战:构建大数据实时计算(阿里巴巴集团技术丛书,大数据丛书.大型互联网公司大数据实时处理干货分享!来自淘宝一线技术团队的丰富实践,快速掌握Storm技术精髓!) 阿里巴巴集团数据平台事业部 ...
- Spark大数据的学习历程
Spark主要的编程语言是Scala,选择Scala是因为它的简洁性(Scala可以很方便在交互式下使用)和性能(JVM上的静态强类型语言).Spark支持Java编程,但对于使用Java就没有了Sp ...
- 大数据公益课堂成就你高薪之梦,30W,50W,100W...
从之前的知道“大数据”这词,到2013年正式开始了解大数据领域,再到2014年深入研究大数据相关的领域,到现在逐渐影响周围的同学.朋友和家人.大数据技术将给我们带来的远不止我们想到的这些.曾经我身边的 ...
随机推荐
- Robotium简要学习
Robotium是一款国外的Android自动化测试框架,主要针对Android平台的应用进行黑盒自动化测试,它提供了模拟各种手势操作(点击.长按.滑动等).查找和断言机制的API,能够对各种控件进行 ...
- MockMvc和Mockito之酷炫使用
由于项目中需要添加单元测试,所以查询之后发现Mockito非常适合现在的web项目. 首先需要添加pom依赖: <dependency> <groupId>junit</ ...
- 浏览器URL传参最大长度问题
这几天为解决一个BUG头疼了一段时间,BUG现象如下: 一个选择人员的选择控件,当选择多个人时(50多个的时候),返回没有错误现象,而再一次打开的时候就报404错误.看到这个错误非常纳闷,无法下手,只 ...
- Linux 中 x86 的内联汇编
工程中需要用到内联汇编,找到一篇不错的文章,趁机学习下. 原文地址:http://www.ibm.com/developerworks/cn/linux/sdk/assemble/inline/ 如果 ...
- leetcode@ [355] Design Twitter (Object Oriented Programming)
https://leetcode.com/problems/design-twitter/ Design a simplified version of Twitter where users can ...
- HDU-4749 Parade Show KMP算法 | DP
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=4749 题意:给两个串S和P,求S串中存在多少个与P串的大小关系一样的串. 因为数字的范围是1<= ...
- HDU-4737 A Bit Fun 维护
题目链接:http://acm.hdu.edu.cn/showproblem.php?pid=4737 题意:给一个数列a0, a1 ... , an-1,令 f(i, j) = ai|ai+1|ai ...
- 安装 RabbitMQ C#使用-摘自网络(包括RabbitMQ的配置)
1.什么是RabbitMQ.详见 http://www.rabbitmq.com/ . 作用就是提高系统的并发性,将一些不需要及时响应客户端且占用较多资源的操作,放入队列,再由另外一个线程,去异步处理 ...
- World’s Smallest h.264 Encoder
转载 http://www.cardinalpeak.com/blog/worlds-smallest-h-264-encoder/ View from the Peak World’s Smalle ...
- 第三百零二天 how can I 坚持
今天给掌中宝提了几个bug,确实管用,哈哈. 还有就是弟弟买房了,海亮艺术公馆,还好,至少安定下来了,可惜啊,我看好的房子也有的卖了,咋办啊. 看准的东西总是会想法设法的买了,可是无能为力啊. 还有, ...