天池大数据周冠军分享|附移动推荐算法赛答辩会Top5选手PPT
上周是淘宝穿衣搭配算法大赛开始评测后的第一周,周冠军是来自浙江大学的"FUC AUTH"队。他们在夺得本周冠军之后,还将自己的获胜经验分享给了大家,究竟有什么秘诀呢?
阿里巴巴天池大数据竞赛在浙大师兄们的口碑中一直很不错,它真正意义上地为我们提供了海量数据源和大数据处理平台,尤其是大数据处理平台是在高校实验室中很难提供。对于以后走向大数据方向的研究人员而言也很具备科研价值,大数据比赛确实也锻炼大数据挖掘算法和程序优化,让我们受益匪浅。
由于我们团队也差不多都是新手,能取得这样的成绩,确实激励我们,让我们更有信心面对将来的挑战。在高兴的同时我们也深刻地意识到到目前比赛刚开始,许多大牛还未真刀真枪开始干,我们现在取得的成绩也不可骄傲。
而在比赛期间,我们确实遇到过很多困难:
1程序运行时间过长
程序运行时间过长,尤其是本文挖掘部分,由于我们采用的比较词向量TF/IDF的相似度的方法,然而词向量维度太高,计算量大。如果采用常规方法计算需要整整1天多,为了解决计算速度问题,我们采用能预先计算的结果预先缓存到内存字典中,线下用python实现类似基于内存迭代的多进程Map/Reduce方案,开出16进程进行计算,将时间缩短到1.5小时左右。
2评价想法的可行性
想法很多,如何评价想法的可行性,我们将套餐数据分开为训练数据和测试数据,并生成测试数据的标准答案,在线下搭建一个线下评价系统。经过第一天的提交结果反馈,我们发现我们的线下评价系统是合理且有效的,线上领先线下0.2%。评价系统能评价出我们的想法的好坏。比赛就是不断验证想法,提出去好的想法并分析其中的原因,并加以改变。
3关于调参问题
关于调参问题,之前一直是手工调参,发现效率太低,人工干预麻烦。我们就采用暴力调参法,先粗条后细调,或者直接采用爬山法以及模拟退火法,甚至我们也开发出一套随机蒙特卡洛方法。发现蒙特卡洛的方法效率最低,参数维度较少优先选择暴力法,参数维度较多选用爬山法或者模拟退火法。
4团队协作
最后关于团队协作问题,由于大家习惯的编程语言不同,有C/C++、matlab、python等,为了更好的协作需要有人能翻译其他人的编程语言实现统一版本的语言,比如python,版本统一能很多好处,集体参数调优。相对而言我觉得python非常适合作为编程工具,抛开其运行效率问题不说,是一种很好的交互式语言,相对于C/C++而言,可以分步执行,随时查看结果,与matlab类似。但是matlab有没有类似python的强大数据结构,字典和列表,还有python机器学习支持很强大,编程非常方便,代码简洁。
5给大家的建议
结合上述的困难,我主要给其他选手的建议:
1. 不断优化代码,能预先计算的可重复使用的数据尽量预先计算好,多用类似hash字典的数据结构缓存变量数据,运行效率提升很大一部分都是在于数据的查询
2. 想法可以很多,都需要建立有效的线下评价系统对其进行验证
3. 模型之前的重要程度可以简单设置参数体现,并通过程序调参选择出最佳参数,每次迭代过程要往评价好的方向走
4. 尽量不要重造机器学习算法,一般来说各大语言算法都有写好的计算学习版本,比如python的sklearn,里面就封装好本次要使用的TF/IDF模型。
文/天池大数据科研平台
移动推荐算法赛答辩会Top5选手PPT截图
(下载方式见底部)
天池大数据周冠军分享|附移动推荐算法赛答辩会Top5选手PPT的更多相关文章
- 超人学院Hadoop大数据技术资源分享
超人学院Hadoop大数据技术资源分享 http://bbs.superwu.cn/forum.php?mod=viewthread&tid=807&fromuid=645 很多其它精 ...
- 大数据学习路线分享-Hbase shell的基本操作完整流程
HBase的命令行工具,最简单的接口,适合HBase管理使用,可以使用shell命令来查询HBase中数据的详细情况.安装完HBase之后,启动hadoop集群(利用hdfs存储),启动zookeep ...
- 【天池大数据赛题解析】资金流入流出预测(附Top4答辩ppt)
http://mp.weixin.qq.com/s?__biz=MzA3MDg0MjgxNQ==&mid=208451006&idx=1&sn=532e41cf020a0673 ...
- 【大数据系列】MapReduce示例好友推荐
package org.slp; import org.apache.hadoop.io.LongWritable; import org.apache.hadoop.io.Text; import ...
- 天池移动推荐算法赛--https://github.com/PnYuan/Tianchi-BigData
参考: https://blog.csdn.net/Snoopy_Yuan/article/details/75808006
- Kaggle大数据竞赛平台入门
Kaggle大数据竞赛平台入门 大数据竞赛平台,国内主要是天池大数据竞赛和DataCastle,国外主要就是Kaggle.Kaggle是一个数据挖掘的竞赛平台,网站为:https://www.kagg ...
- Storm 实战:构建大数据实时计算
Storm 实战:构建大数据实时计算(阿里巴巴集团技术丛书,大数据丛书.大型互联网公司大数据实时处理干货分享!来自淘宝一线技术团队的丰富实践,快速掌握Storm技术精髓!) 阿里巴巴集团数据平台事业部 ...
- Spark大数据的学习历程
Spark主要的编程语言是Scala,选择Scala是因为它的简洁性(Scala可以很方便在交互式下使用)和性能(JVM上的静态强类型语言).Spark支持Java编程,但对于使用Java就没有了Sp ...
- 大数据公益课堂成就你高薪之梦,30W,50W,100W...
从之前的知道“大数据”这词,到2013年正式开始了解大数据领域,再到2014年深入研究大数据相关的领域,到现在逐渐影响周围的同学.朋友和家人.大数据技术将给我们带来的远不止我们想到的这些.曾经我身边的 ...
随机推荐
- Android和iOS隐藏状态条
Android: 在 AndroidManifest.xml 里 <activity android:theme="@android:style/Theme.NoTitleBar.Fu ...
- andriod的简单用法2
1.在Activity中使用menu //创建菜单项 public boolean onCreateOptionsMenu(Menu menu) { // Inflate the menu; this ...
- bzoj 2095: [Poi2010]Bridges(二分法+混合图的欧拉回路)
[题意] 给定n点m边的无向图,对于边u,v,从u到v边权为c,从v到u的边权为d,问能够经过每条边一次且仅一次,且最大权值最小的欧拉回路. [思路] 二分答案mid,然后切断权值大于mid的边,原图 ...
- LyX转Word
写毕业论文是一件非常繁锁的事情,一大堆的图片.公式都要往上贴,有时弄不好就把编号搞错了,有时可能没注意,一不小心字体格式.版面格式又全乱了.怎么办?--其实这只是在word环境下才会有的烦恼. 对于w ...
- Camera图片特效处理综述(Bitmap的Pixels处理、Canvas/paint的drawBitmap处理、旋转图片、裁截图片、播放幻灯片浏览图片<线程固定时间显示一张>)
一种是直接对Bitmap的像素进行操作,如:叠加.边框.怀旧.(高斯)模糊.锐化(拉普拉斯变换). Bitmap.getPixels(srcPixels, 0, width, 0, 0, width, ...
- window.parent 判断是否是被嵌入iframe里面
项目中有个这样逻辑:B页面嵌套A页面 如图下: 但是B页面有可能独立出来.所以判断B页面是否被嵌入进去则使用 window.parent==window 如果是true B页面是独立的,false B ...
- linux shell 实现node-webkit的自动跨平台打包
今天下午发现了个好玩的东西(node-webkit),这东西有一直是我想实现的功能:使用html编写桌面应用,实现跨平台: 具体实现方法:结合chrome浏览器内核和node.js搭建一个跨平台的应用 ...
- 黄金点游戏之客户端(homework-05)
0. 摘要 之前我们玩了2次黄金数游戏,我也幸运的得到了一本<代码大全>,嘿嘿.这次的作业是一个Client/Server程序,自动化完成多轮重复游戏. 我完成了Client部分,使用C# ...
- UVALive 7325 Book Borders (模拟)
Book Borders 题目链接: http://acm.hust.edu.cn/vjudge/contest/127407#problem/B Description A book is bein ...
- POJ 2387 Til the Cows Come Home (最短路 dijkstra)
Til the Cows Come Home 题目链接: http://acm.hust.edu.cn/vjudge/contest/66569#problem/A Description Bessi ...