背景

  • 用户合作产生内容的网站越来越多,有许多隐藏的信息可以去挖掘
  • wiki上保存了贡献者的编辑记录,提供了非常多的有用的信息
  • 研究发现,大部分的贡献者仅仅会参与编辑很小数量的文章,修改的版本也有限制,通常也只在某几个特定的领域/话题中
  • 含有某个主题的文章通常指吸引特定一部分的读者和编辑者

论文关注点

  • 提出一个新的相似度计算方法 expert-based similarity 应用于维基上有争论性的文章集,从而达到更好的聚类效果
  • 维基上争论性的文章的缘由是和自身的特定主题相关的,而不是相关编辑参与者

论文实验方法

  • 比较已有的三种相似度方法:cosine similarity;SimRank;P-Rank
  • expert-based similarity的理论假设:如果两篇文章被同一个人编辑过,我们则认为该两篇文章是相似的
  • 使用了下面三种方法来检测维基上文章的相关性
Relevance aspect Similarity Relation type
Content Cosine similarity Explicit
Hyperlink P-Rank and SimRank similarities Implicit
Co-editorship Expert-based similarity Implicit
  • 文章一共进行了三次实验来评价以上相似度方法,并验证了方法在大量数据上的一般性

    1. 第一次实验使用了compactness指标来评价聚类效果,聚类算法使用了K-Medoids,相似度算法使用了SimRank和P-Rank,同时为了避免选择K时带来的干扰,使用了DBScan方法避免预先指定聚类的个数K

      expert-based方法结果最稳定,有较高的性能和鲁棒性
      SimRank方法的结果最坏
      通过人工方法的评测发现,expert-based方法对于发现维基中语义相关的文章非常有用

    2. 第二次实验利用了分类标签,用purity和entropy来评价聚类效果,聚类使用了K-Medoids和AHC,相似度使用了上述4种方法

      总的来说,expert-based方法在量化wiki文章的相关性上是一种有效的措施

    3. 第三次实验是在大规模的文档集上评价了expert-based similarity
  • 数据的准备:选用了宗教主题相关的文章,考虑到里面争论性的比例比较大;选取的文章保证有5个以上的编辑者;对于基于内容的相似度方法,通常选取最近的5个版本;对于基于超链接的选择最近的3到5个含有链接的版本
  • expert-based方法的优势在于对于破坏性的大量的编辑有较好的防范性,原因在于它采用了类似IDF的计算方法
  • 第五章验证了导致争论的主要原因
  • 如果两个用户之间有互相删除内容的行为,我们认为这两个用户是在争论
  • 通过对贡献者、concept等方面入手,比较争论性形成的原因,得到结论:特定的争论性的主题是维基争论性文章的主要缘由

文章结论

  • expert-based similarity方法是一种高效有用的度量文章相关度的方法

如若感兴趣,可自行google下载,提供参考链接

论文笔记-Mining latent relations in peer-production environments的更多相关文章

  1. 论文笔记:Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments

    Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments 2017-10-25  16:38:23   [Proj ...

  2. Face Aging with Conditional Generative Adversarial Network 论文笔记

    Face Aging with Conditional Generative Adversarial Network 论文笔记 2017.02.28  Motivation: 本文是要根据最新的条件产 ...

  3. 【论文笔记】Learning Fashion Compatibility with Bidirectional LSTMs

    论文:<Learning Fashion Compatibility with Bidirectional LSTMs> 论文地址:https://arxiv.org/abs/1707.0 ...

  4. Deep Learning论文笔记之(四)CNN卷积神经网络推导和实现(转)

    Deep Learning论文笔记之(四)CNN卷积神经网络推导和实现 zouxy09@qq.com http://blog.csdn.net/zouxy09          自己平时看了一些论文, ...

  5. 论文笔记之:Visual Tracking with Fully Convolutional Networks

    论文笔记之:Visual Tracking with Fully Convolutional Networks ICCV 2015  CUHK 本文利用 FCN 来做跟踪问题,但开篇就提到并非将其看做 ...

  6. Deep Learning论文笔记之(八)Deep Learning最新综述

    Deep Learning论文笔记之(八)Deep Learning最新综述 zouxy09@qq.com http://blog.csdn.net/zouxy09 自己平时看了一些论文,但老感觉看完 ...

  7. Twitter 新一代流处理利器——Heron 论文笔记之Heron架构

    Twitter 新一代流处理利器--Heron 论文笔记之Heron架构 标签(空格分隔): Streaming-process realtime-process Heron Architecture ...

  8. Deep Learning论文笔记之(六)Multi-Stage多级架构分析

    Deep Learning论文笔记之(六)Multi-Stage多级架构分析 zouxy09@qq.com http://blog.csdn.net/zouxy09          自己平时看了一些 ...

  9. Multimodal —— 看图说话(Image Caption)任务的论文笔记(一)评价指标和NIC模型

    看图说话(Image Caption)任务是结合CV和NLP两个领域的一种比较综合的任务,Image Caption模型的输入是一幅图像,输出是对该幅图像进行描述的一段文字.这项任务要求模型可以识别图 ...

随机推荐

  1. ActiveMQ安装与入门程序 & JMS的消息结构

    1.Activemq安装 直接到官网下载:记住apache的官网是域名反过来,比如我们找activemq就是activemq.apache.org. 最新版本要求最低的JDK是8,所以最好在电脑装多个 ...

  2. Linux内存管理5---物理内存管理

    1.前言 本文所述关于内存管理的系列文章主要是对陈莉君老师所讲述的内存管理知识讲座的整理. 本讲座主要分三个主题展开对内存管理进行讲解:内存管理的硬件基础.虚拟地址空间的管理.物理地址空间的管理. 本 ...

  3. jvm系列五、jvm垃圾回收机制、jvm各种参数及调优

    转载自:http://yufenfei.iteye.com/blog/1746914 尊重原创. 一.GC有两种类型:Scavenge GC 和Full GC 1.Scavenge GC 一般情况下, ...

  4. Python3学习笔记21-实例属性和类属性

    由于Python是动态语言,根据类创建的实例可以任意绑定属性. 给实例绑定属性的方法是通过实例变量,或者通过self变量: class Student(object): def __init__(se ...

  5. ajax post 传递数组参数

    1.前言 此文章仅作为记录,方便查阅. 2.代码 javascript: var idArr = ['one','two','Three']; $.ajax({ type: 'POST', data ...

  6. java比较两个对象是否相等?

    1.判断两个对象是否是同一个引用对象则用==,"=="比的是地址.因为如果地址相同,则就是同一个对象(java中如果两对象(obj1,obj2)相等,那么在修改obj2的时候,ob ...

  7. Java 程序员必须收藏的资源大全

    Java 程序员必须收藏的资源大全 Java(27) 古董级工具 这些工具伴随着Java一起出现,在各自辉煌之后还在一直使用. Apache Ant:基于XML的构建管理工具.官网 cglib:字节码 ...

  8. SPOJ-SERVICE 线性dp+维度压缩

    还是线性dp,有点感觉了,另外这个问题也可以用滚动数组 /* 依然是先按照阶段i划分, dp[i][j][k]表示完成第i个请求时,两个员工分别在j位置和k位置的费用(还有一个员工一定在位置p) dp ...

  9. hdu4419

    对于这类面积覆盖的题,大致就两点要注意的 1.同一把矩形放在笛卡尔坐标系上做 2.pushup函数要注意下细节:及在统计子区间和之前要先判断是否有子区间 用sum数组来保存区间被覆盖的情况,如果遇到多 ...

  10. 性能测试九:jmeter进阶之beanshell的使用+断言

    一.使用 BeanShell使用方式一 BeanShell面板上写脚本 // 从vars中获取用户定义的参数,并转换为int类型 int p_skuId = Integer.parseInt(vars ...