原书章节 原书章节题目 翻译文章序号 翻译文章题目 链接
4.1 Joining Hadoop(1) MapReduce 连接:重分区连接(Repartition join) http://www.cnblogs.com/datacloud/p/3578509.html
4.1.1 Repartition join Hadoop(1) MapReduce 连接:重分区连接(Repartition join) http://www.cnblogs.com/datacloud/p/3578509.html
4.1.2 Replicated joins Hadoop(2) MapReduce 连接:复制连接(Replication join) http://www.cnblogs.com/datacloud/p/3579333.html
4.1.3 Semi-joins Hadoop(3) MapReduce 连接:半连接(Semi-join) http://www.cnblogs.com/datacloud/p/3579975.html
4.1.4 Picking the best join strategy for your data Hadoop(4) MapReduce 连接:选择最佳连接策略 http://www.cnblogs.com/datacloud/p/3582113.html
4.2 Sorting Hadoop(5) MapReduce 排序:次排序(Secondary sort) http://www.cnblogs.com/datacloud/p/3584640.html
4.2.1 Secondary sort Hadoop(5) MapReduce 排序:次排序(Secondary sort) http://www.cnblogs.com/datacloud/p/3584640.html
4.2.2 Total order sorting Hadoop(6) MapReduce 排序:总排序(Total order sorting) http://www.cnblogs.com/datacloud/p/3586761.html
4.3 Sampling Hadoop(7) MapReduce:抽样(Sampling) http://www.cnblogs.com/datacloud/p/3588120.html
6.1 Measuring MapReduce and your environment Hadoop(8) MapReduce 性能调优:性能测量(Measuring) http://www.cnblogs.com/datacloud/p/3589875.html
6.2 Determining the cause of your performance woes Hadoop(9) MapReduce 性能调优:理解性能瓶颈,诊断map性能瓶颈 http://www.cnblogs.com/datacloud/p/3591981.html
6.2.1 Understanding what can impact MapReduce job performance Hadoop(9) MapReduce 性能调优:理解性能瓶颈,诊断map性能瓶颈 http://www.cnblogs.com/datacloud/p/3591981.html
6.2.2 Map woes Hadoop(9) MapReduce 性能调优:理解性能瓶颈,诊断map性能瓶颈 http://www.cnblogs.com/datacloud/p/3591981.html
6.2.3 Reducer woes Hadoop(10) MapReduce 性能调优:诊断reduce性能瓶颈 http://www.cnblogs.com/datacloud/p/3595682.html
6.2.4 General task woes Hadoop(11) MapReduce 性能调优:诊断一般性能瓶颈 http://www.cnblogs.com/datacloud/p/3596294.html
6.2.5 Hardware woes Hadoop(12) MapReduce 性能调优:诊断硬件性能瓶颈 http://www.cnblogs.com/datacloud/p/3597909.html
6.4.3 Optimizing the shuffle and sort phase Hadoop(13) MapReduce 性能调优:优化洗牌(shuffle)和排序阶段 http://www.cnblogs.com/datacloud/p/3599920.html
6.4.4 Skew mitigation Hadoop(14) MapReduce 性能调优:减小数据倾斜的性能损失 http://www.cnblogs.com/datacloud/p/3601624.html
6.4.5 Optimizing user space Java in MapReduce Hadoop(15) MapReduce 性能调优:优化MapReduce的用户JAVA代码 http://www.cnblogs.com/datacloud/p/3603191.html
6.4.6 Data serialization Hadoop(16) MapReduce 性能调优:优化数据序列化 http://www.cnblogs.com/datacloud/p/3608591.html
6.5 Chapter summary  Hadoop(16)  MapReduce 性能调优:优化数据序列化 http://www.cnblogs.com/datacloud/p/3608591.html
5.1 Working with small files Hadoop(17) MapReduce 文件处理:小文件 http://www.cnblogs.com/datacloud/p/3611459.html
5.2 Efficient storage with compression(tech 25, 26) Hadoop(19) MapReduce 文件处理:基于压缩的高效存储(一) http://www.cnblogs.com/datacloud/p/3612817.html
5.2 Efficient storage with compression(tech 27) Hadoop(19) MapReduce 文件处理:基于压缩的高效存储(一) http://www.cnblogs.com/datacloud/p/3616544.html
Appendix A.10 LZOP Hadoop(20) 附录A.10 压缩格式LZOP编译安装配置 http://www.cnblogs.com/datacloud/p/3617586.html
Appendix D.1 An optimized repartition join framework Hadoop(21) 附录D.1 优化后的重分区框架 http://www.cnblogs.com/datacloud/p/3617079.html
Appendix D.2 A replicated join framework Hadoop(22) 附录D.2 复制连接框架  http://www.cnblogs.com/datacloud/p/3617078.html

[大牛翻译系列]Hadoop 翻译文章索引的更多相关文章

  1. [大牛翻译系列]Hadoop(19)MapReduce 文件处理:基于压缩的高效存储(二)

    5.2 基于压缩的高效存储(续) (仅包括技术27) 技术27 在MapReduce,Hive和Pig中使用可分块的LZOP 如果一个文本文件即使经过压缩后仍然比HDFS的块的大小要大,就需要考虑选择 ...

  2. [大牛翻译系列]Hadoop(18)MapReduce 文件处理:基于压缩的高效存储(一)

    5.2 基于压缩的高效存储 (仅包括技术25,和技术26) 数据压缩可以减小数据的大小,节约空间,提高数据传输的效率.在处理文件中,压缩很重要.在处理Hadoop的文件时,更是如此.为了让Hadoop ...

  3. [大牛翻译系列]Hadoop(20)附录A.10 压缩格式LZOP编译安装配置

    附录A.10 LZOP LZOP是一种压缩解码器,在MapReduce中可以支持可分块的压缩.第5章中有一节介绍了如何应用LZOP.在这一节中,将介绍如何编译LZOP,在集群做相应配置. A.10.1 ...

  4. [大牛翻译系列]Hadoop(9)MapReduce 性能调优:理解性能瓶颈,诊断map性能瓶颈

    6.2 诊断性能瓶颈 有的时候作业的执行时间会长得惊人.想靠猜也是很难猜对问题在哪.这一章中将介绍如何界定问题,找到根源.涉及的工具中有的是Hadoop自带的,有的是本书提供的. 系统监控和Hadoo ...

  5. [大牛翻译系列]Hadoop系列性能部分完结

    Hadoop系列性能部分完结.其它的部分发布时间待定. Hadoop系列将不再一日一篇,开始不定期发布.

  6. [大牛翻译系列]Hadoop(6)MapReduce 排序:总排序(Total order sorting)

    4.2.2 总排序(Total order sorting) 有的时候需要将作业的的所有输出进行总排序,使各个输出之间的结果是有序的.有以下实例: 如果要得到某个网站中最受欢迎的网址(URL),就需要 ...

  7. [大牛翻译系列]Hadoop(5)MapReduce 排序:次排序(Secondary sort)

    4.2 排序(SORT) 在MapReduce中,排序的目的有两个: MapReduce可以通过排序将Map输出的键分组.然后每组键调用一次reduce. 在某些需要排序的特定场景中,用户可以将作业( ...

  8. [大牛翻译系列]Hadoop(22)附录D.2 复制连接框架

    附录D.2 复制连接框架 复制连接是map端连接,得名于它的具体实现:连接中最小的数据集将会被复制到所有的map主机节点.复制连接的实现非常直接明了.更具体的内容可以参考Chunk Lam的<H ...

  9. [大牛翻译系列]Hadoop(21)附录D.1 优化后的重分区框架

    附录D.1 优化后的重分区框架 Hadoop社区连接包需要将每个键的所有值都读取到内存中.如何才能在reduce端的连接减少内存开销呢?本文提供的优化中,只需要缓存较小的数据集,然后在连接中遍历较大数 ...

随机推荐

  1. 通过布赛尔曲线以及CAShapeLayer的strokeStart 、strokeEnd 属性来实现一个圆形进度条

    #import <UIKit/UIKit.h> @interface CircleProgressView : UIView /**起始值(0-1)*/ @property(nonatom ...

  2. javass 视频笔记二 (关键字,标示符,常量变量,运算符和if-else)

    1,java的关键字和标识符2,java的基本数据类型3,变量和常量4,java的运算符5,if-else if - else表达式1,java的关键字和标识符      1.1,所有关键字都要小写 ...

  3. C#中常用的排序算法的时间复杂度和空间复杂度

    常用的排序算法的时间复杂度和空间复杂度   常用的排序算法的时间复杂度和空间复杂度 排序法 最差时间分析 平均时间复杂度 稳定度 空间复杂度 冒泡排序 O(n2) O(n2) 稳定 O(1) 快速排序 ...

  4. 强大的JQuery(三)--操作html与遍历

    前两篇博客讲到了JQuery的基础知识以及其动画效果,本篇将为大家介绍jquery操纵html以及jquery的遍历. 一.jquery操作html 1.获取内容和属性 text() - 设置或返回所 ...

  5. .NET强制进行即时垃圾回收

    大家知道,.NET控制系统垃圾回收(一种自动回收未使用内存的服务)是自动的. 可有时候需要手动强制进行即时垃圾回收. 代码如下: GC.Collect();

  6. 【转】驱动中的类class和节点

    原文出处:http://blog.chinaunix.net/uid-23036581-id-2230558.html 一个类是一个设备的高级视图, 它抽象出低级的实现细节. 驱动可以见到一个SCSI ...

  7. 系统磁盘空间/dev/xvda1占满原因分析

    由于项目原因需要定期检查磁盘空间占用情况,常用检查命令如下: 1.查看磁盘空间大小 df -lh 2.查看对应文件大小 du --max-depth=1 -h / 于一日发现在使用Flume + Ka ...

  8. 【NodeJS】---express配置ejs mongoose route等

    express创建项目 命令行下: express prj_name cd prj_name && npm install ejs html var ejs = require('ej ...

  9. Slickflow.NET 开源工作流引擎基础介绍(二) -- 引擎组件和业务模块的交互

    集成流程引擎的必要性 业务过程的变化是在BPM系统中常见的现象,企业管理层需要不断优化组织架构,改造业务流程,不可避免地带来了业务流程的变化,企业信息系统就会随之面临重构的可能性.一种直接的方式是改造 ...

  10. MVC中验证码的生成

    在项目中验证码的生成通常是需要页面无刷新的,所以验证码图片实际是跟在某个input后面的img,通过控制该img来控制验证码显示的位置,例如: <div> <input id=&qu ...