【文章推荐】Apache Spark源码走读之24 -- Sort-based Shuffle的设计与实现

原文：Apache Spark源码走读之24 -- Sort-based Shuffle的设计与实现

欢迎转载，转载请注明出处。概要 Spark . 中对spark core的一个重大改进就是引入了sort based shuffle处理机制，本文就该处理机制的实现进行初步的分析。 Sort based Shuffle之初体验通过一个小的实验来直观的感受一下sort based shuffle算法会产生哪些中间文件，具体实验步骤如下所述。步骤：修改conf spark default.c ...

2014-09-19 10:22 2 3954 推荐指数：

查看详情

Spark源码分析之Sort-Based Shuffle读写流程

一、概述我们知道Spark Shuffle机制总共有三种： 1.未优化的Hash Shuffle：每一个ShuffleMapTask都会为每一个ReducerTask创建一个单独的文件，总的文件数是S * R,不仅文件数量很多，造成频繁的磁盘和网络I/O,而且内存负担也很大，GC频繁 ...

sort-based shuffle的核心：org.apache.spark.util.collection.ExternalSorter

依据Spark 1.4版在哪里会用到它 ExternalSorter是Spark的sort形式的shuffle实现的关键。SortShuffleWriter使用它，把RDD分区中的数据写入文件。 ExternalSorter的注释这个类的注释提供了关于它的设计的很多信息 ...

Apache Spark源码走读之16 -- spark repl实现详解

欢迎转载，转载请注明出处,徽沪一郎。概要之所以对spark shell的内部实现产生兴趣全部缘于好奇代码的编译加载过程，scala是需要编译才能执行的语言，但提供的scala repl可以实现代码的实时交互式执行，这是为什么呢？既然scala已经提供了repl，为什么spark还要 ...

Apache Spark源码走读之13 -- hiveql on spark实现详解

欢迎转载，转载请注明出处，徽沪一郎概要在新近发布的spark 1.0中新加了sql的模块，更为引人注意的是对hive中的hiveql也提供了良好的支持，作为一个源码分析控，了解一下spark是如何完成对hql的支持是一件非常有趣的事情。 Hive简介 Hive的由来以下部分摘自 ...

Apache Spark源码走读之9 -- Spark源码编译

欢迎转载，转载请注明出处，徽沪一郎。概要本来源码编译没有什么可说的，对于java项目来说，只要会点maven或ant的简单命令，依葫芦画瓢，一下子就ok了。但到了Spark上面，事情似乎不这么简单，按照spark officical document上的来做，总会出现这样或那样的编译 ...

Apache Spark源码走读之14 -- Graphx实现剖析

在Spark上的并行化实现，同时提供了丰富的API接口。本文就Graphx的代码架构及pagerank在 ...

原文：Apache Spark源码走读之24 -- Sort-based Shuffle的设计与实现

相关推荐

相关标签