【文章推荐】Apache Spark源码走读之3 -- Task运行期之函数调用关系分析

原文：Apache Spark源码走读之3 -- Task运行期之函数调用关系分析

欢迎转载，转载请注明出处，徽沪一郎。概要本篇主要阐述在TaskRunner中执行的task其业务逻辑是如何被调用到的，另外试图讲清楚运行着的task其输入的数据从哪获取，处理的结果返回到哪里，如何返回。准备 spark已经安装完毕 spark运行在local mode或local cluster mode local cluster mode local cluster模式也称为伪分布式，可 ...

2014-04-23 15:07 0 11013 推荐指数：

查看详情

Apache Spark源码走读之12 -- Hive on Spark运行环境搭建

欢迎转载，转载请注明出处，徽沪一郎。楔子 Hive是基于Hadoop的开源数据仓库工具，提供了类似于SQL的HiveQL语言，使得上层的数据分析人员不用知道太多MapReduce的知识就能对存储于Hdfs中的海量数据进行分析。由于这一特性而收到广泛的欢迎。 Hive的整体框架中有一个重要 ...

Apache Spark源码走读之10 -- 在YARN上运行SparkPi

y欢迎转载，转载请注明出处，徽沪一郎。概要 “spark已经比较头痛了，还要将其运行在yarn上，yarn是什么，我一点概念都没有哎，再怎么办啊。不要跟我讲什么原理了，能不能直接告诉我怎么将spark在yarn上面跑起来，I'm a dummy, just told me how to do ...

Apache Spark源码走读之2 -- Job的提交与运行

欢迎转载，转载请注明出处，徽沪一郎。概要本文以wordCount为例，详细说明spark创建和运行job的过程，重点是在进程及线程的创建。实验环境搭建在进行后续操作前，确保下列条件已满足。下载spark binary 0.9.1 安装scala 安装sbt ...

Apache Spark源码走读之5 -- DStream处理的容错性分析

再次处理呢？环境搭建为了有一个感性的认识，先运行一下简单的Spark Streaming示例。首 ...

Apache Spark源码走读之6 -- 存储子系统分析

欢迎转载，转载请注明出处，徽沪一郎。楔子 Spark计算速度远胜于Hadoop的原因之一就在于中间结果是缓存在内存而不是直接写入到disk，本文尝试分析Spark中存储子系统的构成，并以数据写入和数据读取为例，讲述清楚存储子系统中各部件的交互关系。存储子系统概览上图是Spark ...

Apache Spark源码走读之7 -- Standalone部署方式分析

欢迎转载，转载请注明出处，徽沪一郎。楔子在Spark源码走读系列之2中曾经提到Spark能以Standalone的方式来运行cluster，但没有对Application的提交与具体运行流程做详细的分析，本文就这些问题做一个比较详细的分析，并且对在standalone模式下如何实现HA进行 ...

Apache Spark源码走读之9 -- Spark源码编译

欢迎转载，转载请注明出处，徽沪一郎。概要本来源码编译没有什么可说的，对于java项目来说，只要会点maven或ant的简单命令，依葫芦画瓢，一下子就ok了。但到了Spark上面，事情似乎不这么简单，按照spark officical document上的来做，总会出现这样或那样的编译 ...

Apache Spark源码走读之8 -- Spark on Yarn

支持Yarn部署，本文将就Spark如何实现在Yarn平台上的部署作比较详尽的分析。 Spark S ...

原文：Apache Spark源码走读之3 -- Task运行期之函数调用关系分析

相关推荐

相关标签