【文章推荐】Apache Spark源码走读之9 -- Spark源码编译

原文：Apache Spark源码走读之9 -- Spark源码编译

欢迎转载，转载请注明出处，徽沪一郎。概要本来源码编译没有什么可说的，对于java项目来说，只要会点maven或ant的简单命令，依葫芦画瓢，一下子就ok了。但到了Spark上面，事情似乎不这么简单，按照spark officical document上的来做，总会出现这样或那样的编译错误，让人懊恼不已。今天闲来无事，又重试了一把，居然o了，做个记录，以备后用。准备我的编译机器上安装的Li ...

2014-05-16 16:44 4 5352 推荐指数：

查看详情

Apache Spark源码走读之8 -- Spark on Yarn

欢迎转载，转载请注明出处，徽沪一郎。概要 Hadoop2中的Yarn是一个分布式计算资源的管理平台，由于其有极好的模型抽象，非常有可能成为分布式计算资源管理的事实标准。其主要职责将是分布式计算集群的管理，集群中计算资源的管理与分配。 Yarn为应用程序开发提供了比较好的实现标准，Spark ...

Apache Spark源码走读之1 -- Spark论文阅读笔记

欢迎转载，转载请注明出处，徽沪一郎。楔子源码阅读是一件非常容易的事，也是一件非常难的事。容易的是代码就在那里，一打开就可以看到。难的是要通过代码明白作者当初为什么要这样设计，设计之初要解决的主要问题是什么。在对Spark的源码进行具体的走读之前，如果想要快速对Spark的有一个整体性 ...

Apache Spark源码走读之13 -- hiveql on spark实现详解

欢迎转载，转载请注明出处，徽沪一郎概要在新近发布的spark 1.0中新加了sql的模块，更为引人注意的是对hive中的hiveql也提供了良好的支持，作为一个源码分析控，了解一下spark是如何完成对hql的支持是一件非常有趣的事情。 Hive简介 Hive的由来以下部分摘自 ...

Apache Spark源码走读之12 -- Hive on Spark运行环境搭建

欢迎转载，转载请注明出处，徽沪一郎。楔子 Hive是基于Hadoop的开源数据仓库工具，提供了类似于SQL的HiveQL语言，使得上层的数据分析人员不用知道太多MapReduce的知识就能对存 ...

Apache Spark源码走读之16 -- spark repl实现详解

欢迎转载，转载请注明出处,徽沪一郎。概要之所以对spark shell的内部实现产生兴趣全部缘于好奇代码的编译加载过程，scala是需要编译才能执行的语言，但提供的scala repl可以实现代码的实时交互式执行，这是为什么呢？既然scala已经提供了repl，为什么spark还要 ...

Apache Spark源码走读之4 -- DStream实时流数据处理

欢迎转载，转载请注明出处，徽沪一郎。 Spark Streaming能够对流数据进行近乎实时的速度进行数据处理。采用了不同于一般的流式数据处理模型，该模型使得Spark Streaming有非常高的处理速度，与storm相比拥有更高的吞能力。本篇简要分析Spark Streaming的处理 ...

Apache Spark源码走读之5 -- DStream处理的容错性分析

欢迎转载，转载请注明出处，徽沪一郎，谢谢。在流数据的处理过程中，为了保证处理结果的可信度(不能多算，也不能漏算)，需要做到对所有的输入数据有且仅有一次处理。在Spark Streaming的处理机制中，不能多算，比较容易理解。那么它又是如何作到即使数据处理结点被重启，在重启之后这些数据也会被 ...

Apache Spark源码走读之11 -- sql的解析与执行

欢迎转载，转载请注明出处，徽沪一郎。概要在即将发布的spark 1.0中有一个新增的功能，即对sql的支持，也就是说可以用sql来对数据进行查询，这对于DBA来说无疑是一大福音，因为以前的知识继续生效，而无须去学什么scala或其它script. 一般来说任意一个sql子系统都需要 ...

原文：Apache Spark源码走读之9 -- Spark源码编译

相关推荐

相关标签