原文:【面试题】大数据开发岗位

某公司面试题: 阐述数据库的三大范式 Linux 自带的常用命令举例至少 个 Spark 有哪些聚合类的算子,我们应该尽量避免什么类型的算子 Hive 和 HBase 的区别 你了解设计模式吗 写出你知道的设计模式。 常见的GC算法有哪些 kafka 的数据存在内存还是磁盘 什么是shuffle 写出你知道的Spark Shuffle 相关参数配置。 有一个 G的文件要存入HDFS,描述一下存储过 ...

2020-08-28 12:54 0 467 推荐指数:

查看详情

面试题大数据开发岗位

Linux 1、使用 linux 命令从字符串 apple@163.com 中提取 apple 2、将 apple@163.com 替换为 apple@qq.com 3、配置crontab 定时调度,每小时10分执行 /data/checklog.sh 脚本 数据库 1、Oracle 数据 ...

Fri Sep 04 06:11:00 CST 2020 0 523
面试题大数据开发第1轮面试

面试总结: 1、HDFS小文件 小文件的产生原因 1) 数据本身的特点:比如我们在 HDFS 上存储大量的图片、短视频、短音频等文件,这些文件本身较小,达不到一个block的大小,而且数量众多。 2) MapReduce产生:例如使用查询一张含有海量数据的表,然后存储在另外一张表中,而这个查询 ...

Sat Aug 29 23:29:00 CST 2020 0 724
大数据面试题总结

面试题总结: 分布式文件系统(Distributed File System)是指文件系统管理的物理存储资源不一定直接连接在本地节点上,而是通过计算机网络与节点相连。分布式文件系统的设计基于客户机/服务器模式。 [优点] 支持超大文件 超大文件在这里指的是几百M,几百GB,甚至几TB大小 ...

Wed Nov 22 18:34:00 CST 2017 0 3933
大数据面试题

判断题: 1.如果 NameNode 意外终止,SecondaryNameNode 会接替它使集群继续工作。(错误)   分析:  SecondaryNameNode是帮助恢复,而不是替代 S ...

Sat Sep 15 00:34:00 CST 2018 0 1189
苏宁大数据面试题

1. hadoop 使用什么版本,CDH版本号,是5.3.6 。hadoop的版本是2.72,记住cdh的版本号和hadoop版本号不一样。2. flume是单节点采集数据还是多节点采集数据?flume是自定义框架还是用官方提供的框架?官方框架开发中有什么问题 ...

Sun Jun 16 21:13:00 CST 2019 0 515
大数据面试题(一)

一、.hdfs写文件的步骤 答案: (1)client向NameNode申请上传…/xxx.txt文件 (2)NN向client响应可以上传文件 (3)Client向NameNode申请Dat ...

Mon Feb 25 05:57:00 CST 2019 0 624
大数据高频面试题

面试中的问题(重点)** 1. RDD的特性(RDD的解释)1.RDD可以看做是一些列partition所组成的2.RDD之间的依赖关系3.算子是作用在partition之上的4.分区器是作用在kv形式的RDD上5.partition提供的最佳计算位置,利于数据处理的本地化即计算向数据移动 ...

Tue Sep 10 22:40:00 CST 2019 0 368
大数据面试题(一)----HADOOP 面试题

1. 下列哪项通常是集群的最主要瓶颈(C) A. CPU B. 网络 C. 磁盘IO D. 内存 2. 下列哪项可以作为集群的管理工具?(C) A.Puppet B.Pdsh C.Cl ...

Thu Feb 06 00:55:00 CST 2020 0 2348
 
粤ICP备18138465号  © 2018-2026 CODEPRJ.COM