原文:Databricks 第5篇:Databricks文件系统(DBFS)

Databricks 文件系统 DBFS,Databricks File System 是一个装载到 Azure Databricks 工作区的分布式文件系统,可以在 Azure Databricks 群集上使用。 一个存储对象是一个具有特定格式的文件,不同的格式具有不同的读取和写入的机制。 DBFS 是基于可缩放对象存储的抽象,可以根据用户的需要动态增加和较少存储空间的使用量,Azure Dat ...

2021-01-12 14:24 0 1070 推荐指数:

查看详情

Databricks 第7:管理Secret

Azure中的Secret是指密码、凭证和密钥等,举个例子,使用Azure Databricks Secret来存储凭证,并在notebook和job中引用它们,而不是直接在notebook中输入凭据。 Secret Scope是Secret的集合,每一个Secret是由name唯一确定 ...

Wed Jan 20 18:05:00 CST 2021 0 397
Databricks 第10:Job

计划(schedule),就可以自动实现数据的维护。 用户也可以通过Databricks UI来监控J ...

Wed Jan 27 21:44:00 CST 2021 0 343
Databricks 第1:初识Databricks,创建工作区、集群和Notebook

Azure Databricks是一个可扩展的数据分析平台,基于Apache Spark。Azure Databricks 工作区(Workspace)是一个交互式的环境,工作区把对象(notebook、library、dashboards、experiments)组织成文件夹,用于数据集成和数 ...

Wed Dec 23 02:45:00 CST 2020 0 1589
Databricks 第4:pyspark.sql 分组统计和窗口

对数据分析时,通常需要对数据进行分组,并对每个分组进行聚合运算。在一定意义上,窗口也是一种分组统计的方法。 分组数据 DataFrame.groupBy()返回的是GroupedData类,可以对 ...

Mon Jan 11 16:38:00 CST 2021 0 1308
Databricks说的Lakehouse是什么?

在过去的几年里,Lakehouse作为一种新的数据管理范式,已独立出现在Databricks的许多用户和应用案例中。在这篇文章中,我们将阐述这种新范式以及它相对于之前方案的优势。 数据仓库在决策支持和商业智能应用方面有着悠久的历史。自20世纪80年代末问世以来,数据仓库技术一直在持续 ...

Tue Nov 17 19:30:00 CST 2020 2 586
 
粤ICP备18138465号  © 2018-2025 CODEPRJ.COM