【文章推荐】基于Apache Hudi + Flink的亿级数据入湖实践

原文：基于Apache Hudi + Flink的亿级数据入湖实践

本次分享分为个部分介绍Apache Hudi的应用与实践实时数据落地需求演进基于Spark Hudi的实时数据落地应用实践基于Flink自定义实时数据落地实践基于Flink Hudi的应用实践后续应用规划及展望 . 实时数据落地需求演进实时平台上线后，主要需求是开发实时报表，即抽取各类数据源做实时etl后，吐出实时指标到oracle库中供展示查询。随着实时平台的稳定及推广开放，各种 ...

2022-01-09 06:10 0 746 推荐指数：

查看详情

Uber基于Apache Hudi构建PB级数据湖实践

1. 引言从确保准确预计到达时间到预测最佳交通路线，在Uber平台上提供安全、无缝的运输和交付体验需要可靠、高性能的大规模数据存储和分析。2016年，Uber开发了增量处理框架Apache Hudi，以低延迟和高效率为关键业务数据管道赋能。一年后，我们开源了该解决方案，以使得其他有需要的组织 ...

字节跳动基于Apache Hudi构建EB级数据湖实践

来自字节跳动的管梓越同学一篇关于Apache Hudi在字节跳动推荐系统中EB级数据量实践的分享。接下来将分为场景需求、设计选型、功能支持、性能调优、未来展望五部分介绍Hudi在字节跳动推荐系统中的实践。在推荐系统中，我们在两个场景下使用数据湖我们使用 ...

基于Apache Hudi 的CDC数据入湖

作者：李少锋文章目录：一、CDC背景介绍二、CDC数据入湖三、Hudi核心设计四、Hudi未来规划 1. CDC背景介绍首先我们介绍什么是CDC？CDC的全称是Change data Capture，即变更数据捕获，它是数据库领域非常常见的技术，主要用于捕获数据库的一些 ...

数据湖-Apache Hudi

Hudi特性数据湖处理非结构化数据、日志数据、结构化数据支持较快upsert/delete, 可插入索引 Table Schema 小文件管理Compaction ACID语义保证,多版本保证并具有回滚功能 savepoint 用户数据 ...

Apache Hudi 在 B 站构建实时数据湖的实践

简介： B 站选择 Flink + Hudi 的数据湖技术方案，以及针对其做出的优化。本文作者喻兆靖，介绍了为什么 B 站选择 Flink + Hudi 的数据湖技术方案，以及针对其做出的优化。主要内容为：传统离线数仓痛点数据湖技术方案 Hudi 任务稳定性 ...

基于 Flink CDC + Hudi 湖仓一体方案实践

一、Flink-CDC 2.0 Flink CDC Connectors 是 Apache Flink 的一个 source 端的连接器，目前 2.0 版本支持从 MySQL 以及 Postgres 两种数据源中获取数据，2.1 版本社区确定会支持 Oracle，MongoDB 数据 ...

Hudi自带工具DeltaStreamer的实时入湖最佳实践

摘要：本文介绍如何使用Hudi自带入湖工具DeltaStreamer进行数据的实时入湖。本文分享自华为云社区《华为FusionInsight MRS实战 - Hudi实时入湖之DeltaStreamer工具最佳实践》，作者：晋红轻。背景传统大数据平台的组织架构是针对离线 ...

使用Apache Spark和Apache Hudi构建分析数据湖

1. 引入大多数现代数据湖都是基于某种分布式文件系统（DFS），如HDFS或基于云的存储，如AWS S3构建的。遵循的基本原则之一是文件的“一次写入多次读取”访问模型。这对于处理海量数据非常有用，如数百GB到TB的数据。但是在构建分析数据湖时，更新数据并不罕见。根据不同场景，这些更新频率 ...

原文：基于Apache Hudi + Flink的亿级数据入湖实践

相关推荐

相关标签