暴走大数据

从部署到实践，即刻拥有你的专属龙虾助手

OpenClaw开发者专区🦞🦞🦞

自行/邀约他人一键搬运博客，享价值百万资源包

腾讯云自媒体同步曝光计划

往期视频·干货材料·成员作品 最新动态

腾讯技术创作特训营知识专栏

新邀入驻腾讯云开发者社区，福利多多！

之前我们介绍了HBASE的存储机制，HBASE存储数据其底层使用的是HDFS来作为存储介质，HBASE的每一张表对应的HDFS目录上的一个文件夹，文件夹名是以HBASE表的名字来命名（如果没有使用命名空间，那么默认是在default目录下）。在表文件夹下存放着若干个region命名的文件夹，而region文件夹中的每个列族也是用文件夹进行存储的，每个列族中存储的就是实际的数据，以HFile的形式存在。

HBase BulkLoad 原理及批量写入数据实战

了解过hudi的新手或者专家都知道，hudi不管是COW还是MOR表，其文件还是存储在hdfs上。因为下来介绍我在学习hudi压缩的一些东西，所以下方就以MOR表文件做下介绍。下方会由浅入深尝试说明压缩计划和压缩策略等等之间的关系。

Apache Hudi压缩Compaction源码解析

主要用于数据初始化导入。Bulk Insert不会进行数据去重，需要用户在数据插入前进行数据去重

Flink写入数据到Hudi数据湖的各种方式

1.Flink 三种Join的代码测试
1.1 数据源
1.2 join
1.3 intervalJoin
1.3.1 intervalJoin API用法
1.3.2 intervalJoin SQL用法
1.4 coGroup

Flink双流及多流Join 、IntervalJoin、coGroupJoin的区别与生产使用

时间轮是一个高性能、低消耗的数据结构，它适合用非准实时，延迟的短平快任务，例如心跳检测。在Netty、Kafka、Zookeeper中都有使用。

时间轮在Netty、Kafka中的应用

为了实现并行执行，Flink应用会将算子划分为不同任务，然后将这些任务分配到集群中的不同进程上去执行。和很多其他分布式系统一样，Flink应用的性能很大程度上取决于任务的调度方式。任务被分配到的工作进程、任务间的共存情况以及工作进程中的任务数都会对应用的性能产生显著影响。本节中我们就讨论一下如何通过调整默认行为以及控制作业链与作业分配（处理槽共享组）来提高应用的性能。

Flink控制任务调度：作业链与处理槽共享组(SlotSharingGroup)

将maven的安装包上传到centos7服务器上，并解压，然后配置系统环境变量即可

Hudi与Spark和HDFS的集成安装使用

广告主和代理商通过广告投放平台来进行广告投放，由多个媒介进行广告展示 ，从而触达到潜在用户。整个过程中会产生各种各样的数据，比如展现数据、点击数据。其中非常重要的数据是计费数据，以计费日志为依据向上可统计如行业维度、客户维度的消耗数据，分析不同维度的计费数据有助于业务及时进行商业决策，但目前部门内消耗统计以离线为主，这种T+1延迟的结果已经无法满足商业分析同学的日常分析需求，所以我们的目标为：建设口径统一的实时消耗数据，结合BI工具的自动化配置和展现能力，满足业务实时多维消耗分析，提高数据运营的效率和数据准确性。

腾讯广告业务基于Apache Flink + Hudi的批流一体实践

官方推荐的 seatunnel1.5.7+spark2.4.8+scala2.11

基于Seatunnel连通Hive和ClickHouse实战

the output elements are forwarded to the local subtask of the next operation.

Flink 上下游算子并发之间的数据传递方式

最近做的一个需求，在一个Flink程序中，根据数据里面的ip进行分流，每个流对应一个ES的索引，一共有14个索引，开启checkpoint。

Flink写Elasticsearch导致Checkpoint频繁失败的解决方案

3.2.0 版本包含许多新功能和改进。本文将重点介绍一些最突出的新功能。有关更改的完整列表，请务必查看发行说明。您还可以观看发布视频，了解 Apache Kafka 3.2.0 中的新功能摘要。

Apache Kafka 3.2.0 重磅发布！

为了解决Flink作业使用RocksDB状态后端时的内存超用问题，Flink早在1.10版本就实现了RocksDB的托管内存(managed memory)机制。用户只需启用state.backend.rocksdb.memory.managed参数(默认即为true)，再设定合适的TaskManager托管内存比例taskmanager.memory.managed.fraction，即可满足多数情况的需要。

Flink RocksDB托管内存机制的幕后—Cache & Write Buffer Manager

doris是一个基于mpp（massively parallel processing，即大规模并行处理）的交互式sql数据仓库,是一个面向多种数据分析场景的，兼容mysql协议的，高性能的，分布式关系型列式数据库，用于报告和分析。

Apache Doris，MPP架构数据库王者学习总结

前言
1.watermark特点
2.窗口
触发的条件
窗口的划分
窗口及水印触发的解释
3.代码
4.测试数据源
5.遇到的问题
6.问题排查
7.问题解决

Flink水印不能触发窗口计算问题详解

Hbase提供了跨集群的数据同步方式Replication,可通过自定义Replication Endpoint，把消息写入kafka，先来了解Hbase Replication集群之间进行复制同步的过程，整体数据复制流程如下图：

Hbase WAL日志数据实时增量推送至Kafka

视图是由若干个字段以及若干条记录构成(也常称为虚标)，它与表有很多相似的地方，视图中的数据源来自于原表,视图本身不存储数据,视图它保存的仅仅是一条select语句，并没有保存真正的数据。

「ClickHouse系列」ClickHouse中的物化视图详解

本文主要介绍将flink任务运行的metric发送到Prometheus，通过grafana报表工具展示。

基于PushGateway+Prometheus+Grafana构建Flink实时监控体系

随着业务发展和数据量的增加，大数据应用开发已成为部门应用开发常用的开发方式，由于部门业务特点的关系，spark和hive应用开发在部门内部较为常见。当处理的数据量达到一定量级和系统的复杂度上升时，数据的唯一性、完整性、一致性等等校验就开始受到关注，而通常做法是根据业务特点，额外开发job如报表或者检查任务，这样会比较费时费力。

数据质量监控框架及解决方案总结

基础类型只有数值、字符串和时间三种类型，没有 Boolean 类型，但可以使用整型的 0 或 1 替代。ClickHouse 的数据类型和常见的其他存储系统的数据类型对比:

ClickHouse 数据类型全解析及实际应用

文章

问答

视频

教程

学习中心

腾讯云实验室

直播

竞赛

腾讯云代码分析专区

腾讯iOA零信任安全管理系统专区

腾讯云架构师技术同盟交流圈

腾讯云数据库专区

腾讯云智能顾问专区

腾讯云原生专区

腾讯混元专区

腾讯云TCE专区

腾讯云Lighthouse专区

腾讯云HAI专区

腾讯云Edgeone专区

腾讯云存储专区

腾讯云智能专区

腾讯轻联专区 

腾讯云开发专区

TAPD专区

腾讯轻量云游戏服专区

EdgeOne AI 安全实战专区

腾讯云最具价值专家

腾讯云架构师技术同盟

腾讯云创作之星

腾讯云开发者先锋

腾讯云代码助手

云原生构建

TAPD 敏捷项目管理

Cloud Studio

SDK中心

API中心

命令行工具

涵盖代码开发、场景应用、自动测试全流程，助你从零构建专属AI助手

一站式MCP教程库，解锁AI应用新玩法

聚焦“写作效率、视觉美观与运行性能”三方面进行全面升级，为您提供更高效、稳定的创作环境

社区富文本&Markdown编辑器全新改版上线，欢迎大家体验!

诚挚邀请您参与本次调研，分享您的真实使用感受与建议。您的反馈至关重要，感谢您的支持与参与！

社区新版编辑器体验调研

腾讯云开发者社区推出了暴走大数据专栏，为你提供了暴走大数据的相关文章，致力于帮助开发者快速成长与发展。

暴走大数据

社区

活动

圈层

关于

腾讯云开发者

热门产品

热门推荐

更多推荐