首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >HIVE-17824,删除hdfs分区信息,清理metastore元数据

HIVE-17824,删除hdfs分区信息,清理metastore元数据

作者头像
用户4128047
发布2025-12-23 16:45:51
发布2025-12-23 16:45:51
1650
举报

        当手动删除HDFS 分区数据时,但是并没有清理 Hive 中的分区元数据,删除操作无法自动更新hive分区表元数据。也就是从hdfs中删除大量分区数据,并没有执行如下命令:

        alter table drop partition commad

        从hive 3.0.0开始可以使用MSCK的方法发现新分区或删除丢失的分区;

        MSCK [REPAIR] TABLE table_name [ADD/DROP/SYNC PARTITIONS] 这种方式是在HIVE-17824中实现的。

        若手动删除 HDFS 上多个分区文件夹,且快速刷新分区,则需要在存在external表执行如下操作:

  • 删除表(DROP TABLE table_name)
  • 重新创建表(CREATE EXTERNAL TABLE table_name ...)
  • 修复它(MSCK REPAIR TABLE table_name)

如果分区数量较多,需要执行的时间很长。另外一种解决方案是对每个已删除的分区文件夹使用ALTER TABLE DROP PARTITION (...),但如果删除了多个分区,这可能会很乏味。

        用户可用修复表option选项运行metastore检查命令:

代码语言:javascript
复制
MSCK [REPAIR] TABLE table_name [ADD/DROP/SYNC PARTITIONS];

        对于不存在元数据的分区,会更新到Hive metastore。

代码语言:javascript
复制
1.MSC命令的默认选项是“ADD PARTITIONS”。通过这个选项,它会将所有HDFS上存在但不存在metastore的分区添加到metastore中。
2.DROP PARTITIONS选项将从metastore中删除已经从HDFS中删除的分区信息。
3.SYNC PARTITIONS选项相当于同时调用ADD和DROP PARTITIONS。

        详情请参阅HIVE-874和HIVE-17824。当有大量未跟踪的分区时,运行MSCK REPAIR TABLE批处理避免OOME(内存不足错误)。通过为属性hive.msck.repair.batch.size提供配置的批大小,它可以在内部的批中运行。属性的默认值是0,这意味着它将一次执行所有分区。 不带REPAIR选项的MSCK命令可用于查找元数据mismatch metastore的详细信息。

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
原始发表:2025-12-23,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  •         当手动删除HDFS 分区数据时,但是并没有清理 Hive 中的分区元数据,删除操作无法自动更新hive分区表元数据。也就是从hdfs中删除大量分区数据,并没有执行如下命令:
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档