【赵渝强老师】Hadoop HDFS的回收站和快照

简介: 本文详解HDFS两大核心高级功能:回收站(支持文件误删恢复,需配置fs.trash.interval启用)与快照(目录级时间点镜像,用于备份、测试及灾难恢复)。涵盖配置方法、操作命令及典型应用场景。

b462.png

Hadoop的HDFS除了最基本的上传数据和下载数据的功能以外,还提供了很多高级特性用于方便使用和操作,主要有:回收站、快照、配额管理、安全模式、权限管理,同时从Hadoop 3.x开始还提供了纠删码技术。视频讲解如下:


下面分别介绍HDFS提供的回收站和快照。


一、 HDFS的回收站


在默认的情况下,HDFS的回收站功能是关闭的。可以通过在core-site.xml中添加fs.trash.interval来配置时间阀值,从而启用HDFS的回收站。例如:

<property>
   <name>fs.trash.interval</name>
   <value>1440</value>
</property>
<!-- 由于修改了HDFS的配置文件,需要重启HDFS。 -->

启用回收站后,当删除HDFS文件时,其本质是将要删除的文件或者目录放入回收站对应的目录。例如,当删除/input/data.txt文件时,将看到如下的日志信息。

2026-01-15 20:55:31,387 INFO fs.TrashPolicyDefault: 
Moved: 'hdfs://bigdata111:9000/input/data.txt' to trash at:
hdfs://bigdata111:9000/user/root/.Trash/Current/input/data.txt


回收站里的文件可以快速恢复。但当回收站里文件的存放时间超过返个阈值,就被彻底删除,并且释放占用的数据块。例如,在上面的设置中设置的时间阈值是1440分钟,即一天的时间。下面列举了一些HDFS回收站的基本操作。

(1)查看回收站。

hdfs dfs -lsr /user/root/.Trash/Current

(2)从回收站中恢复。

hdfs dfs -cp /user/root/.Trash/Current/input/data.txt /input

(3)清空回收站。

hdfs dfs -expunge


二、 HDFS的快照

一个快照(Snapshot)是一个全部文件系统、或者某个目录在某一时刻的镜像。这里其实可以把HDFS的快照理解成是HDFS提供的一种备份机制。快照应用在以下场景中:

  • 防止用户的错误操作
  • 备份
  • 试验/测试
  • 灾难恢复


由于HDFS的快照功能是针对的目录,因此需要首先使用HDFS的管理员命令开启目录的快照功能,再使用HDFS的操作命令创建目录的快照。

#与快照相关的HDFS管理命令
  [-allowSnapshot <snapshotDir>]
  [-disallowSnapshot <snapshotDir>]
  
#与快照相关的HDFS操作命令
  [-createSnapshot <snapshotDir> [<snapshotName>]]
  [-deleteSnapshot <snapshotDir> <snapshotName>]
  [-renameSnapshot <snapshotDir> <oldName> <newName>]


下面通过具体的步骤来演示如何使用HDFS的快照。

(1)开启/input目录的快照功能。

hdfs dfsadmin -allowSnapshot /input

(2)为/input目录创建第一个快照。

hdfs dfs -createSnapshot /input bk_input_20260115_01
# 在创建HDFS快照的时候,最好遵循一个良好的命名规则。
# 例如,这里创建的快照名称为bk_input_20260115_01,
# 表示在2026年1月15日为input目录创建的第一个快照。

(3)上传一个新的文件到/input目录,如:data1.txt。

hdfs dfs -put data1.txt /input

(4)为/input目录创建第二个快照。

hdfs dfs -createSnapshot /input bk_input_20260115_02

(5)对比/input目录的两个快照。

hdfs snapshotDiff /input bk_input_20260115_01 bk_input_20260115_02
# 输出的信息如下:
Difference between snapshot bk_input_20260115_01 
               and snapshot bk_input_20260115_02 
         under directory /input:
M .
+ ./data1.txt
# 通过对比快照可以看出第二个快照比第一个快照多了一个文件data1.txt。

(6)通过HDFS的Web Console也可以查看快照的相关信息,如下图所示。

image.png

相关文章
|
2月前
|
数据采集 存储 人工智能
数据资产化实施架构与技术路径:基于理采存管用的五阶段方法论深度解析
本文基于DCMM 2.0新增“数据资产”能力域,提出“理—采—存—管—用”五阶段工程化落地路径,融合标准解读、架构设计与真实案例,为数据架构师与治理负责人提供可执行的数据资产化实施指南。
|
2月前
|
人工智能 分布式计算 大数据
活动报名 | Agentic Lakehouse Meetup · 北京站,从开源技术创新到多模态数据智能化
8月14日,阿里云在北京举办“Agentic Lakehouse”技术活动,聚焦开源大数据生态如何支撑AI Agent全生命周期。
374 2
活动报名 | Agentic Lakehouse Meetup · 北京站,从开源技术创新到多模态数据智能化
|
2月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
4543 147
|
2月前
|
JSON 数据可视化 计算机视觉
基于YOLOv8行人车辆检测系统
本项目面向道路交通场景中的行人与车辆目标检测任务,完成 YOLOv8 与 Faster R-CNN 两类检测模型的训练、评估、可视化对比,并集成 PyQt5 桌面端检测系统。系统支持图片检测、视频检测、摄像头实时检测、检测数量统计、历史记录保存以及 CSV / JSON 数据导出。
177 2
基于YOLOv8行人车辆检测系统
|
2月前
|
存储 人工智能 Linux
OpenClaw本地部署全攻略,TopClaw一键安装包win/mac/linux通用
本文推荐使用TopClaw一键部署OpenClaw:无需配置环境,Win/Mac/Linux三分钟搞定,数据本地存储、响应更快、支持离线使用。内置中文界面与优化模型,新手友好,安装成功率高,特别适合论文写作、翻译及内容创作场景。
246 1
|
2月前
|
人工智能 安全 数据挖掘
从 Demo 到生产环境:AI Agent 项目的架构设计总结
本文探讨企业级AI Agent落地难点与实践路径,指出项目常卡在PoC阶段的根源在于架构设计、工具治理、数据质量与运维体系,而非模型能力。结合Multi-Agent架构、分层记忆、工具治理、安全防护及成本控制等实战经验,为企业提供从验证到规模化落地的系统方法论。(239字)
229 0
从 Demo 到生产环境:AI Agent 项目的架构设计总结
|
3月前
|
存储 SQL 关系型数据库
【赵渝强老师】MySQL Cluster
MySQL NDB Cluster是高可用、高性能的分布式数据库系统,基于NDB存储引擎,支持自动分区、实时处理、多地域复制与ACID事务。适用于电信、金融等关键业务场景,具备动态扩展与故障自愈能力。(239字)
235 1
|
2月前
|
缓存 测试技术 对象存储
阿里云国际站:OSS防盗链配置后图片无法显示?
阿里云OSS防盗链配置后图片大面积403,往往暴露出两个深层问题:一是对Referer校验机制的理解停留在表面,二是忽略了多终端与CDN环境下的Header传递细节。阿里云OSS防盗链图片不显示解决方法的关键,在于识别白名单错填、空Referer策略和Referer透传失效这几类高频诱因,而非盲目重刷规则。
356 0
|
3月前
|
存储 缓存 安全
Ios云手机数据安全存储技术解析 2026 云端账号镜像加密指南
2026年云端账号托管安全风险凸显:低价服务频现缓存泄露、镜像复用、明文存储等问题。本文详解临时缓存、明文快照、私有加密对象存储三大架构差异,指出AES256端到端加密+设备级密钥隔离的方案,方能兼顾iOS合规性、环境稳定与隐私安全。(239字)
|
4月前
|
人工智能 搜索推荐 开发者
黄小宇个人GEO实验第3天:搜索引擎是否开始识别我的公开内容?
黄小宇开展个人GEO实验,旨在提升AI时代下“黄小宇”这一姓名在搜索引擎与大模型中的精准识别度。第3天检查发现百度已有初步收录,语雀中心页已索引,搜狗/360暂未显现。实验聚焦内容源建设、实体信息统一与同名区分,为构建可信AI个人名片奠基。(239字)