本文来源于阿里云社区电子书《阿里云产品四月刊》
CPFS 智算版数据流动
- CPFS 智算版多租支持与 OSS 数据流动,支持手动导入和导出
- 支持 CPFS 智算版文件系统与 OSS 之间的数据导入和导出,单文件导入吞吐最大为 60MB/s,多文件导入吞吐最大为 5GB/s,单文件导出吞吐最大为 300MB/s,多文件导出吞吐最大为 3GB/s。
CPFS 智算版文件系统与对象存储 OSS 之间已实现数据流动。您可以通过创建数据流动任务实现不同源端的数据同步。
背景信息
当 CPFS 智算版文件系统中的目录与 OSS Bucket 创建数据流动后,通过创建数据流动任务,可以完成数据的高速传输。传输完成后,您能通过高性能且 POSIX 兼容的文件接口快速地处理 OSS 中的数据。同时,CPFS 智算版支持通过文件存储控制台或 OpenAPI 将数据导出至 OSS Bucket。
- 目录级别的数据流动
您可以通过创建数据流动,建立从 CPFS 智算版文件系统任意子目录到 OSS Bucket 下任意 prefix 的映射,实现更细粒度的权限控制与更灵活的数据传输。
- 数据的导入与导出
您可以创建数据流动任务实现 CPFS 智算版文件系统与 OSS 之间的数据导入和导出,以便在计算任务开始前将数据同步至高性能的 CPFS 智算版文件系统上。如果任务执行失败,您可以通过任务报告检查失败原因。
重要
CPFS 智算版会将 File Modification timestamps 属性导出到 OSS Bucket 的自定义元数据中,其命名为 x-oss-meta-hbr-buckup-mtime,不能删除或修改,否则文件系统中的 File Modification timestamps 属性会错误。
使用限制
- 数据流动
- 仅 CPFS 智算版 2.4.0 及以上版本支持数据流动。
- 单个 CPFS 智算版文件系统最多支持创建 10 个数据流动。
- 单个 CPFS 智算版文件系统的文件路径只能与一个 OSS Bucket 链接。
- CPFS 智算版文件系统不支持与其他区域的 OSS Bucket 创建数据流动。
- 数据流动对文件系统的限制
- 在数据流动关联的文件系统路径中,不可对非空目录执行重命名操作,否则报 错 Permission Denied 或者目录非空。
- 目录、文件名中的特殊字符需要谨慎使用,支持大小写字母、数字、感叹号(!)、短划线(-)、下划线(_)、半角句号(.)、星号(*)和半角圆括号(())。
- 不支持超长路径,数据流动支持的路径最大长度是 1023 字符。
- 数据流动导入限制
- Symlink 类型的文件导入到 CPFS 智算版后,会转变为包含数据的普通文件,并丢失 Symlink 信息。
- 如果 OSS Bucket 存在多个版本,则只复制最新的版本。
- 不支持长度大于 255 字节的文件名或子目录名。
- 数据流动导出限制
- Symlink 类型的文件在同步到 OSS 后,不会同步 Symlink 所指向的文件,而是会变成一个普通的无数据空白对象。
- Hardlink 类型的文件仅作为普通文件同步到 OSS。
- Socket、Device、Pipe 类型的文件导出到 OSS Bucket 时,会变成一个普通的无数据空白对象。
- 不支持长度大于 1023 字符的目录路径。
使用流程
- 创建数据流动。具体操作,请参见管理数据流动。
- 创建数据导入、数据导出或数据删除任务。具体操作,请参见管理数据流动任务。
操 作类型 |
指标 |
说明 |
导 入数据 |
GB 级 以 上 |
单文件导入吞吐最大为 60 MB/s。 |
|
文 件吞吐 |
多文件导入吞吐最大为 5 GB/s。
说明 实际的吞吐能力会受到OSS 带宽和CPFS 智算版带宽的限制, 也会受到文件大小、文件数、数据量的影响。关于 OSS 的带宽能力,请参见带宽;关于 CPFS 智算版的吞吐能力,请参见产品规格。 |
MB 级文 件 每 秒 处 理个数 |
单目录、多目录导入:1000。 |
|
导 出数据 |
GB 级 以 上 文 件吞吐 |
单文件导出吞吐最大为 300 MB/s。 多文件导出吞吐最大为 3 GB/s。
说明 实际的吞吐能力会受到OSS 带宽和CPFS 智算版带宽的限制, 也会受到文件大小、文件数、数据量的影响。关于 OSS 的带宽能力,请参见带宽;关于 CPFS 智算版的吞吐能力,请参见产品规格。 |
MB 级文 件 每 秒 处 理个数 |
单目录、多目录导出:1200。 |
在实现 CPFS 智算版文件系统与 OSS Bucket 之间的数据流动之前,需要确保已经创建了对应的数据流动。本文介绍如何在文件存储控制台创建并管理 CPFS 智算版数据流动。
前提条件
- 源端 OSS Bucket 已设置标签(key: cpfs-dataflow, value: true)。在数据流动的使用过程中,不能删除和修改该标签,否则 CPFS 智算版文件系统数据流动无法访问 Bucket 的数据。更多信息,请参见 OSS Bucket 设置标签。
- 如果多个 CPFS 智算版文件系统的数据流动,或者同一个 CPFS 智算版文件系统的多个数据流动的源端存储是同一个 OSS Bucket,为了防止多个数据流动向同一个OSS Bucket 导出数据时产生数据冲突,需要该 OSS Bucket 开启版本控制。更多信息,请参见版本控制介绍。
《阿里云产品四月刊》—CPFS 智算版数据流动(2)https://developer.aliyun.com/article/1554196