Microsoft OneLake 是整个组织的统一数据湖。 每个 Microsoft Fabric 租户都会自动包含 OneLake,它是集中存放所有分析数据的统一位置。 它是一个中央存储库,可在其中存储、管理和管理组织中分析和 AI 工作负载的所有数据。
OneLake 基于Azure Data Lake Storage构建,以 Delta Parquet 或 Iceberg 格式存储表,这是任何工具都可以读取的两个开放标准。 此方法意味着数据不会锁定为专有格式。
OneLake 提供:
- 具有内置治理和安全性的整个组织的统一数据存储
- 一份数据即可供多个分析引擎使用,无需复制
- 通过文件资源管理器、ADLS Gen2 API 和Azure服务集成实现灵活连接
- 使用内置冗余、灾难恢复和访问诊断进行数据保护和监视
统一数据存储
在 OneLake 之前,组织通常会为不同的业务组创建多个湖,这导致了管理多个资源的额外开销。 这种各自为政的做法使跨团队协作变得困难,拖慢了数据项目的推进,并增加了重复工作的风险。
OneLake 通过为整个组织提供中心数据接入点来解决这些挑战。 每个 Fabric 租户都配有一个 OneLake 实例。 无法删除 OneLake 或创建多个 OneLake,并且没有用于预配或管理的基础结构。 部门、团队和项目可以在此统一的湖中存储或连接到其数据,并使用Fabric域、子域和工作区进行组织,每个工作区都有其自己的管理员。 此模型维护数据所有权并启用联合治理,同时仍允许授权用户发现和使用数据而不产生摩擦。
集中管理,分布式归属
Fabric 数据位于以下用于组织和治理的层次结构中:
- 租户:租户级策略会自动保护 OneLake 中用于安全、合规性和数据管理的任何数据。
- 工作区:可以在租户中创建任意数量的工作区来组织数据。 工作区使组织的不同部分能够分配所有权和访问策略。 每个工作区都是属于一个与特定区域相关联的容量,并且该容量是单独计费的。
- 数据项:工作区包含湖屋、仓库、事件屋和 KQL 数据库等数据项。 每种项类型专为特定工作负荷(例如基于 Spark 的分析、T-SQL 查询、实时流式处理等)而构建。
有关详细信息,请参阅工作区。
使用 OneLake 目录发现和管理
OneLake 目录是数据专业人员和业务用户发现、管理和管理自己拥有且可在 OneLake 中访问的数据的单一位置。
用户可以按域、工作区、项目类型、认可等进行筛选,以找到所需的确切内容,每个数据项都由元数据(如说明、所有者、架构、世系和使用情况指标)扩充。
数据所有者可以获取相关洞察和建议采取的措施,以提高数据质量和合规性,包括了解敏感度标签覆盖率、标记、认证和数据位置等情况。
有关详细信息,请参阅 OneLake 目录。
安全性
OneLake 的安全模型允许广泛共享数据,而无需公开敏感信息。 通过使用 OneLake 安全角色,可以定义对数据项的精细权限,具体到特定文件夹、表,甚至行和列。 例如,您可以与团队共享销售数据集,但限制对 Cost 列的访问;或者允许合作伙伴仅查看 Region = "US" 的行。 OneLake 存储这些角色,并自动在所有分析体验中强制实施这些角色。 因此,如果用户只能访问数据集的部分内容,那么无论他们是通过 SQL 进行查询、运行 Spark 笔记本,还是查看 Power BI 报表,该规则都适用。 OneLake 确保他们只看到他们允许看到的内容。
这种统一的安全方法意味着用户不必在不同的引擎中维护单独的权限。 这也意味着,即使数据被传送到由他人拥有的湖仓或工作区,原始数据所有者也始终掌控哪些人可以访问数据源。
可以将敏感度标签应用于 OneLake 项目,就像对文档一样,这些标签也会强制加密或访问限制,即使数据导出到Excel或其他工具也是如此。 同样,数据丢失防护(DLP)策略可以检测来自 OneLake 的敏感数据上传或下载,并防止或提醒潜在的数据泄漏。
有关详细信息,请参阅 开始保护 OneLake 中的数据。
统一的数据副本
所有Fabric分析引擎都直接在 OneLake 中处理数据。 无需复制数据以用于其他引擎或分析来自多个源的数据。
快捷方式
快捷方式是对存储在其他文件位置中的数据的引用。 这些文件位置可以位于同一工作区中、OneLake 中的其他工作区或 OneLake 外部。 可以为 OneLake、Azure Data Lake Storage、Azure Blob 存储、Amazon S3 和与 S3 兼容的源、与 Iceberg 兼容的源、Microsoft Dataverse、本地部署源等使用快捷方式。 无论在哪个位置,快捷方式都能使文件和文件夹看起来像是存储在本地。
快捷方式允许组织在云和域中统一数据,而无需复制数据。 团队可以在各自独立的工作区中工作,并通过快捷方式相互共享数据,而不是复制这些数据。 例如,一个团队可以为另一个团队工作区中的数据集或外部 S3 存储桶创建快捷方式,然后在 OneLake 中将这些数据与其自身的数据合并。 快捷方式指向源,因此,当源数据更新时,这些更改将通过 OneLake 立即可见。 这样,就可以创建虚拟产品或视图,将来自多个业务组的数据组合在一起以满足特定需求,而无需移动或复制数据。 使用快捷转换,甚至可以对数据应用自动更改,例如转换数据格式或删除个人身份信息(PII)。
有关如何使用快捷方式的详细信息,请参阅 OneLake 快捷方式。
Mirroring
Fabric中的镜像是一种低成本、低延迟的解决方案,可连续将数据从各种系统复制到 OneLake。 可以安全地连接到外部数据源,并将所选数据库或表自动镜像(复制)到 OneLake 的开放格式,使其近乎实时地保持同步。 镜像数据以 Delta Parquet 格式存储在 OneLake 中,因此可立即供任何 Fabric 引擎分析。
镜像功能支持以下源,例如 Azure SQL 数据库、Azure Cosmos DB、Azure Database for PostgreSQL、Azure Databricks(Unity Catalog)、Snowflake 等。 源中的更改会持续同步到 OneLake,因此你的 OneLake 副本无需手动 ETL 作业即可始终保持最新状态。 无需直接查询生产源,即可对新数据运行分析、AI 或Power BI报表。
有关详细信息,请参阅Fabric中的镜像是什么?
在多个分析引擎中协作
Fabric 分析引擎(T-SQL、Apache Spark、Analysis Services 等其他引擎)都将数据以开放的 Delta Parquet 格式存储在 OneLake 中。 这种标准化允许跨多个引擎使用相同的数据。 无需复制数据即可用于另一个引擎,也不需要将其与特定引擎一起使用,因为这就是数据所在的位置。
例如,SQL 工程师团队会生成一个完全事务性的数据仓库。 它们使用 T-SQL 引擎创建表、转换数据并将数据加载到表。 如果数据科学家想要使用此数据,则可以将 Spark 笔记本附加到 OneLake 并直接读取这些表。 由于 OneLake 以 Delta 格式存储表,因此 Spark 可以在没有任何特殊连接器或数据导出的情况下加载它们。 SQL 查询和 Spark 作业都对 OneLake 中的数据的一个副本进行操作。
此外,业务用户可以在 Analysis Services 引擎中使用 Direct Lake 模式在 OneLake 的基础上生成Power BI报表。 Direct Lake 模式是一种数据访问模式,无需复制即可快速加载和刷新大量数据。 有关详细信息,请参阅 Direct Lake 概述。
开放表格式互操作性
OneLake 通过 元数据虚拟化支持 Delta Lake 和 Apache Iceberg 表格式。 此功能会自动生成虚拟元数据,以便 Iceberg 表可在 Fabric 各工作负载中作为 Delta Lake 表读取,并且 Delta Lake 表可由外部 Iceberg 读取器读取。 可以直接将 Iceberg 表写入 OneLake,也可以创建存储在外部的 Iceberg 表的快捷方式,OneLake 使这些表可供所有Fabric引擎使用,而无需手动转换。 同样,OneLake 中的任何 Delta Lake 表都可以由与 Iceberg 兼容的服务(如 Snowflake)访问。
有关详细信息,请参阅通过 OneLake 使用 Iceberg 表。
连接到 OneLake
可以从 Fabric 门户、Windows、现有Azure工具或任何支持 ADLS Gen2 API 的应用程序访问 OneLake 数据。
适用于 Windows 的 OneLake 文件资源管理器
可以使用适用于 Windows 的 OneLake 文件资源管理器从Windows浏览 OneLake 数据。 你可以像在 Office 中一样浏览所有工作区和数据项,从而轻松上传、下载或修改文件。 OneLake 文件浏览器让数据湖的使用变得更简单,因此即使是没有技术背景的业务用户也能使用数据湖。
有关详细信息,请参阅 OneLake 文件资源管理器。
ADLS Gen2 API 和 SDK
OneLake 支持 Azure Data Lake Storage (ADLS) Gen2 API 和 SDK,因此可以使用现有的 ADLS Gen2 应用程序。 每个工作区显示为容器,数据项显示为这些容器中的文件夹。 有关详细信息,请参阅 OneLake 访问和 API。
由于 OneLake 与 ADLS Gen2 应用程序兼容,因此可以从 Azure 服务连接到 OneLake。 例如:
数据保护和监视
OneLake 包含内置功能,可保护数据的安全,并让你了解数据的使用方式。
灾难恢复和数据保护
OneLake 使用内置冗余自动保护数据。 在支持可用性区域的区域中,OneLake 使用区域冗余存储(ZRS)跨多个数据中心复制数据。 在其他区域中,它使用本地冗余存储(LRS)。 为了防止区域范围的中断,可以在容量上启用业务连续性和灾难恢复(BCDR),将数据异地复制到配对Azure区域。 OneLake 还支持软删除,该软删除将已删除的文件保留七天,以便你可以从意外删除中恢复。
有关详细信息,请参阅 OneLake 的灾难恢复和数据保护。
诊断
OneLake 诊断可让你了解如何在Fabric环境中访问和使用数据。 在工作区级别启用诊断后,系统会将数据访问事件以日志形式流式传输到湖仓中。 可以跟踪谁访问了哪些数据、时间和方式。 此日志记录涵盖Fabric UI 中的用户操作、通过 API 和分析引擎进行编程访问,以及通过快捷方式跨工作区访问。
有关详细信息,请参阅 OneLake 诊断。