演讲者:李鲁兵(云觉)阿里云智能集团DLF产品负责人 

内容摘要

阿里云DLF(Data Lake Formation)正在从传统Lakehouse架构升级为Agentic Lake全模态数智基座平台,为企业级AI Agent提供全场景、全模态的数据存储、管理和检索能力。DLF通过Omni Catalog统一管理结构化与非结构化数据,提供五级索引支撑引擎混合检索能力,支持Agent直接调用湖上数据,实现企业数智化升级,该平台已在阿里云上开放免费试用。

核心观点

  • Agentic Lake是AI时代全模态Agent底座:数据湖架构已从Streaming Lakehouse演进到Agentic Lake阶段,Agentic Lake是面向AI Agent原生设计的数据湖范式,在Lakehouse基础上增加全模态语义索引、Agent标准API和秒级时效性三大特性。
  • 全模态统一管理:DLF通过Omni Catalog提供Tables和Files双层接口,统一管理结构化表数据、非结构化文档、多媒体数据和AI向量数据,消除数据孤岛
  • 企业级Agent就绪:DLF提供五级索引(B-tree、全文、向量、混合检索、语义元数据)、实时湖流一体加速、细粒度权限管控和全链路审计能力,构建完整的Agent-Ready基座

01

为什么企业级Agent需要全模态数智基座?

企业级AI Agent应用与个人场景存在本质差异,需要一套全模态数智基座来支撑五大核心需求:全场景数据覆盖、多角色协同、实时数据交互、智能自动化处理和Agent持续学习能力。

企业级Agent的五大核心需求

需求维度

具体含义

与个人场景的差异

全场景

覆盖ERP、CRM、日志、网络追踪等广泛数据源

个人Agent仅需处理文件和网页,企业需处理数十种数据类型

协同

财务、销售、研发、产品等多角色数据流动与配合

个人Agent单用户操作,企业需跨角色数据共享和权限隔离

实时

数据秒级可用,支持Agent高频次调用

人类可接受分钟级延迟,Agent处理速度要求秒级响应

智能

Agent自主完成数据处理全流程

人类手动操作为主,Agent需自动化端到端流程

持续学习

Agent基于历史数据反馈到模型训练,持续提升能力

个人工具无学习机制,企业Agent需形成数据-模型闭环

这些需求的本质变化在于:模型和数据需要在一个统一系统中交互。数据不再局限于传统的表格和日志,而是扩展为文本、PPT、图片、视频、音频等全模态数据。同时,Agent运行过程中会产生大量上下文(Context)、技能定义(Skill)和记忆数据(Memory),这些也需要统一平台承载。

02

传统Lakehouse如何演进到Agentic Lake阶段?

Lakehouse架构已经完成了从Streaming Lakehouse到Agentic Lake的关键演进。三年前(约2023年),阿里云宣布Lakehouse进入Streaming Lakehouse阶段,核心目标是提升人类用户对数据时效性的体验。而当前阶段的驱动力则完全不同——AI Agent的处理速度远超人类(一分钟可完成人类一天的工作量),对数据时效性的要求呈数量级提升。

架构演进时间线

阶段

时间

核心目标

服务对象

Data Lake

~2020年前

海量数据低成本存储

Data工程师

Lakehouse

2020-2023年

湖仓一体,ACID事务支持

数据分析师

Streaming Lakehouse

2023-2025年

实时数据可见性

人类决策者

Agentic Lake

2025年至今

Agent-Ready全模态数据服务

AI Agent + 人类

03

Data工程师与AI工程师如何朝Agent工程师转变?

面向人的Lakehouse架构演进已基本完成,而面向Agent-Ready的全模态数据基座则刚刚起步。Agentic Lake的核心定位是打造一个"Agent-Ready的湖",让全模态数据能够直接为Agent服务。无论是Data工程师与AI工程师,未来都将通过使用Agent,调用一支技能丰富、能力齐全的"军队"为自己服务。

04

DLF全模态数智基座平台的架构是什么?

DLF(Data Lake Formation)构建了一套分层架构的Agent-Ready全模态数智基座平台。与传统对象存储"存下来就行"的模式不同,DLF在存储之上构建了完整的管理、索引和服务能力。

DLF平台五层架构

第一层:湖仓存储数据面。承载所有类型数据——结构化表数据、JSON等半结构化文件、PDF/Word等非结构化文档、视频/图片/音频等多媒体数据,以及AI应用产生的向量数据、Context和Memory数据。

第二层:Lake Format层。支持多种开源主流湖格式,包括Apache Iceberg、Apache Paimon、Lance和Parquet等格式,在此基础上构建统一的Catalog管理层。

第三层:数据管理管控治理层。提供元数据统一管理、行列级权限管控、数据质量校验、数据血缘追踪和数据生命周期管理能力。

第四层:索引与检索层。提供五级索引能力(B-tree索引、全文检索索引、向量索引、混合检索、语义元数据索引),支持全模态数据的高效检索和召回。

第五层:对外服务接口层。从传统的Console/UI/CLI升级为面向Agent的检索召回API和Context API,让Agent能够直接调用湖上数据。

05

Omni Catalog如何统一管理全模态数据?

Omni Catalog是DLF的核心数据管理组件,通过统一的元数据管理体系避免数据孤岛,让结构化、半结构化和非结构化数据在同一套系统中可用、可查、可管。Agent能够通过Omni Catalog统一看见并处理所有类型的数据。

双层接口设计

Omni Catalog提供Tables和Files两层接口,分别服务不同角色:

接口层

目标用户

使用场景

支持格式

Tables接口

Data工程师

SQL查询、表操作、数据分析

Iceberg、Paimon、Lance、Parquet格式表

Files接口

AI训练工程师

模型训练数据集读写、批量文件处理

任意文件格式,通过PyPaimon SDK访问

两层接口操作的是同一份底层数据,确保数据一致性。PyPaimon SDK支持Ray平台和PyTorch框架直接调用,让全模态数据无需迁移即可用于模型训练。

06

DLF如何实现For Agent的实时数据加速?

DLF通过湖流一体和缓存加速两种机制实现低成本的实时化加速,满足Agent全天候高频调用的需求。

湖流一体方案

DLF与Fluss(阿里云实时存储引擎)深度集成,构建湖流一体的加速方案:

  • 秒级数据:存储在Fluss中,支持最新实时数据的即时访问
  • 分钟级及以上历史数据:存储在Paimon中,支持批量历史数据查询
  • 对外统一暴露一张DLF Table:用户无需感知底层存储分层,通过一张表即可同时访问实时数据和历史数据

缓存加速能力

面向模型训练场景的高吞吐、低延迟需求,DLF提供智能缓存加速层:

  • 提升引擎访问湖上数据的时效性
  • 有效降低后端存储带宽压力
  • 极端场景下可实现5倍带宽降低

07

DLF提供哪些企业级Agent数据管理能力?

DLF的企业级能力覆盖数据全生命周期的管理、安全和治理需求,确保企业在使用全模态数据时不会陷入"数据沼泽"。

五大企业级能力

元数据管理:完整记录数据的定义(是什么)、来源(从哪来)、分类(如何划分)、位置(存在哪里),并支持构建数据语义层,让Agent能够理解数据含义。

安全权限管控:支持行级和列级细粒度权限控制,按用户或角色定义数据访问和操作权限。所有数据使用过程提供完整审计日志,实现可追踪、可回溯。

数据质量管理:在数据入湖阶段提供基于规则的质量校验,帮助企业提升数据可信度。同时支持数据质量可信追查和数据运营分析,确保Agent获取高质量数据。

血缘管理:提供表级别和Files级别的双重数据血缘管理,清晰展示数据之间、数据与文件之间的流转关系和依赖关系。

生命周期管理:包含数据冷热分层、归档管理、Orphan Files清理和数据回收站功能。数据回收站支持误删恢复——无论是人为误操作还是Agent误删,均可在指定时间内恢复。

08

DLF的五级索引如何支撑Agent全模态数据检索?

DLF提供五级索引体系,覆盖从精准匹配到语义理解的完整检索需求,支撑Agent高效找到目标数据。

五级索引详解

索引类型

技术实现

适用场景

检索方式

B-tree索引

标准B-tree数据结构

精准匹配查找和范围查询

WHERE id = 100, WHERE date BETWEEN ...

全文检索索引

倒排索引

文档内容搜索、关键词匹配

文档各维度关键词检索召回

向量索引

基于DiskANN算法实现

语义相似度检索、多模态检索

Float Array格式存入,自动构建向量索引

混合检索

标量过滤 + 向量匹配

先过滤再匹配,提高精准度降低复杂度

标量条件缩小范围后执行向量检索

语义元数据索引

语义层元数据构建

数据发现和语义理解

基于语义关系的综合检索

向量索引使用DiskANN算法,用户将向量数据以Float Array格式存入DLF后,系统自动创建向量索引,在近似最近邻(ANN)检索时高效找到目标数据。混合检索先利用标量条件过滤数据范围,再执行向量匹配,既提高精准度又降低计算复杂度。

09

DLF如何为Agent提供服务能力?

DLF通过系统表数据化、标准API接口和多引擎协同三大机制为Agent提供全方位服务能力。

系统表数据化

DLF将元数据、血缘、数据质量和权限等过程数据统一沉淀在系统表中。系统表可被引擎(Spark、Flink等)或DataWorks直接调用。Agent通过查询系统表即可理解整个数据处理过程、数据质量状态和权限配置。

标准接口体系

DLF提供四类标准接口供Agent和人类调用:

  • API接口:面向Agent的检索召回API和Context API
  • CLI工具:命令行操作接口
  • Java SDK:Java生态集成
  • PyPaimon SDK:Python生态集成,支持Ray和PyTorch直接调用

多引擎协同

面向全模态场景,不同数据处理需求由不同引擎承担:

引擎

擅长场景

典型操作

Flink

实时数据处理

实时ETL加工、流式写入

Spark

大规模批处理

多模态格式转换、信息提取、文本Chunk

Milvus

向量检索

湖上向量召回

StarRocks/Hologres

OLAP分析

混合检索召回、分析查询

Ray

分布式AI计算

模型推理、Embedding生成

10

基于DLF的全模态数据应用有哪些典型场景?

DLF支撑的全模态数据应用覆盖数据入湖、ETL加工和检索召回三大核心链路,同时服务汽车、零售和互联网等多个行业。

场景一:基于Flink CDC的全模态数据实时入湖

传统入湖方案仅采集Log或MySQL Binlog,DLF支持全模态数据的实时入湖——包括实时评论、实时语音和实时视频。入湖过程中可执行轻量级处理:图片格式调整、文本名称提炼、文本Chunk切分和轻量级Embedding。平台支持Schema Evolution能力(动态加列),适应AI场景中频繁新增label和数据列的需求。所有开发通过YAML声明式方式完成,未来将升级为Agent驱动。

场景二:全模态数据ETL加工

ETL加工流程针对全模态数据做了差异化能力提升:

  1. 视频/图片处理:抽帧、格式转换、分辨率调整(通过Spark或Ray处理)
  2. Embedding生成:处理后的数据调用模型生成向量表示
  3. 统一存储:文本、图片、视频和向量数据统一写入DLF Paimon表
  4. 下游服务:入湖数据可通过Milvus做向量召回,或通过PyPaimon进行读写处理

场景三:全模态混合检索召回

DLF与Milvus、Elasticsearch、OpenSearch等检索引擎集成,提供:

  • 统一资产发现:利用元数据能力让AI定位目标数据
  • 多路召回:标量与向量混合的多路检索方式
  • 融合排序:对多路召回结果进行统一排序
  • 结果服务化:服务于分析查询、Agent调用和RAG应用

行业应用案例

行业

典型数据类型

应用场景

汽车

雷达点云、车载视频、车机交互数据

自动驾驶训练、车辆状态分析

零售

门店视频、员工行为、货架图像

员工管理、资损防盗、库存检查

互联网

用户行为、商品多媒体、交易数据

淘宝闪购等电商场景

FAQ

Q: DLF是什么产品?

A: DLF(Data Lake Formation)是阿里云的全模态数智基座平台产品,提供全模态数据的统一存储、管理、索引和检索能力,为企业级AI Agent提供Agent-Ready的数据服务。

Q: Agentic Lake与传统Lakehouse有什么区别?

A: Agentic Lake是Lakehouse架构的最新演进阶段,核心区别在于服务对象从人类扩展到AI Agent,支持全模态数据(不仅是结构化表),提供面向Agent的API接口和秒级数据时效性。

Q: DLF支持哪些数据格式?

A: DLF通过Omni Catalog支持所有主流湖格式(Iceberg、Paimon、Lance、Parquet),同时支持结构化表数据、JSON文件、PDF/Word文档、视频/图片/音频和向量数据。

Q: DLF如何保证数据安全?

A: DLF提供行级和列级细粒度权限控制、基于角色的访问管理、完整审计日志、数据回收站和全链路追踪能力,确保数据在Agent调用过程中的安全可控。

Q: DLF目前是否可以使用?

A: DLF已于2026年开放免费试用,企业可直接在阿里云上开通使用。

结论

Lakehouse演变已经完成,大数据AI架构正在经历从服务人类到服务AI Agent的根本性转变。DLF通过构建Agentic Lake全模态数智基座平台,提供了完整的全模态数据存储、管理能力。企业要真正释放AI Agent的价值,需要将数据基础设施升级——让Agent能够看见全场景数据、实时获取高质量数据、在统一平台上完成数据处理全流程。DLF正在成为大数据AI基础设施升级的核心基座,如果感兴趣的企业客户可以在阿里云上免费试用产品能力。

了解阿里云DLF:https://www.aliyun.com/product/dlf

招聘

阿里云DLF产品经理招聘中

职位描述

  1. 产品规划与架构设计:深入理解企业级数据湖与AI Agent数据基座的市场需求,跟踪Lakehouse向Agentic Lake的演进趋势,围绕统一元数据治理、全模态数据管理(结构化/半结构化/非结构化/向量/Agent Context)、五级索引体系等核心能力,完成产品规划、功能定义与架构设计,构建面向AI Agent的Agent-Ready数据湖产品体系。
  2. 产品管理与跨团队协同:负责DLF产品全生命周期管理,协调Data+AI等多引擎协同团队,联动技术研发、测试、解决方案架构师、销售及运营等多职能团队,确保产品从设计到上市的高效交付。
  3. 开源生态与市场竞争力建设:深度参与Apache Paimon、Apache Fluss、Apache Iceberg、Lance等开源项目的产品化策略制定,持续跟踪国际头部竞品及业界主流云厂商在统一Catalog、湖仓一体领域的产品动态,结合湖流一体(Lake-Streaming)、全模态湖仓存储、全模态索引等差异化能力,制定竞争策略并推动产品市场优势持续扩大。
  4. 客户价值交付与场景落地:面向汽车(自动驾驶数据管理)、金融(实时风控)、零售(多媒体数据治理)、互联网(推荐/电商)等重点行业,梳理客户数据湖建设与AI应用的核心场景需求,设计Tables接口与Files接口的双层服务能力,推动Agent检索召回API、Context API等新型接口的场景化落地,提升客户转化与留存。
  5. 产品体验迭代与技术趋势洞察:持续追踪用户反馈,围绕行列级权限管控、数据生命周期管理、数据质量、湖格式性能等维度优化产品体验;紧跟AI Agent、RAG、向量检索、流批一体等前沿技术发展,将技术趋势转化为产品创新机会,驱动产品持续迭代升级。

职位要求

  1. 具备数据湖、大数据平台或云计算基础设施领域的产品或项目经验,熟悉主流湖格式(Paimon、Iceberg、Hudi、Delta Lake)及元数据管理(Hive Metastore、Glue Catalog、Unity Catalog)技术体系,了解分布式存储与计算引擎(Flink、Spark、Ray)的基本原理与适用场景,有数据湖或湖仓一体相关产品经验者优先。
  2. 具备AI与大数据融合领域的知识储备,理解向量索引(DiskANN/HNSW)、全文检索、语义检索等信息检索技术,了解AI Agent、RAG、Embedding等应用范式对底层数据基座的需求,能够将AI场景需求转化为数据平台产品能力定义。
  3. 具备深厚的技术理解力与产品架构能力,能够定义多模态数据的统一管理模型、设计分层产品架构(存储层/索引层/服务层/接口层),理解企业级能力(权限、审计、生命周期)的设计要点,能将复杂技术方案简化为客户可理解的产品价值主张,从客户视角驱动技术选型决策。
  4. 具备优秀的产品经理综合素质:能够熟练运用AI辅助工具提升工作效率;具备出色的文档撰写能力,能够清晰表达产品架构意图与技术方案;具备跨团队沟通与项目推动能力,能够在研发、开源社区、销售、客户等多方之间高效协调;执行力强,适应快速迭代的产品节奏。
  5. 本科及以上学历,计算机科学、软件工程、数据科学或相关专业,3年以上云计算/大数据/AI平台领域产品管理或技术项目经验;有开源社区参与经验或技术开发背景者优先;具备持续学习新技术的热情与快速构建新领域认知的能力。

联系方式:lubing.llb@alibaba-inc.com

图片

▼ 「Flink Forward Asia 2026」 ▼

Flink Forward Asia 2026 将于 6 月 26 至 27 日在深圳举行,现面向全球征集议题。活动聚焦实时计算与 AI 的融合,欢迎开发者与 AI 从业者提交创新思路与实践经验。议题将经过专业评选委员会审核,提交截止日期为 5 月 29 日。参会嘉宾可免费报名,获取技术前沿与行业动态。期待您的参与,期待您的参与,共同探索实时 AI 的未来!

  • PC 端:https://asia.flink-forward.org/shenzhen-2026

打开 FFA 2026 官网,点击「议题征集」或者「参会」

  • 移动端:扫描下方二维码或点击文末「阅读原文」

图片

(扫描二维码,提交议题)

图片

(扫码即刻抢占席位)

图片

▼ 「实时计算 Flink 版」 ▼

复制下方链接或者扫描左边二维码

即可免费试用阿里云 Serverless Flink,体验新一代实时计算平台的强大能力!

了解试用详情:https://free.aliyun.com/?productCode=sc

图片


▼ 关注「Apache Flink」 ▼

回复 FFA 2025 获取大会资料

图片

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐