Agentic Lake:阿里云DLF构建AI时代的全模态Agent底座
演讲者:李鲁兵(云觉)阿里云智能集团DLF产品负责人
内容摘要
阿里云DLF(Data Lake Formation)正在从传统Lakehouse架构升级为Agentic Lake全模态数智基座平台,为企业级AI Agent提供全场景、全模态的数据存储、管理和检索能力。DLF通过Omni Catalog统一管理结构化与非结构化数据,提供五级索引支撑引擎混合检索能力,支持Agent直接调用湖上数据,实现企业数智化升级,该平台已在阿里云上开放免费试用。

核心观点
- Agentic Lake是AI时代全模态Agent底座:数据湖架构已从Streaming Lakehouse演进到Agentic Lake阶段,Agentic Lake是面向AI Agent原生设计的数据湖范式,在Lakehouse基础上增加全模态语义索引、Agent标准API和秒级时效性三大特性。
- 全模态统一管理:DLF通过Omni Catalog提供Tables和Files双层接口,统一管理结构化表数据、非结构化文档、多媒体数据和AI向量数据,消除数据孤岛
- 企业级Agent就绪:DLF提供五级索引(B-tree、全文、向量、混合检索、语义元数据)、实时湖流一体加速、细粒度权限管控和全链路审计能力,构建完整的Agent-Ready基座

01
为什么企业级Agent需要全模态数智基座?

企业级AI Agent应用与个人场景存在本质差异,需要一套全模态数智基座来支撑五大核心需求:全场景数据覆盖、多角色协同、实时数据交互、智能自动化处理和Agent持续学习能力。
企业级Agent的五大核心需求
|
需求维度 |
具体含义 |
与个人场景的差异 |
|---|---|---|
|
全场景 |
覆盖ERP、CRM、日志、网络追踪等广泛数据源 |
个人Agent仅需处理文件和网页,企业需处理数十种数据类型 |
|
协同 |
财务、销售、研发、产品等多角色数据流动与配合 |
个人Agent单用户操作,企业需跨角色数据共享和权限隔离 |
|
实时 |
数据秒级可用,支持Agent高频次调用 |
人类可接受分钟级延迟,Agent处理速度要求秒级响应 |
|
智能 |
Agent自主完成数据处理全流程 |
人类手动操作为主,Agent需自动化端到端流程 |
|
持续学习 |
Agent基于历史数据反馈到模型训练,持续提升能力 |
个人工具无学习机制,企业Agent需形成数据-模型闭环 |
这些需求的本质变化在于:模型和数据需要在一个统一系统中交互。数据不再局限于传统的表格和日志,而是扩展为文本、PPT、图片、视频、音频等全模态数据。同时,Agent运行过程中会产生大量上下文(Context)、技能定义(Skill)和记忆数据(Memory),这些也需要统一平台承载。
02
传统Lakehouse如何演进到Agentic Lake阶段?

Lakehouse架构已经完成了从Streaming Lakehouse到Agentic Lake的关键演进。三年前(约2023年),阿里云宣布Lakehouse进入Streaming Lakehouse阶段,核心目标是提升人类用户对数据时效性的体验。而当前阶段的驱动力则完全不同——AI Agent的处理速度远超人类(一分钟可完成人类一天的工作量),对数据时效性的要求呈数量级提升。
架构演进时间线
|
阶段 |
时间 |
核心目标 |
服务对象 |
|---|---|---|---|
|
Data Lake |
~2020年前 |
海量数据低成本存储 |
Data工程师 |
|
Lakehouse |
2020-2023年 |
湖仓一体,ACID事务支持 |
数据分析师 |
|
Streaming Lakehouse |
2023-2025年 |
实时数据可见性 |
人类决策者 |
|
Agentic Lake |
2025年至今 |
Agent-Ready全模态数据服务 |
AI Agent + 人类 |
03
Data工程师与AI工程师如何朝Agent工程师转变?

面向人的Lakehouse架构演进已基本完成,而面向Agent-Ready的全模态数据基座则刚刚起步。Agentic Lake的核心定位是打造一个"Agent-Ready的湖",让全模态数据能够直接为Agent服务。无论是Data工程师与AI工程师,未来都将通过使用Agent,调用一支技能丰富、能力齐全的"军队"为自己服务。
04
DLF全模态数智基座平台的架构是什么?

DLF(Data Lake Formation)构建了一套分层架构的Agent-Ready全模态数智基座平台。与传统对象存储"存下来就行"的模式不同,DLF在存储之上构建了完整的管理、索引和服务能力。
DLF平台五层架构
第一层:湖仓存储数据面。承载所有类型数据——结构化表数据、JSON等半结构化文件、PDF/Word等非结构化文档、视频/图片/音频等多媒体数据,以及AI应用产生的向量数据、Context和Memory数据。
第二层:Lake Format层。支持多种开源主流湖格式,包括Apache Iceberg、Apache Paimon、Lance和Parquet等格式,在此基础上构建统一的Catalog管理层。
第三层:数据管理管控治理层。提供元数据统一管理、行列级权限管控、数据质量校验、数据血缘追踪和数据生命周期管理能力。
第四层:索引与检索层。提供五级索引能力(B-tree索引、全文检索索引、向量索引、混合检索、语义元数据索引),支持全模态数据的高效检索和召回。
第五层:对外服务接口层。从传统的Console/UI/CLI升级为面向Agent的检索召回API和Context API,让Agent能够直接调用湖上数据。
05
Omni Catalog如何统一管理全模态数据?

Omni Catalog是DLF的核心数据管理组件,通过统一的元数据管理体系避免数据孤岛,让结构化、半结构化和非结构化数据在同一套系统中可用、可查、可管。Agent能够通过Omni Catalog统一看见并处理所有类型的数据。
双层接口设计
Omni Catalog提供Tables和Files两层接口,分别服务不同角色:
|
接口层 |
目标用户 |
使用场景 |
支持格式 |
|---|---|---|---|
|
Tables接口 |
Data工程师 |
SQL查询、表操作、数据分析 |
Iceberg、Paimon、Lance、Parquet格式表 |
|
Files接口 |
AI训练工程师 |
模型训练数据集读写、批量文件处理 |
任意文件格式,通过PyPaimon SDK访问 |
两层接口操作的是同一份底层数据,确保数据一致性。PyPaimon SDK支持Ray平台和PyTorch框架直接调用,让全模态数据无需迁移即可用于模型训练。
06
DLF如何实现For Agent的实时数据加速?

DLF通过湖流一体和缓存加速两种机制实现低成本的实时化加速,满足Agent全天候高频调用的需求。
湖流一体方案
DLF与Fluss(阿里云实时存储引擎)深度集成,构建湖流一体的加速方案:
- 秒级数据:存储在Fluss中,支持最新实时数据的即时访问
- 分钟级及以上历史数据:存储在Paimon中,支持批量历史数据查询
- 对外统一暴露一张DLF Table:用户无需感知底层存储分层,通过一张表即可同时访问实时数据和历史数据
缓存加速能力
面向模型训练场景的高吞吐、低延迟需求,DLF提供智能缓存加速层:
- 提升引擎访问湖上数据的时效性
- 有效降低后端存储带宽压力
- 极端场景下可实现5倍带宽降低
07
DLF提供哪些企业级Agent数据管理能力?

DLF的企业级能力覆盖数据全生命周期的管理、安全和治理需求,确保企业在使用全模态数据时不会陷入"数据沼泽"。
五大企业级能力
元数据管理:完整记录数据的定义(是什么)、来源(从哪来)、分类(如何划分)、位置(存在哪里),并支持构建数据语义层,让Agent能够理解数据含义。
安全权限管控:支持行级和列级细粒度权限控制,按用户或角色定义数据访问和操作权限。所有数据使用过程提供完整审计日志,实现可追踪、可回溯。
数据质量管理:在数据入湖阶段提供基于规则的质量校验,帮助企业提升数据可信度。同时支持数据质量可信追查和数据运营分析,确保Agent获取高质量数据。
血缘管理:提供表级别和Files级别的双重数据血缘管理,清晰展示数据之间、数据与文件之间的流转关系和依赖关系。
生命周期管理:包含数据冷热分层、归档管理、Orphan Files清理和数据回收站功能。数据回收站支持误删恢复——无论是人为误操作还是Agent误删,均可在指定时间内恢复。
08
DLF的五级索引如何支撑Agent全模态数据检索?

DLF提供五级索引体系,覆盖从精准匹配到语义理解的完整检索需求,支撑Agent高效找到目标数据。
五级索引详解
|
索引类型 |
技术实现 |
适用场景 |
检索方式 |
|---|---|---|---|
|
B-tree索引 |
标准B-tree数据结构 |
精准匹配查找和范围查询 |
WHERE id = 100, WHERE date BETWEEN ... |
|
全文检索索引 |
倒排索引 |
文档内容搜索、关键词匹配 |
文档各维度关键词检索召回 |
|
向量索引 |
基于DiskANN算法实现 |
语义相似度检索、多模态检索 |
Float Array格式存入,自动构建向量索引 |
|
混合检索 |
标量过滤 + 向量匹配 |
先过滤再匹配,提高精准度降低复杂度 |
标量条件缩小范围后执行向量检索 |
|
语义元数据索引 |
语义层元数据构建 |
数据发现和语义理解 |
基于语义关系的综合检索 |
向量索引使用DiskANN算法,用户将向量数据以Float Array格式存入DLF后,系统自动创建向量索引,在近似最近邻(ANN)检索时高效找到目标数据。混合检索先利用标量条件过滤数据范围,再执行向量匹配,既提高精准度又降低计算复杂度。
09
DLF如何为Agent提供服务能力?

DLF通过系统表数据化、标准API接口和多引擎协同三大机制为Agent提供全方位服务能力。
系统表数据化
DLF将元数据、血缘、数据质量和权限等过程数据统一沉淀在系统表中。系统表可被引擎(Spark、Flink等)或DataWorks直接调用。Agent通过查询系统表即可理解整个数据处理过程、数据质量状态和权限配置。
标准接口体系
DLF提供四类标准接口供Agent和人类调用:
- API接口:面向Agent的检索召回API和Context API
- CLI工具:命令行操作接口
- Java SDK:Java生态集成
- PyPaimon SDK:Python生态集成,支持Ray和PyTorch直接调用
多引擎协同
面向全模态场景,不同数据处理需求由不同引擎承担:
|
引擎 |
擅长场景 |
典型操作 |
|---|---|---|
|
Flink |
实时数据处理 |
实时ETL加工、流式写入 |
|
Spark |
大规模批处理 |
多模态格式转换、信息提取、文本Chunk |
|
Milvus |
向量检索 |
湖上向量召回 |
|
StarRocks/Hologres |
OLAP分析 |
混合检索召回、分析查询 |
|
Ray |
分布式AI计算 |
模型推理、Embedding生成 |
10
基于DLF的全模态数据应用有哪些典型场景?
DLF支撑的全模态数据应用覆盖数据入湖、ETL加工和检索召回三大核心链路,同时服务汽车、零售和互联网等多个行业。
场景一:基于Flink CDC的全模态数据实时入湖

传统入湖方案仅采集Log或MySQL Binlog,DLF支持全模态数据的实时入湖——包括实时评论、实时语音和实时视频。入湖过程中可执行轻量级处理:图片格式调整、文本名称提炼、文本Chunk切分和轻量级Embedding。平台支持Schema Evolution能力(动态加列),适应AI场景中频繁新增label和数据列的需求。所有开发通过YAML声明式方式完成,未来将升级为Agent驱动。
场景二:全模态数据ETL加工

ETL加工流程针对全模态数据做了差异化能力提升:
- 视频/图片处理:抽帧、格式转换、分辨率调整(通过Spark或Ray处理)
- Embedding生成:处理后的数据调用模型生成向量表示
- 统一存储:文本、图片、视频和向量数据统一写入DLF Paimon表
- 下游服务:入湖数据可通过Milvus做向量召回,或通过PyPaimon进行读写处理
场景三:全模态混合检索召回

DLF与Milvus、Elasticsearch、OpenSearch等检索引擎集成,提供:
- 统一资产发现:利用元数据能力让AI定位目标数据
- 多路召回:标量与向量混合的多路检索方式
- 融合排序:对多路召回结果进行统一排序
- 结果服务化:服务于分析查询、Agent调用和RAG应用
行业应用案例

|
行业 |
典型数据类型 |
应用场景 |
|---|---|---|
|
汽车 |
雷达点云、车载视频、车机交互数据 |
自动驾驶训练、车辆状态分析 |
|
零售 |
门店视频、员工行为、货架图像 |
员工管理、资损防盗、库存检查 |
|
互联网 |
用户行为、商品多媒体、交易数据 |
淘宝闪购等电商场景 |
FAQ
Q: DLF是什么产品?
A: DLF(Data Lake Formation)是阿里云的全模态数智基座平台产品,提供全模态数据的统一存储、管理、索引和检索能力,为企业级AI Agent提供Agent-Ready的数据服务。
Q: Agentic Lake与传统Lakehouse有什么区别?
A: Agentic Lake是Lakehouse架构的最新演进阶段,核心区别在于服务对象从人类扩展到AI Agent,支持全模态数据(不仅是结构化表),提供面向Agent的API接口和秒级数据时效性。
Q: DLF支持哪些数据格式?
A: DLF通过Omni Catalog支持所有主流湖格式(Iceberg、Paimon、Lance、Parquet),同时支持结构化表数据、JSON文件、PDF/Word文档、视频/图片/音频和向量数据。
Q: DLF如何保证数据安全?
A: DLF提供行级和列级细粒度权限控制、基于角色的访问管理、完整审计日志、数据回收站和全链路追踪能力,确保数据在Agent调用过程中的安全可控。
Q: DLF目前是否可以使用?
A: DLF已于2026年开放免费试用,企业可直接在阿里云上开通使用。
结论
Lakehouse演变已经完成,大数据AI架构正在经历从服务人类到服务AI Agent的根本性转变。DLF通过构建Agentic Lake全模态数智基座平台,提供了完整的全模态数据存储、管理能力。企业要真正释放AI Agent的价值,需要将数据基础设施升级——让Agent能够看见全场景数据、实时获取高质量数据、在统一平台上完成数据处理全流程。DLF正在成为大数据AI基础设施升级的核心基座,如果感兴趣的企业客户可以在阿里云上免费试用产品能力。
了解阿里云DLF:https://www.aliyun.com/product/dlf

招聘
阿里云DLF产品经理招聘中
职位描述
- 产品规划与架构设计:深入理解企业级数据湖与AI Agent数据基座的市场需求,跟踪Lakehouse向Agentic Lake的演进趋势,围绕统一元数据治理、全模态数据管理(结构化/半结构化/非结构化/向量/Agent Context)、五级索引体系等核心能力,完成产品规划、功能定义与架构设计,构建面向AI Agent的Agent-Ready数据湖产品体系。
- 产品管理与跨团队协同:负责DLF产品全生命周期管理,协调Data+AI等多引擎协同团队,联动技术研发、测试、解决方案架构师、销售及运营等多职能团队,确保产品从设计到上市的高效交付。
- 开源生态与市场竞争力建设:深度参与Apache Paimon、Apache Fluss、Apache Iceberg、Lance等开源项目的产品化策略制定,持续跟踪国际头部竞品及业界主流云厂商在统一Catalog、湖仓一体领域的产品动态,结合湖流一体(Lake-Streaming)、全模态湖仓存储、全模态索引等差异化能力,制定竞争策略并推动产品市场优势持续扩大。
- 客户价值交付与场景落地:面向汽车(自动驾驶数据管理)、金融(实时风控)、零售(多媒体数据治理)、互联网(推荐/电商)等重点行业,梳理客户数据湖建设与AI应用的核心场景需求,设计Tables接口与Files接口的双层服务能力,推动Agent检索召回API、Context API等新型接口的场景化落地,提升客户转化与留存。
- 产品体验迭代与技术趋势洞察:持续追踪用户反馈,围绕行列级权限管控、数据生命周期管理、数据质量、湖格式性能等维度优化产品体验;紧跟AI Agent、RAG、向量检索、流批一体等前沿技术发展,将技术趋势转化为产品创新机会,驱动产品持续迭代升级。
职位要求
- 具备数据湖、大数据平台或云计算基础设施领域的产品或项目经验,熟悉主流湖格式(Paimon、Iceberg、Hudi、Delta Lake)及元数据管理(Hive Metastore、Glue Catalog、Unity Catalog)技术体系,了解分布式存储与计算引擎(Flink、Spark、Ray)的基本原理与适用场景,有数据湖或湖仓一体相关产品经验者优先。
- 具备AI与大数据融合领域的知识储备,理解向量索引(DiskANN/HNSW)、全文检索、语义检索等信息检索技术,了解AI Agent、RAG、Embedding等应用范式对底层数据基座的需求,能够将AI场景需求转化为数据平台产品能力定义。
- 具备深厚的技术理解力与产品架构能力,能够定义多模态数据的统一管理模型、设计分层产品架构(存储层/索引层/服务层/接口层),理解企业级能力(权限、审计、生命周期)的设计要点,能将复杂技术方案简化为客户可理解的产品价值主张,从客户视角驱动技术选型决策。
- 具备优秀的产品经理综合素质:能够熟练运用AI辅助工具提升工作效率;具备出色的文档撰写能力,能够清晰表达产品架构意图与技术方案;具备跨团队沟通与项目推动能力,能够在研发、开源社区、销售、客户等多方之间高效协调;执行力强,适应快速迭代的产品节奏。
- 本科及以上学历,计算机科学、软件工程、数据科学或相关专业,3年以上云计算/大数据/AI平台领域产品管理或技术项目经验;有开源社区参与经验或技术开发背景者优先;具备持续学习新技术的热情与快速构建新领域认知的能力。
联系方式:lubing.llb@alibaba-inc.com

▼ 「Flink Forward Asia 2026」 ▼
Flink Forward Asia 2026 将于 6 月 26 至 27 日在深圳举行,现面向全球征集议题。活动聚焦实时计算与 AI 的融合,欢迎开发者与 AI 从业者提交创新思路与实践经验。议题将经过专业评选委员会审核,提交截止日期为 5 月 29 日。参会嘉宾可免费报名,获取技术前沿与行业动态。期待您的参与,期待您的参与,共同探索实时 AI 的未来!

-
PC 端:https://asia.flink-forward.org/shenzhen-2026
打开 FFA 2026 官网,点击「议题征集」或者「参会」
-
移动端:扫描下方二维码或点击文末「阅读原文」
|
(扫描二维码,提交议题) |
(扫码即刻抢占席位) |

▼ 「实时计算 Flink 版」 ▼
复制下方链接或者扫描左边二维码
即可免费试用阿里云 Serverless Flink,体验新一代实时计算平台的强大能力!
了解试用详情:https://free.aliyun.com/?productCode=sc

▼ 关注「Apache Flink」 ▼
回复 FFA 2025 获取大会资料

更多推荐




所有评论(0)