Data Agent 框架调研与融合架构设计
Data Agent 框架调研与融合架构设计
深度解析 OpenAI、Vanna.ai、LangChain、DataGPT 四大主流框架,并构建新一代"数智融合"架构
博主调研了一下最近比较火的几个AI Data Agent技术架构,总结分享下自己的一些心得吧~ 大家一起交流。
I. 主流 Data Agent 框架对比分析
1. OpenAI Data Agent
本质定位:AI 数据分析助手 - 从"单纯代码生成"转向"深度上下文感知"
核心设计:五层上下文架构
┌─────────────────────────────────────────────────────────────┐
│ Layer 5: Memory (持续进化的记忆) │
│ ├─ 反馈闭环:用户纠错 → 经验固化 │
│ ├─ Global Memory:公司级通用逻辑 │
│ └─ Personal Memory:个人偏好记录 │
├─────────────────────────────────────────────────────────────┤
│ Layer 4: Institutional Knowledge (机构知识库) │
│ ├─ 非结构化集成:Slack、Notion、Docs │
│ ├─ RAG 检索增强 + 权限控制 │
│ └─ Canonical Definitions:指标口径统一 │
├─────────────────────────────────────────────────────────────┤
│ Layer 3: Codex Enrichment (代码级溯源) ⭐ 亮点 │
│ ├─ 逻辑反向工程:阅读 Spark/Python/SQL ETL │
│ ├─ 粒度识别:自动识别过滤条件 │
│ └─ 自动化更新:ETL变更 → Agent认知自动更新 │
├─────────────────────────────────────────────────────────────┤
│ Layer 2: Human Annotations (专家标注) │
│ ├─ 语义补全:is_act → is_active_user │
│ ├─ Caveats:记录 Schema 看不出来的坑 │
│ └─ 意图捕捉:明确表的最佳用法 │
├─────────────────────────────────────────────────────────────┤
│ Layer 1: Table Usage (基础元数据与血缘) │
│ ├─ Schema Grounding:表结构、列名、数据类型 │
│ ├─ Table Lineage:上下游血缘关系 │
│ └─ Query Inference:从历史SQL学习 Join 逻辑 │
└─────────────────────────────────────────────────────────────┘
关键亮点
| 特性 | 说明 |
|---|---|
| 代码级理解 | 不仅读取表结构,还通过 Codex 阅读底层 Pipeline 代码,理解字段真实业务定义 |
| 自愈能力 | 执行出错时分析日志自动重试,通过 Evals API 对比"黄金数据集"验证逻辑 |
| 全局记忆层 | 用户纠错存入全局记忆,下次任何人问类似问题都会记住业务逻辑 |
| 双输出验证 | 同时对比 SQL 和结果数据,通过 OpenAI Evals grader 打分并解释 |
安全设计
- 权限控制:动态注入 Row-level Security (RLS)
- 数据脱敏:自动模糊化敏感字段
- 审计日志:记录所有查询行为
2. Vanna.ai
本质定位:RAG 驱动的 NL2SQL 翻译器
核心流程:训练 → 检索 → 纠错 → 记忆
💡 核心理念:一个好的 Data Agent,不在于模型多强,而在于它能多精准地检索到业务上下文!
三层训练模型(RAG 架构)
┌────────────────────────────────────────────┐
│ 向量化知识库存储 │
├────────────────────────────────────────────┤
│ 1. DDL(数据定义语言) │
│ └─ 表结构、列名、数据类型、关系 │
├────────────────────────────────────────────┤
│ 2. Documentation(业务文档) │
│ └─ "有效订单"等业务术语定义 │
├────────────────────────────────────────────┤
│ 3. SQL 对(黄金数据集)⭐ 关键 │
│ └─ "问题-正确SQL"示例,优先检索相似案例 │
└────────────────────────────────────────────┘
Vanna 2.0 核心升级:Identity-First(身份优先)
| 痛点 | 解决方案 |
|---|---|
| 权限隔离 | 每条指令携带用户身份,自动应用行级安全(RLS) |
| 双重输出 | 一份给 LLM 读的简报(推理),一份给用户看的交互界面(图表) |
| 工具化思维 | SQL执行、图表绘制封装为 Tools,Agent 按需调用 |
技术亮点
| 特性 | 说明 |
|---|---|
| 自学习进化 | 用户纠错 → 存入 Tool Memory → 越用越聪明 |
| 框架灵活性 | 支持任意大模型 + 任意数据库 + 任意向量库组合 |
| Function RAG | 将 RAG 转化为可调用的"模板",SQL生成从"随机生成"变为"参数填充" |
| 安全沙箱 | Python代码执行在隔离环境,防止 Prompt 注入攻击 |
资源链接
- 📓 Notebook: https://colab.research.google.com/github/vanna-ai/vanna/blob/main/notebooks/quickstart.ipynb
- 🐙 GitHub: https://github.com/vanna-ai/vanna.git
3. LangChain SQL Agent
核心设计:渐进式技能加载(The Skills Pattern)
关键洞察:sql generate 是在 analytics skills(具体领域分析框架和业务知识)之后的
三层信息解耦
用户提问:"上周销售额如何?"
↓
┌─────────────────────────────────────────────┐
│ 第一层:元数据(轻量) │
│ ├─ 知道有哪些 Skills(销售分析、库存管理等) │
│ └─ 简短描述识别 │
└──────────────────┬──────────────────────────┘
↓
┌─────────────────────────────────────────────┐
│ 第二层:核心内容(按需加载)⭐ │
│ ├─ 触发"销售分析"技能 │
│ ├─ 加载完整 Schema 和业务逻辑定义 │
│ └─ 节省 Token,避免注意力分散 │
└──────────────────┬──────────────────────────┘
↓
┌─────────────────────────────────────────────┐
│ 第三层:详细资源(深度查询) │
│ ├─ 历史查询模板 │
│ ├─ 复杂指标算法 │
│ └─ 仅在需要时读取 │
└─────────────────────────────────────────────┘
拟态多代理协作(Quasi-Multi-Agent)
| 特征 | 实现 |
|---|---|
| 按需调用 | 像调用 Sub-agent 一样调用 Skills |
| 上下文控制 | 只有相关领域上下文进入 Token 窗口 |
| 分布式开发 | 不同业务团队独立维护技能文件夹(.claude/skills/) |
技术实现 Workflow
- 路由决策:识别需要哪几个 Skills
- 工具触发:
load_skill加载特定领域 SKILL.md - 自愈验证:利用技能知识进行自我修正
资源链接
- 📚 文档: https://docs.langchain.com/oss/javascript/langchain/sql-agent
- 🔧 Skills: https://docs.langchain.com/oss/javascript/langchain/multi-agent/skills-sql-assistant
4. DataGPT
本质定位:“左右脑协同架构” - 集成高性能计算引擎和 LLM 推理的闭环系统
🔗 工具链接: https://www.sparkx.zone/tools/datagpt
核心功能
| 功能 | 描述 |
|---|---|
| 自然语言问答 | 日常语言提问 → 即时获得分析师级别答案 + 图表 |
| 主动洞察 | AI 自动监测数据,识别异常、趋势,每日摘要推送 |
| 数据导航器 | 直观浏览指标,层层下钻探索 |
| 无缝集成 | 连接各种数据源,一次性模式配置确保一致性 |
| 闪电计算引擎 (LCE) | 毫秒级复杂查询,成本降低 15 倍 |
| 导出分享 | 支持 CSV、PDF、交互式表格 |
"左右脑"协同架构 ⭐ 核心设计
┌─────────────────────────────────────────────────────────┐
│ 问题输入: │
│ "为什么上周上海地区利润下滑?" │
└──────────────────────┬──────────────────────────────────┘
↓
┌─────────────────────────────┐
│ 右脑 (LLM 层) │
│ ├─ 意图识别:归因分析 │
│ ├─ 任务拆解:多维度对比 │
│ └─ 时间维度:上周 │
└──────────────┬──────────────┘
↓
┌─────────────────────────────┐
│ 左脑 (专有分析引擎 - LCE) │
│ ├─ 统计测试:显著性检测 │
│ ├─ 归因算法:贡献度计算 │
│ └─ 对比分析:环比/同比 │
└──────────────┬──────────────┘
↓
┌─────────────────────────────┐
│ 右脑 (LLM 层 - 润色) │
│ ├─ 结构化事实 → 自然语言 │
│ └─ 生成 Plotly 可视化图表 │
└─────────────────────────────┘
闪电计算层 (Lightning Cache)
| 优势 | 说明 |
|---|---|
| 性能 | 内存级高速缓存,比传统数据库快 90 倍 |
| 成本 | 在缓存层运行迭代查询,避免频繁调用云端数据库 |
| 预处理 | 自动索引和汇总,数据处于"Ready"状态 |
三层技术栈
┌──────────────────────────────────────────┐
│ Layer 3: 分析师代理 (Analyst Agent) │
│ └─ 自托管 LLM,结构化事实 → 自然语言报告 │
├──────────────────────────────────────────┤
│ Layer 2: 核心分析引擎 │
│ └─ 统计测试、归因分析、生成结构化事实 │
├──────────────────────────────────────────┤
│ Layer 1: 数据连接层 │
│ └─ 插件连接数据源 → 同步至 Lightning Cache│
└──────────────────────────────────────────┘
核心亮点对比
| 能力 | DataGPT | 普通 SQL Agent |
|---|---|---|
| 归因分析 | ✅ 自动挖掘"为什么"(如:收入下降是因为加州移动端广告转化率降低) | ❌ 只告诉你发生了什么 |
| 动态基准 | ✅ 任意时间段、客群横向对比,无需预配置 BI 仪表盘 | ❌ 依赖预设报表 |
| 多轮对话 | ✅ 主动询问消歧:“你指总销售额还是净利润?” | ❌ 单次问答 |
II. “数智融合” Data Agent 架构蓝图
融合上述所有架构优点,cookie帮我分下了下未来Data Agent可能该怎么做。
总结性感触
在 AI-Native 的体系视角下,Data Agent 正在从“面向分析师的大数据引擎”演进为“面向模型与智能体的数据基础设施操作系统”。其核心不再是单一 SQL 加速或可视化能力,而是向下做深、做厚、做硬:以高吞吐、低延迟、强一致、可观测、可编排的系统级能力,为上游模型训练、微调、推理、Agent 工具调用提供 SLA 可量化的数据供给。
关键技术指标已从传统 QPS/并发转向:
-
摄取层:Kafka/Pulsar 集群级吞吐 ≥ 3 GB/s·broker,P99 端到端延迟 ≤ 20 ms,支持
exactly-once 语义与多协议透明接入(Kafka、MQTT、HTTP/2、gRPC)。 -
计算层:Flink/Spark 分析算子鲁棒性 ≥ 99.98 %,支持自适应检查点(Aligned-Unaligned
混合)、预测式弹性扩缩(基于 K8s VPA+HPA 指标预测),Failover 时间 ≤ 15 s。 -
调度层:自研 DAG
Scheduler 实现毫秒级任务依赖解析,批流一体调度延迟 ≤ 100 ms;支持动态优先级继承与资源抢占,保障交互式
SLA(TP99 ≤ 500 ms)。 -
存储层:Iceberg/Hudi 湖格式 + Alluxio 缓存,提供 10 GB/s 扫描带宽,列级 TTL 与索引更新延迟
≤ 30 s;支持向量化 Parquet/Orc Reader 与 GPU-Direct Storage 直通。 -
资源治理:全链路
eBPF+OTel 可观测,CPU/内存/网络/磁盘四维火焰图关联;通过 BPF
自适应限流,将计算瓶颈自动反馈到调度器,实现“数据负载-资源-成本”三角最优。 -
SLA 量化:面向 Agent Tool-Call 场景定义三级 SLA——L0 实时特征 ≤ 50 ms、L1 离线标签 ≤ 5
min、L2 批量样本 ≤ 30 min;支持预算化调度(Budget-based Scheduling),在资源抢占时优先保障
L0 链路。
综上,AI 时代的 Data Agent 本质是“数据基础设施操作系统”,其核心竞争力体现在:高吞吐消息总线、鲁棒流批一体引擎、毫秒级调度与资源抢占、全链路可观测与自治优化,以及面向模型训练的量化 SLA 保障,而非传统意义上的 BI 加速或 SQL 性能。
新一代架构:Adaptive Intelligence Analytics (AIA)
吸取四大框架精华,构建"中枢大脑+双引擎+多层记忆"的融合架构
核心架构图解
┌───────────────────────────────────────────────────────────────────────┐
│ 用户交互层 │
│ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐ │
│ │ 自然语言问答 │ │ 可视化图表 │ │ 主动洞察推送 │ │ 多轮对话 │ │
│ └──────┬──────┘ └──────┬──────┘ └──────┬──────┘ └──────┬──────┘ │
└─────────┼────────────────┼────────────────┼────────────────┼──────────┘
└────────────────┴───────┬────────┴────────────────┘
↓
┌───────────────────────────────────────────────────────────────────────┐
│ 中枢大脑:意图解析与任务编排 │
│ Chain of Thought · 技能路由 · 上下文管理 │
└──────────────────────────────────┬────────────────────────────────────┘
↓
┌───────────────────────────────────────────────────────────────────────┐
│ 第一层:多维上下文感知层 ⭐ │
│ ┌─────────────────┐ ┌─────────────────┐ ┌─────────────────────────┐ │
│ │ 代码级溯源 │ │ 语义向量库 │ │ 血缘与优先级感知 │ │
│ │ (Code-Enriched) │ │ (RAG) │ │ (Lineage) │ │
│ └─────────────────┘ └─────────────────┘ └─────────────────────────┘ │
└──────────────────────────────────┬────────────────────────────────────┘
↓
┌───────────────────────────────────────────────────────────────────────┐
│ 第二层:逻辑与计算双引擎 ⭐ │
│ │
│ ┌─────────────────────────┐ ┌─────────────────────────────┐ │
│ │ 右脑 (推理引擎) │ │ 左脑 (计算引擎) │ │
│ │ LLM 驱动 │◄────►│ Lightning Cache │ │
│ │ · 意图识别 │ │ · 高性能归因算法 │ │
│ │ · 任务拆解 │ │ · 统计测试 │ │
│ │ · 报告润色 │ │ · 结果合理性校验 │ │
│ └─────────────────────────┘ └─────────────────────────────┘ │
│ │
│ └─────── 自愈验证器 ───────┘ │
└──────────────────────────────────┬────────────────────────────────────┘
↓
┌───────────────────────────────────────────────────────────────────────┐
│ 第三层:模块化技能插件 (Multi-Agent) │
│ │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ 销售分析 │ │ 财务分析 │ │ 供应链 │ │ 营销分析 │ │
│ │ Skill │ │ Skill │ │ Skill │ │ Skill │ │
│ └────┬─────┘ └────┬─────┘ └────┬─────┘ └────┬─────┘ │
│ └─────────────┴─────────────┴─────────────┘ │
│ 动态按需加载 │
└──────────────────────────────────┬────────────────────────────────────┘
↓
┌───────────────────────────────────────────────────────────────────────┐
│ 第四层:持续进化记忆系统 │
│ │
│ ┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐ │
│ │ Global Memory │ │ Personal Memory │ │ 纠错反馈闭环 │ │
│ │ 全局经验池 │ │ 个人偏好记录 │ │ UI纠错→RAG更新 │ │
│ └──────────────────┘ └──────────────────┘ └──────────────────┘ │
└──────────────────────────────────┬────────────────────────────────────┘
↓
┌───────────────────────────────────────────────────────────────────────┐
│ 第五层:安全与评估管线 │
│ │
│ ┌──────────────────┐ ┌──────────────────┐ ┌──────────────────┐ │
│ │ 身份感知访问 │ │ 脱敏沙箱 │ │ 自动化 Eval │ │
│ │ (Identity-First) │ │ (PII扫描) │ │ (Golden Set对比) │ │
│ │ 动态 RLS 注入 │ │ │ │ │ │
│ └──────────────────┘ └──────────────────┘ └──────────────────┘ │
└───────────────────────────────────────────────────────────────────────┘
五大核心分层详解
第一层:多维上下文感知层 (Context-Rich Layer)
吸取 OpenAI & Vanna 精华
| 组件 | 功能 | 技术实现 |
|---|---|---|
| 代码级溯源 | 自动解析 ETL 脚本,识别隐含业务逻辑 | Codex 读取 Spark/Python/SQL |
| 语义向量库 | 存储 DDL、专家标注、问题-SQL对 | Embedding + RAG 检索 |
| 血缘与优先级 | 优先从"金牌报表层"取数,非原始日志 | 元数据图谱 + 血缘追踪 |
第二层:逻辑与计算双引擎 (Dual-Engine System)
吸取 DataGPT 精华
| 引擎 | 职责 | 输入/输出 |
|---|---|---|
| 右脑 (LLM) | 意图识别、任务拆解、报告润色 | 问题 → 指令序列 |
| 左脑 (LCE) | 归因算法、统计测试、合理性校验 | 指令 → 结构化结果 |
| 闪电缓存 | 毫秒级查询,降低 15 倍成本 | 预处理数据 |
第三层:模块化技能插件 (Skill-Based Multi-Agent)
吸取 LangChain 精华
┌──────────────────────────────────────┐
│ 技能加载流程 │
│ │
│ 1. 识别领域 → 2. 加载 Skill │
│ ↓ │
│ ┌─────────────┐ │
│ │ 销售分析 │ · 指标定义层 │
│ │ Skill │ · 常用查询模板 │
│ │ │ · 业务逻辑注解 │
│ └─────────────┘ │
│ ↓ │
│ 3. 执行查询 → 4. 返回结果 │
└──────────────────────────────────────┘
第四层:持续进化记忆系统 (Evolutionary Memory)
各家融合升级
| 记忆类型 | 存储内容 | 更新机制 |
|---|---|---|
| Global Memory | 公司级业务避坑指南 | 人工维护 + 自动沉淀 |
| Personal Memory | 用户偏好(CEO看饼图,CFO看Excel) | 学习用户行为 |
| 纠错反馈闭环 | 用户 UI 纠错 → 转化为 RAG 知识点 | 实时更新 |
第五层:安全与评估管线 (Security & Evaluation)
新增补充
| 模块 | 功能 | 技术 |
|---|---|---|
| 身份感知访问 | 动态注入 Row-level Security | JWT + RLS 策略 |
| 脱敏沙箱 | PII 扫描,自动模糊化敏感字段 | 正则匹配 + ML 识别 |
| 自动化 Eval | 对比 Agent 输出与 Golden Set | 裁判模型打分 |
核心业务流程 (Workflow)
用户提问:“为什么上周上海地区的利润下滑?”
Step 1: 意图解析
├─ 识别:归因分析 + 区域维度 + 时间维度
└─ 输出:分析意图结构化
Step 2: 技能加载 ⭐
├─ 识别为"区域销售分析"技能
├─ 加载销售域 Schema
├─ 加载归因算法插件
└─ 输出:领域上下文就绪
Step 3: 上下文检索
├─ RAG 检索:"上海仓库上周暴雨预警"
├─ 非结构化文档关联
└─ 输出:外部事件上下文
Step 4: 双引擎协作
├─ 左脑计算:上海各门店利润变动贡献度
├─ 右脑推理:结合暴雨背景生成解释
└─ 输出:结构化归因结果
Step 5: 安全审查
├─ 检查用户权限:上海地区详细成本数据
├─ 脱敏处理:隐藏敏感客户信息
└─ 输出:安全合规结果
Step 6: 可视化输出
├─ Plotly 交互式归因图表
├─ 自然语言报告
└─ 下钻探索入口
III. 四大框架核心能力对比表
| 维度 | OpenAI | Vanna.ai | LangChain | DataGPT | AIA (融合架构) |
|---|---|---|---|---|---|
| 核心定位 | 上下文感知 | RAG+NL2SQL | 技能插件 | 双引擎计算 | 数智融合中枢 |
| Context深度 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 计算准确性 | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 扩展灵活性 | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 自学习能力 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 企业安全 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 最佳场景 | 深度分析 | 快速部署 | 团队协作 | 实时计算 | 全场景覆盖 |
参考资料
- OpenAI Data Agent: 技术分享
- Vanna.ai: https://vanna.ai/docs/
- LangChain SQL Agent: https://docs.langchain.com/
- DataGPT: https://www.sparkx.zone/tools/datagpt
更多推荐



所有评论(0)