正文

一、背景:GUI Agent 的四条路线

AI Agent 操作计算机图形界面(GUI)的能力,正在成为 Agent 落地的关键一环。目前业界大致有四类技术路线:

路线 代表方案 核心依赖 主要局限
传统 RPA UiPath 等 坐标定位 + 规则脚本 界面变化即失效,维护成本高
浏览器型 CUA 基于 CDP 协议 Chrome DevTools Protocol 只能操作浏览器,无法覆盖桌面应用
云端 Computer Use Claude CU 等 云端大模型 API 屏幕数据需上传至云端,隐私风险大
纯视觉 GUI Agent Mano-P 屏幕截图 → 视觉理解 → 操作 不依赖协议,全平台,本地运行

Mano-P 走的是第四条路线:纯视觉 GUI Agent。不依赖 CDP 协议,不解析 HTML/DOM,不需要辅助功能接口,直接从屏幕截图理解 UI 并执行操作。

今天(2026 年 4 月 13 日),Mano-P 正式以 Apache 2.0 协议开源。

GitHub:https://github.com/Mininglamp-AI/Mano-P

二、Benchmark 成绩

先看硬数据。

2.1 OSWorld:专有模型全球第一

Mano-P 72B 在 OSWorld 基准上达到 58.2% 成功率,在专有模型排名中位列全球第一。第二名 opencua-72b 成功率为 45.0%,Mano-P 领先 13.2 个百分点

在全模型排行榜(包含 GPT、Claude、Gemini 等千亿级通用大模型)中,Mano-P 排名第五。考虑到前四名均为参数规模远超 72B 的通用大模型,这个成绩意味着 Mano-P 在 GUI Agent 垂直领域的能力密度非常高。

2.2 多模态综合:13 个榜单 SOTA

Mano-P 在全球多模态评测中取得 13 个榜单 SOTA,部分代表性成绩:

  • ScreenSpot-V2:93.5
  • MMBench:87.5
  • UI-Vision:46.6
2.3 Web 导航能力

在 WebRetriever Protocol I 的 NavEval 评测中,Mano-P 取得 41.7 分,超越:

  • Gemini 2.5 Pro CU:40.9
  • Claude 4.5 CU:31.3

在这里插入图片描述

三、核心技术拆解

3.1 纯视觉 GUI 理解

Mano-P 的核心设计哲学是"像人一样看屏幕"。不通过 CDP 获取 DOM 树,不调用辅助功能接口枚举 UI 元素,而是直接对屏幕截图进行视觉理解。

这带来两个关键优势:

  1. 全平台覆盖:浏览器、桌面应用、3D 软件、专业工具——只要有图形界面就能操作。
  2. 零侵入:不需要目标应用暴露任何接口或安装插件。
3.2 Mano-Action 双向自增强学习

这是 Mano-P 训练体系中最有创新性的设计之一,核心思想借鉴了 GAN 的循环一致性(Cycle Consistency)。

传统的 GUI Agent 训练通常是单向的:给定文本指令,学习生成对应的操作序列。Mano-Action 在此基础上增加了反向链路:

  • 正向:Text → Action(给定指令,生成操作)
  • 反向:Action → Text(给定操作序列,生成对应的文本描述)

两个方向互为监督信号,形成闭环:

Text ──→ Action ──→ Text'
  ↑                    │
  └────── 一致性约束 ──┘

如果正向生成的 Action 是正确的,那么从这个 Action 反推出的 Text’ 应当与原始 Text 语义一致。这个循环一致性约束迫使模型在两个方向上都学到更准确的映射关系,而不仅仅是记忆训练数据中的 pattern。

实际效果是显著提升了模型在 unseen UI 上的泛化能力。

3.3 三阶段训练流程

Mano-P 的训练采用三阶段递进式设计:

Stage 1:SFT(监督微调)

使用人工标注的 GUI 操作数据进行监督微调,让模型建立基本的"看屏幕 → 执行操作"能力。这一阶段的目标是获得合理的基线策略。

Stage 2:离线 RL(Offline Reinforcement Learning)

在 SFT 基础上,使用已收集的交互轨迹(包括成功和失败的操作序列)进行离线强化学习。模型学习从失败轨迹中吸取教训,从成功轨迹中强化正确行为,而不需要实时与环境交互。

Stage 3:在线 RL(Online Reinforcement Learning)

最后阶段让模型直接与真实 GUI 环境交互,通过在线强化学习不断优化策略。这一阶段是提升真实场景成功率的关键——模型不再只是从离线数据中学习,而是自主探索、试错、改进。

三个阶段逐步递进:从模仿(SFT)到反思(离线 RL)到自主探索(在线 RL),构成完整的能力成长路径。

3.4 GSPruning:视觉 Token 压缩

端侧部署面临的核心挑战是:视觉模型处理屏幕截图会产生大量 Token,直接影响推理速度和内存占用。

GSPruning(Guided Structural Pruning)是 Mano-P 的视觉 Token 压缩方案,核心指标:

  • Token 保留率:压缩至 约 25%(即丢弃约 87% 的视觉 Token)
  • 吞吐量提升2-3 倍
  • 精度损失:极小(通过引导式结构化剪枝保留关键信息)

GSPruning 不是简单地均匀降采样,而是通过学习哪些视觉区域对 GUI 理解最关键,有选择地保留信息密度最高的 Token。这使得端侧推理既快又准。

3.5 think-act-verify 循环推理

Mano-P 的推理过程不是"一次性输出完整操作序列",而是采用 think-act-verify 循环:

  1. Think:分析当前屏幕状态,理解任务上下文,规划下一步操作
  2. Act:执行一步操作
  3. Verify:检查操作结果是否符合预期

每次循环只执行一步操作,执行后重新截屏验证,确认成功后再规划下一步。这种方式的鲁棒性远高于一次性规划。

四、端侧部署性能

Mano-P 4B 量化版本(w4a16)在 Apple M4 Pro 上的实测数据:

指标 数值
预填充速度 476 tokens/s
解码速度 76 tokens/s
峰值内存占用 4.3GB

这组数据意味着:在一台本地设备上,Mano-P 可以实时完成屏幕理解和操作决策,响应速度满足交互式使用需求,且内存占用控制在可接受范围内。

更重要的是,所有数据完全在本地处理。屏幕截图不会上传到任何云端服务器。对于涉及敏感信息的操作场景(企业内部系统、个人隐私数据、金融交易界面),这一特性是硬需求。

五、使用方式

当前提供两种开箱即用的方式,第三种即将发布。

1. CLI 方式(mano-cua)

# 安装
brew tap HanningWang/tap && brew install mano-cua

# 运行
mano-cua run "打开微信并告诉FTY会议延期"

2. Agent Skill 方式(mano-skill)

clawhub install mano-cua

安装后,Agent 可自主判断何时需要 GUI 操作并自动调用 Mano-P。无需手动触发。

3. Python SDK(mano-client,即将发布)

适合编程集成场景,关注 GitHub 获取更新。

六、典型应用场景

Mano-afk:全自动应用构建

给定一个自然语言需求描述,Mano-P 自动完成完整的开发流程:需求分析 → 架构设计 → 编写代码 → 运行测试 → 修复问题 → 验证交付。全程无需人工干预。

个性化操作习惯学习

Mano-P 能够学习用户的个人操作习惯和偏好。一个具象化的例子:按照你个人的打法策略来打麻将——不是通用最优策略,而是你的风格。这正是 Personal AI 的含义。

七、开源路线图

Mano-P 的开源分三个阶段推进:

阶段 内容 状态
阶段一 Mano-CUA Skill 开源 — 开箱即用 今天发布
阶段二 本地模型 + SDK — 数据零上云 🔜 即将
阶段三 训练方法 + GSPruning + 量化技术 📋 规划中

最终目标是将完整的技术栈——从训练方法到部署优化——全部开放给社区。

八、总结

Mano-P 想解决的问题很明确:让 AI Agent 能够像人一样看懂屏幕并操作任何软件,同时数据不出本机。

今天迈出第一步:代码开源,开箱即用。


Star & 试用:https://github.com/Mininglamp-AI/Mano-P

Apache 2.0 开源。欢迎提 Issue、提 PR、参与贡献。



Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐