当下企业 AI 行业出现明显矛盾:企业持续放开 AI 智能体自主操作权限,但对自动化评测体系的信任度却持续走低。

依据 2026 年 6 月 VentureBeat 行业调研,本次调研面向 157 家员工规模≥100 人的企业专业从业者,调研结果具备行业参考趋势(非精准概率抽样):半数企业曾上线通过内部评测的 AI 智能体 / 大模型功能,上线后却引发面向客户的线上故障;四分之一企业出现过不止一次同类事故。

即便事故频发,企业并未放缓自动化落地节奏:66% 的企业现已允许部分流程无人工审核直接上线,或计划 12 个月内搭建全自主发布系统;仅 5% 企业完全信任自动化评测给出的上线判定结果。
这种供需错配就是评估断层:智能体自主操作上限持续提升,但配套可信核验体系的建设速度跟不上。

该现象也是 2026 VB Transform 峰会核心研讨议题:行业普遍先上线各类 AI 智能体,身份管控、效果评估、成本管控、上下文管理、流程编排等配套治理层均滞后落地。未来一整年企业将进入改造周期,预算会大量倾斜至智能体管控、稳定保障类配套系统。

一、自主能力超前,可信评估严重滞后:评测合格≠线上可用

传统软件测试逻辑固定:给定输入,校验输出是否符合预期。AI 智能体测试难度大幅提升,智能体可自主选择执行步骤、调用工具、拉取数据、修改业务状态,每次运行执行路径都存在差异。
智能体每一步单独判断都看似合理,最终结果却可能出错:调取正确账户却修改错误字段、生成合规退款申请却未经审批直接发送、前五轮工具调用全部正常,第六步泄露隐私数据或中断流程。

调研统计企业不信任自动化评测的四大核心原因(占比由高到低):

  1. 评测结果与真实线上业务表现脱节 29%
  2. 输出结果存在偏见、稳定性差 21%
  3. 决策过程缺乏可解释性 18%
  4. 数据泄露、隐私安全隐患 17%

企业核心痛点并非自动化评测速度慢、成本高,而是评测分数无法预判真实客户、员工使用场景下的故障。
美国国家标准与技术研究院(NIST)在生成 AI 指南中持相同观点:受控测试环境得出的指标无法直接复现线上表现,提示词、使用者、业务场景变化都会改变智能体行为,必须配套线上灰度测试、上线持续监控、故障升级处置流程。

二、单次成功不代表稳定可用:可复现性是核心指标

Anthropic 官方智能体评估指南明确区分两类指标:单次任务完成成功率、全场景稳定完成率。
面向客户、核心业务的智能体,后者才是硬性标准:偶尔输出优质答案,但随机场景频繁失效的模型无法投产。

企业评测体系建设要点:

  1. 可重复稳定输出列为一级核心指标,同一业务场景更换话术、上下文、工具异常条件反复多轮测试;
  2. 所有线上故障、客户投诉、工具调用失败、审批错误、数据违规案例,全部纳入回归测试用例,持续扩充评测集,避免同类问题重复上线。

三、按风险分级放开自主权限,而非盲目追求全无人自动化

调研结论并非要求所有智能操作必须人工审核,海量低价值业务全人工 review 不具备落地可行性,但全无人权限必须建立在充分可靠性验证、风险边界约束基础上。

高低风险场景分层管控

低风险场景:内部文档总结、文件分类,可开放高自主权限;
高风险场景:金融交易、客户对外沟通、代码发布、权限变更、数据删除,必须增设多重一致性校验、规则拦截、一键回滚、人工快速介入通道。

不同规模企业落地差异:2500 人以上大型企业 70% 计划落地全无人发布,中小企业比例 64%;大企业同时出现线上客户故障比例更高(54% vs 48%)。
行业警示:去掉人工审核不等于消除业务不确定性,缺少完善评估体系,只会把隐性风险转化为自动化线上事故。

市场长期趋势是持续提升智能体自主性,背后有明确降本增效收益,但长期优势不属于盲目快速去人工审核的企业,而是将复现性测试、故障回归校验与上线速度同等重视的团队。

Logo

这里是“一人公司”的成长家园。我们提供从产品曝光、技术变现到法律财税的全栈内容,并连接云服务、办公空间等稀缺资源,助你专注创造,无忧运营。

更多推荐