登录社区云,与社区用户共同成长
邀请您加入社区
Agent 系统的零停机升级需要处理模型状态连续性、推理不可中断性、工具调用幂等性三个特殊约束。蓝绿部署适合低风险升级(配置变更、Prompt 优化),通过双环境 + 一键流量切换实现秒级回滚,但需要排空现有 Agent 任务。金丝雀发布适合高风险升级(模型切换、协议变更),通过用户 ID 哈希的一致性路由,逐步增加新流量的同时保持同一用户的上下文连续性。不管哪种策略,Agent 上下文的保存和恢
多Agent协同风险不是单点漏洞问题,而是跨角色、跨消息、跨工具的链路风险问题,真正需要威胁建模的是谁在什么边界内读写什么信息、通过什么信道影响下游决策、最终如何触发高后果动作,并围绕入口、传播、执行、回写四段建立可验证的控制点与证据链,这样才能把注入扩散、权限继承、记忆污染和数据外泄从偶发事故转成可度量、可阻断、可复验的工程治理闭环。
2026下半年AI创业的第一增长曲线在垂直行业Agent,第二增长曲线在超级个人工具链。建议创业者优先选择一个市场规模大于100亿、信息化基础较好、且现有Agent产品覆盖不足的垂直行业切入。不要同时做医疗和法律两个行业,单个行业的深度远比多个行业的广度有价值。在垂直行业站稳后再朝向超级个人的工具链延伸,这是最稳健的增长路径。
分享一下 langsmith 的 Agent 测评方法。
本文对比了LLM调用和Agent调用的区别,指出LLM调用是单纯的输入-输出,而Agent具备规划、记忆、工具使用能力的自主系统。Agent由LLM、记忆模块、规划模块和工具使用模块构成,能主动分解任务、调用工具、管理记忆,实现复杂问题解决。文章详细解析了各模块的功能与协同工作方式,并通过实例说明Agent如何通过推理、调用工具和记忆管理,提供个性化、持续进化的服务。对于想要深入理解大模型应用的开
26年6月来自上海交大和华为公司的论文“AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness”。最近,连续环境中的零样本视觉-语言导航 (VLN-CE) 通过大型视觉-语言模型 (VLM) 变得可行。然而,现有的方法通常依赖于学习的航路点预测器来提出可导航的动作。这严重限制模型的动作空间,并且无
本文通过一张图拆解了AIAgent从用户提问到结果返回的17步全流程,剖析了提示词、Agent、大模型等关键要素如何协同构建"自然语言意图→智能决策→工具执行→结果反馈"的闭环系统。同时介绍了AI大模型应用开发工程师的职责:需求分析、技术选型、应用开发、测试优化及部署运维,该岗位月薪可达60k,是连接AI技术与业务落地的关键桥梁。文章为开发者提供了构建高效AI应用的系统化框架,
摘要:这篇综述论文系统分析了LLM智能体的记忆系统,将其分为四大流派(语义记忆、个性化记忆、情景记忆和结构化记忆),并通过实验揭示了当前记忆系统的四大痛点:基准测试存在"上下文饱和陷阱",传统评估指标(如F1)与语义理解脱节,开源骨干模型存在高格式错误率(达30.38%),复杂架构在实际部署中面临延迟问题。研究指出,在长上下文窗口时代(如128k+),许多记忆系统的优势可能被夸
2024-2026年,软件工程Agent研究从代码补全转向仓库级任务处理,模型能参与真实开发流程(定位bug、多文件编辑、测试验证等)。核心进展体现在:1)评测体系(SWE-bench系列)标准化真实issue修复任务;2)交互框架(SWE-agent等)设计专用工具接口;3)结构化方法(Agentless)验证简化管线的有效性;4)数据合成(SWE-smith)解决训练数据稀缺问题。研究趋势表明
前置知识已经说明,大模型可以生成回答或工具调用意图,却不会自行进入外部环境执行;Agent 因此需要一条能够行动、观察并继续判断的反馈循环。本篇把这条抽象循环写成第一个 Python 程序,并始终围绕“查找当前目录中的 Python 文件”这次请求,观察模型如何提出动作、Harness 如何执行、结果怎样回到下一轮,以及程序最终怎样停止并形成完整闭环。
本文拆解了企业AI化转型中四个关键技术概念:大语言模型(LLM)作为通用智能基础;检索增强生成(RAG)通过外部知识库增强回答准确性;微调(Fine-tuning)使模型深度掌握领域知识;智能体(Agent)实现自主任务执行。文章分析了各自特点、适用场景及相互关系,建议企业分阶段实施:从RAG快速验证开始,逐步过渡到微调和Agent。同时解答了常见技术选型问题,强调RAG是中小企业理想切入点。全文
一名半导体晶圆厂的制造部工程师,日常工作就是管产线、盯产能。工序多:一片晶圆从投片到出片,要经过光刻、刻蚀、沉积、离子注入、扩散、CMP、量测、清洗等几百道工序,任何一道卡住,后面全堵设备贵:一台 EUV 光刻机动辄上亿美元,OEE 每掉 1 个点,一个月就是几百万的损失变量多:PM(预防性维护)、Down(宕机)、Setup(换线)、产品切换……影响产能的因素多到让人头大决策靠经验:很多产能规划
如何解决智能体长轨迹任务中现有上下文管理方法不可逆且不灵活导致的信息丢失问题?论文提出即插即用的自适应上下文弹性器ACE,通过无损存储与动态编排实现历史信息的可逆弹性调用。
本文分享一套基于Agent+RAG的5层生产级架构,解决智能问数从Demo到生产常见的准确性、并发稳定性、权限安全及规模化扩展问题。架构通过分层解耦、安全兜底设计,帮助中小团队快速搭建高效、安全、可扩展的智能问数系统。核心内容包括架构设计、优化方案、配置规范及5个常见致命坑的解决方案,助力开发者实现生产级落地。
本文提出了一种让AI技能(Skill)自我进化的系统架构,突破了传统静态提示词文件的局限。通过建立闭环评估机制,系统能够自动收集技能执行数据、分析失败原因、提出改进建议并验证效果。核心创新在于将技能视为可演进组件,利用图结构存储执行历史和反馈数据,实现基于证据的自动优化。这种动态演进机制解决了AI系统因环境变化导致的技能老化问题,同时保留了人工监督权,使维护更高效可靠。文章还展示了该架构的具体实现
从单点工具到平台生态是Agent产品发展的必然方向,但时机选择比执行速度更重要。核心建议:在付费客户数达到500之前不要启动平台化;优先开放非核心能力的扩展点(如数据连接器、报告模板);建立严格的质量审核机制防止低质量Skill污染生态。下半年的重点是完成API标准化和Skill SDK的开发,为Q4的正式平台开放做好准备。
本篇博客是以吴恩达的【Agent智能体】教程为基础,并对其中的内容做了笔记整理以及个人收获的总结。
不是每个 AI 任务都需要 Agent。路径固定、风险可控的业务,更适合轻量工作流。用确定流程包住模型能力,用 Schema 和人工复核兜底,系统会更简单,也更可靠。
一个做法务的朋友跟我诉苦。他们公司法务团队一共5个人,每天要审查50-80份合同。下半年更多,采购合同、销售合同、保密协议、NDA……每份合同都要逐条看条款、找风险点、写审阅意见。
Meta开源300亿参数稠密模型MuseGlimmer,专为Agent工作流设计。该模型采用Dense架构确保长程一致性,通过4-bit量化和DFlash投机解码技术实现消费级GPU部署(RTX5090加速3.1x)。在24项基准测试中12项领先,特别擅长多步工具调用和失败恢复等Agent核心能力。模型以Apache2.0许可证发布,支持多种部署方式,标志着Meta"本地Agent优先&
我理解这三个概念是粒度从小到大的三层结构。Tools 是最小的能力单元,就是封装好的可调用函数,比如搜索、执行代码、发邮件,它只负责「执行」,本身没有任何决策能力;Agent 是一个完整的决策系统,内部用 LLM 做大脑,自己判断什么时候调哪个 Tool、要不要继续、什么时候结束,是主动的;Workflow 是更上层的编排框架,把 Agent、LLM、Tools 组织成一条确定性流程,每个节点做什
发现最终结果不好。拆解工作流,深入查看单次调用的中间结果,弄清错误是如何发生的。批量运行测试,统计各环节的错误比例,找出最大瓶颈,集中火力进行优化。
在多用户共享记忆环境中,一个好的 Agent 不仅要有用,还要知道什么该说、什么不该说、什么已经被要求遗忘。
2026年Agent技术的三个趋势方向,投资优先级排序为:工具使用(立即投入)> 多模态(预研验证)> 自主决策(谨慎观望)。核心建议:不要追热点,聚焦工具使用能力的标准化建设,这是未来12个月内Agent产品最确定的增长点。多模态和自主决策方向,保持每周跟踪论文和开源项目进展,但在准确率达到90%之前不进行产品化投入。
搭建完整的 Harness 不是一次性项目,是持续演进的过程。第一阶段:生存(0-2 周)建立 AGENTS.md配置基础验证脚本让 Agent 能独立完成简单任务第二阶段:可靠(2-8 周)完善状态管理和交接机制建立多层级验证闭环让 Agent 能处理复杂任务且成功率稳定在 80%+第三阶段:优化(8 周以后)建立可观测性和指标系统基于数据持续优化 Harness让 Agent 的产出质量逼近人