登录社区云,与社区用户共同成长
邀请您加入社区
现在我有了足够的信息,开始撰写完整的中文学习笔记。
为什么AI大模型成为越来越多程序员转行就业、升职加薪的首选很简单,这些岗位缺人且高薪智联招聘的最新数据给出了最直观的印证:2025年2月,AI领域求职人数同比增幅突破200% ,远超其他行业平均水平;整个人工智能行业的求职增速达到33.4%,位居各行业榜首,其中人工智能工程师岗位的求职热度更是飙升69.6%。AI产业的快速扩张,也让人才供需矛盾愈发突出。
文章摘要:当前Agent技术虽热,但生产实践经验稀缺。核心观点是Agent本质上是上下文工程(Context Engineering),能力上限取决于信息组织方式。文章指出应避免过度依赖框架、迷信长上下文,强调Benchmark优先、工具设计简洁、缓存优化等实践原则。同时提醒Memory技术尚未成熟,复杂编排可能适得其反,主张保持简单核心循环。随着模型进步,真正持久的Agent系统将是那些深刻理解
本文探讨了如何提高Agent工具调用的稳定性,从工具调用失败的根本原因出发,构建了四层防御机制。首先指出LLM输出的不确定性是失败主因,包括格式混乱、参数缺失等问题。然后提出完整的工具定义应包含名称、描述和参数模式三要素,强调描述质量直接影响工具选择准确性。文章重点介绍了四层防御策略:Prompt层通过示例引导正确格式;解析层采用宽松正则匹配;校验层利用Pydantic进行参数验证;执行层实施重试
本文通过一张图拆解了AIAgent从用户提问到结果返回的17步全流程,剖析了提示词、Agent、大模型等关键要素如何协同构建"自然语言意图→智能决策→工具执行→结果反馈"的闭环系统。同时介绍了AI大模型应用开发工程师的职责:需求分析、技术选型、应用开发、测试优化及部署运维,该岗位月薪可达60k,是连接AI技术与业务落地的关键桥梁。文章为开发者提供了构建高效AI应用的系统化框架,
2026年系统性的自学LLM、RAG、Agent等AI前沿技术,推荐最近我在看的电子书《Hello-Agents》,中文名为《从零开始构建智能体》,目前在GitHub上已经斩获15k的Stars,并且上升曲线非常陡峭,凸显其关注度和受欢迎程度。
本文面向工程实践介绍深度学习框架PyTorch,说明张量、自动求导和模块等核心概念,并描述在CPU/GPU上构建、训练和部署模型的典型工作流程。通过示意图表展示训练损失、准确率和GPU资源使用等信息,以帮助读者形成完整的工程视角。
随着 LLM 越来越擅长生成"看起来合理但实际过拟合"的回测结果,如何判断一个 AI 生成策略的真实 OOS 有效性,将成为下一个核心问题。:可以把 Vibe-Trading 当作"策略原型生成器"而非"交易系统"——用它在几分钟内跑出10个假设的初步回测,筛选值得深入研究的方向,再用 QuantConnect 或自有系统做严格复现。这是当前 AI-for-Finance 工具链的一次有代表性的工
摘要:本文探讨了Agent在执行复杂多步骤任务时容易偏离主线的问题,提出通过"待办清单驱动执行"的解决方案。核心思路是让Agent自行维护结构化任务清单(TodoManager),而非依赖固定流程规划
提取日程信息不准确改进extract_event_info方法,或让LLM提取"""用LLM提取日程信息"""请从以下用户输入中提取日程信息,输出JSON格式:def extract_event_info_with_llm(self , user_input) : """用LLM提取日程信息""" prompt = f"""请从以下用户输入中提取日程信息,输出JSON格式: {user_input
“Agent的评估-01:针对MAF的三种Agent评估方式”针对三种IAgentEvaluator的不同实现,介绍了三种评估MAF Agent的方式。在介绍IAgentEvaluator接口的时候,我们提到MAF以此为核心的评估系统。这个系统由IAgentEvaluator、EvalItem和AgentEvaluationResults三个核心类型组成。
本文探讨了在Strands Agent框架中集成AgentScope的RAG(检索增强生成)能力的方法。RAG技术通过检索知识库相关内容作为上下文,有效解决了大模型在特定领域知识问答中的局限性。文章分析了集成过程中的关键挑战,包括架构差异(AgentScope采用异步设计而Strands为同步)、工具封装、状态管理和错误处理等问题。重点介绍了如何利用AgentScope的Reader、Knowle
2026年被业界称为"智能体AI元年",AI正从生成式迈向自主行动。本文解析Agent AI的三大核心趋势及其对普通人和企业的影响。
本文介绍了AgentFramework的学习资源与最新动态。随着1.0正式版发布,作者重构了代码仓库(dotnet-agent-playbook),整理了30篇系列教程(涵盖基础构建、多Agent协作、工具调用等主题),并计划重点讲解Workflows工作流编排能力。所有示例代码已迁移至新仓库,部分历史版本API需注意兼容性。该系列适合各阶段开发者学习,提供从入门到企业级实践的完整指导。
本文分析了claw-code项目中各模块的产品就绪度,区分了"可售卖"与"演示版"的标准。核心模块如ConversationRuntime、API和权限系统已具备商业化基础,而服务器端和部分集成功能仍停留在演示阶段。文章特别指出文档与源码实现存在差异,如hooks功能已实现但文档未更新。最后强调产品化的关键差距在于HTTP接口闭环、持久化和多租户支持,这些是
记忆模块是Agent打破LLM设计Agent的记忆系统可以仿照人类的记忆机制。分为。
MAF的Agent评估体系以`IAgentEvaluator`为核心,作为该接口的三个原生实现之一,`LocalEvaluator`运行我们在本地定义符合签名的委托来对AIAgent实施评估。原则上我们可利用这种方式实现任意评估逻辑。我们就来看看`LocalEvaluator`背后是如何驱动我们自定义的委托来评估指定的Agent。
彻底搞懂Agent的完整工作闭环,建立Agent的核心认知框架,理解感知、决策、行动三大支柱的协作机制。
A2A协议本身并未绑定具体的传入协议,上一篇主要介绍如何将MAF的Agent以`JSON-RPC`协议发布为A2A服务,这篇文章我们采用相同的形式介绍基于单纯HTTP+JSON的实现。两者的区别很简单,前者将请求和响应消息包装进成符合J`SON-RPC`协议的**封套**,并使用JSON-RPC Method来标识具体的操作,后者直接以请求和响应消息的JSON文本作为传输的内容,通过为每个
随着大模型的迅猛发展,LLM 作为人工智能的核心力量,正以前所未有的方式重塑着我们的生活、学习和工作。无论是智能语音助手、自动驾驶汽车,还是智能决策系统,大模型都是幕后英雄,让这些看似不可思议的事情变为可能。
本系列之前的文章都提供了在各种场景下执行评估的例子,我们无一例外都是在控制台中呈现评估的结果,实际上MEAI不仅可以将评估结果持久化存储,还能将其转换网页的形式以极具可读性的方式呈现出来。本篇文章就来介绍一下关于评估报告的生成问题。
2026年Agent岗面试深度指南:从基础到多Agent协作 本文针对2026年Agent技术岗位面试趋势,系统梳理核心考点与应对策略。面试重点已从框架使用转向底层原理和工程实践,涵盖8大模块: 基础认知:明确Agent与Chatbot、Workflow的本质区别,掌握ReAct核心机制 单Agent架构:深度解析5大模块(决策/工具/记忆等),强调自研优化能力 算法内核:超越GRPO模板,探讨训
对于我们个人来说,Agent编程最大的挑战不是各种所谓的工作,而是写提示词,毕竟我不是专业的文字工作者。OpenEvals针对一系列针对输出文本质量的评估指标定义了对应的提示词,结合基于LLM-as-a-Judge的评估器,我们可以进行针对简洁度、正确性、幻觉度、相关性、计划遵循度、代码正确性等指标的评估。我们会分上下文两篇文章来介绍针对这些预定义提示词的使用。
Nanobot是一款基于Typer、Rich、Questionary等工具的轻量级AI助手CLI工具。其onboard命令用于初始化配置和工作区,支持通过参数或交互式向导设置配置文件路径、工作区目录等。配置处理采用pydantic进行数据验证,向导界面利用Questionary和prompt_toolkit实现交互式操作,支持配置LLM提供商、聊天通道等功能。该命令会根据用户选择决定是否保存配置,
AI从“会聊天”到“能干活”的5层架构解析 本文用通俗语言拆解AI任务执行的底层逻辑,将复杂技术术语归纳为5个功能层:1)决策层(Agent)负责拆解任务;2)执行层(Tools/CLI)连接外部工具;3)方法论层(Workflow/Skill)固化操作流程;4)知识层(RAG/Memory)管理信息调用;5)安全层(Guardrails)控制操作边界。文章通过"AI助理写公众号"等场景案例,形象
我们知道Workflow本质上是一个有向有环图,天生适合表达这种条件循环。所以在这篇文章中,我们将试着将LoopAgent中间件的循环策略采用Workflow来实现。为此我们定义了为Workflow定义了两种类型的Executor,`AgentExecutor`用来调用指定的`AIAgent`,`EvaludationExecutor`用来对每次迭代的输出进行评估,并决定循环是否继续。如果决定继续
WorkflowHostAgent将复杂Workflow封装为统一接口的Agent,实现API兼容性、可组合性和会话管理。以转账工作流为例,通过改造输入输出类型(需支持ChatMessage和TurnToken),将其转换为AIAgent。该流程包含交易提取、风险评估、人工审批和执行转账四个模块,利用ChatProtocolExecutor处理自然语言输入,验证后触发不同执行路径(自动处理或人工审
本文解析了 Pi Agent Loop 的核心机制,基于 v0.82.1 版本源码。Pi 的 Agent Loop 并非简单的 while 循环,而是需要处理多种复杂场景,包括消息转换、流式响应、工具调用验证、串并行执行、转向控制、后续处理以及终止条件等。文章详细拆解了 Agent Loop 的四层消息边界、状态管理机制、prompt()调用流程,并重点分析了其独特的双层循环设计(工具转向循环+后
当然,2026年4月份开始,Cursor 的新版本,也做了很大的改版,不断的从 IDE 形态,向 Agent 形态去转变,在社区上引发了广泛的讨论。2026年的2月14日,我公众号发表了一篇文章,完全基于 Cursor,短时间内,全程0代码,从设计到实现,写了个功能完整,视觉效果还不错的小程序,还是在我之前没有微信小程序开发经验的基础上。经过一个个版本的完善,加上模型能力本身不断增强,2025年下
本文分析了claw-code仓库采用Python/Rust双轨策略的利弊。Python轨(src/)作为移植工作区,优势在于快速验证架构、生成可解释报告和量化移植进度;Rust轨(rust/)则专注于构建安全、高性能的产品级实现。双轨策略的最大挑战是防止语义漂移和贡献者注意力分散,需要明确以Rust为产品主线、Python为对照线,并建立最小契约对齐机制。建议Python专注于诊断验证,Rust负
在”Loop Engineering在MAF中的实现-06:利用Workflow来使用LoopAgent的循环策略“中,我们采用MAF的工作流实现了LoopAgent类似的循环。既然可以利用MAF的Workflow实现,自然能利用LangGraph来实现。鉴于两者之间设计上的差异,相同的功能如果采用这两种解决方案,使用LangGraph大概率会更加简单。
[Agent的评估-09:利用FoundryEvals调用Foundry评估服务]对FoundryEvals如何根据指定的评估器名称调用Foundry评估服务进行了详细的介绍。文中说到:除了预定义的原生评估器(Built-in Evaluator),`FoundryEvals`还支持用户自定义评估器(Rubric Evaluator)。本文将介绍如何利用`FoundryEvals`基于自定义规