登录社区云,与社区用户共同成长
邀请您加入社区
在今年的 ICML 上,AI Infra 已经悄悄形成了三条清晰主线:GPU / Training System、LLM Serving 和 Agent Infra:GPU / Training System研究如何让模型结构、编译器、通信和 GPU 集群真正协同起来;LLM Serving 开始从单纯追求吞吐,转向围绕 KV Cache、长上下文和异构请求做全局资源调度;Agent Infra
多智能体(Multi-Agent)是让多个能够接收信息、做出判断并执行动作的 AI 智能体,围绕一个共同目标进行任务分配、信息交换和协同工作的系统架构。
SGLang是一款专为大语言模型结构化生成优化的推理框架,由斯坦福和伯克利团队开发。它通过三大核心技术提升效率:RadixAttention实现KV Cache共享,减少30-70%显存占用;约束解码确保输出符合JSON/代码等语法规则;编程式接口将提示工程封装为可组合函数。实测显示,在JSON生成等结构化任务中,其性能达vLLM的3倍。该框架特别适合AI Agent、RAG系统等需要精准输出的场