Agent落地医疗最佳实践(非常详细):RareAgents多学科协作诊疗全解析,收藏这一篇就够了!
引言
罕见疾病虽单病种发病率低,但因种类繁多,全球患者总数高达数亿。其诊断面临的核心痛点在于:症状常累及多器官系统,而兼具跨学科知识与临床经验的专科医生却极度稀缺,导致患者往往陷入漫长而曲折的“诊断之旅”。
近日,一项发表于预印本平台的研究带来了突破性方案。由清华大学与北京协和医院团队联合提出了 RareAgents——首个专为罕见病复杂临床场景设计的大语言模型驱动多学科团队诊疗框架。它创新性地模拟真实世界多学科会诊流程,让多个具备动态长期记忆和专用工具调用能力的“专科医生”智能体协同工作,在罕见病诊断和用药推荐任务上,性能超越了当前最先进的领域专用模型、通用大模型及已有的智能体框架。
研究内容与方法
一、专属数据集构建
- RareBench-PUBLIC数据集
-
• 数据来源:多中心罕见病患者临床数据
-
• 构建流程:
- • 筛选包含至少3种标准症状编码的罕见病病例,最终保留1197例有效病例
- • 标注498种罕见病,构建包含17232种症状、9260种疾病的语义空间
- MIMIC-IV-EXT-RARE数据集
-
• 数据来源:MIMIC-IV数据库中Beth Israel Deaconess Medical Center的患者数据
-
• 构建流程:
- • 基于Orphadata的ICD-10与ORPHA罕见病代码映射关系,筛选罕见病患者
- • 保留具有至少2次住院记录的患者,最终得到4760例患者的18522次就诊记录
- • 构建包含8922种疾病、3920种操作、122种药物的诊疗语义空间
二、RareAgents多学科自主诊疗框架
RareAgents是面向罕见病的患者中心式多Agent框架,由多学科团队协作、动态长期记忆、医疗工具调用三大核心模块构成,整体架构如下:

RareAgents框架整体流程图
1. 多学科团队(MDT)协作模块
- • 目的:解决罕见病多系统受累、单Agent知识覆盖不足的问题,模拟临床多学科会诊的协作机制
- • 实现逻辑:
-
• 预定义专科Agent池:包含41个临床专科(如心内科、神经科、泌尿科等),每个专科Agent配置专属角色描述与系统提示,明确其专科诊疗职责
-

儿科专科Agent的角色定义示例
-
• MDT动态组建:主诊医师Agent根据患者的症状、诊断或治疗需求,从专科池中筛选高度相关的专科Agent组成MDT团队
-
• 多轮共识讨论机制:
- 各专科Agent基于自身专科知识,独立生成初步诊疗意见
- 每轮讨论后同步所有成员的意见,更新自身决策依据
- 重复迭代讨论,直到所有成员达成共识或达到预设的最大讨论轮次
- • 讨论报告生成:主诊医师Agent汇总所有轮次的MDT讨论意见,形成统一的MDT讨论报告,公式如下:其中,为最大讨论轮次,为第轮讨论中专科Agent 提出的诊疗意见
2. 动态长期记忆模块
- • 目的:利用历史病例与患者纵向就诊记录,为罕见病诊疗提供上下文支撑,弥补大语言模型对罕见病例的知识缺口
- • 实现逻辑:
- • 诊断场景记忆检索:
- • 将患者症状转换为标准化嵌入向量
- • 从RareBench数据集的病例库中,检索与当前患者嵌入相似度最高的Top-K(默认)相似病例
- • 检索公式:
- • 治疗场景记忆检索:
- • 针对患者第次就诊,检索其前次的所有就诊记录,包括诊断结果、操作记录和用药历史
- • 检索公式:其中,为前次就诊的临床记录,为前次就诊的用药决策结果
- • 记忆动态更新:将当前病例的最终诊疗决策结果加入记忆库,持续丰富记忆资源池
3. 医疗工具调用模块
- • 目的:整合专业医疗工具的精准输出,提升罕见病诊断的准确性与治疗方案的安全性、合理性
- • 实现逻辑:
- • 诊断工具集:包含3种罕见病专属诊断工具,通过API或脚本调用获取候选诊断结果
- • Phenomizer:基于症状语义相似性检索,返回Top-10候选诊断及对应p值
- • LIRICAL:基于似然比分析,返回Top-10候选诊断及对应后验概率
- • Phenobrain:基于表型驱动的AI模型,返回Top-10候选诊断及对应预测得分
- • 治疗工具集:包含2种药物相关工具,用于优化治疗方案
- • DrugBank:获取药物的化学性质、药理机制、适应症等详细信息
- • DDI-Graph:检索药物间的相互作用关系,避免不合理的药物组合
-
• 工具结果聚合:将所有工具的输出结果进行拼接,形成统一的工具反馈信息,公式如下:其中,为医疗工具集合,为工具对患者临床记录的输出结果
-
• 最终诊疗决策生成:主诊医师Agent整合MDT讨论报告、记忆检索结果、工具反馈信息,生成最终的诊断或治疗决策,公式如下:
-

不同医疗工具的调用效果对比图
实验结果分析
RareAgents在罕见病诊断与治疗中的性能表现
以下图表展示了RareAgents框架在罕见病鉴别诊断和用药推荐两大核心任务中的综合性能。通过与通用及医疗大语言模型、现有医疗智能体框架以及领域内最先进(SOTA)模型的比较,评估了RareAgents的有效性。

RareAgents与其他模型在诊断和用药推荐任务上的性能对比。
- • 诊断任务(RAREBENCH-PUBLIC):RareAgents(基于Llama-3.1-70B)在所有评估指标(Hit@1, Hit@3, Hit@10, MR)上均超越了所有基线模型,包括GPT-4o、其他医疗智能体框架以及经过医疗微调的LLM。这证明了其多学科团队协作框架在复杂症状推理上的核心优势。
- • 用药推荐任务(MIMIC-IV-EXT-RARE):RareAgents(70B)在Jaccard系数和F1分数上取得了最佳表现,表明其推荐的药物组合与医生实际处方高度吻合。尽管在药物相互作用(DDI)率上略逊于某些专门优化的模型,但其整体推荐效果具有显著竞争力。
- • 模型规模影响:无论是8B还是70B参数版本,RareAgents均显著优于同规模的单智能体及其他智能体框架,且70B版本性能提升明显,体现了更大模型容量对复杂临床决策的关键支持作用。
多学科团队(MDT)协作机制的有效性分析
本部分通过控制变量实验,深入探讨了RareAgents核心模块——多学科团队(MDT)协作、动态长期记忆和医疗工具使用的各自贡献与最佳实践。

RareAgents各模块的消融实验结果
- • 模块贡献度:移除任一核心模块都会导致性能下降。其中,移除动态长期记忆模块对诊断任务(Hit@1下降12.4%/22.4%)影响最大,凸显了历史相似病例对罕见病鉴别的核心重要性。移除医疗工具模块则导致治疗任务的DDI率显著上升(↑23.4%/20.7%),证明了外部知识库对用药安全的关键保障作用。
- • MDT规模与角色定义:如图3所示,诊断和治疗的性能随MDT中专家人数增加而提升,并在约12人(诊断)和22人(治疗)时达到峰值,符合临床实际需求。图4与图5进一步表明,基于科室相关性预定义专家角色(紫色)的策略,在诊断和治疗的各项指标上均显著优于由LLM自动生成角色或随机选择角色的策略。
动态记忆与工具使用的深度分析
本部分进一步分析了动态长期记忆检索策略以及不同医疗工具对智能体决策的具体影响。

动态记忆检索与随机检索在诊断(a-c)和用药推荐(d-f)任务上的性能对比
- • 动态记忆 vs. 随机记忆:在用药推荐任务中(图10d),动态检索仅需5次历史就诊记录即可达到接近最佳的Jaccard分数,而随机检索即使增加记录数量,性能提升也极其有限。这证明了精准的相关上下文检索远比单纯增加信息量更重要。
- • 诊断工具协同:如图11a所示,在诊断任务中,同时使用Phenomizer、LIRICAL和Phenobrain等多种工具(“All Tools”)能获得最佳的综合诊断召回率。在治疗任务中(图11b),结合使用DrugBank(药物信息)和DDI-Graph(药物相互作用图)能有效平衡推荐效果(Jaccard/F1)与用药安全(DDI)。
优势与局限
优势
• 多学科协作能力强:框架模拟真实临床多学科团队(MDT)会诊,通过预定义专家池和迭代讨论,显著提升对复杂、多系统罕见病的诊断和治疗决策准确性。
• 模块化设计灵活可扩展:集成了动态长期记忆、医学工具调用和MDT协作三大核心模块,支持即插即用,易于适应不同医疗决策场景,并超越现有医学智能体框架。
• 数据与任务覆盖全面:不仅构建了首个面向罕见病药物推荐的扩展数据集MIMIC-IV-EXT-RARE,还在鉴别诊断和用药推荐两大核心任务上均超越了领域专用SOTA模型和通用大语言模型。
局限
• 数据模态与模型微调受限:当前工作主要基于文本形式的临床编码和症状,未整合医学影像、基因组学等多模态数据,且未对底层大语言模型进行针对罕见病领域的专门微调。
• 临床部署与验证尚不充分:尽管在公开数据集上表现优异,但框架的输出仍可能存在大语言模型固有的幻觉或偏见,需进一步的外部数据集验证和临床专家评估,目前仅能作为辅助工具。
• 计算与时间开销较大:多智能体协作、多轮讨论以及外部工具调用增加了推理过程的复杂性和时间成本,对计算资源要求较高,可能影响实时临床应用的可行性。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐



所有评论(0)