
一句“不用担心”背后的医学事实漏洞
在线问诊中,一句 “你的脂肪肝不用担心”,背后可能隐藏着什么?
咨询者是一名既往弥漫大 B 细胞淋巴瘤患者,医生根据影像描述将脂肪肝特征误判为 “影像高密度”,据此排除了脂肪肝。该判断表面看符合医学语境,但关键医学事实与真实影像表现并不一致。
以往针对在线诊疗的安全方案,大多依赖关键词规则或简单的文本分类。这类方法对 “明显错误” 有效,但遇到需要结合患者全局上下文、临床指南和证据链才能判断的边界案例,往往力不从心。一个 “不” 字被遗漏,结论就可能完全相反。
最近,蚂蚁 AI 安全实验室与厦门大学团队联合提出了 MedGuard,将医学事实核查嵌入诊疗流程。它不是又一个 AI 问诊系统,而是一层可嵌入医疗服务流程的安全基础设施 —— 在医生给出诊疗意见、AI 生成回复、用药方案形成之前,先对关键医学事实进行证据层面的验证。相关论文已被 npj Digital Medicine 接收。

论文标题:MedGuard: An LLM-Based Gatekeeper for Detecting Clinical Risks in Chinese Telemedicine Consultations
合作机构:蚂蚁集团、厦门大学
论文状态:npj Digital Medicine(Nature Portfolio,影响因子 18.0)
论文链接:https://www.nature.com/articles/s41746-026-03116-0_reference.pdf
该研究将重点聚焦于医疗安全中的诊疗安全:面向真人医生和 AI 辅助诊疗等多元医疗服务形态,在医患对话、诊断结论、用药方案和治疗建议形成的过程中,主动发现事实错误、逻辑矛盾、关键遗漏与潜在用药风险。最终沉淀为 MedGuard—— 一个面向中文医疗场景的医疗事实核查与诊疗风险识别系统。
MedGuard 在基准评测和临床专业人员评价中均展现出突出表现:基于 7B 参数量级构建,在研究构建的 MedGuardEval 医疗风险评测基准上,评测覆盖真实在线问诊、复杂临床病例和药品知识三类场景。MedGuard 在细粒度对话级风险识别任务中达到 SOTA 水平,整体优于主流开源模型与 HealthCareAgent 等代表性医疗 Agent 系统,其中 F1 相比基线平均提升 22.1%。不仅如此,在 5 分制临床评价中,按照研究预设标准,3 分及以上表示具备临床辅助参考价值;126 名覆盖 10 个科室的持证临床专业人员对 MedGuard 七项评估维度的平均评分均超过 4.0 分,整体评价达到较高水平,其中事实准确性、错误减少、法律伦理安全与整体可用性等关键维度超过 4.2 分。
难的不是 “生成答案”,而是 “判断是否可靠”
互联网诊疗让患者随时随地能看上医生,但也让诊疗风险的呈现方式发生了根本变化。
一次在线问诊可能持续数小时甚至数天。病史、症状、检查结果、处方和治疗建议分散在十几轮对话中。无论是辅助医生开展诊疗,还是支持 AI 参与医疗服务,AI 真正要发挥作用的不是 “生成一段看似专业的回复”,而是能否完整理解临床语境,并准确识别哪些医学事实需要进一步核查。
研究将在线诊疗中的医学事实核查归纳为三类核心挑战。
第一,关键信息被长对话淹没。诊疗风险往往隐藏在长链路、多轮次交流中,关键否定词、剂量信息、既往史和患者特殊情况容易被上下文信息淹没,导致重要风险信号遗漏。
第二,风险边界难以界定。医疗安全不是简单的 “对” “错” 之分。部分诊疗建议需要结合患者具体情况、指南依据和临床经验综合判断。过度敏感会将合理诊疗行为误判为风险,产生大量无效预警,增加医生负担;过于保守则可能遗漏真正需要关注的问题。
第三,医学判断结果需要可追溯。 医疗风险识别 “这里有问题” 并不困难,难的是说清楚 “为什么有问题”。缺乏可追溯证据链的风险提示,医生难以快速复核,也就难以形成有效干预。
MedGuard 让医疗判断具备
可验证性的事实核查框架
将复杂诊疗过程拆解为可核查的医学事实
MedGuard 的思路是:将复杂的医患交流拆解为一组可独立验证的原子医学声明(atomic medical claims)。所谓原子医学声明,是指每条声明只表达一个可以独立判断真伪或风险的临床命题,例如 “该影像表现可排除脂肪肝” 或 “当前剂量适用于该年龄患者”。
系统同时维护患者全局上下文,提取年龄、性别、既往史、过敏史和当前用药等关键信息,对分散在多轮交流中的语句进行去上下文化重写,补全指代和省略信息,并保留否定关系、剂量和时间等关键临床约束。
这一过程包含关键医学信息抽取、患者上下文构建、声明去上下文化、质量审查与去重四个环节。它解决了医疗事实核查中的一个关键问题:如果待核查的医学事实本身不完整,后续检索和推理能力再强,也可能验证错误的对象。通过构建带有患者特异性的原子医学声明,MedGuard 为后续证据核查建立稳定入口。

图 1 展示了 MedGuard 对真实问诊案例的事实核查过程。系统从诊疗交流中提取关键医学声明,并结合医学证据识别潜在风险。
基于不确定性驱动证据核查,形成闭环验证能力
MedGuard 对每条医学声明,不直接进行简单的 “风险 / 无风险” 二分类,而是先进行分层谨慎判断,输出 No Risk、Low Risk、High Risk 三种状态。其中 Low Risk 并不代表低危,而是表示当前判断依据不足或语义存在歧义,需要进一步核查。
高置信的 No Risk 与 High Risk 声明可以沿快速路径完成初步判断;只有进入不确定区域的声明,才触发外部医学证据核查流程。这种以不确定性驱动核查的机制,使系统能够将有限的检索和推理资源集中投入最需要复核的边界案例,在降低漏报的同时控制无效预警。

图 2 展示了 MedGuard 的证据核查闭环流程:系统围绕待核查医学声明,通过规划器生成检索策略,调用医学知识资源获取证据,并由推理模块结合声明与证据输出最终风险判断。
进入核查路径后,MedGuard 的规划器会将医学声明转化为结构化检索任务,明确核心医学实体、适应证 / 禁忌证约束,以及对应的疾病或药物知识领域。检索器在由六类权威中文医学资源构建的知识底座中获取相关证据,该知识底座包含 16535 条疾病记录与 187738 条药物记录。

图 3 展示了 MedGuard 的医学知识底座与证据推理过程:系统分别从疾病和药物知识库中提取相关证据,并形成支撑最终风险判断的 Evidence Chain。
总结器进一步抽取与声明直接相关的证据片段,保留剂量、禁忌证、相互作用和定量指标等关键事实。与单次检索后生成不同,MedGuard 会显式判断当前证据是否充分:若证据缺失、相关性不足或无法支撑结论,规划器会分析失败原因,调整检索策略并再次触发检索与总结,直到获得足以支撑判断的证据。
最终,推理器联合医学声明与精炼证据,输出 Risk/No Risk 结论、解释和证据链,形成声明理解 → 不确定性路由 → 证据规划 → 检索总结 → 充分性判断 → 推理输出的完整闭环。
不仅发现风险,更准确判断风险边界
在细粒度与粗粒度对话评估中,MedGuard 均表现出稳定的风险识别能力。基于 7B 参数量级构建,细粒度对话级风险识别任务中达到 SOTA 水平,整体优于主流开源模型与 HealthCareAgent 等代表性医疗 Agent 系统,其中 F1 相比基线平均提升 22.1%,粗粒度评估提升 5.8%;其中,作为事实核查入口的声明抽取能力相比其他大模型平均提升 23.2%。在按治疗类别、身体系统、年龄和语义标签划分的 41 个子类中,平均 F1 达到 0.77,38 个子类进入前三,22 个子类排名第一。

图 4 展示了 MedGuard 在细粒度、粗粒度风险识别以及医学声明抽取任务上的性能表现,验证了其对复杂医疗语境中关键风险的识别能力。
但数字之外,更值得关注的是 MedGuard 对 “风险边界” 的判断能力。医疗安全能力的关键,不只是发现风险,更需要准确区分真正需要关注的问题与合理诊疗行为。
回归那个既往弥漫大 B 细胞淋巴瘤患者的在线问诊案例,医生将脂肪肝错误描述为影像高密度影,并据此排除了脂肪肝。MedGuard 基于权威证据进行事实核查,准确识别了这一医学事实错误,同时保留医生提出的 MRI 与甲胎蛋白检查建议等合理诊疗行为,体现了对诊疗风险边界的判断能力。
研究进一步邀请 126 名、覆盖 10 个科室的临床专业人员,对 604 段真实问诊进行评价。事实准确性、错误减少、法律伦理安全与整体可用性等关键维度平均得分均超过 4.2 分(满分 5 分);不同科室医生评分具有较高一致性,体现出较好的临床认可度和跨科室适用性。

图 5 展示了 MedGuard 的多维临床评价结果,包括不同评价维度得分、科室覆盖范围以及医生评分一致性分析。
另一组数据同样值得关注:在 10000 段真实问诊记录的回顾性验证中,MedGuard 在不同生理系统中的风险识别波动控制在 ±0.03;同时产生 2234 条风险预警,而对比模型产生 4785 条,说明其并非依靠增加预警数量换取安全,而是在保持风险识别能力的同时,有效控制不必要的警报负担。换言之,它所发出的每一条预警,都更值得临床医生认真审视。
把诊疗安全能力嵌入真实医疗流程
MedGuard 最终不是一个独立的问诊系统,而是一层可嵌入医疗服务流程的安全基础设施。它可以接收完整问诊记录、医生诊疗结论或 AI 辅助生成的诊疗建议,对其中的关键医学事实进行核查,并输出结构化结果:待核查声明 — 风险等级 — 支持证据 — 解释与修正建议。
在实际应用中,MedGuard 可覆盖三个关键环节,将事实核查能力嵌入医疗流程,形成持续、规模化的风险发现机制。
1. 回复或处方前核查:在医生或 AI 给出结论之前,先行完成医学事实层面的验证;
2. 问诊过程风险提醒:在对话进行过程中,实时提示潜在医学事实风险;
3. 历史诊疗质量回顾:对已完成问诊进行回顾性的医学事实质量核查。
在 Medical Fact Check 服务体系中,MedGuard 将医疗安全转化为可执行流程:识别关键医学事实,基于权威证据完成验证,并在必要时触发复核。系统定位为诊疗安全辅助能力,而非替代医疗决策。它的核心价值在于:当临床医生面对复杂病例时,多一个 “背靠权威证据的同行评议者” 协助把关。
从长对话理解、医学声明拆解,到不确定性驱动的证据核查,MedGuard 探索了一条面向医疗智能化时代的安全技术路径:医疗智能化的安全,不只是避免生成有害内容,更需要发现不可靠诊疗事实、解释风险依据,并在不干扰正常医疗服务的前提下及时介入。
在 AI 走向临床的过程中,这样的 “守门人”,或许比任何炫酷的生成能力都更重要。

© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com