跳到正文
原文
npj Digital Medicine· Youssef Mokssit·· 1 天前精选AI 评分70

哈佛团队推出临床智能体评测沙盒 FHIR-AgentEval

FHIR-AgentEval: a modular sandbox for benchmarking clinical LLM agents with memory-augmented configurations

AI 导读

哈佛医学院等机构的研究团队推出 FHIR-AgentEval 模块化评测沙盒,用于评估大语言模型智能体执行 HL7 FHIR 医疗数据操作的可靠性。该基准包含 43 个覆盖预约管理与基因检测工作流的任务,在可重置的 FHIR 服务器上同步验证智能体响应与服务器状态。五种配置的消融实验表明,记忆机制能减少工具选择错误与资源类型混淆,在测试任务中使执行成功率比基线提升 9.1%。

推荐理由

研究通过可重置服务器状态验证与消融实验,为临床大模型智能体调用标准化医疗数据接口提供了具体评测方案。

来源:npj Digital Medicine · nature.com