npj Digital Medicine· Youssef Mokssit·· 1 天前精选AI 评分70
哈佛团队推出临床智能体评测沙盒 FHIR-AgentEval
FHIR-AgentEval: a modular sandbox for benchmarking clinical LLM agents with memory-augmented configurations
AI 导读
哈佛医学院等机构的研究团队推出 FHIR-AgentEval 模块化评测沙盒,用于评估大语言模型智能体执行 HL7 FHIR 医疗数据操作的可靠性。该基准包含 43 个覆盖预约管理与基因检测工作流的任务,在可重置的 FHIR 服务器上同步验证智能体响应与服务器状态。五种配置的消融实验表明,记忆机制能减少工具选择错误与资源类型混淆,在测试任务中使执行成功率比基线提升 9.1%。
推荐理由
研究通过可重置服务器状态验证与消融实验,为临床大模型智能体调用标准化医疗数据接口提供了具体评测方案。
来源:npj Digital Medicine · nature.com