咨询热线

夜蝉软件官网

首页 > 新闻中心 > AI不够“当医生”但能“帮医生”

AI不够“当医生”但能“帮医生”

更新时间:2026-08-18    点击次数:4

本报讯(记者 柴嵘)近日,北京友谊医院联合北京同仁医院等国内外多家医疗机构,开展了全球首次AI(人工智能)大模型医学诊断能力测评。测评结论是:AI眼下还无法取代人类医生,但可以辅助医生提高效率,让其有更多时间和精力服务患者。

此轮“应考”的“AI医生”是GPT-4o、Claude 3.5、Qwen-Max(千问)、DeepSeek-R1(深度求索)、OpenAI o1等5款国内外通用大模型。考题是真实临床病例,包括从心内科、眼科、神经内科、肿瘤科等7个科室选取的有代表性的真实病例脱敏数据。

研究团队主要成员、友谊医院放射介入科医生栗荐说,判卷人分了两批。一批是400余名不同年资、不同地区的执业医生,他们为大模型给出的意见进行盲评打分。结果显示:高年资医生和年轻医生对大模型的评价存在差异,不同地区医生之间也存在差异。

还有一批评委就是AI自己。其给出的“第一名”和400多位医生选出的并不相同。

栗荐说,我国很多医院已部署大模型辅助医生工作,但哪款大模型更适合临床辅助诊疗,尚无定论。此次人类和AI给出的卷面成绩没有达成一致,是因为AI只认“标准答案”。但现实中的医学案例,往往伴随着复杂的个体情况和病理差异,是一道“多选题”,甚至是“开放题”。

例如,同样是胸痛,心内科医生会优先排查冠心病,呼吸科医生会想到肺栓塞,急诊科医生则会立刻做心电图排除心梗。3种判断在各自专科逻辑里都成立,没有对错之分。但AI还难以理解这种差异。“所以当前的研究方向,也多是针对不同专科深耕,开发定制化的AI智能体。”栗荐说。