
醫療AI越來越會考試,但未必越懂臨床實況。美國麻省總醫院最新登上《Nature Biomedical Engineering》的研究發現,頂尖LLM在醫學考試拿下92分高分,但在他們建置的真實臨床任務評測框架中,卻只得44.8分,凸顯醫療AI在臨床應用有著明顯落差。他們也打造一款LLM公開排行榜,目前已納入107款模型.
大型語言模型(LLM)近年在醫療領域表現驚艷,不少模型甚至能在美國醫師執照考試(USMLE)中,拿下接近專科醫師水準的成績。然而,美國麻省總醫院布萊根體系(Mass General Brigham)最新研究發現,這些在標準化考試表現亮眼的AI模型,面對真實醫療情境時,能力可能大打折扣.
該醫院研究團隊最近在《Nature Biomedical Engineering》上,發表一項名為BRIDGE的醫療AI評測框架。這套評測基準,專門評估大型語言模型對真實臨床資料的理解力,範圍涵蓋電子病歷、臨床病例報告和醫病對話等資料,且也涵蓋9種語言.
研究結果發現,表現最佳的模型在標準化醫學考試中拿下92分,但在BRIDGE測試中,平均得分只有44.8%,意味著目前醫療AI模型存在明顯的臨床理解落差。除了論文研究,團隊也同步公開模型排行榜,來供醫療機構和開發者比較不同模型在真實臨床任務的表現,目前已納入107款模型.
為何現有醫療AI評測方式不夠?過去幾年,醫療LLM的能力大多透過醫學考試題庫來評測,比如美國醫師執照考試(USMLE)或專科考題。這類評測方式都有個共同特性:題目通常經過標準化設計,使用正式且結構化的醫學語言,答案也相對明確.
然而,Mass General Brigham研究團隊指出,這類測驗主要評估醫學知識和推理能力,無法完整反映臨床現場的複雜性.
因為,相較於考題,醫師每天接觸的是電子病歷、護理紀錄、醫病對話及各類非結構化文本,其中充滿醫療縮寫、不完整病史、跨科別資訊和各院不同的書寫習慣。AI若無法理解這些內容,即使具備豐富醫學知識,也難以真正融入臨床工作流程.
Mass General Brigham醫學部藥物流行病學與藥物經濟學部門研究員Jie Yang表示,有別於許多以醫學考題為核心的評測工具,團隊建立的BRIDGE更聚焦於真實臨床資料來源,就是希望更真實反映AI在醫療照護現場的能力.
用真實病歷和醫病對話,測試AI能力BRIDGE最早在2025年公開上架,最近則正式通過同儕審查並刊登於權威期刊《Nature Biomedical Engineering》上.
有別於傳統的醫療AI基準測試,BRIDGE採用電子病歷、臨床病例報告和醫病對話等真實醫療文本,作為測試資料,而非醫學考試考題.
簡單來說,BRIDGE包含59個臨床資料來源,評估95款大型語言模型在病人照護全流程中的表現,涵蓋14個臨床專科領域,以及病人分流、醫療資訊擷取、疾病診斷、預後預測和醫療申報與編碼等能力.
結果顯示,即使是表現最佳的模型,在標準化醫學考試拿下92分,在BRIDGE評測中的得分卻只有44.8%。研究團隊認為,這代表目前醫療AI最大的挑戰不再是缺乏醫學知識,而是缺乏對臨床語境(Clinical Context)和真實醫療文本的理解能力.
BRIDGE還有另一個特色,也就是納入9種語言的臨床資料。由於目前大多數醫療AI模型,都以英文資料為主來訓練,因此非英語地區的模型能力與適用性,往往較少受到系統性評估.
研究團隊指出,多語言設計,可以發現AI模型在不同語言環境下的表現差異,進一步改善醫療AI在全球不同醫療場域中的應用表現,降低語言造成的照護落差.
醫療AI評測從「會考試」走向「會工作」除了論文研究,團隊也同步公開模型排行榜,來供醫療機構和開發者比較不同模型在真實臨床任務的表現.
這次論文首先評測95款大型語言模型,截至目前,排行榜已收錄了超過107款模型.
從產業發展角度來看,BRIDGE反映的不只是單一評測工具的進展,而是醫療AI評估標準的改變。過去業界習慣以USMLE等醫學考試成績衡量模型能力,但隨著生成式AI逐步進入醫院工作流程,醫療機構更關心的是AI是否能看懂病歷、理解醫病對話、支援病人分流、協助醫療申報與臨床決策.
_(1).jpg)

