醫療AI會考試不等於會看病 權威研究:臨床任務僅44.8分

TechnologyDigital
20 Jul 2026 • 3:46 PM MYT
華僑日報
華僑日報

Overseas Chinese Daily News (OCDN) covers a wide range of topics including international, national and domestic news, financial and business pages, sports, entertainment and leisure, women column and other pages of great interest.

醫療AI會考試不等於會看病 權威研究:臨床任務僅44.8分

醫療AI越來越會考試,但未必越懂臨床實況。美國麻省總醫院最新登上《Nature Biomedical Engineering》的研究發現,頂尖LLM在醫學考試拿下92分高分,但在他們建置的真實臨床任務評測框架中,卻只得44.8分,凸顯醫療AI在臨床應用有著明顯落差。他們也打造一款LLM公開排行榜,目前已納入107款模型.

大型語言模型(LLM)近年在醫療領域表現驚艷,不少模型甚至能在美國醫師執照考試(USMLE)中,拿下接近專科醫師水準的成績。然而,美國麻省總醫院布萊根體系(Mass General Brigham)最新研究發現,這些在標準化考試表現亮眼的AI模型,面對真實醫療情境時,能力可能大打折扣.

該醫院研究團隊最近在《Nature Biomedical Engineering》上,發表一項名為BRIDGE的醫療AI評測框架。這套評測基準,專門評估大型語言模型對真實臨床資料的理解力,範圍涵蓋電子病歷、臨床病例報告和醫病對話等資料,且也涵蓋9種語言.

研究結果發現,表現最佳的模型在標準化醫學考試中拿下92分,但在BRIDGE測試中,平均得分只有44.8%,意味著目前醫療AI模型存在明顯的臨床理解落差。除了論文研究,團隊也同步公開模型排行榜,來供醫療機構和開發者比較不同模型在真實臨床任務的表現,目前已納入107款模型.

為何現有醫療AI評測方式不夠?過去幾年,醫療LLM的能力大多透過醫學考試題庫來評測,比如美國醫師執照考試(USMLE)或專科考題。這類評測方式都有個共同特性:題目通常經過標準化設計,使用正式且結構化的醫學語言,答案也相對明確.

然而,Mass General Brigham研究團隊指出,這類測驗主要評估醫學知識和推理能力,無法完整反映臨床現場的複雜性.

因為,相較於考題,醫師每天接觸的是電子病歷、護理紀錄、醫病對話及各類非結構化文本,其中充滿醫療縮寫、不完整病史、跨科別資訊和各院不同的書寫習慣。AI若無法理解這些內容,即使具備豐富醫學知識,也難以真正融入臨床工作流程.

Mass General Brigham醫學部藥物流行病學與藥物經濟學部門研究員Jie Yang表示,有別於許多以醫學考題為核心的評測工具,團隊建立的BRIDGE更聚焦於真實臨床資料來源,就是希望更真實反映AI在醫療照護現場的能力.

用真實病歷和醫病對話,測試AI能力BRIDGE最早在2025年公開上架,最近則正式通過同儕審查並刊登於權威期刊《Nature Biomedical Engineering》上.

有別於傳統的醫療AI基準測試,BRIDGE採用電子病歷、臨床病例報告和醫病對話等真實醫療文本,作為測試資料,而非醫學考試考題.

簡單來說,BRIDGE包含59個臨床資料來源,評估95款大型語言模型在病人照護全流程中的表現,涵蓋14個臨床專科領域,以及病人分流、醫療資訊擷取、疾病診斷、預後預測和醫療申報與編碼等能力.

結果顯示,即使是表現最佳的模型,在標準化醫學考試拿下92分,在BRIDGE評測中的得分卻只有44.8%。研究團隊認為,這代表目前醫療AI最大的挑戰不再是缺乏醫學知識,而是缺乏對臨床語境(Clinical Context)和真實醫療文本的理解能力.

BRIDGE還有另一個特色,也就是納入9種語言的臨床資料。由於目前大多數醫療AI模型,都以英文資料為主來訓練,因此非英語地區的模型能力與適用性,往往較少受到系統性評估.

研究團隊指出,多語言設計,可以發現AI模型在不同語言環境下的表現差異,進一步改善醫療AI在全球不同醫療場域中的應用表現,降低語言造成的照護落差.

醫療AI評測從「會考試」走向「會工作」除了論文研究,團隊也同步公開模型排行榜,來供醫療機構和開發者比較不同模型在真實臨床任務的表現.

這次論文首先評測95款大型語言模型,截至目前,排行榜已收錄了超過107款模型.

從產業發展角度來看,BRIDGE反映的不只是單一評測工具的進展,而是醫療AI評估標準的改變。過去業界習慣以USMLE等醫學考試成績衡量模型能力,但隨著生成式AI逐步進入醫院工作流程,醫療機構更關心的是AI是否能看懂病歷、理解醫病對話、支援病人分流、協助醫療申報與臨床決策.

Newswav Malaysia Best News App

Newswav is an online content aggregator and obtains its content from different online sources. The content in the app do not belong to Newswav nor do they reflect the opinions of Newswav and its staff. Your use of this app indicates your understanding and acceptance of this information.

Newswav Sdn. Bhd. (201701008480 (1222645-M)) 2026 All Rights Reserved