同一天、同一本期刊、兩種結局:AI 讀 CT 撿回 51 個被漏掉的病灶,AI 讀病歷被醫師默默棄用
8 月 19 日,《Nature Medicine》同一天刊出兩份前瞻性臨床評估,而它們的結論剛好相反。一份是中國醫科大學盛京醫院與阿里巴巴達摩院等單位的肝臟 AI「LiON」:在 10,333 名病人的前瞻試驗中 AUC 0.952,並在真實流程裡撿回 51 個原本被漏判的病灶(其中 15 個為惡性)、促成 37 份修正報告。另一份是以色列 Rambam 醫學中心的急診 LLM 決策支援系統「SHAKED」:1,138 名病人、零不良事件、專家審查 100 份輸出有 99 份「臨床適當」——但醫師的使用率從 68% 一路掉到 30%,急診滯留時間兩組都是 4.9 小時,作者自己下了結論:「現階段的發現不足以支持臨床部署。」把這兩篇擺在一起,再對照 PLOS Digital Health 上週那個 1,357 比 3 的分母,今天要問的只有一個問題:臨床 AI 的成敗,到底是被準確率決定,還是被「有沒有人繼續用它」決定?
01 — Top Stories
急診 LLM 決策支援「SHAKED」:安全、準確、被醫師慢慢放棄
8 月 19 日,以色列 Rambam 醫學中心(合作單位含以色列理工學院 Technion、Mayo Clinic、Beth Israel Deaconess)在《Nature Medicine》發表一項 DECIDE-AI 第一階段的前瞻性試辦評估:把 LLM 臨床決策支援系統 SHAKED 部署在急診其中一翼,另一翼維持標準流程,為期四週、共分析 1,138 名病人(介入組 584 人)。結果分成三層:(1) 安全無虞——未偵測到不良事件,專家抽查 100 份輸出中有 99 份被評為臨床適當;(2) 效益未顯現——兩翼急診滯留時間同為 4.9 小時(P = 0.99),會診週期時間縮短 9.4 分鐘但未達統計顯著(P = 0.077);(3) 使用率崩落——臨床採用率從 68% 一路降到 30%,且與工作負荷高度相關(每增加一小時班內時數,使用勝算比 OR = 0.72,95% CI 0.62–0.83)。唯一逆勢上升的情境是放射科會診(OR = 2.98,95% CI 1.58–5.63)。作者的結論罕見地直白:「維持臨床人員的持續使用,而非演算法準確度,可能才是真正的關鍵障礙」,且現有發現「不足以支持此階段的臨床部署」。
過去三年幾乎所有醫療 LLM 研究都在回答同一個問題:模型夠不夠準?SHAKED 把這個問題整個換掉。它的模型夠準(99/100)、夠安全(0 不良事件),但在真實急診裡被使用的次數逐週減少,而且醫師越忙越不用——這正好和「AI 幫忙省時間」的商業敘事完全相反:如果 AI 只在你不忙的時候才有人用,那它就沒有在解決忙碌本身。OR = 0.72/每小時班內時數是本週最值得記下的一個係數,因為它把「採用」變成可以量測、可以當作終點指標的東西。這也給了 PLOS Digital Health 那個 1,357 台核可、3 台驗證過病人結果的統計一個新的註腳:就算補上臨床試驗,也可能測不到效果——因為介入本身在試驗期間就被使用者稀釋掉了。DECIDE-AI 框架的設計初衷正是為了捕捉這一層,而 SHAKED 是少數老實照做、並且老實公布負面結果的研究。
SHAKED 為 Rambam 醫學中心(海法)內部開發的 LLM 決策支援系統,作者群 Leibovitch、Ahituv、Gorenshtein、Aran、Sorka、Miron、Shelly 分屬 Rambam、Technion、Mayo Clinic 與 Beth Israel Deaconess。試驗未揭露使用哪一家基礎模型;本研究屬 DECIDE-AI 第一階段(早期臨床評估),不是療效試驗。對照組為同院另一翼的標準作業。
LiON:33,000 人驗證的肝癌 CT AI,在真實流程裡撿回 51 個被漏掉的病灶
同一天的《Nature Medicine》另一篇,由中國醫科大學附屬盛京醫院放射科施悅(Yu Shi)為通訊作者,聯合阿里巴巴達摩院(DAMO Academy)、倫敦國王學院、EURECOM等中、法、英機構發表「Liver DiagnOsis Network(LiON)」的多中心研究與單臂臨床試驗。規模是這篇的重點:訓練 6,443 人、多中心回溯驗證 22,251 人、前瞻試驗 10,333 人。表現:回溯驗證惡性判別 AUC 0.975(95% CI 0.971–0.979),脂肪肝次族群 0.971、肝硬化次族群 0.924;前瞻試驗主要終點 AUC 0.952(95% CI 0.942–0.961)。真正有份量的是次要臨床結果:在既有放射科流程中額外找出 51 個原本被忽略的病灶(含 15 個惡性)、觸發 37 份修正報告、22 次多專科團隊(MDT)升階討論。LiON 讀多期別對比增強 CT(可彈性使用非顯影、動脈期、靜脈期,延遲期選用),輸出病人層級惡性分數、分割八類肝臟病灶,並整合人口學、生物標記與病史等臨床資料。
LiON 與 SHAKED 的對比,幾乎是一場天然實驗。兩者都在真實臨床流程裡跑,都沒有做隨機分派的療效試驗,但只有一個產生了可以指認的病人層級後果:51 個病灶、37 份修正報告、22 次 MDT。差別不在模型有多聰明,而在介入的形態——LiON 以「第二讀片者/安全網」的身分存在,工作發生在醫師的注意力之外,不需要醫師主動開啟;SHAKED 則需要醫師在最忙的時候多按一次。這是今天最實用的一條設計原則:臨床 AI 的採用率,與它需要醫師付出的主動注意力成反比。需要留意的限制也很明確:單臂試驗沒有對照組,因此無法回答「這 51 個病灶若無 AI 是否最終仍會被發現」,也無法把它換算成存活率;作者自己也表示需要跨醫療體系的前瞻比較研究。它仍然停在 PLOS 那 0.2% 之外——只是離門檻最近的一批。
研究主導:中國醫科大學附屬盛京醫院(瀋陽)放射科;技術合作方包含阿里巴巴達摩院——該單位先前以胰臟癌篩檢模型 DAMO PANDA 進入國際期刊,肝臟是其醫療影像布局的第二個器官級標的。學術合作方為倫敦國王學院與法國 EURECOM。競爭者面向:Aidoc(腹部 CT 分流)、United Imaging/聯影智能、推想醫療、Lunit 與 DeepHealth 主攻胸腔與乳房,肝臟多期別 CT 目前競爭密度相對低。
今天這兩篇論文的分母:1,357 台核可,只有 3 台測過病人結果
多倫多大學 Rawan Abulibdeh 與 MIT 計算生理實驗室等合著者,8 月 19 日於 PLOS Digital Health 發表對截至 2025 年 12 月 5 日 FDA 核可的全部 1,357 台 AI 醫材的盤點:僅 34 台曾登錄臨床試驗、12 台公布試驗結果、12 台有同儕審查論文,只有 3 台針對死亡率、中風、住院或生活品質等以病人為中心的結果做過測試。News-Medical 8/20 的整理指出,研究幾乎全在資源充足的醫療體系執行,並系統性排除孕婦、75 歲以上長者與非英語使用者;作者警告此架構可能放大既有健康不平等,並讓中低所得國家在無意間成為「未被充分研究之 AI 裝置」的試驗場。Healio(8/21)與 AuntMinnie 亦有專文。
本站在昨日週回顧已報導此研究,今天重提是因為它是理解前兩則的分母。把 LiON 與 SHAKED 放進這個框架,會發現一件容易被忽略的事:這兩篇論文都不會出現在那 3 台裡——LiON 是單臂設計、SHAKED 測的是採用率與流程指標,兩者都沒有以病人結果為主要終點。也就是說,即使是本週最紮實的兩份前瞻研究,離「證明病人活得更久或更好」仍有一段距離。這不是研究者的失職,而是臨床 AI 的評估基礎建設本身還沒長好:沒有標準終點、沒有跨機構的對照設計慣例、沒有把「採用率」正式納入終點的傳統。今天最該記住的是這個結構,而不是任何單一數字。
分析對象為 FDA 公開的 AI/ML-Enabled Medical Device List 全體,未點名個別廠商。台灣的對應清單為 TFDA 智慧醫療器材資訊暨媒合平台,目前尚無等價的驗證盤點研究。
為什麼「醫師會把關」不能當作安全設計:受過 AI 訓練的醫師,照樣被錯誤建議帶走 14 個百分點
要理解第 1 則裡「99/100 適當」為何仍不足以保證安全,需要一份稍早的隨機試驗。發表於 NEJM AI(2026 年 5 月號,試驗註冊 NCT06963957)的《Automation Bias in Large Language Model–Assisted Diagnostic Reasoning among Physicians Trained in AI Literacy》,把 44 位受過 20 小時 AI 素養訓練的醫師隨機分派,分別接受「無誤」與「刻意植入錯誤」的 LLM 建議。結果:診斷推理分數從 84.9% 降至 73.3%(校正後差異 −14.0 個百分點);首選診斷正確率從 90.5% 降至 76.1%(校正後 −18.3 個百分點)。預印本可見於 medRxiv。後續研究已開始測試以行為推力(behavioral nudges)緩解此效應,見 2026 年 6 月的後續 RCT 預印本。
幾乎所有臨床 AI 的風險論述都建立在同一個假設上:「最終決策仍由醫師負責,所以 AI 出錯會被攔下來。」這份試驗指出這個假設在受過專門訓練的醫師身上都不成立——而且退步幅度(−14.0 與 −18.3 個百分點)大到足以抵銷多數 AI 工具宣稱的增益。把它接回第 1 則:SHAKED 的「99/100 適當」意味著每 100 次就有 1 次不適當,而這份 RCT 說明那 1 次不會被自動攔下。這也是為什麼第 2 則 LiON 的「安全網」形態在風險結構上更有利:AI 用來提示「你可能漏看了什麼」,錯誤代價是額外看一眼;AI 用來建議「你應該怎麼做」,錯誤代價是被說服。此研究樣本為 44 位單一國家(巴基斯坦)醫師,屬中型模擬情境試驗,外推需保守。
未涉及商業產品;試驗使用通用大型語言模型作為建議來源,並人為植入錯誤以測試醫師的獨立判斷。此類「錯誤建議壓力測試」目前尚未成為任何監管機關的上市前必要項目,是 FDA 正在評估的生成式 AI 醫材監管路徑中的空白之一。
內視鏡 AI 進新加坡國立大學醫院:韓國 ENAD 宣稱腺瘤偵測率提高 16%
8 月 18 日,Healthcare IT News 報導南韓 Ainex 公司的即時內視鏡 AI「ENAD(Endoscopy as AI-powered Device)」導入新加坡國立大學醫院(NUH),用於上下消化道內視鏡:即時偵測病灶並自動分類特徵以支援臨床決策。Ainex 表示,根據同儕審查研究,該軟體使腺瘤偵測率(ADR)提高 16%;ENAD 已部署於南韓逾 200 家醫療院所,並取得泰國、馬來西亞與哥倫比亞的核准。
內視鏡 AI 是目前臨床 AI 中最接近「已被證實」的一類——ADR 是大腸鏡的公認品質指標,與後續大腸癌發生率有明確關聯,而電腦輔助偵測(CADe)已累積多篇隨機試驗。它同時也是「第 2 則設計原則」的教科書案例:AI 在螢幕上畫框,醫師不需要主動呼叫它,所以不會出現 SHAKED 那種使用率遞減。但要誠實標註兩件事:(1) 這 16% 是廠商自述的彙整數字,本則報導未附上對應論文;(2) 近年多篇研究指出 CADe 提高 ADR 的同時也提高了微小、低風險腺瘤的切除量,長期臨床效益仍在爭論。對亞洲市場的意義更直接:南韓與新加坡的臨床 AI 採購已進入跨境輸出階段,而台灣廠商面對的正是同一批競爭者。
Ainex(南韓);客戶為新加坡國立大學醫院。同類競爭者:Medtronic GI Genius、Fujifilm CAD EYE、Olympus ENDO-AID、韓國 Wonjin/Coreline 系;台灣端有多家內視鏡 AI 團隊仍以院內合作研究為主,尚未見同等規模的跨境輸出。
「2030 年 AI 可獨立執行醫療認知任務」:Emanuel 與 Khosla 對上美國醫學會
8 月 21 日 Fierce Healthcare 報導一場正在升溫的論戰:生命倫理學者暨腫瘤科醫師 Ezekiel J. Emanuel 與 Curai Health 的 Neal Khosla、Khosla Ventures 的 Vinod Khosla 在 JAMA 共同發表觀點文,主張回顧 2024 年 1 月以來所有醫療 AI 文獻後,AI 在五項核心認知任務(蒐集病人資訊、診斷、選擇檢查、建議治療、慢病管理)上已達到或超越醫師水準,並預測「大約 2030 年」AI 即可在部分、甚至許多工作流程中獨立部署;他們進一步主張,醫師的監督反而會引入錯誤、拉低 AI 的表現。美國醫學會執行長 John Whyte 反駁:醫學需要超越任務執行的人類判斷,並以「自動駕駛普及後飛行員仍不可或缺」為喻,強調同理、溝通與共享決策無法由演算法取代。
這場辯論值得放在今天的第 1、4 則旁邊,因為雙方都可以引用今天的證據,而且都只引用一半。Emanuel/Khosla 一方能指著第 4 則說「醫師監督確實會出錯」——那份 RCT 的確顯示醫師被錯誤建議帶偏;但同一份 RCT 的前提是AI 先給了錯的答案,這恰恰證明無人監督的 AI 同樣會錯。AMA 一方能指著第 1 則說「醫師不買單」——但 SHAKED 的低採用率並不證明 AI 沒有價值,只證明它被設計成需要醫師出力。真正被兩邊略過的是第 2 則的答案:爭論「AI 要不要取代醫師」,可能問錯了層級;LiON 既沒有取代放射科醫師,也沒有等醫師來用它,它只是改變了病灶被看見的機率。
Curai Health(AI 虛擬照護,Khosla Ventures 投資);American Medical Association(AMA);賓州大學(Emanuel)。此論戰的商業背景值得留意:主張自主 AI 的兩位作者中,一位是自主 AI 照護公司的經營者、一位是其投資人,JAMA 觀點文本身應視為有利益關係的立場論述而非中立文獻回顧。
失智照護的真正瓶頸不是偵測:MCI 那 39% 的窗口,卡在三個不互通的系統裡
8 月 22 日 Healthcare IT News(亞太版)刊出對 Youngand Inc. 商務長 Martin Seo 的訪談,直指亞太失智照護的結構問題:輕度認知障礙(MCI)是介入的關鍵窗口——41 個初始世代研究的統合分析顯示約 39% 的 MCI 個案最終進展為失智,而一般族群樣本約為 22%;但「偵測在一個地方、服務量能在另一個地方,而兩邊都沒有紀錄回流」。以新加坡為例,約 2,800 家私人診所、27 家綜合診療所與 230 餘個樂齡活動中心彼此不協調;2030 年約每四位新加坡公民就有一位年滿 65 歲,失智預估在 2040 年成為全球第三大死因。該公司的 Brain Health Playground 以動作辨識與場次級分析,把結構化認知訓練放進長者原本就會聚集的社區場域。
今天前六則都在問「AI 準不準、有沒有人用」,這一則把問題往上推了一層:就算 AI 篩檢做得完美,如果篩出來之後沒有可銜接的服務與回流紀錄,偵測本身不會改變任何結果。這對台灣特別有參考價值——台灣的失智症篩檢工具、認知功能量表數位化與影像生物標記研究都不算落後,但社區據點、基層診所與醫學中心之間同樣缺乏一條把「篩到了」變成「持續介入並被記錄」的路徑。用第 1 則的語彙來說,這是另一種形式的採用率崩落:不是醫師不用工具,而是被偵測出的病人流失在系統的縫隙裡。需註明的限制:本文為受訪企業觀點,Brain Health Playground 的成效未見同儕審查證據;39%/22% 為引用之統合分析數據,非該公司產品的成果指標。
Youngand Inc.(南韓,Brain Health Playground);場景為新加坡與亞太。相關政策背景可對照 Healthcare IT News 8/21 談偏鄉醫院 AI 投資排序——兩者的共同問題都是「AI 能力落在哪一層機構」。
02 — Product Analysis
LiON(Liver DiagnOsis Network)
對比增強 CT 肝臟惡性判別 · 學研+達摩院 · 中國
功能與定位。以多期別對比增強 CT 為輸入(非顯影/動脈期/靜脈期,延遲期選用),輸出病人層級惡性分數並分割八類肝臟病灶,同時整合人口學、生物標記與病史。定位不是取代放射科醫師,而是流程中的「額外一位讀片者」與診斷安全網(Nature Medicine,2026-08-19)。
- 優勢 :規模與族群穩健度。回溯驗證 22,251 人 AUC 0.975、前瞻 10,333 人 AUC 0.952,且在脂肪肝(0.971)與肝硬化(0.924)等困難次族群仍維持水準——次族群不掉,是影像 AI 最常失守的地方。
- 優勢 :有可指認的臨床後果,而不只是統計量。51 個被漏掉的病灶(15 個惡性)、37 份修正報告、22 次 MDT 升階——這是絕大多數 AUC 論文交不出來的東西,也是它比第 1 則更接近「病人結果」的原因。
- 疑慮 :單臂設計無法回答反事實。沒有對照組,就無法知道那 51 個病灶在沒有 AI 的情況下是否會在後續追蹤中被發現、以及延遲多久;也無法換算成存活或分期改善。作者自己指出需要跨醫療體系的前瞻比較研究。
- 疑慮 :訓練與驗證的地理集中。資料主體來自中國醫療體系,而中國的 B 型肝炎相關肝細胞癌盛行率與歐美、甚至與台灣的病因結構都不同。台灣同樣以 B 肝為主要肝癌病因,理論上外推條件較歐美有利,但仍需本地驗證——這正是第 3 則所指「試驗 68% 只在單一國家執行」的同一個問題,只是換了國家。
SHAKED
急診 LLM 臨床決策支援 · 醫學中心自建 · 以色列
功能與定位。在急診工作流程中提供以大型語言模型為基礎的臨床決策支援,涵蓋會診情境。定位是醫師主動查詢的輔助層——這個「主動」是它與 LiON 最根本的差異(Nature Medicine,2026-08-19)。
- 優勢 :研究誠實度本身就是最大優點。採 DECIDE-AI 第一階段設計、設平行對照翼、公布負面結果、並明說「不足以支持此階段的臨床部署」。在一個充滿廠商自述數字的領域裡,這種自我否定的論文比多數正面結果更有價值。
- 優勢 :找到了真正有需求的次場景。整體採用率下滑,但放射科會診情境的使用勝算比達 OR = 2.98(95% CI 1.58–5.63)。這是一條可行的產品路線:不要做「什麼都能問」的助手,去做那個醫師願意繞路去用的單一場景。
- 疑慮 :採用率與工作負荷負相關,是產品設計的致命傷。每增加一小時班內時數,使用勝算降至 0.72 倍。一個宣稱能減輕負擔的工具,在負擔最重時最不被使用——這代表介入點擺錯了位置,應該移到不需要醫師動手的環節(自動預先產生、被動呈現)。
- 疑慮 :「99/100 適當」的殘餘風險沒有被處理。對照第 4 則的自動化偏誤 RCT(錯誤建議使診斷推理下降 14.0 個百分點),那 1% 不適當輸出不會被醫師穩定攔截。本研究四週、單院、未揭露基礎模型,也使得結果難以直接外推到其他醫療體系或其他模型版本。
03 — Companies & Competition
| 機構/公司 | 近況與數字 | 在流程中的位置與護城河 |
|---|---|---|
| 阿里巴巴達摩院 DAMO Academy · 影像基礎模型 |
與盛京醫院等共同發表 LiON:訓練 6,443/回溯 22,251/前瞻 10,333 人,AUC 0.975 與 0.952,撿回 51 個漏判病灶;此前已有胰臟癌篩檢模型進入國際期刊。 | 位置:被動安全網(第二讀片者)。護城河=中國多中心大型影像資料 × 器官級模型累積。弱點:資料地理集中、未見 FDA/CE 路徑資訊。 |
| Rambam Health Care Campus 以色列海法 · 自建 LLM CDS |
SHAKED 急診試辦:1,138 名病人、0 不良事件、99/100 輸出適當,採用率 68%→30%,LOS 4.9 小時無差異;合作單位含 Technion、Mayo Clinic、Beth Israel Deaconess。 | 位置:主動查詢層。護城河=院內資料與臨床試驗執行能力,而非產品。價值在方法論輸出:把「採用率」變成可測終點。 |
| Ainex 南韓 · 內視鏡即時 AI |
ENAD 導入新加坡國立大學醫院;宣稱 ADR 提高 16%;南韓逾 200 家院所部署,並取得泰、馬、哥倫比亞核准(8/18)。 | 位置:即時被動提示(螢幕畫框)。護城河=內視鏡設備商通路 × 多國核准堆疊。競爭者:Medtronic GI Genius、Fujifilm CAD EYE、Olympus ENDO-AID。 |
| 長佳智能 EverFortune.AI 台灣 6841 · 影像 AI 醫材 |
闌尾炎 CT AI 取得 TFDA 許可(2026-08-18 公告),接續 4 月的美國 FDA 510(k);累計 57 張海內外醫材證(美 FDA 15 張、TFDA 24 張),客戶逾 70 家。 | 位置:急症分流提示。護城河=台美雙軌法規證照堆疊 × 醫院渠道。弱點:與 LiON、Aidoc 同樣缺乏病人結果層級證據,競爭最終回到通路與價格。 |
| DeepHealth(RadNet) 美國 · 乳房攝影 AI 流程 |
7 月 23 日《Radiology》研究:95 位放射科醫師、109 家機構、約 578,000 次篩檢;一般放射科醫師癌症偵測率自每千例 3.76 升至 4.99,逼近專科醫師的 4.76;召回陽性預測值升 15.09%,召回率亦升 14.79%。 | 位置:流程再設計(不只演算法)。護城河=自有影像中心網路可同時控制流程與資料。價值主張是「補上專科人力缺口」,與今日主題直接呼應。 |
| Curai Health / Khosla Ventures 美國 · 自主 AI 照護主張 |
與 Emanuel 共同於 JAMA 主張 AI 已在五項認知任務達到或超越醫師、2030 年可獨立部署,且醫師監督反而引入錯誤;AMA 執行長 John Whyte 公開反駁(8/21)。 | 位置:取代層。護城河=資本與敘事,而非臨床證據。應注意作者同時是該領域的經營者與投資人,論述屬有利益關係的立場文。 |
04 — Taiwan Angle
今天台灣最值得記的一則。8 月 18 日,長佳智能(6841)宣布其闌尾炎 AI 醫材軟體「EFAI ERSUITE CT APPENDICITIS ASSESSMENT SYSTEM」取得台灣 TFDA 醫材許可,接續今年 4 月已取得的美國 FDA 510(k),完成台美雙市場布局;公司累計 57 張海內外醫材證(其中美國 FDA 15 張、台灣 TFDA 24 張),客戶逾 70 家。產品以深度學習自動分析腹部對比增強 CT,對疑似闌尾炎的成人病例提示醫療團隊。另一則值得並讀的是 8 月 21 日德國萊因(TÜV Rheinland)完成長聯科技衛教機器人「愛寶」的第三方測試:在疾病、手術、檢查、藥物與照護流程五類資料檢索上命中率 100%,衛教回答正確性與忠實度 99.9%,資安威脅與高風險提問的分類準確率 100%,測試方法參照 ISO/IEC TS 4213:2022。
把今天的國際新聞換算成台灣的問題。台灣目前在 AI 醫材上真正跑得不慢——TFDA 已建立智慧醫療器材資訊暨媒合平台,長佳一家就有 24 張 TFDA 證;衛福部也已啟動三大智慧醫療 AI 中心。但第 1 則的 SHAKED 指出了一個台灣還沒有系統性回答的問題:那些已核准、已裝機的 AI,三個月後還有多少比例真的在被使用?台灣目前沒有公開的臨床 AI 使用率追蹤資料——不論是醫院自評、健保申報端,或是 TFDA 的上市後監督,都沒有把「採用率」納入必要回報項目。而 SHAKED 的核心發現正是:採用率會隨工作負荷而下降,且下降得比任何人預期的都快。台灣的醫護人力結構本就緊繃,這個係數在台灣只會更陡,不會更平。
三個具體的可行動方向。(1) 把採用率變成上市後監督項目。第 3 則指出 FDA 那 1,357 台中只有 3 台驗過病人結果;台灣要在短期內補上療效證據不現實,但補上「使用率」這一層是低成本且立即可行的——它既是療效的前提,也是最容易造假不了的指標。(2) 優先採購被動型 AI。今天最清楚的一條經驗法則是:LiON 與 ENAD 這類「不需要醫師主動開啟」的 AI 維持得住使用率,SHAKED 這類「需要醫師多按一次」的則會衰退。台灣醫院在有限預算下排序時,這是比 AUC 更有預測力的指標。(3) 肝癌 AI 值得本地驗證。台灣與中國同為 B 型肝炎主導的肝細胞癌流行區,LiON 的病因結構與台灣相近,比多數歐美影像 AI 更值得投入本地前瞻驗證;而台灣在肝病臨床研究上的既有基礎,本來就是少數具國際競爭力的領域。
需要保留的懷疑。愛寶的 100%/99.9% 來自單次委託測試,題庫組成、樣本量與難度分布均未公開,不能與臨床試驗等級的證據相提並論;長佳的 57 張證是法規准入數字,不是臨床效益數字——第 3 則整篇研究講的正是這兩者的落差。台灣在「拿證」這件事上表現不錯,但今天七則新聞加起來想說的是:拿證只是資格賽,真正的比賽在裝機之後的第 90 天。
05 — Further Reading
-
Leibovitch, L., et al. “Prospective evaluation of a large language model clinical decision support system in the emergency department” — Nature Medicine (2026-08-19)
今天的第一必讀。請特別讀採用率隨時間下降那一段的分析方法——把「使用行為」當作結果變項來建模(含工作負荷交互作用),是目前臨床 AI 研究中最缺乏、也最容易被複製到其他院所的方法論。任何準備導入 LLM 工具的醫院,都應該先用這篇的設計寫自己的評估計畫。
-
Shi, Y., et al. “Large-scale AI-guided liver malignancy diagnosis: multicenter study and a single-arm trial” — Nature Medicine (2026-08-19)
影像 AI 目前規模最大的前瞻研究之一。除了 AUC,更值得看的是它如何報告「AI 額外發現的病灶」與後續處置(修正報告、MDT 升階)——這是把統計指標翻譯成臨床行動的範例。台灣的肝病研究團隊若要做本地驗證,這篇是現成的協定藍本。
-
“Automation Bias in Large Language Model–Assisted Diagnostic Reasoning among Physicians Trained in AI Literacy — A Randomized Clinical Trial” — NEJM AI (2026-05, NCT06963957)
不是本週新聞,但它是理解今天所有故事的必要背景。讀它是為了拆掉一個太常被當作前提的假設:「有醫師把關就安全」。若無法取得全文,medRxiv 預印本免費可讀,數字與結論一致。
-
Basu, S. & Huynh, B. “Mitigating hallucinations in healthcare AI: a systematic review of evidence-based strategies” — BMC Health Services Research 26:1115 (2026-06-11)
開放取用、涵蓋 44 篇研究的系統性回顧,把七類緩解策略的效果量整理成可比較的表:RAG 降低幻覺 30–50%、知識圖譜 25–45%、人在迴路最高可達 95% 但難以規模化。對要導入 LLM 的醫院,這是目前最實用的一份技術選型依據。
-
Kömen, J., et al. “Towards robust foundation models for digital pathology” (PathoROB) — Nature Communications 17:5218 (2026-06-11)
與今天第 2 則對照著讀最有價值。這份基準測試對 20 個病理基礎模型施加掃描器與染色等非生物性變異,發現當訓練資料與醫學中心相關時,腫瘤偵測準確率可從 >92% 掉到 53–87%——也就是模型學到的是機構特徵而非生物訊號。任何跨院採購 AI 的單位都該先問這一題。
06 — References
- Leibovitch, L., Ahituv, A., Gorenshtein, A., Aran, D., Sorka, M., Miron, K., Shelly, S. “Prospective evaluation of a large language model clinical decision support system in the emergency department.” Nature Medicine, 2026-08-19. nature.com/articles/s41591-026-04601-5
- Shi, Y., et al. “Large-scale AI-guided liver malignancy diagnosis: multicenter study and a single-arm trial.” Nature Medicine, 2026-08-19. nature.com/articles/s41591-026-04589-y · 期刊最新文章列表 nature.com/nm/articles
- Abulibdeh, R., et al. “1,357 AI medical devices cleared, 3 actually tested on patient outcomes.” PLOS Digital Health, 2026-08-19. DOI: 10.1371/journal.pdig.0001597. journals.plos.org
- “FDA-cleared medical AI rarely tested for real-world benefits.” News-Medical, 2026-08-20. news-medical.net · “Most AI tools cleared by FDA were not tested on clinical outcomes.” Healio, 2026-08-21. healio.com · “Most FDA-cleared AI medical devices not tested on patient outcomes.” AuntMinnie. auntminnie.com
- U.S. FDA. “Artificial Intelligence-Enabled Medical Devices” (官方清單). fda.gov
- “Automation Bias in Large Language Model–Assisted Diagnostic Reasoning among Physicians Trained in AI Literacy — A Randomized Clinical Trial.” NEJM AI, 2026-05 (Vol. 3, No. 5), NCT06963957. ai.nejm.org · 摘要報導: bjh.be · 預印本: medRxiv
- “Mitigating Automation Bias in Physician-LLM Diagnostic Reasoning Using Behavioral Nudges: A Randomized Controlled Trial.” medRxiv, 2026-06. medrxiv.org
- “Korean AI to support digestive diagnosis at NUH.” Healthcare IT News (Asia), 2026-08-18. healthcareitnews.com
- “As AI advances, a debate grows over the future role of doctors.” Fierce Healthcare, 2026-08-21. fiercehealthcare.com
- “In dementia care, detection is not the bottleneck.” Healthcare IT News (Asia), 2026-08-22. healthcareitnews.com · “Rural hospitals face high stakes in allocating AI investments.” Healthcare IT News, 2026-08-21. healthcareitnews.com
- “FDA weighs regulatory approach for genAI medical devices.” Healthcare IT News, 2026-08-21. healthcareitnews.com
- “AI-backed imaging workflow helps generalist radiologists perform like breast specialists.” Radiology Business, 2026-07-23(原始研究刊於 RSNA Radiology). radiologybusiness.com
- Basu, S., Huynh, B. “Mitigating hallucinations in healthcare AI: a systematic review of evidence-based strategies.” BMC Health Services Research 26:1115, 2026-06-11. link.springer.com · PubMed
- Kömen, J., Müller, K.-R., et al. “Towards robust foundation models for digital pathology” (PathoROB). Nature Communications 17:5218, 2026-06-11. nature.com/articles/s41467-026-73923-2
- 「長佳智能闌尾炎AI醫療器材軟體攻台美市場 累計有57張海內外醫材證」,台灣光鹽生物科技學苑,2026-08-19(公司公告日 8/18)。biotech-edu.com
- 「醫療 AI 回答不能『無中生有』 德國萊因完成長聯科技『愛寶』AI 衛教測試」,經濟日報,2026-08-21。money.udn.com · 測試參照標準 ISO/IEC TS 4213:2022
- 台灣智慧醫材與政策背景:TFDA 智慧醫療器材資訊暨媒合平台 · 衛福部臺灣智慧醫療三大中心
- 近期日報(供對照):8/20 技術 · 8/21 產品 · 8/22 廣義 AI · 8/23 本週回顧