AI 幫得上忙的人,不一定是你以為的那個
今年臨床 AI 研究最有意思的一個轉向,是問題從「AI 準不準」變成「AI 對誰有用、怎麼呈現才有用」。Nature Medicine 8 月 4 日一項合計 1,096 人的隨機實驗給了最直接的答案:同一套皮膚科 AI,對一般民眾與基層醫師產生方向相反的效果——LLM 文字解釋讓外行人在 AI 答對時多拿 13.4%、答錯時卻掉 21.1%,對醫師則是最沒幫助的解釋型式,卻唯獨改善了信心校準。同一週,Aidoc 的 CARE Body CT Multi-Triage 成為首個以醫療基礎模型為底、取得 Medicare NTAP 加成給付的 AI 軟體(10/1 生效)。臨床證據與付錢的閘門,正在被兩種不同的邏輯推著走。
01 — Top Stories
同一套皮膚科 AI,對醫師與民眾產生相反效果:1,096 人隨機實驗拆解「可解釋 AI」的雙面刃
MIT 的 Marzyeh Ghassemi 團隊在 Nature Medicine 第 32 卷第 8 期(2026 年 8 月 4 日線上刊出,開放取用)發表兩項大規模隨機實驗,採 4×2 因子設計:四種解釋型式(純預測、GradCAM 熱區圖、相似病例檢索、LLM 文字敘述)× 兩種決策順序(人先判斷 vs. AI 先給答案)。受試者為 623 位一般民眾(黑色素瘤二元判讀)與 153 位基層醫師(複雜鑑別診斷),另有 320 位醫學生作為對照組。
結果幾乎是為「病人自己用 AI 看皮膚照片」這個當前趨勢量身寫的警告。對一般民眾:AI 把準確率從 69.7% 拉到 75.8%,但 LLM 文字解釋是雙面刃——AI 答對時 +13.4%、答錯時 −21.1%,也就是把自動化偏誤放大了。對醫師:top-1 準確率提升 21.5%,且即使 AI 給錯建議仍維持效益;LLM 解釋在準確率上幫助最小(+17.7%),卻是唯一改善信心校準的型式。兩組共同的好消息是膚色間的診斷落差縮小(民眾相對減少 46.9%、醫師 35.6%);共同的壞消息是「AI 先講」會顯著增加順從與錨定偏誤。換句話說,介面順序這個看似微不足道的工程決定,其臨床影響量級和模型本身的準確率相當。
通訊作者 Marzyeh Ghassemi(MIT),共同第一作者 Xuhai "Orson" Xu 與 Haoyu Hu,全文含 20 餘位共同作者(Nature Medicine 全文)。研究未綁定任何商業產品,測試的是四種通用可解釋性技術本身。
遺傳性視網膜疾病 AI 多中心隨機試驗:醫師基因診斷準確率 67.3% → 88.5%
上海交通大學附屬上海市第一人民醫院孫曉東團隊主導、跨中國/南韓/波蘭的多中心隨機試驗,刊於 Nature Medicine(2026 年 7 月 24 日)。開發世代為 1,843 位經基因確診病人、3,376 隻眼;隨機分派世代為 300 位疑似遺傳性視網膜疾病(IRD)者,1:1 分派,最終 295 位納入分析(中位年齡 33 歲、女性 38.6%)。系統 Retina4IRD 整合多模態眼底影像,內部驗證 top-5 準確率 90.4%、外部驗證 85.6%。
IRD 是典型的「罕見但可治療性正在改變」的疾病族群——基因治療與臨床試驗機會愈來愈多,但正確指認致病基因需要極稀缺的次專科經驗。這項試驗的關鍵不只是準確率:AI 輔助組醫師的基因診斷準確率為 88.5%,對照組 67.3%(絕對差距 21.2 個百分點,p < 0.001),top-1 準確率 37.8% vs 22.4%;更重要的是下游處置決策綜合分數也顯著提升(37.7 vs 28.5,p < 0.001)。多數醫療 AI 試驗停在「讀片準不準」,這篇一路量到「醫師接下來做了什麼」,是方法學上少見的完整度。
研究團隊跨上海交通大學、南京航空航天大學、清華大學、延世大學(Yonsei)與波蘭多家機構(Nature Medicine 全文)。Retina4IRD 目前為學術系統,本報告未見商業化或法規送件的公開資訊,不做推測。
Aidoc CARE 成為首個以醫療基礎模型取得 Medicare NTAP 的 AI 軟體,10/1 生效
CMS 核准 Aidoc 的 CARE(Clinical AI Reasoning Engine)Body CT Multi-Triage 取得新技術加成給付(NTAP),AuntMinnie 於 8 月 13 日報導,2026 年 10 月 1 日生效、為期三年,適用符合條件的 Medicare 論量計酬(FFS)住院個案。該產品針對胸、腹、骨盆 CT(含/不含顯影劑)自動辨識疑似急症並做工作流程分流,於 2025 年 9 月取得 FDA 突破性醫材認定、2026 年 1 月取得 FDA 清關(Aidoc 新聞稿、Radiology Business、Diagnostic Imaging)。
AuntMinnie 直接把這件事定位為「建立在醫療基礎模型上的 AI 軟體,一次新型態的給付決定」。過去 NTAP 幾乎都給單一適應症、單一演算法的窄型工具;一個能在同一次掃描上同時判讀多種急症的基礎模型型產品拿到加成給付,等於 CMS 承認了「多任務 AI」這個產品型態。對臨床端的直接含意是:影像 AI 從「醫院自掏腰包的效率投資」變成「有現金流的品項」,導入的財務阻力大幅下降。但這也接上 STAT 同日報導中研究者提出的疑慮:按次計價的加成本質上獎勵使用量,且 2–3 年後加成退場,產品必須靠自身臨床效益站住。
Aidoc(以色列,總部特拉維夫)是影像分流 AI 市占領先者之一,2026 年 1 月已將 CT 分流平台擴張至 14 項適應症(其中 11 項為新增)。CARE 為其基礎模型產品線。CMS 未公開單案加成金額,本報告不臆測(原始新聞稿)。
護理師要求進入臨床 AI 的決策桌:從罷工與抗議,走向共同設計
STAT 於 8 月 11 日報導(記者 Katie Palmer),美國護理界對臨床 AI 的反彈正在制度化。文中舉出兩起事件:紐約 Bronx 的 Montefiore 醫院被裁員的護理師質疑行政 AI 取代人力;加州 Kaiser Permanente 的護理師則因 AI 對工作的監控而罷工抗議。代表逾 20 萬名護理師的 National Nurses United 是主要行動者。
臨床 AI 的失敗模式,近年愈來愈少是「模型不準」,愈來愈多是「導入後沒人照著用」。護理師是床邊警示、惡化偵測、文書 AI 的第一線使用者,也是被評估最少的一群人——這一點在本期第 7 則的 UVA 惡化偵測試驗中有直接呼應:11% 的病人被臨床人員在有/無顯示器的床位之間移動,臨床判斷直接壓過了隨機分派。報導的核心論點是把對抗關係轉為共同設計;這也是為什麼「誰參與導入」正在成為和模型效能同等重要的變項。
北歐五國+愛沙尼亞共建 AI-Health 平台:把「全民健康登錄」變成可訓練的資產
奧斯陸大學 Ole A. Andreassen 領銜、21 位共同作者於 Nature Medicine 發表 Comment(2026 年 8 月 14 日),說明 Nordic AI-Health Initiative 的技術架構、資料資產與部署路線圖。參與機構橫跨挪威、丹麥、冰島、瑞典、芬蘭與愛沙尼亞,含 Karolinska Institutet、赫爾辛基大學與 Amgen 旗下 deCODE genetics。平台目標是「在安全、合規的前提下開放取用,並產出可泛化的模型」。
北歐的縱貫性全民登錄資料(出生到死亡、跨世代、可連結)在全球是稀缺資源,過去因 GDPR 與跨國治理難以整合使用。這件事的意義不在單一模型,而在它是 EU AI Act 生效後,第一批試圖把「合規」寫進資料基礎建設本身、而非事後補件的區域級嘗試。對台灣的參照價值很高——健保資料庫同樣具備縱貫性優勢,同樣卡在跨機構治理(見本報「台灣視角」)。文章為 Comment 而非原始研究,未公布世代人數與明確時程里程碑。
RSNA 開出 7.7 萬美元膝關節 MRI AI 挑戰賽:首度要求模型同時吃影像與 12 種語言的報告
RSNA 於 2026 年 8 月 5 日宣布 2026 Knee Abnormality Detection AI Challenge。資料集為全球 16 個機構、超過 5,000 例膝關節 MRI,附 12 種語言的放射科報告;總獎金 77,000 美元,含最有效率模型獎項;競賽於 Kaggle 進行,至 10 月 22 日截止,11 月公布優勝,並於 RSNA 2026 年會(11/29–12/3,芝加哥)表揚。共同主持人為 Cleveland Clinic 的 Po-Hao Chen(陳柏豪)與 Naveen Subhas(AuntMinnie 報導)。
RSNA 自稱這是「迄今最貼近真實世界的挑戰賽」,理由正是它不給乾淨的結構化標註表,而是逼參賽者從格式雜亂、多語言的診斷報告裡學。這對非英語系醫療體系(包含台灣)特別重要——多數影像 AI 的訓練資料與基準都是英文報告,語言不匹配是導入時最常被低估的效能落差來源。另一個訊號是「最有效率模型」獎項:學界基準終於開始把推論成本當成一等公民,而不是只比 AUC。
10,422 人次的惡化偵測叢集隨機試驗:主要結果毫無差異,而且隨機分派被臨床判斷破壞
維吉尼亞大學醫學院 Jessica Keim-Malpass 與 Jamieson M. Bourque 團隊在 Scientific Reports(2026 年 2 月 5 日)發表叢集隨機對照試驗,於 85 床的心臟科與心臟外科病房納入 10,422 人次住院。介入為 Nihon Kohden Digital Health Solutions 的 CoMET(Continuous Monitoring of Event Trajectories),每 15 分鐘以心肺監測與生命徵象機器學習模型更新風險軌跡並被動顯示。主要結果為入院 21 天內「無臨床惡化事件」的時數(死亡、緊急轉 ICU、緊急插管、心跳停止、緊急手術)。
「兩組主要結果沒有變化」——被動顯示風險分數不改變病人結局。但更值得留意的是兩個方法學細節:只有 5.3% 的病人發生惡化事件(事件率極低,統計檢定力先天吃緊);以及臨床人員把 11% 的病人在有/無顯示器的床位之間移動,且傾向把較重的病人移到有監測的床,直接破壞了隨機設計。這正是 Nature 7 月 28 日評論〈Medical AI has a measurement problem〉(哈佛醫學院 Arjun K. Manrai)所指的核心困境:實證醫學預設量尺可靠,但在 AI 情境下這個前提常常站不住。臨床 AI 若只做「被動顯示」而不重新設計工作流程與反應路徑,很可能得到的就是這種結果。
02 — Product Analysis
Aidoc CARE Body CT Multi-Triage
影像分流 · 醫療基礎模型 · Aidoc(以色列)
功能與定位。在胸/腹/骨盆 CT(含與不含顯影劑)上同時辨識多種疑似急症並重排工作清單,屬於「讓放射科先看該先看的」而非取代判讀(AuntMinnie)。
- 優勢 :法規與給付雙軌都走通了——2025/9 突破性醫材認定 → 2026/1 FDA 清關 → 2026/10/1 NTAP 生效,三年加成期給了醫院可預期的財務模型。
- 優勢 :單一基礎模型覆蓋多適應症,攤薄了「一個演算法一次送件」的成本結構;Aidoc 平台已累積 14 項 CT 分流適應症。
- 疑慮 :分流類產品的臨床終點通常是「turnaround time」而非死亡率或再入院率;STAT 引述的研究者指出按次計價本質獎勵使用量。
- 疑慮 :CMS 未公開單案加成金額與預期支出上限(Radiology Business),醫院實際 ROI 目前無法從公開資料推算。
Retina4IRD
眼科罕病 · 多模態決策支援 · 上海交通大學(學術系統)
功能與定位。整合多模態眼底影像,為疑似遺傳性視網膜疾病病人輸出候選致病基因排序,供臨床醫師參考後續基因檢測與處置(Nature Medicine)。
- 優勢 :極少數量到「處置決策」而非只量準確率的醫療 AI 試驗——下游處置綜合分數 37.7 vs 28.5,p < 0.001。
- 優勢 :跨中國、南韓、波蘭三地驗證,外部驗證 top-5 仍達 85.6%(內部 90.4%),族群外推性優於多數單一國家研究。
- 疑慮 :top-1 準確率僅 37.8%(對照 22.4%)——實務上仍是「縮短候選名單」而非「給出答案」,臨床期待需相應設定。
- 疑慮 :隨機世代僅 300 人(295 人分析),且無商業化或法規送件的公開資訊,離臨床落地仍有距離。
03 — Companies & Competition
| 公司/系統 | 臨床證據強度 | 競爭定位 |
|---|---|---|
| Aidoc CARE Body CT Multi-Triage |
法規與給付路徑完整(突破性認定 2025/9、清關 2026/1、NTAP 2026/10/1),但公開的前瞻臨床終點資料有限。 | 平台型多適應症玩家,14 項 CT 分流適應症;護城河在部署規模與給付先行者優勢。 |
| ScreenPoint Medical Transpara v1.7 |
最紮實的一組:31,301 名女性的前瞻配對非劣性試驗(Nature Medicine, 2026/3/19)——放射科判讀量減 63.6%、癌症偵測率 +15.2%(6.3→7.3/千例)、回召率 +14.8%(4.8%→5.5%)。 | 乳篩單一適應症深耕,靠隨機試驗證據取勝;另有瑞典 MASAI 隨機試驗的間隔癌與敏感度資料背書。 |
| Nihon Kohden CoMET |
已完成大型叢集隨機試驗,但結果為陰性——10,422 人次,主要結果無差異,且 11% 病人跨組移動破壞分派。 | 床邊監測硬體廠商延伸至預測分析;優勢在既有機台通路,劣勢在「被動顯示」的介入設計。 |
| Scanslated 病人友善報告 |
大規模真實世界使用資料:Stanford 與 Duke 兒童醫院、391,713 例檢查(2024/1–2025/11),92.6% 家屬回報理解度改善,但實際點閱率僅 9%(標準報告 50.5%)。 | 切入被忽略的「病人端理解」市場,對醫院的賣點是滿意度與留存(91.8% 家屬表示更願意再選擇該院),而非診斷效能。 |
04 — Taiwan Angle
(1) 多語言報告挑戰賽,是台灣資料集的一次機會窗口。RSNA 這次的膝關節 MRI 挑戰賽首度納入 12 種語言的放射科報告、來自 16 個機構,等於承認了非英語報告是真實世界的常態。台灣的中英混寫報告(結構化欄位英文、描述中文)在國際基準裡幾乎不存在,而語言不匹配正是進口影像 AI 導入後效能落差的常見來源之一。無論是參賽或推動本土多語言基準,這是可操作的切入點。
(2) 北歐平台的治理設計,比它的模型更值得抄。台灣健保資料庫的縱貫性優勢與北歐登錄資料同屬稀缺,卡點也相同:跨機構治理與合規。Nordic AI-Health Initiative(8/14)把合規寫進基礎建設而非事後補件的做法,對照衛福部「醫療機構應用生成式人工智慧指引」與臺灣智慧醫療三大中心(含臨床 AI 取證驗證中心)的既有架構,是現成的參照組。
(3) 給付才是導入的真正閘門——台灣這一格還是空的。Aidoc 拿到 NTAP,意味著美國醫院導入影像 AI 開始有現金流支撐;台灣目前健保仍無對應的 AI 軟體給付項目,導入成本幾乎全由醫院自行吸收。衛福部部長石崇良在高醫大論壇(2026/6/27)提出「333 政策」與 489 億元預算,並以年底前醫學中心病歷互通、兩年內擴及區域與地區醫院為目標;同場也提到高醫與鴻海合作、以 NVIDIA 為底的大腸癌偵測系統。資料互通是必要條件,但若沒有接上給付設計,Aidoc 這種「證據尚可、財務可行」的模式在台灣仍難複製。
05 — Further Reading
-
Divergent impacts of explainable AI for dermatological diagnosis on clinicians versus lay people — Nature Medicine, 2026/8/4
本期最值得完整讀完的一篇。開放取用,附完整 4×2 因子設計與所有子群分析;任何在做臨床 AI 介面的人都應該先讀方法與圖 3。
-
Medical AI has a measurement problem — Nature, 2026/7/28
哈佛醫學院 Arjun K. Manrai 的短評,把「實證醫學預設量尺可靠、但 AI 讓這個前提站不住」講得最清楚,是理解今年一連串陰性試驗的框架。
-
AI-based triage and decision support in mammography and digital tomosynthesis: a paired, noninferiority trial — Nature Medicine, 2026/3/19
31,301 人的前瞻試驗,是目前影像 AI「減少判讀量」最硬的證據;但回召率同步上升 14.8%,值得和效益一起讀。
-
General-purpose large language models outperform specialized clinical AI tools on medical benchmarks — Nature Medicine
如果通用模型持續在基準上勝出,窄型專用臨床 AI 的護城河到底是什麼?這篇是所有醫療 AI 產品策略討論的必要前提。
-
Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial — Nature Medicine
務實叢集隨機設計是目前檢驗臨床 AI 最貼近真實的方法;和 UVA 的 CoMET 試驗對照讀,可以看清「介入設計」與「模型效能」哪個才是瓶頸。
06 — References
- Xu, X., Hu, H., … Ghassemi, M. “Divergent impacts of explainable AI for dermatological diagnosis on clinicians versus lay people.” Nature Medicine, vol. 32 no. 8, 2026-08-04. nature.com/articles/s41591-026-04553-w
- Jia, H., Qian, B., Sun, X. “AI-based clinician decision support system for diagnosis of inherited retinal diseases: a multicenter, randomized trial.” Nature Medicine, 2026-07-24. nature.com/articles/s41591-026-04545-w
- “CMS approves Medicare add-on payment for Aidoc CT triage AI.” AuntMinnie, 2026-08-13. auntminnie.com
- “Aidoc's CARE Body CT Multi-Triage receives eligibility for Medicare New Technology Add-on Payment.” PR Newswire (Aidoc press release). prnewswire.com
- “Medicare approves new technology add-on payment for inpatient radiology AI solution.” Radiology Business. radiologybusiness.com · “CT Triage Software Garners NTAP Reimbursement from CMS.” Diagnostic Imaging. diagnosticimaging.com
- Palmer, K. “Nurses seek a seat at the table as they fight expanding clinical AI.” STAT, 2026-08-11 (STAT+ paywall). statnews.com
- Palmer, K. “What Medicare incentives for AI-based devices mean for tech companies — and hospitals.” STAT, 2026-08-13 (STAT+ paywall). statnews.com
- Andreassen, O. A., Heimer, H., Kallioniemi, O., et al. “An AI-Health infrastructure for the Nordic region: technical foundations, data assets, and a roadmap for deployment.” Nature Medicine (Comment), 2026-08-14. nature.com/articles/s41591-026-04575-4
- “RSNA Launches Knee Abnormality Detection AI Challenge.” RSNA News, 2026-08-05. rsna.org · challenge page: rsna.org/artificial-intelligence · AuntMinnie coverage: auntminnie.com
- Keim-Malpass, J., Bourque, J. M., et al. “A randomized controlled trial of artificial intelligence-based analytics for clinical deterioration.” Scientific Reports, 2026-02-05. nature.com/articles/s41598-026-39051-z
- Manrai, A. K. “Medical AI has a measurement problem.” Nature, 2026-07-28. nature.com/articles/d41586-026-02125-z
- Álvarez-Benito, M., et al. “AI-based triage and decision support in mammography and digital tomosynthesis for breast cancer screening: a paired, noninferiority trial.” Nature Medicine, 2026-03-19. nature.com/articles/s41591-026-04277-x
- “Interval cancer, sensitivity, and specificity comparing AI-supported mammography screening with standard double reading (MASAI).” The Lancet. thelancet.com
- “General-purpose large language models outperform specialized clinical AI tools on medical benchmarks.” Nature Medicine. nature.com/articles/s41591-026-04431-5 · “Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial.” Nature Medicine. nature.com/articles/s41591-026-04503-6
- Johnston, A., et al. “Patient-friendly radiology reports improve family comprehension” (Pediatric Radiology, reported 2026-08-03). AuntMinnie. auntminnie.com
- 「高醫大論壇揭示AI醫療新局!衛福部推『333政策』」,聯合新聞網,2026-06-27。udn.com ·「衛生福利部頒布『醫療機構應用生成式人工智慧指引』」,理律法律事務所。leeandli.com · 臺灣智慧醫療三大中心 aicenter.mohw.gov.tw
- “FDA clears CT-based AI triage platform Aidoc.” Diagnostic Imaging, 2026-01-21. diagnosticimaging.com