◆ AI/醫療AI 日報
–
星期一 · 臨床應用與研究

臨床 AI 這一週交出的不是新試驗,而是三份總帳 —— 真正把住院死亡率從 23.1% 壓到 18.6% 的,是一個不含 LLM 的惡化分數;而 GPT-4o 的隨機試驗停在 aOR 0.77、p=0.13

今天這一期必須先說一句不好看的話:過去 72 小時,臨床 AI 沒有任何一份新的大型前瞻試驗落地。本期最新的兩份文件都是回頭算總帳 —— 10 月 2 日被重新提出來討論的那份 NEJM AI 研究,在 11 家急症醫院、23,132 人次上把高風險住院病人的院內死亡率由 23.1% 降到 18.6%(校正後 aOR 0.82,95% CI 0.74–0.91);以及同一天發布的 2026 Q3 季度回顧,把一整季的試驗逐條算完後只留下一句話 ——「the workflow is now the model」。把這兩份擺在 Nature Medicine 那份肯亞 GPT-4o 隨機試驗(9,691 名病人,主要指標 2.2% 對 2.0%,aOR 0.77、95% CI 0.55–1.08、P = 0.13)旁邊,今天的結論就很難繞過去:動到病人結果的是流程,不是模型大小。

01 — Top Stories

今天的八則排法刻意把「有病人結果的」放前面、把「只有分數的」放後面 —— 因為這一週的差別就在這裡
住院死亡率 RWJBarnabas HealthEpic Deterioration IndexNEJM AI10/02

把 Epic 惡化指數直接接到快速反應小組,11 家醫院的高風險住院死亡率從 23.1% 掉到 18.6%

發生什麼

RWJBarnabas Health 與 Rutgers Robert Wood Johnson 醫學院在 11 家急症醫院把 Epic Deterioration Index(EDI)的即時警示直接送進 rapid response team,而不是只貼在護理站的儀表板上。研究發表於 NEJM AI(DOI 10.1056/AIoa2500973),由該院健康資訊副總裁 Thomas Nahass 主持;導入前 10,803 人次、導入後 12,329 人次,共 23,132 人次。10 月 2 日 2 Minute Medicine 的評析把它重新拉回檯面,並補上完整統計:未校正死亡率 23.1% → 18.6%(絕對差 −4.5 個百分點,95% CI −5.6 到 −3.5),校正後 aOR 0.82(95% CI 0.74–0.91);RRT 啟動 OR 1.74(95% CI 1.61–1.88),RRT 評估比例從 25.3% 升到 37.5%,而 ICU 轉床並未同比例上升。

為什麼重要

這是今年少數「動到死亡率」而不是「動到準確率」的臨床 AI 研究,而它用的東西一點都不新 —— EDI 是 Epic 內建、以結構化生理數值為主的梯度提升分數,裡面沒有任何 LLM。真正改掉的是流程:警示不再等人看到,而是直接呼叫一支會去床邊的隊伍。Nahass 自己把因果講得很保守:「我們的目標是更早找出病人,在介入變得困難之前。惡化指數給了我們一個更早的時間點。」

要打折的地方

這是前後對照(before-and-after)的前瞻世代研究,不是隨機試驗,前後兩段期間的季節分布不均、其中兩家醫院導入不完整,外推性作者自己標為不確定。更該注意兩個數字:導入後只有 46.6% 的住院真的產生了通知;而在剛好跨過門檻的 EDI 55–59 這一段,校正後 aOR 是 0.86(95% CI 0.63–1.17)—— 信賴區間跨過 1,也就是這份研究最接近「準實驗」的那一刀並沒有顯著性。

隨機試驗落空 Penda HealthAI Consult / GPT-4oNature Medicine08/01

肯亞 16 家診所、103 位 clinical officer、9,691 名病人:GPT-4o 當臨床安全網「安全但沒有效」

發生什麼

KEMRI-Wellcome Trust、University of Birmingham、Penda Health 與 LSHTM 合作,在奈洛比與 Kiambu 兩縣 16 家基層診所做務實型群集隨機試驗,把 clinical officer 隨機分到「有 LLM 輔助的電子病歷」或「關掉 LLM 的同一套電子病歷」。工具是 AI Consult 2.0,底層 GPT-4o。2025 年 4 月 22 日至 7 月 16 日收案,9,691 名病人、103 位 clinical officer(介入組 52、對照組 51)。主要指標是 14 天內經專家判定的治療失敗複合事件:介入組 102/4,693(2.2%)、對照組 94/4,654(2.0%),aOR 0.77(95% CI 0.55–1.08,P = 0.13),無顯著差異。Nature Medicine 線上刊於 6 月 26 日、紙本 8 月號。

為什麼重要

這是目前規模最大、設計最乾淨的「前沿 LLM 直接進基層診間」隨機試驗,而它的答案是:不會害人,也沒救到人。作者原話是「LLM assistance was safe but did not reduce treatment failure within 14 days and any benefit, if present, is probably modest」。但次要指標全面變好:病歷記載品質顯著提升(診斷 aOR 1.74、完整病程記錄 aOR 1.68、治療計畫 aOR 1.71),抗生素成本平均每人降 0.15 美元,病人滿意度兩組一樣。換句話說,LLM 現在證明得出來的價值是「文件與用藥紀律」,不是「臨床結果」。

要打折的地方

事件率比設計時預期的低得多,所以這份試驗其實是 power 不足:二手整理指出,要偵測更小幅的差異需要 10 萬名以上病人。因此「沒有顯著差異」不等於「證明無效」。另外樣本全來自單一都會區私立診所網路(Penda Health),對鄉村與公立體系的外推性有限;14 天的追蹤窗口也可能太短。安全面上,被標記的輸出只有 49.4% 被評為「definitely safe」,另有 1.1% 被判為不安全 —— 這個 1.1% 的分母與嚴重度細節需回看原文。

季度總帳 2026 Q3ESTOP-AKIProf. Valmed10/02

一份 10/2 發布的季度總結把 Q3 的試驗逐條算完,結論是五個字:workflow 才是模型

發生什麼

10 月 2 日發布的 AI & Digital Health 2026 Q3 回顧把這一季的臨床證據排在一起看,結果很一致:ESTOP-AKI(JAMA Network Open,7 月)180 名住院病人,機器學習成功標出急性腎損傷風險,但提早的腎臟科照會並未改善結果(peak creatinine 變化 0.04 對 −0.03 mg/dL,無統計意義),且非飲食/非電解質建議只有 41% 被完整採納。ALLIANCE(9 月,82 位醫師判讀風濕科病例)顯示 LLM 輔助讓速度大增但準確率沒動;ACDIS 的報導補上數字 —— 用 Prof. Valmed 的介入組首選診斷正確率 33.3%、對照組 35.0%,但判讀時間 94 秒對 206 秒。同一份回顧還列了一項 9 月的幻覺偵測研究:資淺臨床人員只找出 15.8% 的 GPT-4o 幻覺,13.1% 的人一個都沒找到。

為什麼重要

把這些放在一起,Q3 的形狀就出來了:模型抓得到風險,但人與流程沒有把風險變成行動。ESTOP-AKI 的 41% 採納率、EDI 研究的 46.6% 通知率,講的是同一件事。回顧自己下的判語最狠:「A better model does not necessarily produce better medicine.」這也解釋了為什麼同一季的基礎模型規模一路往上(NeuroVFM 吃 524 萬份 MRI/CT volume、PRISM2 吃 230 萬張全切片影像與 70 萬份病理報告),卻沒有一條對應的結果曲線。

要打折的地方

這是個人署名的整理型回顧,不是同儕審查的系統性回顧,也沒有宣告搜尋策略或納入排除標準,因此有選樣偏誤的空間。文中每一項原始研究都應回查原文;本日報只採用其中能另外找到二手或一手出處佐證的數字,無法佐證的(如幻覺偵測研究的完整書目)在編輯說明中標出。

證據品質 ARISEStanford / Harvard01/15

史丹佛─哈佛那份報告的那個數字還沒被反駁:500 多份醫療 AI 研究裡,只有 5% 用了真實病人資料

發生什麼

ARISE(AI Research and Science Evaluation,史丹佛─哈佛研究網絡)的首份年度 State of Clinical AI Report 2026,由 Peter Brodeur、Ethan Goh、Adam Rodman、Jonathan H. Chen 主筆,背後掛著 Stanford Computational Medicine、Harvard Medical School Shapiro Institute 與 Beth Israel Deaconess。史丹佛醫學院的說明給了關鍵數字:FDA 已放行超過 1,200 項 AI 醫材;而他們回顧的 500 多份醫療 AI 研究中,近 50% 用的是考試型題目,只有 5% 用了真實病人資料。報告也記下 AI 可在標準院內警示前 8–24 小時預測病人惡化。

為什麼重要

這 5% 是今天整期日報的分母。當九成五的文獻跑在題庫上,所謂「模型在醫學上的進步」有多少能換成病床邊的改變,本來就無從得知;而本期前三則剛好把那 5% 的樣子攤開給你看 —— 一則有死亡率、兩則沒有。報告自己的話是:「AI is already embedded in health care, and that is unlikely to change. What this report makes clear is that the next phase will not be driven by newer models alone.」它同時點出一個「jagged frontier」:模型在受控任務上很強,碰到真實世界的變異與不確定性就脆。

要打折的地方

報告本身發布於 1 月 15 日,不是本週新聞,放進今天是因為它是解讀前三則的必要尺規。ARISE 官網的公開頁面只給概念性結論,沒有列出完整方法學與那 500 多份研究的清單,所以「近 50%/只有 5%」這兩個比例目前只能由史丹佛醫學院的新聞稿佐證,無法從公開頁面逐篇覆核。

心臟超音波 Mayo ClinicUltraSightPhilips Lumify06/09

九個完全沒受過訓的人拿手持超音波掃 995 人:敏感度 90.1%、特異度 99.1%,但兩段式篩檢把敏感度砍到 77.0%

發生什麼

梅約診所(Rochester)的 Méabh M. Killalea、Jordan Borgeson、Jared G. Bird 等人在 npj Digital Medicine(2026-06-09,卷 9、文章 712)發表前瞻研究:995 名成人同時接受 AI 強化心電圖(AI-ECG)與 AI 導引聚焦式心臟超音波(AI-FoCUS),並以完整心臟超音波為對照。執行者是 9 名完全沒有超音波經驗的新手,使用 Philips Lumify 手持探頭搭配 UltraSight 的即時導引,影像由盲化專家判讀。結果:AI-FoCUS 偵測結構性心臟病(SHD)敏感度 90.1%、特異度 99.1%、PPV 95.4%、NPV 98.0%;AI-ECG 單獨使用敏感度 87.0%、特異度 60.7%、PPV 僅 30.6%。

為什麼重要

這是本期唯一一則「AI 真的把技能下放給非專業人員」的證據,而且下放得很乾淨 —— 導引負責取像、專家負責判讀,責任切面清楚。但真正值得抄下來的是那個取捨:先用 AI-ECG 篩、再用 AI-FoCUS 確認的兩段式策略,把影像使用量壓到 47%、特異度拉到 99.4%、PPV 96.1%,代價是敏感度從 90.1% 掉到 77.0%。也就是省一半的檢查,要漏掉約四分之一的病人。這種「省多少換漏多少」的換算,才是給付單位真正會問的問題。

要打折的地方

這是轉診族群(referral cohort),疾病盛行率遠高於社區篩檢,所以 PPV 95.4% 這個數字不能直接搬到一般人口;作者自己也只說「feasible and accurate for detecting selected SHD phenotypes」—— selected 這個字限定了可偵測的病型範圍。另外,取像是新手做的,但判讀是盲化專家做的,所以這份研究並沒有測試「沒有專家的場景」。

心導管室 Powerful MedicalPMcardio / Queen of HeartsJACC: CV Interventions

同一份 AI 心電圖把假警報從 41.8% 降到 7.9%:1,032 次 STEMI 啟動的三院登錄資料

發生什麼

Queen of Hearts US Registry 收錄 UC Davis(Sacramento)、UT Health Houston、Beth Israel Deaconess(Boston)三個 primary PCI 網絡,2020 年 1 月至 2024 年 5 月共 1,032 次 STEMI 啟動。TCTMD 的報導(研究同步刊於 JACC: Cardiovascular Interventions)給出:AI 敏感度 92% 對標準判讀 71%、特異度 81% 對 29%、AUC 0.94;在生物標記陰性病人中的假陽性心導管啟動由 41.8% 降到 7.9%。該模型是 Powerful Medical 的 PMcardio「Queen of Hearts」,訓練目標是冠狀動脈阻塞型心肌梗塞(OMI)而非傳統 STEMI 判準。Timothy Henry 的話:「AI-EKG analysis has the potential to reduce false activation by up to fourfold.」

為什麼重要

特異度 29% → 81% 這個跳幅在臨床 AI 文獻裡非常罕見,而且它指向一個被低估的事實:很多 AI 的價值不在抓出更多病人,而在停掉不必要的動作。假陽性心導管啟動每一次都是一組人半夜被叫起來、一間導管室被佔用、一個病人被推進侵入性流程 —— 這種成本從來不會出現在 AUC 裡。另一位研究者 Ivan Rokos 的話也值得記下來:「We as physicians are still ultimately responsible for the patient, but AI can certainly turbocharge and augment our abilities.」

要打折的地方

這是回溯性登錄研究,不是前瞻比較,AI 是在已經被啟動的 1,032 個案例上回頭判讀,所以它沒有測到「AI 當第一線守門人會漏掉什麼」。報導與原始發表的時點是 2025 年 10 月(TCT 2025 大會),不是本週新聞;放進今天是為了對比上一則 AI-ECG 單獨使用 PPV 只有 30.6% 的結果 —— 同一個模態,用在不同決策點,數字可以差這麼多。此外 Powerful Medical 是該模型的商業開發者,登錄研究的資料來源與資助關係需回查原文。

核准結構 FDACureusKaiser Permanente07/13

三十年 1,430 件 AI 醫材核准裡,放射科拿走 1,094 件(76.5%),病理科 9 件,精神科 0 件

發生什麼

Kaiser Permanente 洛杉磯醫學中心的 Pouyan Golshani 等人在 Cureus(2026-07-13)盤點 1995–2025 年 FDA 的 AI/ML 醫材核准,AuntMinnie 的整理給出:總計 1,430 件,放射科 1,094 件(76.5%),加上心血管與神經科共佔 90.6%。而病理科只有 9 件、微生物 6 件、婦產科 4 件、精神與行為健康 0 件。速度也很懸殊:1995–2014 年平均每年 1.8 件,2023–2025 年平均每年 264 件,光 2025 一年就 331 件。廠商集中度上,740 家公司中有 502 家(67.8%)只拿到一件核准,而 13 家公司(1.8%)拿下 247 件(17.3%)。

為什麼重要

這張分布圖解釋了為什麼本期的證據全長在影像與心臟上:法規通道三十年來只在「有像素、有訊號、有金標準」的科別鋪好了路。精神科 0 件不是因為沒人做,而是因為精神科缺一個能被 510(k) 接受的參照標準 —— 這也是為什麼心理健康 AI 大多以「非醫材」的消費品形式上市、繞過前市場審查。放射科 76.5% 同時意味著一件事:如果你是一家做非影像臨床 AI 的公司,你面對的不只是技術問題,而是一條還沒被走出來的路。

要打折的地方

這是 7 月 13 日發表的文獻計量研究,不是本週新聞;而且「核准數」不是「臨床價值」的代理指標 —— 1,430 件裡絕大多數是 510(k) 實質等同,不需要前瞻臨床試驗。本日報只讀到 AuntMinnie 的二手整理,心血管與神經科各自的件數在該報導中未列出,故未引用。另有一份 Q3 季度回顧稱 FDA 已授權「超過 1,600 項」AI 醫材,與本則的 1,430 件統計窗口不同(後者僅計至 2025 年底),兩個數字不可混用。

醫師態度 AMA2026 Physician Survey03/12

81% 的醫師自己在用 AI,但 46% 不希望病人拿 AI 去解讀自己的放射報告、88% 擔心技能退化

發生什麼

美國醫學會(AMA)Center for Digital Health and AI 的 2026 Physician Survey on Augmented Intelligence,經 AuntMinnie(2026-03-12)整理:81% 的醫師已在執業中使用 AI(2023 年為 38%),超過 75% 認為 AI 改善了他們照顧病人的能力(2023 年 65%)。但問到病人端就翻轉:46% 表示「從不或很少」希望病人用 AI 解讀放射檢查結果,49% 對病理結果持同樣立場。另有 88% 擔心技能流失,86% 認為資料隱私是擴大採用的關鍵,88% 認為安全性與效能驗證是關鍵。

為什麼重要

把 81% 和 46% 擺在一起,就看得到臨床 AI 下一階段的真正戰場不在模型,而在誰有權拿 AI 讀自己的片子。醫師接受 AI 當自己的副駕駛,但不接受 AI 當病人的副駕駛 —— 而病人端的 AI 判讀工具正在以消費品形式快速普及(前一則的精神科 0 件核准就是同一條路徑)。這個落差會在未來一兩年內變成門診裡的具體衝突,而不是學術爭論。88% 擔心技能退化這一項,則和今天 Prof. Valmed 那個「94 秒對 206 秒、準確率不變」的結果對得上:加速不等於增能。

要打折的地方

這是 3 月 12 日的調查報導,不是本週新聞。更要緊的是:AuntMinnie 的報導未揭露樣本數與抽樣方法,AMA 的會員調查亦有自我選擇偏誤,因此「81%」這類數字應視為受訪醫師的自述比例,不是全美執業醫師的母體估計。「使用 AI」的定義範圍(是否含語音病歷、排程、計費)在該報導中也未界定。

02 — Product Analysis

今天刻意拆最不像對手的兩個東西:一個 2018 年就存在的梯度提升分數,和一個 2025 年的前沿 LLM —— 因為有病人結果的是前者

Epic Deterioration Index (EDI)

內建於電子病歷的住院惡化風險分數 · Epic Systems(美國)

功能與定位。EDI 是直接長在 Epic 電子病歷裡的住院惡化風險分數,吃的是結構化生理數值、檢驗與護理評估,輸出 0–100 的分數,不是生成式模型、裡面沒有 LLM。它賣給誰?它不「賣」—— 它是 Epic 客戶已經有的東西,所以 RWJBarnabas 這次的介入成本幾乎只在流程改造,而不在採購。真正的產品創新是把分數的消費者從「護理站儀表板」換成「rapid response team 的呼叫器」。

  • 優勢 :這是今年極少數掛得上死亡率的臨床 AI —— 11 家醫院、23,132 人次,高風險住院死亡率 23.1% → 18.6%,校正後 aOR 0.82(95% CI 0.74–0.91);而且 ICU 轉床沒有同比例增加,說明不是靠「把人都送進加護病房」換來的。
  • 優勢 :零採購摩擦。它已經在數千家 Epic 客戶的系統裡,可複製性遠高於任何需要簽約、整合、驗證的新模型 —— 本期 ARISE 報告點出的「下一階段不會由更新的模型驅動」,講的就是這種東西。
  • 疑慮 :導入後只有 46.6% 的住院真的跳出通知,所以我們其實不知道這套系統在「全量覆蓋」下會不會變成警報疲乏災難;而剛跨門檻那一段(EDI 55–59)aOR 0.86、95% CI 0.63–1.17,不顯著。
  • 疑慮 :前後對照設計無法排除同期其他品質改善措施的貢獻,兩家醫院導入不完整、季節分布不均,作者自己把外推性標為不確定。缺的那個數據很明確:沒有隨機試驗。

AI Consult 2.0 (Penda Health, on GPT-4o)

嵌在電子病歷裡的基層臨床安全網 · Penda Health(肯亞)/OpenAI GPT-4o

功能與定位。AI Consult 不是 chatbot,而是接在 clinical officer 下診斷與開處方的動作上、對可能的錯誤即時提示的「安全網」層。它的使用者是基層的 clinical officer(在肯亞體系中非醫師的臨床執業人員),底層是 GPT-4o。它被設計成不打斷工作流、只在偵測到問題時出聲 —— 這個設計決策後來同時解釋了它的成功與失敗,詳見 Nature Medicine 的試驗報告。

  • 優勢 :這是極少數敢做群集隨機試驗並把結果如實發表(含落空的主要指標)的 LLM 臨床產品,光這一點的可信度就高於絕大多數自評自測的醫療模型 —— 對照本站 10/01 那期談到的 MedQA 自測 100% 問題。
  • 優勢 :次要指標是真的動了:診斷記載 aOR 1.74、完整病程記錄 aOR 1.68、治療計畫 aOR 1.71,抗生素成本每人降 0.15 美元,且病人滿意度未下降。在抗生素抗藥性是全球議題的脈絡下,用藥紀律本身就是可給付的價值。
  • 疑慮 :主要指標落空,而且作者的措辭已經先把天花板封住了 —— 「any benefit, if present, is probably modest」。更麻煩的是 power 不足:二手整理指出要偵測更小的差異需要 10 萬名以上病人,意思是這類產品短期內拿不出「治療失敗下降」的證據,不是因為做不到,而是因為做不出來給你看。
  • 疑慮 :被標記的輸出只有 49.4% 被評為「definitely safe」,1.1% 被判為不安全。把這個數字乘上今天另一則的發現 —— 資淺臨床人員只找出 15.8% 的 GPT-4o 幻覺 —— 「人會把錯的擋掉」這個假設在基層場景並不成立。

兩者的對比就是本期的論點。EDI 模型能力遠遜於 GPT-4o,卻掛得上死亡率,因為它的輸出被接到一支會移動的隊伍;AI Consult 模型能力遠勝,卻只動得了文件,因為它的輸出終點是一個正在忙的人的眼睛。臨床 AI 的瓶頸現在不在模型的上限,而在輸出之後那段路有沒有人走。

03 — Companies & Competition

誰站在哪裡、憑什麼、跟誰打
公司 近況與數字 競爭定位與護城河
Epic Systems
美國醫院電子病歷的事實標準
內建 EDI 在 RWJBarnabas 11 家醫院、23,132 人次的研究中對應到高風險住院死亡率 23.1% → 18.6%,校正後 aOR 0.82,NEJM AI DOI 10.1056/AIoa2500973;RRT 評估率 25.3% → 37.5%。 護城河是「已經在裡面」:不需採購、不需整合,臨床 AI 的分發權握在它手上。弱點是模型本身並不先進,一旦證據標準從「關聯」升到「隨機」,它沒有做試驗的習慣與誘因。
Penda Health + OpenAI
肯亞基層診所網路 × 前沿模型
16 家診所、103 位 clinical officer、9,691 名病人的群集隨機試驗,主要指標 2.2% 對 2.0%、aOR 0.77、P = 0.13;文件品質 aOR 1.68–1.74,抗生素成本每人降 0.15 美元。 護城河是證據的誠實度與低資源場域的真實部署經驗 —— 這是 OpenAI 在醫療端最難被複製的資產。弱點是商業模式:文件品質與抗生素成本的改善很難在肯亞基層換成足以支撐 GPT-4o 推論成本的付費意願。
UltraSight
即時 AI 導引心臟超音波取像
梅約 995 人前瞻研究中,9 名零經驗新手搭配 Philips Lumify 取像,AI-FoCUS 偵測 SHD 敏感度 90.1%、特異度 99.1%、PPV 95.4%(判讀由盲化專家執行)。 護城河是把超音波取像這項最依賴手感的技能商品化,並綁上 Philips 的手持硬體通路。弱點是它只解了取像、沒解判讀,所以賣的仍是「專家的前處理器」而非替代品 —— 在缺乏心臟專科的地區(包含台灣部分偏鄉),這個限制就是它的天花板。
Powerful Medical
PMcardio/Queen of Hearts,OMI 導向 AI 心電圖
三院 1,032 次 STEMI 啟動的回溯登錄:敏感度 92% 對 71%、特異度 81% 對 29%、AUC 0.94,生物標記陰性病人的假陽性心導管啟動 41.8% → 7.9%。 護城河是訓練標的選得不一樣:直接對準 OMI 而非傳統 STEMI 判準,因此抓到的是教科書判準會漏掉的那一群。弱點是回溯設計,以及它改善的主要是「省掉不必要的啟動」—— 這種價值在以處置量計酬的體系裡反而難賣。
ARISE(Stanford × Harvard)
不賣產品,賣評估標準的那一方
首份年度報告指出 FDA 已放行超過 1,200 項 AI 醫材,而回顧的 500 多份研究中近 50% 用考試題、僅 5% 用真實病人資料;主張證據標準應轉向多輪非結構化資料與真實後果。 護城河是學術中立性與 Stanford/Harvard/BIDMC 的聯合背書 —— 在廠商自評自測成常態的市場裡,「誰定義什麼叫有效」本身就是一種權力。弱點是沒有強制力,也沒有公開完整方法學供逐篇覆核。

今天的競爭結構是一個「分發 vs. 證據」的交叉。握有分發權的(Epic)不需要證據就能部署,而拿得出最誠實證據的(Penda/OpenAI)沒有分發權;中間那一層(UltraSight、Powerful Medical)則都選擇只解一小段流程、把責任留給專家 —— 這在法規上安全,但也把天花板一起焊死了。

04 — Taiwan Angle

台灣正在蓋的是資料基建,而今天的證據說:基建蓋完之後真正缺的是流程

(1) 時程已經壓到年底,但這是「資料」的時程,不是「結果」的時程。衛福部長石崇良在 9 月 15 日為 10 月 7 日登場的生技論壇預告時指出,醫療 AI 的「首要工作是建立資料標準、治理制度及可信賴的使用環境」,並給出明確時間表:醫學中心的 FHIR 資料整備目標在 2026 年底,全國醫院串接在 2027 年底;政策工具包括五年 4,890 億元的「健康台灣深耕計畫」、四年 2,400 億元的「國家藥物韌性整備計畫」,以及規劃中 1,000 億元的創新醫材與新藥研發投資(經濟日報/聯合新聞網,2026-09-15)。對照今天 RWJBarnabas 的結果:他們沒有新資料、沒有新模型,只是把既有分數接到 rapid response team,就拿到 aOR 0.82。FHIR 串接是必要條件,但不是充分條件。

(2) 台灣已經有「負責任 AI 中心」這個制度骨架,但缺的是 RRT 那條線。衛福部在 2025 年已與十家醫院合作建立負責任 AI 執行中心,定位是「可信賴的智慧醫療守門人」(衛生福利部)。守門人這個隱喻恰好說明了問題:守門是「審核模型能不能進來」,而今天的證據全指向「模型進來之後,警示送給誰、誰會動」。ESTOP-AKI 的建議只有 41% 被完整採納、EDI 只有 46.6% 的住院跳通知 —— 台灣的醫學中心若把 AI 導入當成資訊室專案而非品質改善專案(QI),同一組落差會原封不動複製過來。

(3) 給付這一端,今天最可抄的其實是「省下來的檢查」而不是「抓出來的病人」。梅約那份研究的兩段式策略把影像使用量壓到 47%、代價是敏感度從 90.1% 掉到 77.0%(npj Digital Medicine);Powerful Medical 把假陽性心導管啟動從 41.8% 壓到 7.9%(TCTMD)。在健保總額制下,這種「減少不必要處置」的價值比「提高偵測率」更容易換算成給付論述 —— 但同時也更容易被誤用成壓縮檢查量的理由。那個從 90.1% 掉到 77.0% 的敏感度,就是這筆帳要先講清楚的代價。

05 — Further Reading

挑選標準:能改變你讀下一篇 AI 論文時的問法,而不是多給你一個數字
  1. Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial — Nature Medicine (2026-06-26)

    把摘要最後一句抄下來當尺:「LLM assistance was safe but did not reduce treatment failure within 14 days」。這是目前最乾淨的一次「前沿模型在真實診間」的隨機證據,值得整篇讀完方法學,特別是事件率低於預期導致 power 不足那一段。

  2. State of Clinical AI Report 2026 — ARISE, Stanford–Harvard Research Network

    讀它不是為了那 5%,而是為了「jagged frontier」這個框架:同一個模型在受控任務與真實變異之間的落差不是平滑的,是鋸齒狀的。這個框架會改變你怎麼看 benchmark。

  3. AI & Digital Health: Quarterly Review 2026Q3 — micheledpierri.com (2026-10-02)

    本期最新的一份文件,也是唯一把 Q3 的試驗、基礎模型與法規動作並排算完的整理。注意它把 ESTOP-AKI 的 41% 採納率與 ALLIANCE 的「快但沒更準」放在同一節 —— 這個編排本身就是論點。

  4. Advancing conversational diagnostic AI with multimodal reasoning — Nature Medicine (2026-05-14)

    多模態 AMIE 在 105 次模擬遠距門診中於 32 項評分軸的 29 項勝過基層醫師 —— 然後作者自己標明這不是臨床試驗、聊天介面沒有理學檢查、且可能有預訓練資料洩漏。把這篇和本期第二則對讀,就能看懂「OSCE 贏」與「隨機試驗沒贏」之間那道鴻溝。

  5. An agentic system for rare disease diagnosis with traceable reasoning (DeepRare) — Nature, vol 651, 775–784 (2026)

    罕病診斷是「AI 應該真的有優勢」的少數場景:盛行率低於 1/2,000、臨床醫師本來就連不起來那些模式、而且診斷延遲動輒五年以上。重點讀它的 traceable reasoning 設計 —— 把推論鏈綁回醫學證據,是本期唯一正面處理「人要怎麼查 AI」的做法。

06 — References

參考文獻
  1. Artificial intelligence (AI)-triggered rapid response notifications were associated with lower mortality among inpatients. 2 Minute Medicine, 2026-10-02. 2minutemedicine.com
  2. RWJBarnabas Links Real-Time Epic EDI Alerts Directly to Rapid Response Teams (NEJM AI, DOI 10.1056/AIoa2500973). HIT Consultant, 2026-07-29. hitconsultant.net
  3. AI-enabled tool helps identify hospitalized patients at risk of rapid clinical decline. News-Medical, 2026-07-29. news-medical.net
  4. RWJBarnabas Health Sees Improvements Using Epic Deterioration Index. Healthcare Innovation, 2026-07. hcinnovationgroup.com
  5. AI tool helps detect patient deterioration earlier, reducing hospital deaths. Medical Xpress, 2026-07. medicalxpress.com
  6. Agweyu A, Mwaniki P, Menon V, et al. Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial. Nature Medicine, online 2026-06-26, print 2026-08. nature.com
  7. PubMed record 42362867 (full abstract, Nature Medicine). PubMed / Europe PMC, 2026. pubmed.ncbi.nlm.nih.gov
  8. AI clinical support tool improved clinician decisions in real-world primary care trial. University of Birmingham, 2026. birmingham.ac.uk
  9. Generative AI Clinical Decision Support Shows Safety and Documentation Gains But No Significant Reduction in Treatment Failure in Kenyan Primary Care Trial. MedPath, 2026. trial.medpath.com
  10. AI & Digital Health: Quarterly Review 2026Q3. micheledpierri.com, 2026-10-02. micheledpierri.com
  11. News: AI tool quicker, not more accurate than humans when diagnosing rheum disease, study finds (medRxiv, 2026-08-29). ACDIS, 2026-09-10. acdis.org
  12. Brodeur P, Goh E, Rodman A, Chen JH. State of Clinical AI Report 2026. ARISE (Stanford–Harvard Research Network), 2026. arise-ai.org
  13. Clinical AI Has Boomed. A New Stanford-Harvard State of Clinical AI Report Shows What Holds Up in Practice. Stanford Medicine, 2026-01-15. medicine.stanford.edu
  14. Killalea MM, Borgeson J, Bird JG, et al. Improving structural heart disease screening: AI-ECG and novice AI-guided focused cardiac ultrasound. npj Digital Medicine 9:712, 2026-06-09. nature.com
  15. AI-ECG Finds STEMI Faster, Cuts False-Positive Cath Lab Activations (Queen of Hearts US Registry; JACC: Cardiovascular Interventions). TCTMD, 2025-10-31. tctmd.com
  16. Queen of Hearts: AI ECG for STEMI & OMI. Powerful Medical. powerfulmedical.com
  17. Radiology dominates thirty years of FDA AI device approvals (Golshani P, et al. Cureus, 2026-07-13). AuntMinnie, 2026-07-16. auntminnie.com
  18. Physicians mixed on patient use of AI to interpret radiology results (AMA 2026 Physician Survey on Augmented Intelligence). AuntMinnie, 2026-03-12. auntminnie.com
  19. Advancing conversational diagnostic AI with multimodal reasoning. Nature Medicine, 2026-05-14. nature.com
  20. Zhao et al. An agentic system for rare disease diagnosis with traceable reasoning (DeepRare). Nature 651:775–784, 2026. nature.com
  21. AI succeeds in diagnosing rare diseases (News & Views). Nature, 2026-02-18. nature.com
  22. 生技論壇10月7日登場 衛福部長石崇良:積極建構AI醫療基建. 經濟日報/聯合新聞網, 2026-09-15. udn.com
  23. 醫療AI要聰明,還要能負責!十家醫院打造可信賴的智慧醫療守門人. 衛生福利部, 2025. mohw.gov.tw
  24. General-purpose large language models outperform specialized clinical AI tools on medical benchmarks. Nature Medicine, 2026. nature.com
  25. Registered AI Medical-Imaging Clinical Trials on ClinicalTrials.gov: Publication Yield, Predictors, and Portfolio Evolution. Academic Radiology, 2026 (abstract not retrievable; see editor's note). academicradiology.org
編輯說明:(1)今日該主題新聞較少 —— 過去 72 小時沒有新的大型前瞻臨床 AI 試驗發表,因此本期把窗口前推至 9/28,並以兩份 10 月 2 日發布的回顧型文件(2 Minute Medicine 的 NEJM AI 評析、Q3 季度回顧)作為主線,其餘各則的原始發表日期已逐一標在卡片標籤與來源列上,最舊者為 2025 年 10 月的 TCTMD 報導,刻意保留以對比同一模態在不同決策點的表現差異。(2)未能讀取的頁面:Nature Medicine 原文頁(s41591-026-04503-6)與 Europe PMC 的 Academic Radiology 書目查詢在本次執行中被代理伺服器以 HTTP 429 限流拒絕,PubMed 與 academicradiology.org 則回傳 reCAPTCHA/403;肯亞試驗的完整摘要與統計數字係經 Europe PMC 的 PubMed 42362867 紀錄取得(逐字摘要),次要指標(aOR 1.68–1.74、0.15 美元、49.4%/1.1%)引自 MedPath 的二手整理而非原文,請以原文為準。Academic Radiology 那篇僅取得標題,未引用任何數字。The Lancet Digital Health 的社論(PIIS2589-7500(26)00053-1)同樣回傳 403,故未納入延伸閱讀。(3)廠商自述與設計限制:Powerful Medical 是 Queen of Hearts 的商業開發者,該登錄研究為回溯設計;UltraSight 與 Philips 為 AI-FoCUS 研究的器材提供方。EDI 研究為前後對照世代研究、非隨機試驗。(4)無法逐篇覆核的比例:ARISE 報告的「近 50% 用考試題/僅 5% 用真實病人資料」僅由史丹佛醫學院新聞稿佐證,官網公開頁未列方法學;Q3 季度回顧為個人署名整理、非同儕審查,其中 9 月幻覺偵測研究(15.8%/13.1%)與 ESTOP-AKI、ALLIANCE 的部分細節未能取得原始書目,ALLIANCE 的準確率與秒數已另由 ACDIS 報導佐證。(5)AMA 調查的樣本數與抽樣方法在二手報導中未揭露。(6)本報告不構成投資或醫療建議。