臨床 AI 這一週交出的不是新試驗,而是三份總帳 —— 真正把住院死亡率從 23.1% 壓到 18.6% 的,是一個不含 LLM 的惡化分數;而 GPT-4o 的隨機試驗停在 aOR 0.77、p=0.13
今天這一期必須先說一句不好看的話:過去 72 小時,臨床 AI 沒有任何一份新的大型前瞻試驗落地。本期最新的兩份文件都是回頭算總帳 —— 10 月 2 日被重新提出來討論的那份 NEJM AI 研究,在 11 家急症醫院、23,132 人次上把高風險住院病人的院內死亡率由 23.1% 降到 18.6%(校正後 aOR 0.82,95% CI 0.74–0.91);以及同一天發布的 2026 Q3 季度回顧,把一整季的試驗逐條算完後只留下一句話 ——「the workflow is now the model」。把這兩份擺在 Nature Medicine 那份肯亞 GPT-4o 隨機試驗(9,691 名病人,主要指標 2.2% 對 2.0%,aOR 0.77、95% CI 0.55–1.08、P = 0.13)旁邊,今天的結論就很難繞過去:動到病人結果的是流程,不是模型大小。
01 — Top Stories
把 Epic 惡化指數直接接到快速反應小組,11 家醫院的高風險住院死亡率從 23.1% 掉到 18.6%
RWJBarnabas Health 與 Rutgers Robert Wood Johnson 醫學院在 11 家急症醫院把 Epic Deterioration Index(EDI)的即時警示直接送進 rapid response team,而不是只貼在護理站的儀表板上。研究發表於 NEJM AI(DOI 10.1056/AIoa2500973),由該院健康資訊副總裁 Thomas Nahass 主持;導入前 10,803 人次、導入後 12,329 人次,共 23,132 人次。10 月 2 日 2 Minute Medicine 的評析把它重新拉回檯面,並補上完整統計:未校正死亡率 23.1% → 18.6%(絕對差 −4.5 個百分點,95% CI −5.6 到 −3.5),校正後 aOR 0.82(95% CI 0.74–0.91);RRT 啟動 OR 1.74(95% CI 1.61–1.88),RRT 評估比例從 25.3% 升到 37.5%,而 ICU 轉床並未同比例上升。
這是今年少數「動到死亡率」而不是「動到準確率」的臨床 AI 研究,而它用的東西一點都不新 —— EDI 是 Epic 內建、以結構化生理數值為主的梯度提升分數,裡面沒有任何 LLM。真正改掉的是流程:警示不再等人看到,而是直接呼叫一支會去床邊的隊伍。Nahass 自己把因果講得很保守:「我們的目標是更早找出病人,在介入變得困難之前。惡化指數給了我們一個更早的時間點。」
這是前後對照(before-and-after)的前瞻世代研究,不是隨機試驗,前後兩段期間的季節分布不均、其中兩家醫院導入不完整,外推性作者自己標為不確定。更該注意兩個數字:導入後只有 46.6% 的住院真的產生了通知;而在剛好跨過門檻的 EDI 55–59 這一段,校正後 aOR 是 0.86(95% CI 0.63–1.17)—— 信賴區間跨過 1,也就是這份研究最接近「準實驗」的那一刀並沒有顯著性。
肯亞 16 家診所、103 位 clinical officer、9,691 名病人:GPT-4o 當臨床安全網「安全但沒有效」
KEMRI-Wellcome Trust、University of Birmingham、Penda Health 與 LSHTM 合作,在奈洛比與 Kiambu 兩縣 16 家基層診所做務實型群集隨機試驗,把 clinical officer 隨機分到「有 LLM 輔助的電子病歷」或「關掉 LLM 的同一套電子病歷」。工具是 AI Consult 2.0,底層 GPT-4o。2025 年 4 月 22 日至 7 月 16 日收案,9,691 名病人、103 位 clinical officer(介入組 52、對照組 51)。主要指標是 14 天內經專家判定的治療失敗複合事件:介入組 102/4,693(2.2%)、對照組 94/4,654(2.0%),aOR 0.77(95% CI 0.55–1.08,P = 0.13),無顯著差異。Nature Medicine 線上刊於 6 月 26 日、紙本 8 月號。
這是目前規模最大、設計最乾淨的「前沿 LLM 直接進基層診間」隨機試驗,而它的答案是:不會害人,也沒救到人。作者原話是「LLM assistance was safe but did not reduce treatment failure within 14 days and any benefit, if present, is probably modest」。但次要指標全面變好:病歷記載品質顯著提升(診斷 aOR 1.74、完整病程記錄 aOR 1.68、治療計畫 aOR 1.71),抗生素成本平均每人降 0.15 美元,病人滿意度兩組一樣。換句話說,LLM 現在證明得出來的價值是「文件與用藥紀律」,不是「臨床結果」。
事件率比設計時預期的低得多,所以這份試驗其實是 power 不足:二手整理指出,要偵測更小幅的差異需要 10 萬名以上病人。因此「沒有顯著差異」不等於「證明無效」。另外樣本全來自單一都會區私立診所網路(Penda Health),對鄉村與公立體系的外推性有限;14 天的追蹤窗口也可能太短。安全面上,被標記的輸出只有 49.4% 被評為「definitely safe」,另有 1.1% 被判為不安全 —— 這個 1.1% 的分母與嚴重度細節需回看原文。
一份 10/2 發布的季度總結把 Q3 的試驗逐條算完,結論是五個字:workflow 才是模型
10 月 2 日發布的 AI & Digital Health 2026 Q3 回顧把這一季的臨床證據排在一起看,結果很一致:ESTOP-AKI(JAMA Network Open,7 月)180 名住院病人,機器學習成功標出急性腎損傷風險,但提早的腎臟科照會並未改善結果(peak creatinine 變化 0.04 對 −0.03 mg/dL,無統計意義),且非飲食/非電解質建議只有 41% 被完整採納。ALLIANCE(9 月,82 位醫師判讀風濕科病例)顯示 LLM 輔助讓速度大增但準確率沒動;ACDIS 的報導補上數字 —— 用 Prof. Valmed 的介入組首選診斷正確率 33.3%、對照組 35.0%,但判讀時間 94 秒對 206 秒。同一份回顧還列了一項 9 月的幻覺偵測研究:資淺臨床人員只找出 15.8% 的 GPT-4o 幻覺,13.1% 的人一個都沒找到。
把這些放在一起,Q3 的形狀就出來了:模型抓得到風險,但人與流程沒有把風險變成行動。ESTOP-AKI 的 41% 採納率、EDI 研究的 46.6% 通知率,講的是同一件事。回顧自己下的判語最狠:「A better model does not necessarily produce better medicine.」這也解釋了為什麼同一季的基礎模型規模一路往上(NeuroVFM 吃 524 萬份 MRI/CT volume、PRISM2 吃 230 萬張全切片影像與 70 萬份病理報告),卻沒有一條對應的結果曲線。
這是個人署名的整理型回顧,不是同儕審查的系統性回顧,也沒有宣告搜尋策略或納入排除標準,因此有選樣偏誤的空間。文中每一項原始研究都應回查原文;本日報只採用其中能另外找到二手或一手出處佐證的數字,無法佐證的(如幻覺偵測研究的完整書目)在編輯說明中標出。
史丹佛─哈佛那份報告的那個數字還沒被反駁:500 多份醫療 AI 研究裡,只有 5% 用了真實病人資料
ARISE(AI Research and Science Evaluation,史丹佛─哈佛研究網絡)的首份年度 State of Clinical AI Report 2026,由 Peter Brodeur、Ethan Goh、Adam Rodman、Jonathan H. Chen 主筆,背後掛著 Stanford Computational Medicine、Harvard Medical School Shapiro Institute 與 Beth Israel Deaconess。史丹佛醫學院的說明給了關鍵數字:FDA 已放行超過 1,200 項 AI 醫材;而他們回顧的 500 多份醫療 AI 研究中,近 50% 用的是考試型題目,只有 5% 用了真實病人資料。報告也記下 AI 可在標準院內警示前 8–24 小時預測病人惡化。
這 5% 是今天整期日報的分母。當九成五的文獻跑在題庫上,所謂「模型在醫學上的進步」有多少能換成病床邊的改變,本來就無從得知;而本期前三則剛好把那 5% 的樣子攤開給你看 —— 一則有死亡率、兩則沒有。報告自己的話是:「AI is already embedded in health care, and that is unlikely to change. What this report makes clear is that the next phase will not be driven by newer models alone.」它同時點出一個「jagged frontier」:模型在受控任務上很強,碰到真實世界的變異與不確定性就脆。
報告本身發布於 1 月 15 日,不是本週新聞,放進今天是因為它是解讀前三則的必要尺規。ARISE 官網的公開頁面只給概念性結論,沒有列出完整方法學與那 500 多份研究的清單,所以「近 50%/只有 5%」這兩個比例目前只能由史丹佛醫學院的新聞稿佐證,無法從公開頁面逐篇覆核。
九個完全沒受過訓的人拿手持超音波掃 995 人:敏感度 90.1%、特異度 99.1%,但兩段式篩檢把敏感度砍到 77.0%
梅約診所(Rochester)的 Méabh M. Killalea、Jordan Borgeson、Jared G. Bird 等人在 npj Digital Medicine(2026-06-09,卷 9、文章 712)發表前瞻研究:995 名成人同時接受 AI 強化心電圖(AI-ECG)與 AI 導引聚焦式心臟超音波(AI-FoCUS),並以完整心臟超音波為對照。執行者是 9 名完全沒有超音波經驗的新手,使用 Philips Lumify 手持探頭搭配 UltraSight 的即時導引,影像由盲化專家判讀。結果:AI-FoCUS 偵測結構性心臟病(SHD)敏感度 90.1%、特異度 99.1%、PPV 95.4%、NPV 98.0%;AI-ECG 單獨使用敏感度 87.0%、特異度 60.7%、PPV 僅 30.6%。
這是本期唯一一則「AI 真的把技能下放給非專業人員」的證據,而且下放得很乾淨 —— 導引負責取像、專家負責判讀,責任切面清楚。但真正值得抄下來的是那個取捨:先用 AI-ECG 篩、再用 AI-FoCUS 確認的兩段式策略,把影像使用量壓到 47%、特異度拉到 99.4%、PPV 96.1%,代價是敏感度從 90.1% 掉到 77.0%。也就是省一半的檢查,要漏掉約四分之一的病人。這種「省多少換漏多少」的換算,才是給付單位真正會問的問題。
這是轉診族群(referral cohort),疾病盛行率遠高於社區篩檢,所以 PPV 95.4% 這個數字不能直接搬到一般人口;作者自己也只說「feasible and accurate for detecting selected SHD phenotypes」—— selected 這個字限定了可偵測的病型範圍。另外,取像是新手做的,但判讀是盲化專家做的,所以這份研究並沒有測試「沒有專家的場景」。
同一份 AI 心電圖把假警報從 41.8% 降到 7.9%:1,032 次 STEMI 啟動的三院登錄資料
Queen of Hearts US Registry 收錄 UC Davis(Sacramento)、UT Health Houston、Beth Israel Deaconess(Boston)三個 primary PCI 網絡,2020 年 1 月至 2024 年 5 月共 1,032 次 STEMI 啟動。TCTMD 的報導(研究同步刊於 JACC: Cardiovascular Interventions)給出:AI 敏感度 92% 對標準判讀 71%、特異度 81% 對 29%、AUC 0.94;在生物標記陰性病人中的假陽性心導管啟動由 41.8% 降到 7.9%。該模型是 Powerful Medical 的 PMcardio「Queen of Hearts」,訓練目標是冠狀動脈阻塞型心肌梗塞(OMI)而非傳統 STEMI 判準。Timothy Henry 的話:「AI-EKG analysis has the potential to reduce false activation by up to fourfold.」
特異度 29% → 81% 這個跳幅在臨床 AI 文獻裡非常罕見,而且它指向一個被低估的事實:很多 AI 的價值不在抓出更多病人,而在停掉不必要的動作。假陽性心導管啟動每一次都是一組人半夜被叫起來、一間導管室被佔用、一個病人被推進侵入性流程 —— 這種成本從來不會出現在 AUC 裡。另一位研究者 Ivan Rokos 的話也值得記下來:「We as physicians are still ultimately responsible for the patient, but AI can certainly turbocharge and augment our abilities.」
這是回溯性登錄研究,不是前瞻比較,AI 是在已經被啟動的 1,032 個案例上回頭判讀,所以它沒有測到「AI 當第一線守門人會漏掉什麼」。報導與原始發表的時點是 2025 年 10 月(TCT 2025 大會),不是本週新聞;放進今天是為了對比上一則 AI-ECG 單獨使用 PPV 只有 30.6% 的結果 —— 同一個模態,用在不同決策點,數字可以差這麼多。此外 Powerful Medical 是該模型的商業開發者,登錄研究的資料來源與資助關係需回查原文。
三十年 1,430 件 AI 醫材核准裡,放射科拿走 1,094 件(76.5%),病理科 9 件,精神科 0 件
Kaiser Permanente 洛杉磯醫學中心的 Pouyan Golshani 等人在 Cureus(2026-07-13)盤點 1995–2025 年 FDA 的 AI/ML 醫材核准,AuntMinnie 的整理給出:總計 1,430 件,放射科 1,094 件(76.5%),加上心血管與神經科共佔 90.6%。而病理科只有 9 件、微生物 6 件、婦產科 4 件、精神與行為健康 0 件。速度也很懸殊:1995–2014 年平均每年 1.8 件,2023–2025 年平均每年 264 件,光 2025 一年就 331 件。廠商集中度上,740 家公司中有 502 家(67.8%)只拿到一件核准,而 13 家公司(1.8%)拿下 247 件(17.3%)。
這張分布圖解釋了為什麼本期的證據全長在影像與心臟上:法規通道三十年來只在「有像素、有訊號、有金標準」的科別鋪好了路。精神科 0 件不是因為沒人做,而是因為精神科缺一個能被 510(k) 接受的參照標準 —— 這也是為什麼心理健康 AI 大多以「非醫材」的消費品形式上市、繞過前市場審查。放射科 76.5% 同時意味著一件事:如果你是一家做非影像臨床 AI 的公司,你面對的不只是技術問題,而是一條還沒被走出來的路。
這是 7 月 13 日發表的文獻計量研究,不是本週新聞;而且「核准數」不是「臨床價值」的代理指標 —— 1,430 件裡絕大多數是 510(k) 實質等同,不需要前瞻臨床試驗。本日報只讀到 AuntMinnie 的二手整理,心血管與神經科各自的件數在該報導中未列出,故未引用。另有一份 Q3 季度回顧稱 FDA 已授權「超過 1,600 項」AI 醫材,與本則的 1,430 件統計窗口不同(後者僅計至 2025 年底),兩個數字不可混用。
81% 的醫師自己在用 AI,但 46% 不希望病人拿 AI 去解讀自己的放射報告、88% 擔心技能退化
美國醫學會(AMA)Center for Digital Health and AI 的 2026 Physician Survey on Augmented Intelligence,經 AuntMinnie(2026-03-12)整理:81% 的醫師已在執業中使用 AI(2023 年為 38%),超過 75% 認為 AI 改善了他們照顧病人的能力(2023 年 65%)。但問到病人端就翻轉:46% 表示「從不或很少」希望病人用 AI 解讀放射檢查結果,49% 對病理結果持同樣立場。另有 88% 擔心技能流失,86% 認為資料隱私是擴大採用的關鍵,88% 認為安全性與效能驗證是關鍵。
把 81% 和 46% 擺在一起,就看得到臨床 AI 下一階段的真正戰場不在模型,而在誰有權拿 AI 讀自己的片子。醫師接受 AI 當自己的副駕駛,但不接受 AI 當病人的副駕駛 —— 而病人端的 AI 判讀工具正在以消費品形式快速普及(前一則的精神科 0 件核准就是同一條路徑)。這個落差會在未來一兩年內變成門診裡的具體衝突,而不是學術爭論。88% 擔心技能退化這一項,則和今天 Prof. Valmed 那個「94 秒對 206 秒、準確率不變」的結果對得上:加速不等於增能。
這是 3 月 12 日的調查報導,不是本週新聞。更要緊的是:AuntMinnie 的報導未揭露樣本數與抽樣方法,AMA 的會員調查亦有自我選擇偏誤,因此「81%」這類數字應視為受訪醫師的自述比例,不是全美執業醫師的母體估計。「使用 AI」的定義範圍(是否含語音病歷、排程、計費)在該報導中也未界定。
02 — Product Analysis
Epic Deterioration Index (EDI)
內建於電子病歷的住院惡化風險分數 · Epic Systems(美國)
功能與定位。EDI 是直接長在 Epic 電子病歷裡的住院惡化風險分數,吃的是結構化生理數值、檢驗與護理評估,輸出 0–100 的分數,不是生成式模型、裡面沒有 LLM。它賣給誰?它不「賣」—— 它是 Epic 客戶已經有的東西,所以 RWJBarnabas 這次的介入成本幾乎只在流程改造,而不在採購。真正的產品創新是把分數的消費者從「護理站儀表板」換成「rapid response team 的呼叫器」。
- 優勢 :這是今年極少數掛得上死亡率的臨床 AI —— 11 家醫院、23,132 人次,高風險住院死亡率 23.1% → 18.6%,校正後 aOR 0.82(95% CI 0.74–0.91);而且 ICU 轉床沒有同比例增加,說明不是靠「把人都送進加護病房」換來的。
- 優勢 :零採購摩擦。它已經在數千家 Epic 客戶的系統裡,可複製性遠高於任何需要簽約、整合、驗證的新模型 —— 本期 ARISE 報告點出的「下一階段不會由更新的模型驅動」,講的就是這種東西。
- 疑慮 :導入後只有 46.6% 的住院真的跳出通知,所以我們其實不知道這套系統在「全量覆蓋」下會不會變成警報疲乏災難;而剛跨門檻那一段(EDI 55–59)aOR 0.86、95% CI 0.63–1.17,不顯著。
- 疑慮 :前後對照設計無法排除同期其他品質改善措施的貢獻,兩家醫院導入不完整、季節分布不均,作者自己把外推性標為不確定。缺的那個數據很明確:沒有隨機試驗。
AI Consult 2.0 (Penda Health, on GPT-4o)
嵌在電子病歷裡的基層臨床安全網 · Penda Health(肯亞)/OpenAI GPT-4o
功能與定位。AI Consult 不是 chatbot,而是接在 clinical officer 下診斷與開處方的動作上、對可能的錯誤即時提示的「安全網」層。它的使用者是基層的 clinical officer(在肯亞體系中非醫師的臨床執業人員),底層是 GPT-4o。它被設計成不打斷工作流、只在偵測到問題時出聲 —— 這個設計決策後來同時解釋了它的成功與失敗,詳見 Nature Medicine 的試驗報告。
- 優勢 :這是極少數敢做群集隨機試驗並把結果如實發表(含落空的主要指標)的 LLM 臨床產品,光這一點的可信度就高於絕大多數自評自測的醫療模型 —— 對照本站 10/01 那期談到的 MedQA 自測 100% 問題。
- 優勢 :次要指標是真的動了:診斷記載 aOR 1.74、完整病程記錄 aOR 1.68、治療計畫 aOR 1.71,抗生素成本每人降 0.15 美元,且病人滿意度未下降。在抗生素抗藥性是全球議題的脈絡下,用藥紀律本身就是可給付的價值。
- 疑慮 :主要指標落空,而且作者的措辭已經先把天花板封住了 —— 「any benefit, if present, is probably modest」。更麻煩的是 power 不足:二手整理指出要偵測更小的差異需要 10 萬名以上病人,意思是這類產品短期內拿不出「治療失敗下降」的證據,不是因為做不到,而是因為做不出來給你看。
- 疑慮 :被標記的輸出只有 49.4% 被評為「definitely safe」,1.1% 被判為不安全。把這個數字乘上今天另一則的發現 —— 資淺臨床人員只找出 15.8% 的 GPT-4o 幻覺 —— 「人會把錯的擋掉」這個假設在基層場景並不成立。
兩者的對比就是本期的論點。EDI 模型能力遠遜於 GPT-4o,卻掛得上死亡率,因為它的輸出被接到一支會移動的隊伍;AI Consult 模型能力遠勝,卻只動得了文件,因為它的輸出終點是一個正在忙的人的眼睛。臨床 AI 的瓶頸現在不在模型的上限,而在輸出之後那段路有沒有人走。
03 — Companies & Competition
| 公司 | 近況與數字 | 競爭定位與護城河 |
|---|---|---|
| Epic Systems 美國醫院電子病歷的事實標準 |
內建 EDI 在 RWJBarnabas 11 家醫院、23,132 人次的研究中對應到高風險住院死亡率 23.1% → 18.6%,校正後 aOR 0.82,NEJM AI DOI 10.1056/AIoa2500973;RRT 評估率 25.3% → 37.5%。 | 護城河是「已經在裡面」:不需採購、不需整合,臨床 AI 的分發權握在它手上。弱點是模型本身並不先進,一旦證據標準從「關聯」升到「隨機」,它沒有做試驗的習慣與誘因。 |
| Penda Health + OpenAI 肯亞基層診所網路 × 前沿模型 |
16 家診所、103 位 clinical officer、9,691 名病人的群集隨機試驗,主要指標 2.2% 對 2.0%、aOR 0.77、P = 0.13;文件品質 aOR 1.68–1.74,抗生素成本每人降 0.15 美元。 | 護城河是證據的誠實度與低資源場域的真實部署經驗 —— 這是 OpenAI 在醫療端最難被複製的資產。弱點是商業模式:文件品質與抗生素成本的改善很難在肯亞基層換成足以支撐 GPT-4o 推論成本的付費意願。 |
| UltraSight 即時 AI 導引心臟超音波取像 |
梅約 995 人前瞻研究中,9 名零經驗新手搭配 Philips Lumify 取像,AI-FoCUS 偵測 SHD 敏感度 90.1%、特異度 99.1%、PPV 95.4%(判讀由盲化專家執行)。 | 護城河是把超音波取像這項最依賴手感的技能商品化,並綁上 Philips 的手持硬體通路。弱點是它只解了取像、沒解判讀,所以賣的仍是「專家的前處理器」而非替代品 —— 在缺乏心臟專科的地區(包含台灣部分偏鄉),這個限制就是它的天花板。 |
| Powerful Medical PMcardio/Queen of Hearts,OMI 導向 AI 心電圖 |
三院 1,032 次 STEMI 啟動的回溯登錄:敏感度 92% 對 71%、特異度 81% 對 29%、AUC 0.94,生物標記陰性病人的假陽性心導管啟動 41.8% → 7.9%。 | 護城河是訓練標的選得不一樣:直接對準 OMI 而非傳統 STEMI 判準,因此抓到的是教科書判準會漏掉的那一群。弱點是回溯設計,以及它改善的主要是「省掉不必要的啟動」—— 這種價值在以處置量計酬的體系裡反而難賣。 |
| ARISE(Stanford × Harvard) 不賣產品,賣評估標準的那一方 |
首份年度報告指出 FDA 已放行超過 1,200 項 AI 醫材,而回顧的 500 多份研究中近 50% 用考試題、僅 5% 用真實病人資料;主張證據標準應轉向多輪非結構化資料與真實後果。 | 護城河是學術中立性與 Stanford/Harvard/BIDMC 的聯合背書 —— 在廠商自評自測成常態的市場裡,「誰定義什麼叫有效」本身就是一種權力。弱點是沒有強制力,也沒有公開完整方法學供逐篇覆核。 |
今天的競爭結構是一個「分發 vs. 證據」的交叉。握有分發權的(Epic)不需要證據就能部署,而拿得出最誠實證據的(Penda/OpenAI)沒有分發權;中間那一層(UltraSight、Powerful Medical)則都選擇只解一小段流程、把責任留給專家 —— 這在法規上安全,但也把天花板一起焊死了。
04 — Taiwan Angle
(1) 時程已經壓到年底,但這是「資料」的時程,不是「結果」的時程。衛福部長石崇良在 9 月 15 日為 10 月 7 日登場的生技論壇預告時指出,醫療 AI 的「首要工作是建立資料標準、治理制度及可信賴的使用環境」,並給出明確時間表:醫學中心的 FHIR 資料整備目標在 2026 年底,全國醫院串接在 2027 年底;政策工具包括五年 4,890 億元的「健康台灣深耕計畫」、四年 2,400 億元的「國家藥物韌性整備計畫」,以及規劃中 1,000 億元的創新醫材與新藥研發投資(經濟日報/聯合新聞網,2026-09-15)。對照今天 RWJBarnabas 的結果:他們沒有新資料、沒有新模型,只是把既有分數接到 rapid response team,就拿到 aOR 0.82。FHIR 串接是必要條件,但不是充分條件。
(2) 台灣已經有「負責任 AI 中心」這個制度骨架,但缺的是 RRT 那條線。衛福部在 2025 年已與十家醫院合作建立負責任 AI 執行中心,定位是「可信賴的智慧醫療守門人」(衛生福利部)。守門人這個隱喻恰好說明了問題:守門是「審核模型能不能進來」,而今天的證據全指向「模型進來之後,警示送給誰、誰會動」。ESTOP-AKI 的建議只有 41% 被完整採納、EDI 只有 46.6% 的住院跳通知 —— 台灣的醫學中心若把 AI 導入當成資訊室專案而非品質改善專案(QI),同一組落差會原封不動複製過來。
(3) 給付這一端,今天最可抄的其實是「省下來的檢查」而不是「抓出來的病人」。梅約那份研究的兩段式策略把影像使用量壓到 47%、代價是敏感度從 90.1% 掉到 77.0%(npj Digital Medicine);Powerful Medical 把假陽性心導管啟動從 41.8% 壓到 7.9%(TCTMD)。在健保總額制下,這種「減少不必要處置」的價值比「提高偵測率」更容易換算成給付論述 —— 但同時也更容易被誤用成壓縮檢查量的理由。那個從 90.1% 掉到 77.0% 的敏感度,就是這筆帳要先講清楚的代價。
05 — Further Reading
-
Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial — Nature Medicine (2026-06-26)
把摘要最後一句抄下來當尺:「LLM assistance was safe but did not reduce treatment failure within 14 days」。這是目前最乾淨的一次「前沿模型在真實診間」的隨機證據,值得整篇讀完方法學,特別是事件率低於預期導致 power 不足那一段。
-
State of Clinical AI Report 2026 — ARISE, Stanford–Harvard Research Network
讀它不是為了那 5%,而是為了「jagged frontier」這個框架:同一個模型在受控任務與真實變異之間的落差不是平滑的,是鋸齒狀的。這個框架會改變你怎麼看 benchmark。
-
AI & Digital Health: Quarterly Review 2026Q3 — micheledpierri.com (2026-10-02)
本期最新的一份文件,也是唯一把 Q3 的試驗、基礎模型與法規動作並排算完的整理。注意它把 ESTOP-AKI 的 41% 採納率與 ALLIANCE 的「快但沒更準」放在同一節 —— 這個編排本身就是論點。
-
Advancing conversational diagnostic AI with multimodal reasoning — Nature Medicine (2026-05-14)
多模態 AMIE 在 105 次模擬遠距門診中於 32 項評分軸的 29 項勝過基層醫師 —— 然後作者自己標明這不是臨床試驗、聊天介面沒有理學檢查、且可能有預訓練資料洩漏。把這篇和本期第二則對讀,就能看懂「OSCE 贏」與「隨機試驗沒贏」之間那道鴻溝。
-
An agentic system for rare disease diagnosis with traceable reasoning (DeepRare) — Nature, vol 651, 775–784 (2026)
罕病診斷是「AI 應該真的有優勢」的少數場景:盛行率低於 1/2,000、臨床醫師本來就連不起來那些模式、而且診斷延遲動輒五年以上。重點讀它的 traceable reasoning 設計 —— 把推論鏈綁回醫學證據,是本期唯一正面處理「人要怎麼查 AI」的做法。
06 — References
- Artificial intelligence (AI)-triggered rapid response notifications were associated with lower mortality among inpatients. 2 Minute Medicine, 2026-10-02. 2minutemedicine.com
- RWJBarnabas Links Real-Time Epic EDI Alerts Directly to Rapid Response Teams (NEJM AI, DOI 10.1056/AIoa2500973). HIT Consultant, 2026-07-29. hitconsultant.net
- AI-enabled tool helps identify hospitalized patients at risk of rapid clinical decline. News-Medical, 2026-07-29. news-medical.net
- RWJBarnabas Health Sees Improvements Using Epic Deterioration Index. Healthcare Innovation, 2026-07. hcinnovationgroup.com
- AI tool helps detect patient deterioration earlier, reducing hospital deaths. Medical Xpress, 2026-07. medicalxpress.com
- Agweyu A, Mwaniki P, Menon V, et al. Generative AI-enabled clinical decision support system in primary care: a pragmatic, cluster-randomized trial. Nature Medicine, online 2026-06-26, print 2026-08. nature.com
- PubMed record 42362867 (full abstract, Nature Medicine). PubMed / Europe PMC, 2026. pubmed.ncbi.nlm.nih.gov
- AI clinical support tool improved clinician decisions in real-world primary care trial. University of Birmingham, 2026. birmingham.ac.uk
- Generative AI Clinical Decision Support Shows Safety and Documentation Gains But No Significant Reduction in Treatment Failure in Kenyan Primary Care Trial. MedPath, 2026. trial.medpath.com
- AI & Digital Health: Quarterly Review 2026Q3. micheledpierri.com, 2026-10-02. micheledpierri.com
- News: AI tool quicker, not more accurate than humans when diagnosing rheum disease, study finds (medRxiv, 2026-08-29). ACDIS, 2026-09-10. acdis.org
- Brodeur P, Goh E, Rodman A, Chen JH. State of Clinical AI Report 2026. ARISE (Stanford–Harvard Research Network), 2026. arise-ai.org
- Clinical AI Has Boomed. A New Stanford-Harvard State of Clinical AI Report Shows What Holds Up in Practice. Stanford Medicine, 2026-01-15. medicine.stanford.edu
- Killalea MM, Borgeson J, Bird JG, et al. Improving structural heart disease screening: AI-ECG and novice AI-guided focused cardiac ultrasound. npj Digital Medicine 9:712, 2026-06-09. nature.com
- AI-ECG Finds STEMI Faster, Cuts False-Positive Cath Lab Activations (Queen of Hearts US Registry; JACC: Cardiovascular Interventions). TCTMD, 2025-10-31. tctmd.com
- Queen of Hearts: AI ECG for STEMI & OMI. Powerful Medical. powerfulmedical.com
- Radiology dominates thirty years of FDA AI device approvals (Golshani P, et al. Cureus, 2026-07-13). AuntMinnie, 2026-07-16. auntminnie.com
- Physicians mixed on patient use of AI to interpret radiology results (AMA 2026 Physician Survey on Augmented Intelligence). AuntMinnie, 2026-03-12. auntminnie.com
- Advancing conversational diagnostic AI with multimodal reasoning. Nature Medicine, 2026-05-14. nature.com
- Zhao et al. An agentic system for rare disease diagnosis with traceable reasoning (DeepRare). Nature 651:775–784, 2026. nature.com
- AI succeeds in diagnosing rare diseases (News & Views). Nature, 2026-02-18. nature.com
- 生技論壇10月7日登場 衛福部長石崇良:積極建構AI醫療基建. 經濟日報/聯合新聞網, 2026-09-15. udn.com
- 醫療AI要聰明,還要能負責!十家醫院打造可信賴的智慧醫療守門人. 衛生福利部, 2025. mohw.gov.tw
- General-purpose large language models outperform specialized clinical AI tools on medical benchmarks. Nature Medicine, 2026. nature.com
- Registered AI Medical-Imaging Clinical Trials on ClinicalTrials.gov: Publication Yield, Predictors, and Portfolio Evolution. Academic Radiology, 2026 (abstract not retrievable; see editor's note). academicradiology.org