醫療 AI 的臨床證據這一週全部指向同一件事——模型準不準已經不是瓶頸:Rambam 的急診 LLM 有 99/100 份輸出被評為臨床合適,醫師使用率卻在四週內從 68% 掉到 30%;AI 預測出院日在入院當天贏過個管師、在出院前 24 小時輸掉兩倍;而史丹佛用 37,000 個 AI 代理設計出的 CD276 抗體藥物複合體,被 Merck 獨立做出同一個設計並拿到 FDA 突破性療法認定
把這一週進到臨床證據圈的研究排在一起看,會發現它們在講同一件事的不同面向。Nature Medicine 上那份以色列 Rambam 醫學中心的急診 LLM 前瞻試驗,把 1,138 位病人分到兩個平行的急診區,專家覆核抽樣的 100 份輸出中有 99 份被評為「臨床合適」、零不良事件——然後醫師的使用率在四週內從 68% 掉到 30%,每多一小時班內工作量,使用的勝算比就掉到 0.72;住院天數兩邊都是 4.9 小時,P = 0.99。作者自己的結論是:瓶頸是「持續的臨床參與」,不是演算法準確度,而現有證據還不支持上線。JAMA Network Open 用 22,349 次住院給出另一半答案:AI 預測出院日在入院當天小勝個管師(平均絕對誤差 4.20 天對 4.27 天),但到出院前 24 小時就輸成 1.93 天對 0.98 天——它贏在預測最沒用的時候。NEJM AI 則提醒,這些討論的前提甚至還沒站穩:一個病人端的 RAG 聊天機器人,被人只用瀏覽器開發者工具就抓走了系統提示、檢索設定、後端端點,還有最近 1,000 筆病人對話,全程不需要任何認證(arXiv:2605.00796)。唯一朝反方向走的大消息,是史丹佛 James Zou 實驗室那套 37,000 個代理的「虛擬生技公司」:它設計出一個針對 CD276 的肺癌抗體藥物複合體,幾個月後 Merck 獨立做出同一個設計,並拿到 FDA 突破性療法認定(Stanford Medicine, 2026-09-17)。
01 — Top Stories
急診 LLM 的第一個前瞻對照評估:輸出幾乎全部合格,醫師卻在四週內不用了
以色列 Rambam Health Care Campus(合作單位包括 Technion 與 Mayo Clinic)把一套名為 SHAKED 的 LLM 臨床決策支援系統,放進兩個平行運作的急診區之一,另一區維持標準流程,為期四週、共分析 1,138 位病人(584 位分到介入區),並按 DECIDE-AI stage 1 的規格報告。結果:專家覆核抽樣的 100 份輸出中 99 份被評為臨床合適、未偵測到不良事件;但臨床採用率從 68% 降到 30%,主因是工作量造成的脫離(每多一小時班內時數,使用勝算比 OR = 0.72);醫師唯一明顯偏好的用途是放射科會診(OR = 2.98)。住院天數兩區都是 4.9 小時(P = 0.99),會診週期縮短 9.4 分鐘但未達顯著(P = 0.077)。Nature Medicine, 2026-08-19/PubMed 42618632
這是醫療 AI 少見的「幾乎所有東西都做對了、結果還是不能上線」案例,而且不能上線的理由不在模型。過去兩年醫療 AI 的論證方式是拿 benchmark 分數推論臨床價值;這份試驗把中間那一段攤開來:即使輸出品質接近滿分,只要臨床工作量一上來,使用率就會塌,而使用率一塌,任何下游指標(住院天數、會診效率)都會被稀釋到測不出來。作者的措辭很直白——瓶頸是持續的臨床參與,而不是演算法準確度。這對採購方的意義是:demo 的準確率再高,也不能替代「第三週還有多少人在用」這個數字。
單一中心、四週、DECIDE-AI stage 1 本身就是明確標示為早期階段的設計,不是隨機分派的療效試驗;住院天數與會診週期都是次級指標,樣本量不足以偵測小幅效果,「P = 0.99」不等於「確定無效」。99/100 的合適率來自抽樣專家覆核,不是全量稽核。
37,000 個 AI 代理設計出的肺癌 ADC,Merck 獨立做出同一個設計並拿到 FDA 突破性療法認定
史丹佛生醫資料科學副教授 James Zou 的團隊把一間製藥公司的組織結構搬進多代理系統:靶點發現、分子設計、臨床試驗各成一個部門,由一個「AI 首席科學官」代理統籌,臨床試驗部門本身就有 約 37,000 個代理,底層搭一個叫 Paperclip 的 AI 原生資料平台(團隊稱可把時間與成本壓低「超過一個數量級」)。產出之一是針對 CD276 的肺癌抗體藥物複合體(ADC);數個月後 Merck 獨立開發並驗證了同一個治療設計,該設計隨後取得 FDA 突破性療法認定。團隊另外報告,以單細胞特徵挑出的靶點「上市機率約高出 50%」。Stanford Medicine, 2026-09-17/VentureBeat/Nature 新聞特寫
AI 藥物發現最難的不是產生假說,是證明假說不是幻覺。這件事之所以值得單獨拿出來講,全部的份量都押在「Merck 獨立收斂到同一個設計」這一句上——那是一個由人類團隊、用完全不同的流程、在不知道對照組存在的情況下產生的外部驗證,而且後續被監管機關以突破性療法認定背書。相對地,37,000 這個數字本身不是證據,它是算力與編排規模的描述。把這兩件事分開看,才不會把一次收斂讀成一套方法學的普遍效力。
系統的絕大多數預測沒有實驗驗證;Merck 的收斂是回溯性的、n = 1,不能當成命中率。「上市機率高出 50%」是在歷史靶點上的回溯關聯,不是前瞻結果。主要文獻以 bioRxiv 預印本形式流通,Science 的版本本報未能直接取得全文,數字以史丹佛官方新聞與二手報導為準。
一個病人端 RAG 聊天機器人,用瀏覽器開發者工具就交出後端設定與最近 1,000 筆病人對話
Alfredo Madrid-García 與 Miguel Rujas 對一個(匿名處理的)實際上線的病人端醫療聊天機器人做兩階段測試:先用 Claude Opus 4.6 做初步探測,再用 Chrome 開發者工具人工檢視網路流量與儲存內容。取得的東西包括系統提示、模型與 embedding 設定、檢索參數、後端端點、API schema、知識庫內容,以及最近 1,000 筆病人與聊天機器人的完整對話紀錄——全程不需要任何認證,與該服務對外的隱私聲明相矛盾。根本原因是敏感設定經由前後端通訊外露,而非限制在伺服器端。這份案例研究本週由 NEJM AI 的評論文章〈When the Chatbot Leaks〉帶進臨床社群,原始報告見 arXiv:2605.00796(2026-05-01),並經 Duke AI Health 2026-09-25 週報轉載。
這不是一個需要資安專家才做得出來的攻擊,作者刻意強調「不需要專業技能」——能被稽核者用瀏覽器做到的事,也能被任何人做到。對正在把 RAG 問答放上官網、LINE 官方帳號或病人 app 的醫療機構,這份報告等於一張當天就能自己跑一遍的檢查清單:系統提示與檢索設定是否在前端可見、對話紀錄的端點是否要認證。而且它戳破了醫療 AI 討論裡一個常見的順序錯誤——我們在爭論模型的診斷準確度,但很多部署連「病人對話不會被外人讀到」這一層都還沒做到。
單一、匿名化的部署,廠商未具名,因此外界無法查證是否已修補,也無法據此推估同類產品的普遍失效率。NEJM AI 該篇為評論體例而非原始研究,本報未能直接取得該頁全文,技術細節以 arXiv 原始報告為準。
I3LUNG:可解釋 AI 把醫師的疾病控制預測從 57% 拉到 65%,但一做外部驗證就掉了,加影像與病理也沒用
Nature Medicine 刊出 I3LUNG 計畫的臨床可用性研究,涵蓋六個國際中心、2,396 位接受免疫治療的晚期非小細胞肺癌(NSCLC)病人;20 位醫師在 200 次評估中使用一個以臨床與血液指標為基礎的可解釋決策支援工具,疾病控制預測準確率從 57% 提升到 65%。但研究同時報告兩個負面結果:模型在外部驗證時表現轉弱,而加入影像或病理資料的多模態版本並未穩定複製增益。Nature Medicine, 2026-09-13
八個百分點的絕對提升,發生在「醫師要不要繼續打免疫治療」這種真的會改變處置的問題上,這是少見有臨床意義的人機協作數字。但這篇更值得看的是它敢把兩個負面結果寫進同一篇:多模態不一定更好、外部驗證會掉。過去兩年醫療 AI 的主流敘事是「模態越多越強」,I3LUNG 用同一群病人告訴你,在這個任務上便宜的臨床與血液變數已經吃掉大部分訊號,而昂貴的影像與病理模態並沒有穩定地再加上去。這對正在規劃多模態基礎模型投資的醫院是很實際的成本訊息。
AI 預測出院日:入院當天小勝個管師,離出院越近輸得越多
一份單中心品質改善研究比較 AI 工具與個案管理師(case manager)對出院日的預測,涵蓋 22,349 次住院、17,173 位病人。平均絕對誤差:入院當時 AI 4.20 天對個管師 4.27 天(AI 小勝);出院前 48 小時 1.59 對 1.29(AI 落後);出院前 24 小時 1.93 對 0.98(AI 誤差接近兩倍)。JAMA Network Open, 2026-09-03
出院日預測是床位調度、住院管理、出院準備服務的骨幹,而這份研究的形狀很有啟發性:AI 贏在資訊最少、預測也最沒有行動價值的時點;人類贏在資訊足夠、預測真的要拿來排床的時點。原因不難猜——個管師掌握的是模型看不到的東西(家屬什麼時候能來、長照床位有沒有空、主治醫師的習慣)。這也解釋了為什麼很多「AI 提升營運效率」的專案在導入後找不到效益:它改善的那一段誤差,本來就不是決策瓶頸。要用這類工具,應該把它定位成入院當天的粗估與資源預警,不是出院前的排程依據。
單中心、品質改善研究設計,不能外推到不同的病種組合與照護流程;個管師的預測本身可能受到自我實現效應影響(他們預測完也參與安排出院)。本報未能直接取得該篇全文,數字引自 9 月證據彙編的轉述。
胸部 CT 上「順手」量的 AI 骨密度,預測了往後的腦白質病變與認知退化,糖尿病族群尤其明顯
Johns Hopkins 放射科主導的 Radiology 研究,以前瞻世代 MESA(Multi-Ethnic Study of Atherosclerosis)做次級分析:用深度學習在非增強胸部 CT 上「順手」量出脊椎骨密度(vBMD),再對上後續的認知測驗與腦部 MRI。樣本為 715 位(CT 加認知測驗)與 405 位(腦部 MRI),中位年齡 69 歲。結果:基線 vBMD 每低 0.1 g/cm³,年度認知退化快 0.025 個標準差;胼胝體的白質高信號(WMH)年增 12.8%;內囊前肢的分數異向性年降 0.0048 個標準差;糖尿病族群的整體 WMH 累積約快 5%。Diagnostic Imaging, 2026-09-23(作者訪談見 同站 9/25 專訪)
「順手診斷」(opportunistic screening)是醫療 AI 裡商業模式最乾淨的一類:掃描已經做了、輻射已經吃了、費用已經付了,AI 的邊際成本只是跑一次模型,卻多產出一個風險分層變數。這份研究把這個邏輯延伸到跨器官——胸部的骨頭訊號指向腦部的老化軌跡——如果站得住,它意味著每一張已經存在的胸部 CT 都是一份尚未讀取的腦健康風險資料。這也是少見不需要說服醫師改變行為就能產生價值的 AI 應用,剛好和今天前面幾則「醫師不用就沒效」的結果形成對照。
這是關聯,不是因果,而且是在一個並非為此設計的世代研究上做次級分析;絕對效果量很小(0.025 個標準差/年),臨床可用的門檻仍待前瞻驗證。腦部 MRI 子樣本只有 405 人,糖尿病亞群更小,5% 這個差異的信賴區間未在本報引用的二手報導中呈現。本報未能直接取得 Radiology 原文,數字引自 Diagnostic Imaging 的報導。
前沿模型在醫療 benchmark 上的分數,經不起最簡單的對抗測試——把關鍵影像拿掉,它照樣答對
Microsoft Research Health & Life Sciences(Yu Gu、Jingjing Fu、Xiaodong Liu 等 32 位作者)在 Nature Medicine 上對 GPT-5、Gemini、Claude 3.5 Sonnet、GPT-4o、DeepSeek-VL2、Qwen3-VL、LLaVA-Med、MedGemma 做系統性對抗壓力測試,資料集涵蓋 VQA-RAD、OmniMedVQA、MIMIC-CXR-VQA、PathVQA、SLAKE 與 MMMU。核心發現:模型在關鍵視覺資訊被移除後仍能猜對答案、提示詞的微小改動就造成表現下滑、並會產生看起來有說服力但推理有誤的解釋鏈;研究同時指出熱門健康 benchmark 之間「到底在量什麼」差異極大。Nature Medicine, 2026-06-26
「拿掉影像還答對」是一個特別難反駁的證據:它直接證明分數的一部分來自題目本身的統計線索,而不是讀影像的能力。這件事在監管上正好落在關鍵時點——FDA 還沒有成形的 AI benchmarking 指引,而市場上已經有大量以 benchmark 分數為主要臨床論據的產品說明書。研究結論很難聽但很有用:benchmark 成功與臨床部署所需的證據之間,落差大到不能互相替代。要驗一個醫療多模態模型,該做的是消融測試(把該看的資訊拿掉,看它還敢不敢答),不是再刷一輪排行榜。
這是 benchmark 層級的研究,不涉及真實臨床工作流程,因此不能直接推論某個已上市器材的臨床安全性;Microsoft 同時是其中部分受測模型的商業合作方,利益關係應納入閱讀。受測的 Claude 版本為 3.5 Sonnet,已非該系列最新,跨代比較需謹慎。
誰有能力驗證 AI,本身正在變成一種基礎建設:北卡州鄉村醫院 AI 評估網路,與全美第一張 Joint Commission AI 認證
UNC Health、Duke Health 與北卡州合作單位成立全州級網路,協助鄉村與關鍵取得(critical access)醫療機構評估並導入 AI 工具,由 The Duke Endowment 資助三年 440 萬美元(UNC, 2026-09-22)。同一週,Hackensack Meridian Health 取得全美第一張 Joint Commission 的 AI 認證,審查範圍包含 AI 盤點清冊、風險評估、上線後監測與病人資料保護(TechTarget,經 HIStalk 2026-09-23 整理)。
今天前面六則研究共同指出一件事:醫療 AI 的價值高度依賴在地部署條件(工作量、流程、人員習慣),因此不可能靠廠商的多中心試驗一次交付。這就產生一個結構性問題——有醫學中心規模的機構可以自己跑 DECIDE-AI 式的前瞻評估,鄉村醫院不行,而它們面對的正是最容易被 AI 話術說服的處境。北卡這個網路和 Joint Commission 的認證,是對同一個缺口的兩種補法:一種補「誰幫你驗」,一種補「驗過的標準是什麼」。值得注意的是,這兩件事都不是 FDA 做的——治理層在監管明文之外先長出來了。
Joint Commission 的 AI 認證審查的是流程與治理,不是產品療效,取得認證不代表該機構使用的任何 AI 工具有臨床效益證據。440 萬美元分三年、覆蓋全州鄉村機構,規模相對於需求很小,目前也沒有公布任何成效指標。
02 — Product Analysis
SHAKED
急診 LLM 臨床決策支援 · Rambam Health Care Campus(以色列)自建,合作 Technion 與 Mayo Clinic
功能與定位。在急診情境中,就病人當下的資料提供處置與會診建議;不是商業產品,而是院內自建、為了被嚴格評估而建的系統。它的獨特之處在評估設計:兩個平行急診區、一區用一區不用,按 DECIDE-AI stage 1 規格報告 1,138 位病人的結果——這是幾乎沒有商業廠商做得到的對照條件,因為沒有醫院願意為了驗證而把自家急診切成兩半。
- 優勢 :安全面的數字很硬——專家覆核抽樣 100 份輸出中 99 份被評為臨床合適、零不良事件,而且是在真實病人、真實班表下取得,不是回溯資料集(Nature Medicine)。
- 疑慮 :採用率四週內 68% → 30%(OR = 0.72/班內每小時)意味著任何下游效益都被稀釋到測不出來——住院天數兩區都是 4.9 小時(P = 0.99)、會診週期 −9.4 分鐘未達顯著(P = 0.077)。缺的數據要直說:完全沒有診斷正確率、再入院率或死亡率的比較,作者自己也寫下現有證據不支持上線。
- 可借用的地方 :那條採用率曲線本身就是可交付物。任何要導入臨床 AI 的機構都該把「使用率對班內工作量的迴歸」列為必收指標——它比準確率更早告訴你這個工具會不會活過第一季。
PRISM2
切片層級多模態病理基礎模型 · Tempus(美國),資料來自 Memorial Sloan Kettering 等機構
功能與定位。以 230 萬張全切片影像(WSI)與從 70 萬份病理報告衍生的 1,400 萬組問答對訓練,覆蓋 685,507 件檢體、200,692 位病人;46 億參數,Perceiver 切片編碼器接 Phi-3 Mini 語言模型,設計上分出「基礎 embedding」(供遷移學習)與「診斷 embedding」(供臨床任務)兩套表徵。Nature Medicine, 2026-07-31(vol 32, 3203–3213)
- 優勢 :泛癌症偵測 AUC 0.967(診斷 embedding),對比前代 PRISM 的 0.947 與 TITAN 的 0.931;在前列腺、乳房與乳房淋巴結偵測上以提示式推論達到或超越臨床級商品(P < 0.05);大腸癌無復發存活預測 C-index 0.809,勝過專門的存活模型 0.773。提示式推論意味著新任務不必逐項標註資料(Nature Medicine)。
- 疑慮 :完全沒有前瞻臨床試驗——所有「達到或超越臨床級商品」的比較都是回溯性的,而今天第七則那份 Microsoft 對抗測試正好是對這種讀法的警告:把關鍵資訊拿掉模型照樣答對,AUC 因此不能當部署論據。另一層疑慮在資料集中度:核心訓練資料來自 MSK 體系,外部機構的分布偏移未在本報可見的摘要中量化。
- 要問廠商的問題 :診斷 embedding 與基礎 embedding 的雙軌設計,實務上等於承認同一個模型在不同任務上不能共用表徵;那麼上線後的監測要監哪一套、漂移怎麼判定,這件事目前沒有公開答案。
03 — Companies & Competition
| 公司/機構 | 近況與數字 | 競爭定位與護城河 |
|---|---|---|
| Tempus 精準醫療資料與病理基礎模型 |
PRISM2 以 230 萬張 WSI、1,400 萬組問答對、46 億參數發表於 Nature Medicine,泛癌症 AUC 0.967、大腸癌 RFS C-index 0.809;共同作者橫跨 Tempus 與 Memorial Sloan Kettering(Nature Medicine, 2026-07-31)。 | 護城河是「切片+報告+臨床結果」三者配對的規模,這在學界幾乎複製不了。薄的地方是沒有前瞻試驗,而且和 Paige、PathAI 一系的競爭者共享極相近的資料血統——一旦 MSK 級資料不再獨家,優勢就回到通路。 |
| Artera 數位病理風險分層,已取得 FDA 許可 |
ArteraAI Breast 取得 FDA 許可,為首個以數位病理做乳癌風險分層的工具,適用於早期 HR+/HER2− 病人、輸出遠端轉移風險分數,可在標準病理流程內當日出結果、不需額外取檢體;支持資料來自 2025 年 San Antonio Breast Cancer Symposium(ITN, 2026-05-06)。 | 護城河是真的拿到許可、而且嵌在既有流程裡(不需改變取檢體行為)——這正是今天第一則試驗指出的關鍵:不要求醫師改變行為的工具才活得下來。薄的地方是預後(prognostic)不等於能預測治療效益,要進到指引層級仍需隨機證據。 |
| Stanford/James Zou 實驗室 多代理藥物發現(學界,非公司) |
Virtual Biotech 以約 37,000 個代理運作,設計出的 CD276 肺癌 ADC 被 Merck 獨立做出同一設計並取得 FDA 突破性療法認定;底層 Paperclip 平台稱可把時間與成本降低超過一個數量級(Stanford Medicine, 2026-09-17)。 | 護城河是編排方法與 AI 原生資料基礎設施,而非任何單一模型——這也意味著它很容易被大藥廠直接內部複製。薄的地方是絕大多數輸出沒有濕實驗驗證,目前唯一硬證據是一次 n = 1 的外部收斂。 |
| Microsoft Research Health & Life Sciences 評估方法學,實質上的裁判位置 |
在 Nature Medicine 對 GPT-5、Gemini、Claude 3.5 Sonnet、MedGemma 等八個模型做對抗壓力測試,指出移除關鍵影像後模型仍能答對、提示微調即掉分(Nature Medicine, 2026-06-26)。 | 護城河是議程設定權:在 FDA 的 AI benchmarking 指引成形之前,誰定義了「有效的評估」,誰就間接定義了誰能通過。薄的地方是明顯的利益衝突——它同時是部分受測模型的商業夥伴。 |
| Rambam · Technion · Mayo Clinic 院內自建 CDS 與前瞻評估能力 |
SHAKED 完成 1,138 位病人、兩個平行急診區、四週的 DECIDE-AI stage 1 評估,並主動公布採用率 68% → 30% 的負面結果(Nature Medicine, 2026-08-19)。 | 護城河是廠商買不到的東西:把自家急診切成兩半做對照的權限,以及公布負面結果不會傷害股價的自由。薄的地方是沒有商業化路徑,好的評估方法不會自動變成產品。 |
| The Joint Commission 醫療品質認證機構,新增 AI 認證 |
向 Hackensack Meridian Health 發出全美第一張 AI 認證,審查 AI 盤點、風險評估、監測與病人資料保護(TechTarget/HIStalk, 2026-09-23)。 | 護城河是既有的認證通路:醫院本來就要被它評鑑,AI 只是多一個章節,導入成本遠低於新設監管。薄的地方也在這裡——它審流程不審療效,容易被當成品質背書誤用。 |
把這一節收束成一句話:今天的競爭不是模型對模型,是「誰生產得出可部署等級的證據」對「誰只生產得出 AUC」。右邊那一欄人很多、資本很密集;左邊那一欄目前幾乎只有能把自家急診切成兩半的學術醫學中心,而他們沒有商業動機把方法變成產品。這個錯配是醫療 AI 現在最結構性的缺口,也正是 Joint Commission 與北卡州網路那類「第三方驗證基礎建設」開始長出來的原因。
04 — Taiwan Angle
(1) 台灣的 AI-SaMD 查驗登記能證明「準不準」,但證不了「第三週還有多少人在用」。食藥署已成立智慧醫療器材專案辦公室並營運智慧醫療器材資訊暨媒合平台,臺北榮總也提供AI-SaMD 產品臨床試驗服務,制度端的登記路徑其實相對完整。但 Rambam 那份試驗指出的決定性變數——採用率隨班內工作量塌陷(OR = 0.72/小時)——不在任何查驗登記卷宗的必填欄位裡。對台灣醫院而言,這意味著導入評估的收案設計要多一項:不只量準確率,還要量第 1 週、第 4 週、第 12 週的實際使用率,以及它對班別忙碌程度的迴歸。這個數字便宜、可自己收,而且比廠商任何多中心數據都更能預測這筆採購會不會變成閒置授權。
(2) 那份聊天機器人洩漏報告,對台灣醫院的 LINE 官方帳號問答是即刻適用的警告。研究者取得的是後端設定加最近 1,000 筆完整病人對話,工具只有瀏覽器開發者工具與一個商用 LLM,全程不需認證(arXiv:2605.00796)。台灣許多醫療機構的衛教與候診問答建在 LINE 官方帳號或院網前端,而病人在這類對話裡吐露的是病史與症狀——在個人資料保護法下屬於病歷與健康檢查一類的特種個資,處理限制明顯高於一般個資。可以今天就做的兩件事:用開發者工具看一次自家問答的網路請求,確認系統提示與檢索設定沒有出現在前端;以及確認對話紀錄的查詢端點需要認證、而且不接受可預測的序號參數。這不需要資安團隊,只需要有人願意按 F12。
(3) 「順手診斷」是台灣最容易論證給付價值的一類醫療 AI,因為掃描已經做完了。Johns Hopkins 那份研究的商業邏輯在台灣特別成立:健保體系每年已經產生大量非增強胸部 CT(含低劑量肺癌篩檢),而行政院對 AI 醫療影像的政策說明也早把影像列為重點。關鍵是:邊際成本只是跑一次模型,不多一次掃描、不多一次輻射、不多一次掛號——這是少數可以用「同一筆檢查產出第二個臨床變數」來談成本效益的場景,也是給付談判裡最好講的一種故事。要注意的限制同樣清楚:MESA 世代的族群組成與台灣不同(樣本 715 人、中位年齡 69 歲),效果量小,直接沿用門檻值並不安全,本地重跑一次關聯分析是必要前提。
05 — Further Reading
-
Prospective evaluation of a large language model clinical decision support system in the emergency department — Nature Medicine (2026-08-19)
今天最該完整讀的一篇。看的重點不是準確率,是那條從 68% 掉到 30% 的採用率曲線,以及作者怎麼把「醫師不用了」寫成主要發現而不是限制。
-
How a team of AIs discovered a promising lung-cancer drug — Nature (2026-09)
新聞特寫,但它把「Merck 獨立收斂」為什麼是這整件事唯一算得上證據的部分講清楚了,正好用來校正被 37,000 這個數字帶走的注意力。
-
When RAG Chatbots Expose Their Backend: An Anonymized Case Study of Privacy and Security Risks in Patient-Facing Medical AI — arXiv:2605.00796 (2026-05-01)
當成檢查清單讀,不是當成論文讀。它列出的每一項外洩都對應一個你今天下午就能在自家系統上驗證的檢查動作。
-
Evaluating the robustness and readiness of large frontier models in health AI applications — Nature Medicine (2026-06-26)
在 FDA 的 benchmarking 指引落地之前,這篇是目前最完整的「為什麼 benchmark 分數不能當部署論據」。消融測試那一節可以直接抄進採購技術規格。
-
Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy: a multicentre, observational study — The Lancet Gastroenterology & Hepatology
今天這一期反覆在講「醫師不用就沒效」;這篇講的是同一個問題的反面——醫師一直用之後,不用 AI 時的能力會不會退化。兩篇一起讀才看得到完整的取捨。
06 — References
- Prospective evaluation of a large language model clinical decision support system in the emergency department. Nature Medicine, 2026-08-19. nature.com · PubMed 42618632
- Virtual biotech company puts thousands of AI scientist agents to work on drug discovery. Stanford Medicine News, 2026-09-17. med.stanford.edu
- How a team of AIs discovered a promising lung-cancer drug. Nature (news feature), 2026-09. nature.com
- The Virtual Biotech: A multi-agent AI framework for therapeutic discovery and development. Science, 2026. science.org · preprint: bioRxiv
- Stanford is running 37,000 AI agents as a virtual biotech — and one of its drug designs got independently confirmed by Merck. VentureBeat, 2026. venturebeat.com
- Virtual Biotech Company Puts 37,000 AI Agents to Work on Drug Discovery. Singularity Hub, 2026-09-18. singularityhub.com
- When the Chatbot Leaks: Securing Patient-Facing Medical AI in the Age of Dual-Use Large Language Models. NEJM AI, 2026. ai.nejm.org
- Madrid-García A, Rujas M. When RAG Chatbots Expose Their Backend: An Anonymized Case Study of Privacy and Security Risks in Patient-Facing Medical AI. arXiv:2605.00796, 2026-05-01. arxiv.org
- AI Health Roundup — September 25, 2026. Duke AI Health, 2026-09-25. aihealth.duke.edu
- Clinical usability of an explainable AI decision support tool and evaluation of multimodal models in NSCLC (I3LUNG). Nature Medicine, 2026-09-13. nature.com
- Comparison of an AI tool and case managers for inpatient discharge-date prediction. JAMA Network Open, 2026-09-03. jamanetwork.com
- Healthcare AI News and Regulation: September 2026 Evidence Briefing. Veroscribe, 2026-09. veroscribe.com
- September 2026 healthcare AI briefing separates evidence from vendor announcements. Complete AI Training, 2026-09. completeaitraining.com
- Study: AI BMD assessment on chest CT linked to faster cognitive decline and white matter changes on brain MRI (Radiology). Diagnostic Imaging, 2026-09-23. diagnosticimaging.com
- New CT/MRI research may reveal links between bone loss, diabetes and cognitive decline (interview with Dr. Shadpour Demehri). Diagnostic Imaging, 2026-09-25. diagnosticimaging.com
- Advances in AI — September 2026. Diagnostic Imaging, 2026-09. diagnosticimaging.com
- Gu Y, Fu J, Liu X, et al. Evaluating the robustness and readiness of large frontier models in health AI applications. Nature Medicine, 2026-06-26. nature.com
- Vorontsov E, Shaikovski G, Liu S, et al. End-to-end multimodal pathology foundation model with clinical dialogue (PRISM2). Nature Medicine 32:3203–3213, 2026-07-31. nature.com
- FDA Clears AI Digital Pathology Tool in Breast Cancer (ArteraAI Breast). Imaging Technology News, 2026-05-06. itnonline.com
- Statewide network launches to help rural and critical access providers harness AI for better patient care. UNC, 2026-09-22. unc.edu
- Inside Hackensack Meridian's first-in-nation Joint Commission AI certification. TechTarget, 2026-09. techtarget.com
- Healthcare AI News 9/23/26. HIStalk, 2026-09-23. histalk2.com
- Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy: a multicentre, observational study. The Lancet Gastroenterology & Hepatology. thelancet.com
- 食品藥物管理署智慧醫療器材專案辦公室成立. 衛生福利部. mohw.gov.tw
- 智慧醫療器材資訊暨媒合平台. 衛生福利部食品藥物管理署. aimd.fda.gov.tw
- AI-SaMD 產品臨床試驗服務. 臺北榮民總醫院人工智慧中心. vghtpe.gov.tw
- AI 在醫療影像之應用(院會議案). 行政院. ey.gov.tw