這一週臨床 AI 交出兩份漂亮的成績單——146 種腹部 CT 發現 AUC 0.913、每 18 張腦部 CT 多救回一個大血管阻塞——同一週另外三份研究說,我們判斷它何時出錯的能力完全沒跟上:汙名字眼讓檢傷降級 9.4%、12 位判讀者只有 3 位察覺影像是合成的、229 個數位健康試驗裡 73% 由開發者自己做
本週臨床線有一個少見的結構:能力面與校準面同時出現硬數據,而且方向相反。能力面,浙江大學醫學院附屬第一醫院與阿里巴巴達摩院在 Science 發表的 RADAR,用 424,911 例檢查訓練出單一通用模型,在 146 種腹部 CT 發現上平均 AUC 0.913,八家中心外部驗證 0.895,而且程式碼直接開源;高麗大學的非顯影 CT 中風模型則把人類判讀者的 AUC 從 0.718 推到 0.852,相當於每 18 張 CT 多抓出 1 例原本會漏掉的大血管阻塞。校準面,同一週有三份 npj Digital Medicine 研究各自從不同角度說同一件事:我們沒有能力在當下知道模型什麼時候在騙人——221,556 組檢傷比較顯示汙名化措辭本身就會造成最高 9.4% 的有害降級;12 位判讀者裡只有 3 位主動懷疑影像是合成的,而且合成影像的「感知品質」還比真的高 0.44;229 個數位健康 RCT 裡 73% 由開發者自己執行,且回報統計顯著結果的勝算比高出 23%。而把這兩面綁在一起的,是 9 月 17 日 FDA 那一紙駁回放射 AI 免 510(k) 請願的最終命令:能力可以開源、可以一夜擴散,但上市前的證據關卡沒有要放鬆。
01 — Top Stories
RADAR:單一模型涵蓋 146 種腹部 CT 發現,平均 AUC 0.913,而且開源
浙江大學醫學院附屬第一醫院、阿里巴巴達摩院與湖畔實驗室 9 月 17 日在 Science 發表 RADAR,一個以對比式學習把 CT 體積拆成解剖結構、再與報告文字對齊的視覺—語言模型。訓練資料為 424,911 例檢查、150 萬組影像—文字配對與逾 1,500 萬組解剖特異性配對。在 146 種腹部 CT 發現上平均 AUC 達 0.913,對照的最佳競爭模型為 0.776;八家中心外部驗證 AUC 0.895;在完全未針對急診訓練的情況下,27,000 例以上的急診情境仍有 AUC 0.904。程式碼與權重已放上 GitHub,機構新聞稿見 EurekAlert。
過去十年的放射 AI 商業模式建立在「一個演算法做一件事、每一件事各自送審」之上。146 種發現的通用模型如果站得住,這個模式的單位經濟就變了:產品不再是偵測器,而是一層基礎設施。更關鍵的是它選擇開源——這意味著能力的擴散速度不再受任何一家公司的商業節奏限制,卻也意味著臨床端從此要自己承擔「這一版有沒有被驗證過」的判斷。急診那個未訓練卻拿到 0.904 的數字尤其值得注意:零樣本泛化到高風險情境,正是監管最難處理的一類主張。
全部數據為回溯性判讀表現,沒有前瞻性試驗、沒有病人結果指標,也沒有「醫師搭配 RADAR 後表現如何」的讀者研究——AUC 高不等於臨床可用。八家外部中心全在中國,跨人種、跨機型、跨顯影劑流程的泛化尚未驗證。開源也代表沒有任何監管機關為線上部署的那一版背書。
非顯影 CT 抓大血管阻塞:判讀者 AUC 0.718 → 0.852,每 18 張多救回 1 例
高麗大學醫學院 9 月 14 日發布跨韓美驗證結果,論文刊於 Journal of NeuroInterventional Surgery(DOI 10.1136/jnis-2026-025339)。模型只用標準非顯影腦部 CT 判斷是否存在大血管阻塞(LVO),不需顯影劑。963 位病人(韓國 723、美國 240)中,模型本身 AUC 韓國 0.963、美國 0.899;8 位醫療人員在無 AI 時判讀 AUC 0.718,有 AI 時升至 0.852,敏感度由 46.6% 提高到 63.7%、特異度由 91.9% 到 94.9%。研究團隊換算為「每判讀 18 張非顯影 CT,多抓出 1 例原本會漏掉的 LVO」,並指出未觀察到顯著的自動化偏誤。
這是本週唯一一則「AI 輔助人類、在急診情境、且有跨國外部驗證」的證據,而且它針對的是真實的照護瓶頸:非顯影 CT 是絕大多數急診中風流程的第一張片,但人眼在這張片上找 LVO 的敏感度本來就只有四成多。把敏感度拉到六成多、特異度不但沒掉還上升,意味著這是一個罕見的「同時減少漏診與誤診」的輔助模式,而不是用假陽性換敏感度。更值得注意的是研究主動測了自動化偏誤——這正是下面幾則研究指出最缺的那一塊。
判讀者只有 8 位,是本研究最脆弱的一環;讀者研究屬實驗室情境,不是真實急診的時間壓力下。此外「每 18 張多 1 例」是由敏感度差值與該世代盛行率換算而得的衍生數字,換一個 LVO 盛行率不同的場域就會變動,不宜直接外推到台灣的急診量能。
Dresden 院內自建 AI agent:判斷該不該信它,看「重複作答是否一致」比看信心分數準
德勒斯登工業大學與德勒斯登大學醫院 9 月 15 日在 Nature Medicine(DOI 10.1038/s41591-026-04609-x)發表完全在院內基礎設施上運行的醫療 AI agent,以模擬醫病問診方式處理標準化病例。最佳本地模型在一個 benchmark 上約 90% 診斷正確、另一個 84%;在 181 個隨機抽選的病例上,醫師覆核與自動評分的一致率超過 90%。核心發現是:模型對同一病例重複作答的一致性,比模型自報的內部機率更能預測答案正不正確,即使在刻意刪減資訊的壓力測試下也成立。研究同時發現高齡病例的診斷準確率明顯較低。主持人 Jakob Kather 的說法是:「我們的目標是具備選擇性自主權的 AI agent——支援臨床決策,但絕不完全接手。」
這是本週最有實作價值的一則。醫院導入 LLM 時最棘手的問題不是準確率,而是「這一次該不該信」——而模型自報的信心分數長期被證明校準不良。用「同一問題問三次、看答案是否一致」當信任訊號,是任何醫院當天就能在工作流裡加上去的一條規則,不需要換模型、不需要拿到權重。加上整套跑在院內、資料不出院區,等於同時回答了信任與隱私兩個採購問題。至於高齡準確率偏低,則是把一個具體的病人安全風險標在地圖上。
全部基於標準化模擬病例,不是真實病人、不是真實門診;模擬問診與真實病史詢問之間的落差向來是這類研究最大的外推風險。作者本身也指出高齡準確率偏低的成因尚待釐清,尚不能斷言是資料分布、症狀非典型性或模型偏誤。
221,556 組檢傷比較:只要在病歷敘述裡加上汙名字眼,LLM 就會把病人往下排,最高 9.4%
德州大學西南醫學中心急診醫學部與生物資訊學系 9 月 19 日在 npj Digital Medicine 發表「結果導向」的對照實驗:在兩家學術醫學中心急診的真實病例敘述中插入人口學、社會或汙名相關屬性,比較 LLM 的檢傷優先順序變化,共 221,556 組以 ESI 配對的比較、18 種中性與汙名化敘述配對,測試 Gemma、Qwen、DeepSeek 三個開放權重模型。結果:「頻繁急診就醫」的汙名化敘述造成最高 9.4% 的有害降級,且在全部六個「模型 × 資料集」組合中都比中性敘述高出 1.4 到 7.1 個百分點;精神科病史造成最高 9.5% 的位移。相對地,種族、語言、保險別未見一致的有害位移。
既有的 LLM 偏誤研究大多停在「模型對不同族群的輸出有差異」,這一份把終點綁在臨床結果(ESI 配對後的有害降級),規模又大了兩個數量級,因此結論的可操作性完全不同:風險不是抽象的公平性,而是急診分流當下的病人安全。更值得醫院注意的是它的反直覺處——種族與保險別沒有一致效應,真正會傷人的是臨床端自己寫進病歷的措辭(「常跑急診」「有精神科病史」)。這意味著防護不能只靠去識別化,還得管到敘述本身。
只測了三個開放權重模型,不能外推到醫院實際在用的商用閉源模型;精神科病史那條 9.5% 只有一個模型達到統計顯著。此外這是模擬檢傷排序,不是真實部署後的病人結果追蹤——它證明的是風險存在,不是傷害已經發生。
229 個數位健康 RCT 裡 73% 由開發者自己執行,回報顯著結果的勝算比高 23%
9 月 17 日 npj Digital Medicine 刊出「數位健康介入臨床試驗:研究獨立性與開發者效應的快速回顧」,從 29 篇系統性回顧中抽出 229 個 RCT(2013–2025,涵蓋營養、孕產、心理健康、睡眠四個領域)。73% 的試驗有開發者直接參與,只有 27% 獨立執行。開發者參與的試驗預註冊的勝算比為 2.47(p=0.004)——也就是說流程反而更規範;但以樣本數加權後,回報統計顯著結果的勝算比為 1.23(95% CI 1.16–1.31,p<0.001)。
這份研究提供了一個可以直接套用到任何臨床 AI 數據的折扣係數。本站過去兩週反覆處理的主題——廠商自述效益與同儕審查效益之間相差三到六倍——在這裡拿到了機制層的解釋:問題不是造假,而是由開發者設計、執行、分析的試驗,系統性地更容易產出顯著結果。預註冊率反而較高這一點尤其值得玩味,它說明「流程合規」不能當成獨立性的代理指標。讀任何一份臨床 AI 研究的第一個問題因此應該是:作者名單裡有沒有賣這個東西的人。
樣本是數位健康介入(含行為 app),不是純粹的臨床 AI 裝置試驗,外推到影像 AI 或臨床決策支援時要保留空間。OR 1.23 是統計上顯著但效果量不大的偏移,不足以用來推翻任何單一研究——它是讀文獻時的先驗校正,不是判決。
12 位判讀者只有 3 位懷疑影像是合成的,而合成的乳房超音波「看起來比真的還好」
9 月 19 日 npj Digital Medicine 發表三階段盲測:第一階段目的盲化,12 位判讀者各看每個來源 60 張乳房超音波影像,不知道其中有合成影像。結果合成影像的判讀者感知品質反而較高,差值 0.44(95% CI 0.33–0.55);模型估計的「影像足以進行基本評估」比率,合成為 95.9%、真實為 86.7%。12 位判讀者中只有 3 位主動質疑影像來源。第二階段明確告知有合成影像後,偵測準確率為 70.8%;第三階段提供辨識線索後升至 79.5%。最終在 94.9% 的合成影像評估中,判讀者選擇覆核、查證或不採用。
合成醫學影像原本被當成資料擴增的解方——罕見病灶不夠就生一些。這份研究把它翻成風險題:當生成影像的感知品質高於真實影像,訓練集、教學檔案、遠距判讀流程與研究資料庫的「來源鏈」就成了臨床安全的一環,而現行沒有任何醫院流程在查這件事。真正刺眼的數字是 3/12:不是判讀者辨不出來(告知後有七成),而是在沒被提醒時根本不會想到要問。這正好和前面 Dresden 那則構成一組:信任校準的失敗不在模型端,在人沒有被給予提問的時機。
12 位判讀者、單一模態(乳房超音波),樣本極小;作者明確表示本研究並未建立合成影像的臨床保真度、診斷等價性或因果介入效果。也就是說它證明的是「人不會主動懷疑」,不是「合成影像會導致誤診」。
AI 輔助陰道鏡外部驗證:低年資醫師敏感度 +6.5 個百分點,每案切片從 2.48 降到 2.02
9 月 19 日 npj Digital Medicine 發表以 WHO 開源資料集進行的獨立外部驗證:187 位病人、855 張陰道鏡影像,由中國 12 個地區、45 位不同資歷的陰道鏡醫師判讀。AI 單獨對 CIN2+ 的敏感度 84.2%(95% CI 74.4–90.7);醫師無 AI 時 84.8%(95% CI 82.7–86.9),搭配 AI 後升至 90.6%(95% CI 88.7–92.1)。低經驗判讀者的 AUC 由 0.72 升至 0.76(p=0.043),敏感度提升 6.5 個百分點。同時每案平均切片數由 2.48 降至 2.02。
兩點。第一,這是用「別人的公開資料集」做的外部驗證,不是廠商自己的留出測試集——在上面那則「開發者效應」的脈絡下,這種驗證的證據權重明顯不同。第二,它同時改善了兩個通常互斥的指標:敏感度上升而切片數下降。多數輔助診斷 AI 的代價是過度檢查,這裡反而減少了侵入性處置,對子宮頸癌篩檢資源有限的地區特別有意義——而 AI 的增益集中在低年資判讀者身上,正是這些地區的人力結構。
187 位病人是很小的驗證集,CIN2+ 的信賴區間相當寬(AI 單獨 74.4–90.7);AUC 0.72→0.76 的增幅在臨床上屬於邊際,p=0.043 也貼近顯著門檻。判讀者全在中國,陰道鏡訓練體系與台灣不同。切片數下降是好事,但研究並未追蹤是否因此漏掉任何病灶。
FDA 駁回放射 AI 免 510(k) 請願:每一次「臨床上有意義的變更」還是要重新送審
FDA 於 9 月 17 日在聯邦公報發布最終命令(Docket FDA-2025-P-5560),駁回由 Rubrum Advising 的 Nancy Stade 代表 Harrison.ai 於 2025 年 10 月 22 日提出的請願。該請願要求對放射科電腦輔助偵測/診斷(CADe/CADx)與電腦輔助分診通知(CADt)軟體給予部分 510(k) 豁免,條件是製造商已有先前 clearance 並落實上市後監測。FDA 套用裝置歷史、效能特性、變更可偵測性與分類穩定性四項標準後認定全部未滿足,明言「請願所提資訊未能證明上市前通報為非必要」,並同時表示仍會持續推動「創新且負擔最小」的數位健康監管途徑。最終命令全文見聯邦公報;產業端解讀見 PYMNTS。
放在本週其他七則旁邊,這一則才顯出份量。同一週 RADAR 把 146 種發現的通用模型直接開源,而 FDA 對已有多項 clearance、部署在 1,000 家以上機構的 Harrison.ai 說:你的下一版還是得回來排隊。監管機關實際上在回答一個很具體的問題——「模型更新後的效能變化,靠上市後監測偵測得到嗎?」——而它的答案是偵測不到。這正是 9/19 那兩份研究的實證支持:人類不會主動懷疑,信心分數不可信,那麼放行的關卡就只能留在上市前。對廠商的現實影響是營收綁在版本上:每一版有沒有 clearance 都要能追溯。
這是對「單一請願」的駁回,不是新的政策宣示,也不改變 FDA 既有的預定變更管制計畫(PCCP)途徑——業者仍可透過 PCCP 預先取得特定更新範圍的核准。把它讀成「FDA 全面收緊」是過度詮釋。聯邦公報正文在本環境無法直接抓取,文件識別資訊與引述經由公報官網頁面與 PYMNTS 報導交叉比對。
費城兒童醫院用開源 MONAI 自建心臟建模:4 小時縮到數秒,今年約 200 例
9 月 15 日 NVIDIA 部落格 揭露費城兒童醫院(CHOP)的心臟建模服務:以 MONAI、MONAI Label、NVIDIA Auto3DSeg、3D Slicer 與 SlicerHeart 等開源工具,從既有 CT、MRI 與 3D 超音波直接生成解剖精確的心臟模型,供先天性心臟病手術規劃使用。單例建模時間從 4 小時縮短到數秒;CHOP 今年預計建模約 200 例;全美 20 家以上兒童醫院有心臟建模計畫,波士頓兒童醫院每年用於約 500 台手術。先天性心臟缺陷約占活產的 1%。主持的心臟科醫師 Matthew Jolley 說:「你面對的是獨一無二的孩子,和一個現成規格的器材。我們的工作是找出哪一個裝得上。」
這是本週唯一一則「醫院自己建、跑在自己流程裡、有量化工作流改善」的案例,而且路線與 RADAR、Dresden 一致:開源工具 + 院內部署。四小時到數秒不只是省時間,它改變了建模能不能進入術前常規的門檻——4 小時意味著只有複雜個案才值得做,數秒意味著可以每台刀都做。值得注意的是這條路徑完全繞過了商業醫材的送審週期,因為它是手術規劃輔助而非診斷宣稱。
這是 NVIDIA 官方部落格的自述內容,不是同儕審查研究,也沒有第三方稽核;「4 小時縮到數秒」是流程時間,不是臨床結果——文中沒有任何手術成效、併發症率或死亡率數據。約 200 例、500 台刀等數字均為機構自報。
02 — Product Analysis
RADAR(damo-radar)
通用型腹部 CT 視覺—語言模型 · 浙大一院 + 阿里巴巴達摩院(中國)
功能與定位。把顯影腹部 CT 的體積資料拆成個別解剖結構,再以對比式學習對齊放射報告文字,用單一模型輸出 146 種發現的判讀。定位不是某一科的偵測器,而是一層可被任何下游應用調用的判讀基礎設施,論文與程式碼同步公開。
- 優勢 :覆蓋廣度與泛化能力同時成立——146 種發現平均 AUC 0.913(對照最佳模型 0.776),八家中心外部驗證仍有 0.895,在未針對急診訓練的 27,000 例以上急診情境維持 0.904。零樣本泛化到未見情境是通用模型最難偽造的能力指標。
- 優勢 :開源直接改變採用曲線。任何醫院或新創都能在自己的資料上重跑評估、在院內部署,不必等廠商授權,也不必把影像送出院區——這正是本週 Dresden 與 CHOP 兩案不約而同選擇的架構。
- 疑慮 :缺的正是最關鍵的那一份數據——沒有讀者研究。全部數據衡量的是模型獨自表現,而臨床部署的實際形態是「放射科醫師 + RADAR」。相較之下本週高麗大學那則之所以更接近可用,正因為它量到了 0.718 → 0.852 這個人機協作的差值。
- 疑慮 :沒有監管路徑,也沒有版本治理。FDA 同一週才重申每一次臨床上有意義的變更都要重新送審;開源模型在醫院端 fork、微調、更新之後,沒有任何機制知道線上跑的是哪一版、那一版有沒有被驗證過。八家外部中心全在中國,跨人種與跨機型泛化亦未驗證。
TU Dresden on-premise clinical AI agent
院內部署的診斷對話 agent · 德勒斯登工業大學 + 德勒斯登大學醫院(德國)
功能與定位。兩個以模擬醫病問診方式處理標準化病例的 agent,完全運行在醫院自有基礎設施上,資料不出院區。最佳本地模型在一個 benchmark 達約 90% 診斷正確、另一個 84%,但團隊的主張不在分數,而在「何時可以信任它」這個判準本身。主持人 Jakob Kather 稱之為「選擇性自主權」。
- 優勢 :交付了一個可以當天實作的信任規則——重複作答的一致性比模型自報信心更能預測正確與否,且在刻意刪減資訊的壓力測試下仍成立。這不需要模型權重、不需要重新訓練,任何用閉源 API 的醫院也照樣能套用:同一題問三次,答案不一致就升級給人。
- 優勢 :主動揭露自己的失效模式。研究指出高齡病例的診斷準確率明顯較低,這種自曝短處在廠商主導的研究裡幾乎看不到——對照本週 73% 試驗由開發者執行、顯著結果勝算比高 23% 的發現,這份研究的證據權重明顯不同。
- 疑慮 :全部建立在標準化模擬病例上,沒有真實病人、沒有真實門診的時間壓力與資訊不完整。模擬問診與真實病史詢問之間的落差,是這一類研究最大的外推風險,而這份研究並未提供任何前瞻性部署數據。
- 疑慮 :一致性當信任訊號有一個結構性弱點——模型可以穩定地一致錯誤。研究只證明一致性比信心分數「更能」預測正確,沒有給出一致但錯誤的殘餘比例,而這個數字才決定它能不能當成安全門檻使用。高齡準確率偏低的成因,作者也明言尚待釐清。
03 — Companies & Competition
| 公司 | 近況與數字 | 競爭定位與護城河 |
|---|---|---|
| Alibaba DAMO Academy 阿里巴巴研究院 · 與浙大一院合作 |
9/17 於 Science 發表 RADAR:424,911 例檢查訓練、146 種腹部 CT 發現平均 AUC 0.913、八中心外部驗證 0.895、急診 27,000 例以上 0.904,並開源。 | 護城河是資料規模與頂刊背書,不是產品。開源放棄授權收入,換的是生態位——讓別人的產品長在它的模型上。弱點是沒有監管路徑、沒有讀者研究、沒有商業化通路,醫院要用它得自己承擔驗證與版本治理。 |
| Harrison.ai / Annalise.ai 澳洲放射 AI · 旗艦產品 Annalise Enterprise CXR |
2025 年 2 月完成 1.12 億美元 C 輪(Aware Super 領投),累計募資 2.4 億美元;12 項 FDA clearance、部署於 1,000 家以上醫療機構、澳洲一半放射科醫師使用、年影響 600 萬病人。9/17 其免 510(k) 請願遭 FDA 駁回。 | 護城河正是 RADAR 沒有的那一層:clearance、給付(一項腦 CT 演算法取得 NTAP)與既有部署基礎。但 Annalise CXR 宣稱涵蓋 124 種胸部 X 光發現,對比 RADAR 的 146 種腹部 CT 發現免費開源,說明「覆蓋廣度」正在從差異化特徵變成基本盤。它的請願被駁回,等於承認自己的成本結構被綁在逐版送審上。 |
| NVIDIA(MONAI 生態) 醫療影像 AI 的基礎層供應商 |
9/15 揭露費城兒童醫院以 MONAI、Auto3DSeg、3D Slicer 自建心臟建模:單例 4 小時縮至數秒、CHOP 今年約 200 例、全美 20 家以上兒童醫院有建模計畫、波士頓兒童醫院年支援約 500 台手術。 | 不賣醫材、不送 FDA,賣的是所有人自建時都會用到的那一層。醫院自建的比例越高,它的位置越穩——本週 RADAR、Dresden、CHOP 三案不約而同走開源自建,全都落在它的護城河裡。弱點是這層價值無法用臨床結果證明,數字全是機構自報的流程時間。 |
| TU Dresden / Dresden University Hospital 學術機構,但正在定義一個產品類別 |
9/15 於 Nature Medicine(DOI 10.1038/s41591-026-04609-x)發表院內自建診斷 agent:最佳本地模型約 90%/84% 正確率、181 例醫師覆核一致率逾 90%、一致性優於信心分數、高齡準確率偏低。 | 沒有商業模式,卻可能是本週對廠商威脅最大的一則:如果「院內自建 + 開放權重 + 一致性門檻」這條路可行,環境式 AI 與臨床決策支援的軟體授權費就少了一個必要理由。它的護城河是方法論而非程式碼——「何時該信任」這個判準可以被任何人複製,包括廠商。 |
| Google Health 對話式醫療 AI 的主要推動者之一 |
9/14 於 Nature Medicine 發表評論(與 Beth Israel 等機構合著),主張對話式醫療 AI 的信任無法靠 benchmark 建立,必須靠真實場域的前瞻性研究。此為觀點文章,無量化結果。 | 在 benchmark 上長期領先的一方主動說 benchmark 不夠,這是把競爭門檻往自己擅長的方向移——前瞻性試驗的成本只有大廠付得起。對小廠是壓力,對醫院是好消息:它與本週 Dresden、開發者效應兩則指向同一個結論,只是動機不同。 |
今天的競爭結構是一個「能力免費化、信任商品化」的形狀。RADAR 把覆蓋廣度變成公共財,Harrison.ai 的請願被駁回則確認了 clearance 與給付仍是稀缺資源——所以護城河正在從「模型多準」移動到「誰能證明它在你的病人身上也準」。Dresden 的一致性判準、高麗大學的讀者研究差值、陰道鏡那份用 WHO 公開資料集做的外部驗證,全都是同一種資產:可被第三方複製的驗證方法。而 73% 由開發者自己做試驗的現況,正說明這種資產目前有多稀缺。
04 — Taiwan Angle
(1) 衛福部把賭注押在資料標準,時機是對的。據 聯合新聞網 9 月 15 日報導,衛福部長石崇良強調醫療 AI 落地的首要工作是「建立資料標準、治理制度及可信賴的使用環境」,規劃在醫學中心部署 FHIR Box 做標準化轉換,年底前完成全國醫學中心重要醫療資料對接、明年底前擴及全國醫院;搭配的資源包括健康台灣深耕計畫五年 489 億元、國家藥物韌性整備計畫四年 240 億元,以及 100 億元策略性投資。把這段話對照本週的 RADAR 開源事件,時序意義就出來了:當世界級的模型變成免費的,台灣的瓶頸就不在買不買得到模型,而在有沒有可用、可串接、標註一致的本地資料來驗證它。
(2) 但本週真正該抄的不是模型,是驗證方法。RADAR 的八家外部驗證中心全在中國,沒有讀者研究;直接拿來用等於接受一組未經本地人口驗證的效能宣稱。本週最值得台灣醫學中心複製的其實是三個方法:高麗大學那種「有/無 AI 的判讀者 AUC 差值」(0.718 → 0.852)、Dresden 那種「重複作答一致性當信任門檻」,以及陰道鏡那份「用別人的公開資料集做外部驗證」。這三種都不需要自建模型、不需要巨額算力,只需要一組願意做讀者研究的臨床醫師與一份乾淨的本地資料——後者正是 FHIR Box 要解決的東西。
(3) 汙名化措辭那一則,台灣的急診現在就該看。UT Southwestern 的 221,556 組比較顯示,真正造成有害降級的不是種族或保險別,而是臨床端自己寫進病歷的敘述(「常跑急診」「有精神科病史」)。台灣急診同樣存在高頻就診者與精神科共病的族群,而中文病歷的簡寫與慣用語(例如「老病人」「情緒個案」)從未被任何偏誤研究測過。在把 LLM 接進檢傷或分流之前,這是一個應該先做的本土前置測試,而且做起來不貴——需要的只是配對病例與一致的嚴重度分級基準。
05 — Further Reading
-
RADAR: an expert-level generalist AI for abdominal CT diagnosis — Science (2026-09-17)
讀方法論那一段就好:它怎麼把 CT 體積拆成解剖結構再對齊報告文字,是本週唯一一個值得逐字看的架構設計。附帶的 GitHub repo 可以直接在自家資料上重跑評估。
-
Clinical trials for digital health interventions: study independence and the developer effect — npj Digital Medicine (2026-09-17)
今年最實用的一份「讀論文用的校正表」。讀完之後,你看任何一份臨床 AI 研究的第一個動作會變成翻作者利益揭露,而不是看主要指標。
-
Outcome-grounded effect of clinically stigmatizing information on LLM emergency triage prioritization — npj Digital Medicine (2026-09-19)
值得讀的是它的實驗設計而非結論:把偏誤終點綁在 ESI 配對後的有害降級,是目前最乾淨的一套可複製方法,任何醫院都能照著在自己的病歷語料上跑一次。
-
Provenance risk of synthetic breast ultrasound images: a three-phase staged evaluation — npj Digital Medicine (2026-09-19)
樣本很小,但它提出的問題在其他地方還沒有人問:當合成影像的感知品質高於真實影像,你的教學檔案、研究資料庫與遠距判讀流程裡,誰在查來源?
-
Prospective evidence for conversational medical AI is non-negotiable — Nature Medicine Comment (2026-09-14)
沒有數據,但值得讀它的來源:Google Health 與 Beth Israel 的團隊自己說 benchmark 建立不了信任。誰在說這句話,跟這句話本身一樣值得琢磨。
06 — References
- RADAR: an expert-level generalist AI for abdominal CT diagnosis. Science, 2026-09-17. science.org · PubMed 42752131
- Introducing RADAR (press release). EurekAlert / AAAS, 2026-09-17. eurekalert.org
- damo-radar (source code and weights). GitHub — Alibaba DAMO Academy, 2026-09. github.com
- AI detects large vessel occlusion on non-contrast CT: Korea–US validation. Korea University College of Medicine / Journal of NeuroInterventional Surgery, 2026-09-14. DOI 10.1136/jnis-2026-025339. eurekalert.org
- On-premise medical AI agents with selective autonomy. TU Dresden / Nature Medicine, 2026-09-15. DOI 10.1038/s41591-026-04609-x. eurekalert.org
- Outcome-grounded effect of clinically stigmatizing information on large language model emergency triage prioritization. npj Digital Medicine, 2026-09-19. nature.com
- Clinical trials for digital health interventions: a rapid review of study independence and the developer effect. npj Digital Medicine, 2026-09-17. nature.com
- Provenance risk of synthetic breast ultrasound images: a three-phase staged evaluation. npj Digital Medicine, 2026-09-19. nature.com
- External validation of AI assisted colposcopy using WHO dataset for cervical precancer and cancer detection. npj Digital Medicine, 2026-09-19. nature.com
- Medical Devices; Exemption From Premarket Notification: Radiology Computer-Aided Detection and/or Diagnosis Devices (final order, Docket FDA-2025-P-5560). Federal Register 91 FR 58817, 2026-09-17. federalregister.gov
- FDA keeps radiology AI revenue tied to premarket clearance. PYMNTS, 2026-09-17. pymnts.com
- Children's hospital turns to open-source AI for cardiac care. NVIDIA Blog, 2026-09-15. blogs.nvidia.com
- Prospective evidence for conversational medical AI is non-negotiable (Comment). Nature Medicine, 2026-09-14. DOI 10.1038/s41591-026-04639-5. nature.com
- 石崇良:醫療 AI 落地首重資料標準與治理制度. 聯合新聞網(經光鹽生物科技學苑轉載), 2026-09-15. biotech-edu.com
- Radiology AI firm Harrison.ai raises $112M, opens US office. Radiology Business, 2025-02-11. radiologybusiness.com