考文字拿 92.7%,換成看圖只剩 76.9%——而這週從愛丁堡送來的證據說,從病歷裡掉出去最快的是病人本人
這一週的臨床證據在同一個地方裂開。德勒斯登團隊 9 月 2 日貼上 medRxiv 的 1,477 題血液學基準測試顯示,Claude Opus 5 在純文字題上拿到 92.7%,但同一批題目一旦附上影像就掉到 76.9%;Gemini-3.1 Pro 是 91.4% 對 78.7%。同一天貼上的另一份前印本則量出前沿 LLM 在自助分流情境上以 73.3–86.7% 勝過澳洲政府的 Healthdirect(48.9%)。而 9 月 3 日愛丁堡大學在 BMJ Digital Health & AI 刊出的回顧,把量尺從「醫師省了幾分鐘」換成「病歷裡少了什麼」,答案是:表情、手勢、情緒,以及病人在知道被錄音之後不肯再講的那些事。
01 — Top Stories
愛丁堡回顧:環境式 AI 抄寫員把病人的敘事整段丟掉,而全英國已有四成家醫在用
9 月 3 日,愛丁堡大學 Lucas Seuren、Robin Williams、Kathrin Cresswell 等人在 BMJ Digital Health & AI(2 卷 1 期,DOI 10.1136/bmjdh-2026-000091)發表以 NASSS 框架進行的回顧,檢索 Embase、PubMed、Scopus 至 2026 年 3 月 20 日,納入 27 篇文獻、其中 13 篇為實證研究。校方 9 月 4 日的新聞稿指出,英國已有約 40% 的一般科醫師在使用環境式抄寫員。
迄今幾乎所有抄寫員研究量的都是「醫師省了幾分鐘」。這篇把量尺換掉:病歷是醫病互動共同生產的東西,而模型只吃得到聲音。臉部表情、手勢、情緒狀態不進入文字流;病人在知道被錄音時,對物質使用、家暴、心理健康的揭露會退縮;手寫本身是一種處理資訊的認知動作,交出去等於認知卸載——回顧引述的臨床醫師說,他們回診時認不出自己的病歷、也想不起這個病人。作者的結論是:環境式抄寫員應該被當成複雜介入來評估,不是生產力工具,需要情境化驗證與長期追蹤。
這是 27 篇文獻的框架式回顧,不是新的前瞻資料,也沒有合併效果量;13 篇實證研究的場域與樣本高度異質。「四成英國家醫」出自新聞稿轉述的外部調查,不是本回顧自己量的數字。
1,477 題血液學:十個前沿模型的文字分數逼近 93%,一附上影像就掉 13 到 16 個百分點
德勒斯登工業大學 Carl Gustav Carus 大學醫院、Else Kröner Fresenius 數位健康中心與 NCT/UCC Dresden 的 Radoynova、Benouis、Middeke、Eckardt 等人,9 月 2 日在 medRxiv 貼出十個前沿模型在 1,477 題 board-style 選擇題上的基準測試。題目取自英國血液學會、美國血液學會與 EBMT 的五個教育題庫,涵蓋九個疾病領域與六個臨床技能面向,兼有純文字與多模態病例。結果:Claude Opus 5 文字 92.7%/多模態 76.9%,Gemini-3.1 Pro 91.4%/78.7%,Gemini-3.6 Flash 91.0%/74.8%,GPT-5.6 Sol 89.9%/76.7%。
血液學的診斷實體有一大半住在影像裡——周邊血片、骨髓抹片、流式細胞圖。一個在文字題上接近 93% 的模型,換到這些東西上只剩四分之三,而那正是這個科真正在做的事。作者另外量到兩件事:準確度與模型規模顯著相關,但這一代的進步幾乎全部發生在開源權重模型身上,閉源模型只有邊際成長;更要緊的是,表現最好的幾個模型「錯題高度一致」——它們在困難題上共享同一批盲點。這直接否定了最常見的臨床風險緩解法:多問一個模型當第二意見。作者自己的結論是持續的 expert-on-the-loop 監控無可取代。
前印本,未經同儕審查。選擇題不是臨床決策:題目給了選項、沒有病史缺漏、沒有時間壓力、沒有不確定的檢驗結果。教育題庫長期公開,落進訓練資料的機率不低,文字題的高分可能有一部分是記憶而非推理。各模型分數取自摘要頁,本報未取得完整補充資料表。
前沿 LLM 的分流準確率 73–87%,澳洲政府掛保證的症狀檢查器 48.9%——關鍵漏判 0 對 2
墨爾本 Victorian Institute of Technology 的 Azwad Raza Chowdhury 與 CQUniversity Australia 的 Bushra Chowdhury,9 月 2 日在 medRxiv 貼出一份標準化情境評估:45 個 Semigran 臨床情境(15 急診、15 非急症、15 自我照護),比對澳洲政府的 Healthdirect 與 ChatGPT、Claude、Gemini 的六種設定(免費與付費層各三)。Healthdirect 分流準確率 48.9%(95% CI 35.0–63.0)、Cohen's kappa 0.233、急症敏感度 46.7%、出現 2 次關鍵漏判;LLM 為 73.3–86.7%、kappa 0.600–0.800、急症敏感度 80.0–86.7%,270 次評估中關鍵漏判 0 次(95% CI 0–1.4%)。付費訂閱沒有帶來可辨識的安全性提升。
被比下去的那一方不是隨便一個 App,是澳洲政府經營、被當成公共衛生基礎設施、由護理師電話線在背後撐著的官方入口。而 LLM 犯錯時的方向也值得注意:它們的低估幾乎都是把該自我照護的人推去看家醫,而不是把該去急診的人留在家裡——錯得比較貴,但不比較危險。作者明說這些結果應該進入「LLM 是否該與既有症狀檢查服務整合」的法規討論。
45 個情境、270 次評估,Healthdirect 準確率的信賴區間寬達 28 個百分點,兩端都可能。Semigran vignettes 是 2015 年公開的題庫,幾乎確定在訓練資料裡——這是 LLM 這一側最大的疑慮。情境不是病人:沒有含糊的主訴、沒有中途改口、沒有不會描述症狀的人。單一國家、單一官方產品、單一次評估,前印本未經同儕審查。
LUNA25:468 顆未定性肺結節、75 位放射科醫師,最佳 AI 以 AUC 0.78 對 0.69 統計顯著勝出
《Radiology: Artificial Intelligence》八卷五期(2026 年 9 月號)刊出 Radboudumc 診斷影像分析組 Peeters、Obreja、Jacobs 等人主辦的 LUNA25 挑戰賽結果(DOI 10.1148/ryai.260179)。訓練集為 NLST 的 4,069 次 CT,測試集是 DLCST、NELSON、MILD 三個歐洲篩檢試驗中的 468 顆未定性結節(156 惡性、312 良性),另有 75 位放射科醫師讀 300 顆結節的讀片研究。作者公開版摘要載明,表現最好的 AI 系統 AUC 0.78(95% CI 0.73–0.84,p<0.001),醫師平均 0.69;在相同特異度下多抓出 12% 的惡性病灶,在相同敏感度下少 20% 偽陽性。同期並刊出 Farina 與 Szarf 8 月 5 日的評論。
大多數「AI 勝過醫師」的標題來自回溯性資料集與寬鬆的比較設計。LUNA25 不是:隱藏測試集、Docker 容器提交、同一批結節、同一群人類、預先註冊的讀片研究。而且它挑的是最貴的那一段——未定性結節。明顯的惡性與明顯的良性都不是問題,把 312 顆良性結節送去追蹤、切片甚至開刀才是所有肺癌篩檢計畫真正流血的地方。「同敏感度下少 20% 偽陽性」換算成計畫尺度,是幾千次不必要的追蹤與手術。
挑戰賽的最佳演算法不是任何一件上市產品,沒有取得任何一國的醫材許可。讀片醫師是在人工情境下作答——沒有病史、沒有前片、沒有臨床脈絡,這對人類這一側不利,而真實診間裡放射科醫師手上有這些東西。訓練集全部來自 NLST(美國重度吸菸者世代),測試集全部來自歐洲試驗,非吸菸者與亞洲族群的代表性都不明。《Radiology: AI》正文與評論全文在付費牆後,本報數字取自作者公開版摘要與挑戰賽官網。
把 AI 放在排隊順序上而不是判讀上:急診 CT 第 90 百分位等待時間少 43.4 分鐘
同一期還有史丹佛急診醫學與放射科、哈佛生醫資訊系 Silva、Tang、Chiacchia、Zhang、Langlotz、Kim 的模擬研究(7 月 22 日上線,DOI 10.1148/ryai.260110)。他們用 313,966 次急診就診(2020 年 8 月–2024 年 8 月)訓練一個梯度提升模型,在下單當下預測這次 CT 是否具臨床可行動性,再以離散事件模擬比較先進先出與 AI 排序,樣本為 2024 年 3 至 8 月的 20,795 次檢查。7,637 次可行動檢查(36.73%)的中位等待時間減少 10.75 分鐘(95% CI −12.40, −9.10),第 90 百分位減少 43.36 分鐘(−50.58, −36.80),60 分鐘內完成的比率從 48.33% 升到 57.30%。模型取得理論最大效益的 80–87%。
這是目前最容易通過院內治理的一類 AI 介入,因為它不碰判讀。模型不說這張片子有什麼,只說這張片子該排在誰前面;判讀責任、法律歸屬、醫材分類全部不動,也不需要新硬體。放在今天其他六則的脈絡裡看,這幾乎是一個反命題:當所有人都在爭論模型的診斷準確率該用什麼標準驗證時,這篇證明只要把預測用在調度上,效益就繞過了整個驗證僵局。
這是離散事件模擬,不是前瞻實施;真實急診的排程受人力、機台、病人動線牽制,模擬取不到。等待時間也不是臨床結果,沒有人量到死亡率、住院天數或處置改變。而且效益不是憑空生出來的——非可行動檢查的中位等待雖然也少了 5.80 分鐘,第 90 百分位卻增加 14.46 分鐘,也就是有一群病人被排到更後面去了。單一學術醫學中心資料,外推性未驗證。
252 個上市放射 AI 產品、545 篇驗證研究,只有 14% 說得出它在不同族群身上的表現
大阪公立大學醫學研究科人工智慧學部門的 Shannon Walston、Hirotaka Takita、Yasuhito Mitsuyama、Junya Sato 與通訊作者 Daiju Ueda,在《European Radiology》發表掃描式回顧(DOI 10.1007/s00330-026-12652-y),涵蓋 142 家廠商的 252 個商用 AI 產品與 545 篇驗證研究;本週經 News-Medical(9/2)與 Medical Xpress 進入新聞循環。只有 14%(77/545)提供性別、年齡或種族/族裔的分層表現。81% 記錄了病人性別,卻只有 16% 給出分性別效能;14% 有分年齡層,其中僅 51%(40/79)附上各組人數;種族/族裔最低,只有 8%(45 篇)提及,其中僅 18%(8/45)同時給出人口學與效能指標。骨骼(88 篇中 23%)與肺部(139 篇中 22%)影像最常提供分層資料;約 67% 的結核偵測資料集在性別次族群統計上功效不足。時序分析顯示沒有隨時間改善,有無廠商資助也沒有差別。
今天前五則都在回答「模型贏了誰」。這一則回答的是另一個問題:我們有沒有能力知道它會在誰身上輸。答案是,對於已經在市場上賣、已經拿到許可、已經在讀真人片子的 252 個產品,八成六的驗證文獻答不出來。而「沒有隨時間改善」這一點特別難看——這代表過去幾年所有關於 AI 公平性的討論、指引與檢核表,沒有改變廠商實際寫進論文裡的東西。
僅限放射科、僅限已上市產品,不涵蓋病理、心電圖或臨床決策支援。作者自陳資料萃取由單一作者完成,可能引入選擇偏誤;研究也沒有比較各產品之間的效能差異,更沒有測量臨床採用率。文章線上發表日期是 2026 年 6 月 12 日,本週是新聞覆蓋而非新發表——列在這裡是因為它是今天其他六則的共同前提。
同一張乳房攝影,多讀出一個器官系統:中風 AUROC 0.86、高血壓 0.79、缺血性心臟病 0.78
歐洲心臟學會 8 月 27 日的新聞稿預告了 ESC Congress 2026(慕尼黑,8/28–31)上的一項研究:以色列 Sheba 醫學中心與特拉維夫大學的 Viana Copeland 團隊,用 29,921 名女性、97,364 次乳房攝影(中位年齡 54 歲)訓練深度學習模型,從乳攝影像辨識高血壓(盛行率 16%,AUROC 0.79)、缺血性心臟病(2.5%,0.78)與中風(2.5%,0.86)。ESC 另行公布本屆為史上最大,近 34,000 名專業人士、170 國參與,逾 180 篇研究同步在各期刊發表(ESC)。
機會性篩檢是目前最省錢的一種 AI 應用:影像已經拍了、輻射已經吃了、預約已經排了,模型只是把原本沒人看的訊息讀出來。Copeland 自己的說法是「因為乳攝已被廣泛使用,分析同一批影像取得心血管資訊,有機會在不增加額外檢查的情況下規模化」。乳房動脈鈣化與心血管風險的關聯已有多年文獻,但這次量的是三個明確的疾病終點、樣本近三萬人。
會議摘要,尚未見同儕審查全文;本報數字全部取自 ESC 官方新聞稿,未取得原始摘要表。單一醫學中心的回溯資料。而且 AUROC 衡量的是「辨識出已有診斷的人」,不是前瞻預測未來事件——這兩件事在臨床意義上差很遠。在 2.5% 的盛行率下,AUROC 0.86 的陽性預測值可能低得驚人,而新聞稿沒有公布。
02 — Product Analysis
Claude Opus 5 / Gemini 3.1 Pro
通用前沿模型(作為臨床知識引擎)· Anthropic(美國)/Google DeepMind(美國、英國)
功能與定位。兩者都不是醫材,沒有任何一國的臨床適應症許可,卻在血液學專科考題上拿到 92.7% 與 91.4%。它們實際上被賣給的是開發者與企業,而醫療端的使用大半發生在兩種形態:包在別人的產品裡(臨床決策支援、文獻檢索、抄寫),或醫師私下開一個分頁——兩者都不在任何醫材監理框架內(medRxiv, 2026-09-02)。
- 優勢 :橫跨九個疾病領域與六個技能面向的一致高分,沒有任何專科 AI 產品具備這種廣度;而且在自助分流的獨立測試裡,270 次評估中關鍵漏判為零(medRxiv, 2026-09-02)。
- 疑慮 :多模態分數掉 13–16 個百分點,而血液學一半的診斷在影像裡;更麻煩的是頂尖模型錯題高度重疊,「多問一個模型」這個最常見的安全網不成立。作者也提醒,公開教育題庫幾乎確定落在訓練資料內,文字題的高分有多少是推理、多少是記憶,目前沒有人量得出來。
- 缺什麼 :沒有任何一份公開文件說明這些模型在不同性別、年齡或族裔病人身上的臨床表現差異——這正是 European Radiology 那份回顧指控整個商用 AI 產業的地方,而通用模型連被指控的資格都還沒有,因為它們根本不在那 545 篇驗證研究的統計範圍內。
Healthdirect Symptom Checker
政府經營的線上自助分流入口 · Healthdirect Australia(澳洲,聯邦與各州共同出資)
功能與定位。Healthdirect 是澳洲全國性的公費健康資訊與分流入口,症狀檢查器以規則式問答引導民眾判斷該自我照護、看家醫或去急診,背後另有 24 小時護理師電話線。在本週的 45 情境評估中,它的分流準確率為 48.9%(95% CI 35.0–63.0)、Cohen's kappa 0.233、急症敏感度 46.7%,並出現 2 次關鍵漏判(medRxiv, 2026-09-02)。
- 優勢 :可稽核、可問責、行為可預測。規則式系統的每一條路徑都能被公共衛生單位檢視與修改,出錯時可以追溯到哪一條規則——這是 LLM 目前完全給不出的東西,也是它被政府採用的原因。
- 疑慮 :kappa 0.233 意味著它與正確分流之間的一致性只比隨機好一點;急症敏感度 46.7% 代表它漏掉超過一半該去急診的情境。對一個掛著政府名字、被民眾當成權威的入口來說,這個數字比同一份研究裡任何一個 LLM 的缺點都嚴重。
- 要打折的地方 :45 個情境撐不起「這個產品不安全」的結論,信賴區間寬達 28 個百分點;而且評估者用的是七步互動協定,未必等同真實民眾的使用方式。這份前印本也還沒有經過同儕審查或 Healthdirect 官方回應。
03 — Companies & Competition
| 公司 | 近況與數字 | 競爭定位與護城河 |
|---|---|---|
| Qure.ai 胸部 X 光與 CT 的 AI 判讀,印度/美國 |
2 月 26 日宣布 qXR-Detect 再獲六項 FDA 510(k) 適應症(肺、胸膜、縱膈與心臟、骨骼、置入物、其他),累計 9 個產品共 26 項 FDA 許可、65 項以上 CE 認證;為首件搭載預定變更控制計畫(PCCP)的胸部 X 光 CADe 裝置(Qure.ai, 2026-02-26)。 | 護城河是監理廣度與 PCCP 帶來的更新自由——別人每改一次演算法要重送,它不用。薄的地方正是今天第六則:結核偵測是它的主戰場,而那份回顧算出約 67% 的結核資料集在性別次族群上功效不足。 |
| OpenEvidence 臨床決策支援與醫學檢索,美國 |
9 月 3 日發表自家臨床模型家族並加深腫瘤科佈局(STAT、Fierce Healthcare);此前已與 JAMA 簽下多年授權協議,把期刊內容餵進其 AI 醫學搜尋引擎(Fierce Healthcare)。 | 它賭的是「內容授權+醫師分發」而不是模型能力:通用模型的血液學分數證明知識本身不再稀缺,稀缺的是可引用的來源與醫師願意打開的那個介面。風險在於,一旦通用模型也拿到同等授權,這條護城河就只剩使用習慣。 |
| Nihon Kohden Digital Health Solutions 連續生理監測與惡化預測(CoMET),日本/美國 |
與維吉尼亞大學合作的叢集隨機對照試驗(85 床心臟內外科病房、11 個叢集、10,422 次住院,2021 年 1 月至 2022 年 10 月)於 2 月 5 日發表:主要結果「21 天內無臨床惡化事件時數」兩組無差異,作者結論為「預測性分析監測未改善病人結果」(Scientific Reports)。 | 這一列存在的意義是提醒:整個表格裡唯一做了隨機對照試驗的產品,得到的是陰性結果。護城河是與監測儀硬體綁定的資料流,弱點是它證明了預測準不代表病人活得比較久——今天所有 AUC 數字都該對著這一列讀。 |
| Anthropic / Google DeepMind / OpenAI 通用前沿模型,未取得臨床適應症 |
在 1,477 題血液學基準上,Claude Opus 5 文字 92.7%、Gemini-3.1 Pro 91.4%、GPT-5.6 Sol 89.9%;多模態則全部落在 74.8–78.7% 之間(medRxiv, 2026-09-02)。同週另一份研究顯示付費層在分流安全性上並未優於免費層(medRxiv, 2026-09-02)。 | 它們沒有護城河,因為它們沒有進場——是別人的產品把它們裝進去的。真正的競爭不是「通用對專科」,而是專科 AI 廠商的整條驗證與監理成本,正在被一個不受同一套規則約束、且分數更高的替代品從側面掏空。開源權重模型這一代的進步幅度最大,這條側翼還會更寬。 |
| Healthdirect Australia 政府經營的分流入口 |
45 情境評估中分流準確率 48.9%、kappa 0.233、急症敏感度 46.7%、2 次關鍵漏判,全面落後六種 LLM 設定(medRxiv, 2026-09-02)。 | 護城河是公共信任與零成本的全民可及性,不是效能。但公共信任正是最禁不起這種比較的資產:一旦民眾知道那個免費聊天視窗分得比政府準,入口就會自己搬家,而搬過去的那一邊沒有護理師電話線接手。 |
今天的競爭結構是一個倒置的金字塔。拿到最多許可、投入最多驗證成本的廠商(Qure.ai)守著最窄的適應症;做了唯一一次隨機對照試驗的廠商(Nihon Kohden)拿到陰性結果;而分數最高、覆蓋最廣的那一層(通用前沿模型)既不是醫材、也不在任何驗證統計裡。監理的重量與臨床的分數,這一週在同一張表上呈反向排列。
04 — Taiwan Angle
(1) 台灣是全球第一個把 LDCT 篩檢擴及非吸菸高風險族群的國家,而它的問題正是未定性結節。國健署公費肺癌篩檢首年共 49,508 人受檢(男性 56.3%、女性 43.7%),確診肺癌 531 人、偵測率 1.1%,其中第 0、1 期占 85.1%;符合資格者中 57.8% 是因家族史、38.3% 是重度吸菸者,確診個案裡 74.6% 具家族史。但估計 50 萬名符合資格者中只有約一成受檢(康健雜誌)。
(2) 台灣已經有自己的 LDCT-AI,而且早就上線了。國健署 2021 年委託台大與工程團隊開發的肺結節輔助判讀程式,2024 年 2 月取得食藥署第二等級醫材許可,導入台大醫院、台大癌醫中心、成大醫院、彰化基督教醫院與部立台北、南投、台東等七家院所;官方公布的效能為小於 4 mm 與大於 6 mm 結節偵測準確度均約九成、偽陽性約 2 個,報告輸出速度提升 29%、結節特性判讀一致性提升 31%(健康醫療網)。
(3) 更關鍵的是,健保署已經在把 AI 往給付審查的位置放。2026 年 3 月的報導指出,健保署正發展生成式 AI 辨識系統,作為肺結節手術的給付前審查平台與醫院自主管理工具;健保署組長黃育文表示第一階段目標是 AI 辨識與病理報告一致性達 95%,對診斷為良性的不必要手術予以核刪,並透過中央指令系統找出切片惡性率偏低的醫院與醫師給予提醒。同一報導引述,2024 年有 530 多萬人次接受 LDCT,近 3 萬人接受肺結節或腫瘤切除手術,台大等四家醫院術後切片惡性率達七成以上,部分醫院低於五成甚至四成;醫界共識是小於 0.6 公分的結節不需手術(元氣網)。
(4) 而今天第六則的警告,正好落在這個交叉點上。如果台灣要拿 AI 當給付核刪的依據,就必須能回答一個問題:這個模型在女性、在非吸菸者、在 60 歲以上、在不同廠牌的 CT 上,表現一樣嗎?全球 545 篇商用放射 AI 驗證研究裡只有 14% 答得出來,種族/族裔更只有 8% 提及(European Radiology)。而台灣篩檢族群有 43.7% 是女性、大半靠家族史而非吸菸史入場——這正是 NLST 世代最沒有代表到的一群人,也正是 LUNA25 的訓練資料來源。一個在美國重度吸菸者身上訓練、在歐洲試驗上驗證的模型,AUC 0.78 這個數字要搬到台灣的篩檢對象身上,中間缺的不是演算法,是那份沒有人做的次族群驗證。
05 — Further Reading
-
What LUNA25 Teaches Us about AI for Lung Cancer Screening — Radiology: Artificial Intelligence (2026-08-05)
Farina 與 Szarf 為 LUNA25 撰寫的隨刊評論。看完主文的 AUC 差距後,這篇是唯一一份由同儕寫下、說明這個挑戰賽究竟證明了什麼、又沒有證明什麼的文件。
-
Human–large language model collaboration in clinical medicine: a systematic review and meta-analysis — npj Digital Medicine (2026-01-28)
十篇試驗的合併結果指出一個違反直覺的現象:醫師加 AI 不必然勝過 AI 單獨作業,複合診斷與處置分數只多 4.88 個百分點(95% CI 0.65–9.12),而文件的事實錯誤率仍有 26–36%。今天所有「AI 當第二意見」的假設都應該先讀這一篇。
-
The current state of demographic subgroup reporting for commercially available AI for radiology: a scoping review — European Radiology (2026-06-12)
今天第六則的原始論文。要判斷任何一個上市影像 AI 產品能不能搬到你的病人身上,這篇提供的是方法而不只是結論。
-
A benchmark study of vision and pathology foundation models for computational pathology — Nature Communications (2026-07-24)
史丹佛 Gevaert 團隊比較 32 個基礎模型、41 項任務、53 個資料集、逾 17,500 張全玻片。結論與今天的血液學基準呼應:病理專用模型並未一致優於通用視覺模型,規模也不保證泛化。
-
Lessons from deploying the ChatEHR system at Stanford Medicine — Nature Medicine (2026-08-10)
把 LLM 真的接上病歷之後會發生什麼事的第一手紀錄,重點在為什麼基準分數不足以作為部署依據——正好是今天第二、三則留下的問題。
06 — References
- Seuren LM, Williams R, Cresswell K, et al. Beyond productivity: a NASSS-informed review of implementation risks and research priorities for ambient AI scribes in healthcare. BMJ Digital Health & AI 2(1):e000091, 2026-09-03. DOI 10.1136/bmjdh-2026-000091. bmjdigitalhealth.bmj.com
- AI scribes may fail to capture patients' experiences. University of Edinburgh News, 2026-09-04. ed.ac.uk
- Ambient AI scribes may risk missing vital patient information. News-Medical, 2026-09-03. news-medical.net
- Radoynova M, Benouis M, Schulze F, Schneider MMK, Winter S, Bornhäuser M, Middeke JM, Eckardt JN. Benchmarking ten frontier large language models on 1,477 board-style multiple choice questions in hematology. medRxiv 2026.09.01.26361881, 2026-09-02. medrxiv.org
- Chowdhury AR, Chowdhury B. Are Frontier Large Language Models Safer Than Government-Backed Symptom Checkers for Clinical Self-Triage? A Standardised Vignette Evaluation. medRxiv 2026.09.01.26361908, 2026-09-02. medrxiv.org
- Peeters D, Obreja B, Antonissen N, Saghir Z, Pastorino U, De Bock G, Vliegenthart R, Prokop M, Jacobs C. Benchmarking of AI and Radiologists for Indeterminate Lung Nodule Malignancy Risk Estimation on Screening CT: The LUNA25 Challenge. Radiology: Artificial Intelligence 8(5), 2026-09. DOI 10.1148/ryai.260179. pubs.rsna.org
- LUNA25 Challenge, 作者公開版摘要與挑戰賽官網. Diagnostic Image Analysis Group, Radboudumc. diagnijmegen.nl · luna25.grand-challenge.org
- Farina EMJM, Szarf G. What LUNA25 Teaches Us about AI for Lung Cancer Screening. Radiology: Artificial Intelligence 8(5), 2026-08-05. DOI 10.1148/ryai.260657. pubs.rsna.org
- Silva E, Tang K, Chiacchia S, Zhang X, Langlotz C, Kim D. Simulation of AI-driven CT Queue Prioritization in the Emergency Department. Radiology: Artificial Intelligence 8(5), 2026-07-22. DOI 10.1148/ryai.260110. pubs.rsna.org
- Walston SL, Takita H, Mitsuyama Y, Sato J, Ueda D. The current state of demographic subgroup reporting for commercially available AI for radiology: a scoping review. European Radiology, 2026-06-12. DOI 10.1007/s00330-026-12652-y. link.springer.com
- Demographic reporting for medical AI remains inadequate, study shows. News-Medical, 2026-09-02. news-medical.net · Medical Xpress
- AI could help detect common cardiovascular diseases from mammograms. European Society of Cardiology press release, 2026-08-27. escardio.org
- Record-breaking ESC Congress 2026 puts new life-saving cardiovascular science in the spotlight. European Society of Cardiology, 2026. escardio.org
- Qure.ai nets six new indications cleared by the FDA. Qure.ai newsroom, 2026-02-26. qure.ai
- Keim-Malpass J, Ratcliffe SJ, Clark MT, et al. A randomized controlled trial of artificial intelligence-based analytics for clinical deterioration. Scientific Reports, 2026-02-05. DOI 10.1038/s41598-026-39051-z. nature.com
- OpenEvidence launches new family of AI models for clinicians. STAT News, 2026-09-03. statnews.com · Fierce Healthcare
- JAMA signs multi-year deal with OpenEvidence to inform AI-powered medical search. Fierce Healthcare. fiercehealthcare.com
- 晚期存活率剩1成!公費肺癌篩檢首年僅1成篩檢率. 康健雜誌 CommonHealth, 2023-07-03(2026-01-08 更新). commonhealth.com.tw
- 國健署LDCT肺癌篩檢AI輔助程式獲食藥署許可. 健康醫療網 HealthNews, 2024-09-07. healthnews.com.tw
- LDCT揪出一堆肺結節!健保署推AI把關,避免「不該切卻被切」. 聯合報元氣網 UDN Health, 2026-03-17. health.udn.com
- Wang G, Zhang K, Jiang J, Yang X, et al. Human–large language model collaboration in clinical medicine: a systematic review and meta-analysis. npj Digital Medicine, 2026-01-28. DOI 10.1038/s41746-026-02382-2. nature.com
- Bareja R, Carrillo-Perez F, Zheng Y, Pizurica M, et al. A benchmark study of vision and pathology foundation models for computational pathology. Nature Communications, 2026-07-24. DOI 10.1038/s41467-026-76004-6. nature.com
- Lessons from deploying the ChatEHR system at Stanford Medicine. Nature Medicine, 2026-08-10. nature.com
- Lång K, et al. Interval cancer, sensitivity, and specificity comparing AI-supported mammography screening with standard double reading without AI in the MASAI study. The Lancet, 2026-01-29. DOI 10.1016/S0140-6736(25)02464-X. eurekalert.org