醫療 AI 的技術突破全部撞在同一道牆上——評分的人就是賣模型的人:OpenEvidence 9/30 以 150 億美元估值再募 2.5 億,而它家 Darwin 那個 MedQA 史上第一個 100% 是自測自評;Nature Medicine 的頭對頭研究發現三個通用前沿模型在 MedQA、HealthBench 與醫師真實問題上全面贏過兩款專用臨床 AI 工具,後者「表現沒比 Google AI 摘要好」;而微軟自家的 HealthAgentBench 把 54 個代理任務丟出去,最強的 Codex GPT-5.5 只過 42%
星期四是技術突破日,而今天要先承認一件事:9/28–10/1 這個窗口裡,醫療 AI 沒有大廠級的模型發布。真正落地的新東西是 arXiv 預印本與 Hugging Face 上的權重上架——9/30 的醫療 AI 行業日報掃出來的五個「新模型」,下載數最高的 Fastino-Nemotron-3.5-Lightning-Healthcare 是 6,707 次、22 個 like,其餘四個合計不到 2,000 次下載,而且全部沒有臨床準確度的獨立評測。於是今天的技術主線不是「誰的模型更強」,而是一個更難回答的問題:當分數繼續往上漲,誰在獨立驗分?這個問題在 9/30 變得具體——OpenEvidence 以 150 億美元估值再募 2.5 億美元,而支撐它「全世界每一個主流 benchmark 分數最高的醫療 AI 模型家族」這句話的四個數字,是自己測、自己評、自己發表的。
01 — Top Stories
OpenEvidence 在 9/30 以 150 億美元估值募得 2.5 億美元——而它家 Darwin 的 MedQA 100% 是自己打的分數
9 月 30 日,被稱為「醫師版 ChatGPT」的 OpenEvidence 完成 2.5 億美元募資、估值 150 億美元,投資方包含多家醫療系統與 Andreessen Horowitz;這使它在過去 12 個月內累計募得約 10 億美元。而這一輪的技術底氣來自 9 月 3 日發表的 OpenEvidence Model Family:Darwin 成為史上第一個在 MedQA 拿到 100% 的 AI 系統,另外 MedXpertQA 72.8%、HealthBench Professional 82.7%、NOHARM 87.2%,公司表示 Darwin 贏過 Claude 與 Gemini 的對應模型,但因為病毒學、免疫學與遺傳學的雙重用途風險而仍停留在 research preview。另外三個模型 Osler(5 秒回答)、Sackett(30 秒、證據導向)、Snow(5 分鐘文獻回顧)則對全美臨床人員免費開放。
因為沒有人獨立驗過這四個數字。9 月 22 日 Grid Health 的分析把這件事講得很直白:「這些是 OpenEvidence 自己的測驗,由 OpenEvidence 評分,由 OpenEvidence 發表。」更尖的一刀是命名——Sackett 取自證據醫學之父 David Sackett,而它提供的證據全部出自自己;同一份分析也指出,OpenEvidence 曾批評 NYU 的研究者使用 OpenAI 的 benchmark,如今自己用來宣稱世界第一的 HealthBench Professional 正是 OpenAI 的 benchmark。這不是對模型能力的質疑,而是對「臨床準確度」與「臨床效用」之間那條縫的質疑:MedQA 100% 不等於在診間裡會做對事。
四個 benchmark 分數全部為廠商自述、未經第三方稽核。「使用 OpenEvidence 的美國醫師比所有競品加總還多」這句公司說法沒有附任何引證。募資金額與估值引自 HISTalk 的二手報導,且該報導自己指出早先版本的消息是「尋求 2 億美元、估值 200 億美元」,與定案數字不符。
Nature Medicine 的裁判結果:通用前沿模型贏過專用臨床 AI 工具,而專用工具「表現沒比 Google AI 摘要好」
Krithik Vishwanath、Anton Alyakin 與 Eric Karl Oermann 的研究做了一件這個產業很少有人做的事:把三個通用前沿大模型與兩款領先的專用臨床 AI 工具放在同一張桌子上,用兩個公開 benchmark(MedQA 與 HealthBench)加上醫師真實提交的問題做頭對頭比較。結論是三個通用模型全面勝出,而兩款專用臨床工具「表現沒比 Google 搜尋的 AI 摘要更好」。研究的 briefing 刊於 Nature Medicine 第 32 卷第 7 期第 2364–2365 頁(DOI 10.1038/s41591-026-04457-9,2026-06-17),主文〈General-purpose large language models outperform specialized clinical AI tools on medical benchmarks〉收錄於 PubMed 42286322/s41591-026-04431-5。
這份研究明確指出的風險,正是 9/30 那場募資的風險:專用臨床 AI 工具正在「幾乎沒有獨立測試」的狀態下進入醫療實務。把兩件事疊起來看,今天的技術地景是這樣的——通用模型的通識醫學能力已經高到讓「做一個醫療專用模型」這件事的附加價值變得需要證明,而要證明就得有人在廠商之外評分,但那個人目前不存在。Harvard 醫學院生醫資訊系的 Arjun K. Manrai 在 7 月 28 日的 Nature 評論裡把這件事抽象成一句話:證據醫學建立在「量尺可信」這個假設上,而醫療 AI 的能力「越來越難被正確評估與理解」。
這不是本週新聞——主文發表於 2026 年 6 月,今天把它拉回來是因為它是本週募資與自評分數爭議的唯一獨立裁判基準。另外,Nature Medicine 主文頁面在撰稿時回傳 503,本則內容依其 research briefing 與 PubMed 書目資料撰寫,未取得全文;briefing 本身沒有具名那三個通用模型與兩款專用工具是哪些,也沒有公布各自的分數。
微軟把 54 個真實醫療代理任務丟給前沿模型,最強的 Codex GPT-5.5 只過 42%——而醫療影像是它們最吃力的那一類
由 Qianchu Liu、Sheng Zhang 等人進行、Hoifung Poon 為通訊作者的 HealthAgentBench(arXiv 2606.31179,2026-06-30 投稿)建了一套 54 個代理式醫療任務、分成 7 大類,每個任務都複製真實臨床工作流:代理必須自己去探索原始醫療資料、在複雜環境裡操作、執行多步驟的解法,而不是回答一個 prompt。結果:Codex GPT-5.5 以約 42% 的成功率居首,同時也是成本效益最好的;Claude Code 系列的模型在醫療影像任務上特別吃力;所有前沿代理在「搜尋空間大 + 需要組合式推理」的任務上都明顯失手。基準已公開釋出於 GitHub 的 microsoft/HealthAgentBench。
42% 這個數字和 MedQA 的 100% 放在一起,就是今天整份日報的核心落差。選擇題的天花板已經被打穿,工作流的地板還沒鋪好。MedQA 是一題一答、可驗證、沒有副作用;HealthAgentBench 的任務是「去這堆原始資料裡找出該找的東西,然後做對接下來的五件事」——後者才是醫院真正要買的東西。而同樣值得注意的是,微軟自己做的基準把微軟自己的合作夥伴模型也一起打了:這才是獨立評測該有的樣子,不管做的人是誰。代理在 EHR 研究管線上展現了潛力,但在醫療影像上集體失手,也解釋了為什麼影像 AI 至今仍是「單點模型 + 放射科醫師簽名」而不是「代理自己跑完」。
同樣不是本週新聞(6 月 30 日投稿)。42% 是「約」值,原文未在摘要層級給出完整排行榜;「Claude Code 系列」與「其他前沿代理」的具體分數本則未取得。54 個任務對一套要代表整個醫療工作流的基準而言偏少,作者自己也把低通過率描述為「基準很難」而非「模型很差」——這兩種解讀在數據上目前無法分離。
Sophont 的 Medmarks v1.0:30 個 benchmark × 61 個模型全部攤開,結論是醫學微調真的有用、開源大模型要燒 5 倍 token、而給模型一台計算器反而讓它算錯
Sophont 把它的醫療 LLM 評測套件擴充到 30 個 benchmark(原 20 個)、61 個模型/71 種配置(原 46 個模型),同時釋出技術報告(arXiv 2605.01417)、互動排行榜與訓練環境 Medmarks-T,全部開源。可驗證題型的 Medmarks-V 由 Gemini 3 Pro Preview 領先,開放式臨床推理的 Medmarks-OE 由 GPT-5.2 居首。三個結論值得抄下來:(1) 醫學微調確實有效——各家族的醫學微調版本相對基礎模型達到「近乎 Pareto 改善」;(2) 開源的優勢只在選擇題上成立——GLM 4.7 在多選題逼近前沿,但到開放式任務優勢消失,而且需要「超過 5 倍的 token 數」才能達到與 GPT-5.2 相當的結果,對講求速度的臨床部署來說是硬傷;(3) 工具整合會反咬——給模型計算器之後,許多模型不是直接忽略工具,就是有工具仍算錯,或在拿到外部工具後發生格式崩潰。
Medmarks 做的正是 OpenEvidence 沒做的那件事:把廠商之外的評分交出去。而它的第二個結論直接打在一個很多人忽略的成本上——「開源模型分數追上了」不等於「開源模型可以用」,當它需要 5 倍 token 才追平,在一間每天跑數萬次查詢的醫院裡,那個 5 倍是推論成本、延遲與 GPU 採購量。第三個結論則對整個「醫療 AI agent」的敘事潑了冷水:代理最基本的能力是正確使用工具,而目前連「給它計算器讓它算對」這件事都不穩定。
v1.0 的部落格發表日為 2026-05-12,不是本週。Sophont 本身是醫療 AI 公司,自己做評測套件同樣存在利益關係——差別只在它把題庫、程式碼與排行榜全部開源,使第三方可以複製與反駁,這一點 OpenEvidence 沒有做到。另外,排行榜上的模型版本(Gemini 3 Pro Preview、GPT-5.2、GLM 4.7)在發表後數月間已有更新,當前名次未必成立。
今天唯一不需要吵分數的技術進步:GigaPath-Flash 用 1/50 算力留住 97% 的病理表現,22M + 21M 參數、Apache-2.0 開權重
微軟研究院釋出兩個計算病理學的高效基礎模型(arXiv 2607.18218v2)。GigaPath-Flash 把一個 22M 參數的 ViT-S tile encoder 接上 21M 參數的 LongNet slide encoder,從十億參數級的 GigaPath 教師模型蒸餾而來,在 slide-level 平均表現上留住 GigaPath 的 97%,而算力少 50 倍;在 PANDA 與 EBRAINS 的 slide-level 分類上平均 0.826,優於只用 tile-level 的基線,同時 FLOPs 比原版 GigaPath 少 49.5 倍。GigaTIME-Flash 把原 GigaTIME 的 CNN backbone 換成 ViT-S,從 H&E 影像預測 21 通道的多重免疫螢光圖譜,速度快 6 倍、GPU 記憶體少 8 倍:每張 256×256 tile 從 69.1 GFLOPs 降到 14.9(4.6 倍),batch 128 時峰值 GPU 記憶體從 16.68 GB 降到 2.16 GB,吞吐量從原版約 390 tiles/秒的天花板拉到 1,679 tiles/秒,而且在分布內與分布外世代的平均 Pearson 相關係數都高於原版。兩個模型的權重全部以 Apache-2.0 釋出。
因為效率的進步不需要人家相信你的分數——它直接把門檻降下來。病理基礎模型長期的問題不是不夠準,而是一張 whole-slide image 動輒數 GB、一台能跑的機器就是一筆資本支出,結果只有大型醫學中心玩得起。16.68 GB 降到 2.16 GB 的意義很具體:前者需要一張資料中心級顯卡,後者一張消費級顯卡就能跑。這是今天唯一一則「不管誰來評分,結論都一樣」的進展,也是最可能在未來 12 個月內真的改變誰能用上病理 AI 的那一則。
所有數字出自作者自己的論文(v2 版),未經第三方重現;PANDA 與 EBRAINS 是公開的研究資料集,不是前瞻臨床驗證——0.826 的平均分數不等於診斷等級的表現。「97%」是 slide-level 平均表現的保留比例,不保證在每一個下游任務上都成立。本則內容依 arXiv 的 HTML 全文撰寫,未另行核對權重頁面上的實際檔案與授權文字。
另一個不該出現的畫面:醫療代理最常被引用的 benchmark,榜首到現在還是 Claude 3.5 Sonnet v2 的 69.67%,榜單最後更新是 5 月
MedAgentBench 由史丹佛團隊建立,做法是搭一個虛擬 EHR 環境,放進 100 份擬真病歷、共 785,000 筆記錄,要模型完成 300 項臨床任務,包含開檢驗、開藥與調閱病人資訊(Becker's 報導;研究全文刊於 NEJM AI)。問題是它的公開排行榜最後更新於 2026-05-27,榜首仍是 Claude 3.5 Sonnet v2 的 69.67%(Query SR 85.33%、Action SR 54%)。注意那個 54%——同一個模型查資料查得很準,真的要「動手做」的時候只對一半。
這是「醫療 AI 的量尺問題」最具體的一個切片:模型每幾週換一代,而獨立的評測基礎設施以月為單位落後。當一個被 NEJM AI 收錄、被產業廣泛引用的榜單,榜首還停在一個 2024 年發表的模型,任何人想問「現在最強的醫療代理有多強」都只能回去相信廠商的新聞稿。Query SR 85.33% 對 Action SR 54% 的落差也值得單獨記一筆——它跟 HealthAgentBench 的 42% 指向同一件事:讀取資料與執行動作之間有一道很深的能力斷層,而醫院買的是後者。
「榜首仍是 Claude 3.5 Sonnet v2」只代表該第三方榜單沒有更新,不代表沒有更強的模型存在——它只是沒有被獨立測過並公布,而這正是本則要說的事。原始研究的 Becker's 報導日期為 2025-09-16,是舊的報導;排行榜數字引自第三方彙整站 benchmarklist.com,未與 MedAgentBench 官方倉庫逐項核對。
9/29–9/30 真正新的東西:19,930 段年輕人與 ChatGPT 的對話被臨床人員逐段判讀,問題不在說錯話,而在「說對的話、說錯的時機」
本週窗口內最值得讀的新發表都在 arXiv。〈Right Words, Wrong Moment〉(2609.35953)把 19,930 段年輕人與 ChatGPT 的對話交給臨床人員逐段判讀,結論指向的不是內容錯誤,而是流程失誤——最典型的一種是「過早跳到解決方案」。ARCagent(2609.36392)處理的是臨床問答裡一個很現實的難題:當醫療指引彼此矛盾時,檢索要如何校準,論文以 ME/CFS 為案例探討「知識完整性」與「衝突感知的動態綜合」。MERID(2609.36238)則用遞迴自我改善的多模態代理整合訪談與感測資料做重度憂鬱分析。同一批日報也掃出 UltraBench 2(2609.28610,超音波視覺基礎模型的穩健評測)與 nnFoundation(2609.26924,放射學 3D 基礎模型)。工程面則有哈佛/BIDMC 的開源數位精神醫學平台 mindLAMP,已在 17 個國家、65 個站點以 AWS serverless 架構部署。
〈Right Words, Wrong Moment〉這個標題本身就是對今天整個主題的一句話註解:benchmark 衡量的是「說得對不對」,臨床價值卻取決於「什麼時候說、順序對不對」。一個在 MedQA 拿 100% 的模型完全可以在真實對話裡犯下「過早跳到解方」這種流程錯誤,而目前沒有任何主流 benchmark 會扣它的分。ARCagent 指出的指引互相矛盾也是同一件事的另一面——真實臨床的困難往往不是知識不足,而是知識互相打架時要怎麼選。至於 UltraBench 2 與 nnFoundation:當兩個獨立團隊在同一週分別針對超音波與 3D 放射學提出新的評測與基礎模型,說明影像這條線正在補的是地基,不是天花板。
全部是未經同儕審查的預印本。arXiv 2609.35953、2609.36392、2609.36238 三篇的作者、機構與完整數據在撰稿時無法直接取得(抓取被拒),本則依 arXiv 新稿清單與摘要層級的描述撰寫,分數與樣本細節未逐項核對;2609.28610 與 2609.26924 的 PDF 回傳無可讀文字,僅依標題與檢索摘要列入。mindLAMP 的「17 個國家、65 個站點」出自 AWS 自家的產業部落格,屬廠商自述。
02 — Product Analysis
OpenEvidence Model Family — Osler · Sackett · Snow · Darwin
分層推理深度的臨床問答模型族 · OpenEvidence(美國)
功能與定位。這一族的設計邏輯是「按問題難度配推理深度」:Osler 走廊上 5 秒給答案、Sackett 30 秒做會診級的證據彙整、Snow 5 分鐘做腫瘤會議級的文獻回顧,三者對全美臨床人員免費;Darwin 是研究預覽版的天花板模型,因雙重用途風險未開放(Becker's, 2026-09-08)。商業模式是「免費給醫師、靠流量變現」,而 9/30 的150 億美元估值買的是這個分發面。
- 優勢 :分層架構解掉一個真實的臨床痛點——走廊上問問題的人沒有 5 分鐘。四個分數在帳面上也確實是目前最高的一組:MedQA 100%、MedXpertQA 72.8%、HealthBench Professional 82.7%、NOHARM 87.2%。
- 疑慮 :這四個分數全部自測、自評、自發,沒有任何第三方重現。而 Nature Medicine 的頭對頭研究正好指出,專用臨床 AI 工具在醫師真實問題上表現沒比 Google AI 摘要好——那份研究沒具名測了誰,但它測的就是這個產品類別。
- 疑慮 :缺的那個數字是「臨床效用」。沒有任何公開資料顯示使用 Osler 或 Sackett 之後,診斷正確率、處置改變率或病人結果有什麼變化——分析者直接點出臨床準確度不等於臨床效用。缺就是缺。
GigaPath-Flash / GigaTIME-Flash
蒸餾式計算病理學基礎模型 · Microsoft Research(美國)· Apache-2.0
功能與定位。它不賣臨床判讀,它賣「讓病理 AI 跑得起來」。GigaPath-Flash(22M ViT-S tile encoder + 21M LongNet slide encoder)從十億參數的 GigaPath 蒸餾,做 whole-slide image 的 slide-level 表徵;GigaTIME-Flash 從 H&E 影像預測 21 通道的腫瘤微環境多重免疫螢光圖譜,兩者權重皆以 Apache-2.0 釋出、在大規模真實臨床資料上預訓練。客戶不是醫院的採購部門,是下游所有要在病理影像上做研究或建產品的人。
- 優勢 :效率數字可以被任何人重跑驗證,不需要相信廠商——50 倍更少算力留住 97% 表現、FLOPs 少 49.5 倍、PANDA 與 EBRAINS 平均 0.826,而 GigaTIME-Flash 的峰值 GPU 記憶體從 16.68 GB 降到 2.16 GB、吞吐量從約 390 拉到 1,679 tiles/秒。
- 優勢 :Apache-2.0 是商用可改可重散布的授權,不是「研究用途」這種半開放。這決定了它能不能真的被塞進別人的產品。
- 疑慮 :PANDA 與 EBRAINS 是研究資料集,不是前瞻臨床驗證;0.826 的平均分數離診斷等級還有距離,而「97%」是平均保留率,不保證每個下游任務都成立。所有數字來自作者自己的論文,尚無第三方重現。
兩者的對照就是今天的結論。OpenEvidence 的說服方式需要你相信一組它自己打的分數,而且那組分數衡量的是選擇題;GigaPath-Flash 的說服方式是給你一張算力帳單,而算力帳單沒有辦法作假——你跑一次就知道 2.16 GB 是真的還是假的。在一個量尺本身不可信的領域,後者這種「可被獨立重現的進步」的相對價值被嚴重低估了。
03 — Companies & Competition
| 公司 | 近況與數字 | 競爭定位與護城河 |
|---|---|---|
| OpenEvidence 醫師版 ChatGPT,想當臨床 OS |
9/30 募 2.5 億美元、估值 150 億美元,12 個月累計約 10 億美元;9/3 發表四模型家族,Darwin MedQA 100%。 | 護城河是醫師端的分發與習慣,不是模型——而模型這一側正被 Nature Medicine 的通用模型勝出結論與自評分數的質疑同時夾擊。 |
| Microsoft Research (HLS) 兩手都下:開權重模型 + 獨立基準 |
GigaPath-Flash/GigaTIME-Flash 以 Apache-2.0 釋出(97% 表現、1/50 算力);同時以 HealthAgentBench 的 54 個任務把前沿代理壓在 42%。 | 護城河是「同時擁有基礎設施與評分權」:把高效模型開源可以收割生態,把基準開源則讓它定義什麼算進步。弱點是這兩件事都不直接帶來營收,依賴 Azure 轉化。 |
| Google / DeepMind 開權重醫療模型的另一極 |
MedGemma 1.5(4B/27B)與 MedASR:MRI 判讀 65%(前版 51%)、CXR 解剖定位 IoU 從 3% 升到 38%、EHRQA 90%(前版 68%);MedASR 在胸部 X 光口述上詞錯誤率 5.2%,比 Whisper large-v3 的 12.5% 少 58%。研究與商用皆免費,上 Hugging Face 與 Vertex AI。 | 護城河是「免費 + 可商用 + 小尺寸」的組合,直接壓縮專用醫療模型新創的生存空間:當 4B 的開權重模型就能做 CT/MRI/病理與文件理解,向醫院賣一個封閉的影像判讀模型要多解釋很多事。 |
| Sophont 把評測開源的醫療 AI 新創 |
Medmarks v1.0:30 個 benchmark、61 個模型/71 配置、含訓練環境 Medmarks-T;指出 GLM 4.7 需 5 倍以上 token 才追平 GPT-5.2,且給模型計算器反而造成忽略工具、算錯或格式崩潰。 | 護城河是信譽而非技術:在一個廠商自評成常態的市場裡,「我的題庫與程式碼你全部拿去跑」本身就是差異化。弱點是它也是賣模型的公司,中立性終究有上限,而且維護一個 30×61 的榜單需要持續投入——MedAgentBench 停更在 5 月就是前車之鑑。 |
| Epic 掌握資料端的那一方 |
Comet 這組預測性 AI 模型訓練於 Cosmos 去識別化病歷的 1,000 億筆以上資料點,用來預測病人健康軌跡;本週 UGM 另宣布多項資安計畫。 | 護城河是資料與工作流的入口,不是模型品質——這也是為什麼 HealthAgentBench 的 42% 對它比對模型廠更重要:代理要能在 EHR 裡真的動手做事,才輪得到誰的模型更強這個問題。 |
今天的競爭結構是一個夾擠。上面被通用前沿模型壓住——Nature Medicine 說通用模型贏,Google 的 4B 開權重醫療模型免費可商用;下面被開源高效模型抬起來——Apache-2.0 的病理基礎模型用 1/50 算力就能跑。被夾在中間的,正是「封閉、專用、靠自己宣布分數」這個位置,而這恰好是本週募到 2.5 億美元的那個位置。這個矛盾不會立刻引爆,因為估值買的是醫師端的分發,不是模型;但它解釋了為什麼「沒人在獨立驗分」這件事會在這個時間點被提出來。
04 — Taiwan Angle
(1) 國際上缺的獨立驗分機制,台灣已經有制度雛形。衛福部在 2024 年 10 月 7 日啟動三大 AI 中心,其中「臨床 AI 取證驗證中心」與 TFDA 合作、預先組成醫院聯盟串接電子病歷資料,專門解決驗證數據蒐集困難;「負責任 AI 執行中心」要求公開 AI 模型、資料與效能等重要資訊;「AI 影響性研究中心」則與中央健保署合作建立臨床試驗機制評估效益,並據此建立「科學性的定價基礎」。啟動時共 30 家醫院提交 48 案,16 家醫院的 19 案通過決選,含臺大、中榮、北榮、成大等。把這套制度對照本週的爭議看——OpenEvidence 缺的不是技術,是這種「廠商以外的人來打分」的機構,而台灣的架構裡第二個中心的任務就是「公開模型、資料與效能」。制度存在不等於執行到位,但這是一個台灣難得領先於國際討論的位置。
(2) GigaPath-Flash 的算力帳單對台灣中小型醫院的意義比對醫學中心大得多。峰值 GPU 記憶體從 16.68 GB 降到 2.16 GB(arXiv 2607.18218v2)換算成採購,是「資料中心級顯卡」與「一張消費級顯卡」的差別。台灣的病理 AI 落地長期卡在區域醫院與地區醫院沒有算力也沒有 MLOps 人力,而 Apache-2.0 的授權允許商用、修改與再散布,意味著本土廠商可以直接拿去做成院內可部署的產品,而不是再談一次授權。配合TFDA 的智慧醫療器材資訊暨媒合平台,這條路徑比等一個封閉模型降價現實得多。
(3) 衛福部的生成式 AI 指引正好擊中本週的那個縫。衛福部已發布醫療機構應用生成式 AI 指引,以六大風險、九項要點建立治理框架,另有AI 醫療細則草案在研擬中。對照〈Right Words, Wrong Moment〉的發現——19,930 段對話裡的問題是「過早跳到解方」這類流程失誤,不是內容錯誤——台灣要訂的細則若只管「輸出內容對不對」,就會漏掉真正會傷到病人的那一類錯誤。治理文件應該要求的是互動流程的紀錄與可稽核,而不只是答案的正確率。
05 — Further Reading
-
General-purpose chatbots outperform clinical AI tools on physicians' real-world questions — Nature Medicine research briefing (2026-06-17)
兩頁的 briefing 比主文好讀,而「專用工具表現沒比 Google AI 摘要好」這一句是今天所有爭論的錨點。
-
Medical AI has a measurement problem — Nature, Arjun K. Manrai, Harvard Medical School (2026-07-28)
把「量尺不可信」這件事講成一個可以推理的問題,而不是一句抱怨;讀完會知道為什麼自評分數的爭議不是公關問題而是方法論問題。
-
HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments — arXiv:2606.31179 (2026-06-30)
想知道「醫療 AI agent」目前真實的能力上限,看這 54 個任務怎麼設計的比看任何一個分數都有用。
-
Release of Medmarks v1.0, technical report, and updated leaderboard — Sophont Blog (2026-05-12)
唯一一份把「開源模型要燒 5 倍 token」這種部署成本明確寫進評測結論的報告,對要選模型的人比排行榜名次有用。
-
OpenEvidence, TEMPO & No One's Watching — Grid Health (2026-09-22)
反方意見寫得最乾淨的一篇,而且它把 FDA 的 TEMPO 試點(從 4 家擴到 40 家)跟廠商自評放在同一個框架下看——兩者都在用「真實部署」取代「上市前獨立驗證」。
06 — References
- News 9/30/26. HISTalk, 2026-09-30. histalk2.com
- OpenEvidence, TEMPO & No One's Watching. Grid Health, 2026-09-22. gridhealth.io
- OpenEvidence's new model achieves 1st perfect score on medical AI benchmark. Becker's Hospital Review, 2026-09-08. beckershospitalreview.com
- Introducing the OpenEvidence Model Family. Business Wire, 2026-09-03. businesswire.com
- OpenEvidence launches 4 medical AI models for clinicians. MobiHealthNews. mobihealthnews.com
- General-purpose chatbots outperform clinical AI tools on physicians' real-world questions. Nature Medicine 32(7):2364–2365, 2026-06-17. DOI 10.1038/s41591-026-04457-9. nature.com
- General-purpose large language models outperform specialized clinical AI tools on medical benchmarks. Nature Medicine, 2026. nature.com · PubMed 42286322
- Manrai AK. Medical AI has a measurement problem. Nature, 2026-07-28. nature.com
- Liu Q, Zhang S, et al. (Poon H, corresponding). HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents. arXiv:2606.31179, 2026-06-30. arxiv.org
- Release of Medmarks v1.0, technical report, and updated leaderboard. Sophont Blog, 2026-05-12. sophont.med
- Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks. arXiv:2605.01417. arxiv.org
- GigaPath-Flash and GigaTIME-Flash: Efficient Pathology Foundation Models for Whole-Slide and Tumor Microenvironment Analysis. arXiv:2607.18218v2, Microsoft Research. arxiv.org
- MedAgentBench Benchmark Scores & AI Model Leaderboard. benchmarklist.com, last updated 2026-05-27. benchmarklist.com
- MedAgentBench: A Virtual EHR Environment to Benchmark Medical LLM Agents. NEJM AI, DOI 10.1056/AIdbp2500144. ai.nejm.org
- Stanford benchmarks AI agents in healthcare. Becker's Hospital Review, 2025-09-16. beckershospitalreview.com
- Right Words, Wrong Moment: A Clinician-Grounded Analysis of Distress in 19,930 Conversations between Young People and ChatGPT. arXiv:2609.35953, 2026-09. arxiv.org
- ARCagent: An Adaptive Retrieval Calibration Agent for Clinical Question Answering. arXiv:2609.36392, 2026-09. arxiv.org
- MERID: Multimodal Exploration via Recursive Self-Improvement Agents for Major Depression Analysis. arXiv:2609.36238, 2026-09. arxiv.org
- UltraBench 2: Towards Robust Evaluation of Vision Foundation Models on Ultrasound. arXiv:2609.28610, 2026-09. arxiv.org
- nnFoundation: 3D Foundation Models for Radiology. arXiv:2609.26924v1, 2026-09. arxiv.org
- 醫療 AI 行業日報 2026-09-30 / Medical AI industry daily digest. agents-radar, Issue #343. github.com
- 醫療 AI 行業日報 2026-09-29 / Medical AI industry daily digest. agents-radar, Issue #334. github.com
- From cloud to clinic: How AWS powers digital psychiatry at scale. AWS Industries Blog. aws.amazon.com
- Next generation medical image interpretation with MedGemma 1.5 and medical speech to text with MedASR. Google Research Blog, 2026-01-13. research.google
- google/medgemma-1.5-4b-it. Hugging Face. huggingface.co
- Epic Launches Comet: A New AI Platform to Predict Patient Health Journeys. HIT Consultant, 2025-09-03. hitconsultant.net
- 衛生福利部三大AI中心啟動記者會 / MOHW launches three AI centres. 衛生福利部, 2024-10-07. mohw.gov.tw
- 衛福部首發醫療GenAI指引 六大風險、九項要點建立治理框架. 環球生技月刊 / GBI Monthly. news.gbimonthly.com
- 厚生會成立智慧醫療委員會 衛福部擬提AI醫療細則草案. 中央社 / CNA, 2026-08-06. cna.com.tw
- 智慧醫療器材資訊暨媒合平台 / AI-ML Medical Device Information and Matchmaking Platform. TFDA. aimd.fda.gov.tw
- Insurers claim AI is already increasing healthcare costs. TechCrunch, 2026-09-26. techcrunch.com
Fastino-Nemotron-3.5-Lightning-Healthcare 的下載數在 9/29 為 6,825、9/30 為 6,707,兩者皆引自 agents-radar 日報,未與 Hugging Face 原站核對,本文採 9/30 的數字。(7)Medmarks 排行榜上的模型版本與 MedAgentBench 的榜首在發表後數月間可能已被超越,名次僅代表該榜單最後更新時的狀態。