◆ AI/醫療AI 日報
–
星期四 · 技術突破

答對不等於做對:這一週三份醫療 AI 技術成績單,全部卡在「過程能不能查」

技術突破這一節通常在寫「又高了幾分」。這一週不是。CliniCARE-Bench 在 8 月 7 日把 16 個 agentic 系統丟進 750 個真實病歷衍生的稽核情境,四分類準確率落在 65.3–76.1%——聽起來還行,但作者另外算了一個「無瑕疵準確率」(只有答案正確**且**推理過程沒有使用被禁止的捷徑才算分),數字直接掉 4.8 到 14.8 個百分點。同一個月,EHR-Complex 用 5.2 萬題測出最佳模型 62.3% 的 exact-match,但 k=4 時幾乎所有模型的 Pass^k 一致性都跌破 50%;而 Nature Biomedical Engineering 在 8 月 17 日刊出的 ConceptCLIP,索性把「解釋」直接寫進預訓練目標,用 2,300 萬組影像–文字–概念三元組換一個能被醫師逐項查核的模型。三份成績單指向同一件事:醫療 AI 的技術前緣,已經從「準不準」移到「查不查得動」。

01 — Top Stories

八則消息,三條技術線:把解釋寫進預訓練、把稽核寫進評測、把代理寫進病歷系統
開源基礎模型 HKUSTConceptCLIP8/17

ConceptCLIP:2,300 萬組「影像–文字–概念」三元組,把可解釋性從事後補丁變成預訓練目標

發生什麼

香港科技大學陳浩(Hao Chen)團隊於 8 月 17 日在 Nature Biomedical Engineering 發表 ConceptCLIP,並同步公開 MedConcept-23M——一組 2,300 萬筆生醫「影像–文字–概念」三元組。與一般對比式視覺語言預訓練只做影像與整段文字對齊不同,ConceptCLIP 額外做「區域–概念」對齊,讓模型在輸出診斷的同時指出它依據的是影像哪一塊、對應到哪一個醫學概念。評估橫跨 78 個資料集、10 種影像模態(胸部 X 光、CT、MRI、乳房攝影、病理全玻片、內視鏡、超音波、皮膚科、視網膜等),其中 68 個為公開資料集、9 個為私有資料集,另新整理 PMC-9K(9,222 組影像–文字配對)。模型權重上架 Hugging Face、程式碼放在 GitHub,資料集說明檔置於 Hugging Face Datasets。

為什麼重要

過去兩年醫療影像基礎模型的可解釋性幾乎都靠事後方法:Grad-CAM 熱區圖、注意力視覺化、或叫大語言模型「解釋一下」。這些方法的共同問題是解釋與決策不同源——模型怎麼算是一回事,事後產生的說法是另一回事。ConceptCLIP 的作法是把概念對齊放進損失函數,讓解釋成為模型本身表徵的一部分。論文附帶的臨床醫師使用者研究(跨三種影像模態)顯示,這種概念式解釋確實幫助醫師驗證預測、找出潛在錯誤——這一點比 benchmark 分數更值得注意,因為它回答的是「解釋有沒有用」而不是「模型有沒有解釋」。

要打折的地方

78 個資料集裡有 9 個是私有資料,外部團隊無法完整重現該部分結果。使用者研究只涵蓋三種模態,未涵蓋全部十種。論文未公布模型參數量與訓練算力細節;MedConcept-23M 在 Hugging Face 上釋出的是說明文字(captions)而非全部原始影像,實際重建需自行取得來源影像。

評測基準 CliniCARE-BenchMIMIC-IV8/07

CliniCARE-Bench:16 個 agentic 系統答對七成,扣掉「抄捷徑」後最多再掉 14.8 個百分點

發生什麼

一支橫跨多個機構、含史丹佛 Nigam H. Shah 在內的團隊於 8 月 7 日釋出 CliniCARE-Bench(arXiv:2608.07796)。它把 25 個經臨床醫師驗證的回溯稽核情境,實例化成 750 個以 MIMIC-IV 真實病人資料衍生的個案,要求系統輸出四種判決之一:Yes、No、Indeterminate(資料不足)、Indeterminate(醫學上本就模稜兩可)。16 個 agentic 系統的四分類準確率落在 65.3–76.1%;但論文另外定義「defect-free accuracy」——只有判決正確且推理過程未使用被明文禁止的捷徑才計分——這個數字比四分類準確率低 4.8 到 14.8 個百分點。

為什麼重要

兩個設計值得學界抄走。第一,把「資料不足」與「醫學上模稜兩可」拆成兩個不同的判決選項——現行大多數醫療 QA benchmark 只有對錯二分,逼模型在資訊不足時硬猜,反而獎勵了自信的錯誤。第二,defect-free accuracy 這個指標把評測從「輸出對不對」推進到「過程可不可接受」。這正是稽核(audit)與問答(QA)的根本差別:稽核要求的是可被複核的推理鏈,不是一個剛好正確的結論。對照 8 月稍早 Nature Medicine 上 Microsoft Research 與 Scripps 團隊的發現——前緣模型在關鍵視覺資訊被移除後仍能維持準確率,代表它們根本沒在看影像——會發現這是同一個病灶的兩種顯影。

要打折的地方

arXiv 預印本,尚未經同儕審查。論文摘要未逐一列出 16 個受測系統的名稱與各自分數,因此無法從公開摘要判斷哪一家模型掉最多。25 個情境全部來自 MIMIC-IV(美國單一醫學中心的加護資料),對台灣或歐洲醫療體系的可轉移性未經驗證。

評測基準 EHR-ComplexAnt GroupZhejiang Univ.

EHR-Complex:5.2 萬題、3,800 次失敗歸因,最佳模型 62.3%,重跑四次一致性跌破五成

發生什麼

Yitong Qiao 等人的 EHR-Complex(arXiv:2606.23301)建立在 MIMIC-IV 之上——36.5 萬名病人、31 張資料表、逾 5 億筆紀錄——生成約 5.2 萬個任務,涵蓋六類臨床意圖,同時支援病人層級與族群層級查詢。代理必須在沙箱中實際執行 SQL 或 Python 才能作答。最佳模型的 exact-match 為 62.3%;更關鍵的是 k=4 時幾乎所有受測模型的 Pass^k 一致性都低於 50%。作者分析逾 3,800 次失敗,歸納出三類主因:SQL 邏輯錯誤、醫療代碼查找失敗、語意理解偏差。

為什麼重要

Pass^k 是這篇論文最該被引用的部分。它問的不是「跑一次會不會對」,而是「同一題連跑 k 次會不會每次都對」。62.3% 的單次準確率在 demo 影片裡看起來可用,但一個在同一問題上四次有兩次以上答不一致的系統,不可能拿去做院內的品質指標計算或健保申報稽核——那些場景要的是可重現,不是期望值。這也解釋了為什麼「醫療代碼查找失敗」會單獨成為一個失敗類別:ICD-10 與 SNOMED 的層級關係不是靠語言模型的常識可以推的,是要查表的,而模型偏偏很擅長把查表的動作用語言蒙混過去。

要打折的地方

同樣是 arXiv 預印本(6 月 22 日投稿),未經同儕審查。任務由程式生成,與真實臨床人員實際會問的問題分佈可能不同。作者群多來自螞蟻集團與浙江大學,受測模型清單與是否包含自家模型,需查閱全文確認。

可解釋性 MITColumbiaStanford8/04

同一份解釋,醫師受益、外行被騙:Nature Medicine 證明 XAI 沒有「通用」這回事

發生什麼

由哥倫比亞大學生物醫學資訊系 Orson Xu 領銜,合著者包括 MIT 的 Marzyeh Ghassemi 與史丹佛的 Roxana Daneshjou,8 月 4 日於 Nature Medicine 發表皮膚疾病診斷的可解釋 AI 研究。受試者分為一般民眾與基層醫師兩組,在有/無各種 XAI 輔助(含信心分數、相似影像推薦、熱區圖、大語言模型文字解釋)的條件下進行診斷。結果呈現明顯分歧:一般民眾的準確率確實提升,但提升來自對 AI 的順從——他們不論解釋正確與否都相信 LLM 的說法,而且「愈含糊的解釋愈有說服力」;醫師則在只給預測、不給解釋時表現最好,他們能抓出 AI 的錯誤,也不會被錯誤輔助帶偏。MIT News 引述研究者的結論:「同一份解釋可以幫助專家,也可以誤導初學者。」

為什麼重要

這篇對前面兩則 benchmark 是一記反向刺拳。CliniCARE-Bench 與 ConceptCLIP 都假設「解釋愈好愈安全」,這篇則指出解釋的效果取決於接收端的鑑別力:對有能力反駁的人,解釋是查核工具;對沒能力反駁的人,解釋是說服工具。監理與產品設計的意涵很直接——同一個模型輸出,給醫師版與給病人版必須是兩套 UI,不是同一套換字體。而在 OpenAI 已把 ChatGPT Health 直接接上病患的病歷入口、消費端醫療 AI 使用者絕大多數是非專業人士的當下,「愈含糊的解釋愈有說服力」這個發現,是整份研究裡最該讓產品經理坐立不安的一句。

代理架構 EpicCosmosAgent Factory8/17–20

Epic UGM 2026 的技術面:把生成式模型架在 3.2 億人的資料上,把代理工廠交給不會寫程式的人

發生什麼

Epic 於 8 月 17–20 日在威斯康辛州 Verona 舉行年度使用者大會(逾 2 萬人到場、約 500 場議程;Fierce Healthcare 記錄 8,400 人實體出席、含線上約 7 萬人參與)。三個技術產物:Curiosity,以 Cosmos 資料訓練的生成式模型,用於預測再入院、中風風險等結果,2027 年 3 月起開放給有貢獻資料的 Cosmos 成員機構,Cosmos 現有規模為 3.2 億病人、230 億次就診;Agent Factory,可不寫程式建置與編排代理的平台,內建 120 個以上預製代理,2027 年廣泛上線,早期採用者 ECU Health 用一個彙整轉院請求的代理,估計每週省下 20 小時;Ergo / Ergo Visit,AI 原生的臨床介面,2026 年 11 月上線,看診準備功能可調用 3.2 億筆去識別化病歷。

為什麼重要

把 Curiosity 跟今天前三則放在一起看,會看到一個尷尬的錯位:學界正在把評測標準推向「過程可稽核、重跑要一致」,而產業界最大的一次押注是一個以生成式架構做風險預測、且訓練資料規模大到無法逐案追溯的模型。這不是說 Epic 做錯——3.2 億人的縱貫資料是全世界少數幾家拿得到的資產——而是說,當 Curiosity 2027 年 3 月開始輸出再入院風險分數時,CliniCARE-Bench 那套「defect-free accuracy」的問法會直接落到它頭上。Agent Factory 的風險更具體:120 個預製代理 × 無需寫程式 × 各院自行客製,等於把代理的安全邊界從單一廠商的責任分散到數千家醫院的設定畫面上,而 EHR-Complex 的 Pass^k 結果已經告訴我們,同一個代理跑四次不一定給同一個答案。

要打折的地方

ECU Health「每週省 20 小時」與 Ask Emmie 在 Sutter Health「省下 1,000 客服工時」皆為採用機構自述,未經第三方稽核。Curiosity 與 Agent Factory 都還沒上線(分別為 2027/3 與 2027 年),目前所有描述均來自廠商簡報,沒有任何獨立驗證的效能數字。兩個出席人數版本互相矛盾(2 萬 vs 8,400 實體),本報同時列出,未作取捨。

語音技術 SukiEpic / Meditech8/25

Suki 反向操作:在環境式聽寫當紅的年頭,把「口述」重新做成 API

發生什麼

AI 病歷代筆公司 Suki 於 8 月 25 日推出 Suki Dictation,原生內建於 Epic 與 Meditech,可單獨部署或與 Suki for Clinicians 併用,並以 API 與 SDK 形式提供給第三方健康科技產品整合。與被動錄音的環境式代筆不同,這個產品讓醫師以打字或語音指令主動編輯,把內容放到病歷的指定位置。試用者 Witham Medical Group 胸腔重症科醫師 Edward Mintz 表示每天至少省下 1–2 小時。產品長 Abhi Pathak 的說法是:「我們不是靠把人鎖進更大的套裝來取勝,而是要讓醫師自由選他真正需要的東西。」公司同時預告下一代串流語音辨識、對話式語音編輯、AI 輔助處置紀錄等功能。

為什麼重要

這是一個值得注意的技術路線分歧。過去三年的主流敘事是「環境式 AI 會吃掉口述市場」——醫師什麼都不用做,AI 聽完自動成稿。Suki 反過來把口述做成可嵌入的元件,賭的是另一件事:當代筆的成稿仍需醫師大幅修改時,真正的瓶頸不是「能不能生成」,而是「能不能精準地改」。把 dictation 拆成 API,等於承認語音在臨床工作流裡是一個原子操作,而不是一個完整產品。這個判斷也解釋了為什麼 Suki 選擇不綁定套裝——在 Epic 自己推出 Ergo 與 Agent Factory 的當下,任何試圖與 Epic 正面競爭「完整工作流」的第三方廠商都在打一場輸面很大的仗,而做成別人都要用的元件是更安全的位置。

要打折的地方

「每天省 1–2 小時」是單一試用醫師的自述,樣本數為一,未經任何對照或時間動作研究。新聞未揭露定價、辨識字錯誤率(WER)、可用語言,也未說明有多少機構已簽約。

技術治理 JAMAUPenn8/17–18

JAMA 觀點文章主張:一旦 AI 明顯超越醫師,強制 human-in-the-loop 反而會鎖死較差的照護

發生什麼

賓州大學醫學倫理與衛生政策系 Ezekiel J. Emanuel 為通訊作者的 JAMA 觀點文章(DOI 10.1001/jama.2026.15380)於 8 月 17 日刊出,題為「Will Autonomous AI Exceed AI-Aided Physicians as the Best Medical Care?」,EurekAlert 同日發布新聞稿。The Decoder 於 8 月 18 日的整理列出文中援引的證據:Google 的 AMIE 在模擬對話中勝過基層醫師;ChatGPT o3 在複雜個案首次即給出正確診斷的比率為 60%,內科醫師為 15.9%;GPT-4 單獨作答的診斷推理得分 92%,而可使用 AI 的醫師為 76%。文章主張,要求醫師最終核可的法規,可能在 2030 年前把較差的照護模式制度化。共同作者包括 Curai Health 執行長 Neal Khosla,其父為 OpenAI 與 Curai 的投資人。

為什麼重要

把這篇跟今天的皮膚科 XAI 研究並排,會出現一個很難迴避的問題。Emanuel 等人引用的「GPT-4 單獨 92%、醫師加 AI 只有 76%」,與 Nature Medicine 觀察到的「醫師在只給預測時表現最好、給了解釋反而更差」,其實可能是同一個現象的兩種讀法:人機協作的損失不見得來自人類拖累模型,也可能來自介面設計把人放在錯的位置上。這兩種歸因會導向完全相反的政策——一種說「把人拿掉」,一種說「把介面重做」。在證據幾乎全來自模擬而非真實照護的前提下,前者是遠比後者更難撤回的賭注。

要打折的地方

這是觀點文章(viewpoint),不是原始研究。作者自己承認幾乎所有證據來自模擬情境而非實際病人照護,且侵入性處置仍需醫師執行。兩位作者對自主 AI 的普及具有直接財務利益,屬於必須在閱讀時折現的利益衝突。JAMA 原文位於付費牆後,本節數字引自 EurekAlert 新聞稿與 The Decoder 的二手整理,非取自原文全文。

基礎建設 Nordic AI-HealthNature Medicine8/14

北歐六國把國家級縱貫健康資料做成聯邦式 AI 平台,寫成一份技術白皮書投進 Nature Medicine

發生什麼

由 Ole A. Andreassen 領銜、共 22 位作者的 Nordic AI-Health Initiative 論文於 8 月 14 日刊登於 Nature Medicine,副標即為「技術基礎、資料資產、部署路線圖」。作者群橫跨挪威、瑞典、丹麥、芬蘭、冰島與愛沙尼亞,目標是建立一個聯邦式(federated)的北歐健康生態系:資料不集中搬移,在符合法規的前提下讓 AI 模型到資料所在處運算,用以支撐可泛化的醫學 AI 開發。

為什麼重要

值得台灣讀者注意的不是技術新穎度——聯邦式學習不是新概念——而是排序。北歐的作法是先把跨國資料治理與標準寫定,再談模型;這與台灣衛福部先建 FHIR Box、再談 AI 應用的路徑幾乎一致(見台灣視角一節)。相對地,Epic 的 Cosmos 是把 3.2 億人的資料集中在單一廠商手上,靠規模取勝。這兩種架構的差別會在未來幾年具體化為兩件事:誰能做出跨體系可泛化的模型,以及當模型出錯時誰負責——集中式有明確的問責對象,聯邦式則把責任分散在各參與國的治理框架裡。

要打折的地方

論文屬於基礎建設藍圖與路線圖性質,可公開取用的部分未載明各國資料資產的確切筆數,也未列出具體里程碑日期。本節不引用未經證實的規模數字。

02 — Product Analysis

兩個開放權重的醫療多模態模型,兩種完全不同的成功定義

ConceptCLIP

概念對齊的可解釋生醫視覺語言模型 · 香港科技大學(香港)

功能與定位。ConceptCLIP 是為「醫師要能查核」而設計的通用生醫影像編碼器,不是為了刷榜。它以 MedConcept-23M(2,300 萬組影像–文字–概念三元組)做聯合的影像–文字與區域–概念對齊,在 78 個資料集、10 種影像模態上評估。買家是醫院資訊部門與想在受監理環境部署影像 AI 的團隊——需要向稽核者說明模型依據的場景。

  • 優勢 :解釋與決策同源。概念對齊寫在訓練目標裡,不是事後生成的說法;跨三種模態的臨床醫師使用者研究顯示醫師確實能靠它抓出模型錯誤。
  • 優勢 :權重與程式碼公開(GitHub、Hugging Face),可在院內私有環境自行部署,資料不需外送。
  • 疑慮 :78 個評估資料集中有 9 個私有,外界無法完整重現;論文未公布參數量與訓練算力,導入者難以估算硬體需求。今天的 Nature Medicine 皮膚科研究也提醒:概念式解釋對醫師有用,不代表對病患端有用。

MedGemma 1.5

Google 開放權重醫療多模態模型 · Google(美國)

功能與定位。MedGemma 1.5 建立在 Gemma 3 之上,2026 年 1 月 13 日更新,目前提供 4B 多模態版本,涵蓋 3D 醫學影像(CT/MRI 立體判讀)、全玻片病理、縱貫影像比較、解剖定位框、以及病歷與醫療文件理解。官方模型卡公布的數字:CT 巨觀準確率 61.1%(前代 58.2%)、MRI 64.7%(前代 51.3%)、MIMIC 胸部 X 光 macro F1 89.5%、EHRQA 病歷理解 89.6%。買家是開發者——它是 Health AI Developer Foundations 生態的起手式。

  • 優勢 :4B 參數即可跑 3D CT/MRI 與病理全玻片,部署門檻遠低於同級模型;MRI 從 51.3% 跳到 64.7% 是這一代最實在的進步。
  • 疑慮 :可解釋性仍是事後方法,模型卡上找不到「醫師能否據此查核」的使用者研究。此外授權受 Health AI Developer Foundations 條款約束,並非標準開源授權,商業部署前必須逐條看。
  • 疑慮 :61.1% 與 64.7% 這種量級的準確率,在放射科實務裡離「可獨立作業」還很遠。Nature Medicine 的前緣模型穩健性研究更指出,這一類 VQA benchmark 本身在測什麼就眾說紛紜。

03 — Companies & Competition

誰站在哪裡、憑什麼、跟誰打
公司/團隊 近況與數字 競爭定位與護城河
Epic Systems
美國最大 EHR 廠商
UGM 2026 發表 Curiosity(2027/3)、Agent Factory(2027,120+ 預製代理)、Ergo(2026/11)。Cosmos 規模 3.2 億病人、230 億次就診;急症照護 EHR 市佔 43.7%、逾 3,700 家醫院、3.25 億人病歷(Fierce Healthcare)。首個德國客戶 Charité 合約約 2 億歐元(HealthTech HotSpot)。 護城河是資料規模加工作流鎖定,沒有第二家拿得到同等縱貫資料。薄弱處在稽核:Cosmos 太大,無法逐案追溯訓練來源,而學界的評測標準正朝反方向走。
Google
開放權重醫療模型供給者
MedGemma 1.5(2026/1/13 更新)4B 多模態版,CT 61.1%、MRI 64.7%、MIMIC CXR macro F1 89.5%、EHRQA 89.6%(官方模型卡)。AMIE 在模擬對話中勝過基層醫師,被 JAMA 觀點文章列為自主 AI 的證據之一(The Decoder)。 走的是「免費模型換生態位」:讓全世界的醫療 AI 新創建在 HAI-DEF 之上,再從雲端與工具鏈收租。弱點是授權非標準開源,且缺少醫師可查核性的實證。
HKUST / ConceptCLIP
學術團隊,開放權重
MedConcept-23M(2,300 萬三元組)、78 資料集、10 模態、PMC-9K(9,222 對),權重與程式碼公開(Nature BME, 2026-08-17)。 不與大廠比參數,比「能不能被查核」。這在歐盟 AI Act 與 FDA 對生成式醫材的審查邏輯下是有價值的差異化,但學術團隊缺乏維運、版本管理與法遵支援,實際落地需靠廠商包裝。
Suki
AI 病歷代筆與語音元件
8/25 推出 Suki Dictation,原生內建 Epic 與 Meditech,並以 API/SDK 供第三方整合;試用醫師自述每日省 1–2 小時(Fierce Healthcare, 2026-08-25)。 刻意不與 Epic 正面爭工作流,改當所有人都要用的語音元件。護城河薄——語音辨識本身已商品化——但通路位置(原生內建兩大 EHR)短期難被複製。
長佳智能(6841)/遠傳(4904)
台灣醫療 AI 與系統整合
長佳智能持有約 57 張國內外醫材許可證,2026 上半年營收 1 億 6,710 萬元,毛利率由 57.8% 拉升至 73.1%;遠傳為 FHIR 智慧醫療資料平台的主要系統整合夥伴(蕃新聞, 2026-08-24)。 護城河來自政策時程而非技術:FHIR Box 的三階段推進(2026 醫學中心/2027 區域與地區醫院/2028 診所與衛生所)決定了誰先接上管線。風險同樣來自政策——時程延後,估值先受傷。

把這一節收束成一句話:今天的競爭結構,是「資料規模」與「可查核性」兩條軸線正在分岔。Epic 與 Google 在規模那一端各自佔住位置——一個靠 3.2 億人的縱貫資料,一個靠免費權重換生態位;ConceptCLIP 這類學術產物則押在另一端,賭監理與臨床採用最終會要求「說得出依據」。台灣的位置比較特別:既沒有 Cosmos 等級的資料,也沒有頂尖模型團隊,但衛福部先做資料標準再談應用的順序,剛好站在可查核那一端。

04 — Taiwan Angle

當國際技術前緣移向「可稽核」,台灣剛好把地基蓋在那一邊

(1) FHIR Box 的價值,正好是今天三則 benchmark 指出的缺口。衛福部推動的 FHIR Box 是一層「醫療通用作業層」,讓醫院不必改動既有系統即可標準化交換病歷,目的是讓 AI 模型能跨院運作,而不必為每一家醫院客製。三階段時程為:2026 年底完成醫學中心之間的病歷互通、2027 年底擴及區域與地區醫院、2028 年延伸到診所與衛生所(蕃新聞, 2026-08-24)。CliniCARE-Bench 與 EHR-Complex 揭露的失敗類型——醫療代碼查找失敗、跨表縱貫推理不穩定——本質上是資料語意不一致造成的,而 FHIR 標準化正是在處理這一層。台灣的技術機會不在做出更大的模型,而在成為少數能提供「標準化、可追溯、跨院一致」評測環境的地方。

(2) 8 月 21 日衛福部與羅氏診斷簽署合作備忘錄,第一波瞄準慢性腎臟病。合作內容為以 AI 預警延緩腎病惡化,背景是台灣逾 9 萬名透析病人。值得注意的是衛福部官員強調的順序:先建立資料標準與治理框架,再部署 AI 工具。目前長庚、馬偕、中山三家醫學中心已能透過 FHIR Box 即時共享病歷以支援 AI 臨床應用(中央社, 2026-08-21)。這個順序與 Nordic AI-Health Initiative 幾乎一致,也與 Epic 集中式 Cosmos 的路徑相反——對一個健保資料完整但單一機構規模有限的體系來說,聯邦式是比較務實的選擇。

(3) 但今天的 XAI 研究對台灣的病人端應用是一記警告。Nature Medicine 的結論是外行人會被含糊的解釋說服。台灣正在推的慢性病 AI 預警若最終要面向病人(例如透過健康存摺或 App 推播腎功能惡化風險),介面設計必須假設接收者無法反駁模型——這與給腎臟科醫師看的版本應該是兩套產品。此外,長佳智能(6841)2026 上半年營收 1 億 6,710 萬元、毛利率 73.1% 的數字(蕃新聞)反映的是政策紅利期,投資判斷應扣掉時程風險:FHIR Box 三階段任一階段延後,最先受影響的就是靠政策時程定價的標的。

05 — Further Reading

五篇文章,都在回答同一個問題:我們到底在測什麼
  1. Medical AI has a measurement problem — Nature (2026-07-28)

    哈佛醫學院 Arjun K. Manrai 的評論,把今天三則 benchmark 的共同焦慮寫成一句話:技術跑得比我們衡量它的能力更快。讀完再回頭看 defect-free accuracy 這類指標的設計動機,會清楚很多。

  2. Evaluating the robustness and readiness of large frontier models in health AI applications — Nature Medicine (2026-06-26)

    Microsoft Research 與 Scripps 的 32 人團隊發現:抽掉關鍵視覺資訊,前緣模型的準確率竟然不掉。這是今天所有「答對不等於做對」討論的實證起點。

  3. The benefits of medical AI assistance vary based on user expertise — MIT News (2026-08-04)

    Nature Medicine 皮膚科研究的白話版,比論文摘要更清楚地說明實驗設計與四種 XAI 條件的差異。做病人端產品的人應該直接讀這一篇。

  4. Will Autonomous AI Exceed AI-Aided Physicians as the Best Medical Care? — JAMA (2026-08-17)

    今年最會被引用、也最該連同利益衝突聲明一起讀的一篇。無論同不同意,它把「human-in-the-loop 是保護還是拖累」這個問題正式擺上檯面。付費牆後,可先看 EurekAlert 新聞稿。

  5. An AI-Health infrastructure for the Nordic region — Nature Medicine (2026-08-14)

    對台灣最有參考價值的一篇:一份把跨國健康資料治理寫成工程規格的文件。想理解 FHIR Box 未來三年會遇到什麼問題,看別人已經寫下來的路線圖最快。

06 — References

參考文獻
  1. An explainable biomedical foundation model via large-scale concept-enhanced vision–language pretraining. Nature Biomedical Engineering, 2026-08-17. nature.com
  2. ConceptCLIP — code repository. GitHub. github.com
  3. MedConcept-23M dataset captions. Hugging Face Datasets. huggingface.co
  4. CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR. arXiv:2608.07796, 2026-08-07. arxiv.org
  5. EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning. arXiv:2606.23301, 2026-06-22. arxiv.org
  6. Divergent impacts of explainable AI for dermatological diagnosis on clinicians versus lay people. Nature Medicine, 2026-08-04. nature.com
  7. The benefits of medical AI assistance vary based on user expertise. MIT News, 2026-08-04. news.mit.edu
  8. Epic expands AI ambitions with agent platform, Cosmos-powered predictions and deeper workflow automation. Fierce Healthcare, 2026-08. fiercehealthcare.com
  9. Epic UGM 2026 Recap: Cosmos Curiosity, EpicOps and an Expanding AI Footprint. HealthTech HotSpot, 2026-08. healthtechhotspot.com
  10. AI scribe Suki rolls out AI-driven clinical dictation tool. Fierce Healthcare, 2026-08-25. fiercehealthcare.com
  11. Will Autonomous AI Exceed AI-Aided Physicians as the Best Medical Care? JAMA, 2026-08-17. DOI 10.1001/jama.2026.15380. jamanetwork.com
  12. Will autonomous AI exceed AI-aided physicians as the best medical care? EurekAlert!, 2026-08-17. eurekalert.org
  13. As AI beats doctors, regulators shouldn't force a human into the loop, JAMA piece says. The Decoder, 2026-08-18. the-decoder.com
  14. An AI-Health infrastructure for the Nordic region: technical foundations, data assets, and a roadmap for deployment. Nature Medicine, 2026-08-14. nature.com
  15. Evaluating the robustness and readiness of large frontier models in health AI applications. Nature Medicine, 2026-06-26. nature.com
  16. Medical AI has a measurement problem. Nature, 2026-07-28. nature.com
  17. MedGemma 1.5 model card. Google Health AI Developer Foundations, 2026-01-13. developers.google.com
  18. MedGemma: Our most capable open models for health AI development. Google Research Blog. research.google
  19. Introducing ChatGPT Health. OpenAI. openai.com
  20. 衛福部攜手羅氏推 AI 醫療 首波瞄準慢性腎臟病照護. 中央社 CNA, 2026-08-21. cna.com.tw
  21. 台灣醫療 AI 掀全國基建!FHIR Box 串聯跨院 長佳智能、遠傳受惠. 蕃新聞 Yam News, 2026-08-24. n.yam.com
  22. STAT Health Tech: FDA promises new AI guidance, and Epic UGM updates. STAT News, 2026-08-25. statnews.com
  23. This Week in European HealthTech, MedTech and Health AI: 21st August 2026. healthcare.digital, 2026-08-21. healthcare.digital
編輯說明:本期主線集中在 8/04–8/27 的技術性發表,其中兩則(CliniCARE-Bench、EHR-Complex)為 arXiv 預印本,尚未經同儕審查,已在各則中標註。JAMA 觀點文章與 STAT News 均位於付費牆後,本報僅根據公開可見的標題、摘要、EurekAlert 新聞稿及 The Decoder 的二手整理撰寫,未取得原文全文;該文兩位共同作者對自主 AI 普及具直接財務利益,已在文中揭露。Epic UGM 2026 的所有效益數字(ECU Health 每週 20 小時、Sutter Health 1,000 客服工時、Ask Emmie 帳單訊息減少 73%)皆為採用機構或廠商自述,未經第三方稽核;Curiosity 與 Agent Factory 尚未上線,無獨立驗證的效能數據。UGM 出席人數有兩個互相矛盾的版本(逾 2 萬人 vs 8,400 人實體),本報同時列出未作取捨。Suki Dictation 的「每日省 1–2 小時」為單一試用醫師自述,樣本數為一。ConceptCLIP 的 GitHub 與 Hugging Face 連結取自 Nature 論文的程式碼與資料可得性聲明。台灣段落的長佳智能財務數字引自蕃新聞報導,非取自公司財報原件,投資判斷請以公開資訊觀測站為準。MedGemma 1.5 為 2026 年 1 月釋出,非本週消息,列入產品分析僅作為 ConceptCLIP 的對照組。