醫療 AI 的新戰場:不是更大的模型,而是會自己動手的模型
本週醫療 AI 的技術主軸,正從「模型有多大、基準分數多高」轉向兩個更難的問題:模型會不會自己調度工具、協調流程,以及我們手上的基準到底可不可信。8 月 13 日 Hippocratic AI 發表 Polaris 星系架構的「代理協調層」——700B 主模型搭配 30 多個監督模型,目標是「協調整段照護」而非完成單一任務。兩天後,一篇 Translational Psychiatry(8/15)直接戳破另一端:65% 的思覺失調症 EEG AI 論文因資料洩漏把準確率灌水最多 30 個百分點。同一週的技術重點,一半在教模型「動手」,一半在提醒我們別被漂亮的數字騙了。
01 — Top Stories
Hippocratic AI 發表「代理協調層」:700B 主模型+30 多個監督模型,把醫療 AI 從「做任務」推向「顧結果」
Hippocratic AI 於 8 月 13 日發表新一代「Agentic Orchestrators」(代理協調器):不再是一支語音 AI 完成一件事,而是由一個「監督智能」決定「哪個專科代理、在什麼時機、用什麼方式」接觸每一位病人。底層是其專利的 Polaris 星系(constellation)架構——一個 700 億參數主模型,搭配 30 多個負責升級處理、用藥辨識與不良事件偵測的監督模型。首波推出 30 多個協調器,分屬支付方(8 個)、醫療提供者(8 個)與生技藥廠(18 個)三大客群(Unite.AI)。
這是「醫療 agent」從單點任務走向編排(orchestration)的代表案例,也是本週最能定義技術方向的一則。過去一年的醫療語音 AI 多半停在「打一通提醒電話」;把多個代理疊成一個由監督模型調度的系統,等於把賭注押在「以人群結果(再入院率、STAR 評分、慢病管理、臨床試驗招募)計價」的商業模式上。公司宣稱在 775,000 通電話、由 7,700 多名美國執照臨床人員審查中達到 99.89% 正確建議、零嚴重傷害,累積逾 2.5 億次病人互動。但這些是廠商自陳、非獨立第三方評估的數字,且在醫療語境下「99.89%」的剩餘 0.11% 落在哪裡,才是真正的臨床風險所在——這也正好呼應本期第 3 則對「漂亮數字」的警告。
Hippocratic AI(加州)由 Munjal Shah(執行長)與 Meenesh Bhimani(醫療長)創辦,累計募資 4.44 億美元,投資者含 Andreessen Horowitz、General Catalyst、Kleiner Perkins,以及 NVIDIA 的 NVentures 與 Google 的 CapitalG。產品為患者端對話式語音代理,非診斷或處方系統。
教模型「看哪裡、怎麼看」:7B 醫學視覺代理在 8 項 VQA 基準平均勝過 o3、Gemini 2.5 Pro、GPT-5
上海創智學院 LeapQuest 團隊與浙江大學、上海交通大學、復旦大學提出 Ophiuchus(影像)與 MedScope(影片)兩個醫學 AI 代理,論文獲 ICML 2026 接收(2026 年 5 月 27 日公開)。核心是「Think with Images/Videos」範式:模型在推理過程中主動調用視覺工具——Ophiuchus 用 SAM2 做精細分割、BiomedParse 定位醫學結構、再 zoom-in 放大關鍵區域;MedScope 先建立全局理解,再用 crop_video 截片段、get_frame 抓關鍵影格,把局部觀察整合回答案。
這是「視覺證據驅動優於單純堆規模」的一個乾淨證明。Ophiuchus-7B 在 8 個醫學 VQA 基準平均 68.0 分、工具調用準確率 97.9%,勝過 OpenAI-o3(62.2)、Gemini 2.5 Pro(61.8)與 GPT-5(59.9)——一個 70 億參數的專用代理,靠「會看片」贏過數千億參數的通用旗艦。對醫療影像特別關鍵:診斷錯誤常源於「沒看對地方」,而讓模型像放射科醫師一樣主動放大、分割、比對,比單純把整張圖丟進去更貼近臨床推理。對算力受限的醫院與國家,小模型+工具的路線也更可負擔。
研究由上海創智學院(Shanghai Institute for Advanced Study)LeapQuest 團隊主導,跨浙大、上海交大、復旦(36 氪報導)。屬學術研究成果,本報告未見商業化或臨床取證的公開資訊,不做推測。
65% 的思覺失調症 EEG AI 論文把準確率灌水最多 30 分:一篇論文戳破整個子領域的「基本算術」
Frigyes Sámuel Rácz 與 Gábor Csukly 於 Translational Psychiatry(2026 年 8 月 15 日)系統檢視以 EEG(腦波)診斷思覺失調症的深度學習研究,指出多數研究因資料洩漏(data leakage)把準確率高估。最常見的錯誤是依「epoch(腦波片段)」而非「病人」切分訓練/測試集——結果模型學到的是「個人腦波指紋」而非「疾病標記」;另一種是在切分前就做特徵選擇,讓模型提前看到測試資料。號稱 95% 以上準確率的模型,在正確方法下大幅崩落(Yesil Science 報導)。
這則是本週技術主軸的另一端,也是對第 1、2 則所有「亮眼分數」的必要冷水。高達 65% 的已發表論文含這類管線錯誤、灌水幅度可達 30 個百分點,意味著一整個子領域的「SOTA」可能建在流沙上。這正是 Nature 7 月〈醫療 AI 有量測問題〉一文的具體個案:當基準本身不可信,比較模型高下就失去意義。實務含意很直接——採購或導入任何醫療 AI 時,「準確率數字」若沒有說清楚切分是否依病人、特徵選擇是否在切分之後,該數字基本上不能當真。
Pillar-0:全開源 CT/MRI 基礎模型,新架構比 ViT 快 150 倍,全面勝過 MedGemma、微軟 MI2、阿里 Lingshu
UC Berkeley 與 UCSF 研究團隊釋出 Pillar-0 醫學影像基礎模型(2025 年 11 月 20 日)。核心是新的 Atlas 神經網路架構,直接處理 3D 影像體積而非逐張 2D 切片,處理一份腹部 CT 比傳統 vision transformer 快 150 倍以上。模型可從單一 CT/MRI 辨識數百種病徵,涵蓋胸部 CT、腹部 CT、腦部 CT 與乳房 MRI。程式碼、訓練權重、評估與資料管線全部公開釋出。
這是「開源 + 效率架構」路線最有力的一個代表,值得在技術週特別點名。Pillar-0 在 366 項任務、四種模態上以 0.87 AUC(涵蓋 350 多種病徵)全面勝過 Google MedGemma(0.76)、微軟 MI2(0.75)與阿里 Lingshu(0.70)超過 10 個百分點,肺癌預測較 Sybil-1 進步 7%,且用僅 25% 的訓練資料就達到優異的腦出血偵測。它的意義有三:一是「直接吃 3D 體積」的架構把速度與資料效率同時拉高;二是完全開源讓醫院與研究者可以在地驗證、微調,而不必受制於大廠 API;三是它直接把幾家大廠的醫療影像模型放上同一張對照表,讓「誰真的強」有了可複現的量尺——恰好與第 3 則的基準可信度主題互補。
由 UC Berkeley 計算、資料科學與社會學院(CDSS)與 UCSF 研究者共同開發(Berkeley CDSS 公告)。被比較對象為 Google MedGemma、Microsoft MI2、Alibaba Lingshu 三個廠商模型。
NVIDIA 推 BioNeMo Agent Toolkit:把「博士級研究助理」的工具交給 AI 代理,虛擬篩藥從數天壓到數分鐘
NVIDIA 發表 BioNeMo Agent Toolkit(2026 年 6 月 23 日),把十餘年累積的生命科學函式庫、工具與開放模型整合成「AI 代理可直接呼叫」的平台。組件包含 BioNeMo 模型與框架、NIM 微服務、用於推理的 Nemotron 開源模型、NeMo RL 強化學習庫、以及 Parabricks 基因體加速。代理可以生成並篩選化合物、做分子對接、預測結合強度、過濾類藥性,把虛擬篩選的時程從數天壓縮到數分鐘。
如果第 1 則是「臨床照護的代理」,這則就是「科學研發的代理」——同一個技術範式(讓 LLM 調度專用工具)延伸到藥物發現。Jensen Huang 的定調很清楚:「前沿模型是大腦,BioNeMo 是科學工具箱,合起來給 AI 代理一個博士級研究助理的技能」。採用名單橫跨前沿實驗室(Anthropic、OpenAI、Owkin、Edison Scientific)、藥廠(Eli Lilly、Natera)、資料平台(Databricks、Snowflake、Benchling)與 AI 原生生技(Boltz、Chai Discovery),逾 50 家公司部署。這強化了本週的共同主線:2026 年的醫療 AI 競爭,關鍵不只是模型,而是模型能調度多完整的工具鏈。
NVIDIA Healthcare/BioNeMo;合作與採用方見上(NVIDIA 新聞稿)。工具鏈以 NVIDIA 自家開源模型(Nemotron)與微服務(NIM)為底,商業模式綁定其運算平台。
MedGemma 1.5 與 MedASR:4B 開放多模態醫學模型升級,醫療語音辨識錯誤率較 Whisper 少 58–82%
Google Research 釋出 MedGemma 1.5(4B)與醫療語音辨識模型 MedASR(2026 年 1 月 13 日),皆可在 Hugging Face 與 Vertex AI 免費用於研究與商業。MedGemma 1.5 4B 在多項醫學任務較 v1 明顯進步:MRI 判讀 51%→65%、實驗室報告擷取 F1 60%→78%、MedQA 推理 64%→69%、CT 分類 58%→61%。MedASR 針對臨床口述,在胸部 X 光口述上錯誤率 12.5%→5.2%(少 58%),跨科別口述 28.2%→5.2%(少 82%)。
MedGemma 系列是目前最被廣泛採用的開放醫學模型基底之一,也是本期第 4 則 Pillar-0 的直接對照組(Pillar-0 在影像上勝過 MedGemma,但 MedGemma 提供的是可微調的通用多模態底座)。值得關注的是 MedASR:醫療語音辨識的錯誤在臨床上代價極高(把 mg 聽成 mcg、把否定聽成肯定),而它把跨科別錯誤率壓到 5.2%、相對 Whisper large-v3 大減,對「AI 病歷書寫/臨床口述」這個當前最大落地場景很關鍵。放在技術週,它示範了「小而專、開放可微調」的另一條可行路線。提醒:此為 1 月釋出、屬本期技術背景,非本週新聞,日期已標示。
Google Research/DeepMind,Health AI Developer Foundations 系列;27B 版仍供複雜文字任務使用(Google Research 部落格)。
AgentClinic:把靜態考題變成互動診間,MedQA 準確率在多輪對話下掉到不到原本的十分之一
AgentClinic(npj Digital Medicine,2026 年 4 月 27 日)是一套多模態代理基準,用「病人代理/醫師代理/檢驗代理/裁判代理」四方系統,把 LLM 放進模擬診間,測其在資訊不完整下的循序臨床決策——問診、調度檢查工具、多輪對話、跨九科七語、23 種認知偏誤。資料取自 USMLE、MIMIC-IV 病歷與 NEJM 案例挑戰,含 215 般案例、120 多模態、260 專科、749 多語言案例。
它精準點出「考試分數」與「臨床能力」的鴻溝:同一批 MedQA 題目搬進循序互動格式後,準確率掉到原本的不到十分之一。也就是說,一個在靜態選擇題拿高分的模型,未必會問診、會在資訊不足時追問。研究也顯示工具的效果因模型而異(Llama-3 用 notebook 工具相對進步達 92%,有些模型反而退步),且非英語案例表現普遍較弱。放在本週脈絡:當醫療 AI 全面轉向「代理」,我們也需要「代理級」的基準——而 AgentClinic 這類設計,正是評估第 1、2、5 則那些代理系統時該用的尺,而不是舊的選擇題準確率。
02 — Product Analysis
Hippocratic AI Polaris Orchestrators
患者端語音代理 · 星系架構 · Hippocratic AI(美國)
功能與定位。由監督智能調度 30 多個專科語音代理,針對慢病管理、再入院預防、STAR 評分、臨床試驗招募等「人群結果」運作,屬非診斷、非處方的患者互動層(Unite.AI)。
- 優勢 :架構把安全檢查做成獨立層——700B 主模型外掛 30 多個監督模型負責升級、用藥與不良事件偵測,比單一大模型更可稽核。
- 優勢 :規模與資本到位——逾 2.5 億次互動、4.44 億美元募資,且以結果計價的商業模式與支付方誘因對齊。
- 疑慮 :99.89%、零嚴重傷害皆為廠商自陳、非獨立評估;在醫療語境下,剩餘 0.11% 的分佈與嚴重度才是關鍵。
- 疑慮 :代理編排的失敗模式(誰在什麼時候聯繫病人)比單一任務更難追責,且尚無公開的前瞻臨床終點試驗佐證結果宣稱。
Pillar-0 (Atlas architecture)
3D 影像基礎模型 · 全開源 · UC Berkeley × UCSF(學術)
功能與定位。直接處理 3D CT/MRI 體積、從單次掃描辨識數百種病徵;程式碼、權重、評估與資料管線全開源,供醫院與研究者在地部署與微調(Berkeley CDSS)。
- 優勢 :效率架構是真突破——Atlas 處理腹部 CT 比 ViT 快 150 倍以上,且用 25% 資料就達優異腦出血偵測,資料效率極高。
- 優勢 :在 366 項任務上以 0.87 AUC 領先 MedGemma/MI2/Lingshu 逾 10 分,且完全開源,沒有 API 綁定與資料出境問題。
- 疑慮 :AUC 是回顧性內部評估,非前瞻臨床試驗;「讀片準」離「改變病人結局」仍有距離(見第 3、7 則的基準警示)。
- 疑慮 :開源模型的臨床落地仍需各院自行負責法規取證、驗證與維運,門檻不在授權費,而在院內的驗證能量。
03 — Companies & Competition
| 公司/系統 | 技術主張與證據 | 競爭定位 |
|---|---|---|
| Hippocratic AI Polaris 代理協調層 |
700B 主模型+30 多監督模型;99.89% 正確、零嚴重傷害(廠商自陳,775K 通電話),無公開前瞻試驗。 | 患者端語音代理的規模領先者,護城河在部署量與結果計價模式;競爭者為 Abridge、Ambience 等(多聚焦文書)。 |
| Google DeepMind MedGemma 1.5 / MedASR |
開放多模態底座+醫療 ASR;MRI 65%、MedQA 69%、ASR 錯誤率較 Whisper 少 58–82%。 | 以「可免費微調的通用底座」搶開發者生態;被 Pillar-0 在純影像上超越,但勝在多模態廣度與雲端整合。 |
| NVIDIA BioNeMo Agent Toolkit |
50 多家藥廠與實驗室採用,虛擬篩藥從數天到數分鐘;含 Nemotron 開源模型與 NIM 微服務。 | 不做終端模型,做「代理工具鏈+運算平台」;護城河在 CUDA 生態與生命科學函式庫的深度,綁定其硬體。 |
| UC Berkeley × UCSF Pillar-0 (Atlas) |
全開源 3D 影像模型;0.87 AUC、366 任務領先逾 10 分,比 ViT 快 150 倍(回顧性評估)。 | 學術開源路線,直接對打大廠影像模型;優勢在效率與可近性,劣勢在缺乏商業化支援與前瞻臨床證據。 |
04 — Taiwan Angle
(1) 「小模型+工具」與開源路線,對資源有限的台灣醫院更可行。本期第 2、4 則(Ophiuchus-7B、Pillar-0)共同指向一件事:70 億參數的專用代理與全開源影像模型,能在特定任務上贏過數千億參數的通用旗艦。這對沒有大型 GPU 叢集、又擔心資料出境的台灣醫學中心特別有意義——與其付昂貴 API、把病人影像送出雲端,不如在院內以開源模型微調、驗證、部署。衛福部「臨床 AI 取證驗證中心」的角色,正好可以是這條路線的把關者與加速器。
(2) 醫療語音辨識與繁中臨床 NLP,是被低估的在地機會。MedASR(第 6 則)把英文醫療口述錯誤率壓到 5.2%,但繁體中文與台語混雜的臨床口述幾乎沒有對應的高品質模型與基準。台灣的病歷長期中英混寫(結構化欄位英文、描述中文),這既是導入國際模型的落差來源,也是本土可以建立護城河的地方——一個好的繁中醫療 ASR 或臨床 NLP 基準,價值不亞於再訓一個影像模型。這與「333 政策」推動的病歷資料標準化與互通目標天然互補:資料先一致,語言模型才有東西可學。
(3) 「代理熱潮」需要資料基礎建設先到位——台灣的順序其實走對了。第 1、5 則的代理協調,前提是能安全調度跨系統的資料與工具;沒有互通的資料底層,agent 只能在單一孤島裡打轉。衛福部部長石崇良在高醫大論壇(2026/6/27)提出「333 政策」與 489 億元「健康台灣深耕計畫」預算,目標年底前醫學中心病歷互通、兩年內擴及區域與地區醫院;同場也點名高醫附醫與鴻海合作、以 NVIDIA 為底開發「全台首例大腸癌 AI 代理」。把「資料互通」放在「代理落地」之前,其實正是本期國際技術新聞給出的正確順序——只是台灣還缺一塊給付設計,讓這些代理有可持續的商業模式。
05 — Further Reading
-
MedGemma Technical Report — arXiv:2507.05201
想理解一個開放醫學多模態模型如何訓練、如何評估的最佳單一入口,也是對照 Pillar-0 架構選擇的必要背景。
-
AgentClinic: a multimodal benchmark for tool-using clinical AI agents — npj Digital Medicine, 2026/4/27
若你只讀一篇「代理級評估」的論文,就是這篇。它把「考試分數 ≠ 臨床能力」量化得最清楚,是評估本期所有代理系統的正確尺。
-
Data leakage inflates schizophrenia EEG-AI accuracy — Translational Psychiatry, 2026/8/15
本週最該讀的方法學警訊。任何在做醫療 AI 驗證或採購的人,讀完會對「準確率數字」永遠多一分警惕。
-
NVIDIA launches BioNeMo Agent Toolkit — NVIDIA Newsroom, 2026/6/23
要看「代理如何延伸到藥物發現」的完整組件清單與採用者名單,這是第一手來源;也能感受「工具鏈綁運算平台」的商業邏輯。
-
State of Open Models: Summer 2026 — Hugging Face
把本期第 4、6 則放進更大脈絡:2026 年開源模型的整體版圖、授權與能力演進,對思考「台灣該押哪條開源路線」很有幫助。
06 — References
- “Hippocratic AI Announces Next Generation of Healthcare AI: Orchestrators Focused on Outcomes, Not Tasks.” PR Newswire (Hippocratic AI press release), 2026-08-13. prnewswire.com
- “Hippocratic AI Launches Agentic Orchestrators That Coordinate Voice AI Teams for Healthcare Outcomes.” Unite.AI, 2026-08. unite.ai · IT Digest. itdigest.com
- 「7B 打敗 o3、GPT-5,醫學 AI 智能體讓模型學會『看哪裡、怎麼看』」(Ophiuchus/MedScope, ICML 2026),36 氪,2026-05-27。36kr.com/p/3827353790059143
- Rácz, F. S., Csukly, G. “Data leakage and inflated diagnostic performance in EEG-based deep learning for schizophrenia.” Translational Psychiatry, 2026-08-15. doi.org/10.1038/s41398-026-04315-9 · “AI schizophrenia tests are failing basic math.” Yesil Science. yesilscience.com
- “UC Berkeley and UCSF researchers release top-performing AI model for medical imaging” (Pillar-0 / Atlas). UC Berkeley CDSS, 2025-11-20. cdss.berkeley.edu
- “NVIDIA Announces BioNeMo Agent Toolkit — Tools for Agents to Accelerate Scientific Discovery.” NVIDIA Newsroom, 2026-06-23. nvidianews.nvidia.com
- “Next generation medical image interpretation with MedGemma 1.5 and medical speech to text with MedASR.” Google Research Blog, 2026-01-13. research.google · “MedGemma Technical Report.” arXiv:2507.05201. arxiv.org/html/2507.05201v4
- “AgentClinic: a multimodal benchmark for tool-using clinical AI agents.” npj Digital Medicine, vol. 9, art. 499, 2026-04-27. nature.com/articles/s41746-026-02674-7 · project page agentclinic.github.io
- “Medical AI has a measurement problem.” Nature, 2026-07-28. nature.com/articles/d41586-026-02125-z
- “The Health AI Brief — Week of August 17, 2026.” Yesil Science. yesilscience.com/the-brief-2026-08-17
- “State of Open Models: Summer 2026.” Hugging Face. huggingface.co/blog/state-of-open-models-summer-2026
- 「高醫大論壇揭示 AI 醫療新局!衛福部推『333 政策』 國家 489 億預算力挺」,聯合新聞網,2026-06-27。udn.com/news/story/7266/9592218 · 臺灣智慧醫療三大中心 aicenter.mohw.gov.tw