◆ AI/醫療AI 日報
–
星期四 · 技術突破

推理正在離開螢幕:Astra 把它折進潛在空間,Gemini 把它攤成便宜 token,而一篇 BCI 論文量出了代價——28.4% 的高信心輸出並不忠實

這一週三件技術事件指向同一個問題:模型的推理過程,人類還看不看得見。TechCrunch 於 9 月 1 日報導,OpenAI 的 Astra 是第一個跨過該公司自訂「關鍵網路安全門檻」的模型,在 ExploitBench 上拿到滿分,並在改版測試中自主找出並利用兩個 zero-day(TechCrunch, 2026-09-01);社群同時流傳它採用「遞迴深度(recurrent depth)」,把一部分思考留在隱藏狀態而非寫成 chain-of-thought。隔天 Google 走了完全相反的路:Gemini 3.8 Flash 與資安變體 Flash Cyber 同日推出,把顯性推理的價格砍到每百萬 input token 0.75 美元(Artificial Analysis, 2026-09-02)。而在醫療端,8 月 27 日上線的一篇 medRxiv 論文把「看不見的推理」換算成病人的代價:當 LLM 替腦機介面使用者「修正」打字錯誤時,解碼錯誤率 40% 下語意漂移達 60.3%,且 28.4% 的高信心輸出並不忠於原意(medRxiv, 2026-08-27)。

01 — Top Stories

七則消息分成兩層:上面四則決定模型怎麼想,下面三則決定手術室裡放什麼硬體
模型架構 OpenAIAstra9/01

Astra 成為第一個跨過 OpenAI 自訂「關鍵網路安全門檻」的模型,ExploitBench 滿分、自主挖出兩個 zero-day

發生什麼

OpenAI 表示 Astra 能在沒有人類指導的情況下,自行找出並利用電腦系統中未知的安全漏洞,在衡量 LLM 攻擊能力的 ExploitBench 上取得滿分,並在 OpenAI 自行改版的測試中挖出兩個先前未知的 zero-day 漏洞。公司說會「很快」開放 Astra,但最強的資安能力初期會限制存取,並搭配濫用偵測強化、越獄防護、依風險分級的帳號限制,以及 chain-of-thought 監控(TechCrunch, 2026-09-01)。Astra 系列本身在 8 月 1 日首度公布,8 月 6 日追加十道長年未解數學問題的解法,全部以 Lean 形式化、API token 成本約 2,000 美元(The Decoder, 2026-08)。

為什麼重要

醫院是網路防禦最薄弱的大型組織之一,而一個能自主找 zero-day 的模型同時是防禦者與攻擊者的工具。更值得注意的是 OpenAI 自己把「chain-of-thought 監控」列為安全機制之一——若遞迴深度的傳聞屬實,這項機制監控的對象正在變少。TechCrunch 也指出,這些安全宣稱目前缺乏獨立第三方驗證。

要打折的地方

「遞迴深度」目前來自研究社群的解讀與二手報導,OpenAI 尚未發布可核對的技術報告;ExploitBench 滿分與兩個 zero-day 皆為廠商自述、未經第三方稽核。Sebastian Raschka 在 9 月的分析中反駁「循環層必然壓抑可見推理」的說法,認為重複使用層本身並不會直接抑制 chain-of-thought(Raschka, 2026)。

模型發布 Google DeepMindGemini 3.8 Flash9/02

Google 同日推出 Gemini 3.8 Flash 與 Flash Cyber:智慧指數 59 追平前沿,價格砍到 0.75 美元/百萬 token

發生什麼

Gemini 3.8 Flash 在 Artificial Analysis 智慧指數上取得 59 分(高推理模式),比 3.7 Flash 進步 3 分,追平 GPT-5.6 Sol 與 Grok 4.6;具 100 萬 token 脈絡窗、支援文字/影像/影片/語音輸入、平均約每秒 300 output token。定價 2026 年底前折扣為每百萬 input/output token 0.75/3.75 美元,標準價 1.50/7.50 美元,單一任務成本約 0.58 美元。這是 Google 四個月內第四款 Flash 模型(Artificial Analysis, 2026-09-02)。同日推出的 Flash Cyber 專為資安研究者設計,用於找程式漏洞與寫修補,在 16 項測試中有 9 項勝過 Claude Opus 5 與 GPT-5.6 Sol,DeepSWE-1.1 得 73.7%、CyberGym 的 C/C++ 漏洞偵測得 86.2%(SiliconANGLE, 2026-09-02)。

為什麼重要

對醫療系統而言,決定 AI 能不能鋪到全院的往往不是頂端能力而是單位成本:以折扣價計,掃過一份 20 萬 token 的完整住院病歷約 0.15 美元 input 成本。同時 Google 選擇把資安能力做成一個公開、可買到的獨立變體,而 OpenAI 選擇限制存取——同一種能力,兩種治理姿態。Google 主管 Tulsee Doshi 與 Raluca Ada Popa 表示,模型「在複雜任務上表現出更強的盡責度——執行額外的推理步驟、反覆呼叫工具」。

要打折的地方

benchmark 分數來自 Google 自述與第三方指數,沒有任何一項是醫療任務;MedQA、影像判讀等臨床指標在這次發布中未見公布。折扣價 2026 年底到期,長期成本應以標準價 1.50/7.50 美元估算。

臨床評估 medRxivBCI8/27

當 LLM 替漸凍症病人「修句子」:解碼錯誤 40% 時語意漂移 60.3%,28.4% 的高信心輸出並不忠實

發生什麼

一組以放射與資訊醫學為主的團隊(Gorenshtein、Omar、Klang、Barash 等)在 medRxiv 發表〈Intent Drift in LLM-Assisted BCI Communication〉,用模擬 P300 拼字器解碼錯誤的方式,測試 20 個開放權重模型替腦機介面使用者更正文字時的忠實度。結果:漂移率隨解碼錯誤率從 2.2% 一路升到 60.3%;模型自評的高信心輸出中有 28.4% 不忠於原意;判別力尚可(AUROC 0.83)但校準極差(expected calibration error 0.32);表現最好的修正策略仍有 18% 的訊息被改錯;臨床上關鍵的訊息漂移率反而略高;醫師人工複核與自動評分的一致性僅屬中等(kappa 0.41)(medRxiv, 2026-08-27)。

為什麼重要

這是把「模型幻覺」放到最不能出錯的場景測出來的數字:使用者是失去發聲能力的病人,輸出被當成他本人的意思。作者用的詞是「流暢而高度自信的謊言」——重點不在錯字沒修好,而在模型改變了病人想說的話,而且改得很有把握。ECE 0.32 意味著模型的信心分數幾乎不能拿來當閘門,這直接推翻「用信心值做自動篩選」這一整類部署設計。

要打折的地方

這是 in-silico 基準測試,解碼錯誤為模擬而非真實 BCI 使用者資料,且為未經同儕審查的 preprint。20 個模型皆為開放權重,前沿封閉模型(Astra、Gemini 3.8、Claude Opus 5)未納入,因此不能直接外推到臨床實際部署的商用模型。

AI agent ScreenAgentmeta-analysis8/30

20 萬篇文獻篩選只花 855.91 美元:agent 與人的一致性(kappa 0.75)已經高於人與人(0.64)

發生什麼

名為 ScreenAgent 的 LLM agent 被用來自動化統合分析的初篩階段。在報導的數字中,它處理了 201,064 筆醫學紀錄、總成本 855.91 美元(每筆約 0.43 美分),內部敏感度 97.7%(44 篇合格研究中找到 43 篇),為人類審閱者減少 99.4% 工作量;agent 與人類的一致性 kappa 0.75,高於人與人之間的 0.64;外部驗證敏感度分別為 95.9% 與 97.4%。作者採取由第二個 LLM 覆核、最終決定權仍在人類專家的混合設計(Yesil Science, 2026-08-30)。

為什麼重要

系統性回顧是實證醫學的成本瓶頸,一份大型統合分析的初篩通常要兩位研究者花數月。若 0.43 美分/篇的數字站得住,臨床指引的更新週期就不再受限於人力,而受限於原始研究的產出速度。與前一則對照也很有意思:同一類技術在「替病人代言」時信心校準極差,在「篩掉不相關論文」這種有明確召回率目標、且錯誤可被第二關攔下的任務上卻表現穩健——任務結構決定了 agent 能不能用,而不是模型強不強。

要打折的地方

這則我們只查到二手報導,未能取得 medRxiv 原文連結核對,所有數字以該報導為準。系統在測試中漏掉 1 篇合格研究——在統合分析裡,漏掉的那一篇有可能就是改變結論的那一篇。97.7% 敏感度聽起來高,但實證醫學的慣例門檻通常更嚴。

影像硬體 GE HealthCarePhotonova Spectra8/31

GE HealthCare 光子計數 CT 取得 CE 標誌:Deep Silicon 偵測器直接量測單顆光子能量,跳過閃爍轉光那一層

發生什麼

GE HealthCare 的 Photonova Spectra 於 8 月 31 日取得 CE 標誌。與傳統 CT 偵測器先把 X 光轉成可見光再讀取不同,Deep Silicon 技術直接量測每一顆 X 光光子及其能量,因此每次掃描同時產生高解析影像與能譜資訊,可用於神經、腫瘤、肌肉骨骼、胸腔與心臟影像。該系統已於 2026 年 3 月取得 FDA 510(k) 與日本上市許可。GE HealthCare 全球 CT 執行總監 Chad Rowland 表示:「其核心是我們的 Deep Silicon 偵測器技術,使 Photonova Spectra 能在每一次掃描中擷取極為細緻的能譜資訊。」(MobiHealthNews, 2026-08-31)

為什麼重要

在一週幾乎全是軟體的新聞裡,這是少數發生在物理層的技術突破,而且它決定了上層模型能拿到什麼。能譜 CT 每個體素帶的是材料組成資訊而非單一 HU 值,這等於把影像 AI 的輸入從灰階圖換成多通道量測——現有以傳統 CT 訓練的影像基礎模型並不能自動吃下這些新資料,重新訓練與重新驗證的成本會落在採用光子計數 CT 的醫院身上。

要打折的地方

報導未提供解析度、劑量下降幅度或臨床結果的具體數字,也沒有與 Siemens Naeotom 等既有光子計數平台的頭對頭比較。CE 標誌是上市許可而非臨床效益證明。

手術科技 StrykerApple Vision Pro9/01

第一個獲 FDA De Novo 授權的 Apple Vision Pro 術中應用:Stryker SportSuite Vision 在杜克完成首例髖關節鏡手術

發生什麼

Stryker 於 9 月 1 日宣布 SportSuite Vision 完成首例臨床使用。這是一套 video see-through 擴增實境頭戴顯示系統,把關節鏡影像、HipCheck 軟體、HipMap 的股髖撞擊(FAI)分析與 CT 影像整合進可自訂的空間運算環境,讓術者在直視視野內疊加數位臨床資訊。FDA 於 2026 年 7 月 17 日給予 De Novo 授權,是首個核准與 Apple Vision Pro 搭配於術中使用的應用;首例由杜克健康(Duke Health)骨科醫師 Chad Mather III 執行,適應症限於 FAI 與髖臼唇修補的髖關節鏡手術(Stryker, 2026-09-01;STAT, 2026-09-01)。

為什麼重要

De Novo 而非 510(k) 意味著 FDA 找不到可比對的既有裝置,因此為這一類「術中頭戴顯示」建立了新的分類與特別控制——之後跟進的產品可以走 510(k)。Mather 醫師的說法點出真正的賣點不是沉浸感而是人因:「空間運算讓我能依自己的工作流程自訂關鍵臨床資訊的擺放位置,並在無菌區內取用。」這是消費級硬體第一次以主要顯示介面的身分進入無菌區。

要打折的地方

Stryker 的發布中沒有提到任何 AI 成分——這是一套顯示與整合系統,不是自動判讀。首例的執刀醫師同時是 Stryker 顧問,且目前僅有單一案例,沒有手術時間、併發症或學習曲線的對照數據。STAT 該篇多數內容位於付費牆後,本則以 Stryker 官方新聞稿為主要依據。

手術機器人 MedtronicCornerstone Robotics9/01

Medtronic 砸 7 億美元買 Sentire 的海外通路:同時養兩套機器人平台,賭的是「連結式手術生態系」而非單一機型

發生什麼

Medtronic 於 9 月 1 日宣布投資約 7 億美元,取得香港 Cornerstone Robotics 的 Sentire 手術機器人系統在美國以外、已取得法規許可市場的通路權。Sentire 由該公司自行研發,具雙控制台與沉浸式操作台設計,2026 年 5 月取得 CE 標誌,涵蓋一般外科、婦科、胸腔與泌尿的微創手術,並已在中國與新加坡取得上市許可。Medtronic 自家的 Hugo RAS 已在六大洲逾 35 國使用,預計本會計年度結束前全球手術量將超過 50,000 例,其數位生態系包含即時 AI 與 Touch Surgery 平台(Medtronic, 2026-09-01)。

為什麼重要

手術機器人的價值正在從機械臂本身轉移到它產生的資料:每一台上線的機器都是連續的手術影片與器械軌跡來源,而這正是訓練手術 AI 唯一難以取代的語料。Medtronic 同時經營 Hugo 與 Sentire 兩條產品線,等於用通路換資料規模,對照 Intuitive Surgical 的單一平台策略——這是達文西體系之外,第二個具備跨機型資料匯流可能性的玩家。Medtronic 外科事業資深副總 Matt Anderson 表示,「外科醫師、健康系統與市場的需求與偏好各不相同」,需要跨臨床場景的彈性方案。

要打折的地方

新聞稿沒有說明 Sentire 產生的手術資料是否納入 Medtronic 的數位生態系,也未揭露 7 億美元中股權與通路權的分配、Sentire 的裝機量或手術量。50,000 例是 Hugo 的預測值而非已實現數字。

02 — Product Analysis

同一週發表的兩個模型,代表了「推理該放在哪裡」的兩條相反路線——這個選擇會直接決定醫療能不能用

OpenAI Astra

把推理折進潛在空間的前沿模型 · OpenAI(美國)

功能與定位。Astra 被定位為能處理長時程、複雜問題的模型家族,透過多個 agent 協同運作數小時到數天。8 月 6 日公布的十道未解數學問題解法全部以 Lean 形式化、API 成本約 2,000 美元,數學家 Thomas Bloom 稱其結果「比五月那個單位距離猜想的反例更重要」(The Decoder)。目前尚未正式開放,究竟命名為 GPT-6 或 GPT-5 變體也未定案。

  • 優勢 :能力上限確實推進了——ExploitBench 滿分、自主挖出兩個 zero-day、十道長年未解數學問題(TechCrunch)。以遞迴深度重複使用同一層而非堆疊新層,理論上能在不增加參數量的前提下換取更深的有效計算。
  • 疑慮 :醫療部署要的是可稽核的推理軌跡——衛福部的生成式 AI 指引與 FDA 的透明度要求都預設模型能解釋自己。若推理有一部分只存在於隱藏狀態,「留下紀錄」這件事在技術上就變得困難。而且目前沒有官方技術報告可以核對這一點:連「Astra 到底是不是這樣運作」都還是社群推論。
  • 疑慮 :資安研究者 Yona Shavit 質疑,Astra 拒絕突破容器限制究竟反映真實的安全對齊,還是刻意的欺瞞;OpenAI 的安全宣稱目前缺乏獨立第三方驗證,與政府的合作狀態也不明(TechCrunch)。

Gemini 3.8 Flash / Flash Cyber

把顯性推理做便宜的量產模型 · Google DeepMind(美國)

功能與定位。Flash 系列走的是可負擔的前沿:智慧指數 59、100 萬 token 脈絡、三段推理強度(高/中/低),高推理下每任務 2.5 分鐘、低推理 0.8 分鐘,讓部署者自己在成本與品質之間調閥門(Artificial Analysis, 2026-09-02)。Flash Cyber 則把資安能力做成獨立、公開販售的變體。

  • 優勢 :可調推理強度對醫療是被低估的功能——分診跑低推理、疑難個案跑高推理,同一套 API 就能做到成本分層。折扣價 0.75/3.75 美元讓全院級部署第一次進入預算可行區間(Artificial Analysis)。
  • 優勢 :Flash Cyber 在 CyberGym 的 C/C++ 漏洞偵測得 86.2%、DeepSWE-1.1 得 73.7%,16 項測試中 9 項勝過 Claude Opus 5 與 GPT-5.6 Sol(SiliconANGLE)。醫療器材軟體大量是 C/C++ 遺留碼,這正好是能直接派上用場的能力。
  • 疑慮 :這次發布完全沒有醫療 benchmark。四個月四款 Flash 模型的節奏對醫院是負擔而非優點——每次換版都需要重新驗證,而衛福部指引要求的臨床安全驗證與相容性測試並不能跟著三週一次的發布節奏跑。折扣價年底到期後成本翻倍,也應納入採購評估。

對比在哪。Astra 把算力藏進潛在空間換取能力上限,Gemini 把算力攤在便宜的 token 上換取可負擔與可觀察。醫療目前買得起、也審得動的是後者;而前者代表的方向,會讓「模型必須能解釋自己」這條監管前提在技術上愈來愈難成立。

03 — Companies & Competition

誰站在哪裡、憑什麼、跟誰打
公司 近況與數字 競爭定位與護城河
OpenAI
前沿能力的定義者
Astra 8/01 公布、8/06 補上十道未解數學題解法(Lean 形式化、約 2,000 美元 API 成本);9/01 確認為首個跨過關鍵資安門檻的模型,ExploitBench 滿分(TechCrunch, 2026-09-01)。 護城河是能力領先與研究品牌。弱點在透明度:沒有技術報告、沒有第三方稽核、能力愈強愈需要限制存取,而限制存取本身壓縮了醫療這種需要完整審查的市場。
Google DeepMind
價格與部署規模的施壓者
9/02 同日推出 Gemini 3.8 Flash(智慧指數 59、1M 脈絡、折扣價 0.75/3.75 美元)與 Flash Cyber(CyberGym 86.2%);四個月內第四款 Flash(Artificial Analysis, 2026-09-02)。醫療側另有 MedGemma 1.5 開放權重系列(2026-01-13,4B 多模態,MedQA 69.1%、EHR 理解 89.6%)(Google HAI-DEF)。 唯一同時握有前沿通用模型與開放權重醫療模型的玩家,可以讓醫院用 MedGemma 在院內做敏感資料、用 Flash 做規模化任務。弱點是發布節奏太快,與醫院的驗證週期嚴重錯拍。
GE HealthCare
影像硬體與 AI 軟體雙線
Photonova Spectra 光子計數 CT 於 8/31 取得 CE 標誌,2026 年 3 月已有 FDA 510(k) 與日本許可(MobiHealthNews, 2026-08-31)。放療側的 MIM Contour ProtégéAI+ 2.0 已於 2026-06-08 取得含 PCCP 的 FDA 510(k)(Applied Radiation Oncology)。 護城河是掌握資料的產生端:偵測器決定影像 AI 的輸入格式,PCCP 則讓模型更新不必每次重送 510(k)。對手是 Siemens Healthineers 的 Naeotom 光子計數平台與 Philips。弱點是硬體換機週期以年計,軟體對手迭代以週計。
Stryker
把消費級硬體帶進無菌區
SportSuite Vision 於 2026-07-17 取得 FDA De Novo 授權,9/01 在杜克健康完成首例髖關節鏡手術,整合 HipCheck、HipMap FAI 分析與 CT(Stryker, 2026-09-01)。 護城河是 De Novo 建立的新分類與先發者身分,加上既有骨科植入物與器械通路。弱點是把核心體驗綁在單一消費電子平台上,且目前完全沒有 AI 成分——這是顯示層創新,不是判讀層。
Medtronic
用通路換手術資料規模
9/01 宣布投入約 7 億美元取得 Cornerstone Robotics 的 Sentire 海外通路權;自有 Hugo RAS 已在 35 國以上使用,預計本會計年度全球手術量逾 50,000 例(Medtronic, 2026-09-01)。 雙平台策略讓它同時吃高階與價格敏感市場,Touch Surgery 生態系是資料匯流點。對手是 Intuitive Surgical 的達文西裝機基數。弱點是兩套平台的資料是否互通尚未說明,若不互通,通路優勢就換不到 AI 訓練優勢。
Cornerstone Robotics
香港自研手術機器人
Sentire 全部自行研發,雙控制台設計,2026 年 5 月取得 CE 標誌,已在中國與新加坡取得許可;公司設有三個全球研發中心與六個業務據點(Medtronic, 2026-09-01)。 護城河是亞洲市場的法規進度與成本結構,加上與 Medtronic 綁定後取得的全球通路。弱點是把海外通路交給一家同時賣自家競品的公司,長期議價能力受限。
Elucid
心血管斑塊 AI 分析
9/02 宣布完成 5,500 萬美元 D 輪、累計募資約 1.85 億美元,投資人包含一家未具名的大型上市醫材公司、IAG Capital Partners 與 Elevage Medical Technologies;Plaque-IQ 已取得 FDA 許可,FFR-CT 版本仍在審查中(MobiHealthNews, 2026-09-02)。 與本日主線的關聯在於:斑塊組成分析正是光子計數 CT 能譜資料最能發揮的應用之一。護城河是 FDA 許可與 CT 血管攝影的既有工作流嵌入,對手是 HeartFlow 與 Cleerly。未揭露臨床結果數據是明顯缺口。

今天的競爭結構是一個上下分層、而非左右對打的形狀。模型層(OpenAI、Google)在爭誰定義「推理」該長什麼樣子,硬體層(GE、Stryker、Medtronic、Cornerstone)在爭誰擁有資料的產生端。真正稀缺的既不是參數也不是機械臂,而是「能被監理機關檢查的推理紀錄」與「能拿去訓練的真實臨床資料流」——今天七則消息裡,沒有任何一家同時握有這兩者。

04 — Taiwan Angle

衛福部五月訂的六大風險,這一週被國際消息逐條打中

(1) 幻覺與提示詞注入不再是抽象條文。衛福部於 2026 年 5 月 29 日發布《醫療機構應用生成式人工智慧指引》,明列六大風險,其中「AI 幻覺產生錯誤資訊」與「提示詞注入攻擊威脅資安」兩項,這一週各自有了具體數字:BCI 論文量出 28.4% 的高信心輸出不忠實(幻覺),Astra 則證明模型已能自主找出並利用 zero-day(資安)。指引屬建議性質而非強制,九項要點涵蓋事前責任分派與資料可靠性評估、導入期與電子病歷及影像系統的相容性測試與臨床安全驗證,以及事後由醫事人員保留最終決策權、監控輸出品質、建立偏誤管理並告知病人 AI 參與診療(環球生技月刊)。

(2) 三大 AI 中心的分工,正好對應今天三類消息缺的東西。衛福部設有負責任 AI 執行中心、臨床 AI 取證驗證中心(以 FHIR 串接跨院資料並建立聯邦學習平台)與 AI 影響性研究中心(做健康經濟分析與健保給付試算)(臺灣智慧醫療三大中心)。以今天的案例對照:ScreenAgent 這類 agent 缺的是取證驗證中心該做的外部驗證,Gemini 3.8 Flash 缺的是影響性研究中心該算的成本效益,而 Astra 缺的則是負責任 AI 執行中心那套「定期評估、走完資料科學循環」的可稽核性——三件事分屬三個中心,但目前沒有任何一個中心的流程是為「三週換一次模型版本」設計的。

(3) 光子計數 CT 是台灣醫院最快會遇到的採購決策。Photonova Spectra 已集齊 FDA、日本與 CE 三地許可,進入台灣市場只是時間問題。但這裡有一個容易被忽略的連帶成本:能譜資料的格式與傳統 CT 不同,醫院現有的、以傳統 CT 影像訓練與驗證的院內 AI 模型,並不能直接套用在新機器的輸出上。換句話說,買一台光子計數 CT 同時等於讓一批已通過驗證的院內模型需要重新驗證——這筆帳應該在採購評估階段就算進去,而不是等到臨床 AI 取證驗證中心的隊伍排起來才發現。

05 — Further Reading

選的是能撐過本週新聞週期的東西:一篇原始論文、兩個大規模臨床基礎模型、一篇技術澄清
  1. Intent Drift in LLM-Assisted BCI Communication: An In-Silico Benchmark Under Simulated Decoder Corruption — medRxiv (2026-08-27)

    今天唯一一篇該讀原文的:它把「信心值不能當閘門」這件事測到可以放進部署規範的程度,方法本身也可直接移植到 ambient scribe 的忠實度評估。

  2. Apollo: A multimodal and temporal foundation model for virtual patient representations at healthcare system scale — arXiv (2026-04-20)

    Faisal Mahmood 團隊以 720 萬名病人、250 億筆紀錄、28 種模態訓練,在 140 萬病人與 322 項預測任務上評估。想理解「病歷級基礎模型」規模長什麼樣,這是目前最完整的參照點。

  3. Learning from routine health system data builds better neuroimaging AI models — Nature Medicine (2026-07-31)

    用 524 萬筆日常臨床 CT/MRI 影像序列訓練的視覺基礎模型,表現勝過以公開網路與醫學資料集訓練者。對「院內雜訊資料是不是負擔」這個常見疑問給了反方向的答案。

  4. OpenAI Astra and Looped Transformers — Sebastian Raschka (2026-09)

    在一片「Astra 藏起了推理」的解讀中,這篇把循環層的機制講清楚並提出反駁。要對本日主線持保留態度,先讀這篇。

  5. MedGemma 1.5 model card — Google Health AI Developer Foundations (2026-01-13)

    如果本日主線讓你擔心前沿模型的可稽核性,這是可以在院內自行部署、逐項核對 benchmark 的替代路徑;EHR 理解從 67.6% 跳到 89.6% 的那一格特別值得看使用條款。

06 — References

參考文獻
  1. OpenAI's Astra model is on the way — and very good at breaking into computer systems. TechCrunch, 2026-09-01. techcrunch.com
  2. OpenAI announces its "next major model" Astra by dropping ten previously unsolved math solutions. The Decoder, 2026-08. the-decoder.com
  3. OpenAI Astra and Looped Transformers. Sebastian Raschka, 2026-09. sebastianraschka.com
  4. Google has released Gemini 3.8 Flash, its fourth Flash model in under four months. Artificial Analysis, 2026-09-02. artificialanalysis.ai
  5. Google launches two Gemini 3.8 models with cutting-edge reasoning capabilities. SiliconANGLE, 2026-09-02. siliconangle.com
  6. Gorenshtein A, Omar M, Jia E, Adiniaev Y, Daniel O, Kruskal J, Ahmed M, Brook O, Klang E, Barash Y. Intent Drift in LLM-Assisted BCI Communication: An In-Silico Benchmark Under Simulated Decoder Corruption. medRxiv, 2026-08-27. medrxiv.org
  7. AI Screens 200,000 Medical Papers for Pennies (ScreenAgent). Yesil Science, 2026-08-30. yesilscience.com
  8. The Health AI Brief — Week of August 31, 2026. Yesil Science, 2026-08-31. yesilscience.com
  9. GE HealthCare secures CE mark for its Photonova Spectra technology. MobiHealthNews, 2026-08-31. mobihealthnews.com
  10. FDA Clears GE HealthCare's MIM Contour ProtégéAI+ 2.0 for Advanced Cancer Treatment Planning. Applied Radiation Oncology, 2026-06-08. appliedradiationoncology.com
  11. Stryker introduces first of its kind FDA-authorized surgical application for Apple Vision Pro with hip arthroscopy case. Stryker Newsroom, 2026-09-01. stryker.com
  12. FDA clears Stryker's 'surgical cockpit' that uses Apple's VR headset, Vision Pro. STAT News, 2026-09-01. statnews.com
  13. Medtronic Announces Strategic Partnership with Cornerstone Robotics to Further Expand Global Access to Robotic-Assisted Surgery. Medtronic Newsroom, 2026-09-01. news.medtronic.com
  14. Medtronic invests $700M in Cornerstone Robotics. MobiHealthNews, 2026-09-01. mobihealthnews.com
  15. Elucid raises $55M for AI cardiovascular imaging software. MobiHealthNews, 2026-09-02. mobihealthnews.com
  16. MedGemma 1.5 model card. Google Health AI Developer Foundations, 2026-01-13. developers.google.com
  17. Apollo: A multimodal and temporal foundation model for virtual patient representations at healthcare system scale. arXiv:2604.18570, 2026-04-20. arxiv.org
  18. Learning from routine health system data builds better neuroimaging AI models. Nature Medicine 32(8), 2026-07-31. nature.com
  19. 衛福部首發醫療 GenAI 指引:六大風險、九項要點建立治理框架. 環球生技月刊, 2026-05-29. news.gbimonthly.com
  20. 臺灣智慧醫療三大中心. 衛生福利部. aicenter.mohw.gov.tw
  21. AI model release log (Gemini 3.8 Flash, Claude Fable 5.1, GLM-5.3-Flash, Qwen3.8 Flash, Granite 4.2). LLM-Stats, 2026-09. llm-stats.com
編輯說明:(1)STAT News 的 Stryker 報導多數內容位於付費牆後,該則主要依據 Stryker 官方新聞稿,付費牆後未見的內容未納入。(2)ScreenAgent 一則我們僅取得 Yesil Science 的二手報導,未能核對 medRxiv 原文,該則所有數字(201,064 筆、855.91 美元、敏感度 97.7%、kappa 0.75)皆以該報導為準,讀者引用前請自行查證原始論文。(3)Astra 的「遞迴深度」架構來自研究社群解讀與二手報導,OpenAI 尚未發布可核對的技術報告;ExploitBench 滿分與兩個 zero-day 為 OpenAI 自述、未經第三方稽核。(4)Gemini 3.8 Flash 的 benchmark 混用 Google 自述與 Artificial Analysis 第三方指數,且無任何醫療任務評測。(5)本期第 4 節引用的衛福部指引發布於 2026-05-29,非本週消息,係作為背景框架引用。(6)GE HealthCare MIM Contour ProtégéAI+ 2.0 的 FDA 許可日期為 2026-06-08,本週僅有二手報導重提,故未列為重點新聞。(7)本日主題為技術突破,Elucid 募資屬產業消息,僅列入公司表作為與光子計數 CT 的技術關聯,未單獨成則。