模型可以變小,責任不能變輕
從模型縮小、虛擬細胞到機器人與資料保留,AI 的下一場競賽不只是能力,而是誰能驗證、叫停並承擔後果。
這一批訊息看似分散:有人說模型不必再靠無限堆大,有人讓腫瘤樣本先回答哪一種藥可能有效,有人展示會跳舞的機器人卻還沒讓它穩定上班,也有人為了安全把客戶資料保留 30 天。它們其實都在問同一件事:當系統越來越快,誰還能確認它做對了、知道它何時該停,並替結果負責?

模型可以變小,回報才開始被看見
Ilya Sutskever 在 Dwarkesh Patel 的訪談把 2020 到 2025 年稱為「規模時代」:加更多資料、算力與參數,通常就能換來更好的結果。但他也指出,資料終究有限,模型在真實工作上的泛化能力仍遠不如人;當規模已經大到難以再用一百倍硬體換來同等級的躍升,瓶頸就會回到研究方法本身。
DeepSeek 的 V4.1-Flash 官方說明提供了一個具體案例:5520 億參數的 MoE 模型,讀取輸入時每個 token 啟用 80 億參數,生成時啟用 160 億參數;官方並稱它在多項測試中領先 V4-Pro,從 9 月 14 日起把原本送往 V4-Pro 的請求暫時導向 Flash。這些是廠商對自家模型的說法,不等於所有第三方評測都已完成,但它清楚展示了競爭焦點正在從「總共有多大」移到「每次工作實際動用了多少」。
這個轉向對代理系統尤其重要。長提示、工具輸出與程式碼庫會讓輸入端很肥,模型若能用更少的活躍參數處理它們,成本與延遲就會改變;但效率不是品質保證。真正該重測的是模型在自己最常做的工作上能否泛化、能否被觀測,以及換了底層模型後,原本的控制條件是否仍然成立。
🛎️ 要點:參數總量是規格表,活躍計算、真實任務表現與可回溯性才是產品責任。
先讓腫瘤回答,病人不必替模型試錯
Nature 的報導介紹一個針對三陰性乳癌的虛擬細胞模型。這種癌症約占乳癌病例的 15% 到 20%,腫瘤在分子層次差異很大,卻缺少可直接對應的標靶藥物;臨床上常常只能先治療,再看病人如何反應。
背後的原始研究以超過 3800 萬筆、跨時間的蛋白質測量訓練 ProteinTalks,讓模型預測不同藥物與組合對細胞的反應。研究團隊報告,它對訓練資料未包含的 81 種藥物達到 88% 的細胞反應預測準確率,並在 501 名病人的腫瘤切片分析中,預測實際接受化療後的臨床結果。這仍是研究成果,不是任何人的個別用藥建議,也不是可以跳過醫師與臨床試驗的自動處方。
真正值得注意的不是又一個更高的分數,而是試錯位置改了:模型先在腫瘤的蛋白質資料上排名候選藥物,病人不再是唯一的實驗場。要讓這種改變進入醫療,還需要外部驗證、適用族群界線、失敗案例與清楚的臨床決策責任;「預測得準」與「足以改變治療」之間,仍隔著一整套制度。
🛎️ 要點:AI 可以把部分試錯移到資料與模型裡,但不能把醫療責任一起移走。

機器人能上台,還不能算上班
KRRO 轉載的 Reuters 報導指出,Boston Dynamics 明年在美國上市的可能性不高,因為 Atlas 尚未大規模部署,公司也仍未獲利。報導引述資料稱,Boston Dynamics 2025 年虧損約 5284 億韓元,2021 到 2025 年累計虧損接近 1.7 兆韓元;Hyundai 的目標是 2028 年建立年產 3 萬台機器人的產能,分析師則認為 2029 或 2030 年上市更合理。
這不是在否定 Atlas 的動作能力,而是在區分兩種完全不同的證據:舞台上的一次成功,與工廠裡每天重複、可維護、出錯可接管的工作。真正的商業化指標會是長時間運轉的完成率、人工介入次數、停機原因與維修成本,而不是影片有多流暢或估值有多漂亮。
當機器人還在累積第一批可靠的工作資料,市場卻先替它標上未來收入,估值就跑到了產品前面。機器人可以跳舞、奔跑、吸引資金;但能不能打卡,取決於它是否能在沒有人盯著的時候持續完成任務。
🛎️ 要點:展示能力是入場券,穩定工作、可被接管與能算清成本,才是交付。
安全不能一邊保護世界,一邊保留客戶秘密
Anthropic 的 Covered Models 政策說明,為了分析跨請求的濫用模式,指定模型的 prompts 與 outputs 預設會保留 30 天;若內容被安全系統標記或有法律要求,可能保留更久。政策自 2026 年 6 月 9 日起生效,也指出部分設有零資料保留環境的組織可能獲得啟用 ZDR 的安排。官方的理由是安全偵測需要把多次請求放在一起看,但這也代表「不用客戶資料訓練」和「完全不保留客戶資料」不是同一個承諾。
CNA 轉載的 Reuters 報導指出,Palantir 要求不可撤銷的零資料保留保證,Nvidia 將該模型限制在較不敏感的工作,Booz Allen Hamilton 則禁止員工用它處理專有的資安工作。這些是媒體引述的企業反應,不代表所有客戶都離開;但它們共同說明一個採購現實:安全機制若需要更多資料,資料所有人就會要求更強的邊界、合約與稽核紀錄。
模型供應商不能只說「我們是為了安全才看得更久」。企業真正要問的是:誰能看、何時能看、保留多久、客戶能否撤回,以及規則改變時誰必須通知。安全不是一句動機宣告,而是一套可以被客戶檢查和拒絕的操作條件。
🛎️ 要點:能偵測風險不等於能取得保管秘密的授權;安全設計必須同時讓人相信模型與供應商。

八則短訊:產品開始把邊界寫進預設值
- Cloudflare 的官方說明表示,9 月 15 日起新網域的更新預設值會在含廣告頁面阻擋 Training 與 Agent 類爬蟲,同時保留 Search 類爬蟲;內容授權開始變成網站的預設設定。
- Perplexity 的產品報導稱,GPT-6 Astra 被用來編輯生產程式碼、監看線上系統與草擬對外溝通,人工檢查點因此減少;這描述的是產品方向,不代表所有部署都適合無人值守。
- Cognition 的 SWE-2 公告宣稱,新編程模型在 FrontierCode 1.1 Main 達到 50.0%,並以比 Fable 5.1 低 64% 的成本推進能力/成本前沿;這是公司自己的評測與定價主張。
- SBS 的報導稱,高頻寬記憶體供應緊張讓 Nvidia 的 AI 伺服器價格上漲超過 15%;模型變便宜,不表示整個算力供應鏈同步變便宜。
- TechCrunch 對 Garry Tan 的報導記錄,他主張美國開放權重實驗室應被允許蒸餾前沿模型;這是政策立場,不是已通過的法規。
- Claude for Financial Advisors推出連接保管機構、投資組合平台、CRM 與財務規劃工具的套件,並把顧問的日常工作拆成可重複的技能;金融導入因此更像權限與紀錄設計,而不只是聊天介面。
- CNBC 的報導稱,中國國家主席習近平在金磚國家峰會提出由中國帶頭推動 AI 合作、雲端平台與數位技能訓練;這是國際合作倡議,不等於平台已經建成。
- TechCrunch 對 Moonshot AI 的報導稱,Kimi 開發商 Moonshot AI 以開放權重 Kimi K3 的採用為基礎,把年底 20 億美元年化營收列為目標;目標是管理層預期,不是已實現營收。
這些消息合在一起看,AI 的稀缺資源已從單純的模型能力,移到四個更難偽造的位置:能否用更少計算完成工作、能否把試錯移到安全的環境、能否在真實世界長時間運作,以及資料邊界能否被說清楚。模型可以自己往前跑;產品若要被信任,控制面必須跟得上。