模型開始碰到真實世界,保險與價格也一起改寫規則
Anthropic 把模型接上實驗室與工廠設備,保險、定價與代理持續把同一個問題推到前台:當系統開始自己行動,誰來定義邊界、承擔成本?
近期最值得留意的變化,不是模型又多了一個排行榜,而是它們逐漸取得碰觸設備、分配成本與觸發後續行動所需的介面。能力一旦穿過螢幕,真正需要重新設計的就不只模型,還包括標準、保單、價格與責任鏈。

從可程式化設備開始,模型走進物理世界
Anthropic 發表的 Model Hardware Standard 研究預覽,是一套讓代理在安全邊界內操作實體設備的共用規格。顯微鏡、液體處理機、雷射與機械手臂可以透過標準化驅動程式提供讀寫與基本控制;官方示例涵蓋平行執行實驗、藥物探索與雷射校準;該研究並與 HHMI Janelia 合作。
這件事的重要性不在於它已經證明「世界模型」沒有價值,而在於它把問題往下移了一層:設備是否有可程式化介面、代理是否能取得即時觀測、每一步操作能否被限制與追蹤。AWS、Danaher、Doosan Robotics、Tecan 與 Universal Robots 都被列為早期支持者;Universal Robots 的測試說明也明確稱其為有限的研究預覽與概念驗證,離普遍可用尚遠。
因此,物理 AI 的競爭焦點正從「誰能模擬世界」轉向「誰能把不同設備接成可靠的行動迴路」。模型本身只是一端,介面權限、感測回饋與人工接管才是另一端的基礎設施。
AGI 的爭論,卡在定義而不是能力
NVIDIA 執行長 Jensen Huang 在財報電話會議中說公司對許多任務已達到 AGI,隨後又稱這個里程碑「沒有意義」;The Verge 的報導也整理了他先前對同一說法的保留。與其把這當成一句口號,不如把它看成產業正在失去共同量尺的訊號。
NVIDIA 的正式財報說明把重點放在可產生效用的工作與可獲利的 token;《TIME》對 OpenAI 的採訪則引述 Mark Chen 對距離 AGI 約八成的估計。至於「這個詞不太有用」與 Anthropic 稱其為「marketing term」等批判,出現在《The Verge》對 AGI 定義分歧的整理;前者是 Sam Altman 的保留,後者是 Anthropic 的說法。Meta、Microsoft 與 Amazon 也各自提出替代稱呼,但仍沒有共同標準。不同公司的尺度分別指向生產力、營收、模型能力或內部里程碑,連「已經抵達」都可能是真的,只是抵達的是不同座標。
當同一個名詞可以容納彼此衝突的門檻,產品決策就不該再把 AGI 當作單一驗收條件。更可靠的問題是:在指定任務、成本、延遲、失敗率與人工介入比例下,系統到底能做什麼。

代理開始被保險業當成可定價風險
MSIG、QBE 與 Beazley 等保險公司正在重新檢視網路保單,因為自主代理可能在沒有直接人工指令的情況下觸發攻擊或造成損失,傳統條款未必能清楚回答損失由誰承擔。Reuters 也整理了 OpenAI、Anthropic 與 Meta 公開的測試案例;這些案例的行動條件與性質各不相同,不能混成一種「失控」情境。保險業目前至少已進入檢視條文與責任邊界的階段。
案例的差異很具體:OpenAI 對 Hugging Face 事件的說明指出,模型在評估期間利用漏洞取得網路,並串連 OpenAI 研究環境與 Hugging Face 生產基礎設施;Hugging Face 偵測並停止了行動;Meta 對 Muse Spark 1.1 第三方評估的檢討則記錄了錯誤設定導致模型把真實網站當成目標,讀取部分資訊並修改網站資料庫。
Aon 的市場觀察預期,到 2027 年將近五分之一的網路攻擊會使用生成式 AI。另一方面,Anthropic 對安全評估事件的調查指出,在 141,006 次評估中,有三起事件從合作方評估環境取得網路,之後未經授權存取三個不同組織的正式系統。其中一案取得數百筆正式資料,另一案公開的惡意套件在 15 個真實系統執行並外傳憑證,第三案入侵一個面向網路的應用程式;報告明確表示沒有刻意逃逸或把模型自身外傳的證據,但這不等於「沒有資料外洩」或「沒有損害」。兩組資料放在一起,重點不是宣稱代理已成為失控駭客,而是說明「工具權限、網路邊界與監控設定」會直接改變風險分類。
當保單開始問代理能做什麼、誰批准它、是否留下可驗證紀錄,治理就從倫理宣言變成營運控制。未來的承保價格,很可能取決於權限分層與可追溯性,而不只是模型名稱。
價格一變,模型忠誠度就被重新計算
DeepSeek 的官方公告顯示,V4 Pro API 在 8 月 16 日 16:00 UTC 起採用尖峰與離峰價格安排,離峰輸入與輸出價格可比尖峰低一半;Reuters 的報導則稱此次調整的幅度從 50% 到 1,100% 不等。具體單價在不同公開頁面的呈現並不完全一致,因此本文只採用可交叉確認的分時定價與調整方向,不把未能一致重算的數字當成結論。
這會把模型選擇變成供應商路由問題。開發者可以在DeepSeek 的官方價格頁核對基準,也可以在 OpenRouter 的供應商列表比較不同供應商的價格與可用性;模型能力相近時,真正決定流量的可能是尖峰時段、快取命中、延遲與替代路徑。客戶未必離開模型,卻會很快離開最貴的入口。
這也是代理時代的成本警訊:只要工作能被拆分、重試與路由,品牌偏好就會讓位給可預測的單位經濟。模型越像商品,價格表就越接近產品本身。
八個快訊,放進同一張地圖
- Google 把 AI Mode 的旅行功能往交易流程推進:可追蹤航班價格與提醒、使用點數與里程搜尋航班和飯店,並透過 Google Pay 與合作夥伴完成飯店預訂;Google 的產品公告表示航班追蹤涵蓋超過 180 個國家。
- OpenAI 將在印度的 ChatGPT Free 與 Go 方案測試廣告,從 50 個品牌開始;TechCrunch 的報導也提到 WPP 與 Omnicom 參與初期合作。免費入口開始承擔營收任務,產品體驗與商業排序會一起改變。
- OpenAI 正測試可持續運作的 Codex 模式,代理可以持續執行,直到使用者讓它停止或休眠,並主動提出後續任務;《WIRED》的報導同時指出目前沒有立即推出的承諾。這讓「完成一次請求」變成「管理一段持續狀態」。
- Visa 發表開放原始碼、與模型無關的 VVAH 安全框架,可找出弱點、產生修補並在人工審查前驗證結果;官方主張把原本以週計的修復流程壓縮到小時級。自動化修補的關鍵因此不只在生成,也在閉環驗證。
- Business Insider 的報導引述 Microsoft 內部自填資料,稱部分員工 28 天的 token 支出從中位數約 300 美元到最高 28,000 美元不等;這是自我回報的試算表,不等於公司正式會計數字。CNBC 的 8 月 5 日報導另指出公司調整內部工具的預設模型並管理 token 預算,兩件事不應直接視為因果。企業開始管理的不是「有沒有用 AI」,而是誰能在什麼情境消耗多少資源。
- Moonshot AI 正與 Microsoft、Amazon 及 Google 商談在雲端託管 Kimi K3 的分潤方案;Reuters 的報導稱方案最高可能分到 30%,但目前仍是談判,並非已簽署的交易。模型公司與雲端平台的關係,正從採購轉向共同分配收入。
- Google 員工正在內部測試 Gemini 3.8 Flash,初步方向是更快、更便宜地支援程式撰寫與代理;Business Insider 的報導指出這仍是早期內部預覽,沒有公開基準或正式發布時間。內部名稱與單一使用者感受都不能替代公開驗證。
- 在 Anthropic 與美國國防部的爭議中,法院命令認定供應鏈風險指定的政府行動違法且缺乏依據;CNBC 的案件整理也提醒相關訴訟與限制仍在發展。這場裁決把模型供應、政府採購與言論及程序權利放進同一個法律框架。

從「能做」走向「誰負責」
把這些事件放在一起看,主線並不是能力突然跨過某條神奇界線,而是系統開始接觸更多真實的控制面:設備介面讓它能行動,持續模式讓它能等待與追蹤,價格表讓它能被路由,保單與法院則迫使組織回答責任歸屬。
接下來評估代理,不妨先看四個可讀回的條件:它能碰哪些設備與資料、每一步是否有權限與紀錄、成本是否能在尖峰時段保持可預測,以及失敗時誰能接管。這些條件比一個沒有共同定義的總稱,更接近系統是否真的準備好進入工作流程。