Terry.TY Chen

從八十三億個模擬使用者到零售結帳,模型正在重畫信任邊界

Published: August 10, 202611 min readEdit on GitHub

MatrAIx 把模擬使用者擴張到八十三億筆,零售商卻仍把付款與資料留在自己手中;本日幾則消息共同指向同一個轉折:模型能接管入口,信任與責任仍要回到人和制度。

今天幾則看似分散的消息,其實都在問同一件事:當模型可以替我們測試、搜尋、寫程式、挑商品,甚至影響它自己將來讀到的內容,誰還握有最後的判斷權?答案暫時不是模型,而是掌握資料、付款關係與制度責任的人。

紙藝拼貼呈現大量模擬人物資料匯入中央評估空間,再分流到產品、商店與真實人群,象徵模型能快速擴大測試範圍,但仍需要現實世界的人做最後判斷。

一個可以被執行的「世界」

一個有 Harvard 與 MIT 研究者參與的團隊在 MatrAIx 論文中提出一套大規模模擬使用者評估基礎設施。它的 Persona 8B 包含約 83 億筆 persona records,每筆以 1,290 個分類維度描述背景、心理、能力與行為;研究團隊另外釋出約 100 萬筆經品質篩選的資料集,並在 Survey、聊天、網頁與 App 四種環境執行 18,189 次評估。

這不是把八十三億個真實人類複製到伺服器裡,而是把人口統計、公開資料與志願者調查等資訊轉成可抽樣、可重複測試的角色。論文在 400 次受控試驗中觀察到,91.5% 的指定行為要麼被表現出來,要麼被正確抑制,這代表它適合拿來做早期篩選、壓力測試與族群差異分析;但論文也明確提醒,重要結論仍要回到真人研究驗證,不能把模擬反應直接當成真實大眾的意見。

真正的轉折不在於「能不能模擬人」,而在於產品團隊會不會因此把招募研究對象、等待回覆與面對異議視為多餘成本。當一個模擬環境能在幾小時內跑完大量情境,管理者更容易得到一個整齊的答案,也更容易忘記那些沒有被模型表達出來的沉默、矛盾與意外。

入口可以被重寫,結帳卻還在現實裡

零售市場呈現了另一半答案。根據 Reuters 報導的零售觀察,Walmart、Ulta Beauty 與 Wayfair 等業者正調整商品頁,爭取出現在 ChatGPT 與 Gemini 的推薦裡;Adobe Analytics 則指出,來自相關服務的訪客,其每次造訪帶來的收入比傳統流量高 41%。Ulta 表示,從 Gemini 與 ChatGPT 找到商品的消費者,轉換與購買意圖約為其他來源的兩倍。

但「被推薦」不等於「被交付」。Etsy 觀察到,使用者在對話工具裡發現商品後,通常仍會回到 Etsy 完成付款;OpenAI 也在 3 月結束 Instant Checkout,把重心退回商品探索與導流。零售商願意租用模型的入口,卻不願把結帳、會員、售後服務與購買資料一併交出去。前者是注意力,後者才是長期關係。

工具與內容的中介層正在吞掉自己

程式開發工具的變化更直接地碰到「中介層能否獨立存在」這個問題。The Information 的報導指出,SpaceX 對 Cursor 的 600 億美元收購案接近完成,內部已討論品牌淡出、團隊併入,以及未發布的通用代理工具可能改用 Grok 名稱。這仍是交易完成前的報導,時程取決於監管與最後程序;但它已讓一個產業問題浮上檯面:如果工具建立在別人的模型之上,其所累積的使用資料與企業關係,最後可能成為模型公司的收購標的。

內容分發也開始出現相同的重新定價。Vincent Schmalbach 的實測顯示,TIME 會對一般瀏覽器與不同的助理爬蟲回傳不同版本:ClaudeBot、PerplexityBot 與 OAI-SearchBot 取得較精簡的 Markdown,部分頁面還嵌入只會出現在機器版本裡的贊助 FAQ;《The Register》重現了這項測試。這些廣告在爬蟲回應裡有標示,爭議不只在透明度,也在於出版商開始把「影響模型回答」當成新的曝光單位。

當讀者多半透過代理讀取網頁,內容業者自然會追逐代理;當開發者把每次接受建議都交給工具,工具自然會累積可被再利用的行為資料。這兩條路徑都提醒我們:介面可以很快消失,資料與分發權卻會留下來。

手工紙藝構成程式碼片段、內容紙頁與多條機器爬蟲路徑,橋接到一個被重新命名的工具容器,表達模型、應用程式與內容分發之間的權重正在轉移。

其他動態:工具、分配與治理一起改版

  • GitHub 的 7 月 Copilot 更新加入側邊快速對話、平行多聊天,以及讓 Copilot、Claude 或 Codex session 使用隔離 worktree 的能力;重點不是多一個聊天視窗,而是讓多個編碼任務在不同工作副本中並行,降低互相覆寫的風險。

  • 新加坡政府的說明表示,政府、雇主與工會會透過技能訓練、工作媒合與職務重設協助勞工適應轉型;勞動力部的國會演說也承認,有些職務會演變,有些可能消失,因此政策重點是讓人保有重新進入經濟的能力,而不是保證每個職位原封不動。

  • X 的新 Original Content Rewards 計畫將取代原有收益分成,並把原創報導、分析、影像、影片與具實質價值的評論放在計算核心;現行方案的收益延續到 9 月 7 日,新方案預計 9 月 8 日起接受申請。平台試圖降低複製、垃圾內容與點擊誘餌帶來的套利空間。

  • Cloudflare 的 Kitesurf是建立在 Workers 之上的代理導向瀏覽器,目前在 Browser Run Beta 免費提供;官方表示,它以 V8 isolate 的隔離模型處理頁面,針對截圖與 HTML 擷取等常見工作,比 Chromium 更節省 CPU 與記憶體,但也犧牲分頁、擴充功能與像素級渲染等人類瀏覽器功能。

  • Anthropic 宣布,Claude Code 將從 8 月 14 日起,讓 Pro、Max 與 Team 方案的新工作階段預設使用 Auto mode。系統會以分類器檢查工具行動,試圖攔下不可逆、破壞性或超出請求範圍的操作;這減少了逐次核准,但不等於取消監督,因為使用者仍需為工作方向、權限與敏感環境負責。

  • 明尼蘇達州聯邦法院的起訴書顯示,前 Mayo Clinic 研究營運主管 Traci Tamiko Eto 指控院方在 MAYA 數位助理研究中錯誤呈現結果、刪除不利結果,並涉及未經適當審查的軟體與資料隱私問題。這些仍是訴訟中的指控,不是法院已認定的事實;Mayo Clinic 亦否認違法並表示其研究與臨床創新遵循相關規範。

  • Dean Ball 的公開說明寫明,他將在 OpenAI 領導 Strategic Futures 團隊,向 Chief Strategy Officer Jason Kwon 報告,處理前沿技術政策、災難風險、勞動市場影響與公司內部治理。這使政策與治理不再只是外部監管者的問題,也成為模型公司內部的策略職能。

最後要保留的,不是速度而是責任

模擬八十三億筆 persona 可以把研究提前,代理瀏覽器可以把操作壓縮,Auto mode 可以把等待核准的時間拿掉;但這些效率都沒有回答「如果結果錯了,誰要承擔」?真正可靠的系統,應該把模擬當成篩選、以模型作為入口、把工具當成可替換的中介,最後仍保留真人驗證、可追溯資料、可退出的付款關係與清楚的制度責任。

紙藝小人物站在由模型、商店與公共制度組成的分層場景前,手上保留一張可翻回原路的紙卡,象徵人在自動化流程中仍必須保有拒絕、覆核與承擔後果的選擇。

ai-newssimulated-usersdigital-trustai-agentsai-governance