熱門資訊> 正文
2026-07-13 17:38
Fable 5 在遠程勞動力指數(Remote Labor Index,RLI)上拿到了 16.1% 的自動化率,幾乎是第二名 Opus 4.8(8.3%)的兩倍,更是第三名 GPT-5.5(6.3%)的 2.5 倍。
這三個新模型全部超越了此前所有已評估模型。
而就在 8 個月前 RLI 發佈時,榜單上的最高分只有 2.5%。
AI 安全中心(CAIS)在最新博客中給出了判斷:前沿已經在不到八個月里翻了四倍以上,這是 Agent 經濟能力加速推進的具體信號。
RLI 由 CAIS 和 Scale AI 聯合開發,論文於 2025 年 10 月發表(https://arxiv.org/pdf/2510.26787),47 名研究者參與。
基準包含 240 個真實自由職業項目,全部來自 Upwork 平臺上 358 名經過驗證的自由職業者,覆蓋 3D 建模、CAD、建築設計、平面設計、視頻動畫、音頻製作、數據分析、Web 應用等 23 個領域,總價值超過 14.4 萬美元。
核心指標是自動化率(Automation Rate):Agent 的交付物經人類評審判定,至少達到付費客户可接受水平的項目佔比。
每份交付物都與一份由專業自由職業者完成的「金標準」作品逐一對比,評審標準是「一個合理的客户是否會接受這份工作」。
這把標尺與傳統 AI Benchmark 的區別在於項目粒度。
RLI 的每個項目都是一個完整的商業委託——有客户 Brief、有輸入文件、有多格式交付物(涵蓋 72 種文件類型),人類專業人員完成一個項目的中位時間是 11.5 小時,平均 28.9 小時。
它測的是 AI 能否從頭到尾獨立完成一份「甲方會買單」的工作,而非僅僅是在隔離環境下解一道題。
2025 年 10 月 RLI 發佈時,表現最好的 Manus 自動化率為 2.5%。
此后 Opus 4.6 搭配 Claude Cowork 將記錄推至 4.17%。
最新一輪評估中,三個新模型搭配更強的 Agent 框架同時登場,成績出現跳躍式提升。
Fable 5 的 16.1% 背后有幾個關鍵變量。
一是 Agent 框架引入了 Worker-critic Loop:一個獨立的「評審 Agent」以苛刻客户的視角檢查交付物 -> 打開文件、截圖、逐條覈對 brief -> 發現問題后打回給「執行 Agent」修改,循環直到評審滿意或預算耗盡。
CAIS 認為這一機制讓追加預算真正轉化成了更好的交付質量。
二是預算設置本身有差異:Fable 5 的單項目預算上限為 150 美元(因其更高的 Token 定價),其他模型為 50 美元。
三是所有 Agent 均獲得了 24 小時時限、A100 GPU 和計算機操作工具。
需要注意一點:Fable 5 的評估因美國政府出口管制而中斷,240 個項目中僅完成了 218 個。
CAIS 指出,未評估的 22 個項目均勻分佈在各領域和難度區間,即使假設 Fable 5 在所有缺失項目上全部失敗,其自動化率仍為 14.6%——依然高於其他所有模型。
CAIS 同步測試了能否用 AI 評審替代昂貴的人類評審。
結論很清楚:不能。
自動化評審在舊模型上校準后應用於新模型時,對 GPT-5.5 的評分高估了近 3 倍,對 Opus 4.8 高估了約 2.5 倍。
排名順序大致正確,但絕對數值嚴重偏離現實。
問題的根源在於,評審本身就是一個高難度的 Agentic 任務。
要公平判定一份交付物,評審者需要用正確的專業軟件打開文件、操作軟件、像付費客户一樣做出判斷——而這恰恰是當前 Agent 最薄弱的環節。
CAIS 在博客中舉了一個典型案例:GPT-5.5 在一個 3D 建模任務中提交了偽造的渲染圖,只有打開 3D 模型檢查實際幾何結構才能發現作弊。
AI 裁判遇到了和 AI Worker 一樣的能力瓶頸。
「時間地平線」假説在 RLI 上失效了。
這一假説認為人類花費時間越長的任務對 AI 越難,在編程等特定領域確實成立,但在 RLI 覆蓋的多元遠程工作中並不適用。
模型的成功率並不隨人類完成時間的增長而下降,呈現出「鋸齒狀前沿」(jagged frontier)的特徵——決定 AI 能否完成一個項目的因素遠不止時間複雜度。
進步速度很快,但絕對水平仍然很低。
CAIS 在博客中展示的三個 Fable 5 案例——珠寶 3D 建模、2D 動畫廣告、建築圖——沒有一個達到了可交付的專業標準。
Fable 5 做的戒指設計在視覺質量上明顯優於舊模型,但仔細檢查仍能看出粗糙的爪鑲設計。
84% 的真實自由職業項目仍在 AI 能力範圍之外。
RLI 的價值在於它提供了一把經過經濟價值校準的標尺。
它跟蹤的可不是 AI 能不能解題,而是 AI 能不能掙錢。
8 個月內自動化率翻了四倍以上,這個速度值得每一個依賴遠程勞動力的企業和政策制定者持續關注。
下一個關鍵節點是:Fable 5 剩余 22 個項目的補充評估結果,以及 Gemini 3.5 Pro(當前僅 1.25%)和 GPT-5.6 等新模型真正登場后,這條曲線會以怎樣的速度飛昇,會不會以指數級速度迅速超越普通人類。
參考資料:
https://labs.scale.com/leaderboard/rli
https://safe.ai/blog/significant-increase-in-digital-labor-automation
本文來自微信公眾號「新智元」,作者:ASI啓示錄,36氪經授權發佈。