繁體
  • 简体中文
  • 繁體中文

熱門資訊> 正文

一邊降本一邊提價 密集融資后的智譜押注RSI敍事

2026-09-19 07:56

《科創板日報》9月19日訊(記者 李明明) 「我們的繼任者,正是我們親手創造出來的AI。」 9月17日,智譜創始人、首席科學家唐傑在X平臺發表長文,並轉發智譜技術博客,披露GLM團隊在遞歸自我改進(Recursive Self-Improvement,RSI)方向的首個工程化實踐:由GLM-5.3驅動的Infra Agent完成了GLM-5.3-Flash推理基礎設施的設計、調試與優化——模型開始反向改進承載自己運行的系統。這是國內大模型廠商首次公開跑進生產環境的RSI案例。

時點耐人尋味。就在前一天,智譜剛在分析師電話會上披露,約50億美元再融資中約60%的淨額(約235億港元)將投入下一代GLM基礎模型和「完全自訓練」體系;昨日,智譜又正式GLM-5.3-FlashX,其新版本推理速度最高可達200tokens/s,是GLM-5.3-Flash速度的5倍,定價提升至原版的2.5倍。大洋彼岸的Anthropic則公開了內部衡量AI自我改進速度的三大指標。戰略敍事、工程實踐、產品提價、監管儀表盤在48小時內密集落地——RSI這條曾被視作科幻概念的賽道,這一周同時進入了中國公司的生產環境、價目表和美國公司的披露清單。

兩周3倍:模型給自己建了一套推理系統

所謂遞歸自我改進,指的是AI系統不再只是被動運行的工具,而是開始參與改進自身——從寫代碼、調優承載自己的系統,到終極形態:自主設計並訓練出自己的「繼任者」。它被頭部實驗室視為通往AGI的關鍵一躍,邏輯很現實:人類研究員的擴張是線性的,而一旦模型開始參與研發自己的下一代,迭代速度就具備了複利式加速的可能。商業含義同樣直接——AI研發效率和推理成本,正是大模型公司眼下最燒錢的兩項支出;誰先讓模型把這兩項成本打下來,誰的商業閉環就先跑通。

據智譜方面對《科創板日報》記者介紹,這次實踐的硬指標是:Infra Agent在超過10萬張國產芯片組成的集群上,從零搭建了一套完整的生產級推理服務,不到兩周將端到端吞吐提升至初始基線的3倍,硬件利用效率與單Token成本達到主流NVIDIA GPU相當水平,並支持1M上下文窗口與多模態請求。

據官方博客,此前沒人成功部署過如此大規模的國產卡集群——芯片內存容量和帶寬受限、生態不成熟、算子不完備,許多文檔基本靠猜。做成這件事的不是一支團隊,而是GLM-5.3驅動的Infra Agent。GLM-5.3-Flash的全部線上推理,目前都運行在這套系統之上。

系統已經受真實流量檢驗:GLM-5.3-Flash以匿名模型Ox-Alpha在OpenCode與OpenRouter上線,一周內成為雙平臺調用量最大的模型,6天Token調用量超過62萬億。技術棧上,團隊實施了以算力換帶寬、以通信換顯存等定製化方案,並引入EPD(Encode–Prefill–Decode)分離式架構。

值得記錄的是這次實踐的含RSI量:Agent不再只是生成代碼,而是圍繞推理系統完成了完整工程閉環——根據測試、Trace、Benchmark等稠密反饋自主提出性能假設、定位精度缺陷、修改底層代碼、執行分層測試並持續迭代。GLM團隊同時劃清了邊界:系統尚未達到完全自主設計和訓練下一代模型的階段,但RSI的早期形態已經出現——模型建設推理系統,系統再反過來支撐模型運行。

這次披露並非孤立事件,而是智譜半年來層層遞進的一步。今年7月,創始人唐傑在內部信《巨浪已來》中提出摸高計劃,將完全自訓練列為核心方向;8月31日業績會上,智譜管理層首次為下一代模型定調:從預訓練、中訓練到后訓練全流程讓模型自己訓練自己,核心特徵是自淨化——」最大的問題是這個模型能自己判斷什麼時候停止、什麼時候糾正自己,而不是簡單地把模型訓練大「。

一位大模型業內人士告訴《科創板日報》記者,對智譜而言,RSI的商業含義同樣直接:推理系統的吞吐與單Token成本,正是其算力經濟賬里80%理論推理毛利的前提。模型把自己的推理成本打下來,等於給智譜那筆300億算力投入、400億年收益的測算補上了一個自我強化的變量。

漲價與降本,正在這家公司身上同步發生。昨日上線的GLM-5.3-FlashX定價為GLM-5.3-Flash的2.5倍,據《科創板日報》記者統計,這已是智譜年內至少第六次提價。一邊用RSI把推理成本打下來,一邊把更快的服務賣出更高的價格,兩個動作指向同一本賬:把推理生意的毛利做厚。

RSI全球牌桌:頭部實驗室競速透明化,中國廠商落地真實生產環境

RSI已是全球頭部實驗室公開競逐的下一個高地,而Anthropic在本周拿出了迄今最激進的一次透明化動作。9月12日,CEO阿莫迪發表長文《We Must Pace the Frontier》,單方面承諾引入擁有員工級權限的獨立第三方評估員進駐公司,並呼籲前沿實驗室給AI發展定速——遞歸自我改進被其列為需要全球協調限速的對象。

9月18日,Anthropic在官網發佈《理解前沿實驗室中AI發展速度的衡量指標》,首次向外界公開三項內部指標:其構建的「研發自動化指數」顯示,截至8月,Claude在26%的AI研發工作中處於主導地位、超過90%的研發工作有AI深度參與,但沒有任何環節實現完全自主;在其最常用的內部平臺上,任意時刻約有3萬個AI智能體在執行研發與工程任務,這些智能體的全部動作100%經過在線監控系統,被攔截的比例為0.002%,約合每4.7萬次動作攔截一次;算力分配上,投向AI研發的算力中約6%用於安全研究。

OpenAI則選擇了把時間表公開。9月6日,其官方博客宣佈按期達成去年秋天設立的「自動化AI研究實習生」目標:研究部門每投入1個人工工作日,對應3.1個智能體工作日;下一個節點是2028年3月前實現「自動化AI研究員」。OpenAI同時承認,以RSI方式實現這一目標的路徑,尚不清楚如何安全實現。

放回國內座標,《科創板日報》記者注意到,智譜這次披露的意義在於「生產環境」四個字:此前國內廠商關於自我改進的表述多停留在論文與規劃層面,GLM是第一個把RSI早期形態放到真實流量下檢驗並公開細節的。競爭邏輯也在此切換——當AI開始參與自身系統的構建,AI研發效率本身成了競爭對象:誰先讓模型參與構建下一代模型,誰的迭代速度就獲得複利。

國內牌桌上,大廠中,騰訊混元7月發佈研究智能體Hyra-1.0,將遞歸自我改進能力引入自身研發工具棧;字節 Seed 團隊也在推進 Seed‑for‑Seed 的 AI4AI 探索,把 AI 自動數據合成、評測、框架調優逐步融入模型研發流水線;阿里5月發佈的Qwen3.7-Max,曾在自研真武M890芯片上連續自主工作35小時、完成1158次工具調用——沒有掛RSI的名字,做的是同類的事。

海外對照組更能説明賽道熱度:據統計,半年內RSI相關初創融資已超過10億美元——由OpenAI前研究副總裁等人創立、田淵棟加盟的Recursive估值已達46.5億美元;Anthropic離職研究員6月創立的Mirendil,種子輪即獲2億美元。競爭邏輯也在此切換:當AI開始參與自身系統的構建,AI研發效率本身成了競爭對象——誰先讓模型參與構建下一代模型,誰的迭代速度就獲得複利。

對於這次披露,北京計算機學會AI專委會祕書長、北京大學特聘研究員張有魚對《科創板日報》記者表示,智譜此次實踐的價值不在於3倍吞吐這個數字本身,而在於驗證了Agent可以在缺乏文檔、生態不成熟的國產硬件環境里完成長鏈條工程任務。這解決的是國產算力最頭痛的可用性問題——卡買到了沒人會調,現在模型自己會調了。但他同時提醒,目前的RSI仍侷限於「有稠密反饋、可自動驗」的工程場景。此外,Infra Agent優化的是推理系統工程,不是模型架構與訓練方法的自我設計。離完整意義上的RSI,即模型自主設計並訓練出繼任者,中間還隔着整個行業都還沒跨過去的一步。

風險及免責提示:以上內容僅代表作者的個人立場和觀點,不代表華盛的任何立場,華盛亦無法證實上述內容的真實性、準確性和原創性。投資者在做出任何投資決定前,應結合自身情況,考慮投資產品的風險。必要時,請諮詢專業投資顧問的意見。華盛不提供任何投資建議,對此亦不做任何承諾和保證。