全球基模決戰!AI圈休不了十一長假了

量子位
4小時前

一水 發自 凹非寺

量子位 | 公衆號 QbitAI

現在就預告了——中秋和國慶的13天假期,可能會是今年AI圈最忙最炸的兩周。

盆友,別休了,別睡了,找好椅子癱坐吧。

基模決戰周,真要來了!!

硅谷那邊已經暗流湧動。

Anthropic的新Claude,灰測動靜早就傳得沸沸揚揚。

谷歌更是直接,Gemini 4 Pro疑似已經披着馬甲,偷偷混進Arena參加摸底考試了。

國內這邊,全卡在假期前瘋狂憋大招。

Kimi開始拿K3.1瘋狂打啞謎,DeepSeek下一張Pro牌已經提前寫進官方文檔,Qwen4也直接亮出了新架構。

而擂台正中央,OpenAI月初才啱啱放出GPT-6 Astra——一款讓OpenAI提前給AGI開香檳的基模。

好傢伙,這架勢整得像大家提前約好了一樣:

該來的、可能來的、偷偷摸摸已經在考場裏的,全趕到了一塊兒

節前最後一舞,Are you ready?

硅谷集體圍攻OpenAI GPT-6 Astra

硅谷這邊,A社、谷歌、馬斯克的Grok幾乎都有新動作傳出。

A社Claude 5.2箭在弦上

最先坐不住的自然還是A社。

路透社最新爆料已經確認,Anthropic正在考慮推出一款新模型,只是最終什麼時候發、叫什麼,還沒公開。

社區裏呼聲最高的是Claude Opus 5.2和Fable 5.2

這兩款模型之所以被社區盯上,主要還是因為最近冒出來的一系列灰測信號。

最早的線索來自Claude Code。

有開發者發現,自己明明選擇的還是Opus 5,但部分複雜任務裏的表現卻和此前版本明顯不同。

於是社區開始猜測:

Anthropic是不是已經在後台悄悄切換模型,把一部分請求路由到了新的內部checkpoint?

這個猜測很快被更多線索印證。

多位開發者反饋,原本調用Fable 5.1的請求,在後台被靜默重定向到了新版本。

有人在高推理模式下實測,發現新模型的輸出質量明顯優於GPT-6 Astra,代價是速度更慢、成本更高。

最戲劇性的當屬Opus 5.2的午夜驚魂。

9月17日晚間,Anthropic突然切斷了Opus-Next(據傳是Opus 5.2的內部代號)的灰度測試通道,活躍測試賬號一度歸零,開發者社區一片哀嚎。

但僅僅一天之後,灰測就重新上線,範圍還從Claude Code擴大到了Chat和Cowork。

而這一系列動作的大背景是:

OpenAI月初發布的GPT-6 Astra,已經拿下了約13%的企業AI支出,Anthropic的Claude Fable則約為8%。

Anthropic選擇在IPO前夕放出新模型的風聲,很難說不是在搶回敘事主動權。

谷歌Gemini 4 Pro內測效果刷屏

更有節目效果的是谷歌。

最近Arena裏出現了一個名叫gemini-3.8-flash的模型。

名字看着平平無奇,但不少測試者很快發現不對勁:

這玩意兒根本不像Flash

衆人一致推斷,它很可能是谷歌下一代旗艦Gemini 4 Pro的隱身checkpoint,社區還流傳其內部代號為Argon

隨後冒出來的一堆demo,更是直接把討論度拉起來了。

AI圈祖傳考題鵜鶘騎自行車,這次疑似Gemini 4 Pro的版本,不只是把鳥和自行車畫出來,還進一步做成了帶踩踏動作、光照變化和控制組件的完整交互頁面。

相比普通3.8 Flash,複雜度肉眼可見地高了一截。

再比如畫PS5 SVG,模型花了大約10分鐘,直接用代碼畫出一套細節非常密的PS5矢量圖,包含複雜曲線、陰影和機身結構。

測試者直接評價,這是自己從AI模型裏拿到過最誇張的輸出之一。

還有Voxel Pagoda(體素寶塔),這次模型直接搭了一個完整3D場景:

多層寶塔、地形、樹木和周邊環境一起生成,同時還保留了查看和燈光控制。

相比之前checkpoint,幾何結構和整個場景的完整度明顯提高。

以及一個傳播很廣的demo側視家貓SVG,提示詞非常簡單:

畫一隻側視的家貓。

測試者把疑似Gemini 4 Pro的結果和GPT-6 Astra Max、正式版Gemini 3.8 Flash擺在一起,主要看輪廓、四肢比例和空間關係(下圖按此順序)。

結果也因此在Reddit拿到了數百讚,成了這一波最火的對比圖之一。

再往後,測試已經從SVG一路捲到了網頁和3D場景。

有網友甚至用它做了一個奧特曼騎哥斯拉打怪獸小遊戲:

SVG+HTML,鼠標點哪裏就往哪裏發射激光,還能加速。

當然,這些demo只能說明Arena裏這個神祕checkpoint確實很能打。

它到底是不是Gemini 4 Pro,谷歌沒官宣之前還得打個問號,但至少從測試密度來看——

下一代Gemini,已經離得很近了

馬斯克Grok 4.7正在烹製中

馬斯克也沒閒着。

此前有網友詢問Grok 4.7進展,老馬直接回復:

Grok 4.7 needs a few more days to cook.

掐指一算,也差不多這幾天了。

不過按老馬以前的風格,他一般是等其他人都發了再出現,主打一個黃雀在後(doge)。

買定離手,我先壓一個。

國內熱鬧程度也不遑多讓

國內這邊,有人已經提前搶跑了——

就在啱啱,階躍星辰突然發布新一代旗艦模型Step 5 Preview

模型採用稀疏MoE架構,總參數600B、激活參數27B,支持百萬Token上下文,並針對編程、Agent、專業知識工作等真實任務進行了優化。

在全球權威的Artificial Analysis Intelligence Index中,Step 5 Preview取得44分,位居全球開源模型前三,而且單任務成本僅為Claude Opus 5的1/8。

而階躍剛把牌拍上桌,Kimi那邊的謎底也已經快寫臉上了。

最近其官方賬號最近突然放出一串數字:415926535897932384626433832795……

乍一看像亂碼,但把圓周率π拿出來對照一下就懂了。

π開頭是:

3.1415926535897932384626433832795……

去掉最前面的3.1,剩下的剛好就是這串數字。

K3.1??好好好,是誰又悟了~(不過也有網友反手買,說這意味着沒有3.1)

除了Kimi,DeepSeek這邊也早就埋好了彩蛋。

9月10日發布DeepSeek V4.1 Flash時,官方文檔裏已經明確提到:

在V4.1 Pro上線之前,部分V4 Pro請求會被路由到V4.1 Flash

換句話說,V4.1 Pro基本確定存在,只差什麼時候翻牌。

而按以前發布節奏推測,V4.1 Pro最快可能會落在9月底到10月初這個窗口期。

Flash和Pro之間通常不會拖太久,此前V4系列發布時,Flash和Pro基本同步亮相。

更早的版本迭代中,輕量版本先行後,旗艦版本也往往會在數周內跟進。

再加上放假這個因素,一放假就發模型的戲碼想必大家也不陌生了。

再往後是阿里Qwen。

阿里8月底開源Qwen3.8-Flash-Next時也把話挑明瞭:

這就是Qwen4底層架構的early preview

而且官方強調,這次之所以提前把架構開出來,就是想讓社區在完整Qwen4系列構建完成之前先行測試。

換句話說,Qwen4同樣已經在路上。

現在,太平洋兩岸的選手已經嚴陣以待,就看誰先出牌了。

當然,有新模型要發的要加班,沒有新模型發的可能更要加班。

還討論什麼AI代替工作、AI自我進化RSI……咱這行一直都是一部分人鉚足了勁,要麼讓另一部分人失業,要麼讓另一部分人加班。

十一假期,Are you ready?

參考鏈接:

[1]https://x.com/MaxForAI/status/2101254889296781439

[2]https://x.com/kimmonismus/status/2101268494901792968

[3]https://x.com/kimmonismus/status/2101226451861180711

[4]https://x.com/LuminaBench/status/2101359620472115598

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10