Grok 4.5和Claude 4.8,在我電腦裡"打"起來了
壹位開發者直言:“頂級工程能力的邊際成本,今天被徹底打穿了。”
速度同樣不容忽視。SpaceXAI稱,Grok 4.5的生成速度約為每秒80個tokens;在SWE-Bench Pro任務中,它平均使用約1.6萬個輸出tokens,而Opus 4.8 Max約為6.7萬個。獨立測試測得其輸出速度約為每秒88個tokens,高於同類推理模型的平均水平。在我們實際的測試過程中,Grok 4.5的生成速度也顯著快於Claude Opus 4.8。
對於需要模型反復讀取文件、調用工具、修改代碼和自我驗證的智能體來說,更少的步驟和更短的輸出,意味著節省的不只是API賬單,還有等待時間。
馬斯克還提出,要在2026年余下時間裡以接近每月壹款新基礎模型的節奏推進迭代。背靠大規模算力、Cursor積累的真實開發數據,以及SpaceX體系內的工程資源,Grok的追趕速度確實可能比過去更快。
在我們這次實測中,雖然Grok Build的邊界控制出了嚴重事故,但它在游戲創意、視覺包裝、長文檔檢索上,並不是陪跑者,甚至在個別任務上明顯壓過Claude Code。Grok的真正問題是,能力沖到這個量級之後,還能不能被穩定地約束住。
這正是馬斯克式產品的典型氣質:速度極快,沖擊力極強,但與此同時,他也會把風險、邊界和工程紀律壹起推到聚光燈下。
所以,馬斯克重回大模型牌桌了嗎?
答案是肯定的。但他還沒有贏下這壹局。
Claude仍然更穩、更克制、更像壹個可以托付生產環境的工程同事。Grok 4.5則像壹台剛被放出來的高性能機器,馬力驚人,成本誘人,但刹車系統還需要被反復驗證。
[加西網正招聘多名全職sales 待遇優]
還沒人說話啊,我想來說幾句
速度同樣不容忽視。SpaceXAI稱,Grok 4.5的生成速度約為每秒80個tokens;在SWE-Bench Pro任務中,它平均使用約1.6萬個輸出tokens,而Opus 4.8 Max約為6.7萬個。獨立測試測得其輸出速度約為每秒88個tokens,高於同類推理模型的平均水平。在我們實際的測試過程中,Grok 4.5的生成速度也顯著快於Claude Opus 4.8。
對於需要模型反復讀取文件、調用工具、修改代碼和自我驗證的智能體來說,更少的步驟和更短的輸出,意味著節省的不只是API賬單,還有等待時間。
馬斯克還提出,要在2026年余下時間裡以接近每月壹款新基礎模型的節奏推進迭代。背靠大規模算力、Cursor積累的真實開發數據,以及SpaceX體系內的工程資源,Grok的追趕速度確實可能比過去更快。
在我們這次實測中,雖然Grok Build的邊界控制出了嚴重事故,但它在游戲創意、視覺包裝、長文檔檢索上,並不是陪跑者,甚至在個別任務上明顯壓過Claude Code。Grok的真正問題是,能力沖到這個量級之後,還能不能被穩定地約束住。
這正是馬斯克式產品的典型氣質:速度極快,沖擊力極強,但與此同時,他也會把風險、邊界和工程紀律壹起推到聚光燈下。
所以,馬斯克重回大模型牌桌了嗎?
答案是肯定的。但他還沒有贏下這壹局。
Claude仍然更穩、更克制、更像壹個可以托付生產環境的工程同事。Grok 4.5則像壹台剛被放出來的高性能機器,馬力驚人,成本誘人,但刹車系統還需要被反復驗證。
[加西網正招聘多名全職sales 待遇優]
| 分享: |
| 注: | 在此頁閱讀全文 |
| 延伸閱讀 |
推薦:
Grok 4.5和Claude 4.8,在我電腦裡"打"起來了