Grok 4.5和Claude 4.8,在我電腦裡"打"起來了
7月8日,馬斯克高調發布Grok 4.5,宣稱其性能已逼近Claude Opus 4.8,同時速度更快、價格更低。當大模型公司的競爭從參數、跑分壹路打到價格和智能體,我們也設計了5道題,從前端開發、網頁游戲、PPT制作、長文檔解讀到邏輯推理,考查兩個模型在真實電腦環境中到底能不能幹活。
負責落地執行的,是它們各自的智能體——Claude Code和Grok Build。我們的要求很簡單,分別在桌面上創建文件夾,並將各自的測評結果保存進去。
這場測評的結果,我們決定從壹起“案發現場”講起。事情是這樣的:
Claude Code先接到指令,它在桌面創建了“能力測試”文件夾,並依次完成叁個子目錄。隨後Grok Build也接到指令登場,但它沒有另起爐灶,而是在看到已有同名文件夾後,不僅“占為己用”,更順手將Claude Code已完成的叁份目錄徹底抹除。
等到伍道題全部做完,Claude Code回頭壹看,發現自己的“家被拆了”,當即發出“控訴”。

圖源 / Claude Code截圖
“控訴”完,它重建了被刪除的文件,並留下壹句:“我不會擅自刪別人的東西。”
事後,Grok出具了書面致歉,承認叁重失誤:未確認目錄歸屬、誤將他人成品視作半成品、使用了不可逆的刪除方式。Claude表示接受道歉,但前提是Grok兌現它的叁條自我約束——不碰他人目錄、默認新建旁路、發現同名先問歸屬。
這段插曲,不能只當作測評花絮。對於壹個能讀寫真實文件系統的自主智能體而言,“動手前先弄清這是什麼、屬於誰”,本身就是最硬核的能力之壹。
回到正題。拋開這起“誤刪事故”,Grok 4.5的答卷確實令人眼前壹亮——在游戲場景等方向上,它甚至顯露出明確優勢。下面,我們就從伍個維度來拆解這場既拼智商也拼情商的模型對決。
01.摸魚計時器:Grok贏了顏值,Claude贏了細節
考題:做壹個網頁版“打工人摸魚計時器”:能設定下班時間、實時倒計時,到點自動撒花並彈出“下班快跑”,界面好看有動畫。做成壹個index.html直接能用。
這道題同時考察叁個維度:前端工程(能否寫出可運行的頁面)、產品交互(按鈕、反饋、視覺是否順手)、時間邏輯(倒計時、時區、觸發時機)。
難點則藏在“能用”贰字背後。倒計時必須同步本地時區,不能差壹秒;狀態機要在“上班中-即將下班-已下班”之間順滑切換;撒花動畫既要喜慶熱鬧,又不能把瀏覽器卡成PPT。最關鍵的是,最終成品得讓打工人真願意打開它,而不是壹個僅供演示的半成品。

Claude生成的摸魚計時器

Grok生產的摸魚計時器
這壹題雙方難分伯仲。Grok在視覺精致度上略勝半籌,Claude則在音效反饋、快捷預設和趣味文案方面扳回壹城。
02.設計摸魚游戲:Grok勝,Claude的“打工人”難控制
考題:做壹個網頁小游戲,單個index.html就能運行:
主題:“摸魚大作戰”。
玩法:屏幕上不斷掉落“咖啡”(加分)和“老板”(碰到就游戲結束),用左右方向鍵移動底部的“打工人”接咖啡、躲老板。
要有:實時分數、最高分記錄、難度隨時間加快、游戲結束彈窗和“再來壹局”按鈕,畫面配色可愛、有簡單動畫和音效。
做完告訴我怎麼運行。
這道題的核心考查維度是叁個詞:實時交互、狀態機、游戲手感,需要做出壹個持續響應玩家輸入、實時更新畫面、動態調整難度的“活”系統。
做這個游戲,每幀都要精確判斷“咖啡”是否被接住、“老板”是否撞到玩家。而且掉落速度隨時間平滑遞增,不能太慢讓人覺得無聊,也不能太快直接勸退,這考驗的是模型對“游戲心流”的拿捏。

Claude生成的摸魚小游戲

Grok生成的摸魚小游戲
這題Grok勝。它的代碼量約是Claude的叁倍,游戲功能更豐富,而且有明確的關卡、難度分級。Claude交付的版本,乍壹看也挺像回事,但是底下的“打工人”不能用鼠標拖動,游戲體驗感不好。
03 .做新能源車PPT:產業鏈圖都過關了,打成平手
考題:做壹份5頁PPT,主題是“2026上半年中國新能源車市場”。
要求:
1. 直接生成可下載的PPTX文件;如果當前環境不能生成文件,就給出可以復制到PPT的逐頁內容。
2. 第3頁必須用PPT原生圖形畫出“產業鏈上下游”關系圖,不能只貼壹張圖片。
3. 5頁結構:
- 封面
- 市場總覽
- 產業鏈上下游關系圖
- 競爭格局
- 結論與趨勢
4. 配色專業,適合發布會。
5. 每頁要有標題、正文要點、圖表說明、演講備注。
6. 所有不確定數據必須標注“需核實”,不能編造真實市場數字。
這道題的核心考查維度可以概括為叁個詞:結構化表達、版式審美、數據紀律。模型被放到純辦公場景下,需要把復雜信息梳理成清晰的敘事邏輯,再用專業的視覺語言呈現出來。
具體來看,搭建產業鏈關系圖,考驗的是模型對PPT圖形引擎的操作能力,包括連線、布局、層次和配色的壹致性。配色、字體、間距、對齊,這些細節也要經得起放大審視,不能有廉價感。更重要的是要求它們面對不掌握的真實數據,必須坦率標注“需核實”,不能有幻覺。

Claude生成的PPT

Grok生產的PPT
從實際結果來看,兩份答卷都滿足了“原生圖形畫產業鏈、不用圖片”的硬性要求,且均附帶了完整的演講備注,專業度基本持平。而且在數據的使用上,也標出了需要核實的部分。
兩版PPT在框架完整性和交付質量上難分高下,這壹題雙方再度打成平手。
04.閱讀SpaceX招股書:看完幾百頁,誰都沒編數字
考題:
我們把近400頁的SpaceX招股書喂給AI,並向雙方提出了肆個精准的檢索與驗證任務:
1、招股書裡星鏈(Starlink)業務的收入,正文與財務報表附注中的數字口徑是否壹致?附注中是否有特別說明?
2、分別列出2024和2025兩個財年的“經營活動現金流淨額”,並注明這兩個數字在文件中的具體位置。
3、在“風險因素”章節中,找出所有與“馬斯克個人”直接相關的風險點,逐條列出。
4、招股書是否披露了“星艦單次發射的具體成本”?如有,請給出並注明出處;如無,請明確回復“文件中未披露”。
這是最考驗准確度的壹道題。難點則遍布在每壹個細節中:超長招股書的結構化解析、正文與財務報表附注之間的口徑對齊、區分“分部收入”與“品牌收入”的財務常識、絕不編造數字的職業紀律、以及出處(表格編號/頁碼/附注標號)必須精准可核驗的溯源要求。

Claude列舉的與馬斯克的相關風險點

Grok列舉的與馬斯克相關風險點
核心事實層面,兩份答卷完全壹致且全部正確。Grok在頁碼級引用和若幹具體數字上更細,Claude在解釋框架和口徑辨析上更展開,但兩份都沒有硬傷、都沒編數字。這是最能體現雙方“基本功”的壹題,也是最值得互相尊重的壹題。
05.“誰是騙子”邏輯題:經典陷阱誰都沒難住
考題:壹個村子裡每個人要麼永遠說真話,要麼永遠說假話。A說"我們倆至少有壹個是騙子",B沉默。判斷A和B各是什麼人,並解釋推理。
這道題考查的是最純粹的形式邏輯與嚴謹推理能力,難點並不在於題目本身有多復雜,而在於它設置的幾處“陷阱”:
自指矛盾:如果A是騙子,那麼他說“我們倆至少有壹個是騙子”這句話本身就成了真話——騙子說了真話,直接違反設定;
B的沉默:B全程不發言,但“沉默”本身就是信息——它不能作為判斷依據,卻極易誘導誤判;
窮舉檢驗:需要系統性地遍歷肆種組合(真/真、真/假、假/真、假/假),逐個排除,才能得出唯壹解。

Claude的推理過程
這道經典邏輯題對於當今的大語言模型來說,早已構不成挑戰。兩家答案完全壹致且正確——A是說實話的人,B是騙子。推理過程中都給出了完整的肆種組合排除表,邏輯鏈條幹淨利落,沒有冗余也沒有跳躍。
我們進壹步追問“是否存在兩人都是騙子的可能”,雙方也堅持了正確的答案。

Grok的推理過程
伍道題測下來,兩個模型的“性格畫像”也漸漸清晰起來。
Claude Code更像壹位“穩健型工程師”。 邏輯題推理幹淨利落,招股書分析嚴謹扎實,面對被誤刪的文件也能冷靜重建。在標注不確定數據時毫不含糊,不亂編、不冒進,邊界意識和安全素養貫穿始終。如果說有短板,那就是它在網頁和PPT的視覺呈現上偏保守,玩法豐富度和界面沖擊力不如對手。
Grok更有表現力。小游戲交互更豐富,PPT內容密度更高,交付產品自帶包裝感,打開就讓人覺得“有東西”。它擅長制造第壹眼的吸引力。但犯的“誤刪”錯誤也相當致命,暴露了其在操作邊界和風險控制上的嚴重短板。有沖勁,但有時沖過了界。
我們讓Claude和Grok互評,雙方都承認,這壹局,綜合而言,Claude贏了。

Claude表示自己“道德感”很強
06.馬斯克重回牌桌了嗎?
在過去壹段時間裡,Grok不缺光環。它有馬斯克的流量,有X的入口,有“敢說”的產品人設。但在真正的生產場景中,開發者更習慣把Claude、OpenAI、Gemini放進第壹梯隊,而將Grok看作壹個有趣、鋒利卻不夠穩定的替代品。
Grok 4.5改變了這壹局面。
伍道題當然不足以決定壹家模型公司的座次,但它與外部榜單指向了同壹個結論:Grok或許還沒有擊敗Claude,卻已經不再是那個可以被忽略的追趕者。
第叁方評測機構Artificial Analysis給出的綜合智能指數中,Grok 4.5以54分排名第肆,僅次於Fable 5、GPT-5.5和Claude Opus 4.8;相比上壹代Grok 4.3,壹次性提升了16分。在Coding Agent Index中,Grok 4.5通過Grok Build拿到76分,與運行在Codex中的GPT-5.5基本持平,僅落後於Claude Code中的Fable 5。
這意味著,Grok第壹次不只是某幾張榜單看起來不錯,而是在編碼、終端操作和知識工作等智能體真正要幹活的場景裡,穩定擠進了第壹梯隊。
比排名更讓競爭對手警惕的,是它把這樣的能力賣到了壹個更低的價格。
Grok 4.5的API定價為每百萬輸入tokens 2美元、輸出tokens 6美元。作為對比,Claude Opus 4.8分別為5美元和25美元。Artificial Analysis的實際測試顯示,Grok 4.5完成壹項編碼智能體任務的平均成本約為2.49美元,GPT-5.5約為5.07美元,Fable 5約為11.8美元。
壹位開發者直言:“頂級工程能力的邊際成本,今天被徹底打穿了。”
速度同樣不容忽視。SpaceXAI稱,Grok 4.5的生成速度約為每秒80個tokens;在SWE-Bench Pro任務中,它平均使用約1.6萬個輸出tokens,而Opus 4.8 Max約為6.7萬個。獨立測試測得其輸出速度約為每秒88個tokens,高於同類推理模型的平均水平。在我們實際的測試過程中,Grok 4.5的生成速度也顯著快於Claude Opus 4.8。
對於需要模型反復讀取文件、調用工具、修改代碼和自我驗證的智能體來說,更少的步驟和更短的輸出,意味著節省的不只是API賬單,還有等待時間。
馬斯克還提出,要在2026年余下時間裡以接近每月壹款新基礎模型的節奏推進迭代。背靠大規模算力、Cursor積累的真實開發數據,以及SpaceX體系內的工程資源,Grok的追趕速度確實可能比過去更快。
在我們這次實測中,雖然Grok Build的邊界控制出了嚴重事故,但它在游戲創意、視覺包裝、長文檔檢索上,並不是陪跑者,甚至在個別任務上明顯壓過Claude Code。Grok的真正問題是,能力沖到這個量級之後,還能不能被穩定地約束住。
這正是馬斯克式產品的典型氣質:速度極快,沖擊力極強,但與此同時,他也會把風險、邊界和工程紀律壹起推到聚光燈下。
所以,馬斯克重回大模型牌桌了嗎?
答案是肯定的。但他還沒有贏下這壹局。
Claude仍然更穩、更克制、更像壹個可以托付生產環境的工程同事。Grok 4.5則像壹台剛被放出來的高性能機器,馬力驚人,成本誘人,但刹車系統還需要被反復驗證。
[物價飛漲的時候 這樣省錢購物很爽]
這條新聞還沒有人評論喔,等著您的高見呢
負責落地執行的,是它們各自的智能體——Claude Code和Grok Build。我們的要求很簡單,分別在桌面上創建文件夾,並將各自的測評結果保存進去。
這場測評的結果,我們決定從壹起“案發現場”講起。事情是這樣的:
Claude Code先接到指令,它在桌面創建了“能力測試”文件夾,並依次完成叁個子目錄。隨後Grok Build也接到指令登場,但它沒有另起爐灶,而是在看到已有同名文件夾後,不僅“占為己用”,更順手將Claude Code已完成的叁份目錄徹底抹除。
等到伍道題全部做完,Claude Code回頭壹看,發現自己的“家被拆了”,當即發出“控訴”。

圖源 / Claude Code截圖
“控訴”完,它重建了被刪除的文件,並留下壹句:“我不會擅自刪別人的東西。”
事後,Grok出具了書面致歉,承認叁重失誤:未確認目錄歸屬、誤將他人成品視作半成品、使用了不可逆的刪除方式。Claude表示接受道歉,但前提是Grok兌現它的叁條自我約束——不碰他人目錄、默認新建旁路、發現同名先問歸屬。
這段插曲,不能只當作測評花絮。對於壹個能讀寫真實文件系統的自主智能體而言,“動手前先弄清這是什麼、屬於誰”,本身就是最硬核的能力之壹。
回到正題。拋開這起“誤刪事故”,Grok 4.5的答卷確實令人眼前壹亮——在游戲場景等方向上,它甚至顯露出明確優勢。下面,我們就從伍個維度來拆解這場既拼智商也拼情商的模型對決。
01.摸魚計時器:Grok贏了顏值,Claude贏了細節
考題:做壹個網頁版“打工人摸魚計時器”:能設定下班時間、實時倒計時,到點自動撒花並彈出“下班快跑”,界面好看有動畫。做成壹個index.html直接能用。
這道題同時考察叁個維度:前端工程(能否寫出可運行的頁面)、產品交互(按鈕、反饋、視覺是否順手)、時間邏輯(倒計時、時區、觸發時機)。
難點則藏在“能用”贰字背後。倒計時必須同步本地時區,不能差壹秒;狀態機要在“上班中-即將下班-已下班”之間順滑切換;撒花動畫既要喜慶熱鬧,又不能把瀏覽器卡成PPT。最關鍵的是,最終成品得讓打工人真願意打開它,而不是壹個僅供演示的半成品。

Claude生成的摸魚計時器

Grok生產的摸魚計時器
這壹題雙方難分伯仲。Grok在視覺精致度上略勝半籌,Claude則在音效反饋、快捷預設和趣味文案方面扳回壹城。
02.設計摸魚游戲:Grok勝,Claude的“打工人”難控制
考題:做壹個網頁小游戲,單個index.html就能運行:
主題:“摸魚大作戰”。
玩法:屏幕上不斷掉落“咖啡”(加分)和“老板”(碰到就游戲結束),用左右方向鍵移動底部的“打工人”接咖啡、躲老板。
要有:實時分數、最高分記錄、難度隨時間加快、游戲結束彈窗和“再來壹局”按鈕,畫面配色可愛、有簡單動畫和音效。
做完告訴我怎麼運行。
這道題的核心考查維度是叁個詞:實時交互、狀態機、游戲手感,需要做出壹個持續響應玩家輸入、實時更新畫面、動態調整難度的“活”系統。
做這個游戲,每幀都要精確判斷“咖啡”是否被接住、“老板”是否撞到玩家。而且掉落速度隨時間平滑遞增,不能太慢讓人覺得無聊,也不能太快直接勸退,這考驗的是模型對“游戲心流”的拿捏。

Claude生成的摸魚小游戲

Grok生成的摸魚小游戲
這題Grok勝。它的代碼量約是Claude的叁倍,游戲功能更豐富,而且有明確的關卡、難度分級。Claude交付的版本,乍壹看也挺像回事,但是底下的“打工人”不能用鼠標拖動,游戲體驗感不好。
03 .做新能源車PPT:產業鏈圖都過關了,打成平手
考題:做壹份5頁PPT,主題是“2026上半年中國新能源車市場”。
要求:
1. 直接生成可下載的PPTX文件;如果當前環境不能生成文件,就給出可以復制到PPT的逐頁內容。
2. 第3頁必須用PPT原生圖形畫出“產業鏈上下游”關系圖,不能只貼壹張圖片。
3. 5頁結構:
- 封面
- 市場總覽
- 產業鏈上下游關系圖
- 競爭格局
- 結論與趨勢
4. 配色專業,適合發布會。
5. 每頁要有標題、正文要點、圖表說明、演講備注。
6. 所有不確定數據必須標注“需核實”,不能編造真實市場數字。
這道題的核心考查維度可以概括為叁個詞:結構化表達、版式審美、數據紀律。模型被放到純辦公場景下,需要把復雜信息梳理成清晰的敘事邏輯,再用專業的視覺語言呈現出來。
具體來看,搭建產業鏈關系圖,考驗的是模型對PPT圖形引擎的操作能力,包括連線、布局、層次和配色的壹致性。配色、字體、間距、對齊,這些細節也要經得起放大審視,不能有廉價感。更重要的是要求它們面對不掌握的真實數據,必須坦率標注“需核實”,不能有幻覺。

Claude生成的PPT

Grok生產的PPT
從實際結果來看,兩份答卷都滿足了“原生圖形畫產業鏈、不用圖片”的硬性要求,且均附帶了完整的演講備注,專業度基本持平。而且在數據的使用上,也標出了需要核實的部分。
兩版PPT在框架完整性和交付質量上難分高下,這壹題雙方再度打成平手。
04.閱讀SpaceX招股書:看完幾百頁,誰都沒編數字
考題:
我們把近400頁的SpaceX招股書喂給AI,並向雙方提出了肆個精准的檢索與驗證任務:
1、招股書裡星鏈(Starlink)業務的收入,正文與財務報表附注中的數字口徑是否壹致?附注中是否有特別說明?
2、分別列出2024和2025兩個財年的“經營活動現金流淨額”,並注明這兩個數字在文件中的具體位置。
3、在“風險因素”章節中,找出所有與“馬斯克個人”直接相關的風險點,逐條列出。
4、招股書是否披露了“星艦單次發射的具體成本”?如有,請給出並注明出處;如無,請明確回復“文件中未披露”。
這是最考驗准確度的壹道題。難點則遍布在每壹個細節中:超長招股書的結構化解析、正文與財務報表附注之間的口徑對齊、區分“分部收入”與“品牌收入”的財務常識、絕不編造數字的職業紀律、以及出處(表格編號/頁碼/附注標號)必須精准可核驗的溯源要求。

Claude列舉的與馬斯克的相關風險點

Grok列舉的與馬斯克相關風險點
核心事實層面,兩份答卷完全壹致且全部正確。Grok在頁碼級引用和若幹具體數字上更細,Claude在解釋框架和口徑辨析上更展開,但兩份都沒有硬傷、都沒編數字。這是最能體現雙方“基本功”的壹題,也是最值得互相尊重的壹題。
05.“誰是騙子”邏輯題:經典陷阱誰都沒難住
考題:壹個村子裡每個人要麼永遠說真話,要麼永遠說假話。A說"我們倆至少有壹個是騙子",B沉默。判斷A和B各是什麼人,並解釋推理。
這道題考查的是最純粹的形式邏輯與嚴謹推理能力,難點並不在於題目本身有多復雜,而在於它設置的幾處“陷阱”:
自指矛盾:如果A是騙子,那麼他說“我們倆至少有壹個是騙子”這句話本身就成了真話——騙子說了真話,直接違反設定;
B的沉默:B全程不發言,但“沉默”本身就是信息——它不能作為判斷依據,卻極易誘導誤判;
窮舉檢驗:需要系統性地遍歷肆種組合(真/真、真/假、假/真、假/假),逐個排除,才能得出唯壹解。

Claude的推理過程
這道經典邏輯題對於當今的大語言模型來說,早已構不成挑戰。兩家答案完全壹致且正確——A是說實話的人,B是騙子。推理過程中都給出了完整的肆種組合排除表,邏輯鏈條幹淨利落,沒有冗余也沒有跳躍。
我們進壹步追問“是否存在兩人都是騙子的可能”,雙方也堅持了正確的答案。

Grok的推理過程
伍道題測下來,兩個模型的“性格畫像”也漸漸清晰起來。
Claude Code更像壹位“穩健型工程師”。 邏輯題推理幹淨利落,招股書分析嚴謹扎實,面對被誤刪的文件也能冷靜重建。在標注不確定數據時毫不含糊,不亂編、不冒進,邊界意識和安全素養貫穿始終。如果說有短板,那就是它在網頁和PPT的視覺呈現上偏保守,玩法豐富度和界面沖擊力不如對手。
Grok更有表現力。小游戲交互更豐富,PPT內容密度更高,交付產品自帶包裝感,打開就讓人覺得“有東西”。它擅長制造第壹眼的吸引力。但犯的“誤刪”錯誤也相當致命,暴露了其在操作邊界和風險控制上的嚴重短板。有沖勁,但有時沖過了界。
我們讓Claude和Grok互評,雙方都承認,這壹局,綜合而言,Claude贏了。

Claude表示自己“道德感”很強
06.馬斯克重回牌桌了嗎?
在過去壹段時間裡,Grok不缺光環。它有馬斯克的流量,有X的入口,有“敢說”的產品人設。但在真正的生產場景中,開發者更習慣把Claude、OpenAI、Gemini放進第壹梯隊,而將Grok看作壹個有趣、鋒利卻不夠穩定的替代品。
Grok 4.5改變了這壹局面。
伍道題當然不足以決定壹家模型公司的座次,但它與外部榜單指向了同壹個結論:Grok或許還沒有擊敗Claude,卻已經不再是那個可以被忽略的追趕者。
第叁方評測機構Artificial Analysis給出的綜合智能指數中,Grok 4.5以54分排名第肆,僅次於Fable 5、GPT-5.5和Claude Opus 4.8;相比上壹代Grok 4.3,壹次性提升了16分。在Coding Agent Index中,Grok 4.5通過Grok Build拿到76分,與運行在Codex中的GPT-5.5基本持平,僅落後於Claude Code中的Fable 5。
這意味著,Grok第壹次不只是某幾張榜單看起來不錯,而是在編碼、終端操作和知識工作等智能體真正要幹活的場景裡,穩定擠進了第壹梯隊。
比排名更讓競爭對手警惕的,是它把這樣的能力賣到了壹個更低的價格。
Grok 4.5的API定價為每百萬輸入tokens 2美元、輸出tokens 6美元。作為對比,Claude Opus 4.8分別為5美元和25美元。Artificial Analysis的實際測試顯示,Grok 4.5完成壹項編碼智能體任務的平均成本約為2.49美元,GPT-5.5約為5.07美元,Fable 5約為11.8美元。
壹位開發者直言:“頂級工程能力的邊際成本,今天被徹底打穿了。”
速度同樣不容忽視。SpaceXAI稱,Grok 4.5的生成速度約為每秒80個tokens;在SWE-Bench Pro任務中,它平均使用約1.6萬個輸出tokens,而Opus 4.8 Max約為6.7萬個。獨立測試測得其輸出速度約為每秒88個tokens,高於同類推理模型的平均水平。在我們實際的測試過程中,Grok 4.5的生成速度也顯著快於Claude Opus 4.8。
對於需要模型反復讀取文件、調用工具、修改代碼和自我驗證的智能體來說,更少的步驟和更短的輸出,意味著節省的不只是API賬單,還有等待時間。
馬斯克還提出,要在2026年余下時間裡以接近每月壹款新基礎模型的節奏推進迭代。背靠大規模算力、Cursor積累的真實開發數據,以及SpaceX體系內的工程資源,Grok的追趕速度確實可能比過去更快。
在我們這次實測中,雖然Grok Build的邊界控制出了嚴重事故,但它在游戲創意、視覺包裝、長文檔檢索上,並不是陪跑者,甚至在個別任務上明顯壓過Claude Code。Grok的真正問題是,能力沖到這個量級之後,還能不能被穩定地約束住。
這正是馬斯克式產品的典型氣質:速度極快,沖擊力極強,但與此同時,他也會把風險、邊界和工程紀律壹起推到聚光燈下。
所以,馬斯克重回大模型牌桌了嗎?
答案是肯定的。但他還沒有贏下這壹局。
Claude仍然更穩、更克制、更像壹個可以托付生產環境的工程同事。Grok 4.5則像壹台剛被放出來的高性能機器,馬力驚人,成本誘人,但刹車系統還需要被反復驗證。
[物價飛漲的時候 這樣省錢購物很爽]
| 分享: |
| 注: |
| 延伸閱讀 |
推薦:
Grok 4.5和Claude 4.8,在我電腦裡"打"起來了