Grok 4.5和Claude 4.8,在我电脑里"打"起来了
Claude的推理过程
这道经典逻辑题对于当今的大语言模型来说,早已构不成挑战。两家答案完全一致且正确——A是说实话的人,B是骗子。推理过程中都给出了完整的四种组合排除表,逻辑链条干净利落,没有冗余也没有跳跃。
我们进一步追问“是否存在两人都是骗子的可能”,双方也坚持了正确的答案。

Grok的推理过程
五道题测下来,两个模型的“性格画像”也渐渐清晰起来。
Claude Code更像一位“稳健型工程师”。 逻辑题推理干净利落,招股书分析严谨扎实,面对被误删的文件也能冷静重建。在标注不确定数据时毫不含糊,不乱编、不冒进,边界意识和安全素养贯穿始终。如果说有短板,那就是它在网页和PPT的视觉呈现上偏保守,玩法丰富度和界面冲击力不如对手。
Grok更有表现力。小游戏交互更丰富,PPT内容密度更高,交付产品自带包装感,打开就让人觉得“有东西”。它擅长制造第一眼的吸引力。但犯的“误删”错误也相当致命,暴露了其在操作边界和风险控制上的严重短板。有冲劲,但有时冲过了界。
我们让Claude和Grok互评,双方都承认,这一局,综合而言,Claude赢了。

Claude表示自己“道德感”很强
06.马斯克重回牌桌了吗?
在过去一段时间里,Grok不缺光环。它有马斯克的流量,有X的入口,有“敢说”的产品人设。但在真正的生产场景中,开发者更习惯把Claude、OpenAI、Gemini放进第一梯队,而将Grok看作一个有趣、锋利却不够稳定的替代品。
Grok 4.5改变了这一局面。
五道题当然不足以决定一家模型公司的座次,但它与外部榜单指向了同一个结论:Grok或许还没有击败Claude,却已经不再是那个可以被忽略的追赶者。
第三方评测机构Artificial Analysis给出的综合智能指数中,Grok 4.5以54分排名第四,仅次于Fable 5、GPT-5.5和Claude Opus 4.8;相比上一代Grok 4.3,一次性提升了16分。在Coding Agent Index中,Grok 4.5通过Grok Build拿到76分,与运行在Codex中的GPT-5.5基本持平,仅落后于Claude Code中的Fable 5。
这意味着,Grok第一次不只是某几张榜单看起来不错,而是在编码、终端操作和知识工作等智能体真正要干活的场景里,稳定挤进了第一梯队。
比排名更让竞争对手警惕的,是它把这样的能力卖到了一个更低的价格。
Grok 4.5的API定价为每百万输入tokens 2美元、输出tokens 6美元。作为对比,Claude Opus 4.8分别为5美元和25美元。Artificial Analysis的实际测试显示,Grok 4.5完成一项编码智能体任务的平均成本约为2.49美元,GPT-5.5约为5.07美元,Fable 5约为11.8美元。
[加西网正招聘多名全职sales 待遇优]
这条新闻还没有人评论喔,等着您的高见呢
这道经典逻辑题对于当今的大语言模型来说,早已构不成挑战。两家答案完全一致且正确——A是说实话的人,B是骗子。推理过程中都给出了完整的四种组合排除表,逻辑链条干净利落,没有冗余也没有跳跃。
我们进一步追问“是否存在两人都是骗子的可能”,双方也坚持了正确的答案。

Grok的推理过程
五道题测下来,两个模型的“性格画像”也渐渐清晰起来。
Claude Code更像一位“稳健型工程师”。 逻辑题推理干净利落,招股书分析严谨扎实,面对被误删的文件也能冷静重建。在标注不确定数据时毫不含糊,不乱编、不冒进,边界意识和安全素养贯穿始终。如果说有短板,那就是它在网页和PPT的视觉呈现上偏保守,玩法丰富度和界面冲击力不如对手。
Grok更有表现力。小游戏交互更丰富,PPT内容密度更高,交付产品自带包装感,打开就让人觉得“有东西”。它擅长制造第一眼的吸引力。但犯的“误删”错误也相当致命,暴露了其在操作边界和风险控制上的严重短板。有冲劲,但有时冲过了界。
我们让Claude和Grok互评,双方都承认,这一局,综合而言,Claude赢了。

Claude表示自己“道德感”很强
06.马斯克重回牌桌了吗?
在过去一段时间里,Grok不缺光环。它有马斯克的流量,有X的入口,有“敢说”的产品人设。但在真正的生产场景中,开发者更习惯把Claude、OpenAI、Gemini放进第一梯队,而将Grok看作一个有趣、锋利却不够稳定的替代品。
Grok 4.5改变了这一局面。
五道题当然不足以决定一家模型公司的座次,但它与外部榜单指向了同一个结论:Grok或许还没有击败Claude,却已经不再是那个可以被忽略的追赶者。
第三方评测机构Artificial Analysis给出的综合智能指数中,Grok 4.5以54分排名第四,仅次于Fable 5、GPT-5.5和Claude Opus 4.8;相比上一代Grok 4.3,一次性提升了16分。在Coding Agent Index中,Grok 4.5通过Grok Build拿到76分,与运行在Codex中的GPT-5.5基本持平,仅落后于Claude Code中的Fable 5。
这意味着,Grok第一次不只是某几张榜单看起来不错,而是在编码、终端操作和知识工作等智能体真正要干活的场景里,稳定挤进了第一梯队。
比排名更让竞争对手警惕的,是它把这样的能力卖到了一个更低的价格。
Grok 4.5的API定价为每百万输入tokens 2美元、输出tokens 6美元。作为对比,Claude Opus 4.8分别为5美元和25美元。Artificial Analysis的实际测试显示,Grok 4.5完成一项编码智能体任务的平均成本约为2.49美元,GPT-5.5约为5.07美元,Fable 5约为11.8美元。
[加西网正招聘多名全职sales 待遇优]
| 分享: |
| Note: | _VIEW_NEWS_FULL |
| 延伸阅读 |
推荐:
Grok 4.5和Claude 4.8,在我电脑里"打"起来了