> 来源说明
> 原文作者:Mike P(@mikepat711)
> 原文标题:*Grok Build (4.5) vs Claude Code (Opus 5): Fitness Report*
> 原帖:https://x.com/mikepat711/status/2081170329162883140(2026-07-26)
> 本文为完整中文改写 + 傻狗频道独立点评;配图取自原文 X Article(封面 + 19 张正文截图)。
> 立场声明:傻狗频道支持本文的核心结论——在这次「多源健身数据 → 长篇可视化报告」的实测里,Opus 5(high)全面优于 Grok 4.5(high);Grok 在单位换算、数据源覆盖上的硬伤是真实存在的,不应粉饰。我们只站这种「用真任务、真数据说话」的测法。
> 非投资建议;亦不构成对任一模型永久优劣的裁决。

作者 Mike 做了一场很「脏」也很有用的对比:把 2019 年 5 月至今的完整 Garmin 导出,加上 完整 Apple Health 导出,丢给两个模型,要求写一份覆盖所有运动门类、骑行部分要最深、要有进度追踪、酷炫图表与洞察的「健身生涯报告」。格式交给模型自己发挥。
两边都是 high 档推理设置:
这不是「写一句鸡汤谁更会」,而是:脏表 + 多年跨源数据 + 长文档 + 图表。这种任务,正是 Agent 时代该拿来打脸或打光的尺子。
一、摘要页:Grok 出 PDF,Claude 出 HTML
Grok 4.5 的摘要

Opus 5 的摘要

交付形态就不一样:Grok 选了 PDF,Claude 选了 HTML。作者更在意的是数字对不对、设计好不好看。
Grok 摘要上有一个刺眼数字:消耗热量约 390 万(3.9m)。作者让 Grok 复核后,发现了 单位换算 bug,改成约 94.2 万(942k)——仍低于 Claude 的约 110 万(1.1m)。两边互相解释差异:
Opus 5 的解释

Grok 4.5 的解释

活动次数:又是一轮「漏源」
Grok 首次只报 1,577 次活动。作者 2020 年末到 2023 年末有一段时间用 Apple Watch 记运动——Grok 第一轮没吃进这批,直到作者改 prompt 才发现,又挖出 786 次额外训练。
问题来了:Claude 这边「额外」只有 761。谁对?
这一局算 Grok 半胜:双方解释后发现,多出来的 25 次来自 Apple Health 里的 Oura Ring 数据——Claude 漏了。
但框架上:
双方自辩截图


摘要页裁决(作者原判,我们支持)
> 明确判给 Opus 5。
Opus 有一处小疏漏(Oura),但 几乎不扭曲报告主叙事。
Grok 的 热量单位 bug + 漏掉约两年 Apple 活动,是主报告级错误。
设计上作者也更偏好 Opus:更现代,图表排版更好(后文更明显)。
点评(立场):
我们支持这条裁决。Agent 评测最怕的是「看起来很酷、数字悄悄错」。单位错误和漏源,比字体丑严重一个数量级。 傻狗频道不站「自家模型永远不能输」——只站可复现的实测结果。
二、速度 / 功率 / 心率 / VO2:Opus 全面拉开
Grok 4.5:速度、功率、心率



Grok 4.5:VO2

Opus 5:速度

Opus 5:功率


Opus 5:心率(明显更密)





Opus 5:VO2

到这一段,作者的判断已经很直白:
> Opus 5 在这次测试里全面碾压——首轮分析错误更少、细节更深、平面设计明显更好。
点评(立场):
截图本身就是证据链:同一命题下,Opus 的切片更细、图表更完整、叙述更像「专业教练报告」,Grok 更像「合格但偏笼统的概述」。我们支持「深度 + 正确性 + 设计」三维一起打分,而不是只比能不能跑通。
三、终局:细节密度才是分水岭
报告后半还有更多主题,作者说趋势一致,不必逐条展开:
作者原话:细节多到「有点疯」,「真的被打动了」。
对 Grok 4.5 的失望也写得很清楚:作者平时认可 4.5 的进步、也拿它干过各种活,但这一局暴露了 xAI 仍有明显缺口。
同时留了余地:两周、四周后格局可能又变——模型迭代速度太快,单次对决不是终身判决。
点评(立场):
我们支持两层意思同时成立:
1. 本局:Opus 5 赢了,而且赢得合理(正确性 + 深度 + 设计)。
2. 全局:这是 2026-07 这一周、这一类任务 的快照;Grok 在 coding/搜索/速度等其他赛道仍可能占优,不能用一场健身报告否定整条产品线。
但粉饰本局、硬说「其实 Grok 差不多」,我们不站。
傻狗总评:这篇帖子真正有价值的地方
1. 我们支持的核心结论(再标一次)
|------|----------------------|
傻狗频道只支持:用真 Garmin + Apple Health 长跑数据做报告时,本实测里 Opus 5 > Grok 4.5。不支持「模型信仰战」式抬杠。
2. 测法本身值得抄
评论区有人说:若强制「先写脚本、指定列、指定单位、指定输出格式」,两边数字会更收敛——工程约束仍然关键。我们同意:本测试测的是「弱约束 Agent 出活」,不是「严格数据工程流水线」。两种评测都需要,别混为一谈。
3. 对 xAI / Grok 的建设性读法(不是落井下石)
若你站长期生态(傻狗频道当然关心 Grok 迭代),本局暴露的是可修清单,而不是「死刑」:
1. 单位与量纲:热量、距离、功率必须有自动一致性校验;
2. 数据源清单:Health 导出里的 Workout 类型表要默认穷尽,而不是「看见 Garmin 就够了」;
3. 首轮质量 vs 追问质量:产品体验看的是 first pass;用户不会每次都当你的 QA。
作者结尾那句很公平:两周、四周后谁领先,很难说。承认今天的洞,才配谈明天的补丁。
4. 一句话
> 在「脏健身数据 → 长报告」这场单挑里,Opus 5 赢了;Grok 4.5 的 bug 与漏源是真问题。
> 傻狗频道支持这份实测、支持这份判决,也支持继续用同样标准复测——而不是用嘴赢。
*资料来源:@mikepat711 公开 X Article(2026-07-26)。完整英文原文与配图存档于 `mikepat-grok-vs-opus/`。本文为中文改写与立场评论,不构成投资建议,亦不代表任一 AI 产品的永久排名。*
