傻狗频道
马斯克帝国每日资讯
留言板归档订阅频道
专题文章2026-07-26👁 19,800

Grok 4.5 vs Claude Opus 5:一份真实健身数据的「长报告」对决

Mike P(@mikepat711)用 2019 至今完整 Garmin + Apple Health 导出,让 Grok 4.5 与 Claude Opus 5 同做骑行加重的健身生涯报告。Grok 出现热量单位 bug、首轮漏掉约两年 Apple Watch 活动;Opus 细节更深、设计更好,仅小漏 Oura。傻狗频道支持作者判决:本局 Opus 5 完胜。原文配图全部嵌入。非永久排名。

Grok 4.5 vs Claude Opus 5:一份真实健身数据的「长报告」对决

> 来源说明

> 原文作者:Mike P(@mikepat711)

> 原文标题:*Grok Build (4.5) vs Claude Code (Opus 5): Fitness Report*

> 原帖:https://x.com/mikepat711/status/2081170329162883140(2026-07-26)

> 本文为完整中文改写 + 傻狗频道独立点评;配图取自原文 X Article(封面 + 19 张正文截图)

> 立场声明:傻狗频道支持本文的核心结论——在这次「多源健身数据 → 长篇可视化报告」的实测里,Opus 5(high)全面优于 Grok 4.5(high);Grok 在单位换算、数据源覆盖上的硬伤是真实存在的,不应粉饰。我们只站这种「用真任务、真数据说话」的测法。

> 非投资建议;亦不构成对任一模型永久优劣的裁决。

封面:Grok Build 4.5 vs Claude Code Opus 5
封面:Grok Build 4.5 vs Claude Code Opus 5

作者 Mike 做了一场很「脏」也很有用的对比:把 2019 年 5 月至今的完整 Garmin 导出,加上 完整 Apple Health 导出,丢给两个模型,要求写一份覆盖所有运动门类、骑行部分要最深、要有进度追踪、酷炫图表与洞察的「健身生涯报告」。格式交给模型自己发挥。

两边都是 high 档推理设置:

  • **Grok 4.5(high)** — 走 Grok Build
  • **Claude Opus 5(high)** — 走 Claude Code
  • 这不是「写一句鸡汤谁更会」,而是:脏表 + 多年跨源数据 + 长文档 + 图表。这种任务,正是 Agent 时代该拿来打脸或打光的尺子。


    一、摘要页:Grok 出 PDF,Claude 出 HTML

    Grok 4.5 的摘要

    Grok 4.5 健身报告摘要页
    Grok 4.5 健身报告摘要页

    Opus 5 的摘要

    Opus 5 健身报告摘要页
    Opus 5 健身报告摘要页

    交付形态就不一样:Grok 选了 PDF,Claude 选了 HTML。作者更在意的是数字对不对、设计好不好看。

    Grok 摘要上有一个刺眼数字:消耗热量约 390 万(3.9m)。作者让 Grok 复核后,发现了 单位换算 bug,改成约 94.2 万(942k)——仍低于 Claude 的约 110 万(1.1m)。两边互相解释差异:

    Opus 5 的解释

    Opus 5 解释热量数字差异
    Opus 5 解释热量数字差异

    Grok 4.5 的解释

    Grok 4.5 解释热量数字差异
    Grok 4.5 解释热量数字差异

    活动次数:又是一轮「漏源」

    Grok 首次只报 1,577 次活动。作者 2020 年末到 2023 年末有一段时间用 Apple Watch 记运动——Grok 第一轮没吃进这批,直到作者改 prompt 才发现,又挖出 786 次额外训练。

    问题来了:Claude 这边「额外」只有 761。谁对?

    这一局算 Grok 半胜:双方解释后发现,多出来的 25 次来自 Apple Health 里的 Oura Ring 数据——Claude 漏了。

    但框架上:

  • Grok:**先漏掉一大池 Apple 活动**(主伤),后来补上,并捡到 Oura 小细节;
  • Claude:**主数据池更稳**,漏了 Oura 小池(次伤)。
  • 双方自辩截图

    Opus 5 解释活动数差异
    Opus 5 解释活动数差异
    Grok 4.5 解释活动数差异
    Grok 4.5 解释活动数差异

    摘要页裁决(作者原判,我们支持)

    > 明确判给 Opus 5。

    Opus 有一处小疏漏(Oura),但 几乎不扭曲报告主叙事

    Grok 的 热量单位 bug + 漏掉约两年 Apple 活动,是主报告级错误

    设计上作者也更偏好 Opus:更现代,图表排版更好(后文更明显)。

    点评(立场):

    我们支持这条裁决。Agent 评测最怕的是「看起来很酷、数字悄悄错」。单位错误和漏源,比字体丑严重一个数量级。 傻狗频道不站「自家模型永远不能输」——只站可复现的实测结果。


    二、速度 / 功率 / 心率 / VO2:Opus 全面拉开

    Grok 4.5:速度、功率、心率

    Grok 4.5 速度洞察
    Grok 4.5 速度洞察
    Grok 4.5 功率洞察
    Grok 4.5 功率洞察
    Grok 4.5 心率洞察
    Grok 4.5 心率洞察

    Grok 4.5:VO2

    Grok 4.5 VO2 相关分析
    Grok 4.5 VO2 相关分析

    Opus 5:速度

    Opus 5 速度洞察
    Opus 5 速度洞察

    Opus 5:功率

    Opus 5 功率洞察
    Opus 5 功率洞察
    Opus 5 功率补充分析
    Opus 5 功率补充分析

    Opus 5:心率(明显更密)

    Opus 5 心率分析 1
    Opus 5 心率分析 1
    Opus 5 心率分析 2
    Opus 5 心率分析 2
    Opus 5 心率分析 3
    Opus 5 心率分析 3
    Opus 5 心率分析 4
    Opus 5 心率分析 4
    Opus 5 心率分析 5
    Opus 5 心率分析 5

    Opus 5:VO2

    Opus 5 VO2 分析
    Opus 5 VO2 分析

    到这一段,作者的判断已经很直白:

    > Opus 5 在这次测试里全面碾压——首轮分析错误更少、细节更深、平面设计明显更好。

    点评(立场):

    截图本身就是证据链:同一命题下,Opus 的切片更细、图表更完整、叙述更像「专业教练报告」,Grok 更像「合格但偏笼统的概述」。我们支持「深度 + 正确性 + 设计」三维一起打分,而不是只比能不能跑通。


    三、终局:细节密度才是分水岭

    报告后半还有更多主题,作者说趋势一致,不必逐条展开:

  • 两边**话题覆盖**大体重叠;
  • Grok 往往停在**一般性**总结;
  • Opus 会往下挖——很多洞察是作者**自己都没想过要看**的。
  • 作者原话:细节多到「有点疯」,「真的被打动了」。

    对 Grok 4.5 的失望也写得很清楚:作者平时认可 4.5 的进步、也拿它干过各种活,但这一局暴露了 xAI 仍有明显缺口

    同时留了余地:两周、四周后格局可能又变——模型迭代速度太快,单次对决不是终身判决

    点评(立场):

    我们支持两层意思同时成立:

    1. 本局:Opus 5 赢了,而且赢得合理(正确性 + 深度 + 设计)。

    2. 全局:这是 2026-07 这一周、这一类任务 的快照;Grok 在 coding/搜索/速度等其他赛道仍可能占优,不能用一场健身报告否定整条产品线

    但粉饰本局、硬说「其实 Grok 差不多」,我们不站。


    傻狗总评:这篇帖子真正有价值的地方

    1. 我们支持的核心结论(再标一次)

    · 维度 · 本局结果(支持作者) ·

    |------|----------------------|

    · 首轮数据正确性 · **Opus 5 更好**(Grok 热量单位 bug + 漏 Apple 活动池) ·
    · 跨源数据覆盖 · 互有漏网;Grok 后补 Oura 半胜,但主伤更重 ·
    · 分析深度 · **Opus 5 明显更深** ·
    · 视觉与排版 · **Opus 5 更现代、更清晰** ·
    · 总判决 · **Opus 5 完胜本任务** ·

    傻狗频道只支持:用真 Garmin + Apple Health 长跑数据做报告时,本实测里 Opus 5 > Grok 4.5。不支持「模型信仰战」式抬杠。

    2. 测法本身值得抄

  • 真实多年脏数据,不是玩具 CSV;
  • 多源合并(Garmin / Apple Watch / Oura 进 Health);
  • 强制长报告 + 可视化,而不是单题问答;
  • 发现分歧后**让两边互相解释**,比「一次生成定生死」更接近真实用法。
  • 评论区有人说:若强制「先写脚本、指定列、指定单位、指定输出格式」,两边数字会更收敛——工程约束仍然关键。我们同意:本测试测的是「弱约束 Agent 出活」,不是「严格数据工程流水线」。两种评测都需要,别混为一谈

    3. 对 xAI / Grok 的建设性读法(不是落井下石)

    若你站长期生态(傻狗频道当然关心 Grok 迭代),本局暴露的是可修清单,而不是「死刑」:

    1. 单位与量纲:热量、距离、功率必须有自动一致性校验;

    2. 数据源清单:Health 导出里的 Workout 类型表要默认穷尽,而不是「看见 Garmin 就够了」;

    3. 首轮质量 vs 追问质量:产品体验看的是 first pass;用户不会每次都当你的 QA。

    作者结尾那句很公平:两周、四周后谁领先,很难说。承认今天的洞,才配谈明天的补丁。

    4. 一句话

    > 在「脏健身数据 → 长报告」这场单挑里,Opus 5 赢了;Grok 4.5 的 bug 与漏源是真问题。

    > 傻狗频道支持这份实测、支持这份判决,也支持继续用同样标准复测——而不是用嘴赢。


    *资料来源:@mikepat711 公开 X Article(2026-07-26)。完整英文原文与配图存档于 `mikepat-grok-vs-opus/`。本文为中文改写与立场评论,不构成投资建议,亦不代表任一 AI 产品的永久排名。*

    本文同步发布于 YouTube,观看完整视频请前往 YouTube @pizypizy
    #Grok#Claude#Opus 5#Grok 4.5#AI评测#Agent#xAI#Anthropic#健身数据#基准测试

    📬 邮件订阅

    留下邮箱,马斯克帝国每日资讯更新时通知你

    评论 (0)

    加载中...