傻狗频道
马斯克帝国每日资讯
留言板归档订阅频道
专题文章2026-08-30👁 24,186

两边都赢,赢的不是硅:OpenAI 芯片 Jalapeño 与那本贬值的 CUDA 老账

X 上被分开转发的两条帖子——「OpenAI 芯片两条曲线都赢了英伟达」和「OpenAI 工程师看不懂自己的 kernel 代码」——其实是同一条新闻的因和果,而且因果方向是反的。傻狗翻完 SemiAnalysis 原文、OpenAI 官方数据和 Hot Chips 现场报道,拆了三件事:赢的是哪一代英伟达、为什么打平就等于赢、以及真正在贬值的那本二十年老账。

两边都赢,赢的不是硅:OpenAI 芯片 Jalapeño 与那本贬值的 CUDA 老账

8 月 25 到 26 日,X 上有两条帖子被分开转发,各自都刷了不少量。傻狗先把这两条是什么讲清楚,再说自己的看法。

第一条来自 @firesidealpha(Fireside Alpha),转述的是 SemiAnalysis 的分析师 Jordan Nanos 在一档播客里的话。核心是一句:OpenAI 自研的这颗芯片,在"快 token"和"便宜 token"两条曲线上同时赢过英伟达。Nanos 的原话是"结论就是他们基本上两边都赢了",然后他点了名——Groq、Cerebras、d-Matrix、SambaNova 这些押 SRAM 的,说自己要的是解码速度、低批量、不管吞吐;AMD 以及 TPU、Trainium 这些是奔着吞吐去的,然后承认"我们在高交互性那头拼不过对方"。每一家挑战者都只能选曲线的一端,而 OpenAI 这颗芯片两头都能干,而且干得很好。

第二条是中文博主 @MaxForAI 转的另一段 Nanos 的话,标题起得很吓人:「OpenAI 的工程师已经看不懂自己的代码了」。内容是说,在看 OpenAI 自研芯片的底层 kernel 代码时发现,里面已经有大量代码是 AI 直接生成的;其中一段用于 DeepSeek MLA 的 kernel,OpenAI 的工程师对硬件和整个系统都很熟,但让他们逐行解释,基本只能回答"不知道它具体在干嘛,但它能跑,而且性能很好"。内部还在用一套叫 Gluon 的、基于 Triton 的低级 kernel 编程语言。这条帖子的结论是:「这有点吓人……这意味着我们可能已经没有能力控制 AI 失控了。」

背景补一句:这两条的源头都是 2026 年 8 月的 Hot Chips 2026 大会。OpenAI 在会上第一次公开了它和博通(Broadcom)联合开发的自研推理芯片,代号 Jalapeño(西班牙语「墨西哥辣椒」),并同台请上了博通和 Celestica 的团队。会后 OpenAI 官网也放了首批基准成绩。

好,背景讲完。下面是傻狗读完全部一手资料之后的判断。

傻狗的判断:这两条不是两件事,是一件事

而且因果方向,跟大家转发的方式是反的。

不是"芯片牛所以敢让 AI 写代码",是"AI 能写 kernel 了,这颗芯片才有可能两边都赢"

真正被重新定价的东西,既不是英伟达的硅,也不是"人类失去控制",是那本二十年攒下来的手写 kernel 老账。

下面拆开讲。

一、「赢了英伟达」,先问是哪个英伟达

Jalapeño 的账面数据确实好看。700 瓦封装功耗,216 GiB HBM4 显存,15.4 TB/s 带宽,13.4 PFLOPS 的 MXFP4 算力。对面 GB200 是 1.2 千瓦,GB300 是 1.4 千瓦,AMD 的 MI355X 也是 1.4 千瓦。

在 InferenceX 基准上:跑 gpt-oss 120B 对 GB200,每千瓦 token 吞吐高 1.9 倍、端到端延迟低 1.7 倍;跑 DeepSeek R1 670B 对 GB300,1.7 倍吞吐、3.6 倍延迟;跑 Kimi K2.5 万亿参数模型,1.5 倍和 3.4 倍。

Jalapeño 与英伟达、AMD 的规格对比,以及那四个不能丢的定语
Jalapeño 与英伟达、AMD 的规格对比,以及那四个不能丢的定语

问题出在这里:GB200 和 GB300 是 HBM3e 世代,Jalapeño 是 HBM4。

这不是傻狗在挑刺——SemiAnalysis 自己在文章里写的就是这个对比"不完整、不公平",并且直接点名:真正的同代对手是同样用 HBM4 的 Vera Rubin。而一旦跟 Rubin 比,结论立刻变了味道:每美元产出的 token 数「基本打平」。

还有三件事把这个对比进一步稀释:

  • **所有测试都是 8k 输入 / 1k 输出**,这是整个推理基准里最好调优的形状。
  • SemiAnalysis 明确说他们更看重的多轮长上下文基准(AgentX)**压根没跑**。
  • 这是 **A0 步进的首硅,只做了三个月的 bring-up**。
  • 至于那个被到处引用的「104 倍吞吐」,看清楚它的定语——那是"在对方能达到的最快 TBT 那个点上"的吞吐比。任何芯片在对手工作区间的极限边缘都能刷出夸张倍数,这个数字的信息量是全场最小的

    但公平起见,有一点是反过来的:Jalapeño 的成绩是不带投机解码跑出来的,而 Rubin 在 2026 年 7 月的对照结果用了多 token 预测(一次前向吐多个 token,会显著抬高吞吐读数)。也就是说这一项上,是 OpenAI 让着对手在打。OpenAI 说上了多 token 预测(7 次草稿 + 1 次大模型,单周期最多 8 个 token)还能再拿 3 到 5 倍。

    所以傻狗不认为"Jalapeño 不行"。傻狗认为的是:它已经赢了,但赢的方式和媒体说的不是一回事。

    二、OpenAI 根本不需要赢,打平就够了

    所有把这件事读成"性能竞赛"的分析,都漏掉了 OpenAI 的约束条件。

    先问一句:一家已经把上万亿美元算力承诺签出去的公司,为什么要花十五个月自己造芯片?

    不是因为它觉得自己能设计出比英伟达更好的芯片。是因为它买的每一块钱推理算力里,有相当大一块是英伟达的毛利。英伟达常年 70% 以上的毛利率意味着:只要 Jalapeño 在性能上跟 Rubin 打平,OpenAI 的推理成本结构就发生了一次结构性下移。

    你不需要设计出更好的芯片,你只需要设计出一颗不用付溢价的芯片。

    所以 SemiAnalysis 那句「每美元 token 基本打平」,在媒体嘴里是"没那么厉害",在 OpenAI 的损益表上是目标已经达成

    第二个约束更硬:数据中心是电力受限,不是芯片受限。

    这是理解 OpenAI 为什么把核心指标定成"每焦耳 token"而不是"每美元 token"的关键。同一个变电站的供电额度是固定的,1.5 倍的 tokens/kW 不是省了 33% 的成本,是从同样一度电里多榨出 50% 的可售产能。在算力紧张、电力审批周期以年计的环境里,这个换算关系比价格重要得多。700 瓦对 1.4 千瓦这件事,本身就是产品定义,不是工程副产品。

    顺带说一句关于信源的结构:InferenceX / InferenceMAX 是 SemiAnalysis 自己做的基准,Jordan Nanos 是他们做基准这条线的人。OpenAI 选择在这个基准上公开成绩,等于把它抬成了行业标准。这不是说数据有假——数据是开源可复现的——但"挑战者用我们的尺子量赢了霸主"对出尺子的人是最好的结果,读结论的时候心里有这根弦就行。

    三、为什么以前的挑战者只能选一边

    Nanos 那段话里最有价值的其实不是"OpenAI 赢了",是他顺手描述的那个格局:没有一家挑战者能同时占住曲线的两端,只有英伟达可以。

    推理帕累托前沿:想再快一点,就得牺牲效率;两边都赢,意味着你的整条曲线在对方外面
    推理帕累托前沿:想再快一点,就得牺牲效率;两边都赢,意味着你的整条曲线在对方外面

    大家默认的解释是"物理上必须取舍"——SRAM 快但小,HBM 大但慢,你只能挑一头。

    这个解释是错的,或者说只对了一半。因为英伟达用的也是 HBM,它并没有绕开物理定律,它照样占住了两端。

    真正让别人只能选一边的,是两件跟硅无关的事。

    第一,你要卖给谁。

    Groq、Cerebras 卖的是通用商品芯片,客户会拿它跑各种他们没见过的模型。所以它们必须在流片那一刻就把内存层级押死,而且赌注不可撤回。

    OpenAI 只有一个客户——它自己;只需要跑几个它自己设计的模型架构;甚至可以反过来改模型去迁就芯片。这不是工程能力差异,是商业身位差异。

    第二,也是关键的那一条:占住整条曲线是一笔人力账单。

    曲线上每一个工作点——每个批大小、每个序列长度、每个算子形状、每个数据类型——都需要一个单独调过的 kernel。

    英伟达之所以能守住整条前沿,不是因为它的硅在物理上更优,是因为它有二十年攒下来的、覆盖了空间里每一个点的手写 kernel 库

    CUDA 的护城河从来不是硅,是那本账。

    没有哪家创业公司雇得起那么多 kernel 工程师,所以它们只能选一个点,把它调到极致,然后管这叫"战略聚焦"。

    接缝就在这里:一个成立十五个月的芯片项目之所以能占住整条曲线,是因为它把那笔以前只有英伟达付得起的 kernel 人力账单,用 Codex 付掉了。

    四、一个 8k/1k 的胜利,分不开两种解释

    这是傻狗认为整件事里最该被指出、也最少被指出的一点。

    "Jalapeño 在整个工作负载空间上帕累托占优""Jalapeño 只在它被共同设计、并且被手工调优过的那一个形状上占优"——这两种情况下,你观察到的东西长得一模一样:一条漂亮的、外扩的帕累托曲线。

    目前公开的证据,分不开这两者。

    而且巧的是,OpenAI 自己的真实生产负载,恰恰就是那个没测的部分。ChatGPT 的多轮对话、Codex 的 agentic 长上下文任务,特征是:上下文极长、前缀缓存命中率是性能的主导因素、输出长度高度不确定、路由和缓存管理的压力远大于纯算力。这些正是 SemiAnalysis 说 AgentX 该测但还没测的东西。

    一颗在 8k/1k 上赢了的芯片,和一颗能承载 OpenAI 生产流量的芯片,中间还隔着一整个未公开的验证区间。

    顺着这个思路,ServeTheHome 那位作者提的技术疑点也值得记一笔:按 15.4 TB/s 的裸带宽推算,理论 token 速率应该在每秒一千到一万之间,但实际系统落在远低于此的位置。他归因为长延迟路径、统一内存子系统争用、以及昂贵的全局内存栅栏。

    翻译成人话就是——这颗芯片目前跑出来的成绩,离它自己的硬件上限还有很大距离。这句话对多头空头都成立:往好里说是还有很多余量没释放;往坏里说是有些结构性瓶颈可能不是靠调优能解决的。哪一种,得等第二代和长上下文测试来分。

    五、看不懂代码这件事,怕的方向错了

    回到第二条推文那个结论:「我们可能已经没有能力控制 AI 失控了。」

    傻狗觉得这是把一件真事,推到了一个错误的方向上。拆两层看。

    「人类看不懂实际执行的代码」不是新闻,是 1957 年的旧闻

    自从有编译器,人类就不读实际被执行的那份代码了。

    今天没有任何人在逐行审读 ptxas 吐出来的 PTX;没有人在审 TVM 自动调优器选出来的调度;cuBLAS 和 cuDNN 里那些手写 SASS 汇编,十年来全世界能读懂的也就是英伟达内部那么几十号人,而且是闭源的——整个 AI 行业在这上面跑了十年,没人觉得这是失控。

    所以"工程师逐行解释不出来"这件事本身,真的不是新东西。

    新东西是:正确性的担保方式换了

    编译器的每一次变换在构造上是保语义的,这是编译器和你之间的契约。而一个 LLM 写出来的 kernel,唯一的保证是"测试跑过了"。

    这是两种完全不同的认识论。前者是"证明",后者是"抽样验证"。这个降级是真实的,也是唯一值得担心的那件事。

    但注意 OpenAI 对这件事的回应——而且这个回应恰恰被中文转述漏掉了:Gluon 里那套叫 Linear Layouts 的东西,做的就是"可证明正确的 layout 转换"。

    也就是说,他们专门把 AI 最容易犯的那一类错(数据布局、索引映射搞错)设计成了机器可验证的。这是把审查负担从"人眼阅读"搬进了类型系统和编译器。

    这是在加强控制,不是在放弃控制。

    再说一句:kernel 恰恰是全软件领域里最适合交给 AI 的地方。它的规格说明就是一份参考实现,正确性可以用几百万个随机输入做数值逐位比对,目标函数是一个墙钟时间的数字,而且部署时没有分布漂移——一个特定形状的 kernel 要么算对要么算错,不存在"上线后遇到没见过的世界"。

    它离超优化器和 SAT 求解更近,离"一个在真实世界里自主行动的 agent"很远。

    拿软件里最可验证的那个领域,去论证最不可验证的那个领域会失控,这是一次范畴错误。真要挑地方开始,kernel 正是你会挑的那个。

    那真正的风险是什么

  • **一、静默数值错误。**不是崩溃,是某个测试集没覆盖到的形状或数据类型组合上,算出了轻微错误的 logits。模型质量悄悄退化,没有任何报警。这是 QA 问题,形状很清楚,但很难。
  • **二、机构知识断层。**第二代芯片来了要移植 kernel,没有人有心智模型。OpenAI 的答案是"AI 来移植"——这不算错,但它把问题往后推了一代。
  • **三、最实在的一条:OpenAI 的芯片路线,现在结构性地依赖 Codex 保持领先。**这不是一个对齐问题,是一个商业依赖问题。如果编码模型的进步停滞,或者竞争对手拿到了同等能力的编码模型,Jalapeño 的这项优势就会被抹平。
  • 六、那本二十年的账,正在贬值

    把上面几段接起来,结论就出来了。

    Codex 在无人干预的情况下写出了一颗全新指令集架构上的 DeepSeek MLA kernel,并且优化后的注意力和 MoE kernel 比专家手写实现快 1.5 到 1.8 倍——如果这件事可复现,那么"二十年积累的手写 CUDA kernel 库"这项资产就在贬值。

    它不会归零,但它的重置成本从"一支几百人的团队干十年"变成了"一批算力跑几周"。

    护城河贬值之后,谁受益、谁受损
    护城河贬值之后,谁受益、谁受损

    谁受益、谁受损,排序其实很清楚:

  • **受益最大:垂直整合的模型公司。**谷歌 TPU、亚马逊 Trainium、OpenAI Jalapeño、Meta MTIA。它们本来就同时控制模型和芯片,唯一缺的就是那笔 kernel 人力账单。现在账单塌了。
  • **受益明确:AMD。**它多年来的说法一直是"我们硬件不差,差的是软件生态"。如果软件差距的填补成本大幅下降,它的相对位置改善很多。但它仍然是通用商品芯片,要伺候各种它没见过的模型,拿不到"改模型迁就芯片"的那部分红利。
  • **处境最尴尬:Groq / Cerebras / SambaNova。**这才是 Nanos 那段话真正的潜台词。它们的卖点是"我们选了曲线上更重要的那一端"。可如果英伟达能守住整条曲线靠的是 kernel 人力,而 kernel 人力现在便宜了,那么**"只能选一端"就从一个被迫的战略,变成了一个被焊死在硅片上的结构性劣势**。别人的曲线在长,它们的不能长。
  • **英伟达:护城河变窄,但没被填平。**同一套工具它也有,工程师更多,模型也不差。CUDA 在"工作负载多样性"上的优势依然真实——尤其是训练侧,几乎没受这件事影响。真正被侵蚀的是**推理侧的定价权**,而推理恰恰是营收增长最快、也是客户最有动力自研替代的那块。
  • 对咱们看马斯克这条线的朋友多说一句:特斯拉的 AI5/AI6 走的是完全同一套逻辑——自己的模型、自己的芯片、单一且已知的工作负载。以前这条路上最大的隐性成本就是软件栈和 kernel,现在这块成本在下降。这对 xAI/特斯拉这种"有模型、有芯片计划、但没有二十年 CUDA 遗产"的玩家是纯利好;反过来说,谁的资产是"软件生态积累",谁就要重新算账。

    还有一件事,可能比芯片本身更大:AI 不只写了 kernel,还参与了 RTL 设计和物理实现(用了 XLS 这套可扩展硬件描述语言),而且重大架构改动一直改到 RTL 冻结当天。结果是:2025 年 2 月启动 RTL,2025 年 11 月流片,2026 年 5 月拿到首硅并跑起了 Codex。

    定制芯片的迭代周期,从业界习惯的三年左右压缩到了一年半。如果第二代"几个月内流片"属实,那这就不是一次性的运气。一个能每 18 个月迭代一次专用硅的模型公司,和一个每 24 个月出一代通用 GPU 的供应商,长期是完全不同的两种竞争关系。

    七、转发之前,这三处先降一级

  • **逻辑不自洽:**「第二代几个月内流片,第三代已经在运行」——这两句放一起是矛盾的。第二代还没流片,第三代不可能"已经运行"。合理的读法是第三代的团队或项目已经启动。**别按"三代芯片都在跑"传播。**
  • **二手口语转述:**「OpenAI 工程师看不懂自己的代码」——这是从一段播客口语里摘出来的转述的转述。Nanos 的原话重心是"这不是 slop,因为它性能很好",**他是在夸,不是在示警**。中文版把它转成了恐怖故事。
  • **官方披露,但看清定语:**1.5 到 1.9 倍效率、1.7 到 3.6 倍延迟——这些是 OpenAI 官方数字,基准开源可复现。但定语是"对 GB200/GB300""8k/1k""A0 首硅""未开投机解码"。**四个定语一个都不能丢。**
  • 八、傻狗记账:接下来盯这六件事

    上面全是判断,判断得能被证伪才有意义。以下是傻狗给这套判断记的账,每一条都有明确时点和明确的"什么结果算我错了"。

  • **2026 年四季度|小批量部署是否真的发生。**官方口径是年底"极小批量",2027 才有规模。如果连极小批量都推迟,说明 A0 到量产之间的问题比现在披露的多。
  • **Rubin 铺开后|HBM4 对 HBM4 的重测。**这是最关键的一次验证。如果 OpenAI 迟迟不发对 Rubin 的完整 InferenceX 对比,"两边都赢"这句话就该继续打折。
  • **时点未定|AgentX / 多轮长上下文成绩。**直接决定第四节谁对。跑出来还赢,傻狗的质疑就作废;一直不跑,质疑就成立。
  • **数月内|第二代是否按期流片。**验证"18 个月迭代周期"是常态还是一次性运气。这一条比性能数字更能说明 AI 辅助设计的真实价值。
  • **季度财报|英伟达推理侧的毛利率与客户集中度。**护城河贬值如果是真的,最先出现在数字上的地方是这里,不是营收总额。
  • **持续|OpenAI 是否披露 Jalapeño 承担的生产 token 占比。**Nanos 说"至少它会服务真实生产 token"。占比才是唯一诚实的成绩单——1% 和 30% 是两个完全不同的故事。
  • 一句话收束

    Nanos 说"两边都赢",对 Blackwell 成立,对 Rubin 是打平——但打平已经足够,因为 OpenAI 要的是把英伟达的毛利拿回来,不是赢一场性能比赛。

    它能占住整条曲线,靠的不是硅比英伟达好,是它只有一个客户、可以反过来改模型迁就芯片,而且用 Codex 付掉了那笔以前只有英伟达付得起的 kernel 人力账单。

    所以"工程师看不懂 kernel"不是一个失控的故事,是一个成本坍塌的故事——真正在贬值的,是 CUDA 那本二十年的手写账本。

    至于"我们控制不住 AI 了"这个结论,它拿的是软件里最可验证的证据(对错可以逐位比对、性能可以计时、部署没有分布漂移),去论证最不可验证的那件事,中间那一步跳跃不成立。


    信源:SemiAnalysis《OpenAI Jalapeno: Better Than Nvidia Blackwell》("不公平对比"与"对 Rubin 打平"出自此文)· ServeTheHome Hot Chips 2026 现场技术细节 · OpenAI 官网《Jalapeno first results》· Tom's Hardware Jalapeño ASIC 拆解(RTL 到首硅时间线)· InferenceMAX 基准方法论 · Triton 官方 Gluon 文档 · 原始推文 @firesidealpha 与 @MaxForAI。

    本文是分析,不是投资建议。所有性能数字均为厂商披露或第三方基准结果,未经独立复现。记账部分的六个时点,就是用来打自己脸的。

    本文同步发布于 YouTube,观看完整视频请前往 YouTube @pizypizy
    #OpenAI#英伟达#半导体#AI芯片#Broadcom

    📬 邮件订阅

    留下邮箱,马斯克帝国每日资讯更新时通知你

    评论 (0)

    加载中...