8 月 25 到 26 日,X 上有两条帖子被分开转发,各自都刷了不少量。傻狗先把这两条是什么讲清楚,再说自己的看法。
第一条来自 @firesidealpha(Fireside Alpha),转述的是 SemiAnalysis 的分析师 Jordan Nanos 在一档播客里的话。核心是一句:OpenAI 自研的这颗芯片,在"快 token"和"便宜 token"两条曲线上同时赢过英伟达。Nanos 的原话是"结论就是他们基本上两边都赢了",然后他点了名——Groq、Cerebras、d-Matrix、SambaNova 这些押 SRAM 的,说自己要的是解码速度、低批量、不管吞吐;AMD 以及 TPU、Trainium 这些是奔着吞吐去的,然后承认"我们在高交互性那头拼不过对方"。每一家挑战者都只能选曲线的一端,而 OpenAI 这颗芯片两头都能干,而且干得很好。
第二条是中文博主 @MaxForAI 转的另一段 Nanos 的话,标题起得很吓人:「OpenAI 的工程师已经看不懂自己的代码了」。内容是说,在看 OpenAI 自研芯片的底层 kernel 代码时发现,里面已经有大量代码是 AI 直接生成的;其中一段用于 DeepSeek MLA 的 kernel,OpenAI 的工程师对硬件和整个系统都很熟,但让他们逐行解释,基本只能回答"不知道它具体在干嘛,但它能跑,而且性能很好"。内部还在用一套叫 Gluon 的、基于 Triton 的低级 kernel 编程语言。这条帖子的结论是:「这有点吓人……这意味着我们可能已经没有能力控制 AI 失控了。」
背景补一句:这两条的源头都是 2026 年 8 月的 Hot Chips 2026 大会。OpenAI 在会上第一次公开了它和博通(Broadcom)联合开发的自研推理芯片,代号 Jalapeño(西班牙语「墨西哥辣椒」),并同台请上了博通和 Celestica 的团队。会后 OpenAI 官网也放了首批基准成绩。
好,背景讲完。下面是傻狗读完全部一手资料之后的判断。
傻狗的判断:这两条不是两件事,是一件事
而且因果方向,跟大家转发的方式是反的。
不是"芯片牛所以敢让 AI 写代码",是"AI 能写 kernel 了,这颗芯片才有可能两边都赢"。
真正被重新定价的东西,既不是英伟达的硅,也不是"人类失去控制",是那本二十年攒下来的手写 kernel 老账。
下面拆开讲。
一、「赢了英伟达」,先问是哪个英伟达
Jalapeño 的账面数据确实好看。700 瓦封装功耗,216 GiB HBM4 显存,15.4 TB/s 带宽,13.4 PFLOPS 的 MXFP4 算力。对面 GB200 是 1.2 千瓦,GB300 是 1.4 千瓦,AMD 的 MI355X 也是 1.4 千瓦。
在 InferenceX 基准上:跑 gpt-oss 120B 对 GB200,每千瓦 token 吞吐高 1.9 倍、端到端延迟低 1.7 倍;跑 DeepSeek R1 670B 对 GB300,1.7 倍吞吐、3.6 倍延迟;跑 Kimi K2.5 万亿参数模型,1.5 倍和 3.4 倍。

问题出在这里:GB200 和 GB300 是 HBM3e 世代,Jalapeño 是 HBM4。
这不是傻狗在挑刺——SemiAnalysis 自己在文章里写的就是这个对比"不完整、不公平",并且直接点名:真正的同代对手是同样用 HBM4 的 Vera Rubin。而一旦跟 Rubin 比,结论立刻变了味道:每美元产出的 token 数「基本打平」。
还有三件事把这个对比进一步稀释:
至于那个被到处引用的「104 倍吞吐」,看清楚它的定语——那是"在对方能达到的最快 TBT 那个点上"的吞吐比。任何芯片在对手工作区间的极限边缘都能刷出夸张倍数,这个数字的信息量是全场最小的。
但公平起见,有一点是反过来的:Jalapeño 的成绩是不带投机解码跑出来的,而 Rubin 在 2026 年 7 月的对照结果用了多 token 预测(一次前向吐多个 token,会显著抬高吞吐读数)。也就是说这一项上,是 OpenAI 让着对手在打。OpenAI 说上了多 token 预测(7 次草稿 + 1 次大模型,单周期最多 8 个 token)还能再拿 3 到 5 倍。
所以傻狗不认为"Jalapeño 不行"。傻狗认为的是:它已经赢了,但赢的方式和媒体说的不是一回事。
二、OpenAI 根本不需要赢,打平就够了
所有把这件事读成"性能竞赛"的分析,都漏掉了 OpenAI 的约束条件。
先问一句:一家已经把上万亿美元算力承诺签出去的公司,为什么要花十五个月自己造芯片?
不是因为它觉得自己能设计出比英伟达更好的芯片。是因为它买的每一块钱推理算力里,有相当大一块是英伟达的毛利。英伟达常年 70% 以上的毛利率意味着:只要 Jalapeño 在性能上跟 Rubin 打平,OpenAI 的推理成本结构就发生了一次结构性下移。
你不需要设计出更好的芯片,你只需要设计出一颗不用付溢价的芯片。
所以 SemiAnalysis 那句「每美元 token 基本打平」,在媒体嘴里是"没那么厉害",在 OpenAI 的损益表上是目标已经达成。
第二个约束更硬:数据中心是电力受限,不是芯片受限。
这是理解 OpenAI 为什么把核心指标定成"每焦耳 token"而不是"每美元 token"的关键。同一个变电站的供电额度是固定的,1.5 倍的 tokens/kW 不是省了 33% 的成本,是从同样一度电里多榨出 50% 的可售产能。在算力紧张、电力审批周期以年计的环境里,这个换算关系比价格重要得多。700 瓦对 1.4 千瓦这件事,本身就是产品定义,不是工程副产品。
顺带说一句关于信源的结构:InferenceX / InferenceMAX 是 SemiAnalysis 自己做的基准,Jordan Nanos 是他们做基准这条线的人。OpenAI 选择在这个基准上公开成绩,等于把它抬成了行业标准。这不是说数据有假——数据是开源可复现的——但"挑战者用我们的尺子量赢了霸主"对出尺子的人是最好的结果,读结论的时候心里有这根弦就行。
三、为什么以前的挑战者只能选一边
Nanos 那段话里最有价值的其实不是"OpenAI 赢了",是他顺手描述的那个格局:没有一家挑战者能同时占住曲线的两端,只有英伟达可以。

大家默认的解释是"物理上必须取舍"——SRAM 快但小,HBM 大但慢,你只能挑一头。
这个解释是错的,或者说只对了一半。因为英伟达用的也是 HBM,它并没有绕开物理定律,它照样占住了两端。
真正让别人只能选一边的,是两件跟硅无关的事。
第一,你要卖给谁。
Groq、Cerebras 卖的是通用商品芯片,客户会拿它跑各种他们没见过的模型。所以它们必须在流片那一刻就把内存层级押死,而且赌注不可撤回。
OpenAI 只有一个客户——它自己;只需要跑几个它自己设计的模型架构;甚至可以反过来改模型去迁就芯片。这不是工程能力差异,是商业身位差异。
第二,也是关键的那一条:占住整条曲线是一笔人力账单。
曲线上每一个工作点——每个批大小、每个序列长度、每个算子形状、每个数据类型——都需要一个单独调过的 kernel。
英伟达之所以能守住整条前沿,不是因为它的硅在物理上更优,是因为它有二十年攒下来的、覆盖了空间里每一个点的手写 kernel 库。
CUDA 的护城河从来不是硅,是那本账。
没有哪家创业公司雇得起那么多 kernel 工程师,所以它们只能选一个点,把它调到极致,然后管这叫"战略聚焦"。
接缝就在这里:一个成立十五个月的芯片项目之所以能占住整条曲线,是因为它把那笔以前只有英伟达付得起的 kernel 人力账单,用 Codex 付掉了。
四、一个 8k/1k 的胜利,分不开两种解释
这是傻狗认为整件事里最该被指出、也最少被指出的一点。
"Jalapeño 在整个工作负载空间上帕累托占优" 和 "Jalapeño 只在它被共同设计、并且被手工调优过的那一个形状上占优"——这两种情况下,你观察到的东西长得一模一样:一条漂亮的、外扩的帕累托曲线。
目前公开的证据,分不开这两者。
而且巧的是,OpenAI 自己的真实生产负载,恰恰就是那个没测的部分。ChatGPT 的多轮对话、Codex 的 agentic 长上下文任务,特征是:上下文极长、前缀缓存命中率是性能的主导因素、输出长度高度不确定、路由和缓存管理的压力远大于纯算力。这些正是 SemiAnalysis 说 AgentX 该测但还没测的东西。
一颗在 8k/1k 上赢了的芯片,和一颗能承载 OpenAI 生产流量的芯片,中间还隔着一整个未公开的验证区间。
顺着这个思路,ServeTheHome 那位作者提的技术疑点也值得记一笔:按 15.4 TB/s 的裸带宽推算,理论 token 速率应该在每秒一千到一万之间,但实际系统落在远低于此的位置。他归因为长延迟路径、统一内存子系统争用、以及昂贵的全局内存栅栏。
翻译成人话就是——这颗芯片目前跑出来的成绩,离它自己的硬件上限还有很大距离。这句话对多头空头都成立:往好里说是还有很多余量没释放;往坏里说是有些结构性瓶颈可能不是靠调优能解决的。哪一种,得等第二代和长上下文测试来分。
五、看不懂代码这件事,怕的方向错了
回到第二条推文那个结论:「我们可能已经没有能力控制 AI 失控了。」
傻狗觉得这是把一件真事,推到了一个错误的方向上。拆两层看。
「人类看不懂实际执行的代码」不是新闻,是 1957 年的旧闻
自从有编译器,人类就不读实际被执行的那份代码了。
今天没有任何人在逐行审读 ptxas 吐出来的 PTX;没有人在审 TVM 自动调优器选出来的调度;cuBLAS 和 cuDNN 里那些手写 SASS 汇编,十年来全世界能读懂的也就是英伟达内部那么几十号人,而且是闭源的——整个 AI 行业在这上面跑了十年,没人觉得这是失控。
所以"工程师逐行解释不出来"这件事本身,真的不是新东西。
新东西是:正确性的担保方式换了
编译器的每一次变换在构造上是保语义的,这是编译器和你之间的契约。而一个 LLM 写出来的 kernel,唯一的保证是"测试跑过了"。
这是两种完全不同的认识论。前者是"证明",后者是"抽样验证"。这个降级是真实的,也是唯一值得担心的那件事。
但注意 OpenAI 对这件事的回应——而且这个回应恰恰被中文转述漏掉了:Gluon 里那套叫 Linear Layouts 的东西,做的就是"可证明正确的 layout 转换"。
也就是说,他们专门把 AI 最容易犯的那一类错(数据布局、索引映射搞错)设计成了机器可验证的。这是把审查负担从"人眼阅读"搬进了类型系统和编译器。
这是在加强控制,不是在放弃控制。
再说一句:kernel 恰恰是全软件领域里最适合交给 AI 的地方。它的规格说明就是一份参考实现,正确性可以用几百万个随机输入做数值逐位比对,目标函数是一个墙钟时间的数字,而且部署时没有分布漂移——一个特定形状的 kernel 要么算对要么算错,不存在"上线后遇到没见过的世界"。
它离超优化器和 SAT 求解更近,离"一个在真实世界里自主行动的 agent"很远。
拿软件里最可验证的那个领域,去论证最不可验证的那个领域会失控,这是一次范畴错误。真要挑地方开始,kernel 正是你会挑的那个。
那真正的风险是什么
六、那本二十年的账,正在贬值
把上面几段接起来,结论就出来了。
Codex 在无人干预的情况下写出了一颗全新指令集架构上的 DeepSeek MLA kernel,并且优化后的注意力和 MoE kernel 比专家手写实现快 1.5 到 1.8 倍——如果这件事可复现,那么"二十年积累的手写 CUDA kernel 库"这项资产就在贬值。
它不会归零,但它的重置成本从"一支几百人的团队干十年"变成了"一批算力跑几周"。

谁受益、谁受损,排序其实很清楚:
对咱们看马斯克这条线的朋友多说一句:特斯拉的 AI5/AI6 走的是完全同一套逻辑——自己的模型、自己的芯片、单一且已知的工作负载。以前这条路上最大的隐性成本就是软件栈和 kernel,现在这块成本在下降。这对 xAI/特斯拉这种"有模型、有芯片计划、但没有二十年 CUDA 遗产"的玩家是纯利好;反过来说,谁的资产是"软件生态积累",谁就要重新算账。
还有一件事,可能比芯片本身更大:AI 不只写了 kernel,还参与了 RTL 设计和物理实现(用了 XLS 这套可扩展硬件描述语言),而且重大架构改动一直改到 RTL 冻结当天。结果是:2025 年 2 月启动 RTL,2025 年 11 月流片,2026 年 5 月拿到首硅并跑起了 Codex。
定制芯片的迭代周期,从业界习惯的三年左右压缩到了一年半。如果第二代"几个月内流片"属实,那这就不是一次性的运气。一个能每 18 个月迭代一次专用硅的模型公司,和一个每 24 个月出一代通用 GPU 的供应商,长期是完全不同的两种竞争关系。
七、转发之前,这三处先降一级
八、傻狗记账:接下来盯这六件事
上面全是判断,判断得能被证伪才有意义。以下是傻狗给这套判断记的账,每一条都有明确时点和明确的"什么结果算我错了"。
一句话收束
Nanos 说"两边都赢",对 Blackwell 成立,对 Rubin 是打平——但打平已经足够,因为 OpenAI 要的是把英伟达的毛利拿回来,不是赢一场性能比赛。
它能占住整条曲线,靠的不是硅比英伟达好,是它只有一个客户、可以反过来改模型迁就芯片,而且用 Codex 付掉了那笔以前只有英伟达付得起的 kernel 人力账单。
所以"工程师看不懂 kernel"不是一个失控的故事,是一个成本坍塌的故事——真正在贬值的,是 CUDA 那本二十年的手写账本。
至于"我们控制不住 AI 了"这个结论,它拿的是软件里最可验证的证据(对错可以逐位比对、性能可以计时、部署没有分布漂移),去论证最不可验证的那件事,中间那一步跳跃不成立。
信源:SemiAnalysis《OpenAI Jalapeno: Better Than Nvidia Blackwell》("不公平对比"与"对 Rubin 打平"出自此文)· ServeTheHome Hot Chips 2026 现场技术细节 · OpenAI 官网《Jalapeno first results》· Tom's Hardware Jalapeño ASIC 拆解(RTL 到首硅时间线)· InferenceMAX 基准方法论 · Triton 官方 Gluon 文档 · 原始推文 @firesidealpha 与 @MaxForAI。
本文是分析,不是投资建议。所有性能数字均为厂商披露或第三方基准结果,未经独立复现。记账部分的六个时点,就是用来打自己脸的。
