资讯

Hy4上线就排队,国产AI真正缺的可能不只是GPU

华尔街见闻·2026/9/2 08:44:07🔗 原文

📌 概要

腾讯混元Hy4上线后WorkBuddy任务排队、集群紧急扩容,暴露国产AI瓶颈已从缺GPU转向有效算力不足。MoE、百万Token上下文与Agent多轮任务使卡间通信、内存与调度成为效率关键,超节点进入商业化早期,Scale-up交换、整柜交付与系统Goodput成新竞争焦点。

⚡ 关键要点

  • 腾讯Hy4(7700亿参数MoE、百万Token上下文)上线首日即现任务排队并紧急扩容
  • 算力荒正从缺卡演变为有效算力不足,通信、内存与调度决定推理效率
  • 超节点进入商业化早期,Scale-up交换、整柜交付和系统Goodput成竞争焦点

Hy4上线后的任务排队与紧急扩容,折射出国产AI需求正在从“缺卡”走向“有效算力不足”。超节点也已由架构验证进入商业化早期,Scale-up交换、整柜交付和系统Goodput正成为新的竞争焦点。

一、发生了什么?算力荒正在从“缺卡”演变为“有效算力不足”

1. Hy4上线后排队,推理需求开始给基础设施上强度:

8月28日,腾讯混元发布并开源Hy4 preview。官方披露,这款模型总参数达到7700亿,单次推理激活490亿参数,上下文长度突破100万Token,并同步接入WorkBuddy、CodeBuddy、元宝、ima等产品。上线首日,WorkBuddy任务队列即出现排队,随后推理集群紧急扩容;受高端算力总量与高峰并发约束,部分时段仍可能继续排队。

这一幕表面上是熟悉的“算力不够”,背后的负载已经发生变化。Hy4采用MoE架构,又同时面向长上下文和Agent等生产力场景。MoE会在不同专家之间频繁传递数据,百万Token上下文持续增加KV Cache和内存访问压力;进入Agent场景后,一次用户指令还可能被拆成规划、推理、工具调用、校验等多轮任务。计算量上升的同时,卡间通信、内存访问和任务调度开始更明显地决定推理效率。

2. 有多少GPU,已经不足以描述一家公司的算力:

传统思路下,算力不足最直接的办法是继续增加GPU。但在大型集群里,峰值FLOPS与应用最终得到的有效算力之间存在折损。

近期产业研究越来越重视“算力生产力”的概念,可粗略理解为标称算力乘以实际发挥效率,再乘以设备在时间维度上的利用率。一组行业测算中,效能系数约0.6、满载系数约0.5,两者叠加后有效产出约为标称算力的30%。该数字来自特定测算,不能机械外推到所有数据中心,却揭示了一个重要事实:采购的峰值算力与业务端持续可用的算力并不等同。

……