跳到正文
@AYi_AInotes· @AYi_AInotes · X·· 15 天前AI 评分50
AI 导读

平头哥在云栖大会发布真武 V900 AI 芯片,216GB 显存、1200GB/s 片间互联,通过自研 ICN Switch 支持千卡统一编址,单集群架构上限可扩至 50 万卡,定档 2027 年 Q1 量产。

正文

平头哥今天在云栖发了真武 V900,
把国产 AI 芯片的参数拉到了一个之前没见过的位置,
216GB 显存,1200GB/s 片间互联,千卡统一编址当一颗超级芯片用,单集群扩到 50 万卡。

大家可能不知道,国产 AI 芯片市场去年华为昇腾占了将近一半,平头哥排第二大概 16%。

今天发的真武 V900 是平头哥第一次在规格层面把参数拉到这个级别:216GB 显存、1200GB/s 互联、千卡统一编址、50 万卡集群,

能不能真正改变格局要看量产和生态,但至少牌面够看了hh。

而且我觉得平头哥今天发的不只是一颗芯片,真武 V900 + ICN Switch 互联 + 磐脉网卡 + 镇岳存储主控 + 倚天 CPU,算力网力存力全是自研的。

国产 AI 基础设施第一次把数据中心里的核心芯片凑齐了。

先说 V900 本身,训推一体,算力是上一代 M890 的三倍,216GB 显存,片间互联带宽 1200GB/s,原生支持 FP8 和 FP4 低精度。

通过自研 ICN Switch 连起来之后具备原生内存语义和统一编址,上千颗 V900 在逻辑上当一颗超级芯片用。

单一集群架构可以扩到 50 万卡,2027 年 Q1 量产。

这里面最值得关注的不是 3 倍算力这个数字,是互联和编址。

做过大模型训练的都知道,单卡算力到了一定水平之后,瓶颈就不在单卡上了,而在几千张卡连在一起时候的通信效率。

带宽不够的集群,卡再多也有大量时间在等数据搬运。

V900 这套千卡全带宽互联加统一编址,解决的是这一层的问题。

然后是全栈,平头哥同时预告了倚天 720 和倚天 730 两代服务器 CPU,定档 2027 年。后面还有一代倚天 750,基于第二代自研核,可以通过 ICN 总线跟 AI 芯片直连。

加上已有的 ICN Switch、磐脉智能网卡和镇岳存储主控芯片,数据中心里从计算到互联到网络到存储,全线自研。

这意味着什么?之前国产 AI 算力的常见状态是自研芯片搭配第三方互联和通用网卡存储,各家的接口协议和优化路径不一样,系统级调优空间有限。

全栈自研之后,芯片之间的协同可以从硬件层面打通,不用在中间跑适配层。

对于做超大规模集群的场景,这个差距会被放大。

商业落地数据:截至今年 6 月,真武系列已经服务超过 650 家企业客户。

上一代 M890 超节点今年已经规模化上架阿里云数据中心,跑通了 2 万亿参数大模型的推理。

不过 650 家客户目前用的还是 M890 或更早的产品,V900 进入客户数据中心要等 2027 年 Q1 之后。

边界说清楚,官方说的"算力性能最强国产 AI 芯片"是自身口径,目前没有公布具体 TFLOPS 数值,只给了 3 倍 M890 的倍数,也没有第三方独立基准测试。

50 万卡集群是架构设计上限,不是已经建成的规模。量产节奏取决于良率和供应链。

另外还预告了下一代真武 J900,自研并行计算架构做了跨代革新,2028 年 3 月上市。

加上 V900 和两代倚天 CPU,平头哥把未来三年的芯片路线图一次摊开了。成立八年,从单点突破到全栈自研,这步走到了。

引用@AYi_AInotes@AYi_AInotes
看完今天上午云栖大会千问交出的整套底牌, 我感觉最锋利的地方全落在了账本上: 研发端让模型零干预自主迭代 33 轮扛住研发重活, 成本端直接把缓存命中输入打穿到了每百万 Tokens 一毛钱。 咱们把这两串数字掰开看, 在模型研发端,Qwen3.8-Max 在没有任何人工干预的情况下自主跑完 33 轮闭环演进,调用上万次工业工具把总线模块面积缩减了 42%,Artificial Analysis 质量指数推到了 45。 面对从未见过的阿里新款芯片,它自己进场完成算子调优与底层框架适配,竟然把单实例推理吞吐拉升了 96%,这说明算法团队日夜洗数据调参的阶段正在过去,大模型正在自己接管研发流水线。 而在落地成本端,提前开源架构的 Qwen3.8-Flash 通过注意力机制等底层重构,把训练成本直接砍掉近九成,配上每百万 Tokens 一毛钱的缓存单价,让大规模并发调用有了真实的利润空间。 Pinterest CEO 在公开场合提到,换用千问后综合调用成本压缩至同类商业模型的 8%。 更耐人寻味的是技术迭代的节奏,新架构 Qwen4 已经在训,后续版本规划直奔 5 到 10 万亿参数,配合全球突破 30 亿次的开源下载量,感觉千问交出来的已经不是几个孤立的模型版本了,有点把 AI 从手工作坊时代推进到了自运转的工业工厂时代的意味。 并且阿里的这种工程化能力已经开始向多模态交付延伸了,视频模型 Wan3.0 在主流评测中排名前列,下代模型定档 11 月,刚开源的 Qwen-Image-2.1 凭借 7B 的轻量尺寸,把原生透明图层与局部编辑做进了同一个模型,支持圈选修改、图层替换与多图保真参考,以往需要跨几个专业软件来回倒腾的设计链路,现在能在同一个模型内被压成秒级响应。 从算法团队教模型理解世界,到模型反向进入研发体系、全行业的计算成本被大幅摊薄。 开源生态把图纸与开采机完整交出来之后,竞争的重心彻底转向了谁能用更低成本把真实业务跑通。 这套成本架构落地之后,大家最想先重构手头的哪块业务?我自己是打算把后台知识库检索和长文本记忆全量切过去,粗算一年能省出好几台服务器的实打实开销。
在 X 查看被引用的帖子

来源:@AYi_AInotes · x.com