|

股票

真武V900性能翻三倍,阿里50万卡集群剑指20GW算力

来源:鳌头财经

2026-09-23 12:36:58

(原标题:真武V900性能翻三倍,阿里50万卡集群剑指20GW算力)

真武V900性能三倍提升,阿里以50万卡集群和Qwen4野心完成全栈自研闭环。

9月22日,2026云栖大会在杭州开幕。阿里巴巴集团CEO吴泳铭把话说得很直白,如果说Token是AI时代的电,芯片就是发电机。同一天,平头哥发布新一代训推一体AI芯片真武V900,Qwen4官宣投入训练,参数路线直指5万亿到10万亿。

真武V900最核心的卖点,是目前中国算力性能最强的AI芯片。单芯片综合性能是上一代真武M890的3倍,显存从144GB增加到216GB,片间互联带宽从800GB/s提升到1200GB/s。量产时间定在2027年第一季度。

比单颗芯片更值得看的是组网能力。新一代磐久超节点服务器把V900、ICN Switch互联芯片、磐脉智能网卡和镇岳SSD主控芯片集成在一起,上千颗V900通过ICN Switch实现千卡全带宽互联,单一集群可扩展至50万卡规模。

从单卡到50万卡的系统级跃迁

真武V900的升级不只是单颗芯片的性能提升,而是显存、互联、精度三个维度的同步换代。

显存从M890的144GB增加到216GB。万亿参数MoE模型时代,单卡能装下的模型和KV Cache规模,直接决定了推理的上下文天花板。片间互联带宽从800GB/s提升到1200GB/s。专家分布在不同芯片上,每个Token都要被动态路由到对应专家再汇集,通信压力是MoE架构的命门。

精度上,真武V900原生支持FP8、FP4低精度计算,并重构了Tensor Core运算单元。平头哥副总裁高慧给过一笔账,精度每降一档,一度电换来的Token数量基本翻一倍。

这套打法已经过实战验证。基于M890的超节点已大规模跑通Qwen3.8、Kimi K3等超过2万亿参数的模型。截至今年6月,真武系列已服务超过650家企业客户,覆盖智驾、金融、具身智能等行业。

CPU侧也第一次给了路线图。平头哥2027年推出倚天720和倚天730,后者首次采用全自研CPU微架构,单核SPECint 2017/GHz性能最高达倚天710的1.4倍。2029年的倚天750将支持自研ICN片间互联协议,让CPU与AI芯片直接互联。

芯片竞争已经从单卡跑分转向系统级工程能力。能不能把几十万颗芯片调成一台机器,比单颗性能更能决定交付能力。

Qwen4开训与RSI自我进化

模型侧的重磅消息是,基于下一代全新架构的Qwen4已正式投入训练,后续的Qwen4.5、Qwen5计划将参数规模扩展至5万亿到10万亿。作为参照,当前旗舰Qwen3.8-Max是2.4万亿参数。

比参数数字更有意思的,是RSI递归自我改进的落地进展。Qwen3.8-Max在人类完全零参与的情况下,自主搭建训练流程、构造数据、设计实验并定位缺陷,持续迭代超过1个月,完成33轮有效迭代。新版在Artificial Analysis榜单从40分涨到45分,与Claude、GPT最强模型同处第一阵营。

推理优化方面,Qwen3.8在从未见过的平头哥新款GPU上,自主适配优化了下一代Qwen3.8-Flash的SGLang推理框架,单实例量提升96%。芯片协同设计方面,仅凭一份真实的总线模块规范,Qwen3.8自主运行超60小时、调用EDA工具上万次,完成了减少42%面积的物理实现优化,功耗降低59.5%。

架构层面,Qwen3.8-Flash已提前开源下一代千问架构,训练成本骤降近90%。这也是5万亿到10万亿参数野心能成立的前提,不把单位算力成本打下来,堆参数就是烧钱竞赛。

据企业财报数据显示,2026年二季度阿里AI云及算力服务收入约484亿元,同比增长45%。资本开支约677亿元,同比增长75%。全栈自研的另一面,是真金白银的投入强度。

更远的靶子是2032年,阿里云运营的全球数据中心规模超过20GW。基于全模块化设计架构CUBE 5.0,大型AIDC的交付工期从国内传统的6到12个月压缩到100天,建设成本降低10%以上,单位面积算力密度达到上一代的5到10倍。

把三个信息拼在一起看,芯片把算力、内存、互联三个变量同时推高,超节点把几千颗芯片变成一台机器,Qwen4则要把参数推到5万亿到10万亿。阿里在讲一个模型、芯片、云三位一体的故事。这套自研闭环的最大背景,是先进GPU对华出口受限,自研不是选择,是唯一出路。

证券之星财经

2026-09-23

首页 股票 财经 基金 导航