AMD推出整机柜AI系统 正面对抗英伟达

iEXExchanger
AMD推出整机柜AI系统 正面对抗英伟达

AMD发布Helios机架系统,内含72颗Instinct MI455X芯片。Anthropic已预订2吉瓦算力,微软正据此扩建Azure。

AMD把自家芯片整合进一整个服务器机架,命名为Helios——这是公司首次拿出完整方案挑战英伟达的AI训练系统,而不只是推出一颗更快的芯片。一个机架里装了72颗Instinct MI455X加速卡、18颗全新EPYC「Venice」处理器,以及把它们连成一体的液冷高速网络。

AMD想让人记住的数字是:单机架内存比英伟达的Vera Rubin系统多出约50%。对于参数量以万亿计的模型来说,这不只是参数好看——内存越大,模型被拆分到多颗芯片上的比例就越低,训练自然更快、成本也更低。

比芯片本身更关键的是买家名单。Anthropic已同意部署最多2吉瓦的MI450 GPU算力,意味着Claude未来的训练不会完全依赖英伟达硬件。微软正围绕Helios扩建Azure,OpenAI、Meta和甲骨文也确认了各自的部署计划。

首批交付将在今年内启动,下一代Venice-X处理器要到2027年才推出。这是AMD历史上规模最大的一次基础设施押注——CEO苏姿丰预计到2030年AI加速器市场规模将达1.4万亿美元,并希望从目前占据约九成份额的英伟达手中抢下实实在在的一块。

问题在于,芯片从来不是AMD真正的短板。英伟达的CUDA生态花了十年才建成,而开发者转向AMD的ROCm软件栈一直进展缓慢。Anthropic和微软能否真把Helios用到工业级规模,才是检验这道差距是否补上的真正考验。

问答

本文相关常见问题

AMD Helios是什么?

这是AMD首款完整的AI服务器机架:72颗Instinct MI455X加速卡、18颗EPYC Venice处理器,配合液冷系统,整合为用于训练大模型的统一计算平台。

Helios与英伟达Vera Rubin系统相比有何不同?

据AMD介绍,Helios机架的内存比Vera Rubin多出约50%,可让大模型在更少拆分的情况下运行,从而加快训练速度。

目前有哪些公司已订购基于Helios的系统?

Anthropic已同意部署最多2吉瓦的MI450 GPU算力,微软正基于Helios构建部分Azure基础设施,OpenAI、Meta和甲骨文也确认了各自的部署计划。

Helios何时开始交付?

首批交付将于2026年内启动,而该平台下一代Venice-X处理器计划于2027年推出。

AMD真的能撼动英伟达的主导地位吗?

AMD的硬件具备竞争力,但真正的障碍在于英伟达花费十年打造的CUDA软件生态。Helios能否成功,取决于Anthropic、微软等客户能否把真实工作负载迁移到AMD的ROCm软件栈上。