亚马逊网络服务和NVIDIA将部署200万个额外的图形处理单元用于人工智能工作负载,并将合作扩展到中央处理器、网络和机器人领域。
此举进一步扩大了与AI计算需求激增相关基础设施的规模,云服务提供商和芯片制造商竞相增加模型训练和部署的处理能力。
此次部署将进一步丰富 NVIDIA 硬件的庞大安装基础,这些硬件已在 AWS 云平台上广泛使用。NVIDIA已成为AI芯片的主导供应商,而AWS则试图用自有芯片(包括Trainium和Inferentia)来平衡NVIDIA系统的需求。
更宽的建造范围
更广泛的合作表明,这种关系现在已超越图形处理器。通过将CPU、网络和机器人与GPU并列,这些公司表明他们正在跨越数据中心扩展和人工智能系统设计核心的更广泛技术。
云基础设施团队一直在大力投入,以确保足够的处理器、网络设备和电力,以跟上企业和消费者对生成式AI服务的使用步伐。NVIDIA 的芯片依然是这一构建的核心,因为它们被广泛用于训练大型语言模型并在部署后执行推理任务。
对于AWS来说,额外的GPU可以帮助客户通过云端访问NVIDIA系统,而非自行构建数据中心。这一安排也反映了大型云运营商如何通过结合商用芯片供应与内部开发的处理器和紧密集成的网络设备来保持灵活性。
机器人技术是较新的重叠领域。英伟达推动机器人系统和工业自动化的软硬件平台,而亚马逊则长期投资于仓库自动化和机器学习系统,纳入其物流网络。在该领域更深层次的合作表明,合作可能超越云计算,延伸到实体人工智能应用。
竞争压力
此公告发布之际,超大规模云服务提供商为获得AI服务所需设备而竞争日益激烈。Microsoft、Google及其他大型运营商一直在扩大基础设施布局,签署供应协议并推出自有芯片设计,以降低成本并管理对外部供应商的依赖。
这一背景提升了英伟达在最大技术集团中的战略重要性。即使客户在寻求替代方案,其GPU和网络产品仍深度嵌入AI系统架构,使得服务初创企业、开发者和大型企业客户的云运营商优先考虑供应。
CPU纳入扩展联盟也值得注意,因为它表明人工智能系统组装方式趋于更紧密。虽然GPU承担了许多AI任务的大部分重任,但CPU依然是编排工作负载、管理内存以及在数据中心内运行更广泛应用环境的关键。
随着AI集群的规模扩大,网络建设同样变得重要。快速在处理器间传输数据对于高效训练高级模型至关重要,NVIDIA通过高速互联和数据中心网络产品在这一领域进行了扩展。因此,与AWS在网络领域的紧密合作将影响未来AI集群在云提供商基础设施中的配置方式。
行业背景
新增200万块GPU的规模凸显了人工智能已成为全球最大科技公司中资本密集型竞争的趋势。在如此规模的构建和操作系统上,不仅需要大量资金投入芯片,还需要服务器、网络、软件集成、散热和电力。
投资者和客户一直在关注,人工智能基础设施的投入是否能转化为云服务提供商和半导体集团的可持续收入增长。AWS一直面临压力,要求证明AI服务的需求能够支撑快速扩张的成本,而NVIDIA则面临当前需求水平能持续多久的质疑。
即便如此,最新的部署显示,两家公司仍在为AI在商业软件、消费应用和工业系统中的进一步增长做准备。新增200万块GPU,以及CPU、网络和机器人领域的更广泛工作,表明双方的合作关系正更加深入地融入当前AI市场的基础设施中。
英伟达是AI芯片的主导供应商,而AWS则是全球最大的云运营商之一,致力于满足客户对先进计算系统日益增长的需求。