CPU恐成云端业下一个瓶颈!亚马逊AWS出现“CPU短缺”
科技业已经从聚焦于GPU一片难求的窘境,转向CPU这项基础计算资源。
根据《The Information》报道,亚马逊云端服务(AWS)内部今年5月已对工程团队发出示警,要求全力节省计算资源,以确保未来能持续满足客户需求。
值得注意的是,这波节流令不仅锁定AI芯片,更直指长年支撑网络服务运作的传统CPU服务器。
知情人士透露,AWS已对各部门下达期限,要求在今年稍晚前削减计算资源的占用比例。为了腾出算力转供外部客户使用,工程师们正陆续关闭先前用于软体开发、如今处于闲置状态的EC2虚拟服务器。
一名任职AWS多年的工程师表示,过去申请CPU服务器资源通常数小时内就能到位,如今却得苦候数天之久,这样的延迟在他的职涯中前所未见,甚至可能拖累专案交付时程。
对此,AWS官方回应强调,尽管当前面临“庞大需求”,公司仍有能力满足“绝大多数”内外部客户的计算需求,并表示正与内部团队密切合作,确保EC2资源维持一贯的高效运用,员工使用资源的相关指引也未因目前的紧张情势而调整。
值得留意的是,外部客户目前受到的衝击仍属有限。一名协助企业导入AWS服务的顾问指出,尚未观察到客户在合约承诺的算力上出现实际短缺。
不过,AWS以折扣价提供、但可随时在两分钟内被收回的“竞价执行个体”(Spot Instances),近几个月来已越来越难大量取得,被视为AWS整体供需缺口正在收窄、弹性空间持续压缩的明确讯号,也可能预示云端计算成本即将走高。
分析指出,这波CPU吃紧的根本原因,在于“AI代理”应用的快速扩散。AI顾问公司Elendil Labs共同创始人暨董事总经理Jing Xie观察到,客户的人均IT支出已然翻倍,主因正是企业内大量导入AI代理程序协助软件开发。
他指出,AI代理程序在运作过程中往往需要调用比以往更多的云端资源,进而对CPU形成持续性的庞大需求。
他表示:“不论是现在的开发、生产或运营,几乎所有工作所需的CPU都比过去更多。”
事实上,CPU的角色不仅限于AI应用的执行端,在AI开发流程中同样不可或缺。例如AI公司为训练模型准备资料时,仍须仰赖CPU从文件、影像与影片中读取并处理原始数据。
芯片大厂的最新表态也印证了这股趋势。英特尔CEO陈立武(Lip-Bu Tan)今年4月的财报电话会议上曾透露,在AI推理(即模型实际运作)情境中,CPU与GPU的使用比例约为1比4。
然而,到了7月,该公司财务长David Zinsner便指出这项比例已迅速拉近至接近1比1。
AMD与Arm的高层主管近期也做出类似表态,显示CPU需求增长的速度已超出业界原先预期。
除了CPU本身供不应求,与之搭配使用的存储芯片供应紧张,以及数据中心实体空间的限制,也共同加剧了这场算力荒。
大型科技公司的算力分配难题
如何在内部研发与外部客户之间分配有限算力,已成为近两年科技巨头共同面临的棘手课题。
根据《The Information》先前报道,Google去年已成立一个由高级主管组成的专责委员会,负责协调Google Cloud、DeepMind研究部门与消费端业务之间的计算资源分配。
即便如此,内部摩擦仍未消弭。Google知名AI研究员Noam Shazeer今年稍早便因不满算力取得受限而选择离职。
相较之下,微软则展现出算力管理效率提升所带来的正面效益。该公司财务长Amy Hood上月在财报电话会议上表示,Azure云端服务部分营收增长,正是得益于CPU与GPU丛集管理效率的提升。