AMD收购AI推理芯片初创公司Taalas,将模型权重直接蚀刻进硅片
关键词: AMD Taalas AI推理芯片 ASIC 硬件定制
当地时间8月6日,AMD宣布已达成最终协议,收购总部位于加拿大多伦多的AI推理芯片初创公司Taalas。这是继今年初英伟达斥资200亿美元收购Groq资产后,AI推理芯片领域的又一笔重磅交易,标志着行业竞争焦点正从训练芯片加速转向推理芯片。

今年2月,Taalas为开发针对人工智能模型优化的芯片筹集了1.69亿美元,使其累计融资额达到约2.19亿美元。AMD未披露此次交易的具体金额。此次收购尚需满足惯例成交条件并获得监管部门批准。
Taalas绝技:把模型权重"刻"进硅片
Taalas成立于2023年,其核心技术路线与主流GPU、Groq LPU及Cerebras晶圆级加速器等数据流架构存在本质区别。该公司并非依赖传统的高带宽内存(HBM)存储模型权重,而是将权重直接蚀刻进硅片之中,形成模型专用集成电路。
芯片主要由两个功能区域构成:用于存储模型权重的掩膜ROM召回结构,以及用于存放KV缓存和微调适配器的SRAM召回结构。这一方案有望将推理性能提升一个数量级甚至更多,同时摆脱了对昂贵且稀缺的HBM的依赖。
Taalas联合创始人兼CEO Ljubisa Bajic表示:"我们创立Taalas的初衷是围绕模型构建硬件,从根本上重新思考人工智能推理。"
运行Llama 3.1速度超英伟达GPU 48倍
今年2月,Taalas发布了首款测试芯片HC1,采用台积电6纳米工艺制造。初步基准测试显示,该芯片运行Meta Llama 3.1 8B模型时,速度达每秒16,960个token——这一成绩在当时约为英伟达GPU的48倍、Cerebras加速器的8.5倍。

Taalas HC1 AI 推理卡
尽管Llama 3.1以当前标准已非最新模型,但该光罩尺寸芯片的主要目的在于验证技术概念的可行性。Taalas计划于今年夏季推出第二代HC2芯片,目标将单芯片支持的参数量提升至200亿。虽然这一数值本身并不算庞大,但通过类似GPU的流水线并行方式,权重可分布在多颗加速器上协同运行。以单芯片200亿参数计算,仅需50颗加速器即可支撑万亿参数级别的大模型。

Taalas 性能对比(AMD 收购前 Taalas 在 Llama 3.1 8b Large 平台上的表现)
AMD计划与Helios机架配对,构建分离式架构
据知情人士透露,AMD计划将Taalas技术芯片与Instinct系列的Helios机架配对使用,构建分离式架构:计算密集型的提示词处理由GPU负责,token生成任务则卸载至Taalas加速器。

另一种部署模式为,客户先在Instinct加速器上部署和验证模型,待效果确认后再迁移至Taalas加速器,形成类似"tick-tock"的迭代节奏。AMD人工智能事业部高级副总裁Vamsi Boppana表示:"AMD正在构建一个全栈式AI平台,让客户能够灵活地为每项AI工作负载部署合适的计算解决方案。Taalas的技术和世界一流的工程团队通过提供差异化的推理性能和效率,增强了我们的AI产品组合。"
从训练到推理,专用芯片成新战场
此次收购是AMD近年来密集布局AI生态的延续。2024年,AMD以6.65亿美元收购AI模型开发商Silo AI,随后以49亿美元收购服务器厂商ZT Systems,为Helios机柜产品线奠定基础。此外,公司还收购了推理软件开发商MK1、MEXT和FastFlowLM等多家AI初创企业。今年7月,AMD还与AI芯片企业Cerebras建立合作,将其AI加速器整合至AMD系统中。

随着生成式AI应用快速普及,行业重心正逐渐由模型训练转向模型推理,即AI模型在实际业务中响应用户请求的计算过程。不同于GPU等通用计算芯片,Taalas开发的是针对单一AI模型进行硬件定制的专用推理加速器(ASIC),芯片在设计时便针对特定模型进行"硬连线"优化,因此虽然灵活性较低,但可显著提升推理效率并降低成本。
AMD首席执行官苏姿丰此前表示,她始终认为AI芯片市场不存在"一种芯片适用于所有应用"的情况。GPU凭借高度通用性,仍将占据AI芯片市场的大部分份额,但不同应用场景也需要更加专业化的加速器共同构建完整的AI计算生态。