港大研制出原子级模拟存内搜索芯片,处理速度比CPU快1亿倍
关键词: 存算一体 模拟CAM 二硫化钼 冯·诺依曼瓶颈 港大芯片
在人工智能与大数据时代,传统计算机硬件存在一个根本性瓶颈——处理器和内存之间需要频繁来回搬运数据,既耗时又耗电,业界称之为"冯·诺依曼瓶颈"。近日,香港大学研发的一款芯片,从根本上绕开了这一限制。

8月4日,香港大学工程学院李灿教授领导的研究团队公布了一项突破性成果:成功研制出一款原子级厚度的"模拟存内搜索"芯片,在处理特定计算任务时,速度比标准CPU快约1亿倍。该成果已发表在国际顶级学术期刊《自然·纳米技术》(Nature Nanotechnology)上。

香港大学工程学院李灿教授领导的研究团队。(图自港大)
极简架构,但实测数据震撼
这款芯片采用"存算一体"架构,可直接在数据存储位置完成复杂搜索,无需将数据搬运到处理器再进行运算。团队利用比头发丝还细数万倍的二维二硫化钼(MoS₂)闪存,研发出新型模拟内容寻址存储器(CAM),可在单个步骤中同时将输入的搜索数据与所有存储数据进行比对,实现瞬间完成搜索并返回结果。
传统基于静态随机存取存储器(SRAM)的CAM单元需要多达16个晶体管,导致芯片体积庞大、功耗极高。港大团队设计的极简架构模拟CAM仅需2个晶体管即可构建一个单元,不仅大幅缩小芯片面积,还能直接处理更接近真实世界的连续模拟信号,提升信息存储密度。
为克服将二维材料连接到电路时限制电子流动的"肖特基势垒",研究团队使用半金属锑(Sb)作为接触电极,成功创造了一条畅通无阻、极低电阻的通道。
实测数据令人震撼。这款芯片的延迟仅为36皮秒(Picosecond,即一万亿分之一秒),单次搜索耗能低于0.1飞焦耳(fJ),创下世界纪录。
36皮秒是什么概念?光在真空中1皮秒仅能走0.3毫米,这意味着搜索完成时,光甚至还没来得及跨越芯片本身。这种"超光速"级别的响应速度,为实时AI推理、边缘计算等场景提供了全新的可能性。
在执行机器学习分类任务时,新型模拟CAM的处理速度比标准CPU快了约1亿倍,并在多个数据集测试中获得了极高的准确率。
李灿教授表示,作为大语言模型基础的"注意力机制",本质上是从压缩的知识库中提取信息的搜索过程。目前团队正在探索如何利用高性能硬件,来实现大型AI模型的搜索机制。
从实验室到产业化
在应用场景方面,团队举例智能手机的面部识别技术,可以直接在设备上瞬间完成,而无需将隐私数据上传至云端。这种"端侧智能"的实现,既保护了用户隐私,又大幅降低了延迟和能耗。
尽管技术突破令人振奋,李灿教授坦言,大规模商业化生产新型芯片仍需克服封装方面的工程挑战。不过,这项研究已成功验证了该原理,为下一代高效能、低功耗AI硬件提供了清晰的发展蓝图。
团队进一步展示了该技术的潜力:通过三维异质整合技术,在单个存储单元内垂直堆叠了不同类型的二维材料,使所需面积减半,功耗进一步降低。
香港在"存算一体"版图中的角色
"存算一体"正处于从验证到落地的关键阶段。香港在"存算一体"的全球版图中,扮演着重要的基础研究和关键技术突破者的角色,尤其在忆阻器应用和模拟计算领域特色鲜明。香港理工大学、香港大学等高校团队都有相关研究。
有专家认为,"存算一体"技术正处在从实验室走向产业化的爆发前夜,全球竞争激烈。这项技术被视为计算架构的"范式革命",影响意义深远。香港在基础研究和特定技术点上表现突出,而这项技术本身预示着新软硬件生态的指数级提升。