美国推出新型3D-DRAM AI芯片:百TB/s带宽与高能效优势显著

更新时间: 2026-09-05 浏览:8720

美国人工智能芯片初创公司d-Matrix近日在Hot Chips 2026会议上展现了其创新的Raptor 3D-DRAM生成式AI推理加速器。这款芯片采用台积电的N4逻辑裸片与3D-DRAM进行紧密堆叠,内存直接放置在计算单元下方。单张Raptor卡配备了32GB的3D-DRAM,令人瞩目的带宽超过了100TB/s。每个chiplet提供4GB的内存及约12.5TB/s的带宽,而八个chiplet则构成了一张完整的加速卡。相比之下,192GB的HBM4配置的带宽仅约为18TB/s。

about image

在能效方面,Raptor的垂直IO测试结果显示功耗仅为0.37pJ/bit,仅为HBM方案的十分之一。单位面积的带宽达到32.6GB/s/mm²,是HBM4和英伟达Rubin R200的约20倍,而每GB/s的功耗仅为2.96mW,相较于HBM方案的40mW,改善幅度超过了13.5倍。Raptor的推出正是为了应对AI推理中的内存带宽瓶颈问题。大模型在解码阶段,每个token需要频繁地读取权重和KV缓存,因此带宽显得尤为关键。在64个并发用户操作下,100万token的上下文中,KV缓存占用高达935GB。

虽然SRAM能够提供数百TB/s的带宽,但其容量仅限于GB级且泄漏功耗极高。虽然HBM具有较大的容量,但其带宽也受到封装边缘空间的限制,在100TB/s的带宽下,其内存功耗高达1.92kW。而3D-DRAM则恰好介于两者之间。Raptor芯片将逻辑裸片直接放置于DRAM上方,信号传输路径缩短到毫米级,省去了PHY接口。在单层堆叠时,如果功率密度控制在0.5W/mm²以下,就可以通过液冷将DRAM温度保持在100°C以下。

about image

d-Matrix预计Raptor的商用产品将于2027年推出,3D-DRAM是否能够重新定义AI推理的内存架构,值得在其大规模应用中进行实际考验。

about image