精华简报:三星内存计算技术(PIM)深度解析
TL;DR
三星在Hot Chips 2026大会上展示了突破性的LPDDR5X-PIM技术,通过在DRAM存储体中集成MAC运算单元,实现了内存内计算与标准内存控制器的兼容,使单芯片内部带宽提升至614GB/s(较传统DRAM提升8倍),为AI推理等场景提供高能效解决方案。
核心技术洞察
1. 架构创新
- 存储体级并行计算:16个存储体各配备独立PIM模块,突破传统DRAM两个存储体并行限制
- 混合精度支持:支持INT8/FP8/4bit等多种格式,单周期完成4-8次MAC运算
- 协议兼容性:通过特殊行地址触发计算模式,完全遵循LPDDR5X标准
2. 性能突破
| 指标 | PIM模式 | 传统模式 | 提升倍数 |
|---|---|---|---|
| 有效带宽 | 614GB/s | 76.8GB/s | 8x |
| 单芯片算力(INT8) | 2.4TOPS | N/A | - |
| 8芯片组合算力 | 9.6TOPS | ≈Meteor Lake NPU | 对标x86 NPU |
3. 商业价值
- 成本效益比:128GB内存配置即可达到主流NPU性能,但需权衡内存成本
- 能效优势:数据就地计算减少90%以上的数据搬运能耗(根据行业基准数据推断)
- 部署灵活性:可作为独立加速方案或与现有NPU/GPU协同工作
行业影响与启示
技术趋势
- 内存墙突破:验证了PIM技术在大规模商用DRAM中的可行性
- 异构计算新范式:开创”存储即计算”的架构设计理念
- AI推理变革:为边缘设备提供高带宽、低延迟的ML加速方案
商业启示
- 内存厂商战略:美光/SK海力士可能加速类似技术研发
- 芯片架构重构:CPU/GPU厂商需重新评估内存子系统设计
- 软件生态机会:需要开发新的编译器优化和内存分配策略
潜在挑战
- 编程复杂度:需新的开发工具链支持PIM-aware编程
- 成本敏感度:大容量PIM内存配置在消费级市场接受度存疑
- 精度限制:当前仅支持低精度计算,制约应用场景
关键问题:如何在保持JEDEC标准兼容性的前提下,平衡计算密度与内存成本?