小米 AI Cube 原型情报简报

信息来源:Reddit r/LocalLLaMA 热帖;原始信源为 IT之家(ithome.com/0/993/546.htm)
信息等级:初步披露,单一来源,关键参数待官方确认

1. TL;DR

小米公布“AI Cube”原型,采用三芯片方案(玄戒 O3、O100、D100),其中 O100 标称 1.22TB/s 内存带宽,D100 支持最高 160GB 内存。该组合在本地 LLM 社区引发关注,但带宽与容量的归属关系不清,尚无法判断其实际大模型推理性能。

2. 核心观点与技术细节

  • 三芯片架构:系统由小米玄戒 O3、O100、D100 组成,具体分工未完全公开。
  • 高带宽指标:O100 具备 1.22TB/s 内存带宽,若为主内存/高带宽存储器,将对 LLM 推理的 decode 阶段较为有利。
  • 大容量指标:D100 支持最高 160GB RAM,该芯片原用于小米电动汽车,现被引入 AI 计算场景。
  • 关键疑点:帖子作者指出 1.22TB/s 可能指 SRAM/片上缓存,而非可扩展主内存;若如此,实际可寻址容量与带宽组合存疑。
  • 来源局限:目前信息来自 IT之家,未见小米官方详细架构说明或白皮书。

3. 核心痛点

  • 带宽与容量错位:O100 有高带宽但未明确对应大容量;D100 有大容量但未披露对应带宽。对 LLM 推理而言,两者必须同时满足,否则会出现“带宽高但装不下模型”或“容量大但 token/s 低”的瓶颈。
  • SRAM vs DRAM 模糊:1.22TB/s 若为片上 SRAM,则容量可能仅数百 MB 级,无法承载 70B/160GB 级模型;若为 HBM/封装内存,则成本与可扩展性需进一步说明。
  • 三芯片协同不透明:O3/O100/D100 之间如何分配计算、内存与 I/O,决定实际可用性能,但当前信息缺失。
  • EV 芯片复用风险:D100 源自电动汽车场景,其内存子系统是否针对 LLM 推理优化(大容量、高带宽、低延迟)仍待验证。

情报评估

该帖反映社区对“高带宽 + 大容量”本地 AI 硬件的强烈需求,但小米披露的规格存在关键参数混淆,暂不能作为推理性能依据。建议持续跟踪官方架构图、第三方实测及量产版本规格。