小米玄戒 AI 芯片「全家桶」精华简报

来源:爱范儿 ifanr
原文链接:https://www.ifanr.com/1676441?utm_source=rss&utm_medium=rss&utm_campaign=


TL;DR

小米在玄戒技术沟通会上一次性发布三颗自研芯片:手机旗舰 SoC「玄戒 O3」、面向大模型推理的高带宽 AI 加速芯片「玄戒 O100」,以及面向智能驾驶的「玄戒 D100」,并预告搭载 O3 的小米 18 Fold「阔折叠」与小米平板 9 Pro Max 将于 9 月发布。三颗芯片的共同主线并非单纯堆算力,而是解决“算力增强后数据搬运跟不上”的瓶颈:O3 通过 10 核全大核、LPDDR6 与超大缓存提升手机端数据吞吐;O100 用晶圆级 3D 堆叠把内存带宽拉到 1.22TB/s;D100 则以 160GB 统一内存支持 200B 参数模型本地部署。小米由此补齐“澎湃 OS + MiMo 模型 + 玄戒芯片”的端侧 AI 算力底座,从手机、桌面到汽车形成完整芯片矩阵。


核心观点与技术/商业洞察

1. 玄戒 O3:跑分“掀桌”,但真正的竞争焦点是能效与持续性能

玄戒 O3 的规格非常激进:

  • CPU:10 核全大核架构,6 超大核 + 4 大核,最高主频 4.35GHz;
  • 工艺与规模:3nm,芯片面积从上一代 109mm² 扩大到 133mm²,晶体管从 190 亿增至 240 亿;
  • 跑分:Geekbench 6.5 多核 1.5 万分,比苹果 A19 Pro 高近四成;实验室低温安兔兔极限 522 万分;
  • GPU:16 核 G2-Ultra NX,图形性能 +85%,光追性能 +182%,集成 8 个 NX 神经网络单元,算力 36 TOPS;
  • ISP:第五代旗舰 ISP,支持 4.32 亿像素单摄、24bit 位宽、64M+64M+50M 三摄并发,4K 60FPS AINR 夜景视频硬件级支持。

但文章强调,O3 真正的重点不是峰值跑分,而是中低负载功耗降低 25%、同性能点功耗比 O1 最高低 64%。这说明小米清楚:全大核架构的最大风险是日常使用中的发热与续航。旗舰 SoC 的竞争正从“极限跑分”转向“持续性能释放与能效曲线”。

2. 内存带宽成为端侧 AI 的核心瓶颈,小米三颗芯片都在解决“数据搬运”

文章用“顶级厨房”比喻:厨师再多、炒菜再快,如果送菜通道窄、食材仓库远,算力也会被堵在内存通道里。

O3 的应对是:

  • 首发支持 4×24bit、10667Mbps LPDDR6,带宽 113.8GB/s,比主流 LPDDR5X 提升近一半;
  • 缓存总量约 60MB(12MB L2 + 16MB L3 + 16MB SLC);
  • 静态访存延迟压缩至 82ns,优于苹果 A19 Pro 的 92ns 和上代 O1 的 121ns;
  • 针对 MiMo 5 值量化模型,加入硬件霍夫曼无损压缩,节省 30% 内存带宽;28MB NPU 近存使 MiMo 3B 首词响应 +40%、推理速度 +45%、功耗 -26%。

这说明小米已经意识到:端侧大模型推理的本质是“每吐一个 token 都要把数十亿参数从内存读一遍”,因此内存带宽、延迟和压缩能力比单纯 TOPS 更重要。

3. 玄戒 O100:用晶圆级 3D 堆叠把内存带宽拉到 1.22TB/s

O100 是本次最具架构创新性的产品。它不追求通用计算,而是完全面向大模型推理的高带宽 AI 加速芯片:

  • 采用 Wafer on Wafer 晶圆级 3D 堆叠 + Hybrid Bonding 混合键合,将两层高速 AI 专用 DRAM 晶圆与一层高性能 NPU 晶圆垂直键合;
  • Face to Face 金属层直连,258 万个物理键合节点,TSV 孔径 0.7μm,键合间距 1.4μm;
  • 内存带宽达到 1.22TB/s,是主流旗舰手机 LPDDR5X 的 16 倍;
  • 14 个 NPU 核心采用动态互联:Prefill 阶段走 Ring 环形网络,Decode 阶段切换 All-to-All 广播网络;
  • 配合 Xiaomi MiMo,实验室最高跑出 330Tokens/s 的本地推理速度。

O100 的商业逻辑很清晰:当通用 SoC 无法满足大模型推理的带宽需求时,专用加速芯片必须从架构上打破传统平面封装限制。晶圆级 3D 堆叠把“数据通路从平面变成垂直穿透”,这是端侧 AI 硬件的重要方向。

4. 玄戒 D100:160GB 统一内存,让 200B 模型常驻车机

D100 面向智能驾驶:

  • 3nm 工艺,20 核 CPU + 16 核 NPU;
  • 最高支持 160GB 统一内存;
  • 已在本地成功部署 200B 参数规模模型,计划明年商用。

文章指出,智能汽车端侧算力的核心诉求是离线与低延迟。地库、隧道等弱网环境下,云端协同会面临延迟甚至断连。160GB 统一内存的意义在于让大参数模型直接常驻车机本地,不依赖网络即可完成实时推理。这不仅是智驾芯片的竞争,也是“端侧大模型上车”的关键一步。

5. 从单点 SoC 到“芯片全家桶”:小米 AI 战略的底层闭环

三颗芯片覆盖手机、桌面 AI 终端、智能汽车,加上澎湃 OS 与 MiMo 模型,小米形成了完整的垂直整合:

  • 澎湃 OS:整机调度;
  • MiMo:模型算法;
  • 玄戒:物理算力底座。

文章引用 Alan Kay 名言:“真正认真对待软件的人,就应该自己做硬件。”小米的路径正是从系统、模型到底层芯片的协同。现场还展示了 Xiaomi AI Cube Prototype:类似英伟达 DGX Spark 的桌面 AI 终端,航天铝一体成型外壳,超过 33874 个 CNC 蜂窝散热孔,内部芯片阵列串联,实现 120B + 3B 双模型本地混合部署——小模型负责高频指令毫秒级响应,大模型负责深度推理。

6. 产品节奏直指苹果:小米 18 Fold「阔折叠」与平板 9 Pro Max

小米 18 Fold 预计 9 月发布,是小米首款「阔折叠」形态产品,搭载玄戒 O3;小米平板 9 Pro Max 同样搭载 O3。文章提到,此前 HyperOS 宣传海报中曾出现机身比例明显更宽的折叠设备,此次沟通会也展示了「阔折叠」宽屏工程原型机。

时间点上,苹果下个月将发布 iPhone 18 Pro 系列和首款折叠屏 iPhone。小米选择此时“掀桌子”,显然是要在苹果折叠屏落地前抢占高端折叠屏与自研芯片的双重声量。


启发与影响

对手机 SoC 行业

  • 竞争维度从峰值跑分转向能效与持续性能。O3 的 10 核全大核架构虽然跑分惊人,但小米反复强调中低负载功耗降低 25%、同性能功耗降低 64%,说明旗舰芯片的胜负手正在从“极限性能”转向“日常体验”。
  • 内存带宽和缓存体系成为旗舰 SoC 新战场。LPDDR6、超大缓存、低延迟设计将越来越重要,尤其是在端侧 AI 推理场景下。
  • 苹果 A19 Pro 被直接作为基准对标,显示小米自研芯片已经进入高端旗舰竞争的核心圈层。

对 AI 硬件与端侧大模型

  • 内存带宽是端侧大模型推理的第一瓶颈。O100 的 1.22TB/s 带宽和晶圆级 3D 堆叠方案,可能引领专用 AI 加速芯片的架构创新。
  • 大小模型混合部署成为产品化路径。AI Cube 的 120B + 3B 双模型方案,兼顾响应速度与深度推理,为桌面 AI 终端提供了可参考的范式。
  • 量化、压缩与近存计算将成为端侧 AI 芯片的标配能力,而非单纯堆 TOPS。

对智能汽车与智驾芯片

  • 大参数模型本地常驻是智驾/座舱的下一个竞争点。D100 的 160GB 统一内存和 200B 模型部署能力,意味着离线低延迟推理将成为高端智能汽车的核心差异化。
  • 端侧算力与云端协同的边界将进一步向端侧倾斜,尤其在弱网场景下。

对小米商业战略

  • 垂直整合加深:澎湃 OS + MiMo + 玄戒芯片形成“丝滑小连招”,小米从系统、模型到芯片的闭环能力显著增强,有助于提升高端产品溢价与差异化。
  • 产品矩阵扩展:手机、平板、桌面 AI 终端、汽车全覆盖,小米正在构建一个以端侧 AI 为核心的硬件生态。
  • 潜在风险:三颗芯片同时推进,量产良率、功耗控制、软件生态适配和开发者支持都是巨大挑战;尤其 O100 的晶圆级 3D 堆叠和 D100 的 160GB 统一内存,距离规模商用仍有不确定性。

对消费电子形态

  • 「阔折叠」可能开启折叠屏新品类。更宽的机身比例在折叠状态下更接近小平板,展开后则提供更大的可视面积,可能改变用户对折叠屏的使用场景认知。
  • 自研芯片与折叠形态的结合,有望在影像、AI 交互和多任务体验上形成差异化,但最终仍需看实际产品落地与软件适配。

一句话总结:小米玄戒“全家桶”的真正意义不在于刷新跑分,而在于用 O3、O100、D100 三颗芯片,从手机、桌面到汽车,系统性地解决端侧 AI 的带宽与数据搬运瓶颈,完成“OS + 模型 + 芯片”的垂直整合,并在苹果折叠屏发布前抢占高端声量。