小米端侧 AI 原型机实测简报
来源:爱范儿 ifanr
链接:https://www.ifanr.com/1676596
TL;DR
小米在技术沟通会现场展示了两款搭载自研玄戒芯片的工程原型机:一台折叠屏原型机在完全断网状态下本地运行 3B 模型,实现 0.45 秒首字响应、303 tokens/s 生成速度;另一台桌面计算终端 AI Cube 则本地部署 120B 参数大模型,现场完成钢琴网页代码生成。文章核心是验证小米自研芯片从纸面参数走向真实端侧 AI 负载,展现“随身轻量秒回 + 桌面重度推理”的双形态分工,并指向端侧 AI 设备量产可能。
核心观点与技术/商业洞察
1. 自研芯片进入“真实负载验证”阶段
玄戒 O3 的 Geekbench 6.5 多核破 1.5 万分、O100 通过 3D 堆叠实现 1.22 TB/s 带宽,纸面数据激进。但现场重点已从跑分转向实际生成速度、首字延迟、散热与离线能力。这说明端侧 AI 芯片竞争正从“参数竞赛”转向“可用性竞赛”。
2. 端侧 AI 体验的关键指标是“跟手”
折叠屏原型机在断网下运行 MiMo 3B 模型,TTFT 仅 0.45 秒,生成速度 303 tokens/s,峰值 330 tokens/s,超过人眼阅读节奏。这意味着 AI 润色、通话同传等场景真正具备日常实用价值,而非演示玩具。
3. 快慢双模型架构是端侧部署的务实路径
AI Cube 支持 3B + 120B 快慢双模型切换:轻量高频指令由 3B 小模型秒回,复杂代码生成才交给 120B 大模型。这种架构在延迟与智能之间找到平衡,避免小模型在复杂任务上“胡乱发挥”,也降低千亿级模型的常驻成本。
4. 硬件形态因散热与算力需求发生分化
折叠屏原型机背面加装主动散热风扇,AI Cube 机身打满 33874 个镂空孔并配备散热鳍片。端侧大模型的高负载对热设计提出新挑战,也催生新品类:随身设备负责轻量高频,桌面终端承接重度推理。
5. 离线隐私成为核心卖点
两款设备均强调断网运行、数据不出本地。对于敏感场景(如商务会议、个人文档处理),端侧 AI 的隐私底线是云端方案无法替代的差异化优势。
6. 标题“性能超 iPhone”需谨慎解读
正文未提供与 iPhone 同场景的对比数据,所谓“性能超 iPhone”更多指向纸面 CPU/带宽参数。现场实测聚焦端侧 AI 生成速度,缺乏与苹果设备的直接对照,因此该结论仍需后续量产机验证。
对行业的启发与影响
- 端侧 AI 设备将从“能跑”进入“好用”阶段:生成速度、首字延迟、散热与功耗将成为关键评价指标,而非单纯模型参数量。
- 自研芯片 + 专用加速器 + 高带宽内存可能成为手机/PC 厂商差异化核心,冲击高通、联发科、苹果现有芯片格局。
- **双模型协同(小模型常驻 + 大模型按需)**有望成为端侧 AI 系统设计范式,推动模型压缩、动态调度与端云协同技术发展。
- 桌面 AI Cube 类产品可能开辟“个人 AI 算力中枢”新品类,满足开发者、隐私敏感用户及小型团队的本地推理需求。
- 量产挑战依然存在:主动散热与手机便携性的矛盾、成本控制、模型生态与开发者工具链成熟度,都是从小规模原型走向大众市场的关键障碍。
- 若成功量产,将降低本地大模型使用门槛,推动端侧 AI 普及,并对云端推理商业模式形成一定替代效应,尤其在隐私敏感和低延迟场景。