腾讯混元 Hy4 Preview 技术简报
来源:极客公园《腾讯重金投入 AI 之后,混元 Hy4 preview 交出了什么答卷》
核心内容:腾讯发布新一代大模型混元 Hy4 Preview,参数规模与性能显著提升,聚焦生产力场景,通过三项实测验证其长任务处理与工程化能力。
一、核心升级
-
模型规模
- 总参数:295B → 770B(增长161%)
- 激活参数:21B → 49B
- 上下文长度:256K → 1M(支持超长文本处理)
-
性能优化
- 推理吞吐提升 31.8%(通过训练方法、数据策略优化)
- 定价保持普惠:输入 6元/百万 tokens,输出 18元/百万 tokens
-
应用落地
- 已集成至腾讯办公(WorkBuddy)、编程(CodeBuddy)、内容(元宝)等产品,并通过腾讯云开放调用。
二、实测表现
腾讯通过三项复杂任务测试 Hy4 Preview 的长程任务执行与工程化调试能力:
-
费用审核(多源材料处理)
- 任务:审核6笔费用申请(12份材料),需交叉验证制度、预算、邮件等。
- 结果:3分27秒生成《费用审核报告》,核减230元,退回补件840元。
- 亮点:
- 主动关联分散证据(如邮件附件验证交通费合理性)。
- 识别审批邮件语义(拒绝“标题党”式放行)。
- 不足:1笔申请误判制度版本(未影响金额)。
-
原生Canvas游戏开发(32分钟)
- 任务:用HTML5 Canvas+TypeScript开发《深海进化论》(大鱼吃小鱼)。
- 结果:交付可运行游戏,含自动化测试(15项逻辑测试+14项端到端测试)。
- 亮点:
- 自修复边界动画、追击逻辑等开发问题。
- 超额实现功能(连击、暂停、本地存储高分)。
-
Three.js 3D游戏开发(2小时)
- 任务:从一句话需求生成《午夜港口》无人机竞速游戏。
- 结果:首次交付失败(打包问题),20分钟内修复为单文件可运行版本。
- 亮点:
- 自主调试AI路径、渲染参数(如修复雨夜过曝问题)。
- 支持完整游戏循环(氮气加速、实时排名、碰撞检测)。
三、关键结论
-
能力边界
- 优势:长任务链处理(需求拆解→执行→测试→迭代)、多模态工程能力(文档/代码/3D)、性价比突出。
- 局限:仍需人工复核关键前提(如制度版本)、复杂项目首次交付可能不完善。
-
战略意义
- 腾讯二季度AI业务投入对利润影响达105亿元,Hy4需证明算力投入的商业回报。
- 通过低价API(6元/百万tokens)和产品集成(如WorkBuddy)推动规模化应用。
-
行业定位
- 盲测得分:Hy4(2.99/4)略超Kimi K3(2.94)、GLM 5.3(2.92),但核心差异在于真实场景的稳定交付能力,而非单纯参数竞赛。
分析师点评:
腾讯Hy4 Preview展现了从“生成答案”到“执行任务”的跨越,尤其在工程与办公场景的实用性显著提升。其长程Agent能力(如自主调试、多轮迭代)可能成为差异化优势,但需持续优化首次交付准确率。未来商业化关键在能否通过WorkBuddy等产品形成高频调用生态。
(简报基于公开信息提炼,完整内容参见原文链接)