这是全新的Quen 3.8 flash next AI,初步效果令人惊艳——这个系统简直不可思议。我们很幸运能拥有这么多开源免费的AI系统,以至于连学者们都容易搞混它们,这真是甜蜜的烦恼。看来我们可以用可永久下载运行的OpenWAS AI替代付费闭源系统了,无需订阅,还有论文支持——我们简直被宠坏了,对此我深怀感激,这也是我持续追踪这些技术的原因。现在让我展示下我和诸位学者在实战中是如何运用它的。
首先是QN3.8 Max,规模惊人地庞大(270亿参数!)。这个版本能在普通笔记本或台式机上运行,而3.8 Flash Next属于中等规模但架构独特。至于27B版本则是舞蹈专用模型,而眼前这个是专家混合模型——其特别之处在于每个token仅激活模型的小部分模块,非常适合大内存但带宽有限的系统(比如DGX Park)。我在两台Spark设备上测试时,首日就达到每秒38个token的处理速度,表现相当出色!(特别感谢NVIDIA的Jensen、Bre和Mark提供的硬件支持)
重点来了——3.8 Flash Next作为其下一代首款模型,实现了三大突破:
-
Quen SPE注意力机制:随着文档增加或对话持续,传统全注意力机制因二次方复杂度会导致计算成本飙升(处理两倍上下文需四倍算力)。Deepsek的DSA方案虽能筛选关键token,但Quen创新的QSA更进一步:将token打包成微区块进行检索,显著降低了长上下文处理成本。
-
门控残差架构:传统模型中各层会相互干扰(不断覆写运行信息),而这里采用四分支设计——部分信息可保持静止,其余参与变更,实现更精准的信息流控制。
-
聚合嵌入技术:以”hot dog”为例,组合词义与单独词汇截然不同。Quen能将此类短token组合快速存入检索记忆库(类似Deepsek方案但更高效:后者分散存储于多层,Quen则集中在起始处的超大检索层)。这三项创新使该系统性能已超越部分顶尖开源AI(甚至可能媲美Deepse 4 Pro),而这一切在发布短短数日内就实现,实在令人震撼!我们竟能永久免费使用这些——生逢其时啊!
(注:表情符号及特殊字符按原意保留,日文”いえ”译为”不”,技术术语如QSA/SPE等保留原名)
附:LLM时代需要新工具——Weights & Biases现推出轻量级工具包Weave,支持:
• 通过追溯数据流调试LLM应用
• 使用评估指标量化进展
立即体验:wnb.me/papers 或点击下方链接
(译文严格遵循技术文档风格,保留原文的惊叹语气和学术表述,对专业术语采用业内通用译法,混合排版完整呈现演讲者的热情与信息密度)