TL;DR
一位开发者编写了一个编译器,将《毁灭战士》的经典软件渲染算法直接编译为 210 亿参数的 Transformer 权重(无需任何训练),生成的标准 Hugging Face 检查点可通过 43 行宿主 Python 代码驱动,模型输出像素绘制指令序列并还原出 E1M1 关卡画面;性能对比鲜明:原版在 486 上跑 35 FPS,该项目在 NVIDIA B200 上约 35 FPD(每天帧数)。
核心观点与技术细节
- 核心创新:不是“用 Transformer 学习渲染”,而是通过自研编译器将命令式计算图(Doom 渲染算法)直接映射为 Transformer 权重,实现“程序即模型”。
- 技术路径:
- 将 Doom 渲染器移植为与编译器兼容的计算图。
- 编译器将计算图编译成标准 Transformers 检查点(无需
trust_remote_code,可直接加载)。 - 推理时输入 3,614 token 的场景数据提示词,模型自回归生成 53,747 个 token,解析后即为绘制指令(移动光标、画像素等),机械执行后得到完整帧。
- 性能数据:
- 单帧生成在 B200 上耗时约 40 分钟。
- 速度对比:原版 Doom 在 486 CPU 上 35 FPS,本方案在 B200 上 35 FPD。
- 资源开放:提供文章、Hugging Face 权重、GitHub 源代码。
核心痛点
- “训练即成本”困境:传统神经网络解决特定算法任务需要海量数据、算力与调参,本工作展示了一条“零训练”的替代路径,将算法直接编译进权重。
- 可解释性与可控性缺失:常规模型是黑盒,而本方案中模型行为完全由显式算法决定,输出可预期、可调试。
- 部署与兼容性摩擦:许多自定义模型需要特殊加载代码;本项目强调“标准 checkpoint、标准 transformers 接口”,降低了使用门槛。