TL;DR

本文是 Sebastian Raschka 撰写的一篇实操教程,核心在于如何用完全本地化的技术栈搭建一个可用于生产环境的编码代理(coding agent):以 Ollama 作为推理引擎/运行时服务器,本地运行开放权重 LLM(首选 Qwen3.6 35B-A3B),再搭配开源编码框架(如 Qwen-Code、Codex、Claude Code 等)来完成读文件、编辑代码、执行命令和验证变更等任务。作者认为,本地方案在成本可控、隐私保护、可复现性、离线可用性以及透明可控方面日益具备竞争力,并提供了从模型选型、服务部署到框架接入的完整路径,同时也对比了不同 harness 与模型之间的适配关系。


核心观点与技术/商业洞察

1. 本地编码代理的定位:专有服务的有力替代而非玩具

  • 作者承认自己日常主力仍是 Codex 和 Claude Code,但他持续使用本地方案进行测试和实际工作,并强调本地方案透明、可检查、运行成本几乎为零(除硬件和电费)。
  • 关键使用动机包括:
    • 成本可预测:不受订阅套餐限制,也不受 API 涨价影响;
    • 隐私安全:例如处理个人收据等敏感数据时,不希望传给 OpenAI 或 Anthropic;
    • 可复现性:模型升级可能破坏既有工作流,固定本地版本可避免意外变化;
    • 离线可用:飞机上、无网络的写作静修等场景。

2. 编码代理的架构:LLM 是引擎,harness 是运行环境

  • 核心组件分层清晰:
    • LLM(大模型):负责推理与代码生成;
    • Harness(编码框架):提供文件读取、代码编辑、命令执行、结果验证等操作系统能力;
    • 推理引擎/服务器:如 Ollama,负责高效地本地托管模型,对外提供 API。
  • 这套架构意味着你可以自由组合模型与框架,不受专有平台锁定。

3. 模型与框架存在“最优配对”关系

  • 作者主要选择 Qwen3.6 + Qwen-Code 组合,原因:
    • Qwen-Code 是开源框架(与 Codex 相同,优于 Claude Code 的非开源);
    • Qwen 系列模型专门针对 Qwen-Code 做了优化;
    • 可同时在同一台机器上运行 Codex(云端 GPT 模型)和 Qwen-Code(本地模型),无需手动切换。
  • 引述 Nvidia 的 Polar: Agentic RL on Any Harness at Scale 论文基准:Qwen3.5-4B 在 Qwen-Code 中表现最佳,验证了“模型对自家 harness 优先优化”的行业惯例。
  • 但 harness 是通用的:例如 Qwen-Code 也可以接入 North Mini Code、Gemma 4 等模型。

4. 模型选型:Qwen3.6 35B-A3B 是当前同尺寸最佳

  • 该模型下载约 22 GB,需要 30–40 GB 内存,在 Mac Mini M4 和 DGX Spark 上均可流畅运行。
  • 引用 Cohere 2026 年 6 月发布的 North Mini Code 报告基准:Qwen3.6 35B-A3B 在同尺寸级别(~35B 激活 3B)中几乎在所有基准上领先。
  • 架构上采用混合注意力(hybrid attention),与 Qwen3-Coder/Qwen3.5 一脉相承。
  • 备选方案:Cohere 的 North Mini Code 是同等尺寸下最值得关注的能力替代。

5. 本地服务引擎的选择:Ollama 是最易上手的方案

  • 可选引擎包括 Ollama、LM Studio、vLLM、SGLang、MLX 等。
  • 作者自身偏好从零实现模型以便深度理解和微调,但在“仅需推理”的场景下,直接使用高度优化的现成引擎更务实。
  • 推荐 Ollama 的理由:
    • 跨平台安装简单;
    • 命令行友好;
    • 支持云上开放权重模型(如 GLM 5.2)作为便捷测试选项,虽然并非免费。
  • 不涉及训练/微调时,Ollama 的推理速度和资源管理已足够生产使用。

6. 生态与工具趋势:开源 harness 竞争加剧

  • 除 Qwen-Code、Codex、Claude Code 外,还提到 OpenCode、Cline、Pi、Noumena Code 等框架。
  • 作者特别指出 Pi 是未来值得深入尝试的有趣候选者。
  • Claude Code 目前闭源,而 Codex 开源,这是作者选择开源工具链的重要考量之一。

对行业的启发与影响

1. 编码代理的“本地化”将成为企业级 AI 开发的合规刚需

随着数据隐私法规趋严(如 GDPR、企业保密协议),金融、医疗、法律等领域无法接受将内部代码或业务数据发送到第三方云 API。本地编码代理提供了“同等能力 + 完全数据掌控”的路径,且成本结构更可预测。这篇文章展示了用 30–40 GB 内存的消费级硬件即可运行相当强大的编码模型,意味着本地 AI 编码助手不再是企业专属,个人开发者也能完全掌控工具链。

2. “模型 + Harness”绑定优化将成为模型厂商的竞争策略

Nvidia 的基准研究、Qwen 对 Qwen-Code 的针对性优化,揭示了一个重要趋势:未来的开放权重模型会与特定 agent harness 深度协同,类似“芯片 + 软件栈”的绑定。厂商通过自研 harness 释放模型潜力,也为开发者提供了清晰的选型依据。这可能导致 harness 生态的分化——但同时也意味着更强的整体性能和更顺畅的用户体验。

3. 开源 harness 正在缩小与闭源产品的代差

作者本人仍以 Codex 和 Claude Code 为日常主力,但他承认本地方案“日益具有吸引力”,且已在真实工作中使用。开源工具链(Codex 开源、Qwen-Code、Ollama)与开放权重模型(Qwen3.6、North Mini Code)的组合,已经在代码生成、执行验证、多文件编辑等核心能力上逼近专有方案。未来若闭源服务继续限制性能或提价,开源替代方案将具备更强的“备胎”价值。

4. 推理效率比模型尺寸更重要

Qwen3.6 35B-A3B 这类 MoE(混合专家,激活 3B)模型证明,通过架构优化(混合注意力 + 稀疏激活),中尺寸模型在编码任务上可以媲美更大模型,同时大幅降低硬件门槛。这推动行业从“追求参数量”转向“追求单位参数效率”,也将影响云服务定价和本地硬件市场的需求结构。

5. 可复现性与可控性成为 AI 工具链的新卖点

模型升级导致工作流破坏是实际痛点。本地固定版本允许团队锁定模型和 harness 版本,实现完全可复现的 AI 编码环境,这对软件工程中的回归测试、CI/CD 集成和合规审计至关重要。未来“版本化 AI 开发环境”可能成为企业级工具链的标配。

6. 本地 AI 的“乐趣”与“极客精神”正在形成新的开发者文化

作者多次提到“fun”和“joy”,这并非简单的个人偏好,而是代表了开发者对技术主权和动手定制工具链的追求。从 Ollama GUI 一键下载模型,到修改开源 harness 的行为,这种“可 hack 的 AI 栈”将吸引更多开发者进入本地 AI 生态,形成社区正循环,进一步加速工具成熟。