“有没有人已经完全用本地模型替代Claude/GPT作为日常编程主力?”——这个帖子在Hacker News上引发了热烈讨论,短短时间内飙升至606分。答案比许多人预想的更积极:确实有相当数量的开发者已经在这样做,而且体验出乎意料地好。
主流通勤方案:Qwen + OpenCode
受访开发者中最常出现的组合是阿里通义千问Qwen 3.6 35B模型配合OpenCode编码工具。这个组合可以在单张RTX 3090(24GB显存)上流畅运行,推理速度甚至超过大多数云端API的响应时间。
一位使用Mac Studio(128GB内存)的开发者分享,他用Qwen 3.6 35B的MoE版本——仅3B活跃参数——完成了一次网站首页和博客的完整重设计。另一位拥有双RTX 3090的开发者表示,他已经取消了每月100美元的Claude订阅,转而使用Unsloth Studio上的Qwen和Gemma 4两种模型。
实际效果:云端八至九成功力
社区共识是:本地模型目前能达到Claude Code或OpenAI Codex约80-90%的编码能力。一位使用RTX 6000的开发者坦言”它不如Claude Code聪明,但足够完成我90%的工作”。另一位则在中途修正——”我开始时想说90%,但实际更像是80%。大项目的上下文理解和一次性完成复杂重构的能力仍有差距。”
不过这些差距正在以惊人的速度缩小。有开发者指出,当前本地模型的编码质量相当于8-12个月前的云端前沿模型——这意味着如果趋势持续,到2027年初本地模型可能与今天的SOTA模型持平。
硬件门槛和使用场景
最令人振奋的是硬件门槛的降低:一台配备RTX 3090的旧PC就足以运行可用的编码助手。Llama.cpp对Qwen 3.6的MTP(Multi-Token Prediction)优化让性能大幅提升。而使用MacBook Pro 36GB内存或Mac Studio的用户,可以利用统一内存架构运行更大模型。
对隐私敏感的开发者来说,完全离线的编码助手是杀手级应用。一位已经使用本地方案数月的用户写道:”我关心的是数据隐私和LLM自由。”他的方案是将Pi编码框架容器化并沙箱化,确保完全离线运行。
不过坦率的反对声音同样存在:”每个月我都会研究这个问题,然后得出相同的结论——目前花时间、精力和金钱让本地模型达到Claude Code的水平并不划算。”这场关于效率与自由裁量权的辩论,显然还远未结束。
📎 HN讨论原文