过去两年来,本地大语言模型一直被贴着”慢、难用、不准”的标签。但2026年6月,资深技术博主Vicki Boykis发出宣言:本地模型终于可以用了。
从”不行”到”够用”的转折点
Boykis使用一台2022年的M2 Mac(64GB内存),测试了从Mistral 7B到Gemma 3、Qwen 3 MOE等一系列开源模型。她的核心判断标准很简单:”我还需要拿云端模型来double-check吗?”在GPT-OSS发布之前,答案是几乎总是”需要”。但GPT-OSS是第一个让她大幅减少交叉验证的模型。
真正的转折点来自Google最新发布的Gemma 4系列。Boykis报告称,Gemma 4-26B-a4b在LM Studio上运行,能够在约75%的准确率和速度上完成代理式编码任务——这个数字已经接近前沿商业模型的表现。
实际用例:从重构到生成
她列举了多个真实场景:将Jupyter Notebook重构为5-6个模块的Python仓库、修复类型提示、校对博客文章、编写单元测试,甚至从头搭建推荐系统的双塔模型。虽然生成的代码基础但超出了以往本地模型的边界——这正是”够用”的定义。
社区反响:两极分化
HN评论区呈现出明显的分歧。使用MacBook Pro M5 Max(128GB内存)的开发者iagooar表示同时运行Qwen 3.6 27B(密集)和35B(MoE)两个模型,体验优异。而另一位用户则吐槽量化到4-bit的模型在工具调用上”像是被脑叶切除术摧毁了”。
有趣的是,有用户被迫从Qwen 27B切换到Claude Sonnet 4.6后,反而觉得是”降级”——因为云端模型”话太多、自以为是”。也有人指出,一台$2600的AMD双卡方案就能以50 tokens/秒的速度运行Qwen 27B FP8,性价比远超云端API订阅。
趋势洞察
多位评论者点出了一个核心问题:当本地模型越来越好,AI公司的定价天花板就会越来越低。正如rmunn所说:”很多人会计算——如果买硬件一年就能回本,为什么还要每月付订阅费?”
本地模型的崛起不只是技术问题,更是商业模式的问题。开源社区的进步正在改写AI工具的经济学。