手机端27B大模型Bonsai

Bonsai 27B,MoE量化,手机端可跑的大模型发布

PrismML发布了Bonsai 27B——首个能在手机上运行的27B参数级大语言模型。基于Qwen3.6 27B架构,采用1.58位三值量化(ternary quantization)和混合专家(MoE)设计,在保持推理能力的同时将模型压缩到移动设备可承载的规模。

技术突破:1.58位三值量化

传统的模型量化通常降到4位或8位。Bonsai采用的1.58位量化更为激进——每个权重只取三个值(+1、0、-1),用不到2位的信息表示。这意味着原本需要16位或32位浮点数存储的270亿参数,现在只需约5GB的存储空间。

PrismML此前已在较小模型上验证了这一技术路线。Bonsai 27B将这个前沿推进到商用级别:在标准基准测试中,其性能接近全精度27B模型,部分任务(如摘要、翻译)的差距仅在5%以内。

MoE架构:按需激活

Bonsai采用了混合专家架构,推理时只激活模型的一小部分参数。结合1.58位量化,实际运行时的内存占用和计算量大幅降低。PrismML宣称在iPhone 16 Pro上可以实现流畅的推理速度。

HN社区讨论指出,虽然”1位模型”是一个吸引人的标签,实际上它是1.58位(三值)。有评论者提到Unsloth的UD_Q2变体在工具调用任务上约有5%的性能下降,这在现实应用中可能比基准测试显示的更明显。

移动端AI的范式转变

Bonsai 27B的意义不止于技术指标。它代表了一个方向:高质量AI不再必须依赖云端。手机本地运行27B模型意味着隐私保护、离线可用和零延迟。这对医疗、金融等敏感领域尤其重要。

模型已在Hugging Face开源,PrismML同时发布了配套的移动端推理demo。虽然目前仅限iOS,Android支持正在开发中。

原文: Announcing Bonsai 27B | HN讨论: 374 points, 144 comments

Leave a Reply

Your email address will not be published. Required fields are marked *