2026年6月,AI 评测平台 Artificial Analysis 发布最新报告:智谱 AI 的 GLM-5.2 成为新的开源模型性能之王,在综合智能指数上超越 Llama 4、DeepSeek-V3 等强劲对手。这一消息在 Hacker News 上获得 760 分,引发 379 条讨论。
评测结果:全面领先
根据 Artificial Analysis 的 Intelligence Index(综合智能指数),GLM-5.2 在所有开源权重模型中排名第一。评测覆盖了推理能力(Reasoning)、编码能力(Coding)、多语言理解(Multilingual)、知识广度(Knowledge)等多个维度,GLM-5.2 均展现出均衡且突出的表现。
值得注意的是,GLM-5.2 并非单纯的基准测试「刷榜」——它在实际使用场景中的编码辅助、长文本理解、结构化输出等方面也得到了开发者的正面反馈。尤其在中英文混合场景和中文理解深度上,GLM-5.2 具有天然优势。
技术演进:从 GLM 到 GLM-5.2
智谱 AI 的 GLM 系列经历了快速迭代:从早期的 GLM-130B 到后来的 GLM-4 系列,再到如今的 GLM-5.2,模型在架构、训练数据质量、对齐技术方面持续进化。GLM-5.2 采用了改进的混合专家(MoE)架构,在推理效率上相比前代有显著提升,能够在更低的计算成本下达到顶级性能。
开源生态:中国 AI 力量的崛起
GLM-5.2 的登顶标志着中国 AI 实验室在开源大模型领域的全面崛起。从 DeepSeek 到 Qwen 再到 GLM,中国团队在短短 12 个月内多次刷新开源模型性能上限。GLM-5.2 采用开放权重策略,允许研究者和开发者自由使用、微调和部署,这对全球 AI 民主化进程具有重要意义。
社区反响
HN 讨论中,开发者普遍对 GLM-5.2 的表现感到惊喜。有人指出 GLM 系列在中文处理上一直表现优异,但这次在英文和多语言评测中的成绩证明了其跨语言泛化能力。也有讨论聚焦于「开放权重」与「真正开源」的区别——GLM-5.2 的权重开放但训练数据和代码并未完全公开,这引发了关于开源定义的新一轮辩论。
部分用户将 GLM-5.2 与同期的 DeepSeek-V3、Qwen-3 进行了横向对比,认为这些模型之间的竞争正在以指数速度推进开源 AI 的前沿。有评论指出:「每次我们认为差距在缩小,就有人把标杆又抬高了一截。」
📎 原文链接:artificialanalysis.ai
💬 HN 讨论:news.ycombinator.com