在AI代码安全领域, 一场静悄悄的革命正在发生。Semgrep团队近日公布了他们对多款主流AI模型在网络安全基准测试中的评测结果, 结果显示国产开源模型GLM 5.2在多项指标上全面超越Claude, 成为目前表现最佳的开源代码安全模型。
评测背景: Mythos的威胁与Semgrep的应对
Semgrep是知名的代码安全平台, 服务于金融科技、SaaS等行业的数千家企业。随着AI代码生成工具的普及, AI生成代码中的安全漏洞成为新的攻击面。Semgrep今年在RSA大会上发布了Multimodal多模态分析引擎, 将传统规则检测与AI推理相结合。
此次评测的动机直接源于对”Mythos”这一新兴威胁的担忧——攻击者正在利用AI工具加速漏洞挖掘, 防御方需要同等级别的AI能力才能保持平衡。
核心发现: 开源模型的崛起
Semgrep团队使用内部网络安全基准对多个模型进行了系统评测, 包括代码漏洞发现能力、误报率控制、复杂上下文理解等维度。GLM 5.2在综合评分中超越了Claude系列, 成为开源阵营中表现最优的模型。
值得关注的是, 这并非GLM首次在专业评测中崭露头角。在更早的安全漏洞猎手基准测试中, DeepSeek V4 Pro和MiMo 2.5 Pro也曾表现出色, 但GLM 5.2在Semgrep特定的网络安全场景中拔得头筹。这表明不同模型在不同细分领域各有优势。
成本优势: 开源模型的实用价值
HN社区用户jackdawed分享了使用GLM 5.2的实际体验: 通过Neuralwatt平台调用, 一个月消耗了3.74亿tokens, 总花费仅18美元。另一位资深开发者pimeys表示, 在使用GPT的典型编程session中, 单次费用就可能超过100美元, 而GLM 5.2提供了相近的质量却几乎零成本。
这种极致的性价比正在改变开发者的工具选择——如果开源模型能在安全扫描等专业领域达到商业模型的水平, 企业完全有理由从订阅制转向按量计费的开源模型。
社区反响
HN上的讨论集中在几个方向: 开源模型的快速进步是否正在威胁商业模型的护城河?不同模型在不同评测中的表现差异是否意味着我们需要”模型组合”策略?多位评论者提到了DeepSeek V4 Pro在代码审计中的优秀表现, 也有人认为模型评测本身存在局限性——真实生产环境中的表现才是最终检验标准。
社区普遍认为, GLM 5.2代表了开源AI在垂直专业领域的实质性突破, 而不仅仅是通用能力的提升。