本地跑SOTA大模型实操

4xRTX PRO 6000+EPYC搭384GB推理机,BIOS到PCIe调优

背景:为什么要自己跑大模型?

Jamesob 在 GitHub 上公开了一份详尽指南,记录了他花 $40,000 搭建本地推理机的全过程。他的动机很直接:”如果 Dario 和 Altman 让你心里发慌(他们应该让你发慌),请继续读下去。”

随着云端 AI 服务日益集中,数据隐私、服务可用性和长期成本成为开发者的核心关切。这份指南为那些”不想把数据交给别人的服务器”的人提供了一条可复现的技术路线。

核心方案:钱花在刀刃上

Jamesob 的机器核心配置是 4 块 NVIDIA RTX PRO 6000 Blackwell 工作站显卡,每块 96GB 显存,合计 384GB VRAM。这个配置可以运行 GLM-5.2-594B(Int8 量化版),在 460K 上下文窗口下达到约 80 tokens/s 的推理速度。

关键策略是”重显存、轻平台”:主板和 CPU 选用了上一代 EPYC Milan + DDR4 方案(eBay 采购,$5,587),把钱集中花在 GPU 上(约 $46,000)。作者特别指出:”到 2026 年 7 月,PCIe 5 / DDR5 基础平台依然贵得离谱,所以我选择在 VRAM 上花钱。”

技术深潜:PCIe 交换机与 BIOS 调优

这份指南最有价值的部分是对 PCIe 交换机的实战调优。作者使用了 c-payne 的 Microchip Switchtec PM40100 Gen4 交换机(约 $1,330),让 4 块 GPU 之间实现 P2P 直连通信(而非通过 CPU 中转),这对张量并行的 allreduce 操作至关重要。

调优过程充满坑点:BIOS 中必须关闭 bifurcation(否则上游链路只训练到 x8)、关闭 ASPM(否则空闲链路掉到 Gen1)、关闭 IOMMU(否则 NCCL 在多 GPU P2P 时挂死)、通过 setpci 禁用 ACS(否则 P2P 流量绕回 CPU)。最终结果:单向 27.5 GB/s,双向 50.4 GB/s,延迟 0.37-0.45 µs——达到 Gen4 线速。

GPU 功耗管理也是一大亮点:作者用 nvidia-smi 将每块卡限制在 350W(默认 600W),让整机能在 110V 电路上运行,避免了加装 220V 专线的麻烦。

预算分级:从 $2K 到 $40K

指南贴心地提供了不同预算的方案:入门级 $2,000 左右(2× RTX 3090,48GB VRAM)可以跑 Qwen3.6-27B 和本地语音转文字(whisper-large-v3);顶配 $40,000 则可达到接近 Claude Opus 级别的模型能力。

他还分享了 Docker 化的模型服务方案(runners/ 目录),每个模型一个 docker-compose,权重文件通过挂载只读共享,通过 opencode 客户端远程调用。并搭建了完整的工具链:Camofox/Kagi 网页搜索、Telegram 通知、Gitea 代码协作,全部在沙箱 VM 中运行。

社区反响:硬件民主化进行时

HN 讨论中,有用户提醒”本地 LLM 是个坑”——很多人为此花了远超预算的钱。但也有用户指出 128GB 统一内存架构(如 DGX Spark 集群)提供了中间路线。社区还分享了 rtx6kpro 仓库和 Discord 群组,形成了一个活跃的本地推理硬件社区。

最高赞评论坦言:”我在本地 LLM 上花了很多时间,在硬件上也花了不该花的钱。但我有一个本地群组,里面的人花的更多。”——这或许就是本地推理圈的真实写照。

原文链接:GitHub · HN 讨论 (256 分)

Leave a Reply

Your email address will not be published. Required fields are marked *