请叫我峰子:
感受VPS建站的乐趣。

本地跑大模型,1k 到 10w 五套配置:钱花在显存上才有意义

本文于 2026-09-18 13:22 更新,部分内容具有时效性,如有失效,请留言

本地跑大模型,1k 到 10w 五套配置:钱花在显存上才有意义

本地部署大模型,最贵的不是显卡,是买错显卡。
1k 到 10w,跨度一百倍,真正决定你能跑什么模型的只有一个数:显存。


01 只有一件事重要:显存

先说结论:买主机跑大模型,CPU、内存、电源、机箱全都可以妥协,显存不行。

原因是物理的,不是玄学。模型跑起来要先把权重从硬盘加载到显存里,加载完才能开始推理。权重装不下,后面的算力再强也是零——卡会直接报 OOM(out of memory),或者把权重切成一半留在显存、一半留在内存,然后推理速度掉到个位数的 token/s,你等一个回答要等一分钟。

显存决定你能跑多大的模型。其余配件决定的是:你跑得爽不爽。

算显存只需要一个公式:

所需显存 (GB) = 模型参数量 (B) × 每参数字节数

量化位决定每参数字节数:Q8 是 1 字节,Q4 是 0.5 字节,Q3 是 0.375 字节,Q2 是 0.25 字节。

几个常用数字:

模型规模 Q8 权重 Q4 权重 实际需要的显存(含 KV Cache)
7B 7 GB 3.5 GB 6–8 GB
14B 14 GB 7 GB 10–12 GB
32B 32 GB 16 GB 20–24 GB
70B 70 GB 35 GB 40–48 GB
122B 122 GB 61 GB 70–80 GB

最后一列才是你真正要看的。Q4 权重 16GB 不等于 16GB 显存够用——KV Cache 会随上下文长度线性增长,8K 上下文的 32B 模型,KV Cache 就要吃掉 4–6 GB。

把权重算出来乘以 1.3,才是安全显存线。

这条线一画,市面上大部分显卡就被划掉了。


02 五套配置(2026 年 9 月行情)

价格来自 2026 年 9 月中旬市场行情,不是官方定价。显卡这轮涨价从 2026 年 1 月索泰开始,9 月华硕、技嘉再次上调(5070 系列 +150~300 元,5060 Ti 16G +200 元,5080 +500 元),存储芯片紧缺是主因,短期看不到回落。

配置①|3,000 元档:RTX 3060 12G

部件 规格 参考价
显卡 RTX 3060 12G 2,050–2,800 元(全新,二手约 1,900)
CPU Ryzen 5 5600 / i5-12400 500–600 元
内存 32 GB DDR4 3200 300 元
硬盘 1 TB NVMe 350 元
电源+机箱+主板 750W 全模组 / B550 / ATX 800 元

能跑什么:7B 模型 Q4/Q8 舒适,14B 模型 Q3/Q2 勉强。32B 以上跑不动。

适合谁:只想在本地跑 7B 级小模型做实验、跑 Embedding、做 RAG 检索验证的人。这是唯一能真正买得起入门门槛的配置。

别期待什么:跑 14B 模型 Q4 需要把 KV Cache 压到 2K 以内,上下文长了就 OOM。这是 12GB 显存的物理天花板,不是调参能解决的。

配置②|5,000 元档:RTX 5060 Ti 16G

部件 规格 参考价
显卡 RTX 5060 Ti 16G 约 5,000 元(8G 版 3,400 元,16G 版才是这档
CPU Ryzen 7 7500F 969 元
内存 32 GB DDR5 6000 600 元
硬盘 2 TB NVMe 700 元
电源+机箱+主板 850W / B650 / ATX 1,000 元

能跑什么:14B 模型 Q4/Q8 舒适,32B 模型 Q3 勉强(KV Cache 压到 2K)。

适合谁:预算紧但必须跑 14B 级模型的人。

这档的坑:5060 Ti 是 128-bit 位宽,16G 版本相当于”大仓库配小门”——显存够,带宽跟不上,高并发推理会露怯。跑游戏没事,跑 AI 长上下文会有明显延迟。另外 8G 版 3,400 元、16G 版 5,000 元,差价 1,600 元买的就是 8 颗显存颗粒,别买错版本。

配置③|12,000–15,000 元档:RTX 5070 Ti 16G

部件 规格 参考价
显卡 RTX 5070 Ti 16G 9,599 元(低价约 8,950)
CPU Ryzen 7 7700 / i7-13700 1,600 元
内存 64 GB DDR5 6000 1,200 元
硬盘 2 TB NVMe 700 元
电源+机箱+主板 1000W 全模组 / X670 / ATX 1,500 元

能跑什么:14B 模型 Q8 舒适,32B 模型 Q4 舒适,70B 模型跑不动。

适合谁:主力跑 14B–32B 模型的人,比如做代码补全、长文改写、本地知识库问答。

这档的问题:16GB 显存卡着 70B 这道线,这是本档位最尴尬的地方——预算能到 1.2 万,模型上限只有 32B。往上再加 5000 元能上 24G,跨过去就是 70B,不加就只能停在 32B。

配置④|25,000–30,000 元档:二手 RTX 3090 24G

部件 规格 参考价
显卡 RTX 3090 24G(二手) 4,300–7,500 元(波动大,看渠道)
CPU Ryzen 7 7700X / i7-13700K 1,800 元
内存 64 GB DDR5 6000 1,200 元
硬盘 2 TB NVMe 700 元
电源+机箱+主板 1200W 全模组 / X670E / ATX 1,800 元
其余(显示器、外设、系统安装) 3,000–6,000 元

能跑什么:32B 模型 Q4/Q8 舒适,70B 模型 Q3/Q2 勉强(KV Cache 压 2K)。

适合谁:预算够、追求单卡显存最大化、能接受二手风险的人。这是 2.5 万档里唯一能碰 70B 的配置

二手 3090 的三个坑
1. 2024 年以前的卡基本都经历过矿潮,看 SN 码出厂日期,螺丝孔位有磨损痕迹的别碰
2. 低价卡背后是矿卡翻新和显存老化,拆开看散热鳍片里有没有灰
3. 价格波动大(2026 年 3 月 6,500–7,500 元,5 月跌破 6,000 元,8 月 4,300–5,700 元),下手前查当月行情

配置⑤|80,000–100,000 元档:双卡 RTX 4090 24G×2

部件 规格 参考价
显卡 RTX 4090 24G × 2(二手) 约 60,000–70,000 元(二手,全新买不到)
CPU Ryzen 9 7950X / i9-14900K 3,000 元
内存 128 GB DDR5 6400 3,000 元
硬盘 4 TB NVMe × 2 2,000 元
电源+机箱+主板 1600W 全模组 / Threadripper 平台 / E-ATX 15,000–25,000 元

能跑什么:70B 模型 Q4 舒适(35GB 权重 + KV Cache),122B 模型 Q2 勉强。

适合谁:必须本地跑 70B 级模型、需要 7×24 小时服务的人。

这档的现实:全新 4090 在国内基本买不到(渠道名存实亡,需要”套提”——买卡必须搭配主板或电源一起拿货,实际到手成本比标价高)。二手 4090 价格区间大,波动比 3090 更剧烈。另外双卡需要双路 CPU 平台(Threadripper / 至强),主板和电源的预算会吃掉 2 万以上。


03 三个不该花的钱

第一,CPU 多核。 大模型推理是 GPU 的活,CPU 只负责喂数据和预处理。从 6 核到 16 核,推理速度差异在 1% 以内。3000 元的 CPU 和 300 元的 CPU 跑同一个模型,你测不出区别

第二,内存超配。 32GB 内存够装下 70B 模型的权重做 CPU 卸载兜底,64GB 是舒服线。再往上加内存,只在模型权重比显存还大、需要做 CPU offload 时才有意义——那种场景下你已经在跑 100B+ 模型了,那根本不是消费级主机的活。

第三,机箱散热。 显卡满载功耗高,风道要做好,但机箱本身不是瓶颈。1000 元的机箱和 300 元的机箱,显卡温度差 3–5℃,对推理速度影响可忽略。把钱省下来加显存。

省下来的钱去哪了?加显存。 每多 8GB 显存,模型上限往上跨一档(12G→16G→24G→32G),这是唯一能改变你能跑什么模型的花费。


04 总结:按需求对号入座

你的需求 推荐配置 预算
只想本地跑 7B 级小模型试试水 ① RTX 3060 12G 3,000 元
主力跑 14B,预算紧 ② RTX 5060 Ti 16G 5,000 元
主力跑 14B–32B,做生产用 ③ RTX 5070 Ti 16G 12,000 元
必须碰 70B,能接受二手风险 ④ 二手 RTX 3090 24G 25,000–30,000 元
必须本地跑 70B,7×24 服务 ⑤ 双卡 RTX 4090 24G×2 80,000–100,000 元

三句话收口

显存决定模型上限,带宽决定推理速度,其余全是配套。

这轮显卡涨价不是偶然,是存储芯片紧缺推动的结构性变化——2026 年 1 月索泰涨价 15% 开始,9 月华硕技嘉再次上调,短期看不到回落。现在买,是买一个”还会继续涨”的价格。

1k 到 10w 的跨度里,只有配置④和⑤值得认真考虑。 ①②③是玩票,④是性价比拐点,⑤是唯一能长期跑 70B 的方案。中间那 5 万块,花不出新的模型能力。

赞(0)
转载请注明:峰网博客 » 本地跑大模型,1k 到 10w 五套配置:钱花在显存上才有意义

评论 抢沙发

评论前必须登录!

 

登录

找回密码

注册