本地跑大模型,1k 到 10w 五套配置:钱花在显存上才有意义
本地部署大模型,最贵的不是显卡,是买错显卡。
1k 到 10w,跨度一百倍,真正决定你能跑什么模型的只有一个数:显存。
01 只有一件事重要:显存
先说结论:买主机跑大模型,CPU、内存、电源、机箱全都可以妥协,显存不行。
原因是物理的,不是玄学。模型跑起来要先把权重从硬盘加载到显存里,加载完才能开始推理。权重装不下,后面的算力再强也是零——卡会直接报 OOM(out of memory),或者把权重切成一半留在显存、一半留在内存,然后推理速度掉到个位数的 token/s,你等一个回答要等一分钟。
显存决定你能跑多大的模型。其余配件决定的是:你跑得爽不爽。
算显存只需要一个公式:
所需显存 (GB) = 模型参数量 (B) × 每参数字节数
量化位决定每参数字节数:Q8 是 1 字节,Q4 是 0.5 字节,Q3 是 0.375 字节,Q2 是 0.25 字节。
几个常用数字:
| 模型规模 | Q8 权重 | Q4 权重 | 实际需要的显存(含 KV Cache) |
|---|---|---|---|
| 7B | 7 GB | 3.5 GB | 6–8 GB |
| 14B | 14 GB | 7 GB | 10–12 GB |
| 32B | 32 GB | 16 GB | 20–24 GB |
| 70B | 70 GB | 35 GB | 40–48 GB |
| 122B | 122 GB | 61 GB | 70–80 GB |
最后一列才是你真正要看的。Q4 权重 16GB 不等于 16GB 显存够用——KV Cache 会随上下文长度线性增长,8K 上下文的 32B 模型,KV Cache 就要吃掉 4–6 GB。
把权重算出来乘以 1.3,才是安全显存线。
这条线一画,市面上大部分显卡就被划掉了。
02 五套配置(2026 年 9 月行情)
价格来自 2026 年 9 月中旬市场行情,不是官方定价。显卡这轮涨价从 2026 年 1 月索泰开始,9 月华硕、技嘉再次上调(5070 系列 +150~300 元,5060 Ti 16G +200 元,5080 +500 元),存储芯片紧缺是主因,短期看不到回落。
配置①|3,000 元档:RTX 3060 12G
| 部件 | 规格 | 参考价 |
|---|---|---|
| 显卡 | RTX 3060 12G | 2,050–2,800 元(全新,二手约 1,900) |
| CPU | Ryzen 5 5600 / i5-12400 | 500–600 元 |
| 内存 | 32 GB DDR4 3200 | 300 元 |
| 硬盘 | 1 TB NVMe | 350 元 |
| 电源+机箱+主板 | 750W 全模组 / B550 / ATX | 800 元 |
能跑什么:7B 模型 Q4/Q8 舒适,14B 模型 Q3/Q2 勉强。32B 以上跑不动。
适合谁:只想在本地跑 7B 级小模型做实验、跑 Embedding、做 RAG 检索验证的人。这是唯一能真正买得起入门门槛的配置。
别期待什么:跑 14B 模型 Q4 需要把 KV Cache 压到 2K 以内,上下文长了就 OOM。这是 12GB 显存的物理天花板,不是调参能解决的。
配置②|5,000 元档:RTX 5060 Ti 16G
| 部件 | 规格 | 参考价 |
|---|---|---|
| 显卡 | RTX 5060 Ti 16G | 约 5,000 元(8G 版 3,400 元,16G 版才是这档) |
| CPU | Ryzen 7 7500F | 969 元 |
| 内存 | 32 GB DDR5 6000 | 600 元 |
| 硬盘 | 2 TB NVMe | 700 元 |
| 电源+机箱+主板 | 850W / B650 / ATX | 1,000 元 |
能跑什么:14B 模型 Q4/Q8 舒适,32B 模型 Q3 勉强(KV Cache 压到 2K)。
适合谁:预算紧但必须跑 14B 级模型的人。
这档的坑:5060 Ti 是 128-bit 位宽,16G 版本相当于”大仓库配小门”——显存够,带宽跟不上,高并发推理会露怯。跑游戏没事,跑 AI 长上下文会有明显延迟。另外 8G 版 3,400 元、16G 版 5,000 元,差价 1,600 元买的就是 8 颗显存颗粒,别买错版本。
配置③|12,000–15,000 元档:RTX 5070 Ti 16G
| 部件 | 规格 | 参考价 |
|---|---|---|
| 显卡 | RTX 5070 Ti 16G | 9,599 元(低价约 8,950) |
| CPU | Ryzen 7 7700 / i7-13700 | 1,600 元 |
| 内存 | 64 GB DDR5 6000 | 1,200 元 |
| 硬盘 | 2 TB NVMe | 700 元 |
| 电源+机箱+主板 | 1000W 全模组 / X670 / ATX | 1,500 元 |
能跑什么:14B 模型 Q8 舒适,32B 模型 Q4 舒适,70B 模型跑不动。
适合谁:主力跑 14B–32B 模型的人,比如做代码补全、长文改写、本地知识库问答。
这档的问题:16GB 显存卡着 70B 这道线,这是本档位最尴尬的地方——预算能到 1.2 万,模型上限只有 32B。往上再加 5000 元能上 24G,跨过去就是 70B,不加就只能停在 32B。
配置④|25,000–30,000 元档:二手 RTX 3090 24G
| 部件 | 规格 | 参考价 |
|---|---|---|
| 显卡 | RTX 3090 24G(二手) | 4,300–7,500 元(波动大,看渠道) |
| CPU | Ryzen 7 7700X / i7-13700K | 1,800 元 |
| 内存 | 64 GB DDR5 6000 | 1,200 元 |
| 硬盘 | 2 TB NVMe | 700 元 |
| 电源+机箱+主板 | 1200W 全模组 / X670E / ATX | 1,800 元 |
| 其余(显示器、外设、系统安装) | — | 3,000–6,000 元 |
能跑什么:32B 模型 Q4/Q8 舒适,70B 模型 Q3/Q2 勉强(KV Cache 压 2K)。
适合谁:预算够、追求单卡显存最大化、能接受二手风险的人。这是 2.5 万档里唯一能碰 70B 的配置。
二手 3090 的三个坑:
1. 2024 年以前的卡基本都经历过矿潮,看 SN 码出厂日期,螺丝孔位有磨损痕迹的别碰
2. 低价卡背后是矿卡翻新和显存老化,拆开看散热鳍片里有没有灰
3. 价格波动大(2026 年 3 月 6,500–7,500 元,5 月跌破 6,000 元,8 月 4,300–5,700 元),下手前查当月行情
配置⑤|80,000–100,000 元档:双卡 RTX 4090 24G×2
| 部件 | 规格 | 参考价 |
|---|---|---|
| 显卡 | RTX 4090 24G × 2(二手) | 约 60,000–70,000 元(二手,全新买不到) |
| CPU | Ryzen 9 7950X / i9-14900K | 3,000 元 |
| 内存 | 128 GB DDR5 6400 | 3,000 元 |
| 硬盘 | 4 TB NVMe × 2 | 2,000 元 |
| 电源+机箱+主板 | 1600W 全模组 / Threadripper 平台 / E-ATX | 15,000–25,000 元 |
能跑什么:70B 模型 Q4 舒适(35GB 权重 + KV Cache),122B 模型 Q2 勉强。
适合谁:必须本地跑 70B 级模型、需要 7×24 小时服务的人。
这档的现实:全新 4090 在国内基本买不到(渠道名存实亡,需要”套提”——买卡必须搭配主板或电源一起拿货,实际到手成本比标价高)。二手 4090 价格区间大,波动比 3090 更剧烈。另外双卡需要双路 CPU 平台(Threadripper / 至强),主板和电源的预算会吃掉 2 万以上。
03 三个不该花的钱
第一,CPU 多核。 大模型推理是 GPU 的活,CPU 只负责喂数据和预处理。从 6 核到 16 核,推理速度差异在 1% 以内。3000 元的 CPU 和 300 元的 CPU 跑同一个模型,你测不出区别。
第二,内存超配。 32GB 内存够装下 70B 模型的权重做 CPU 卸载兜底,64GB 是舒服线。再往上加内存,只在模型权重比显存还大、需要做 CPU offload 时才有意义——那种场景下你已经在跑 100B+ 模型了,那根本不是消费级主机的活。
第三,机箱散热。 显卡满载功耗高,风道要做好,但机箱本身不是瓶颈。1000 元的机箱和 300 元的机箱,显卡温度差 3–5℃,对推理速度影响可忽略。把钱省下来加显存。
省下来的钱去哪了?加显存。 每多 8GB 显存,模型上限往上跨一档(12G→16G→24G→32G),这是唯一能改变你能跑什么模型的花费。
04 总结:按需求对号入座
| 你的需求 | 推荐配置 | 预算 |
|---|---|---|
| 只想本地跑 7B 级小模型试试水 | ① RTX 3060 12G | 3,000 元 |
| 主力跑 14B,预算紧 | ② RTX 5060 Ti 16G | 5,000 元 |
| 主力跑 14B–32B,做生产用 | ③ RTX 5070 Ti 16G | 12,000 元 |
| 必须碰 70B,能接受二手风险 | ④ 二手 RTX 3090 24G | 25,000–30,000 元 |
| 必须本地跑 70B,7×24 服务 | ⑤ 双卡 RTX 4090 24G×2 | 80,000–100,000 元 |
三句话收口:
显存决定模型上限,带宽决定推理速度,其余全是配套。
这轮显卡涨价不是偶然,是存储芯片紧缺推动的结构性变化——2026 年 1 月索泰涨价 15% 开始,9 月华硕技嘉再次上调,短期看不到回落。现在买,是买一个”还会继续涨”的价格。
1k 到 10w 的跨度里,只有配置④和⑤值得认真考虑。 ①②③是玩票,④是性价比拐点,⑤是唯一能长期跑 70B 的方案。中间那 5 万块,花不出新的模型能力。

峰网博客
评论前必须登录!
注册