# 二手 RTX 3080 20G 魔改卡跑 27B：30+ t/s 的千元级方案

> i5-5600 + 32G 内存 + 二手 3080 20G 魔改卡，跑 Qwen3.8-27B 稳定 30+ t/s、1200 t/s prefill，挂 DeepSeek Harness 当 coding agent。核心是 llama.cpp 按架构编译 + KV 量化，不是堆硬件。

![显卡与机箱全景](/assets/articles/lcz/rtx3080/hero.jpg)

> 一台 i5-5600 + 32GB 内存 + 二手 RTX 3080 20G 魔改卡的普通主机，跑 Qwen3.8-27B，decode 稳定 30+ t/s、prefill 1200 t/s，再挂上 DeepSeek Harness 当 coding agent——这就是本文的"作业"。

## 先说结论

**二手 3080 20G 魔改卡 + 普通主机，跑 27B 模型已经完全够用。** 关键不是堆硬件，而是三件事：

1. **llama.cpp 按显卡架构编译**（3080 是 A 系列，`CMAKE_CUDA_ARCHITECTURES=86`）
2. **KV cache 量化**（`-ctk q8_0 -ctv q4_0`，把 KV 缓存的显存占着砍掉一半）
3. **DeepSeek Harness 加持**（工具调用稳定，极少死循环）

## 配置与编译

| 部件 | 规格 |
| --- | --- |
| CPU | AMD Ryzen 5 5600 |
| 内存 | 32GB DDR4 3200 |
| 显卡 | RTX 3080 20G 魔改卡（A100 架构，86 架构号） |
| 系统 | Ubuntu 26.04 |
| llama.cpp | v9737，Vulkan 后端 |

```bash
git clone https://github.com/ggerganov/llama.cpp
cmake -B build -D GGML_CUDA=ON -D CMAKE_CUDA_ARCHITECTURES=86 \
      -D LLAMA_BUILD_SERVER=ON -D LLAMA_BUILD_ALL_EXAMPLES=OFF
cmake --build build --config Release --parallel 2
```

启动参数（Qwen3.8-27B IQ4_XS，160K 上下文）：

```bash
llama-server -m Qwen3.8-27B-thinkingcap-abliterated.IQ4_XS.gguf \
  -c 160768 -np 1 -ngl 99 -fa on \
  -b 4096 -ub 256 -t 18 -tb 18 \
  --temp 0.5 --top-p 0.9 \
  --cache-type-k q8_0 --cache-type-v q4_0
```

## 实测数据

| 场景 | 速度 |
| --- | --- |
| 初始状态 | 40+ t/s decode / 1200 t/s prefill |
| 接上 DeepSeek Harness | 35 t/s / 600 t/s（压缩上下文前） |
| 长会话后期 | 30 t/s 稳定 |

## 几个值得知道的小细节

- **KV 量化精度损失见仁见智**：Q8_0 的 K + Q4_0 的 V 组合，实际使用中工具调用失败率极低，DSH 对模型自身能力还有加成，能一定程度缓和 Qwen3.8 思考过长的问题
- **思考模式是双刃剑**：首字会变慢，但工具调用的精准度和回答质量明显更高，跑 agent 值得开
- **魔改卡就是省**：20G 显存的 3080 二手价格比 24G 3090 便宜一大截，跑 27B IQ4 量化绰绰有余

## 适合谁抄作业

手里有一张 20G+ 显存的 NVIDIA 卡、不想花大钱买 5090 的朋友。这套配置的核心价值是：**用一千块级别的卡，跑 160K 上下文的 27B 模型，挂 agent 写代码，完全流畅。**


---
来源：https://laobanclaw.top/articles/rtx3080-20g-27b-budget-setup/（AI 军火库）
