
7900XTX + Qwen3.8 27B Q5_K_M + DeepSeek Harness,实测让模型从零写一个完整的 2D 打飞机游戏(单 HTML 文件,Canvas + 原生 JS)——平均 89 t/s,5409 个 token 的代码一气呵成。
配置
| 项目 | 规格 |
|---|---|
| CPU | AMD Ryzen 5 5600 |
| RAM | 32GB DDR4 3200 |
| GPU | 7900XTX |
| 系统 | Ubuntu 26.04 |
| 软件 | llama.cpp + Vulkan(v9737) |
| 模型 | Qwen3.8 27B Q5_K_M |
测试任务
一条 prompt 让模型创建完整的 2D 太空射击街机游戏:
- 800x600 Canvas 居中,复古街机 UI(分数 + 生命)
- 玩家飞船底部居中,方向键/A-D 移动,限制在画布内
- 空格发射激光,带冷却
- 随机外星人/小行星从顶部下坠
- 精确碰撞检测(子弹打敌、敌碰玩家/底边扣命)
- requestAnimationFrame 游戏循环、Game Over 界面、Restart 按钮
实测
I slot print_timing: n_decoded = 5409, tg = 89.47 t/s, tg_3s = 71.71 t/s5409 个 token 的代码,平均 89 t/s 输出,3 秒窗口内 71.7 t/s。整个游戏文件一次性生成完毕,代码干净、注释完整、可运行。
为什么 Q5_K_M 值得注意
Q5_K_M 比 IQ4_XS 占显存多,但精度更高——在 24G 显存的 7900XTX 上,27B 的 Q5_K_M 放得下,且精度收益在代码生成这种"长输出生成"场景下比 4bit 明显。代码类任务对 token 级精度敏感(一个括号写错整个文件废了),5bit 的容错更好。
适合谁
- 有 24G+ 显存的 NVIDIA/AMD 卡
- 想让本地模型做"从零写完整项目"的 coding agent
- 想验证"本地模型能不能一次出完整可运行代码"的人