AI TOOL DIRECTORY · CURATED FOR REAL WORK

找到趁手的 AI

从日常问答到创意生产,按场景整理实用的 AI 工具,帮你快速选对。

37
精选工具
13
场景分类
56
技术文章

TOP TOOLS

热门工具榜

从最近更新的精选工具中,快速锁定值得关注的新选择。

C 榜首 · AI 音频ChatterboxMIT 开源 TTS SoTA · 5 秒零样本克隆 · 情绪强度可控 · Turbo 350M 消费卡可跑

INSIGHTS

技术文章

全部文章
部署教程

12GB 显卡跑 125B 大模型:真实速度 9-40 tok/s,hugepages 和 PCIe 校准两个坑一次讲完

Strata 把 125B 的门槛定在 12GB 起步:3500 Ada 12GB 实测 decode 9-10 tok/s 是'能用级',但加内存、跑 calibrate、配 hugepages 三步做完速度明显提升。两个坑:nr_hugepages 给小了系统静默退化成 4K 页不报错,PCIe 启动探测读数漂移 3 倍必须手动校准。附 12GB 完整配置和选型建议。

12GB16GB24GB32GB8GB
阅读完整指南
01RTX 5090 拉满 Strata 125B:decode 149 tok/s、prefill 6004 tok/s 与 1M 上下文的完整配置5090 32GB 是 Strata 的完全体:decode 125-149 tok/s、prefill 6004 tok/s、MTP 接受率 76%、1M 上下文 YaRN 能跑。三个加速开关:prefill auto:32768 让 prefill 快 21-35%、conversation-cache 让追问快 10-20 倍、kv-resident 追问免重算。附跨版本 stager 回归坑和 200K+ prefill 阻塞调度的注意事项。028GB 和 11GB 老显卡跑 125B:5500 XT 15 tok/s,2080 Ti 跑满 262K 完整窗口2019 年的 RX 5500 XT 8GB 能到 15-17 tok/s,Tesla P4 8GB 22 tok/s,RTX 2080 Ti 11GB 更狠——显存压满 10.5G 靠 KV streaming 跑满 262,144 token 完整窗口,decode 34 tok/s,250K 深度追问 3.56 秒出结果。三组小显存锚点数据 + MTP 在老卡上开还是关的完整判断标准。03Strata 双卡 layer split 让 125B decode 翻倍:16+16 显存实测 54-61 tok/s,NVLink 没用,第三张卡是负优化Strata 双卡的价值不是算力叠加而是容量叠加:两张 16GB 卡的专家缓存合计覆盖 98% 路由专家,把 GPU+CPU 混跑变成纯 GPU 跑。同 45W 功耗限制下 decode 从 30-37 提到 54-61 tok/s 接近翻倍。附完整配置和三个反直觉结论:NVLink 零收益、第三张卡拖慢长 prompt、low-RAM 与 layer split 互斥需手编 json。04R9700 单卡跑 Qwen3.8-27B MXFP4:prefill 3300 tok/s 的完整配置与 4 个坑RDNA4 没有原生 MXFP4 运算单元,原生 ROCm vLLM 会退回 BF16 模拟反量化慢 3-5 倍。4 组 R9700 单卡实测:vllm-radiance 原生 kernel 下 prefill 2300-3300 tok/s、decode 峰值 161 tok/s、8 并发聚合 152。附三套方案(打包镜像/裸配/NVFP4)完整启动参数和显存、并发、ROCm 版本四个坑。

FEATURED SCENES

全部 13 个场景

NEW ARRIVALS

最新收录

全部 37 个工具

COMMUNITY CURATED

找到好用的 AI 工具?

分享给所有人,让军火库更趁手。提交工具