SGLang Qwen2.5-1.5B RTX 4070 基准测试 | AI生成和翻译

首页 2026.07

SGLang 基准测试 — Qwen2.5-1.5B-Instruct 在 RTX 4070 上运行

主题 TTFT(ms) Total(ms) Tokens Tok/s 质量 ──────────────────────────────────────────────────────────────── 数学 8453 9175 100 10.9 正常(截断) 编程 17 2196 300 136.6 包含函数 推理 17 497 66 132.8 正确 创意 17 125 15 119.6 俳句尚可 事实 17 716 96 134.1 覆盖两方面 翻译 17 147 18 122.2 正确(法文) 总结 17 373 49 131.3 正常

主要发现:

  1. TTFT(首 Token 延迟):
    • 首次请求:8.5 秒 — 冷启动(CUDA 图捕获、KV 缓存分配)。仅发生一次。
    • 预热后:约 17ms — 基本即时。SGLang 的基数树 KV 缓存生效。
  2. 吞吐量: 预热后生成速度 约 120-137 tok/s。对于 1.5B 模型在 RTX 4070 上,这表现尚可 — 瓶颈在于小模型本身,而非框架。

  3. 质量评估(1.5B 模型):
    • 数学:正确分解 17×23,但在完成前达到 100 token 限制(答案应为 391)
    • 编程:生成带有文档字符串的真实函数,使用动态规划方法
    • 推理:得出正确答案(9 只羊),步骤正确清晰
    • 创意:不错的俳句 — “数据如河流 / 模型从模式中学习 / 智慧绽放”
    • 事实:准确列出 TCP 与 UDP 的要点,术语正确
    • 翻译:完美的法语 — “Le renard brun rapide saute par-dessus le chien paresseux”
    • 总结:对相对论的 ELI5 解释,扎实到位
  4. SGLang 的真正价值 不在于单用户延迟 — 而在于并发吞吐量。1 个用户时约 130 tok/s;10 个并发用户时,SGLang 的连续批处理能保持高吞吐,而普通服务器则会卡顿。此外,换用 Qwen2.5-7B 可获得明显更好的质量(约占用 8 GB 显存,您的 12 GB 显卡仍可容纳)。

需要我用更大的模型测试,或者将其设置为 OpenAI 兼容端点供您的 Mac 访问(例如,让 ww LLM 命令指向它)吗?


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助