L·CLLM 算力规划台CAPACITY PLANNING LAB
测算引擎在线

INFERENCE CAPACITY / 2026

让每一张卡,
落在正确的负载上。

从现有硬件、目标并发或 Token 产量出发,快速形成可解释、可交付的推理算力规划。

3种规划口径8类业务场景
LIVE ESTIMATE

并发容量估算

可支撑并发路数

276NVIDIA H100 SXM 80GB × 8
REAL-TIME
ESTIMATE
集群总生成吞吐8,303token / 秒
实例拓扑TP1 × 8张量并行 × 副本
主要瓶颈解码吞吐显存 3,072 路 · 吞吐 276 路
单路 KV Cache0.2GB / 路
CAPACITY LIMITS

容量上限对照

4K context · 30 token/s
PLANNING NOTE

先处理「解码吞吐

增加卡数、提高连续批处理效率,或降低单路速度目标。

简单问答 · 业务提醒

优先保障单路输出速度;小模型和高批处理效率通常更划算。

查看测算口径与中间值

模型权重 ≈ 8B × 0.5 Byte = 4 GB

KV Cache / token ≈ 147 KB;KV Cache / 路 ≈ 0.2 GB

实例拓扑 = TP1 × 8 副本;集群可用吞吐 ≈ 8,303 token/s

已计入 20% 容量冗余与 84% 引擎效率。