测算引擎在线
INFERENCE CAPACITY / 2026
让每一张卡,
落在正确的负载上。
从现有硬件、目标并发或 Token 产量出发,快速形成可解释、可交付的推理算力规划。
3种规划口径8类业务场景
LIVE ESTIMATE
并发容量估算
可支撑并发路数
276路NVIDIA H100 SXM 80GB × 8 张REAL-TIME
ESTIMATE
ESTIMATE
CAPACITY LIMITS
4K context · 30 token/s容量上限对照
先处理「解码吞吐」
增加卡数、提高连续批处理效率,或降低单路速度目标。
简单问答 · 业务提醒
优先保障单路输出速度;小模型和高批处理效率通常更划算。
查看测算口径与中间值 +
模型权重 ≈ 8B × 0.5 Byte = 4 GB
KV Cache / token ≈ 147 KB;KV Cache / 路 ≈ 0.2 GB
实例拓扑 = TP1 × 8 副本;集群可用吞吐 ≈ 8,303 token/s
已计入 20% 容量冗余与 84% 引擎效率。