实时推理指标 — 数据来自 nvidia-smi 与 vLLM / llama.cpp 的 /metrics

连接中
上次采集: — 网卡 ↓ — · ↑ —
模型服务 :8001
—
正在连接…
Prompt 吞吐
—tok/s
prompt tokens: —
Decode 吞吐
—tok/s
生成 tokens: —
请求延迟
—ms TTFT
等待首次采集…
KV 分层
—% CPU 缓存
CPU 层预留—
CPU 读 / 写—
前缀缓存命中—
命中 / 查询—
写入—
读取—
KV 显存占用—
GPU 总功耗
—W / —W
等待首次采集…
GPU 利用率(—)0%
DECODE 吞吐(tok/s)0
次级服务 — 实时—
推理过程抓取 — 实时 CoT (可选:流式 reasoning_content,需设置 THOUGHT_LOG) —
尚未抓取到推理流。 可选:用代理把每个请求的 reasoning_content 写入日志并设置 THOUGHT_LOG;每个并发流会在这里单独占一张卡。
网络 — —Σ — 本次会话 · 峰值 ↓ —
局域网 (被动采集:ARP + 连接表)—
—

模型清单 — 可加载模型 · 由 fleet-metrics /models 提供

正在加载清单…