设定目标输出 Token 与生成速度,直观感受「每秒吐字」的真实节奏;也可以直连本机 Ollama / vLLM / LM Studio,实测你的模型实际速度。
http://127.0.0.1:11434/v1 · vLLM: http://127.0.0.1:8000/v1 · LM Studio: http://127.0.0.1:1234/v1--api-server-cors;llama.cpp 的 server 默认放开。速度统计口径:生成耗时 = 收到首个 token 之后的时间,tok/s = 完成 token 数 ÷ 生成耗时(首 token 延迟单独显示,代表预填充速度)。举报此页面滥用
帮助我们维护平台安全