吐字速度体验器 · 自部署 LLM

设定目标输出 Token 与生成速度,直观感受「每秒吐字」的真实节奏;也可以直连本机 Ollama / vLLM / LM Studio,实测你的模型实际速度。

生成参数

选中预设可自动填入速度;不同量化/驱动/并发下实际值差异很大。

实时状态

就绪:点击「开始吐字」体验流式输出。
0.0s
已用时间
实际 tok/s(实时)
0 / 800
已生成 Token
预计剩余
0 字
已吐出字数
等效 字/分钟
0%目标:800 token

连接你的模型(OpenAI 兼容 /chat/completions 流式接口)

Ollama: http://127.0.0.1:11434/v1 · vLLM: http://127.0.0.1:8000/v1 · LM Studio: http://127.0.0.1:1234/v1
⚠️ 若浏览器报跨域(CORS)错误:Ollama 默认允许跨域可直接用;vLLM 启动时加 --api-server-cors;llama.cpp 的 server 默认放开。速度统计口径:生成耗时 = 收到首个 token 之后的时间,tok/s = 完成 token 数 ÷ 生成耗时(首 token 延迟单独显示,代表预填充速度)。

实测状态

就绪:填写上方连接信息后点击「开始实测」。
首 Token 延迟
生成耗时
实测 tok/s
0
生成 Token 数
0 字符
输出字符
总耗时
max_tokens:800