怎么用
- 在左下「快速添加」选一个预设(或手动新增),填入 Base URL 与模型名。
- 选中端点后点「开始测速」,页面会流式显示输出并实时绘制速度曲线。
- 在「历史与对比」里查看趋势、对比多个端点的最新成绩。
主要指标
- TTFT:从发请求到收到第一个 token 的时间。
- 生成速度:(输出 token 数 − 1) ÷ (生成阶段耗时),单位 tokens/s。
- token 数优先取服务端 usage 字段,没有则按流式分片数量近似统计。
最常见的坑:跨域(CORS)
浏览器直连本机/内网服务时,需要目标服务允许跨域。失败时页面会给出原因,常见解决办法:
- Ollama:设置环境变量
OLLAMA_ORIGINS=* 后重启服务。
- vLLM / LM Studio / llama.cpp server:启动时加
--allowed-origins *(LM Studio 在 Server 设置里开启 CORS)。
- 或者在本机跑一个带 CORS 头的反向代理,把 Base URL 指向代理端口。
数据与隐私
本站是纯前端应用:端点配置、API Key、全部测试记录只保存在你自己的浏览器(localStorage)里,不经过任何服务器,不做任何上传与同步。清除浏览器数据 = 数据消失;换浏览器/设备 = 数据不互通,这是隐私设计的代价。
「定时巡检」在页面关闭后即停止(浏览器机制决定)。需要 7×24 常驻监控的话,那必须由服务端代跑,数据就要上云——本站选择隐私优先,故不提供。
混合内容
如果本页通过 HTTPS 打开,浏览器会拦截对 HTTP 端点的请求。请把本页用 http / localhost 方式打开,或代理转发。