nano-vllm-voxcpm问题反馈

#398 · open · 1 comments

View on GitHub ↗

shylockasr

我们尝试用nano-vllm-voxcpm部署流式推理,对比原生流式推理,结果如下: 1)中间包nano-vllm-voxcpm推理速度【22ms】比原生推理【45ms】快一倍左右; 2)首包nano-vllm-voxcpm推理速度【189ms】比原生推理【147ms】慢一些; 请问有办法提高 nano-vllm-voxcpm 在流式推理时首包的生成速度吗?

Comments

a710128

暂时还没有,nano vllm 的首包响应时间目前还在优化中。