【Qwen3.8-Flash-Next 端侧部署】04-运行时优化 MTP、CUDA Graph 与 Chunked Prefill
上一篇讲述了如何通过量化操作减少模型对于显存/内存的需求,这是模型能够在有限显存/内存环境启动的基础条件。 真正开始处理请求后,vLLM 还要决定每轮执行多少 token、同时调度多少序列、哪些形状使用 CUDA Graph,以及长 prompt 以多大的 chunk 进入模型。 这些配置相互影响。MTP 增加一次 decode 中验证的 token 数,CUDA Graph 必须覆盖相应的 ba