【Qwen3.8-Flash-Next 端侧部署】05-DGX Spark 统一内存管理与推理执行流程
前几篇分别讨论了 PLE 卸载、NVFP4 权重量化、FP8 KV Cache,以及 MTP 和运行时配置。把这些优化组合起来之后,模型已经具备在单台 DGX Spark 上运行的条件。不过,能够加载权重,还没有回答另一个问题:当长 prompt、多个生成请求和同机进程一起运行时,剩余内存是否足够? 这个问题在统一内存机器上尤其具体。GPU 扩大 KV Cache,会压缩 CPU 和文件缓存可以使