微信公众号·方方洛
关闭vllm教程-08-性能优化
AI评分 35深度16·结构·仅据标题摘要互动数据需从 wechatDownload 导出导入
按原顺序回放,省去逐 kernel 启动成本.vLLM 在启动时(ModelRunner.capture_model)对多种 batch size(几何级数,如 1,2,4,...,...
2026年9月15日·weread · sogou·当前显示 8 / 8 篇
Daily 09:00 Asia/Shanghai. sogou+weread main=6; supplemental weread token-cost=+2; total new today=8
8 / 8
微信公众号·方方洛
关闭互动数据需从 wechatDownload 导出导入
按原顺序回放,省去逐 kernel 启动成本.vLLM 在启动时(ModelRunner.capture_model)对多种 batch size(几何级数,如 1,2,4,...,...