Kimi-K3是一款面向复杂推理与长上下文任务的 MoE 模型。本次测试使用 单机8×NVIDIA B300,通过 GPUStack 分别接入 vLLM 与 SGLang,并启用 Kimi-K3-DSpark 草稿模型进行投机解码。先给出最值得关注的结论:(1)64K 输入、10路并发:vLLM 端到端耗时100.5秒,SGLang 为150.8秒,vLL
......
本文由站长之家用户投稿发布于站长之家平台,本平台仅提供信息索引服务。为了保证文章信息的及时性,内容观点的准确性,平台将不提供完全的内容展现,本页面内容仅为平台搜索索引使用。需阅读完整内容的用户,请查看原文,获取内容详情。