核心结论
官方宣布:llama.cpp 于北京时间 2026年8月31日06:54(上海,UTC 2026-08-30T22:54:26Z)发布 b10704 预发布,核心是在 CUDA 后端放宽 MoE 的 mm_ids_helper 快速路径限制,使此前回落至通用路径的专家数(如 n_expert_used=10)可走快速路径。官方在 RTX PRO 6000 上以 Qwen3.8-Flash-Next(512专家、10激活)、55k上下文测得提示处理从2334 t/s提升至2600 t/s,约11%提升,单token生成不受影响。该版本预编译包已同步更新。
变化细节
据发布说明与对应 PR 描述,原快速路径将 warp 通道按 token 分组,要求 warp 大小整除 n_expert_used,仅对 6 填充至 8 做硬编码例外,其余计数进入通用路径(逐 token 遍历并做 warp 归约)。本次改为按2的幂填充,已有分发保持原有填充不变,n_expert_used=10 因此进入快速路径;其他未覆盖的专家数可通过新增分发逐步支持。
影响与限制
编辑解释:该优化仅影响提示处理阶段的 MoE 聚合核,生成阶段为单 token 无遍历,不受影响。受影响对象为在 CUDA 上运行、且专家激活数命中此次放宽的用户;非 CUDA 后端(Metal、Vulkan、ROCm 等)及 32-wide warp 以外的配置未在本次验证中,效果需以各自环境为准。预发布阶段建议在测试环境验证后再用于生产。
获取与下一步
用户可在 GitHub Releases 的 b10704 页面获取各平台预编译包(含 macOS、Linux、Windows、Android 及 CUDA 12/13、Vulkan、ROCm、OpenVINO、SYCL 等构建)或拉取源码自行编译。后续是否扩大更多专家数的快速路径覆盖,取决于官方分发表的增量更新。