核心变化

ggml-org 在上海时间 2026-09-07 07:04(UTC 2026-09-06T23:04:50Z)发布 llama.cpp 预发布版本 b10829,tag 为 b10829,target commit 为 5fdfa6282936576d2f352d4b97f397a109f207a6,prerelease 为 true。本次发布的核心实质变化是修正 gated delta net(GDN)q/k 归一化的数值实现,与上游参考对齐。

GDN 在 flash-linear-attention 中的定义为 l2norm(x) = x * rsqrt(sum(x*x) + eps),eps 位于根号内。此前 llama.cpp 所有 GDN 调用点使用 ggml_l2_norm,即 x / max(sqrt(sum(x*x)), eps),等价于 torch.nn.functional.normalize,其 CUDA 核亦引用该实现。由于常见数值量级下钳位从未触发,实际等同于无 eps 的归一化,与参考存在系统偏差。

该偏差影响 Qwen3.5、Qwen3.5-MoE、Qwen3-Next、Qwen4-Exp、Kimi-Linear、Kimi-K3、BailingMoE3 等采用 GDN 的模型。PR #28068 由 danielhanchen 提交,于上海时间 2026-09-07 00:46 合并,将实现改为基于已有 rms_norm 的等价形式:rms_norm(x, eps/n) * (1/sqrt(n)) 即 x * rsqrt(sum(x*x) + eps),无需新增 ggml 算子。ggml_l2_norm 本身保持不变,其原始调用者 rwkv7-base 仍使用默认 eps 1e-12。transformers 曾在引入 Qwen3-Next 时复现同一替换,并于三日后在 huggingface/transformers#40842 修正;vLLM 与 SGLang 因直接 vendor FLA 库而未受影响。

适用对象与使用影响

该版本面向需在本地或离线环境运行大语言与视觉语言模型的中国开发者、研究团队及企业用户。llama.cpp 以纯 C/C++ 实现、无额外依赖,首选 Apple Silicon 优化并支持 ARM NEON、AVX/AVX2/AVX-512、Metal、CUDA、HIP、Vulkan、SYCL 等多后端,适合在 Mac、Windows、Linux 服务器及 Android 设备上做低成本本地部署。MIT 许可允许商用集成、修改与分发,需保留版权与许可声明,不提供额外保证。

对已部署 llama.cpp 的用户,本次为预发布,建议在测试环境验证后再用于生产。需要运行 Qwen3-Next、Kimi-K3 等 GDN 模型的用户升级后可获得更接近参考的归一化精度,实测在 Qwen3.8-Flash-Next UD-IQ1_S 与 Qwen3.8-27B Q4_K_M 上均观测到 KLD 与 Top-1 一致性等指标小幅改善;仅使用 Llama、Mistral 等非 GDN 模型的现有管线不受影响,可按需升级。

兼容性与迁移条件

二进制通过 GitHub Releases 分发,覆盖 Windows(x64 CPU、CUDA 12.4/13.3、Vulkan、SYCL、ROCm、OpenVINO,ARM64 CPU/OpenCL Adreno/CUDA 13.4 preview)、macOS(ARM64/x64)、Linux(Ubuntu x64/ARM64/s390x、Vulkan、ROCm、OpenVINO、SYCL FP16/FP32)、Android(ARM64)及 iOS XCFramework。获取方式为直接下载对应平台的 zip/tar.gz 解压,或访问 https://llama.app 获取引导,或通过 Docker、从源码按 docs/build.md 编译。

兼容性方面,无破坏性变更,也无需重新量化已有 GGUF。eps 仍完全来自 checkpoint 原有参数,与所有已发布 GDN 检查点一致;官方说明中该 norm 的参考 eps 为 1e-6,现有检查点均在此范围内。从 b10828 及更早版本升级无需配置变更,自定义 SYCL 内存追踪(GGML_SYCL_MEMTRACE)或依赖旧权重打包逻辑的用户可对照变更说明做回归测试。

限制与下一步

当前 b10829 仍标记为预发布,官方未提供完整 Release Notes 正文,功能稳定性以实际测试为准;部分平台变体如 macOS KleidiAI、openEuler 仍处于禁用状态,Windows ARM64 CUDA 13.4 仍为 preview。建议中国用户在内网或受限网络环境下根据自身硬件选择单一后端包,避免下载全部变体。下一步可关注 ggml-org 是否将该修正合入稳定分支,并在 llama-server 的 OpenAI 兼容 API、工具调用模板中验证与新增模型的协同效果。

  • 仓库:https://github.com/ggml-org/llama.cpp 版本:b10829,发布于 2026-09-07 07:04 Asia/Shanghai(2026-09-06T23:04:50Z) 前置版本:b10828(2026-09-06T22:08:43Z) 提交:5fdfa6282936576d2f352d4b97f397a109f207a6 许可证:MIT(SPDX MIT,https://api.github.com/licenses/mit) 获取方式:Releases 页面下载预编译包或从源码构建 合并 PR:#28068,merged_at 2026-09-06T16:46:22Z(上海 2026-09-07 00:46)