核心变化

ggml-org 在上海时间 2026-09-07 06:08(UTC 2026-09-06 22:08:43)发布 llama.cpp 预发布版本 b10828,tag 为 b10828,commit 为 3ad1ba7336986d98592d3e28cafd1a406715351f。该版本最显著的实质变化是为 Spark2.5 模型家族提供端到端支持:新增 conversion/spark2_5.py、注册 Spark2_5ForCausalLM,并在 GGUF 层面引入 MODEL_ARCH SPARK2_5,实现滑动窗口注意力与全注意力混合层的参数校验、RoPE 维度区分以及 fused QKV 权重处理。

与此同时,b10828 累积包含了紧邻前一版本 b10827 的 OpenCL 后端修复:针对 q4_K 与 q5_K 的 mul_mat 操作正确选择权重打包,避免在 Adreno 等 OpenCL 设备上的精度与性能回退。该修复对使用 Vulkan、OpenCL 后端进行量化推理的用户具有直接价值。

适用对象与使用影响

该版本面向需要在本地或离线环境运行大语言与视觉语言模型的中国开发者、研究团队及企业用户。llama.cpp 以纯 C/C++ 实现、无额外依赖、首选 Apple Silicon 并支持 ARM NEON、Metal、AVX/AVX2/AVX-512、CUDA、HIP、Vulkan、SYCL 等多后端,适合在 Mac、Windows、Linux 服务器及 Android 设备上做低成本本地部署。MIT 许可允许商用集成,但要求保留版权与许可声明。

对已部署 llama.cpp 的用户,b10828 为预发布(prerelease=true),建议在测试环境验证后再用于生产。需要使用 Spark-X2.5-1.7B 等新模型的团队必须升级至 b10828 才能正确执行 convert_hf_to_gguf.py 转换与后续量化;仅使用 Llama、Qwen、Mistral 等存量模型的现有管线可按需升级,但可获得 OpenCL 量化修复带来的稳定性提升。

兼容性与迁移条件

二进制分发通过 GitHub Releases 提供,涵盖 Windows(cpu/cuda-12.4/cuda-13.3/cuda-13.4-arm64/opencl/vulkan/openvino/sycl/rocm)、macOS(arm64/x64)、Ubuntu(x64/arm64/s390x/vulkan/rocm/openvino/sycl-fp16/fp32)、Android(arm64)等。安装条件为直接下载对应平台的 zip/tar.gz 并解压,或通过 https://llama.app 获取安装引导,或使用 Docker、从源码编译(docs/build.md)。

兼容性方面,Spark2_5 转换要求隐藏激活函数为 GELU、注意力门模式为 sigmoid 且启用 headwise_attn_output_gate,否则转换过程会抛出校验错误。现有 GGUF 模型文件不受影响,无需重新量化。从 b10827 及更早版本升级无需配置变更,但若自定义了 SYCL 内存追踪(GGML_SYCL_MEMTRACE)或依赖旧权重打包逻辑,建议对照 #28402 与 #27868 的变更说明进行回归测试。

限制与下一步

当前 b10828 仍标记为预发布,官方未提供完整 Release Notes 正文,功能稳定性以实际测试为准;部分平台如 macOS KleidiAI、openEuler 仍处于禁用状态。Windows CUDA 13.4 arm64 仍为 preview。建议中国用户在内网或受限网络环境下优先选择与自身硬件匹配的单一后端包,避免下载全部变体。下一步可关注 ggml-org 后续是否将 Spark2.5 标记为正式支持并合并至稳定分支,同时验证与 llama-server、OpenAI 兼容 API 的工具调用(tool_call)模板是否与新增的 TAG_WITH_TAGGED 格式一致。

  • 仓库:https://github.com/ggml-org/llama.cpp 版本:b10828,发布于 2026-09-07 06:08 Asia/Shanghai(2026-09-06T22:08:43Z) 前置版本:b10827(2026-09-06T20:50:00Z) 许可证:MIT(api.github.com/licenses/mit) 获取方式:Releases 页面下载预编译包或从源码构建