关键变化

llama.cpp b10919 是 ggml-org 于上海时间 2026-09-12 10:18 发布的预发布版本,对应发布时间为 2026-09-12T02:18:40Z,目标提交为 d3146f2。该版本相对上一预发布 b10917 仅包含 2 笔提交,均为当日窗口内合入:2026-09-11T22:53:07Z 的 server 子进程重构与 2026-09-12T01:47:29Z 的 WebGPU Dawn 更新,分别对应上海时间 2026-09-12 06:53 与 09:47。版本性质为常规预发布迭代,未声明许可证变更、安全修复或维护状态变化。

第一笔实质变更是 ggml-webgpu 将 Dawn 依赖从 v20260317.182325 更新至 v20260908.214631,同步更新 Ubuntu 与 macOS 构建工作流中的资源包哈希,并移除模块扫描逻辑与相关注释。该变更由 Mendy Berger 提交、Masashi Yoshimura 共同编写,已通过 GitHub 验证签名。直接影响 WebGPU 后端构建链:继续使用旧 Dawn 快照的本地构建可能无法复现,使用 WebGPU 的用户需跟随新依赖重新拉取与编译,浏览器与桌面端 WebGPU 推理路径需回归验证。

第二笔实质变更是 llama-server 重构子进程处理并修复 Windows 构建,由 Xuan-Son Nguyen 提交。内容包括统一改用 std::filesystem::rename 以在全平台获得 POSIX 语义,补齐重命名失败时的系统错误信息,修复 Windows 下下载产物已出现时的丢弃与 etag 改写问题。提交说明中曾尝试的并发下载隔离与路由测试串行化均已回退,因此本次不包含新的并发下载加速功能,实际交付为重构加 Windows 兼容修复。受影响对象为使用 llama-server 拉取模型与多进程部署的用户,Windows 用户感知最明显。

兼容性与访问条件

仓库归属为 ggml-org/llama.cpp,公开仓库,描述为 LLM inference in C/C++,当前核验许可证为 MIT,可按保留版权声明的条件分发与修改,本次未发生许可证变化。发布资产与往版一致提供预编译包,本次已核验资产包括 Windows CUDA 包、macOS arm64 与 x64 包、Ubuntu arm64 与含 OpenVINO、ROCm 的 x64 包,以及 Android arm64 包。用户可从 Release 页面按平台下载对应压缩包,或克隆仓库自行编译,访问无需额外授权。

兼容性方面,官方未在本次两笔提交中声明破坏性接口变更,--fuse-qkv 等既有转换参数与 GGUF 读写路径不受影响,已有模型文件无需重转。但作为预发布版本,仍应视为需验证版本:WebGPU 侧因 Dawn 大版本时间跨度约半年,着色器编译与驱动适配可能变化;server 侧因重命名语义改为全平台 POSIX 行为,Windows 下原先失败的覆盖场景现会直接覆盖,需在预发环境确认模型缓存与下载重试逻辑符合预期后再升级生产。

限制与下一步

  • 预发布版本,仅含 2 笔提交的小幅迭代,不适合当作稳定版直接全量替换;本次未声明安全漏洞修复,不应解读为安全加固版本;并发下载隔离等优化已回退,不要期待同名功能已上线;WebGPU 用户需使用 v20260908 对应资源并重新验证推理正确性;Windows server 用户需重点验证模型下载中断续传、缓存命中与多进程同时拉取同一模型时的行为

中国用户如已在使用 b10917,可按需评估本次更新:仅使用 CPU、CUDA 或 Metal 本地推理且不走 WebGPU 与 llama-server 下载链路的,可暂缓;依赖 WebGPU 或在 Windows 上运行 llama-server 的,建议先在测试机下载 b10919 预编译包验证,对比推理与服务日志无异常后再推广。后续进展以同一仓库 Release 页面为准,不以聚合榜单或转载为准。