核心变化
ONNX Runtime v1.28.2 于上海时间 2026-09-03 09:17 正式发布(GitHub 官方发布时间 2026-09-03T01:17:16Z),是面向 v1.28.1 的补丁版本。核心修复为 Compile API 回调序列化环节:此前在生成优化模型时会产生重复的图节点、输入/输出及数值信息,影响含嵌入式或外部初始化器模型的编译产物准确性。本次通过 #32303 修复回调序列化逻辑,消除冗余信息,确保编译后的 ONNX 模型图结构与原始语义一致。
适用对象与价值
面向在中国使用 ONNX Runtime 进行模型部署与推理加速的开发者、算法团队及企业用户。尤其适用于依赖 Compile API 进行模型优化、图捕获与序列化复用的场景,如在 Linux 服务器、Windows 桌面、macOS ARM64 及 CUDA 加速环境中部署大语言模型、视觉或语音模型。修复提升了编译产物的正确性与可复现性,减少因图冗余导致的调试成本与运行时异常。
兼容性与迁移
本版本无破坏性变更,可直接从 v1.28.1 平滑升级。接口与模型格式保持兼容,已编译并序列化的历史模型建议使用新版本重新编译以消除潜在冗余。升级无需修改代码,仅需更新运行时包或预编译二进制;若此前为规避该缺陷而手动去重图节点,可移除临时 workaround。
安装与访问条件
仓库:https://github.com/microsoft/onnxruntime,MIT 许可。安装方式:pip install onnxruntime 或 pip install onnxruntime-gpu;亦可直接下载 GitHub Release 提供的预编译包(onnxruntime-linux-x64、linux-aarch64、linux-gpu-cuda12/13、osx-arm64、win-x64/arm64 等)。国内网络可通过 GitHub 镜像或企业内网分发,需匹配 CUDA 12/13 驱动与硬件架构,源码构建需 CMake 3.26+ 与兼容编译器。
限制与下一步
限制:本次仅修复 Compile API 序列化单一路径,未涉及其他执行提供程序或图优化策略变更;预编译包体积较大,弱网环境下载需预留时间。下一步:建议在测试环境使用新版本重新编译关键模型并对比图节点数与推理输出;在 CI 中固定 onnxruntime==1.28.2 版本并验证含外部初始化器的大模型链路;关注官方对比链接 v1.28.1...v1.28.2 获取完整文件变更。