核心发布

据AIbase 9月1日报道与Hugging Face仓库信息,科大讯飞全资子公司词元星火于9月1日在上海时间当日正式推出并开源两款端侧通用大模型星火X2.5-4B与星火X2.5-1.7B。两款模型为端侧首个原生支持100万Token上下文的开源方案,全程在国产算力平台完成训练,权重、代码仓库与部署文档已同步开放,可立即下载部署。星火MaaS平台同步上线对应模型API并限时免费,官方预告将于9月7日发布下一代旗舰通用大模型。

关键能力与架构

星火X2.5采用混合注意力设计,以1层全注意力配合3层滑动窗口注意力,在保持长上下文性能的同时显著降低计算开销与KV缓存占用,原生支持1,048,576上下文长度。预训练覆盖网页、书籍、学术、代码等多源数据约20万亿Token,并通过专用长上下文阶段、监督微调与MOPD强化学习提升推理、代码与智能体能力,支持200种以上语言,并深度适配Codex、Claude Code等智能体框架。

  • - 原生100万上下文:可一次性导入完整售后手册、技术文档或长代码库并跨章节关联推理 - 智能体与代码领先:同尺寸开源模型中在BFCL、τ²/τ³、MCP-Atlas、SWE-Bench等多项智能体与代码榜单表现靠前 - 多语言与指令遵循:支持200+语言,指令遵循与结构化生成稳定性经监督微调强化

访问与部署条件

权重与配置已在Hugging Face XHToken组织发布,代码与部署文档同步开放。硬件兼容英伟达、华为昇腾、海光、后摩等,推理框架兼容vLLM、SGLang、llama.cpp、MLX,支持通过Ollama与LM Studio一键部署,并可使用LLaMA-Factory进行增量训练。API已在讯飞星辰MaaS平台上线,当前限时免费,需注册账号后调用。

  • - 获取方式:Hugging Face搜索 XHToken/Spark-X2.5-4B 与 Spark-X2.5-1.7B - 部署:单卡即可启动 SGLang/vLLM 服务,最大上下文可设为1,048,576 - 许可证:Apache 2.0,商用需遵守模型卡使用说明与数据合规要求

与既有版本的实质差异

此前讯飞星火主要提供云端大模型服务,X2.5双子星首次将百万级上下文能力下放到端侧4B/1.7B小参数模型,兼顾本地离线运行与长文档理解。此次采用混合注意力替代传统全注意力长上下文方案,在相同上下文长度下降低显存与首token时延,适合个人办公、代码开发、智能家居与机器人本体的端侧推理与工具调用,而不依赖云端固定预设。

限制与评测说明

官方公布的智能体、代码与数学榜单成绩为官方及模型卡自测结果,采用thinking模式、temperature 1.0等特定采样参数,实际效果受部署硬件、框架版本与提示写法影响。在Domux智能家居测试集上,1.7B版本控制指令端到端正确率90.3%、平均响应0.85秒为特定环境数据,建议在目标设备与业务数据上验证。长上下文推理会增加显存占用,需按文档配置上下文长度与量化策略。

适用对象

面向需要私有化、离线与长上下文的中国开发者与企业用户,适用于需一次性读入完整文档的办公场景、需本地代码补全与生成的开发环境、以及智能硬件与机器人本体的离线指令执行与导航决策。已具备Hugging Face与Ollama使用基础的团队可即刻验证,生产上线前需完成安全与合规评估。