你有没有遇到过这种情况:想让 AI 帮你读完一份几十页的产品手册再回答问题,结果它读到后面忘了前面;想让它分析一整年的销售明细,它却只能一小段一小段地喂进去,最后给出的结论前后打架。这不是模型笨,是上下文不够用。
9 月 1 日,科大讯飞全资子公司词元星火开源了星火 X2.5-4B 和星火 X2.5-1.7B 两款端侧模型,把这个问题往前推了一大步——它们是端侧模型中首个原生支持最长 100 万 Token 上下文的产品。换句话说,百万级的信息处理能力,第一次真正落到了本地设备上。
100 万 Token 到底能装多少东西
先给个直观概念。100 万 Token 大致相当于七八百万汉字,你可以把一整套售后手册、一整个季度的会议材料、一批项目文档,甚至一个完整的代码仓库一次性塞进去,让它基于完整信息做判断。
过去端侧模型处理长内容,通常只能把文档切成几段分别提问,结果是忘记前情、遗漏信息、已读乱回。星火 X2.5-4B 和 1.7B 采用混合注意力架构,并使用覆盖长篇文档、技术资料等场景的千亿 Token 级高质量数据开展训练,可以在一次任务中接收并理解更大规模的信息。
官方举的售后场景例子很能说明问题:你把完整的售后手册导进 X2.5-4B,让它先梳理不同场景下的售后规则并标注对应章节;然后问「购买 10 天后设备故障,且使用过第三方耗材,是否符合换货要求」,模型需要跨章节关联退换货、故障处理和例外条件三套规定,才能给出综合判断。更进一步,如果你补充「用户在偏远地区」「设备里存有家庭地图」,它还能保持前文情境,结合物流、数据清除、费用承担和处理时限等规则继续给建议。这种跨章节、带上下文累积的推理,正是长上下文真正的价值——不是为了塞下更多字,而是让模型能基于完整信息连续地理解问题。
小模型也能干大活:4B 对标大 2 到 3 倍的云端模型
参数只有 4B 和 1.7B,能力够用吗?官方给出的定位是围绕智能体、代码、数学和指令遵循四项核心能力做了专门优化,并且基于全国产算力平台完成全流程训练,使用约 20 万亿 Token 的多样化数据做预训练,再经过高质量监督微调和强化学习训练。
几个实测数字:
在代码场景,星火 X2.5-4B 在算法实现、代码补全与生成等任务中,可以对标参数规模大 2 至 3 倍的云端模型。开发者可以通过 DeepSeek Harness、OpenCode、Codex、Pi 等开源 Harness,把模型接入本地开发和自动化脚本流程——也就是说,代码编写、脚本生成和调试辅助,可以不出本地直接完成。
在智能家居场景,星火 X2.5-1.7B 在 Domux 测试集上控制指令的端到端执行正确率达到 90.3%,平均响应时间仅 0.85 秒。这个响应速度是端侧的关键——智能硬件比的不是听没听懂,而是能不能又快又准地执行。
在个人办公场景,官方展示了 Loomy 上的一个完整案例:用户上传销售明细表并提出销售分析和中英文部门业绩报告的交付需求,X2.5-4B 先编写脚本完成数据汇总、关键指标提取和趋势分析,随后生成约 3000 字的中文部门业绩报告,再沿用原有结构和格式生成英文版,最后完成内容、结构和排版校验——从原始数据分析到双语报告交付,全链路一次跑完。
机器人场景同样适用。两款模型可以部署在机器人本体或边缘设备中,支持操作控制、目标追踪、导航决策等任务,减少对云端连接和固定预设程序的依赖。
部署:四种硬件平台,三种推理框架,两种一键工具
这是本文最实用的部分。星火 X2.5-4B 和 1.7B 的部署兼容面铺得相当宽:
硬件平台支持英伟达、华为、海光以及后摩;推理框架兼容 vLLM、SGLang、llama.cpp 等主流方案;部署工具则可以通过 Ollama、LM Studio 快速上手,也支持使用 LLaMA-Factory 开展增量训练。
怎么选?给三个建议:如果你只是想先跑起来看看效果,用 Ollama 或 LM Studio 最简单,拉权重、起服务、开聊,几分钟搞定;如果你要在生产环境跑并发、追求吞吐,选 vLLM 或 SGLang;如果你的显存紧张、想在消费级显卡甚至纯 CPU 上跑,llama.cpp 是稳妥选择。至于想用自己的数据微调,官方明确支持 LLaMA-Factory,门槛不高。
权重获取:即日起模型权重、代码仓库和部署文档已在 Hugging Face 和 GitHub 平台开放,对应 API 也上线了讯飞星辰 MaaS 平台。
三步上手:从下载到跑通长文档问答
给一条最省事的路径。第一步,去 Hugging Face 或 GitHub 上找到星火 X2.5 的模型仓库,按你的硬件挑 4B 还是 1.7B——硬件充裕、要处理复杂任务选 4B,资源紧张、跑智能家居或简单控制类任务选 1.7B。第二步,用 Ollama 或 LM Studio 导入模型权重,这两款工具都提供图形界面,不用碰命令行也能起服务。第三步,准备一份长文档(产品手册、合同、财报都行),直接整份喂进去提问,重点测试它能不能跨章节关联信息——这才是这个模型真正的强项。
如果你想把它接进开发环境,可以通过 DeepSeek Harness、OpenCode、Codex、Pi 这类开源 Harness 接入本地开发和自动化脚本流程,让它参与实际的代码工作流。
对普通人意味着什么
三点值得记住。
第一,「断网也能干重活」第一次成了现实。以前端侧模型的定位是断网能聊几句,现在它能读完一整份手册再跨章节推理,还能调用工具动手执行。对经常出差、在飞机高铁上办公,或者所在网络环境不稳定的人来说,这个变化是实打实的。
第二,数据不用出本地了。合同、财报、客户名单、内部技术资料这类敏感材料,以前用云端模型总有一层顾虑,现在可以完全在本地处理,隐私风险大幅下降。
第三,全国产算力训练是条重要的底线路。两款模型基于全国产算力平台完成全流程训练,兼容华为、海光、后摩等国产硬件,说明这条技术路线已经能支撑起可用的产品,而不只是实验室里的演示。
最后补一个前瞻信息:9 月 7 日,科大讯飞还将正式发布星火 X2.5-293B 通用大模型,进一步升级代码和智能体等核心能力。如果你对端侧方案感兴趣,这几天正好可以先把 4B 和 1.7B 下载下来摸清楚,等 293B 出来再做选型对比。
关注「AI 智习室」,每天一条看得懂的 AI 情报。