NeoHorse-1是一款由基元律动(TokenRhythm)联合无问芯穹、清华大学、北京大学等于2026年9月推出的开源 Agent-Native 语言模型,主要用于智能体任务执行与工具调用,支持 262,144 tokens 超长上下文与全框架本地化部署,适用于电脑操作、深度搜索、代码生成等多步骤自动化场景。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 面向 Agent 场景训练的开源语言模型 |
| 出品方 | 基元律动(TokenRhythm),联合无问芯穹、清华大学、北京大学、香港中文大学、阿里巴巴 |
| 发布时间 | 2026年9月8日 |
| 模型版本 | NeoHorse-1-4B、NeoHorse-1-9B |
| 开源协议 | Apache-2.0 |
| 上下文长度 | 262,144 tokens,可扩展至约 101 万 tokens |
| 部署框架 | SGLang、vLLM、Ollama |
| 价格说明 | 权重免费下载,无授权与调用费用 |

NeoHorse-1 的核心能力
NeoHorse-1 的定位不是通用问答,而是把“完成任务”当作训练目标本身。它围绕真实执行链路组织能力,覆盖从理解需求、拆解步骤到调用工具、验证结果的全过程,四项能力相互衔接。
工具调用与任务规划
模型可以根据任务需求自动选择并调用外部工具,把复杂目标拆解为可执行的子步骤,并在多轮交互中保持长程调度的一致性。与依赖人工预设流程的方案不同,NeoHorse-1 在每一步都会重新评估当前状态,决定继续执行还是调整路径,因此更适合步骤数量不固定、中途可能变化的真实任务。
深度搜索与证据链构建
在多轮检索场景中,模型会主动发起搜索、交叉验证来源,并把支撑结论的证据串成可追溯的链条。这一能力让它在生成调研类内容时不必依赖单次检索结果,而是通过反复求证收敛到更可靠的结论,输出时可附带来源说明。
代码生成与环境反馈修复
模型能够生成可运行的代码,并基于执行环境返回的报错信息定位问题、修改实现,直到任务通过验证。这一闭环把“写代码”和“验证代码”合并到同一次执行里,减少了人工在中间来回搬运信息的过程,适合自动化脚本、数据处理等需要即时验证的场景。
Agent-Native 训练范式
NeoHorse-1 的训练语料以 Routing Harness 在 Agent 执行中产生的结构化轨迹为核心,涵盖任务请求、路由选择、工具调用、环境反馈与错误恢复,比传统问答语料多出能力需求、执行决策、环境结果三个维度。成功轨迹与失败轨迹都会被保留,经结构检查与六维质量评估后进入后训练,让模型学到“哪里容易出错、出错后如何恢复”。这也使它区别于在通用模型上事后适配 Agent 场景的常规做法,与AI智能体所需的执行闭环天然契合。
NeoHorse-1 与同类 Agent 模型的对比
下表以 9B 档参数为主,对照对象直接取自 NeoHorse-1 官方技术报告列出的 benchmark 基线:Qwen3.5、Gemma 4、Muse Glimmer 来自官方 9B 组,星火X2.5 来自官方 4B 组。
| 对比维度 | NeoHorse-1-9B | Qwen3.5 | Gemma 4 | Muse Glimmer | 星火X2.5 |
|---|---|---|---|---|---|
| 开发方 | 基元律动、无问芯穹等 | 阿里通义千问 | Google DeepMind | Meta 超级智能实验室 | 科大讯飞 |
| 对照档位 | 9B(家族含 4B 版) | 9B | 12B(it 版) | 30B | 4B |
| 开源情况 | Apache-2.0 | 开源权重 | Apache 2.0 | Apache 2.0 | 旗舰闭源 API,端侧 4B 开源 |
| 上下文长度 | 262,144 tokens,可扩展至约 101 万 | 系列最高 1M | 系列最高 256K | 131,000 tokens | 旗舰 256k |
| 训练路径 | Agent-Native 后训练:Harness 轨迹 + 路由信号课程 + 在策略蒸馏 | 原生多模态预训练 + 通用后训练 | 构建于 Gemini 3 研究技术之上 | 面向本地常驻智能体场景优化 | 全国产算力全流程训练 |
| 十项基准均分 | 69.04 | 65.60 | 63.51 | 67.86 | 62.22 |
| tau²-Bench | 90.82 | 88.04 | 59.37 | 76.64 | 77.72 |
| PinchBench | 82.25 | 74.55 | 58.89 | 71.35 | 62.37 |
| 核心定位 | 专精 Agent 场景(工具调用、规划、深搜、代码) | 通用多模态,覆盖文本与图像、视频 | 通用多模态推理引擎,覆盖边缘到工作站 | 本地常驻智能体 | 代码与智能体强化的国产算力旗舰 |
从数据看,分野主要在训练路径而非参数规模。NeoHorse-1 把真实执行轨迹当作核心语料,因此在工具调用与多轮交互类任务上的增益最集中,tau²-Bench 与 PinchBench 两项都排在表内首位;Qwen3.5 依托原生多模态底座,十项均分紧随其后,适用面更宽;Muse Glimmer 以 30B 规模换来接近的十项均分,但工具调用与指令跟随分项明显低于前两者;Gemma 4 与星火X2.5 的 Agent 相关分项集中在 60 上下,更贴近通用推理与本地化部署需求。选择时可以先看任务是否以多步骤执行为主,再决定是引入这类 Agent 原生模型,还是在通用模型上自行搭建执行流程。
注:表中分数取自 NeoHorse-1 官方技术报告的 benchmark 表,Qwen3.5、Gemma 4、Muse Glimmer 对应官方 9B 组(Qwen3.5-9B、Gemma-4-12B-it、Muse-Glimmer-30B),星火X2.5 对应官方 4B 组(Spark-X2.5-4B)。
如果更关注长周期任务与编程场景,可以了解 Muse Spark 1.3(Meta 推出的智能体与编程旗舰模型,主打长周期任务执行与代码能力,与本文讨论的方向属同一赛道)。
NeoHorse-1 的应用场景与适用人群
NeoHorse-1 的能力边界集中在“多步骤、可验证、需要与环境反复交互”的任务上,以下三类场景最能发挥它的特点。
- 智能体任务执行:作为 Harness 中的执行模型,完成文件操作、软件使用等真实电脑任务,并在失败后自主恢复。
- 工具调用与 API 编排:在多工具环境中自动选择、组合并调用外部 API,用于搭建自动化工作流助手。
- 深度搜索与研究助理:多轮主动检索、交叉验证信息并附证据链,支撑带引用的调研报告生成。
适用人群:需要为自有产品接入 Agent 执行能力的开发者、对数据合规有要求因而倾向本地私有化部署的团队,以及研究多模型协作、后训练数据配比与强化学习路径的技术人员。由于模型权重完全开放,上述用户都可以在自有环境中验证效果,而不依赖第三方托管接口。
NeoHorse-1 的使用方法
模型权重已在多个平台开放,本地部署的完整链路如下,普通开发者可在单卡环境先跑通 4B 版本。
- 获取模型与文档:NeoHorse-1 官方仓库提供权重、技术报告与部署说明,HuggingFace 与 ModelScope 同步托管。
- 安装下载工具:执行
pip install -U modelscope安装 ModelScope 命令行工具。 - 拉取模型权重:运行
modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B,4B 版本按需替换模型名。 - 部署推理服务:使用 SGLang 或 vLLM 启动服务,配置
--context-length 262144及对应的推理与工具解析参数。 - 接入调用:通过 OpenAI SDK 将
base_url指向本地服务地址,即可按标准接口发送请求。
NeoHorse-1 的价格与开源情况
NeoHorse-1 的 4B 与 9B 权重均免费开放下载,官方不设授权费与按量调用费,使用成本集中在自有 GPU 的显存占用与推理算力上。由于模型可在局域网内运行,推理请求不出本地,对数据合规要求较高的团队可以省去额外的传输与托管成本,预算主要用于硬件或云上按需租用的算力。
NeoHorse-1 以 Apache-2.0 协议发布,允许商业使用、修改与二次分发,HuggingFace、ModelScope 与 GitHub 均提供权重与文档,SGLang、vLLM、Ollama 等推理框架已支持。协议层面不限制商用场景,团队可以把模型直接集成进自有产品,也可在自有数据上继续做后训练;需要注意的是,二次分发时应保留原有的许可与版权声明。
NeoHorse-1 的常见问题
NeoHorse-1 是什么?
NeoHorse-1 是基元律动联合无问芯穹、清华大学、北京大学、香港中文大学与阿里巴巴推出的首个自研 Agent-Native 开源模型,提供 4B 与 9B 两个版本,训练语料以 Harness 产生的结构化执行轨迹为核心。
NeoHorse-1 可以商用吗?
可以。NeoHorse-1 以 Apache-2.0 协议开源,允许商业使用、修改与二次分发,二次分发时需保留原有的许可与版权声明。
NeoHorse-1 需要什么硬件才能部署?
原生上下文为 262,144 tokens,实际可用长度取决于 GPU 显存。4B 版本可在消费级显卡上运行,9B 版本建议使用显存更充足的多卡环境,显存不足时可先降低上下文长度再部署。
NeoHorse-1 和 Qwen3.5 有什么区别?
NeoHorse-1 专精 Agent 场景,训练数据来自真实执行轨迹;Qwen3.5 是通用原生多模态模型,覆盖文本、图像与视频理解。前者适合多步骤任务执行,后者适用面更宽。
浙公网安备33010202004812号