NeoHorse-1 – 基元律动联合无问芯穹推出的首个 Agent-Native 开源模型

AI模型2天前更新 智小研
32 0

NeoHorse-1是一款由基元律动(TokenRhythm)联合无问芯穹、清华大学、北京大学等于2026年9月推出的开源 Agent-Native 语言模型,主要用于智能体任务执行与工具调用,支持 262,144 tokens 超长上下文与全框架本地化部署,适用于电脑操作、深度搜索、代码生成等多步骤自动化场景。

基础信息内容
产品定位面向 Agent 场景训练的开源语言模型
出品方基元律动(TokenRhythm),联合无问芯穹、清华大学、北京大学、香港中文大学、阿里巴巴
发布时间2026年9月8日
模型版本NeoHorse-1-4B、NeoHorse-1-9B
开源协议Apache-2.0
上下文长度262,144 tokens,可扩展至约 101 万 tokens
部署框架SGLang、vLLM、Ollama
价格说明权重免费下载,无授权与调用费用
NeoHorse-1 – 基元律动联合无问芯穹推出的首个 Agent-Native 开源模型

NeoHorse-1 的核心能力

NeoHorse-1 的定位不是通用问答,而是把“完成任务”当作训练目标本身。它围绕真实执行链路组织能力,覆盖从理解需求、拆解步骤到调用工具、验证结果的全过程,四项能力相互衔接。

工具调用与任务规划

模型可以根据任务需求自动选择并调用外部工具,把复杂目标拆解为可执行的子步骤,并在多轮交互中保持长程调度的一致性。与依赖人工预设流程的方案不同,NeoHorse-1 在每一步都会重新评估当前状态,决定继续执行还是调整路径,因此更适合步骤数量不固定、中途可能变化的真实任务。

深度搜索与证据链构建

在多轮检索场景中,模型会主动发起搜索、交叉验证来源,并把支撑结论的证据串成可追溯的链条。这一能力让它在生成调研类内容时不必依赖单次检索结果,而是通过反复求证收敛到更可靠的结论,输出时可附带来源说明。

代码生成与环境反馈修复

模型能够生成可运行的代码,并基于执行环境返回的报错信息定位问题、修改实现,直到任务通过验证。这一闭环把“写代码”和“验证代码”合并到同一次执行里,减少了人工在中间来回搬运信息的过程,适合自动化脚本、数据处理等需要即时验证的场景。

Agent-Native 训练范式

NeoHorse-1 的训练语料以 Routing Harness 在 Agent 执行中产生的结构化轨迹为核心,涵盖任务请求、路由选择、工具调用、环境反馈与错误恢复,比传统问答语料多出能力需求、执行决策、环境结果三个维度。成功轨迹与失败轨迹都会被保留,经结构检查与六维质量评估后进入后训练,让模型学到“哪里容易出错、出错后如何恢复”。这也使它区别于在通用模型上事后适配 Agent 场景的常规做法,与AI智能体所需的执行闭环天然契合。

NeoHorse-1 与同类 Agent 模型的对比

下表以 9B 档参数为主,对照对象直接取自 NeoHorse-1 官方技术报告列出的 benchmark 基线:Qwen3.5、Gemma 4、Muse Glimmer 来自官方 9B 组,星火X2.5 来自官方 4B 组。

对比维度NeoHorse-1-9BQwen3.5Gemma 4Muse Glimmer星火X2.5
开发方基元律动、无问芯穹等阿里通义千问Google DeepMindMeta 超级智能实验室科大讯飞
对照档位9B(家族含 4B 版)9B12B(it 版)30B4B
开源情况Apache-2.0开源权重Apache 2.0Apache 2.0旗舰闭源 API,端侧 4B 开源
上下文长度262,144 tokens,可扩展至约 101 万系列最高 1M系列最高 256K131,000 tokens旗舰 256k
训练路径Agent-Native 后训练:Harness 轨迹 + 路由信号课程 + 在策略蒸馏原生多模态预训练 + 通用后训练构建于 Gemini 3 研究技术之上面向本地常驻智能体场景优化全国产算力全流程训练
十项基准均分69.0465.6063.5167.8662.22
tau²-Bench90.8288.0459.3776.6477.72
PinchBench82.2574.5558.8971.3562.37
核心定位专精 Agent 场景(工具调用、规划、深搜、代码)通用多模态,覆盖文本与图像、视频通用多模态推理引擎,覆盖边缘到工作站本地常驻智能体代码与智能体强化的国产算力旗舰

从数据看,分野主要在训练路径而非参数规模。NeoHorse-1 把真实执行轨迹当作核心语料,因此在工具调用与多轮交互类任务上的增益最集中,tau²-Bench 与 PinchBench 两项都排在表内首位;Qwen3.5 依托原生多模态底座,十项均分紧随其后,适用面更宽;Muse Glimmer 以 30B 规模换来接近的十项均分,但工具调用与指令跟随分项明显低于前两者;Gemma 4 与星火X2.5 的 Agent 相关分项集中在 60 上下,更贴近通用推理与本地化部署需求。选择时可以先看任务是否以多步骤执行为主,再决定是引入这类 Agent 原生模型,还是在通用模型上自行搭建执行流程。

注:表中分数取自 NeoHorse-1 官方技术报告的 benchmark 表,Qwen3.5、Gemma 4、Muse Glimmer 对应官方 9B 组(Qwen3.5-9B、Gemma-4-12B-it、Muse-Glimmer-30B),星火X2.5 对应官方 4B 组(Spark-X2.5-4B)。

如果更关注长周期任务与编程场景,可以了解 Muse Spark 1.3(Meta 推出的智能体与编程旗舰模型,主打长周期任务执行与代码能力,与本文讨论的方向属同一赛道)。

NeoHorse-1 的应用场景与适用人群

NeoHorse-1 的能力边界集中在“多步骤、可验证、需要与环境反复交互”的任务上,以下三类场景最能发挥它的特点。

  • 智能体任务执行:作为 Harness 中的执行模型,完成文件操作、软件使用等真实电脑任务,并在失败后自主恢复。
  • 工具调用与 API 编排:在多工具环境中自动选择、组合并调用外部 API,用于搭建自动化工作流助手。
  • 深度搜索与研究助理:多轮主动检索、交叉验证信息并附证据链,支撑带引用的调研报告生成。

适用人群:需要为自有产品接入 Agent 执行能力的开发者、对数据合规有要求因而倾向本地私有化部署的团队,以及研究多模型协作、后训练数据配比与强化学习路径的技术人员。由于模型权重完全开放,上述用户都可以在自有环境中验证效果,而不依赖第三方托管接口。

NeoHorse-1 的使用方法

模型权重已在多个平台开放,本地部署的完整链路如下,普通开发者可在单卡环境先跑通 4B 版本。

  1. 获取模型与文档NeoHorse-1 官方仓库提供权重、技术报告与部署说明,HuggingFace 与 ModelScope 同步托管。
  2. 安装下载工具:执行 pip install -U modelscope 安装 ModelScope 命令行工具。
  3. 拉取模型权重:运行 modelscope download --model TokenRhythm/NeoHorse-1-9B --local_dir ./NeoHorse-1-9B,4B 版本按需替换模型名。
  4. 部署推理服务:使用 SGLang 或 vLLM 启动服务,配置 --context-length 262144 及对应的推理与工具解析参数。
  5. 接入调用:通过 OpenAI SDK 将 base_url 指向本地服务地址,即可按标准接口发送请求。

NeoHorse-1 的价格与开源情况

NeoHorse-1 的 4B 与 9B 权重均免费开放下载,官方不设授权费与按量调用费,使用成本集中在自有 GPU 的显存占用与推理算力上。由于模型可在局域网内运行,推理请求不出本地,对数据合规要求较高的团队可以省去额外的传输与托管成本,预算主要用于硬件或云上按需租用的算力。

NeoHorse-1 以 Apache-2.0 协议发布,允许商业使用、修改与二次分发,HuggingFace、ModelScope 与 GitHub 均提供权重与文档,SGLang、vLLM、Ollama 等推理框架已支持。协议层面不限制商用场景,团队可以把模型直接集成进自有产品,也可在自有数据上继续做后训练;需要注意的是,二次分发时应保留原有的许可与版权声明。

NeoHorse-1 的常见问题

NeoHorse-1 是什么?

NeoHorse-1 是基元律动联合无问芯穹、清华大学、北京大学、香港中文大学与阿里巴巴推出的首个自研 Agent-Native 开源模型,提供 4B 与 9B 两个版本,训练语料以 Harness 产生的结构化执行轨迹为核心。

NeoHorse-1 可以商用吗?

可以。NeoHorse-1 以 Apache-2.0 协议开源,允许商业使用、修改与二次分发,二次分发时需保留原有的许可与版权声明。

NeoHorse-1 需要什么硬件才能部署?

原生上下文为 262,144 tokens,实际可用长度取决于 GPU 显存。4B 版本可在消费级显卡上运行,9B 版本建议使用显存更充足的多卡环境,显存不足时可先降低上下文长度再部署。

NeoHorse-1 和 Qwen3.5 有什么区别?

NeoHorse-1 专精 Agent 场景,训练数据来自真实执行轨迹;Qwen3.5 是通用原生多模态模型,覆盖文本、图像与视频理解。前者适合多步骤任务执行,后者适用面更宽。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章