GPT-6 Sol – OpenAI推出的面向专业工作与智能体的中高端大模型

AI模型6小时前更新 老高
14 0

GPT-6 SolOpenAI于2026年9月推出的面向专业工作与智能体任务的中高端大模型,主要用于跨应用业务流程自动化与编码智能体任务,支持多档推理强度调节与改进后的提示词缓存,适用于企业流程自动化、软件工程与大规模内容处理场景。

基础信息内容
产品定位面向专业工作与智能体任务的中高端大模型
出品方OpenAI
发布时间2026年9月22日(美东时间)
模型系列GPT-6 系列(GPT-6 Astra 的能力下放版本)
推理强度low / medium / high / xhigh 等多档可调
输入价格每百万 tokens 2 美元(缓存读取 0.20 美元)
输出价格每百万 tokens 10 美元
可用渠道ChatGPT Work、Codex 与 OpenAI API
开放情况未开放模型权重,仅通过 OpenAI 产品与 API 提供
单任务成本AutomationBench 上约为 Claude Opus 5 每任务成本的 9%
GPT-6 Sol – OpenAI推出的面向专业工作与智能体的中高端大模型

GPT-6 Sol 的核心能力

GPT-6 Sol 的改进集中在能力下放与运行效率两处:训练方法与 GPT-6 Astra 接近,把 Astra 在专业工作、事实性、编程、计算机操作与对齐方面的表现压缩进成本更低的运行版本。对以 AI 智能体 为主要负载的团队而言,单任务成本决定了流程能否规模化。

旗舰能力的蒸馏式下放

官方将 GPT-6 Sol 与 Astra 的关系定义为能力探索与规模化应用的分工:Astra 承担前沿探索,Sol 承担低成本铺开,并明确 Astra 仍是整体最强的无妥协选项。在 AutomationBench 跨应用业务流程测试中,Sol 以 xhigh 强度取得 33.2%,高于 Claude Opus 5 的最高表现,单任务成本约为其 9%。在覆盖 55 个细分行业的 Agents’ Last Exam 上,其 max 强度得分 56.4%,单任务成本低约 60%。

编码智能体与代码合并

两款新模型均针对编码智能体负载做过优化。FrontierCode v1.1 Main 上,Sol 以更低的成本追平 Claude Fable 5.1 的 xhigh 水平;DeepSWE v1.1 软件工程测试中,max 强度取得 68.8%,与最高成绩相差 1.1 个百分点,单任务成本低约 80%。长周期任务中的跨文件修改、测试运行与反复纠错,是官方给出的主要适用负载。

计算机操作与事实可靠性

OSWorld 2.0 离线测试中,Sol 在 xhigh 强度下取得 60.5%,与 Claude Opus 5 的 medium 强度 60.3% 接近,单任务成本低约 80%。事实性方面,官方在去标识化的真实对话中测得错误量约为上一代的一半,可靠性接近 Astra,而成本显著更低。

缓存机制与推理强度调节

官方改进了提示词缓存,默认缓存命中率提高,缓存输入读取享受 90% 折扣,以便智能体在长任务中复用上下文。开发者可在对话中途调整推理强度与工具开关而不破坏已有缓存,并通过显式断点控制缓存前缀的结束位置;同一会话建议统一携带会话标识,避免缓存反复重建。

GPT-6 Sol 与同类旗舰模型的对比

对比维度GPT-6 SolClaude Opus 5.5GPT-6 Astra
开发方OpenAIAnthropicOpenAI
模型定位中高端通用与智能体模型Claude 5.5 系列首款旗舰模型旗舰通用与对齐模型
输入价格(每百万 tokens)2 美元4 美元10 美元
输出价格(每百万 tokens)10 美元20 美元50 美元
缓存读取(每百万 tokens)0.20 美元0.20 美元1 美元
AutomationBench(业务流程)33.2%(xhigh)40.0%41.4%
FrontierCode v1.1(代码合并)以更低成本追平 Claude Fable 5.1(xhigh)54.4%53.3%
单任务成本对照约为 Claude Opus 5 的 9%较 Claude Opus 5 降低约 40%为表中最高价位档位

上表价格取自各方官方定价页与官方公告,基准数值分别来自 OpenAI 与 Anthropic 公布的口径。定价差异最直接:Sol 每百万 tokens 输入 2 美元、输出 10 美元,为同表最低;GPT-6 Astra 因定位旗舰,输入与输出分别为 10 美元与 50 美元。能力侧上,Sol 在业务流程与代码合并两项上以明显更低的成本接近更高价位档位,在 AutomationBench 上以 33.2% 的单任务成本约为 Claude Opus 5 的 9%。按单位任务成本排布负载、把长尾请求交给低档位模型,是中高端档位的主要用法。

如需对照这一系列的能力上限,可参考 GPT-6 Astra(OpenAI 的旗舰通用与对齐模型,也是 GPT-6 Sol 训练方法的来源,适合以最强表现为优先、对成本不敏感的任务)。

GPT-6 Sol 的应用场景与适用人群

该模型面向可用成本衡量的规模化任务,常见落点包括:

  • 跨应用业务流程自动化:销售、营销、运营、客服与财务等系统的串联操作,单任务成本约为 Claude Opus 5 的 9%。
  • 长周期软件工程:批量代码修改、多智能体并发开发与回归测试,DeepSWE v1.1 得分接近更高价位档位。
  • 高频文档与内容处理:海量文档分析、摘要与批量问答,配合缓存折扣进一步压低边际成本。
  • 长上下文专业研究:覆盖 55 个细分行业的复杂链路任务,适用于法律、金融与医疗领域的调研初稿。
  • 桌面流程自动化:通过计算机操作能力执行跨软件的填表与录入流程,先在只读环节验证行为边界。

适用人群:以调用量计成本的产品与工程团队、需要把智能体长流程稳定交付的企业后台部门,以及希望在预算内获得接近旗舰表现的中小团队。对数据出境与合规有硬性要求的用户,应先确认所用渠道的数据处理条款,再决定敏感任务是否接入。

GPT-6 Sol 的使用方法

从确认资格到接入生产环境,可按以下步骤开始:

  1. 查阅官方说明:在 GPT-6 Sol 官方公告 了解价格、可用档位与推理强度设置,再确定需要接入的业务环节。
  2. 确认账号资格:ChatGPT Work 与 Codex 面向 Plus、Pro、Business、Enterprise 与 Edu 用户开放,免费与 Go 用户可在桌面的 ChatGPT 客户端使用 GPT-6 Luna。
  3. 配置 API 调用:在 OpenAI API 中将模型名设为 gpt-6-sol,按任务难度选择推理强度,高难度任务使用 xhighmax,常规任务降低档位。
  4. 优化缓存命中:为长任务设置显式断点控制缓存前缀边界,并在同一会话中保持 prompt_cache_key 一致,避免缓存反复重建。
  5. 灰度与验收:先在只读任务上验证输出质量与幻觉率,再逐步放开写操作,并持续跟踪单任务成本、任务完成率与首包延迟三项指标。

落地建议先以低档位验证交互与延迟,再按调用量切换档位;涉及写操作的工具调用保留人工确认与回滚路径,并把缓存命中率纳入成本看板。

GPT-6 Sol 的价格与开源情况

GPT-6 Sol 定价为每百万 tokens 输入 2 美元、输出 10 美元,缓存读取 0.20 美元,较 GPT-5.6 Sol 的促销价下调 50%;同批发布的 GPT-6 Luna 为输入 0.10 美元、输出 0.50 美元、缓存读取 0.01 美元。区域数据处理端点按 10% 加价,

GPT-6 Sol 未开放模型权重,仅通过 ChatGPT Work、Codex 与 OpenAI API 提供,自托管与私有化部署不在可选范围内。对成本敏感的团队而言,缓存命中率与推理强度是决定真实支出的两个变量:缓存读取价格为输入价格的十分之一,而高强度档位的单任务成本可能是低档位的数倍,建议接入时按任务难度分级配置。

GPT-6 Sol 的常见问题

GPT-6 Sol 与 GPT-6 Astra 有什么区别?

两者训练方法接近。Astra 是旗舰模型,官方称其仍为整体最强、追求无妥协体验的首选;Sol 把 Astra 在专业工作、事实性、编程与计算机操作上的能力下放到成本更低的版本,输入价格 2 美元、输出 10 美元,约为 Astra 的五分之一。

GPT-6 Sol 怎么收费?

每百万 tokens 输入 2 美元、输出 10 美元,缓存读取 0.20 美元,相比 GPT-5.6 Sol 的促销价下降 50%;区域数据处理端点另按 10% 加价。

GPT-6 Sol 在哪些渠道可以使用?

ChatGPT Work 与 Codex 面向 Plus、Pro、Business、Enterprise 与 Edu 用户开放,开放平台侧通过 OpenAI API 调用,模型名为 gpt-6-sol

© 版权声明

相关文章