返回模型列表

GPT-6.1 Sol – OpenAI 推出的新一代主力模型

AI科技编辑部
RSS 订阅
GPT-6.1 Sol – OpenAI 推出的新一代主力模型 官方截图
(图片来源官方截图)

导读摘要:

GPT-6.1 Sol是OpenAI于2026年推出的新一代主力模型,作为GPT-6 Sol的升级版本,以GPT-6 Astra旗舰五分之一的Token价格实现接近后者的智能水平。该模型聚焦智能体编程、电脑操作和专业工作三类高消耗场景,在DeepSWE v1.1真实代码库工程任务上追平Astra,在OSWorld 2.0电脑操作评测中仅落后2.1个百分点,同时将缓存输入价格压至每百万Token仅0...

1. GPT-6.1 Sol是什么

GPT-6.1 Sol是OpenAI于2026年推出的新一代主力模型,作为GPT-6 Sol的升级版本,以GPT-6 Astra旗舰五分之一的Token价格实现接近后者的智能水平。该模型聚焦智能体编程、电脑操作和专业工作三类高消耗场景,在DeepSWE v1.1真实代码库工程任务上追平Astra,在OSWorld 2.0电脑操作评测中仅落后2.1个百分点,同时将缓存输入价格压至每百万Token仅0.10美元。官方为模型配套了最高8倍速的Ultrafast档位,现已通过API以及ChatGPT Work、Codex等产品面向付费用户开放。

gpt-6-1-sol-openai 官网截图
(图片来源官方截图)

技术定位与领域: GPT-6.1 Sol属于GPT-6系列的中端推理模型,其核心定位是在成本与能力之间取得平衡,充当OpenAI产品矩阵中的“主力模型”角色。该模型延续了GPT-6系列的推理模型架构,重点面向代理式AI工作负载,覆盖代码生成、计算机操作、多步工作流自动化等任务类型,填补了旗舰模型Astra与入门级模型之间的市场空白。

研发背景: 该模型由OpenAI开发,是GPT-6 Sol的升级迭代版本。OpenAI通过后续训练优化的方式,将GPT-6 Astra级别的能力“下沉”到更低的成本区间,在保持推理模型架构的前提下,重点加强了智能体编程、电脑操作、专业任务三类场景的post-training,使中端模型能够承担此前仅旗舰模型可胜任的工作负载。

核心价值: GPT-6.1 Sol解决了代理式AI应用中成本与效果难以兼得的痛点。在维持接近旗舰智能水平的同时,将标准输入价格降至每百万Token 2美元、缓存输入降至0.1美元,使得长时间运行的智能体任务在经济上具备可行性。其缓存输入价格仅为Astra的十分之一,对多人协作的企业级工作流而言具有实际意义。

技术特点: 该模型支持从低到高的多档推理强度(Reasoning Effort)调节,并以Ultrafast高速档提供最高8倍于标准模式的Token生成速度。通过上下文缓存复用机制,智能体在多次请求间重复利用同一份上下文时可显著降低调用成本,这是本代模型成本优化的关键技术手段。

2. 主要功能

  • 智能体编程能力: 在DeepSWE v1.1真实代码库工程任务上追平GPT-6 Astra,相较GPT-6 Sol提升6.4个百分点。模型能够理解复杂代码仓库结构,完成Bug修复、功能实现、测试补全等工程任务,并输出可合并的Pull Request,适合作为常驻编码Agent使用。

  • 电脑操作能力: 在OSWorld 2.0计算机使用评测中得分为Astra的98.9%(落后2.1个百分点),相比GPT-6 Sol提升7个百分点,而单任务成本约为Astra的七分之一。模型可模拟人类操作图形界面,完成文件管理、应用交互、网页浏览等任务,是桌面自动化场景的核心支撑能力。

  • 专业文档处理: 在GDP.pdf评测中得分超过Claude Opus 5.5,单任务成本不到后者一半。模型能够解析复杂PDF文档中的表格、图表和排版信息,提取结构化数据并完成深度分析,适用于合同审理、财报分析、学术论文解读等专业文档场景。

  • 多步业务工作流: 在AutomationBench评测中,模型以中等推理强度取得比Claude Opus 5.5高2.2个百分点的成绩,成本约为其三分之一。该功能支持跨系统、多步骤的业务流程自动化,包括数据同步、表单流转、审批触发等操作,可承担企业级流程自动化任务。

  • 科学工作流执行: 在Terminal-Bench Science基准上,单任务成本为5.47美元,比Claude Opus 5.5和GPT-6 Astra低超过75%。模型可在终端环境中执行科研数据分析流程,包括数据清洗、统计分析、图表绘制和结果解读,为科研人员提供低成本的自动化分析能力。

  • 多档位推理强度调节: 模型支持从低到高的可调推理effort设置。低档位响应快、成本低,适合简单任务;最高档会分配更多推理计算预算,适用于复杂代码工程和高难度专业任务。官方在DeepSWE、OSWorld、Terminal-Bench等评测中均以最高档报告成绩。

  • Ultrafast高速生成档: Token生成速度最高可达标准版的8倍,通过API或500美元/月的Pro订阅计划启用。该档位在Codex等交互式编程场景中约以6倍价格换取8倍速度,适合对响应延迟敏感的使用场景。

  • 上下文缓存复用机制: 缓存输入价格定为每百万Token 0.10美元,比标准输入低95%、比GPT-6 Sol再降50%。当智能体在多次请求间复用同一份上下文时,服务端可复用已缓存的KV/prefix,仅对新增的增量输入计费,大幅降低多轮交互的总成本。

3. 如何使用

  1. 环境要求: GPT-6.1 Sol通过OpenAI API和ChatGPT Work、Codex产品提供,无需本地部署环境。用户需注册OpenAI账号并开通付费计划——API用户需绑定支付方式,ChatGPT用户需订阅ChatGPT Work或Codex对应的付费层级。建议开通500美元/月的Pro档以获得Ultrafast高速生成能力。

  2. ChatGPT入口使用: 登录ChatGPT(chatgpt.com),在ChatGPT Work或Codex界面中从模型下拉菜单选择“GPT-6.1 Sol”选项。普通Chat对话界面暂未提供该模型,需要切换到Work或Codex工作台才能使用。选择后即可开始对话、编写代码或执行工作任务。

  3. API调用方式: 在代码中将模型ID设为 gpt-6.1-sol,通过标准Chat Completions接口发起请求。开发者可使用OpenAI官方SDK(Python、Node.js等)或直接调用REST API,请求体结构与GPT-6系列其他模型一致,迁移成本较低。示例代码如下:

from openai import OpenAI
client = OpenAI()
response = client.chat.completions.create(
    model="gpt-6.1-sol",
    messages=[{"role": "user", "content": "修复这个Python脚本中的内存泄漏问题"}]
)
  1. 设置推理强度: 根据任务难度选择reasoning effort档位。简单任务(如文本分类、信息提取)使用低档以节省成本,复杂代码工程或多步推理任务使用高档以获得更优效果。推理强度通过API参数 reasoning_effort 控制,取值范围包括low、medium、high。

  2. 启用上下文缓存: 在多次请求间复用系统提示和任务上下文,使后续请求的输入部分按缓存价格0.10美元/百万Token计费,而非标准输入价格2.00美元。建议将固定不变的指令(如系统提示、项目背景)放于消息序列前部,以便服务端命中缓存前缀。

  3. 开启Ultrafast高速档: 需要极速生成时,通过API请求中设置 ultrafast 参数或在ChatGPT Pro订阅中启用该档位,可获得最高8倍于标准速度的Token生成速率。注意该档位采用更高的计费倍率,建议仅在延迟敏感场景(如交互式编码、实时翻译)下使用。

4. 优缺点分析

优点
性价比突出: 标准输入价格2美元/百万Token,仅为旗舰Astra的五分之一;缓存输入更降至0.1美元,为Astra的十分之一,长期运行的智能体任务成本可控。
智能体编程能力强: 在DeepSWE v1.1真实代码库评测中追平GPT-6 Astra,比GPT-6 Sol提升6.4个百分点,具备承担真实工程任务的能力,可完成Bug修复与PR提交全流程。
专业任务超越竞对: GDP.pdf评测超过Claude Opus 5.5且成本不到其一半,AutomationBench上以中等推理强度领先Opus 5.5达2.2个百分点,专业场景表现优异。
事实准确性提升: 低推理强度下事实错误率从11.4%降至7.7%(降幅约32%),高推理强度下进一步降至4.1%,接近Astra的4.0%,可靠性显著改善。

5. 同类工具对比

对比维度 GPT-6.1 Sol GPT-6 Astra
模型定位 能力/成本最优平衡的主力模型 综合能力最强的旗舰模型
标准输入价格(/百万Token) $2.00 $10.00(为Sol的5倍)
缓存输入价格(/百万Token) $0.10 $1.00(为Sol的10倍)
DeepSWE v1.1编程评测 追平Astra 基准线(最高)
OSWorld 2.0电脑操作 距Astra 2.1个百分点,单任务成本约1/7 基准线(最高)
GDP.pdf专业文档 超过Opus 5.5,单任务成本不到其一半 业界领先,成本约为Sol的5倍
事实错误率(高档) 4.1% 4.0%(略优)
Ultrafast高速档 有,最高8倍速 有,全球最快前沿模型档
推理强度调节 支持低/中/高多档位 支持多档位

选型建议: 对于智能体编程、电脑操作和成本敏感的长时间运行任务,GPT-6.1 Sol是当前综合性价比最高的选择,尤其适合需要高频调用API的SaaS产品和企业自动化流程。其缓存输入价格仅为Astra的十分之一,在多轮上下文复用的代理工作负载中优势明显。

对于追求极限能力的科研推理和复杂决策场景,GPT-6 Astra依然是最优选择,尤其在Terminal-Bench Science等科学评测中保持最高分,搜索工具故障披露率也更低。若用户主要处理专业文档且已有Claude生态依赖,Opus 5.5在GDP.pdf等评测中被Sol超越,但其他文档理解维度仍有自身优势,可根据具体业务场景权衡。

6. 编辑总结

GPT-6.1 Sol代表了OpenAI在模型产品分层策略上的成熟实践。从技术创新角度看,该模型通过post-training优化将旗舰能力“下沉”至中端价位,而非简单裁剪模型规模,这种思路有效保留了推理模型的深度能力,同时以缓存复用和推理强度调节两项机制实现了成本结构的系统性优化——缓存输入价格降至0.1美元这一举措,直接改变了代理式AI应用的商业模式可行性。

从实用价值分析,GPT-6.1 Sol在智能体编程和电脑操作两大核心场景中的表现具有实际竞争力。DeepSWE v1.1评测追平Astra意味着开发团队可以将常见的Bug修复和PR生成任务放心交给该模型执行,而OSWorld 2.0仅落后旗舰2.1个百分点的成绩表明桌面自动化场景已具备可用性。专业文档和业务工作流上的成本优势,使其成为企业流程自动化的理想选择。

该模型的适用人群明确:AI应用开发者、企业自动化工程师、科研数据处理者以及高频使用编码助手的个人开发者。对于需要控制API预算的团队,GPT-6.1 Sol的低缓存成本和可调推理档位提供了精细的成本控制能力;对于追求极致速度的交互式使用场景,Ultrafast档位弥补了中端模型的速度短板。

展望后续发展,GPT-6.1 Sol验证了“旗舰能力下沉”这一产品路线的可行性,未来OpenAI可能会将更多Astra级别的能力释放到中端价位,进一步拉大与开源模型的差距。随着上下文缓存技术的成熟和推理强度调节机制的完善,以成本效率为导向的模型分层将成为大模型厂商的标准产品策略。

7. 应用场景

  • App全生命周期维护: 开发者发布应用后,由常驻Agent持续跟踪用户反馈渠道,自动整理高频问题、定位代码缺陷并修复Bug,提交包含完整代码改动和测试结果的PR,同时生成改动说明视频供人工审查。GPT-6.1 Sol的DeepSWE评测成绩保证了其在真实代码库中的工程能力,低缓存成本使长期运行的监控Agent在经济上可行。

  • 产品研发跟进: 新产品发布期间,Agent持续了解产品定位与团队需求,在需求变更后自动更新发布材料、调整产品文档、修改API说明,并标记需要人工确认的部分。模型在AutomationBench上的优势使其能够处理跨文档、多步骤的信息同步和材料更新任务,减少产品团队的事务性工作负担。

  • 科研数据分析: 新实验数据入库后,Agent自动重跑分析流程、调查异常值产生原因、更新论文图表并同步修订相关文字解释。GPT-6.1 Sol在Terminal-Bench Science上单任务成本仅5.47美元,比旗舰低75%以上,为科研团队提供了可负担的自动化数据分析方案,尤其适合需要频繁迭代数据处理的实验室环境。

  • 企业财务自动化: 监控应收账款状态,发现漏开发票时自动准备发票文件,经人工确认后发出。OpenAI已披露早期测试用户的Dot实际完成了这一任务。该场景验证了模型在企业级业务流程中的可靠性,GPT-6.1 Sol的多步工作流能力和低调用成本使其适合作为财务流程的自动化助理。

  • 多渠道信息监控: 定时检查指定Slack频道或电子邮箱,将新发现自动汇总进共享的ChatGPT Space页面并生成动态图表,供团队实时查看。模型的上下文缓存机制使长期运行的监控任务只需在初始加载时支付完整输入费用,后续增量更新按0.1美元/百万Token计费,大幅降低了持续监控的运营成本。

8. 常见问题FAQ

Q:GPT-6.1 Sol与GPT-6 Sol有什么区别?
A:GPT-6.1 Sol是GPT-6 Sol的升级版本,在DeepSWE v1.1真实代码库评测中比GPT-6 Sol提升6.4个百分点,OSWorld 2.0电脑操作评测中提升7个百分点。同时缓存输入价格从GPT-6 Sol的基础上再降50%,降至每百万Token 0.10美元,整体性价比显著提升。

Q:GPT-6.1 Sol与GPT-6 Astra应该如何选择?
A:两者定位不同。GPT-6.1 Sol是主力模型,以Astra五分之一的Token价格提供接近旗舰的智能水平,适合成本敏感的生产环境和高频API调用。GPT-6 Astra是综合能力最强的旗舰,在科学推理(Terminal-Bench Science最高分68.1%)、搜索工具故障披露率(1.5%)等指标上仍保持领先,适合追求极限能力的场景。

Q:GPT-6.1 Sol支持哪些调用方式?
A:模型支持通过OpenAI API调用(模型ID为 gpt-6.1-sol),也可在ChatGPT Work和Codex产品界面中选择使用。普通Chat对话界面暂未提供该模型,使用完整能力需要开通ChatGPT Work、Codex或对应API付费计划。

Q:如何在API调用时使用Ultrafast高速档?
A:需要在API请求中启用Ultrafast档位参数,或者订阅500美元/月的ChatGPT Pro计划。Ultrafast档提供最高8倍于标准模式的Token生成速度,但计费倍率更高(Codex中约6倍价格),建议仅在交互式编程、实时翻译等延迟敏感场景下启用。

Q:上下文缓存是如何降低成本的?
A:当智能体在多次请求间复用同一份上下文时,OpenAI服务端可复用已缓存的KV/prefix,只对新增的增量输入计费。缓存输入价格为每百万Token 0.10美元,比标准输入价格低95%。建议将固定不变的系统提示和任务背景信息放在消息序列前部,以提高缓存命中率。

Q:GPT-6.1 Sol的推理强度调节应该如何设置?
A:模型支持低、中、高多档推理effort设置。低档位响应快、成本低,适合简单信息提取、文本分类等任务;中档位适合一般业务工作流;最高档会分配更多推理计算预算,适用于复杂代码工程、多步推理等任务。官方评测数据均以最高档报告成绩,实际使用中建议根据任务复杂度和预算动态调节。

9. 项目地址

相关 AI 模型文章

Claude Haiku 5.5 – Anthropic 推出的最轻量级模型

Claude Haiku 5.5 – Anthropic 推出的最轻量级模型

Claude Haiku 5.5 是 Anthropic 于 2026 年 10 月 7 日正式发布的最新小型语言模型,定位为"最便宜、最快、最能打"的高性价比产品。该模型将输入价格降至 $0.10/百万 token,综合成本降低约 75%,同时实现了电脑操作能力从 15.7% 到 72.4% 的大幅跃升。其支持 100 万 token 上下文窗口和五档可调思考机制,适用于智能摘要、数据分类、实时...

Startlux-Decision – StartLux Labs 开源的决策模型家族深度评测

StartLux-Decision 是 StartLux Labs 推出的开源决策模型家族,涵盖从 0.8B 至 27B 的五个稠密模型以及 35B-A3B 混合专家模型,专为类型化决策任务设计。该模型家族接收文本、JSON 或图片形式的状态输入,针对选择、是非、评分等结构化问题,通过单次前向推理直接返回每个选项的概率分布,天然可作为置信度使用。模型原生支持 256K token 超长上下文,具备...

SemIf – 开源的 AI 决策模型,复现 Jev 语义决策模式

SemIf – 开源的 AI 决策模型,复现 Jev 语义决策模式

SemIf(原 OpenJev)是一个开源的 AI 决策模型,旨在通过开源手段复现 TypeSafe 闭源服务 Jev 的语义决策接口模式。该模型采用单次前向传播机制,直接读取候选选项对应的 logits 进行打分,由服务端构造结构化结果,从而规避了传统自回归生成后再解析文本的复杂流程。在多个问题共享相同状态时,SemIf 还可复用前缀计算,吞吐量提升近一个数量级。该模型在单张 RTX 3090 ...

MAI-Transcribe-2-Streaming:微软实时流式语音转写模型深度评测

MAI-Transcribe-2-Streaming 是微软推出的首个实时流式语音转写模型,能够在讲话进行时持续输出文字,覆盖 60 种语言并自动检测语言切换。该模型在 Artificial Analysis 流式转写榜单中以 2.50% 的词错误率和 0.13 秒的最终转录延迟双双登顶,首批文本延迟低至数百毫秒,文字最快在语音后 320 毫秒显示。其核心价值在于将传统语音转写从"说完再识别"的批...

版权声明:本文部分内容由 AI 辅助生成并经人工校准,版权归本站所有,未经允许禁止任何形式的转载。