OpenAI发布GPT-6.1 Sol,性能接近Astra成本更低
OpenAI在开发者活动日推出GPT-6.1 Sol模型,官方称其在同等性能条件下具有较高性价比;该模型在智能体编程、电脑操作和专业工作流任务中性能接近GPT-6 Astra,标准输入输出token价格约为后者五分之一。
驱动中国9月30日消息,OpenAI在开发者活动日宣布推出GPT-6.1 Sol模型。官方表示,该模型在同等性能条件下具有较高性价比;在智能体编程、电脑操作和专业工作流等任务中,其性能接近GPT-6 Astra,标准输入/输出token费用约为Astra的五分之一。
GPT-6 Astra是OpenAI于2026年9月推出的旗舰大语言模型,官方将其定位为智能与对齐程度较高的模型,重点面向长程多步骤任务和专业工作流。
价格信息方面,官网公布gpt-6.1-sol全模式定价表,并按上下文长度区分:输入tokens不超过272,000适用短上下文价格,输入tokens超过272,000适用长上下文价格。官方给出的缓存成本为每100万Token 0.1美元,按现汇率约合0.67元人民币,较GPT-6 Sol低50%。
在智能体编程、电脑操作和专业工作流等任务中,GPT-6.1 Sol性能接近GPT-6 Astra,标准输入/输出token价格约为Astra的五分之一。
在DeepSWE v1.1软件工程任务中,GPT-6.1 Sol在较高推理强度下表现与GPT-6 Astra相当;在较低推理强度和成本条件下,得分比GPT-6 Sol高6.4个百分点。
在GDP.pdf专业文档与复杂任务中,GPT-6.1 Sol以不到Opus 5.5一半的任务成本取得优于Opus 5.5的结果。在AutomationBench中等推理强度自动化工作流中,其得分比Opus 5.5高2.2个百分点,成本约为Opus 5.5的三分之一。
在OSWorld 2.0离线最大推理强度电脑操作任务中,GPT-6.1 Sol得分比GPT-6 Sol高7个百分点,成本不足GPT-6 Sol的一半;与Astra相比仅低2.1个百分点,单任务成本约为Astra的七分之一。
在Terminal-Bench Science 0.1最大推理强度科学终端任务中,GPT-6.1 Sol得分超过GPT-6 Sol的两倍,单任务平均成本为5.47美元,低于Opus 5.5的23.21美元和Astra的23.80美元。
可靠性与对齐方面,GPT-6.1 Sol在低推理强度下事实错误比例从GPT-6 Sol的11.4%降至7.7%,下降约32%。官方称,在所有推理设置下,GPT-6.1 Sol错误率与Astra差距控制在1.9%以内。
在困难评测中,GPT-6.1 Sol更少忽略失效搜索工具,更能遵循明确限制,并减少未经授权操作;安全测试中未观察到试图绕过自动化安全审查器的行为。
调用方面,自9月29日起,GPT-6.1 Sol向ChatGPT Work与Codex的Plus、Pro、Business、Enterprise、Edu用户开放;开发者可通过API以gpt-6.1-sol调用。