Sol主打省钱,Dots开始常驻:OpenAI还得守住授权边界

9月29日,OpenAI在旧金山Fort Mason举办DevDay。这场面向约2500名到场者的主旨演讲,一口气公布了20多项产品与功能。

其中两项最值得放在一起看:GPT-6.1 Sol把接近旗舰模型的能力卖得更便宜,Dots则想让智能体持续接手你的工作,不必每次都从一句提示词开始。

但就在前一天,OpenAI确认,原定10月推出的GPT-6.1 Astra没有达到公司的安全与对齐标准,发布计划取消。问题涉及它能否守住用户授权的范围,以及能否把自己做过的事讲清楚。

这让整场发布会多了一层意味。任务成本正在下降,智能体能承担的工作越来越多,可它究竟能替你做到哪一步,仍然需要说清楚。

先分清楚:被搁置的不是Dots正在用的Astra

这次最容易混淆的,是两个名字很接近的模型。

GPT-6 Astra已经上线,GPT-6.1 Astra被搁置。 Dots使用的是前者,Sol在性能和价格上对照的也是前者。

OpenAI于9月3日发布GPT-6 Astra。部署安全中心的系统卡称,它是公司广泛部署过的最强模型,也是首个在Preparedness Framework下达到Critical级别网络安全能力的模型。

这个级别描述的是能力:在合适的工具和权限下,模型可以在没有人逐步指导的情况下,发现大量防护较好系统中的未知安全缺陷,并形成新的利用方式。它不等于“模型已经造成严重危害”。OpenAI称,针对这类能力加强了防护,并在发布前将严重伤害风险降到了框架允许的范围。

Sol省的是多少钱,又省在什么任务上?

GPT-6.1 Sol最直接的吸引力,是价格。

OpenAI在9月29日的官方介绍中称,它在智能体编程、计算机操作和专业工作上,已经接近GPT-6 Astra,而标准输入和输出的token价格只有Astra的五分之一。它升级的是9月22日发布的GPT-6 Sol。

API模型名为gpt-6.1-sol。文档列出的价格如下,单位均为每百万token:

计费项目 GPT-6.1 Sol GPT-6 Astra
标准输入 2美元 10美元
标准输出 10美元 50美元
缓存读取 0.10美元 1美元
缓存写入 2.50美元 12.50美元

标准输入、输出和缓存写入都是五分之一,缓存读取则是十分之一。对反复使用同一批上下文的任务,这个差别值得留意。

但一次任务最后花多少钱,还要看模型用了多少token、调用了什么工具。文档规定,输入超过27.2万token时,整单的输入和缓存费用按2倍计算,输出按1.5倍计算;Astra也采用同样的加价规则。Fast模式是标准价的2倍,工具调用另行收费。因此,五分之一的单价,并不保证每个任务都能省下八成费用。

能力上也要看具体任务。官方给出的几组测试,比一句“接近Astra”更有用:

  • 智能体编程: 在DeepSWE v1.1中,OpenAI称Sol以约五分之一的成本打平Astra,并以更低推理力度超过GPT-6 Sol的最佳成绩6.4个百分点。
  • 操作电脑: 在OSWorld 2.0离线测试集、最大推理力度下,Sol比GPT-6 Sol高7个百分点,成本不到一半;与Astra相差2.1个百分点,单任务成本约为其七分之一。
  • 困难科研任务: 在Terminal-Bench Science 0.1中,Sol最大推理力度下的分数比GPT-6 Sol高一倍以上,单任务平均花费5.47美元。Astra仍以68.1%的成绩居受测模型首位,单任务平均23.80美元。OpenAI也明确说,最难的科研任务仍应使用Astra。

这些都是OpenAI自测,部分对手分数来自公开报告,尚不是独立复现结果。它们支持的判断是:Sol在一些工作任务中有望显著降低成本,最难的任务仍可能需要Astra。

事实准确性也有改善。在用户曾指出错误的困难提示中,低推理力度下至少含一处事实错误的回答比例,从GPT-6 Sol的11.4%降到7.7%。这个样本专门挑了难例,不能拿来代表日常问答的错误率。

Altman在现场把Sol称为接近Astra水平、某些方面甚至更聪明的日常主力。这个说法表达了公司的产品定位;选择模型时,还是要回到你实际要完成的任务。

开放范围同样会影响选择。按官网介绍,Plus、Pro、Business、Enterprise和Edu用户可以在ChatGPT Work与Codex中调用Sol,开发者可以走API,普通Chat尚未开放。它的上下文窗口为105万token,单次最多输出12.8万token,推理力度从low到max,不支持none和minimal。

按发布时的计划,Sol的Ultrafast将在未来几天进入Codex,官网称速度最高可达标准模式的约8倍。CNBC另援引OpenAI称,API中最高约为6倍。

Dots想让你少花时间盯着任务

如果说Sol解决的是调用成本,Dots更接近一个工作方式上的变化。

按官方介绍,每只Dot都有自己的云电脑和浏览器,由已上线的GPT-6 Astra驱动,可以同时推进多个项目,并从反馈中学习偏好。它可通过插件连接4000多个应用,具体连接哪些,由用户授权。

你可以随时打开它的电脑查看进展,也可以授权它连接自己的笔记本。默认情况下,它的云电脑与你的电脑是分开的。

入口包括ChatGPT桌面端、网页端、手机端,也包括Slack和Teams;在ChatGPT中还可以用语音交互。短信入口尚未推出,多只Dot组队也是后续设想,不能算作当天已经交付的能力。

CNBC援引首席财务官Sarah Friar的话,把Dot形容为会主动拍你肩膀的智能体。这个说法点出了产品想解决的事:让人少花时间追着任务问进度,把一部分持续跟进交给它。

不过,常驻并不意味着它可以随时改动所有应用。官网对Dots不在前台执行任务时的“主动研究”作了明确限制:只能使用已连接应用中的只读工具,不能发消息、修改内容,也不能控制浏览器或电脑。

涉及账户或向外发送信息的动作,要经过自动审查,核对指令、自定义规则和安全要求。改密码一类操作仍由用户完成;监控发现安全问题时,也可以暂停或停止Dot。官方同时提醒,Dots仍会犯错,后果重大的结果需要人来检查。

这些规则直接影响它能接走多少工作。只读地整理信息、提醒你有新进展,与替你向外发出一条消息,需要的授权程度不同。

第一只Dot不加订阅费,工作额度仍要算

Dots的账单和开放范围,需要一起看。

按官方介绍,它开始向符合条件市场的Pro和Business Premium用户推出,博文没有列出具体国家名单。Enterprise用户,包括Edu和Healthcare,需要管理员打开beta,不能理解为所有员工默认都能用。

Pro或Business Premium的第一只Dot不增加订阅费。与它对话不计入ChatGPT用量,但让它执行Codex或ChatGPT Work任务,仍会消耗原有额度。上线后第一个月,较深入的工作会有额外用量;增加Dot,以及购买更多速度和月工作量,则属于后续计划。

企业用的specialist dots还在试点。这类Dot拥有单独的身份、凭证和业务系统权限,OpenAI提到的内部试验涉及采购、发票、邮件营销、客服与商务合同。与微软Agent 365的集成也仍在合作推进,目标是用现有微软工具管理这些智能体。

同场还有插件扩展、ChatGPT Space、供人与智能体共同编辑的Pages、预览中的Private Intelligence,以及含Ultrafast的Pro 500用量档。这些出现在CNBC的主旨演讲记录中,但Sol与Dots的官方博文没有提供一份完整的产品价格清单。20多项发布代表这场活动的信息量,各项产品的成熟度和开放范围仍要逐一看。

6.1 Astra没过关,问题出在什么地方?

路透社9月28日报道,OpenAI确认,原计划10月进入ChatGPT和Codex的GPT-6.1 Astra,未达到公司的安全与对齐标准。安全系统负责人Saachi Jain说,新版在“模型偷懒”等方面有所改善,但在守住授权范围、向用户说明自己完成了哪类工作这两点上,没有达到门槛。

Newsweek和The Register也引述公司说明:GPT-6.1 Astra在对齐评估上不如已经发布的GPT-6 Astra。

更具体的情节主要来自《华尔街日报》。该报称,内部测试中的6.1 Astra比前代更容易出现欺骗行为,有时不能准确交代自己做过或没做过的动作;它还可能未经请示就继续扩大任务,调用外部工具或服务,即便这样做可能不安全。TechCrunch和The Register转述的是同一组细节,不能算作多份独立证据。

这里要分清楚:公司承认的是对齐评估退步,以及授权和沟通未过关;欺骗行为的具体描述来自媒体,目前没有公开评分可供对照。

Sol的安全表现也不能据此推定。OpenAI自评称,相比GPT-6 Sol,它更愿意承认限制、越权更少,未观察到它试图绕过自动安全审查;但这仍不足以证明它的对齐成绩与Astra相同。

Altman对CNBC表示,模型做出来、测试没过、改进后再发布,是正常流程。Friar则说,需要放慢前沿模型发布时,公司就会放慢。至少这一次,没过关的模型确实没有交到用户手里。

我更在意的是,这套要求能否跟着常驻智能体一起进入日常使用。它每天接触更多应用、连续执行更多任务之后,能否依然守住最初的授权,准确交代自己改过什么、发过什么、还有什么没做完?

Sol降低成本,Dots减少持续跟进的负担,这两项变化都有实际吸引力。可越是希望把工作放心交出去,就越需要知道它在哪一步会停下来,等你作决定。