OpenAI 推出 Agents API 公测,并把 GPT-Live-1 带进 API
9 月 10 日 OpenAI 同时开放两项开发者能力:托管 Codex harness 的 Agents API 公测(不额外收费),以及全双工语音模型 GPT-Live-1(前端 0.05 美元/分钟)。
2026 年 9 月 10 日,OpenAI 同日发布两篇开发者向公告:Introducing the Agents API 与 Build more natural voice experiences with GPT-Live-1 in the API。前者把支撑 Codex 的智能体 harness 与基础设施以公测形式开放给所有开发者,后者把 ChatGPT 中的全双工语音模型 GPT-Live-1 搬进 API,定价为语音前端每分钟 0.05 美元。
Agents API:一次调用创建可运行的智能体
官方称,开发者通过一次 API 调用指定任务、模型、工具与环境即可创建生产就绪的智能体,示例代码中的模型字段为 gpt-6-astra。要点包括:
- 环境可选:OpenAI 托管沙箱、客户自有基础设施,或沙箱合作伙伴;合作方包括 Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop 与 Vercel。
- 长会话:当会话接近上下文上限时自动压缩(compact)早期上下文,开发者无需自行实现压缩逻辑。
- 工具使用:tool search 按需加载工具定义以降低 token 消耗,programmatic tool calling 允许并行调用、串联操作并在代码中过滤合并结果;支持 MCP、自定义函数与内置的网页搜索等工具。
- 子智能体:multi_agent 开启后可把复杂任务拆为独立部分并行执行,每个子智能体保留自己的上下文,可设定最大并发数。
- 开源底座:Agents API 由开源的 Codex harness 驱动,OpenAI 负责运维,开发者可查阅其公开代码。
计费口径上,官方明确“使用 Agents API 没有额外费用,客户只需为智能体消耗的 token 与工具付费”。
GPT-Live-1:单一模型同时听与说
官方介绍,GPT-Live-1 先随 ChatGPT 推出,此次进入 API;它能同时听与说,并把更深的推理与工具调用委托给后端文本模型(如 GPT-6 Astra)或第三方模型,从而替代“语音转文字—大模型—语音合成”的链式架构。列出的能力包括打断处理、通过系统提示塑造语气/语速/风格、对背景噪声与静默的静默上下文管理、长会话可靠性,以及电话场景支持;模型原生提供 ASR 转写与回复文本,支持关键词偏置,并原生支持轮次检测。
- 官方称在其评测中,GPT-Live-1 相比 GPT-Realtime-2.1 在 Full Duplex Bench 上提升 30 个百分点,并在轮次切换延迟与交互行为上有大幅改善;与 GPT-6 Astra(medium 推理强度)配对时在衡量端到端语音智能体智能的 Tau3 上排名第一。
- 官方还称在早期评测中,Speak 发现 GPT-Live-1 给学习者更多思考时间,相对以往基于轮次的系统把打断减少了近 80%。
- 语音方面从少量实时声音扩展到覆盖口音、方言与语言的更大选择,公告列出 Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinder 等音色,并称未来数月继续扩充。
两条产品线的共同点
两次发布都指向同一件事:OpenAI 把内部跑通的基础设施(Codex 的 harness、ChatGPT 的全双工语音栈)拆成 API 交付,同时以“不额外收费”和“按分钟计价”给出明确的成本口径。官方对客户评价的引述集中在工程简化与延迟改善上,例如 Yelp 首席技术官 Alex Levy 称接入后轮次切换与准确率优于原有语音架构、电话接听率有可见改善。具体价格、并发限制与支持端点以官方文档与定价页为准。
来源:OpenAI
AI Tools Daily 是中英双语新闻室,追踪 AI 工具发布、产品更新与行业趋势。 编辑准则 · 提交更正