返回今日选题

已核验 · Aug 5, 2026

已独立佐证

Vendor「工具整合」周:OpenAI Realtime GA + Claude 4.5 tools + Vertex deep-research + Llama 4 + NIM + Copilot Studio 同一 news cycle

8 个信源

2026-07-27 — 2026-08-02 这一周出现了一组集中的 vendor 工具发布:The Decoder 周报把它框成「tools consolidation」—— OpenAI Realtime GA、Anthropic Claude 4.5 Sonnet 程序化 tool calling + 1M GA、Google Vertex AI Gemini 2.5 Pro deep-research 模式、Meta Llama 4 多模态发布、NVIDIA NIM catalog 更新、Microsoft Copilot Studio autonomous GA。每条单独都是新闻,但放在一起描绘了一个市场:每个前沿 vendor 都在发货(1) tool-using agent 作为产品面、(2) 长上下文作为默认、(3) 自托管 / 开源 weight 替代品、(4) 与 agent orchestration stack 的集成(NeMo、Llama Stack、Vertex、Copilot Studio)。这个集群是 editorial framing,不是协同发布 —— 但这个框架对创作者很有用,因为它允许你并排对比 vendor 方案。

为什么现在讲

「tools consolidation」框架把一周 vendor 新闻变成一个连贯的故事:创作者应该把 agent 建在哪个 vendor 的工具面上,为什么。

推荐理由

演示空间:同一 agent 任务在 OpenAI Realtime、Claude 4.5 程序化 tools、Vertex deep-research、Llama 4 多模态、NIM、Copilot Studio 上的并排对比视频。

依据

The Decoder 周报 + IT 之家周报 + 六个独立 vendor 一手源

六个前沿 vendor 在同一周发了 agent 工具面 —— OpenAI Realtime GA、Claude 4.5 程序化 tools、Vertex deep-research、Llama 4 多模态、NVIDIA NIM、Copilot Studio —— 这个集群本身就是故事。

切入角度

把这一周框成「工具整合」 —— 每个前沿 vendor 在同一 7 天窗口发了 tool-using-agent 面 —— 用这个 lens 并排对比 vendor 方案。

形式

长视频讲解

演示想法

录一段 16 分钟并排对比讲解:2 分钟开场讲「tools consolidation 框架」,然后每个 vendor 2 分钟(Realtime / Claude 4.5 / Vertex / Llama 4 / NIM / Copilot Studio),最后 4 分钟在同一 agent 任务上做并排对比。

平台注意

每个 vendor 的发布都是 vendor 自陈口径;The Decoder 和 IT 之家是 editorial framing 层,不是独立验证。在记录任何具体能力声明前,对照 vendor 一手文档确认。

可用说法

  • OpenAI Realtime 达到生产级语音 agent 流量的正式可用(GA),新增面向常驻语音助手的 Realtime-mini 档位,以及会话中的 function-calling。
  • Anthropic 在 Claude 4.5 Sonnet 发布说明中,将 programmatic tool calling(在沙箱内定义工具并由模型调用)和 web_fetch 提升为 GA,同时 1M token 上下文窗口也正式 GA。
  • Vertex AI 新增 Gemini 2.5 Pro deep-research 模式,并让 Grounding with Google Search 对 Vertex 端点默认开启,提供带引用处理的长程 agentic research。
  • Meta 发布 Llama 4 多模态 checkpoint(视觉 + 音频)和内置安全护栏的 Llama Stack 1.5 参考服务器,并公开后训练 SFT/DPO 配方说明。
  • NVIDIA NIM for LLMs 新增近期开放权重 checkpoint,在目录范围内通用化 tool/function calling,并集成 NeMo Agent toolkit 做运行时编排。
  • Microsoft Copilot Studio 的多步自主 agent 工作流达到 GA,支持 Teams 分发、Power Automate 动作集成和 actions-pack 计费表。

证据链

风险

  • 每份发布说明页都是厂商的一手来源,且以厂商关心的竞品为参照来包装自己的发布。The Decoder 和 IT之家可用作媒体类佐证,但在对外表述任何具体能力声明前,请先阅读厂商原始文档。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • 模型页记录了 Realtime-mini 档位的存在,但超出所捕获摘要的各档位精确费率本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • 发布说明确认了 programmatic tool calling 和 1M GA,但本次未包含定价矩阵。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。
  • Microsoft Learn 确认 actions-pack 计费表存在,但每包费率本次未提取。在对外表述前,请对照厂商原始文档和实际许可 / 定价矩阵核实具体能力声明;不要把各平台定价或许可条款转述成具体美元数字或商业使用条款。

演示思路

  • 六个 vendor 同 agent 任务并排对比:同一 prompt,同一评测 rubric,画成功率 + 成本
  • 决策树:「哪个 vendor 对哪个用例」(语音 → Realtime,长上下文 tool use → Claude 4.5,deep research → Vertex,可自托管多模态 → Llama 4 + NIM,企业分发 → Copilot Studio)
  • 时间线图:把每个 vendor 发布放在同一时间线,展示集群