Aug 13, 2026
官方
DeepSeek API docs: model version listing (V4 Pro 0813)
DeepSeek V4 Pro 0813 checkpoint 在 2026-08-13 落地
DeepSeek 8/13 把 deepseek-v4-pro 更新到 DeepSeek-V4-Pro-0813;调用方法不变,同一个模型名路由到最新版本。
资讯归档
全部已收录的资讯,按 AITopic 收录日期分组。用来补看错过的资讯,或回溯某个信源。
Aug 13, 2026
官方
DeepSeek API docs: model version listing (V4 Pro 0813)
DeepSeek 8/13 把 deepseek-v4-pro 更新到 DeepSeek-V4-Pro-0813;调用方法不变,同一个模型名路由到最新版本。
Aug 13, 2026
媒体
Hacker News: DeepSeek V4 Pro 0813 quietly released (via OpenRouter)
0813 公告 thread 里报的 benchmark:Terminal Bench 2.1 72.1 → 87.9;Cybergym 52.7 → 83.3;DeepSWE 12.8 → 62.7;AutomationBench 12.8 → 31.8。价格不变。
Aug 13, 2026
官方
HuggingFace: Qwen3.8-2.4T model card (A95B-FP8)
阿里通义千问 8/12 发布 Qwen3.8-2.4T 作为 Qwen3.8 家族的开源权重变体;A95B-FP8 变体在 HuggingFace 公开发布。
Aug 13, 2026
官方
xAI News: Introducing Grok 4.6
xAI 8/12 发布 Grok 4.6。Artificial Analysis 报 Grok 4.6 在 Intelligence Index 上得分 61。
Aug 13, 2026
媒体
Artificial Analysis: Grok 4.6 benchmarks and analysis
Artificial Analysis 8/12 发布 Grok 4.6 的 benchmarks 和分析:Intelligence Index 61。超出头条数字外的逐项 benchmark 细节未提取。
Aug 13, 2026
官方
OpenAI Community: Codex in ChatGPT desktop app for Linux in preview
OpenAI 8/12 发布 Codex 桌面端 Linux 预览版,跟现有 ChatGPT 桌面端并列。
Aug 12, 2026
媒体
CNBC: Google DeepMind gets a new AI boss as it tries to close the gap with OpenAI and Anthropic
CNBC 8/12 报道:Google DeepMind 新负责人为 Koray Kavukcuoglu(原 CTO),联合创始人 Demis Hassabis 转任主席;Kavukcuoglu 直接向 Google CEO Sundar Pichai 汇报,负责前沿研究、Gemini 产品、开发者团队和模型开发。
Aug 12, 2026
媒体
CNBC: Google DeepMind gets a new AI boss as it tries to close the gap with OpenAI and Anthropic
CNBC 8/12 报道:Google 内部组建了一个叫 Code Strike 的攻坚组,补强 coding 能力;分析师认为新 DeepMind 负责人的当务之急是尽快发布 Gemini 3.5 Pro。
Aug 12, 2026
官方
Meta Research: Introducing Muse Glimmer — an open agentic model
Meta Superintelligence Labs 8/10 发布 Muse Glimmer:300 亿参数模型,Apache 2.0 开源权重,权重在 Hugging Face;面向端到端 agentic 任务,可在 Mac/PC 单 GPU 上本地跑。
Aug 12, 2026
官方
Meta Research: Introducing Muse Glimmer — an open agentic model
Meta 博客:Muse Glimmer 量化到约 4-bit,LM 权重低于 20 GB,设计用于 24/32 GB 设备预算(KV cache、感知编码器、DFlash drafter 同存);LM Studio 版本 18.16 GB,可在 32 GB+ 内存的机器上本地跑。
Aug 12, 2026
官方
Google Blog: The latest AI news we announced in July 2026
Google 7 月回顾(8/4 发布)列出三个面向开发者的 Gemini 变体:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite、Gemini 3.5 Flash Cyber —— 在效率和质量的甜点上设计,用于规模化 agentic 工作流。
Aug 12, 2026
官方
Google Blog: The latest AI news we announced in July 2026
Google 7 月回顾同期列出:Gemini Robotics ER 2(具身推理模型,完成多步物理任务)、Google Vids 用 Gemini Omni + 个人 avatar 的更新、Lyria 3.5 音乐生成模型(驱动 Google Flow Music)。
Aug 11, 2026
官方
World Labs: RTFM — real-time feed-forward 3D world model GA
World Labs 首页文档化 RTFM —— 实时前馈 3D 世界模型,从单张图生成 3D 场景,不用 per-scene 优化。
Aug 11, 2026
官方
Google DeepMind: Genie 3 — interactive world model GA
DeepMind Genie 研究页文档化 Genie 3 GA —— 交互式世界模型,用户可以实时导航和交互生成的环境。
Aug 11, 2026
官方
NVIDIA: Cosmos — world foundation model for robotics + autonomy
NVIDIA Cosmos 产品页文档化 Cosmos —— 用于机器人 + 自动驾驶系统的世界基础模型,包含 Cosmos Reason vision-language-action 模型和 Cosmos Transfer simulation-to-real pipeline。
Aug 11, 2026
官方
Figure: Helix 2 — humanoid robot VLA model GA
Figure 首页文档化 Helix 2 —— Helix 人形机器人的 vision-language-action 模型,带 dual-system 架构(System 1 快速反应 + System 2 慢推理)。
Aug 11, 2026
媒体
The Decoder: tech-press coverage of the 'world models + robotics' cluster for the week of 2026-08-11
The Decoder 把 2026-08-11 世界模型 + 机器人发布集群框成「每个世界模型 + 人形机器人 vendor 都同一周发一个 GA 里程碑」。
Aug 11, 2026
媒体
IT之家: 中文科技媒体覆盖 8/11 世界模型 + 机器人集群
IT 之家首页快照覆盖 2026-08-11:World Labs RTFM 中文 3D 世界、DeepMind Genie 3 中文交互世界、NVIDIA Cosmos 中文机器人、Figure Helix 2 中文人形机器人。
Aug 11, 2026
官方
World Labs: RTFM — real-time feed-forward 3D world model GA
World Labs RTFM(实时前馈 3D 生成,从单张图,不用 per-scene 优化)和 DeepMind Genie 3 GA(交互式世界模型 —— 用户可以实时导航 + 交互)同一周都发了实时 / 交互里程碑。RTFM 是实时生成;Genie 3 是实时交互。两者合起来让实时世界模型输出成为创作者面,而不是仅限研究。
Aug 11, 2026
官方
NVIDIA: Cosmos — world foundation model for robotics + autonomy
NVIDIA Cosmos(机器人 + 自动驾驶的世界基础模型,带 Cosmos Reason vision-language-action + Cosmos Transfer simulation-to-real pipeline)和 Figure Helix 2(人形机器人的 vision-language-action 模型,带 dual-system 架构)同一周都发了。Cosmos 是通用机器人 + 自动驾驶栈;Helix 2 是人形机器人专用 VLA。两者合起来让 VLA / 机器人基础模型成为创作者可研究的表面。
Aug 11, 2026
官方
PostgreSQL: PostgreSQL 17 GA
PostgreSQL 17 release notes 文档化 PG 17 GA —— JSON_TABLE(JSON 到关系查询)、MERGE / RETURNING、逻辑复制 failover、COPY 性能改进、B-tree deduplication。
Aug 11, 2026
官方
Neon: Serverless Postgres branching GA + scale-to-zero
Neon 首页文档化 branching GA(预览环境数据库分支,跟 git 分支一样)、scale-to-zero 自动挂起、Neon serverless driver 用于 edge functions。
Aug 11, 2026
官方
Supabase: Row-Level Security 2.0 + Realtime GA improvements
Supabase RLS 文档化 RLS 2.0(简化 policy 编写带 helper functions)、Realtime GA 改进(presence 广播 + 授权 hook)、Edge Functions 冷启动改进。
Aug 11, 2026
官方
Cloudflare: D1 GA — global SQLite + read replicas
Cloudflare D1 文档化 D1 GA —— 全球 SQLite 带读副本、5 倍查询性能提升、D1 Time Travel(过去 30 天内 point-in-time 恢复)。
Aug 11, 2026
媒体
The Decoder: tech-press coverage of the 'developer database' cluster for the week of 2026-08-10
The Decoder 把 2026-08-10 开发者数据库发布集群框成「每个开发者数据库都发货一个 branching / serverless / global-replica 里程碑」。
Aug 11, 2026
媒体
IT之家: 中文科技媒体覆盖 8/10 开发者数据库集群
IT 之家首页快照覆盖 2026-08-10:PostgreSQL 17 中文 JSON_TABLE、Neon 中文 branching、Supabase 中文 RLS 2.0、Cloudflare D1 中文全球 SQLite。
Aug 11, 2026
官方
Neon: Serverless Postgres branching GA + scale-to-zero
Neon branching(预览环境数据库分支,跟 git 分支一样)和 Postgres 17(逻辑复制 failover + B-tree deduplication)同一周都发了 branching / failover 里程碑 —— 合起来让预览环境 / 多区域模式成为一等数据库特性,而不是每个团队重新实现的自定义模式。
Aug 11, 2026
官方
Cloudflare: D1 GA — global SQLite + read replicas
Supabase(RLS 2.0 + Edge Functions 冷启动改进)和 Cloudflare D1(全球 SQLite + 读副本 + Time Travel)同一周都发了 edge / serverless 里程碑 —— 合起来让 edge-runtime 数据库成为一等公民。
Aug 11, 2026
官方
Glean: Glean 5 — enterprise search + agents GA
Glean 首页文档化 5 —— 权限感知企业搜索(尊重源系统 ACL)、Glean Agents(工作流自动化)、Glean Assistant(自然语言数据交互)。
Aug 11, 2026
官方
Notion: Notion Enterprise Search GA + AI for every database
Notion AI 产品页文档化 Enterprise Search GA(跨 Notion + Slack + Google Drive + GitHub + Jira + Linear + Asana + Salesforce + Zendesk + Box 搜索)和 AI for every database。
Aug 11, 2026
官方
Cohere: Rerank 3.5 + Embed 4 GA
Cohere Rerank 文档化 Rerank 3.5(检索准确度提升、多语言、多向量)+ Embed 4(1024 维默认 embedding、多语言 + 图文对齐)。
Aug 11, 2026
官方
Nomic: Atlas Embed 2 — long-context embeddings GA
Nomic Atlas 文档化 Embed 2 —— 长上下文 embedding(单次调用 8K token 上下文)、开源 weight 协议、Atlas 可视化 dashboard。
Aug 11, 2026
媒体
The Decoder: tech-press coverage of the 'enterprise RAG' cluster for the week of 2026-08-09
The Decoder 把 2026-08-09 企业 RAG / 搜索 / embedding 发布集群框成「每个企业搜索 vendor 都发货一个权限感知 / 连接器丰富的更新」。
Aug 11, 2026
媒体
IT之家: 中文科技媒体覆盖 8/9 企业 RAG 集群
IT 之家首页快照覆盖 2026-08-09:Glean 5 中文企业搜索、Notion Enterprise Search 中文数据、Cohere Rerank 3.5 + Embed 4 中文 embedding、Nomic Atlas Embed 2 中文 embedding。
Aug 11, 2026
官方
Glean: Glean 5 — enterprise search + agents GA
Glean 5(尊重源系统 ACL 的权限感知连接器)和 Notion Enterprise Search GA(跨 10+ 源连接器带权限传播)同一周都发了权限感知搜索 —— 合起来让跨工具企业搜索尊重访问控制,不会突破安全边界。
Aug 11, 2026
官方
Cohere: Rerank 3.5 + Embed 4 GA
Cohere Rerank 3.5 + Embed 4(1024 维多语言 + 图文对齐)和 Nomic Atlas Embed 2(8K 长上下文开源 weight)同一周发了升级 —— 合起来在 embedding 层(Embed 4 / Atlas Embed 2)和 rerank 层(Rerank 3.5)都提升 RAG 检索质量。
Aug 11, 2026
官方
Runway: Gen-4.5 video generation model GA
Runway research 页文档化 Gen-4.5 GA —— 5+ 秒镜头下动作连贯性提升、跨场景角色/物体一致性、Act-Two 动作捕捉升级。
Aug 11, 2026
官方
Google DeepMind: Veo 3.5 video generation GA on Vertex AI
DeepMind Veo 页文档化 Veo 3.5 在 Vertex AI 上 GA —— 4K 分辨率支持、原生音频生成(唇同步对白、环境音)、camera-motion API。
Aug 11, 2026
官方
OpenAI: Sora 2 — longer shots + audio GA
OpenAI Sora 产品页文档化 Sora 2 —— 60+ 秒镜头带角色/场景一致性、原生音频生成、Sora Storyboard 编辑器。
Aug 11, 2026
官方
Pika: Pika 2.2 — Pikaframes keyframe interpolation GA
Pika 首页文档化 2.2 —— Pikaframes 关键帧到关键帧插值(指定起止帧)、场景一致性改进、Pika Additions API 用于内补绘。
Aug 11, 2026
媒体
The Decoder: tech-press coverage of the 'video generation' cluster for the week of 2026-08-08
The Decoder 把 2026-08-08 视频生成集群框成「每个视频模型同一周发一个更长连贯/原生音频里程碑」。
Aug 11, 2026
媒体
IT之家: 中文科技媒体覆盖 8/8 视频生成集群
IT 之家首页快照覆盖 2026-08-08:Runway Gen-4.5 中文创作、Veo 3.5 中文 4K、Sora 2 中文创作者、Pika 2.2 中文短视频生态。
Aug 11, 2026
官方
OpenAI: Sora 2 — longer shots + audio GA
Veo 3.5(原生音频带唇同步 + 环境音)和 Sora 2(原生音频 + 60+ 秒角色/场景一致性)同一周都发了原生音频 —— 合起来定义「原生音频视频模型」面,创作者不用单独的音频 pipeline 就能用。
Aug 11, 2026
官方
Runway: Gen-4.5 video generation model GA
Runway Act-Two(Gen-4.5 动作捕捉升级用于演员驱动动作)和 Pika Pikaframes(关键帧到关键帧插值,创作者直接控制镜头切换)是视频生成的两个互补控制面 —— 动作捕捉 vs 导演式关键帧。
Aug 7, 2026
官方
Cursor: Cursor 1.0 — Composer-2 + multi-agent inline edits + codebase indexing GA
Cursor changelog 文档化 1.0 —— Composer-2 多文件编辑模型、内联多 agent 编辑(sub-agent 验证和精炼)、codebase indexing 正式 GA 带 semantic search、team workspaces 共享 index。
Aug 7, 2026
官方
Anthropic: Claude Code 1.0 — Skills integration + sub-agent orchestration GA
Anthropic Claude Code overview 文档化 1.0 GA —— Skills 集成、sub-agent 编排(Claude Code 能为并行任务 spawn 隔离的 sub-agent)、/mcp slash command 用于显式 MCP server 连接。
Aug 7, 2026
官方
OpenAI: Codex CLI 1.0 — image input + parallel tool calls + sandbox GA
OpenAI Codex CLI GitHub repo 文档化 1.0 —— image input 支持、parallel tool calls(单次 turn 多 tool 调用)、sandbox 执行模型、AGENTS.md 项目级 agent 指令约定。
Aug 7, 2026
官方
Google: Gemini CLI 1.0 — extension system + multimodal input GA
Gemini CLI GitHub repo 文档化 1.0 —— extension system(给 Gemini CLI 加 command 和 tool 的第三方包)、multimodal input 支持(image + audio + video)、/memory slash command 用于持久项目上下文。
Aug 7, 2026
官方
CodeRabbit: CodeRabbit CLI 1.0 + AI line-by-line code review GA
CodeRabbit CLI product page 文档化 1.0 —— 终端内 line-by-line AI code review、PR comment 生成、内联 --review flag。
Aug 7, 2026
官方
Graphite: Graphite CLI 1.0 + AI-stacked PR review GA
Graphite CLI docs 文档化 1.0 —— AI-stacked PR review(多个 AI reviewer 产出分层反馈)、stacked-diff 增量 PR 工作流、AI reviewer 冲突解决器。
Aug 7, 2026
媒体
The Decoder: tech-press coverage of the 'AI developer tools' cluster for the week of 2026-08-07
The Decoder 把 2026-08-07 AI 开发者工具发布集群框成「每个 dev tool 同一周发一个 1.0 里程碑」。
Aug 7, 2026
媒体
IT之家: 中文科技媒体覆盖 8/7 开发者工具集群
IT 之家首页快照覆盖 2026-08-07:Cursor 1.0 中文 IDE、Claude Code 1.0 中文 sub-agent、Codex CLI 中文 sandbox、Gemini CLI 中文 multimodal、CodeRabbit 中文 code review、Graphite 中文 stacked PR。
Aug 7, 2026
官方
Cursor: Cursor 1.0 — Composer-2 + multi-agent inline edits + codebase indexing GA
Cursor(IDE)和 Claude Code + Codex CLI + Gemini CLI(终端优先工具)并不等价 —— IDE 给丰富视觉上下文,CLI 给可组合 shell 集成。两个面互补:agent 工作流可以从 IDE 视觉重构起步,继续在 CLI 上做 CI / 批处理。
Aug 7, 2026
官方
CodeRabbit: CodeRabbit CLI 1.0 + AI line-by-line code review GA
CodeRabbit(line-by-line AI review 带 PR comment 生成)和 Graphite(AI-stacked PR review 带 stacked-diff 工作流 + AI reviewer 冲突解决器)对 AI code review 下注不同 —— CodeRabbit 下注丰富内联 review,Graphite 下注可以不同意的分层 reviewer。
Aug 6, 2026
官方
LangChain: LangGraph Studio GA + LangGraph 0.5 framework
LangGraph 文档化 LangGraph 0.5 framework(图基 agent 编排,带持久状态、human-in-the-loop interrupt/resume、time-travel debugging)、LangGraph Studio GA(可视化调试 + 部署面)。
Aug 6, 2026
官方
LlamaIndex: Workflows GA + LlamaDeploy 1.0
LlamaIndex Workflows 文档化 Workflows GA(事件驱动 agent 编排,step-level async / sync / streaming handler、自动 instrumentation hooks)、LlamaDeploy 1.0(生产部署 runtime)。
Aug 6, 2026
官方
CrewAI: Flows GA + Crews 1.0
CrewAI 文档化 Flows GA(cross-crew 持久状态事件驱动编排)、Crews 1.0(多 agent crews 带 role / goal / backstory primitives)。
Aug 6, 2026
官方
Microsoft: AutoGen 0.4 — actor model refactor
AutoGen 文档化 0.4 重构 —— actor-model 架构(替换旧的 group-chat manager 抽象)、async-first 设计、跨语言支持(Python + .NET)。
Aug 6, 2026
官方
OpenAI: Agents SDK 1.0 — handoffs, guardrails, and tracing GA
OpenAI Agents SDK 文档化 1.0 —— 专业化 agent 之间的 handoffs、guardrails(输入/输出验证 hook)、内置 tracing dashboard、OpenAI Traces UI。
Aug 6, 2026
官方
Anthropic: Agent SDK 1.0 — Skills + computer use GA
Anthropic Agent SDK 文档化 1.0 —— 一等公民 Skills 集成、computer use API GA(虚拟化桌面鼠标 / 键盘控制)、workbench CLI 本地调试。
Aug 6, 2026
媒体
The Decoder: tech-press coverage of the 'agent framework' cluster for the week of 2026-08-06
The Decoder 把 2026-08-06 agent 框架发布集群框成「每个 agent 框架同一周发一个 1.0 / GA 里程碑」。
Aug 6, 2026
媒体
IT之家: 中文科技媒体覆盖 8/6 agent 框架集群
IT 之家首页快照覆盖 2026-08-06:LangGraph 0.5 中文开发者、LlamaIndex Workflows 中文 RAG、CrewAI Flows 中文多 agent、AutoGen 0.4 中文跨语言、OpenAI Agents SDK 中文 trace、Anthropic Agent SDK 中文 Skills。
Aug 6, 2026
官方
LangChain: LangGraph Studio GA + LangGraph 0.5 framework
四个开源 agent framework(LangGraph、 LlamaIndex Workflows、 CrewAI Flows、 AutoGen)同一周发了 1.0 类里程碑 —— 加起来构成开源 agent runtime 四角,创作者不用依赖任何单一 vendor 路线图就能搭建。
Aug 6, 2026
官方
OpenAI: Agents SDK 1.0 — handoffs, guardrails, and tracing GA
OpenAI Agents SDK 1.0(handoffs + guardrails + tracing)+ Anthropic Agent SDK 1.0(Skills + computer use + workbench)定义双 vendor agent SDK,把底层模型作为默认集成面发出来。
Aug 5, 2026
官方
Anthropic: Constitutional AI v3 specification
Anthropic Constitutional AI v3 文档化多阶段训练(显式原则、无害 reward model + 有用 reward model)、公开的批评-修订循环。
Aug 5, 2026
官方
OpenAI: Preparedness Framework v2 update
OpenAI Preparedness Framework v2 文档化风险类别、分数阈值、缓解义务、跨职能审查委员会。
Aug 5, 2026
官方
Google DeepMind: Frontier Safety Framework v3
Google DeepMind Frontier Safety Framework v3 文档化能力评估、早期预警指标、缓解部署义务。
Aug 5, 2026
官方
Meta: Llama Guard 4 open-weight safety classifier
Llama Guard 4 model card 文档化开源 weight 安全分类器、不安全内容的多类 taxonomy、与 Llama Stack 1.5 reference server 集成。
Aug 5, 2026
官方
Microsoft: AI Red Team + AI Risk Shadow Model updates
Microsoft AI Red Team 文档化 AI Red Team 方法论更新、AI Risk Shadow Model 框架(用于内部 red-team 跟踪)。
Aug 5, 2026
官方
C2PA: Content Credentials 2.0 specification
C2PA Content Credentials 2.0 文档化媒体资产的密码学 provenance、模型 + 工具 attestations、抗篡改 manifest。
Aug 5, 2026
媒体
The Decoder: tech-press coverage of the 'safety frameworks' cluster for the week of 2026-08-05
The Decoder 把 2026-08-05 安全与治理发布集群(Constitutional AI v3、Preparedness v2、Frontier Safety v3、Llama Guard 4、AI Red Team、C2PA 2.0)框成「每个前沿 lab 都发货安全框架更新」。
Aug 5, 2026
媒体
IT之家: 中文科技媒体覆盖 8/5 安全框架集群
IT 之家首页快照覆盖 2026-08-05:Anthropic Constitutional AI 中文对齐、OpenAI Preparedness 中文社区、Google DeepMind Frontier Safety 中文研究、Meta Llama Guard 4 中文开源、Microsoft AI Red Team 中文企业、C2PA Content Credentials 中文内容真实性。
Aug 5, 2026
官方
C2PA: Content Credentials 2.0 specification
把 Llama Guard 4(开源 weight 安全分类器,做输入/输出过滤)+ C2PA Content Credentials 2.0(媒体资产密码学 provenance)组合,创作者拿到一个能实际部署在自己平台的栈。
Aug 5, 2026
官方
OpenAI: Preparedness Framework v2 update
OpenAI Preparedness v2(风险类别、分数阈值、缓解义务)+ Google DeepMind Frontier Safety v3(能力评估、早期预警、缓解部署义务)定义前沿 lab 公布的双评估框架。
Aug 5, 2026
官方
NVIDIA: Blackwell B200 GPU datasheet and inference benchmarks
NVIDIA 数据中心 GPU 产品页文档化 Blackwell 代 B200:FP4/FP8 推理吞吐、NVLink Switch 互联扩展、DGX SuperPOD 参考架构。
Aug 5, 2026
官方
Groq: LPU inference engine v3 — deterministic token-stream latency
Groq 首页文档化 LPU 推理引擎 v3:确定性 token 流延迟(可预测的 per-token time-to-next-token,与 batch size 无关)、LPU 机架级部署。
Aug 5, 2026
官方
Cerebras: WSE wafer-scale inference + cloud SDK
Cerebras 首页文档化 WSE 晶圆级推理 + cloud SDK —— 单芯片推理,避免跨 GPU 模型并行。
Aug 5, 2026
官方
Apple: MLX 1.0 framework + MLX-LM for on-device inference
Apple MLX 文档化 MLX 1.0 framework GA、MLX-LM Python 包(Apple Silicon 设备端 LLM 推理)、统一内存模型。
Aug 5, 2026
官方
AWS: Inferentia3 + Neuron SDK v3 GA for production inference
AWS Neuron SDK 文档化 Inferentia3 GA、Neuron SDK v3 支持 PyTorch / JAX / TensorFlow、分布式推理、Neuron Compiler 自定义模型编译。
Aug 5, 2026
官方
Google Cloud: TPU v6 (Trillium) GA on Cloud + Vertex AI integration
Google Cloud TPU 文档化 TPU v6 (Trillium) Cloud GA + Vertex AI 托管推理集成 + per-pod 扩展拓扑。
Aug 5, 2026
媒体
The Decoder: tech-press coverage of the 'inference hardware' cluster for the week of 2026-08-04
The Decoder 把 2026-08-04 推理硬件 / 框架发布集群框成「每个推理 vendor 都发货一个 Blackwell-era 答案」。
Aug 5, 2026
媒体
IT之家: 中文科技媒体覆盖 8/4 推理硬件集群
IT 之家首页快照覆盖 2026-08-04:NVIDIA Blackwell 中文数据中心、Groq LPU 中文开发者、Cerebras WSE 中文落地、Apple MLX 1.0 苹果生态、AWS Inferentia3 中文 Neuron SDK、Google TPU v6 中文 Vertex AI。
Aug 5, 2026
官方
Apple: MLX 1.0 framework + MLX-LM for on-device inference
把 Apple MLX 1.0(framework GA)+ MLX-LM(设备端 LLM 推理 Python 包)组合,创作者拿到一个 Apple Silicon 设备端推理栈 —— 适合隐私敏感 + 离线可用场景。
Aug 5, 2026
官方
Google Cloud: TPU v6 (Trillium) GA on Cloud + Vertex AI integration
NVIDIA Blackwell(GPU 代)、AWS Inferentia3 + Neuron SDK v3(AWS 答案)、Google TPU v6(Google 答案)定义 Blackwell-era 云推理栈。每个 vendor 的答案在 cost / latency / model coverage 上定位不同。
Aug 5, 2026
官方
DeepSeek: V3.2 technical report — sparse MoE routing refinements
DeepSeek API 文档新闻条目文档化 V3.2 稀疏 MoE 路由优化(expert-choice token routing、改进 load balancing)、128K token 滑窗 attention 扩展、post-training 配方说明。
Aug 5, 2026
官方
Alibaba Qwen: Qwen3-Omni open-weight multimodal release on Hugging Face
Qwen readthedocs 文档化 Qwen3-Omni 多模态(vision + audio + text)采用开源 weight 协议,带 SFT/DPO post-training 配方说明。
Aug 5, 2026
官方
Mistral: Magistral reasoning model open-weight release
Mistral reasoning 文档文档化 Magistral 作为开源 weight 推理模型,带 chain-of-thought 模板和 Le Chat reasoning UI 集成。
Aug 5, 2026
官方
Moonshot Kimi: K2 long-context open-weight release
Moonshot Kimi 平台文档文档化 K2 开源 weight 长上下文发布,256K token 上下文窗口,tool-use 支持。
Aug 5, 2026
官方
Zhipu (Z.ai) GLM: GLM-5.2 compressed-attention MoE technical notes
Z.ai GLM 模型文档文档化 GLM-5.2 compressed-attention MoE 架构(78 层,hybrid local + compressed global attention)带训练基础设施说明。
Aug 5, 2026
官方
Hugging Face: open-r1 fully open reasoning model reproduction
Hugging Face open-r1 社区项目复现前沿级推理模型,全开源 weight + 训练数据 + 训练代码。
Aug 5, 2026
媒体
The Decoder: tech-press coverage of the 'open-weight release' cluster for the week of 2026-08-03
The Decoder 把 2026-08-03 开源 weight 集群(DeepSeek V3.2、Qwen3-Omni、Magistral、K2、GLM-5.2、open-r1)框成「每个前沿 vendor 都发货开源 weight 选项」。
Aug 5, 2026
媒体
IT之家: 中文科技媒体覆盖 8/3 开源 weight 集群
IT 之家首页快照覆盖 2026-08-03:DeepSeek V3.2 国内适配、Qwen3-Omni 多模态开源、Mistral Magistral 中文文档、Kimi K2 长上下文中文工具链、GLM-5.2 国内生态、HF open-r1 中文社区复现。
Aug 5, 2026
官方
Mistral: Magistral reasoning model open-weight release
把 Mistral Magistral(开源 weight 推理模型带 chain-of-thought 模板)+ Hugging Face open-r1(全开源复现前沿级推理模型)组合,创作者就拿到一个开源 weight 推理栈。
Aug 5, 2026
官方
Alibaba Qwen: Qwen3-Omni open-weight multimodal release on Hugging Face
Qwen3-Omni(多模态 vision + audio + text)+ DeepSeek V3.2(长上下文 128K 带滑窗扩展),创作者拿到一个开源 weight 多模态 + 长上下文 pair。
Aug 5, 2026
媒体
The Decoder: weekly roundup of model and tooling releases for the week of 2026-07-27 — 2026-08-02
The Decoder 周报首页快照覆盖 2026-07-27 — 2026-08-02 周,聚合十余条 vendor 发布(OpenAI、Anthropic、Google、Microsoft、Meta、NVIDIA),归入「tools consolidation」框架。
Aug 5, 2026
媒体
IT之家: 2026-08-01 weekly AI vendor news roundup
IT 之家首页快照覆盖 2026-08-01 周:Anthropic Claude 4.5 Sonnet 中文适配、OpenAI Realtime 中文开发者覆盖、Microsoft Copilot Studio 企业落地、Meta Llama 4 国内开源生态、NVIDIA NIM 中文文档。
Aug 5, 2026
官方
OpenAI: ChatGPT Scheduled Tasks GA + Tasks API
OpenAI 平台文档化 Scheduled Tasks 正式 GA(创建 recurring 或 one-shot task,对存好的 prompt 触发模型调用),并提供 Tasks API 用于编程式管理。
Aug 5, 2026
官方
Anthropic: Claude Skills GA — procedural skill bundles for repeated workflows
Anthropic Skills 文档化 Claude Skills 正式 GA:文件夹打包的程序化知识(SKILL.md + 脚本 + references),通过 tool_search 按需加载,模型判断工作流需要时自动调用。
Aug 5, 2026
官方
Vercel: AI Gateway GA — unified LLM routing, fallbacks, cost analytics
Vercel AI Gateway 文档化 GA:统一路由前置多模型 provider,带 fallback、retry、spend limits、按请求成本归因;gateway 处理 auth token 轮换和跨 provider streaming。
Aug 5, 2026
官方
Notion: Notion AI Agents GA — autonomous workflow agents in the workspace
Notion 帮助文档化 Notion AI Agents GA:工作区常驻 agent,可以读、写并触发 Notion 工作流;agent 限定到特定 page 和 database,通过 trigger(手动、定时、事件)运行。
Aug 5, 2026
官方
Linear: Linear AI for issue triage — automated labeling and routing
Linear AI 文档化 AI 驱动的 issue triage —— 自动化 project / label / assignee 推荐、重复检测、AI 生成 summary;定位为「首轮 triage,浮现而不替代人审」。
Aug 5, 2026
官方
Figma: Figma Make GA — prompt-to-design prototype generator
Figma 帮助文档化 Figma Make GA:prompt-to-design 原型生成器,从自然语言描述产出可编辑 Figma primitives(frames / components / auto-layout),不是栅格图。
Aug 5, 2026
媒体
The Decoder: tech-press coverage of the 'productivity agents' GA cluster for the week of 2026-08-02
The Decoder 把 2026-08-02 GA 集群(OpenAI Scheduled Tasks、Anthropic Skills、Vercel AI Gateway、Notion AI Agents、Linear AI triage、Figma Make)框成「每个 productivity tool 都发货 agent 面」。
Aug 5, 2026
媒体
IT之家: 中文科技媒体覆盖 8/2 productivity agents GA 集群
IT 之家首页快照覆盖 2026-08-02:ChatGPT Scheduled Tasks 中文上手、Anthropic Skills 中文文档、Vercel AI Gateway 中文落地、Notion AI Agents 中文模板、Linear AI triage 中文项目管理、Figma Make 国内设计社区试用。
Aug 5, 2026
官方
Vercel: AI Gateway GA — unified LLM routing, fallbacks, cost analytics
把 OpenAI Scheduled Tasks(recurring 模型调用)、Anthropic Claude Skills(按需程序化工作流)、Vercel AI Gateway(多 provider 路由)组合,创作者就能拿到一个 always-on agent runtime,不用自建基础设施。
Aug 5, 2026
官方
Notion: Notion AI Agents GA — autonomous workflow agents in the workspace
Figma Make(设计 primitives)、Notion AI Agents(工作区工作流)、Linear AI(issue triage)共享一个模式:productivity tool 发货一个 agent,住在 tool 现有数据模型里,scope 到 tool 的 primitives(frames / pages / issues)。
Aug 5, 2026
官方
OpenAI: GPT Realtime GA + Realtime pricing tier for voice agents
OpenAI 的 GPT Realtime 模型页文档化了生产 GA 档位,带服务端 VAD、session 中途 system instruction 更新、live session 中的 function calling;另有 Realtime-mini 档位定位 always-on 语音 agent。
Aug 5, 2026
官方
Anthropic: Claude 4.5 Sonnet tools release notes (programmatic tool calling + web fetch GA)
Anthropic Claude 4.5 Sonnet release notes 文档化了三项 GA:程序化 tool calling(在 code execution 沙盒里定义并调用 tool)、web_fetch server tool(带 caching 和 provenance metadata)、1M token 上下文 GA。
Aug 5, 2026
官方
Google Cloud Vertex AI: Gemini 2.5 Pro deep-research mode and grounding updates
Google Cloud Vertex AI Model Garden 文档化 Gemini 2.5 Pro deep-research 模式(长程 agentic research,带引用)、Grounding with Google Search 默认启用、JSON schema 结构化输出、File Search 检索工具。
Aug 5, 2026
官方
Meta AI: Llama 4 multimodal checkpoints and Llama Stack 1.5 reference server
Meta Llama 4 model card 文档化 vision+audio 多模态 checkpoint 变体、开源 Llama Stack 1.5 参考服务(推理 + 内置 safety guardrails)、SFT/DPO post-training 配方说明。
Aug 5, 2026
官方
NVIDIA NIM: catalog updates for open-weight LLMs and agent runtimes
NVIDIA NIM for LLMs 文档化近期开源 weight checkpoint 上架、catalog 全面支持 tool/function calling、接入 NeMo Agent toolkit runtime orchestration。
Aug 5, 2026
官方
Microsoft: Copilot Studio GA for autonomous agent workflows and Teams distribution
Microsoft Learn Copilot Studio 文档化 multi-step autonomous agent workflow GA、原生 Teams 分发、Power Automate action 集成、actions-pack 计费档位。
Aug 5, 2026
官方
Hugging Face TRL: PPO/GRPO/DPO trainer updates and on-policy distillation recipe
TRL 库文档化统一 GRPOConfig(跨 PPO/GRPO/DPO trainer)、对齐 SEED/LongStraw 论文方向的 on-policy distillation 配方、PPO trainer 加强 LoRA 支持。
Aug 5, 2026
官方
GitHub: GitHub Models catalog and Copilot Chat multi-model switcher
GitHub Marketplace models catalog 文档化扩展的前沿 + 开源 weight 模型 catalog、Copilot Chat 多模型切换器在 IDE 上线、free-tier playground 按请求 token 配额。
Aug 5, 2026
论文
arXiv 2607.14777: SEED — Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
Hugging Face 2026-07-17 索引的 arXiv 2607.14777 提出 SEED —— 一个用于长周期 agentic RL 的自演化 on-policy distillation 框架,把已完成轨迹转成 hindsight skills 再蒸馏回策略,消除稀疏奖励的 credit assignment 问题;两阶段:(1) Hindsight Skill SFT 用外部 analyzer(GLM-5.2)对 1,440 条轨迹(180 任务 × K0=8 rollouts)做注解,抽取可复用的自然语言 skills;(2) Self-Evolving OPD 当前 policy snapshot 同时担任 rollout actor 与 trajectory analyzer,每轮刷新让 actor 与 analyzer 共同演化;同一模型 actor + analyzer 共享参数;confidence-gated token-level distillation;sigmoid(β_opd × Δlog-prob);联合损失 L_SEED = L_RL(GRPO + KL 正则)+ λ_opd · L_OPD;梯度只流过 ordinary student 分支;推理时策略只从 ordinary history 行动。自报基准(ALFWorld / Search-QA / WebShop score / WebShop succ):Qwen2.5-3B-Instruct GRPO 75.0/36.4/79.8/63.3 vs Seed 91.8/45.7/88.5/78.9;Qwen2.5-7B-Instruct GRPO 81.2/42.0/80.9/72.6 vs Seed 96.1/48.6/89.7/78.1;Qwen3-1.7B-Instruct GRPO 46.1/40.8/67.3/38.3 vs Seed 92.0/42.2/87.1/77.3;sample efficiency:Seed 用 60% 训练数据(ALFWorld 80.7)就超过全量 GRPO(75.0);cross-domain:ALFWorld Unseen split +15.3 分(86.2 vs 70.9);multimodal:Qwen2.5-VL-3B Sokoban 82.0% / EZPoints 100.0%,平均 91.0% vs GRPO 77.0%。
Aug 5, 2026
论文
arXiv 2607.14952: LongStraw — Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
Hugging Face 2026-07-17 索引(207 赞,#1 Daily Paper)的 arXiv 2607.14952(Mind Lab)提出 LongStraw —— 一个固定 GPU 预算下做百万 token RL post-training 的架构感知 execution stack,以 GRPO 实例化;方法:只用一次无 autograd 评估 shared prompt,只保留后续 token 所需的 model-specific state,短 response 分支在 autograd 下逐个 replay,把 live training graph 从「整段 prompt + response」压到「单条 response 分支」,用 replay 时间换 GPU 内存;模型实现:Qwen3.6-27B(hybrid recurrent + full-attention)与 GLM-5.2(compressed-attention MoE,78 层)。自报数字:8x H20 GPU 上 group=2 与 group=8 完成 grouped Qwen scoring + response backward 在 2.1M positions;group size 增长每档仅 +0.21 GB peak allocated memory;压力测试达到 4.46M positions;32x H20 GPU 上对 2.1M-token prompt 跑完整 78 层 GLM-5.2 做端到端验证。关键洞察:瞄准「inference(~1M token 上下文)与 RL post-training(经常 ≤256K token)」之间的差距,对带累积轨迹的 AI agent 尤其相关;作者说明这些实验只建立 execution capacity、不构成完整训练正确性。
Aug 5, 2026
论文
arXiv 2607.14935: VideoChat3 — Fully Open Video MLLM for Efficient and Generalist Video Understanding
Hugging Face 2026-07-17 索引的 arXiv 2607.14935(MCG-Nanjing University)提出 VideoChat3 —— 4B 参数全栈开放视频 MLLM;架构:(1) Inflated 3D Vision Transformer (I3D-ViT)把 2D 空间 self-attention 扩成 3D 时空 self-attention,16x 时空压缩比;(2) Adaptive Frame Resolution for Streaming Video Perception 用 </Silence> / </Standby> / </Response> 三个状态 token 控制下一窗口像素预算(Silence/Response 224²,Standby 448²);训练数据 3M 样本:VideoChat3-Academic2M(2.27M)、VideoChat3-LV116K(116.2K)、VideoChat3-OL617K(617K),四阶段训练(tokenizer pre-training → video-language alignment → video instruction tuning → long & streaming instruction tuning);全栈开放 —— 权重 + 训练代码 + 训练策略 + 完整训练数据。自报基准(VideoChat3-4B vs open-weight Qwen3-VL-4B):MotionBench 61.7 vs 58.6、TempCompass 75.6 vs 70.8、Video-MME 70.1 vs 69.3、LVBench 56.7 vs 56.2、MMVU 56.4 vs 50.5、Charades TL mIoU 56.1 vs 46.4、VUE-TR V1 47.9 vs 32.9、VUE-TR V2 40.2 vs 19.6、MomentSeeker 25.9 vs 13.8;流式 ODVBench 72.3 vs StreamForest 59.9(+12.4);NVIDIA H200 上 2048 帧:总延迟 20.412s vs Qwen3-VL 44.449s、视觉 token 100,352 vs 200,704(一半)、GPU 内存省 26.14 GB;文章称在三个 TimeLens split 上超过 GPT-5 与 Gemini 2.5 Flash。
Aug 5, 2026
社区
IBM Research blog: It's time for cryptography to get its own abstraction layer
IBM Research 2026-07-17 博客《It's time for cryptography to get its own abstraction layer》主张加密学需要一层把高级意图与底层实现分开的标准层(参考当年文件系统与 socket 对存储与网络做的事);IBM 提议一个按 scopes 组织的 intent-based API,每个 scope 代表一类加密意图(标准数字签名 / 认证加密等),应用只表达「需要什么」、算法/参数/实现下沉到下层集中管理;关键特性:把策略(控制平面)与执行(数据平面)分开,参考 SDN 对网络的建模;把加密后端当作「单一接口后可互换的 provider」覆盖软件/硬件/云/TEE;允许算法升级不动应用代码;支持 PQC 迁移不必「替换算法本身」;IBM 同步放出 API spec、参考 standalone server、Go client SDK,邀请社区「explore the work, challenge the assumptions, help shape its evolution」。
Aug 5, 2026
官方
Cursor changelog: Improvements to Cursor in Slack
Cursor 2026-07-17 changelog 记录三项改进:(1) 交互改进 —— Cursor 在开始前先回一个 plan,用户可早改向;执行中更新状态;in-message buttons 替换为「compact footer links」;表格 / PRs / 制品渲染更干净;(2) Multi-repo 环境支持 —— Cursor 可以在命名的多 repo 环境中启动(而非单一默认仓库),目标环境能访问所有相关 repo;运行中可用「Switch repository button」加进当前环境之外的 repo,Cursor 从中断处继续;(3) Cross-channel workflows —— Cursor 可在多个 Slack 频道/thread 之间读写,把上下文从工作区其他地方拉进来,把更新发回原 thread 或相关频道。
Aug 5, 2026
论文
arXiv 2607.14749: WanSong v1.0 Technical Report
Hugging Face 2026-07-17 索引(arXiv 提交 7/16)的 arXiv 2607.14749(Wan-AI)给 WanSong v1.0 Technical Report —— 商用级 text-to-music 基础模型,单次端到端生成最长约 5 分钟歌曲,输出可分离的 vocal 与 BGM 双 stem;架构:连续 1-D VAE(44.1 kHz → 64 通道潜在,43.1 Hz 下采样 1024 倍)对抗式训练 + hybrid-MMDiT transformer(~25B 参数)处理 LLM 文本 token 与 dual-stem VAE 音频 token;能力:多语言(中/英/日/韩)最长 5 分钟歌曲、3 阶段预训练(90s → 300s → SFT)、为推理加速的 step-distillation、用 DPO 再 ReFL 的 RLHF 对齐;自报基准(WanSong Bench,~200 条 4 分钟 clips):PER 7.43% vs Suno V5 22.80% / Mureka V7.6 12.7% / LeVo 27.11%;SongEval 4.47/4.55/4.57/4.46/4.4;Muq 文本对齐 0.44;内部 musicality 5.49 vs Suno V5 4.18 / Mureka V7.6 3.83 / LeVo 1.69。
Aug 5, 2026
论文
Hugging Face: SEED ablation thread
SEED 7/17 论文 ablation(ALFWorld avg):去掉 Hindsight-Skill SFT → 86.0(-5.8);去掉 Self-Evolving OPD → 87.0(-4.8);用静态 offline skills 替代 on-policy skills → 84.4(-7.4);三段 ablation 加起来约 -18 分,意味着 on-policy 自演化与 hindsight-skill SFT 是两个独立的贡献项,各贡献一半左右;用 60% 训练数据(ALFWorld 80.7)就超过全量 GRPO(75.0)展示 SEED sample efficiency 显著高于 baseline。
Aug 5, 2026
论文
Hugging Face: LongStraw cluster thread
LongStraw 7/17 实现覆盖三个模型:Qwen3.6-27B(hybrid recurrent + full-attention)、GLM-5.2(compressed-attention MoE,78 层);HF daily papers 把 LongStraw 列为 7/17 #1 Daily Paper,获 207 赞;GitHub MindLab-Research/longstraw 41 stars;社区评论 O96a 质疑:对真实 agent loop(上下文在轨迹中间不可预测地增长)而非干净切成 prompt + generation 的场景,适用性如何?
Aug 5, 2026
媒体
The Decoder: IBM Research cryptography abstraction layer
The Decoder 2026-07-17 tech-press 报道 IBM Research 加密学抽象层提议(intent-based API、scopes 代表加密意图、策略/执行分离借鉴 SDN、provider 可互换、PQC 迁移支持)。
Aug 5, 2026
媒体
The Decoder: Cursor in Slack improvements
The Decoder 2026-07-17 tech-press 报道 Cursor in Slack 改进(plan-upfront、multi-repo environments、cross-channel workflows)。
Aug 5, 2026
社区
Hugging Face blog: Security incident disclosure — July 2026
Hugging Face 7 月 16 日博客披露一起由「autonomous AI agent 系统」端到端驱动、对 HF 部分生产基础设施的入侵;攻击者利用 dataset processing 的代码执行路径(远程代码 dataset loader + dataset configuration 的 template-injection)在处理 worker 上跑代码,升级到 node 级访问,窃取云与集群凭证,并在周末横向移动到多个内部集群;整个攻击由一个 autonomous agent framework 执行,在 swarm of short-lived sandboxes 中跑了数万次单个动作。披露的影响:部分内部 datasets 未授权访问,若干 HF 服务凭证被攻陷,公开面向用户的 models / datasets / Spaces 无被篡改证据,软件供应链(container images / published packages)验证 clean。HF 使用 zai-org/GLM-5.2 在自家基础设施上做 LLM-based triage over security telemetry,分析超过 17,000 条事件记录,原因是商业 API frontier model 因安全护栏把响应者也当成攻击者拦截。社区建议:预防性 rotate access tokens 与审查近期账号活动;security@huggingface.co 接报。
Aug 5, 2026
论文
arXiv 2607.12395: Ring-Zero — Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
arXiv 2607.12395(在 HF daily papers 上 7/16 索引)提出 Ring-2.5-1T-Zero —— 一个用 zero RL 在预训练 base 模型上直接训练、不需要人工标注 CoT 数据、依赖 RLVR 的模型;架构使用 Ling-2.5-1T-Base(1T MoE / 63B 激活)与 Ling-2.5-flash-Base(104B MoE / 7.4B 激活)两个 base 模型,四阶段训练 pipeline(一阶段 RL 用 clipped importance sampling policy gradient + token-level loss 诱发推理 / 自蒸馏用最短正确 rollout + 自反思压缩冗长 CoT / 二阶段 RL 用 sample-level loss normalization 做稳定优化 / 三阶段 RL 引入 4k / 16k / 64k 三层 token budget tier);基础设施用 320x H200 GPU + Megatron + SGLang + Areal 编排,BF16 body + FP32 attention softmax / LM head 混合精度,context parallelism 针对 hybrid MLA + Lightning Attention 架构调优。Ring-2.5-1T-Zero(Second Stage RL)在 AIME 2024 上达 94.1%,在 AIME 2025-2026 / HMMT 2025-2026 / IMOAnswerBench 上有竞争力;自发涌现 5 种认知行为(anthropomorphism / structured formatting / self-verification / parallel reasoning / context anxiety);CoT trace 在 comprehensibility / reproducibility(Qwen-32B 自蒸馏比 DeepSeek-R1 高 5.8 分)/ efficiency(用不到一半 token)上优于 baseline。
Aug 5, 2026
社区
vLLM blog: Keeping vLLM Production Quality
vLLM 7 月 16 日博客《Keeping vLLM Production Quality》记录每个 PR 必经的三层关卡:Layer 1 CI(每个 PR 跑轻量 GitHub Actions,Buildkite 上 37 个测试组 / 266 个任务按 diff 动态选取,共享多阶段容器镜像,pip-compile lock 文件,58 个 runner 队列跨 AWS / Crusoe / LambdaLabs / Nebius / NVIDIA / Roblox / RunPod,MIG-slicing 与 autoscale-from-zero 每机器 runner,自定义仪表盘 ci.vllm.ai,夜间 CI-analyzer bot 每天约 1.5 个 auto-revert PR / 约 70% 正确诊断);Layer 2 性能与精度(github.com/vllm-project/perf-eval 夜间 pipeline 跨 H200 / B200 / MI300X / MI355X 跑 17 个 model-hardware 配方:DeepSeek V4 Pro/Flash、gpt-oss、Kimi K2.5、MiniMax M2.5/M3、Qwen3.5、GLM 5.1、Gemma 4、Nemotron 3 Super,度量 TTFT / TPOT / vllm-bench,精度 lm-eval GSM8K / GPQA / AIME,函数调用 BFCL);Layer 3 release 自 2025 年 11 月起的双周节奏(每隔一周的周一 release manager 从 main 切 releases/vX.Y.Z,周一至周三 cherry-pick 窗口,只有三层全通过才发布候选),每个 release 发 7 个 Python wheels + 11 个 Docker images,发布前每个都做 smoke-test。
Aug 5, 2026
官方
Cohere blog: Cohere and the University of Toronto partner to advance responsible AI adoption at scale
Cohere 7 月 16 日博客宣布与多伦多大学的多年合作 —— 把 Cohere 的企业 AI 技术集成到 U of T 即将上线的全校 AI 平台,支持教学、研究、学生服务、行政、运营五大场景的负责任 AI 落地;Cohere 的 North 平台作为 U of T AI 平台内的 orchestration layer,帮用户管理复杂任务、安全访问各大学系统中的可信信息,支持 faculty / librarian / staff / student,同时把敏感数据留在大学的控制之下;Cohere 的技术也将驱动 U of T 的「AI Kitchen」—— 一个通过审核过的应用、合适的数据访问与隐私优先框架来探索和评估 AI 工具的安全环境;这次合作是 Cohere 创始人的回家 —— 2019 年他们以 U of T 学生身份创立公司(Aidan Gomez、Nick Frosst、Ivan Zhang);文章未披露具体资金数字。
Aug 5, 2026
社区
Hugging Face blog: Newer Models, Same Advantage — Dharma-AI
Hugging Face 7 月 16 日博客《Newer Models, Same Advantage》(Dharma-AI)在巴西葡萄牙语 OCR 任务上对比 Mistral OCR4(0.798)、Unlimited-OCR(0.7587)与 DharmaOCR(0.925);两个更新的通用 / 多语言模型虽然更新、资源更充足,但分数都明显低于 DharmaOCR;文章把 DharmaOCR 的持续优势归因于结构特化 —— (1) 领域集中:全部参数都用在巴西葡萄牙语词汇、形态、拼写模式上,而非分散在多种语言;(2) 两阶段训练:监督微调建立领域能力,再用 Direct Preference Optimization 在完整输出连贯性(而非逐 token 预测)上做训练,降低视觉歧义下的文本崩坏;文章主张这种优势是结构性而非临时性的 —— 通用模型把资源分散在多领域,专家模型用有限资源在本领域拿到更多;Mistral OCR4 把「Chico Buarque」读成「Chico Barque」,Unlimited-OCR 输出「a dose de chico bique」这种不连贯文本。
Aug 5, 2026
论文
arXiv 2607.13285: Harness Handbook — Making Evolving Agent Harnesses Readable, Navigable, and Editable
arXiv 2607.13285(在 HF daily papers 上 7/16 索引)是腾讯混元的一本 handbook / guide,讲如何设计更清晰、可导航、可编辑的 agent harness 架构。具体作者名单、架构模式目录、评估方法与参考实现均未提取。
Aug 5, 2026
论文
arXiv 2607.12747: Tracing Agentic Failure from the Flow of Success
arXiv 2607.12747(在 HF daily papers 上 7/16 索引)是一篇 4 作者论文,从成功的轨迹里反推 agentic 失败模式 —— 即在同一条轨迹曾经成功的环节定位失败。具体作者名单、失败分类法、评估方法与所用 agent / benchmark 均未提取。
Aug 5, 2026
论文
arXiv 2607.12625: KnowAct-GUIClaw — Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
arXiv 2607.12625(在 HF daily papers 上 7/16 索引)提出了 KnowAct-GUIClaw —— Lychee Team 的 GUI assistant,带 self-evolving memory 和 skill 模块。具体作者名单、Android / Web / Desktop GUI agent benchmark 上的具体分数、memory 模块架构、self-evolution 机制均未提取。
Aug 5, 2026
社区
Hugging Face: Security incident cluster thread
7 月 16 日 HF 安全事件三件套同日上:Hugging Face Security Incident Disclosure 主文(autonomous AI agent 端到端攻击 + GLM-5.2 取证)+ The Decoder tech-press 报道(autonomous agent 攻击向量、GLM-5.2 取证、合作伙伴 / 客户影响评估)+ Anatomy of a Frontier Lab Agent Intrusion 伴随深度技术时间线(HF blog 索引标注 security / Hot / 423 reactions)。三件套拼成「业界首例公开披露的 autonomous AI agent 攻击」完整叙事。
Aug 5, 2026
仓库
vLLM perf-eval GitHub repo (companion)
vLLM 7 月 16 日 perf-eval 仪表盘覆盖 17 个 model-hardware 配方,跨 H200 / B200 / MI300X / MI355X(DeepSeek V4 Pro/Flash、gpt-oss、Kimi K2.5、MiniMax M2.5/M3、Qwen3.5、GLM 5.1、Gemma 4、Nemotron 3 Super),度量 TTFT / TPOT / vllm-bench,精度 lm-eval GSM8K / GPQA / AIME,函数调用 BFCL;结果展示在 ci.vllm.ai/perf 与 ci.vllm.ai/eval。具体当前排行榜快照与每个 recipe 随时间的 TTFT / TPOT / 精度 delta 均未提取。
Aug 5, 2026
社区
Hugging Face: Welcome Inkling by Thinking Machines
Hugging Face 7 月 15 日博客宣布 Thinking Machines 的 Inkling —— 一个 ~1T 参数的开源多模态模型,原生接受图像、文本、音频输入,在 45T token 上训练。架构:decoder-only 多模态 MoE,975B 总参 / 41B 激活,256 个 expert + top-6 + 2 shared expert,1M 上下文窗口,相对注意力(无 RoPE),5:1 sliding-window 与 global 混合注意力,hidden state 上的短 1D 卷积(SConv),视觉用 hierarchical MLP patchifier,音频用 mel-spectrogram 离散化;变体为 Inkling BF16(2 TB VRAM)与 Inkling NVFP4(600 GB),Inkling-Small BF16 600 GB(276B / 12B 激活)/ NVFP4 180 GB;自报分 Inkling vs Inkling-Small:HLE 文本 29.7% / 31.6%、HLE 带工具 46.0% / 47.8%、AIME 2026 97.1% / 95.5%、GPQA Diamond 87.2% / 89.5%、SWE-Bench Verified 77.6% / 80.2%、SWE-Bench Pro 54.3% / 55.9%、Terminal Bench 2.1 63.8 / 64.69、MCP Atlas 74.1% / 79.2%、MMMU Pro 73.3% / 74.0%、VoiceBench 91.4% / 90.1%;协议未公开。
Aug 5, 2026
社区
vLLM blog: TML Inkling on vLLM — Day-0 Support
vLLM 7 月 15 日博客记录 Inkling day-0 支持 —— NVFP4 + BF16 变体完整功能对等,带 8 个 MTP head(每次 forward step 最多 9 个 token),原生支持 1M token;在 4x NVIDIA GB200 上 380 tok/s/user(MTP8,平均 acceptance length 4.5)、140 tok/s/user(无 MTP);按长度桶的精度数据 2K-221K 99.09% (436/440)、294K-513K 95.68% (421/440)、586K-805K 81.36% (358/440)。
Aug 5, 2026
社区
LMSYS blog: Inkling Day-0 Support in SGLang
LMSYS 7 月 15 日博客宣布 SGLang 同步 day-0 支持 Inkling —— 975B 多模态 MoE、1M 上下文,在 Blackwell 上达到 71.7k tok/s 输入吞吐。SGLang Cookbook 同步给出 Inkling 在 Blackwell TP4/TP8 / H200 / AMD MI350X / MI355X 的部署菜谱。
Aug 5, 2026
社区
Hugging Face: Real World VoiceEQ — Measuring the human quality of voice AI
Hugging Face 7 月 15 日博客宣布 Real World VoiceEQ —— 由 Hume + HF 共同构建的语音 AI 质量基准,基于 100 万+ 跨人群、口音、声学环境的人工评分,覆盖 40+ 专有与开源语音模型、15+ 评测维度、60+ 指标(ASR / TTS / S2S / 语音理解);当前数据集 78.5 万条 TTS 评分、4.8 万条 STS 评分;每次评测在 Hume 的 Kairos 平台运行;引用噪声环境下语音转写 WER 约为音乐环境下的 4 倍;公开 leaderboard 在 huggingface.co/spaces/HumeAI/rw-voice-eq,技术报告在 arXiv 2607.14846。
Aug 5, 2026
官方
Cohere blog: The total cost of AI ownership
Cohere 7 月 15 日博客《The total cost of AI ownership》把 AI 成本框定为「renting vs owning」跨数据中心、芯片、模型三层;引用 Gartner 2026 全球 AI 支出 2.52 万亿美元(YoY +44%)、IDC/DataRobot 96% 生成式 AI 与 92% agentic AI 部署面临高于预期成本、McKinsey ~1/3 组织把 AI 全企业规模化(5-6% 报告显著财务影响)、Mavvrik/Benchmarkit 80% 公司 AI 预测偏离 >25%、Uber 10% 已承诺代码由自主 agent 构建 12 个月预算 4 个月花光;NVIDIA Blackwell vs Hopper ~50x 每兆瓦 token / ~35x 每 token 成本;Lenovo 2026 摊销每百万 token 在自有 H100 ~$0.11、云实例 ~$0.89、前沿 API ~$2.00(对云 8x / 对 API 18x);8-GPU 服务器相对按需云在不到 4 个月内回本;收支平衡约在每天 4 小时使用率;SemiAnalysis InferenceX 在 GB300 上 $0.123 每百万 token。
Aug 5, 2026
社区
Hugging Face: Model Routing Is Simple. Until It Isn't. — IBM Research
Hugging Face 7 月 15 日博客文章,由 IBM Research 发表,题为《Model Routing Is Simple. Until It Isn't.》,讨论为什么随着系统规模增长,模型路由(把查询导向不同 AI 模型)会变得复杂,与初始的简单印象相违。具体框架名、决策图、代码样例、基准方法学在已捕获摘要里未提取。
Aug 5, 2026
社区
Hugging Face: Inkling day-0 cluster thread
7 月 15 日 Inkling 一日三发:Thinking Machines 在 HF 上发 ~1T 多模态开源 MoE、vLLM blog 发 day-0 支持(4x GB200 上 380 tok/s/user MTP8 + 1M 上下文)、LMSYS blog 发 SGLang day-0 支持(Blackwell 上 71.7k tok/s 输入吞吐);三方合起来把「1T 开源 + 一日就绪到推理引擎」做成了 7 月开源生态的最强一日之一。
Aug 5, 2026
论文
arXiv 2607.12463: Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
arXiv 2607.12463(在 Hugging Face daily papers 上 2026-07-15 索引)提出了一种函数感知的 fill-in-the-middle 方法,用作 coding agent 基础模型的中训练(mid-training)。具体作者名单、HumanEval / SWE-Bench / LiveCodeBench 等基准的精确提升、训练算力开销、每步训练方法学在已捕获摘要里未提取。
Aug 5, 2026
论文
arXiv 2607.11562: MonkeyOCRv2 — A Visual-Text Foundation Model for Document AI
arXiv 2607.11562(在 Hugging Face daily papers 上 2026-07-15 索引)提出了 MonkeyOCRv2 —— 一个面向文档 AI 任务的视觉-文本基础模型。具体作者名单、DocVQA / InfoVQA / ChartQA / OmniDocBench 等基准的精确数字、模型规模、训练数据组成与协议在已捕获摘要里未提取。
Aug 5, 2026
官方
Anthropic newsroom: Claude for Teachers
Anthropic 7 月 14 日(7 月 21 日更新)新闻发布 Claude for Teachers —— 为美国已认证 K-12 教师免费提供 Claude 高级功能、教学 skill 库、Learning Commons 接入(覆盖 50 个州学术标准对齐);能力含差异化教学支持、Claude Code + Cowork 自主任务处理、数据分析工具(教师控制数据共享、不用于训练);平台集成 ASSISTments / Brisk Teaching / Canva Education / Coteach / Diffit / Eedi / MagicSchool / Snorkl / TeachFX,加 OpenSciEd + Illustrative Mathematics 课程资源;对已认证 K-12 教师免费,2027-06-30 前注册得一整年访问;18+ 政策、FERPA 通过 K-12 Data Processing Addendum 合规,Anthropic 正在与美国教师联合会(AFT)合作制定 Gold Standard。
Aug 5, 2026
社区
vLLM blog: vLLM x TileRT — Specialized Decode for Latency-Critical Serving
vLLM 7 月 14 日博客记录 vLLM × TileRT 集成 —— 通过 vLLM V1 公开 connector 接口把 prefill 留在 vLLM、decode 交给 TileRT;TileRT 0.1.5 随此集成发布;两池通过 MultiConnector 在单一 prefill 实例后共存,routing/claim filter 只把标 latency-critical 的流量导向 TileRT;评测在 8x NVIDIA B200 跑 GLM-5.1-FP8、输入 1K-192K / 输出 1K,MTP 平均 acceptance length 3.2(峰值 4.0);每 TileRT decode 节点同一时刻一个 in-flight 请求;模型覆盖 GLM-5/5.1 + DeepSeek-V3.2。
Aug 5, 2026
仓库
SGLang release v0.5.15.post1
SGLang 7 月 14 日发布 v0.5.15.post1 —— 针对 GLM-5.2 的稳定性补丁,修复非 CUDA / HIP 设备上的 DSA 模型启动、flashinfer 依赖、NaN 输出,以及 PD-disaggregation + context-parallel 设置下的 GLM-5.2 IndexShare;搭配 v0.5.15(7 月 10 日发布,Blackwell 上 GLM-5.2 NVFP4 生产调优、默认启用 Spec V2 +11% e2e TPS、IndexShare MTP、TopK V2、indexer-prologue fusion、新增 Hunyuan 3 / HRM-Text / Qwen3.6 NVFP4)。
Jul 14, 2026
媒体
aihot.virxact.com: pixverse-c-round
aihot 2026-07-14 08:03 + TechCrunch AI:PixVerse 完成 C 轮扩展,融资累计 4.39 亿美元、估值 200 亿+;V 消费/API + C 专业影视 + R世界模型(游戏开发)产品线;4K 视频 + 音频;1.5 亿注册用户 / 1500 万+ MAU;图生视频 4.80 美元/分钟;投资者包括阿里巴巴。
Jul 14, 2026
媒体
aihot.virxact.com: anthropic-new-tokenizer-coding-cost-increase
aihot 2026-07-14 05:54 + buzzing.cc:Anthropic 新 tokenizer 同价位下比上一代多约 30% token;TypeScript 样本 GPT-5.x 681 token、Claude 新 1,178 token(1.73×);Opus 4.6 / 4.8 真实每代码任务成本 32% 上涨;coding agent 团队必须按每任务成本而不是每 token 标价来算。
Jul 14, 2026
媒体
aihot.virxact.com: openai-prompt-guide-for-end-users
aihot 2026-07-14 02:03 + The Decoder:OpenAI 面向普通用户的提示词指南,围绕四个可选模块(目标、上下文、输出格式、边界);强调「先讲结果,别替模型操心步骤」;明说「后续追问是预期的调整路径」。
Jul 14, 2026
官方
OpenAI: gpt-oss refresh
OpenAI 2026-07-13 index 页面发布 gpt-oss 开源权重线的刷新 —— 120B MoE + 20B dense 两个变体,带新后训练快照;协议 Apache-2.0 + OpenAI usage-policy 附约。自报基准数字:MMLU-Pro 84.6、GPQA-Diamond 76.2、LiveCodeBench v6 72.1、SWE-Bench Verified 68.3、BFCL v3 65.4、Terminal-Bench 2.1 76.8。语义边界:厂商 index + Hugging Face 社区模型卡 + 一条 The Decoder 科技媒体报道,不是任何具体分数的独立复现。
Jul 14, 2026
官方
Anthropic: Claude Sonnet 4.5
Anthropic 2026-07-13 官方新闻发布 Claude Sonnet 4.5 —— 定位在 Haiku 4.5 与 Opus 4.5 之间的「日常驱动位」中段旗舰;200K 上下文、原生 tool-use 加 extended-thinking 模式;定价维持每百万 token 输入 $3 / 输出 $15(与上一代 Sonnet 一致)。自报数字:SWE-Bench Verified 67.4、GPQA-Diamond 74.8、MMLU-Pro 82.9、BFCL v3 63.7、Terminal-Bench 2.1 74.2。部署面:API + claude.ai + AWS Bedrock + Google Vertex AI。语义边界:厂商 newsroom + Hugging Face 社区卡 + The Decoder 一条 tech-press,不是具体分数的独立复现。
Jul 14, 2026
官方
Google: Gemini 3.5 Pro mid-July
Google 2026-07-13 blog 发布 Gemini 3.5 Pro 中段 7 月更新,主打 agent 脚手架(server-side tool-use loop)和一个新增的 image-edit-via-namespace 端点;Pro 档定价不变。自报数字:MMLU-Pro 86.3、GPQA-Diamond 79.1、LiveCodeBench v6 75.4、SWE-Bench Verified 71.2、BFCL v3 68.9、Terminal-Bench 2.1 78.5。部署面:Gemini API + Vertex AI。语义边界:厂商 blog + Hugging Face 社区模型卡;今天没有媒体交叉验证。
Jul 14, 2026
官方
Meta: Llama 4 Behemoth refresh
Meta AI 2026-07-13 blog 发布 Llama 4 系刷新,主打长上下文(1M + token-efficiency)与 code-weight 专家。自报数字:MMLU-Pro 83.4、GPQA-Diamond 75.6、LiveCodeBench v6 73.8、SWE-Bench Verified 69.7、HumanEval+ 91.2、Terminal-Bench 2.1 75.9。协议:Llama 4 Community License + 商业使用限制附约。语义边界:厂商 blog + Hugging Face 社区卡;基准数字均为厂商自陈。
Jul 14, 2026
官方
ByteDance Volcengine: Doubao 1.6 Pro
字节跳动火山引擎 2026-07-13 产品动态发布 Doubao 1.6 Pro 刷新 —— 256K 上下文、tool-use schema 刷、后训练偏文档抽取 / 检索增强型任务。自报数字:MMLU-Pro 80.7、GPQA-Diamond 72.4、C-Eval 88.6、CMMLU 86.9、LiveCodeBench v6 70.3、Terminal-Bench 2.1 73.5。协议:Volcengine API 上的商用 only,完整权重门控仅在 API。语义边界:厂商产品动态 + Hugging Face 镜像卡(标为 researcher preview only)。
Jul 14, 2026
官方
Zhipu Z.ai: GLM-4.6
智谱 2026-07-13 BigModel 平台动态发布 GLM-4.6 刷新,带 AutoGLM-Coder 编程专家后训练与 agent 脚手架。自报数字:MMLU-Pro 81.2、GPQA-Diamond 73.5、HumanEval+ 90.8、MultiPL-E 87.6、SWE-Bench Verified 67.8、Terminal-Bench 2.1 74.6。协议:BigModel / Z.ai 上的商用 only;开源版本「将另行发布」(厂商声明的将来承诺,不是当下构件)。语义边界:厂商平台动态 + Hugging Face 镜像卡;基准数字均为厂商自陈。
Jul 14, 2026
媒体
aihot.virxact.com: meta-louisiana-5gw-datacenter-50b-investment
aihot 2026-07-13 18:35 + IT之家:Meta 路易斯安那州数据中心扩至 5GW,总投资 500 亿+;Meta 承担全部本地能源 + 水资源费用 + 10 亿+ 本地基建投入;签 Entergy 协议为新建天然气电厂、储能电池、核电增容提供资金。
Jul 14, 2026
媒体
aihot.virxact.com: xai-grok-cli-silent-codebase-upload-disclosure
aihot 2026-07-13 08:10 + buzzing.cc:xAI 官方 Grok CLI 0.2.93 每轮对话静默把工作目录 + ~/.claude.json + 全局 AGENTS 规则 + 30+ Skill 文件 + 一个 API key 通过独立旁路通道上传至 xAI 的 Google Cloud 桶;xAI 后续上线服务端的 disable_codebase_upload 关闭开关。
Jul 14, 2026
媒体
aihot.virxact.com: ploy-ai-agent-migrated-claude-opus-to-gpt-5-6-sol
aihot 2026-07-13 07:54 + buzzing.cc:Ploy 把 AI agent 默认模型从 Claude Opus 4.8 切到 GPT-5.6 Sol —— 构建时间 8 分钟 → 3:42(2.2×)、单次构建成本 $3.06 → $2.22(–27%)、输出 token 33.0K → 17.1K、视觉评分 0.936 → 0.970;同时披露 GPT-5.6 Sol 给 25 个工具参数默默填默认值,52–64% 文件读取返回空结果。
Jul 14, 2026
媒体
aihot.virxact.com: altman-amodei-ai-net-jobs-narrative-shift
aihot 2026-07-12 17:28 + The Decoder:OpenAI CEO Altman 与 Anthropic CEO Amodei 同时软化早期「AI 取代就业」口径 —— Altman 称「相当确信 AI 至今净创造就业」;并对照引用若干尚未发现 AI 整体生产力 / 劳动市场影响的研究。
Jul 14, 2026
媒体
aihot.virxact.com: apple-v-openai-trade-secrets-ai-hardware-suit
aihot 2026-07-11/12 + IT之家 + TechCrunch AI:Apple 在加州北区联邦法院起诉 OpenAI(以及 Tang Tan、Chang Liu、io Products)系统性窃取商业机密用于开发消费级 AI 硬件;约 400 名 Apple 前员工现就职 OpenAI;案件涉及消费级硬件产品;2026 年 2 月私了尝试被 OpenAI 拒绝。
Jul 13, 2026
官方
Qwen Blog: Qwen3-Max
阿里通义千问团队 2026-07-12 博客公开 Qwen3-Max:1.2T 总参 / 32B 激活 MoE,1M 上下文,原生 tool-use / function-calling schema;部署面 Tongyi Qianwen + Model Studio + DashScope OpenAI 兼容 API;协议 Apache-2.0 + 中国监管侧 acceptable-use 附约。自报基准数字:MMLU-Pro 87.1、GPQA-Diamond 81.4、LiveCodeBench v6 78.2、SWE-Bench Verified 74.5、BFCL v3 72.0、MTEB 多语 71.6、Terminal-Bench 2.1 81.0。语义边界:这是厂商发布 + Hugging Face 社区模型卡 + 一条 tech-press 报道,不是任何具体分数的独立复现。
Jul 13, 2026
官方
Mistral News: Mistral Large 3
Mistral 2026-07-12 官方新闻公开 Mistral Large 3:145B 参数 dense 旗舰,128K 上下文,原生 function-calling + JSON-schema tool-use,配套 chat-instruct 变体;部署 Mistral La Plateforme + Azure AI Foundry + Bedrock;权重格式 BF16 sharded safetensors + MXFP4 推理快照;协议 Apache-2.0 + Mistral-research 附约。自报数字:MMLU-Pro 79.2、GPQA-Diamond 71.6、HumanEval+ 93.4、MultiPL-E 88.1、MT-Bench v3 9.21、IFEval strict 88.4。语义边界:厂商 + Hugging Face 社区模型卡;基准数字均为厂商自陈。
Jul 13, 2026
官方
Moonshot AI: Kimi K2.7-0913
Moonshot AI 2026-07-12 平台博客公开 Kimi K2.7-0913:K2 系权重 re-tag(架构不变:1.1T 总参 / 32B 激活 MoE,Apache-2.0 + K2 acceptable-use 附约),强化长文本指令遵循 + agent 脚手架(browser / shell / file-system tool handler) + 良性长上下文场景拒答减少。相对 K2 的自报提升:IFEval strict 86.7(vs 81.4)、WildChat-Write 9.04(vs 8.81)、AgentBench-lite 78.4(vs 71.2)、64K NIAH 99.2%。语义边界:这是已有权重的刷新,不是基础模型迭代;提升数字是相对 K2 基线的厂商声明 delta。
Jul 10, 2026
官方
Anthropic Newsroom: Inviting hard questions
Anthropic 2026-07-09 在官方 Newsroom 公开「Inviting hard questions」倡议,邀请公众就 AI 对就业、社会等影响提出尖锐问题;Anthropic 明确表述为「征询最难的问题 + 承诺在处理过程中 show our work」。语义边界:这是一项公开征询 + 公开回应追踪承诺,而非新设独立监管或强制问责机制。
Jul 10, 2026
官方
Anthropic Newsroom: Ben Bernanke appointed to Long-Term Benefit Trust
Anthropic 2026-07-09 官方公告:任命前美联储主席 Ben Bernanke 加入公司 Long-Term Benefit Trust,与现 Chair Neil Buddy Shah、Richard Fontaine、Mariano-Florentino Cuéllar 共同组成 4 位具名受托人;Co-Founder & President Daniela Amodei 公开阐述「AI 可能是现代史上经济影响最大的技术,Anthropic 有双重的理解与行动责任」。语义边界:LTBT 持有少数股权、并无对产品 / 研究决策的运营否决权,本次任命属于公司治理结构更新而非新增约束。
Jul 10, 2026
官方
Google Research Blog: SensorFM
Google Research 7/9 官方博客发表 SensorFM(Xin Liu + Daniel McDuff):面向可穿戴健康的通用基础模型,预训练数据「1 万亿 + 分钟传感器信号 / 来自约 500 万具名同意的人(100+ 国家 / 全美 50 州 / 20+ Fitbit 与 Pixel Watch 型号,数据窗口 2024-09 → 2025-09)」;5 种传感器(PPG、加速度、EDA、皮温、海拔)+ 34 个一分钟级聚合特征。规模曲线跨 4 个量级(~2M → 2B 传感器小时 / 100K → 100M 参数)。最大变体 SensorFM-B 较最小变体:reconstruction loss 下降 31%、分类 AUC 平均提升 9%、回归 Pearson 提升 21%,35 项迁移任务中胜 33 项。Personal Health Agent 评测:31 份参与者画像、1860 份临床医生评分。语义边界:这是研究博客公布的基础模型 + 迁移基准,不是 FDA 认证 / 临床部署 / 诊疗决策辅助;涉及健康话题时务必保留风险提示。
Jul 9, 2026
官方
xAI News: Introducing Grok 4.5
xAI 7 月 8 日发布 Grok 4.5,定位 SpaceXAI 最新旗舰,主打 coding、agentic 与知识工作;模型与 Cursor 共同在「数万台 NVIDIA GB300 GPU」上训练。自报基准:DeepSWE 1.0 62.0%(Fable max 66.1%、GPT 5.5 xhigh 64.31%)、SWE Marathon 29.0%(自报最高)、Terminal Bench 2.1 83.3%、SWE Bench Pro 64.7% resolve rate,在 SWE Bench Pro 上输出 token 比 Opus 4.8(max)少 ~4.2 倍(15,954 vs 67,020);~80 TPS 服务,定价每百万 token 输入 $2 / 输出 $6;已在 Grok Build、Cursor(全 plan)与 SpaceXAI API 上架,欧盟尚未上架,预计 7 月中。
Jul 9, 2026
官方
xAI News: Grok 4.5 (Cursor integration thread)
xAI 7 月 8 日发布 Grok 4.5 同时把这款模型在 Cursor 全 plan 作为默认选项上架;模型被描述为与 Cursor 工程团队在「数万台 NVIDIA GB300 GPU」上共同训练的产物,Cursor 是发布当天就接入的渠道,而非后续补漏。
Jul 9, 2026
社区
Hugging Face Blog: Native-speed vLLM transformers modeling backend
Hugging Face 7 月 8 日博客:启用 `--model-impl transformers` 后,transformers modeling backend 在三个 Qwen3 工作负载(4B dense 单卡 / 32B dense tensor parallelism / 235B 参数 FP8 MoE Qwen3-235B-A22B-FP8 在同一节点 8xH100 上 data + expert parallelism)上达到或超过 vLLM 手写原生 backend;技术用 torch.fx 静态图捕获加 Python ast rewrite,让 Python modeling 代码留在热路径上、由编译器做融合与预分配。线性注意力模型(Mamba2、RWKV 等)在这次 pass 明确不支持。
Jul 9, 2026
官方
Microsoft Research Blog: Flint — A Visualization Language for the AI Era
Microsoft 7 月 8 日博客公开 Microsoft Flint —— Microsoft Research + 中国人民大学 IDEAS Lab 联合项目,把 chart-spec 语言与 MCP server 配对,让 AI agent 可以从简短的人类可编辑 spec 直接产出 Vega-Lite、ECharts、Chart.js;开源仓库 microsoft/flint-chart 在 2026-06-28 打了第一个 tag v0.1.1。研究论文自述「coming soon」。
Jul 9, 2026
仓库
Hugging Face: deepseek-ai/DeepSeek-V4-Pro-DSpark
Hugging Face 上 deepseek-ai/DeepSeek-V4-Pro-DSpark 模型卡(上传 2026-06-27、最后修改 2026-07-08):DeepSeek-V4-Pro 是 1.6T 总参 / 49B 激活 MoE,1M 上下文,MIT 协议,使用 Hybrid Attention 设计(CSA+HCA)加上 Muon 优化器与 manifold-constrained hyper-connections;DSpark 增加一个 confidence-scheduled speculative decoding 模块,带 semi-autoregressive 生成。
Jul 9, 2026
仓库
Hugging Face: zai-org/GLM-5.2
Hugging Face 上 zai-org/GLM-5.2 模型卡(上传 2026-06-16、最后修改 2026-07-02):753B 参数 MoE(BF16 + F32,sharded safetensors),使用 Glm MoE DSA —— 稀疏注意力机制,通过「IndexShare」让每四个稀疏注意力层共用一个 indexer,声称在 1M 上下文下每 token FLOPs 减 2.9 倍;MIT 协议,无地区限制;自报分 GPQA-Diamond 91.2、SWE-bench Pro 62.1、DeepSWE 46.2、HLE 默认 40.5 / 带工具 54.7、AIME 2026 99.2、Terminal Bench 2.1 (Best Harness) 82.7。
Jul 9, 2026
仓库
Hugging Face: tencent/Hy3
Hugging Face 上 tencent/Hy3 模型卡(上传 2026-07-02、最后修改 2026-07-06):腾讯混元第三代 MoE,295B 总参 / 21B 激活,Apache-2.0 协议,256K 上下文,80 层,带一个 multi-token prediction (MTP) 层;自报分 GPQA Diamond 90.4、SWE-bench Verified 78、SWE-bench Pro 57.9。
Jul 9, 2026
仓库
Hugging Face: meituan-longcat/LongCat-2.0
Hugging Face 上 meituan-longcat/LongCat-2.0 模型卡(上传 2026-07-05、最后修改 2026-07-08):美团 LongCat 第二代为 1.6T 总参 / ~48B 激活 MoE,MIT 协议,引入 LongCat Sparse Attention(Streaming / Cross-Layer / Hierarchical Indexing)与 135B N-gram embedding,基于 35T+ token 训练。
Jul 9, 2026
仓库
Hugging Face trending — Chinese MoE wave cluster thread
7 月第一周中国开源 MoE 在 Hugging Face 一周内四连上:DeepSeek-V4-Pro(1.6T 总参 / 49B 激活 / Hybrid Attention / Muon)、GLM-5.2(753B MoE / Glm MoE DSA / IndexShare 1M 上下文 2.9x FLOPs)、腾讯 Hy3(295B / 21B / 256K + MTP)、美团 LongCat-2.0(1.6T / ~48B / LongCat Sparse Attention + 135B N-gram embedding)。共同方向:sparse attention at long context。
Jul 9, 2026
社区
Hugging Face Blog: LeRobot v0.6.0 — Imagine, Evaluate, Improve
Hugging Face 7 月 7 日博客:LeRobot v0.6.0 「Imagine, Evaluate, Improve」 — 新增 world-model 策略(VLA-JEPA 基于 Qwen3-VL-2B,JEPA 世界模型在训练时监督、推理时消失;LingBot-VA 自回归视频-动作模型,单卡 24-32 GB GPU 可跑;FastWAM 把 ~5B 视频生成专家与紧凑动作专家配对);5 个新 VLA(GR00T N1.7 替代 N1.5、MolmoAct2、EO-1、Multitask DiT ~450M、EVO1 0.77B);2 个奖励模型(Robometer 基于 Qwen3-VL-4B、>1M 轨迹、RSS 2026 论文 arxiv:2603.02115、TOPReward 零样本 Qwen3-VL log-prob 包装);6 个新仿真基准(LIBERO-plus / RoboTwin 2.0 / RoboCasa365 / RoboCerebra / RoboMME / VLABench);`lerobot-rollout` 部署 CLI 带 DAgger 策略;HF Jobs 云训练 `--job.target=a10g-small`;FSDP 训练;数据加载 ~2x 提速;PyTorch 2.7-2.11 支持;基础依赖减 ~40%。
Jul 9, 2026
官方
Anthropic: Fable 5 cyber safeguards + CJS scale thread
Anthropic 7 月 2 日发布 Fable 5 cyber safeguards 与 jailbreak framework 详情:与「Glasswing partners」(Amazon、Microsoft、Google)联合起草 Cyber Jailbreak Severity (CJS) 量表 —— 五个等级 CJS-0 Informational(0 分)、CJS-1 Low(1-3.5)、CJS-2 Medium(4-6.5)、CJS-3 High(7-8.5)、CJS-4 Critical(9-10),按四个维度打分(capability gain、breadth、ease of weaponization、discoverability),最终等级只能上调、不能下调。
Jul 9, 2026
官方
Anthropic: Fable 5 cyber safeguards (HackerOne bounty thread)
Anthropic 7 月 2 日发布 Fable 5 cyber safeguards 的 HackerOne bug-bounty 项目 hackerone.com/anthropic-cyber-jailbreak 接受 Fable 5 cyber jailbreak 提交,反馈邮箱 cyber-safeguards@anthropic.com;分类器把 cyber 活动分为四类(Prohibited、High-risk dual use、Low-risk dual use、Benign),留比以往模型更大的安全边界。
Jul 8, 2026
社区
Hugging Face Blog: From Hugging Face to Amazon SageMaker Studio in one click
Hugging Face 7 月 7 日博客宣布与 Amazon SageMaker AI 的 deep-link 集成 —— 模型页面出现「Customize on SageMaker AI」与「Deploy on SageMaker AI」按钮,直接打开对应 Studio workflow;新 Studio 环境自动获得 AmazonSageMakerModelCustomizationCoreAccess managed policy(SFT/DPO/RLVR/RLAIF 微调 + SageMaker AI/Bedrock endpoint 部署),实例选择 UI 内联展示 G5/G6 GPU 配额状态并直跳 Service Quotas。
Jul 8, 2026
社区
Hugging Face Blog: Hugging Face Models on Foundry Managed Compute
Hugging Face 7 月 7 日博客记录 Microsoft Build 2026 推出 Foundry Managed Compute,内嵌一个每周刷新的 Hugging Face 开源模型目录,覆盖 LLM / VLM / ASR / embedding / 分割 / 图像生成,只发 SafeTensors 格式;Microsoft 预存权重到 Azure storage,构建并 CVE 扫描 runtime 镜像(vLLM、SGLang、TensorRT-LLM、NIM、TEI、llama.cpp、hf-serve),当前预览支持 NVIDIA A100/H100 + AMD MI300X。
Jul 8, 2026
社区
Hugging Face Blog: zero-egress storage with SkyPilot
Hugging Face 7 月 7 日博客:Hugging Face Storage 通过 `store: hf` 选项与 `hf://` URL 接入 SkyPilot —— Bucket(读写)/model/dataset/Space(只读)用 `hf-mount` FUSE 驱动挂载到 SkyPilot 任务中(MOUNT/COPY 双模式、lazy read),数据可在 20+ 云 + Kubernetes + Slurm + 本地环境间无 egress/CDN 费地读,Qwen3.5-4B SFT 基准 ~30 秒免费加载完、最高 500 MB/s,checkpoint 112-168 MB/s 跨 AWS/GCP/Lambda 写入 Bucket;Bucket 底层 Xet 支持增量去重。
Jul 8, 2026
官方
Anthropic Features: The Making of Claude Code
Anthropic 7 月 6 日 features 文章:The Making of Claude Code 公开 Claude Code 的内部起源 —— 工程师先在终端里用,刻意选了 terminal-native 体感(最小化表面面积、透明的 tool use、与现有开发环境紧密集成)而不是另起一个 IDE;后来才公开发布。
Jul 8, 2026
官方
Anthropic Features: The Making of Claude Code (positioning thread)
Anthropic 7 月 6 日 features 文章把 Claude Code 定位为尊重开发者现有工作流的产品(用户可以打断、改向、部分接受改动),同时支持云端 + 本地两种部署;Anthropic 公开表态「开发者工具的下一步跳变是 agent 协作,而不是替代」。
Jul 8, 2026
官方
Anthropic Features: The Making of Claude Code (origin thread)
单条 signal 切出 Claude Code 内部 CLI 起源:工程师先在终端里用,选了 terminal-native 体感,刻意不要 IDE 化的产品;早期用户报「少补全自动、多像协作」。
Jul 8, 2026
仓库
huggingface/transformers v5.13.0 release
huggingface/transformers 7 月 3 日发 v5.13.0,一次性接入 8 个新模型:Kimi K2.5/2.6/2.7(Moonshot 多模态 agent,长周期编码 + 前端 + Rust/Go/Python swarm 编排)、Xiaomi MiMo-V2-Flash(27T token MoE、32k 原生上下文、可扩展 256K)、Zyphra ZAYA1(760M active / 8.4B total MoE + 压缩卷积注意力)、OpenBMB MiniCPM3-4B(DeepSeek-V2 MLA + SwiGLU);视觉/视频:Google DeepMind VideoPrism(36M 视频-字幕对 + 582M 噪声片段预训练)+ NVIDIA RADIO(把 CLIP/DINOv2/SAM 蒸馏到单一可变分辨率 ViT);ASR:NVIDIA Nemotron 3.5 ASR + Nemotron ASR Streaming(80/160/560/1120 ms chunk 可配) + Qwen3 ASR(Whisper-style 编码器 + Qwen3 解码器 + forced-aligner);同时推出 HfExporters 子系统(DynamoExporter / OnnxExporter / ExecutorchExporter 三个子类 + prefill/decode 自动切分)。
Jul 8, 2026
仓库
huggingface/transformers v5.13.0 (ASR cluster thread)
transformers v5.13.0 的 ASR 子集:NVIDIA Nemotron 3.5 ASR(多语种,FastConformer-RNNT 后端)+ Nemotron ASR Streaming(英文流式,cache-aware FastConformer-RNNT,80/160/560/1120 ms chunk 可调延迟)+ Qwen3 ASR(Whisper-style 音频编码器 + Qwen3 解码器,带 forced-aligner 时间戳头)。
Jul 8, 2026
仓库
huggingface/transformers v5.13.0 (vision cluster thread)
transformers v5.13.0 的视觉/视频子集:Google DeepMind VideoPrism(通用视频编码器,36M 视频-字幕对 + 582M 噪声片段预训练)+ NVIDIA RADIO(把 CLIP、DINOv2、SAM 蒸馏到单一可变分辨率 ViT)。
Jul 8, 2026
仓库
huggingface/transformers v5.13.0 (HfExporters subsystem)
transformers v5.13.0 推出 HfExporters 子系统 —— 统一基类 + DynamoExporter / OnnxExporter / ExecutorchExporter 三个子类,给 PyTorch/ONNX/ExecuTorch 导出提供单一 API,对生成式模型自动做 prefill/decode 切分;同时标准化 layer 声明、mask/cache 构造、混合注意力处理,让模型可以干净地导出到 ONNX / torch.export / ExecuTorch。
Jul 7, 2026
仓库
Hugging Face Hub: kernels repository directory
配合 7/6 Kernels 改版,Hub 上 huggingface.co/kernels 上线了[kernel] 仓库目录,共 127 个仓库、5 页。下载量最高的是 flash-attn3(6.79k)、flash-attn2(6.63k),更新最频繁的有 vllm-moe、flashrt-fp8-swiglu-ffn、aiter-kernels 等。发布者包括 kernels-community、kernels-staging、flashrt、MiniMaxAI 和大量个人贡献者。
Jul 7, 2026
社区
Hugging Face Blog: LeRobot v0.6.0 — Imagine, Evaluate, Improve
Hugging Face 7 月 7 日发 LeRobot v0.6.0(主题「Imagine, Evaluate, Improve」)。新引入三个世界模型策略 VLA-JEPA、LingBot-VA、FastWAM,让机器人在训练中「想象」未来状态;统一了 reward-models API,首发 Robometer(基于 Qwen3-VL-4B,产生逐帧进度曲线)与 zero-shot TOPReward;数据集层加了自定义视频编码(NVENC / VideoToolbox / VAAPI / QSV)、Intel RealSense 深度采集、lerobot-annotate CLI 生成 VLM 语言标注,加载速度最高 2x。一次性统一了 6 个新仿真基准 LIBERO-plus、RoboTwin 2.0、RoboCasa365、RoboCerebra、RoboMME、VLABench,全部进入 lerobot-eval CLI;部署侧新增 lerobot-rollout(DAgger 式人在回路纠错),训练侧加 FSDP 与 HF Jobs 一键云训练。底层基础依赖减少约 40%,支持 PyTorch 2.7-2.11 + CUDA 12.8,加 Foxglove 流式可视化与 pip 可装插件包。
Jul 7, 2026
官方
Anthropic News: Alberta Government + Claude cybersecurity case study
Anthropic 7 月 6 日案例文章:加拿大 Alberta 政府科技创新部用 Claude Code(Opus + Sonnet)并行跑 ~50 个 agent,在 20 小时内跨 1,280 个应用、3,400 个仓库扫描 4.66 亿行代码;同样的活人工估计要 6.5 年。Pipeline 是「规则引擎 + 验证 agent(精确到文件/行号)」两步,然后自动改、写测试、重写老系统;还基于 Claude Agent SDK 组建红队 / 蓝队 agent,持续跑约 95 项安全控制。
Jul 7, 2026
官方
Anthropic Research: A global workspace in language models
Anthropic 7 月 6 日的可解释性研究文章「A global workspace in language models」:用 Jacobian lens(J-lens)读出 Claude 内部一处自发涌现的小型「J-space」,其内容因果驱动多步推理——例如把 J-space 里的「Soccer」换成「Rugby」、「spider」→「ant」、「France」→「China」,下游行为会跟着变。J-space 仅占 Claude 内部活动不到十分之一,屏蔽它会让高阶推理消失,但语法流畅性和简单回忆不受影响。Neel Nanda(DeepMind)做了独立复现。
Jul 7, 2026
社区
Hugging Face Blog: 🤗 Kernels — Major Updates
Hugging Face 7 月 6 日对自定义 compute kernel 的打包/分发/消费做了大改版:Hub 上线 [kernel] 仓库类型;新增两层安全——trusted kernel publishers(需用户 trust_remote_code 显式启用)+ Sigstore cosign 签名(临时密钥 + GitHub workflow 验证);kernels 和 kernel-builder 两个 CLI 拆分;新增 Torch Stable ABI(目标覆盖约 2 年的 Torch 版本)与首个非 Torch 框架 Apache TVM FFI;为 agent 自动开发 kernel 准备了 agent-optimized CLI + backend skills + HF Jobs 基准;同时把静态 libstdc++ 切到 manylinux_2_28 动态链接,解决了过去的 corruption/segfault。
Jul 7, 2026
社区
Hugging Face Blog: Photoroom PRX Part 4 — Our Data Strategy
Photoroom 7 月 6 日在 HF 博客发 PRX Part 4 — Our Data Strategy:用 Qwen3-VL-8B 对每一张 PRX 文生图训练图像重新打标,验证了「长的准确 caption 战胜短的 caption」、JPEG 质量 92 与 PNG 视觉上无明显差异,captioner 选用在 PRX 预训练上降了 FID / CMMD / DINO-MMD;数据用 Lance 探索、按分辨率与宽高比分桶重写进 Mosaic Data Shards 以支持流式读,轻量 caption 过滤和 perceptual-hash 去重用 skip list 而不是重写 shard。
Jul 7, 2026
官方
OpenAI API Changelog: GPT-Realtime-2.1 + GPT-Realtime-2.1 mini
OpenAI 7 月 6 日 API 更新日志唯一一条:GPT-Realtime-2.1 上线,实时推理模型,改进 alphanum 字符识别、静音与噪音处理、打断行为;同步放出 GPT-Realtime-2.1 mini(蒸馏版,更快更便宜)。两个都跑在 v1/realtime 端点。
Jul 7, 2026
官方
Anthropic News: Fable 5 cyber safeguards + jailbreak framework
Anthropic 7 月 2 日发布 Fable 5 的网络安全保护细节,并与 Glasswing 合作伙伴提出一个提案性的 Cyber Jailbreak Severity (CJS) 框架,从「能力获得 / 能力获得范围 / 武器化难度 / 可发现性」四个轴线对 jailbreak 做 0-4 评分,同时开通了 HackerOne 提交通道。
Jul 7, 2026
论文
arXiv 2607.02087: SUNTA — Hierarchical Video Prediction with Surprise-based Chunking
arXiv 编号 2607.02087 的论文 SUNTA(Iiyama / Suzuki / Matsuo,7/2 投稿):用「惊喜」(预测误差)驱动层次化状态空间模型 HSSM 的分块边界,而不是固定长度或相似度;通过解耦训练与「自上而下的内部不一致」充当 open-loop surprise 信号,在 2D 与 3D 视频预测上能稳 250 个时间步,而所有 baseline 在 10 个时间步内就开始退化。
Jul 7, 2026
官方
Anthropic Platform Release Notes: Claude Fable 5 + Mythos 5 access restored
Anthropic 7 月 1 日 release notes 单独一条:Claude Fable 5 与 Claude Mythos 5 在 API 上恢复访问。这一条不是新模型,是恢复可用性 — 但它把本批 7/1-7/7 Anthropic 系列动作收尾的意义放到了可发布窗口。
Jul 6, 2026
社区
Hugging Face
Hugging Face 在 2026 年 7 月 1 日的博客中描述了一个级联式语音到语音 pipeline,串起 Nvidia 的 Parakeet(语音识别)+ Google DeepMind 的 Gemma 4 31B VLM(跑在 Cerebras 推理上)+ Alibaba 的 Qwen3TTS(语音合成),目标是为 Reachy Mini 机器人等场景提供实时语音 AI。文章未公开具体延迟数字(ms / P95),只做了定性对比;代码开源(huggingface/speech-to-speech)。
Jul 6, 2026
社区
Hugging Face (IBM Research)
Hugging Face 博客 2026 年 6 月 30 日发布 IBM Research 的「ScarfBench: Benchmarking AI Agents for Enterprise Java Framework Migration」,这是一个评估 AI agent 在企业级 Java 框架迁移任务上表现的 benchmark。本条仅来自 HF RSS 的标题 + pubDate,正文未抽取。
Jul 6, 2026
社区
Hugging Face (Dharma-AI)
Hugging Face 博客 2026 年 6 月 30 日发布 Dharma-AI 的观点文「Why Specialization Is Inevitable」,主张 AI 模型的专门化是一条不可避免的方向。本条仅来自 HF RSS 的标题 + pubDate,正文未抽取。
Jul 6, 2026
社区
Hugging Face
Hugging Face 在 2026 年 6 月 30 日的博客发布「Featuring Every Eval Ever Results on Hugging Face Model Pages」,把「Every Eval Ever」(EEE)社区评估结果展示到 HF 模型页面上。本条仅来自 HF RSS 的标题 + pubDate,正文未抽取。
Jul 6, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 30 日的 RSS 公告中发布「Inside Genebench-Pro」案例集,展示 GeneBench-Pro 在真实复杂基因组数据集上是怎么测的。本条来自 OpenAI RSS 公告,正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 6, 2026
社区
Hugging Face (AllenAI)
Hugging Face 博客 2026 年 6 月 29 日发布 AllenAI 的研究文章「DiScoFormer: One transformer for density and score, across distributions」,介绍一个统一的 transformer 同时用于密度估计与 score 估计。本条仅来自 HF RSS 的标题 + pubDate,正文未抽取。
Jul 6, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 23 日的 RSS 公告中介绍 Omio 如何用 OpenAI 驱动对话式旅行体验、加速产品开发,并转型为 AI-native 公司。本条来自 OpenAI RSS 公告,正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 6, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 14 日的 RSS 公告中启动 OpenAI Partner Network,投入 1.5 亿美元,帮助全球合作伙伴加速企业 AI 的采用、部署与转型。本条来自 OpenAI RSS 公告,正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 6, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 9 日的 RSS 公告中发布「Industrial policy for the Intelligence Age」。本条来自 OpenAI RSS 公告(无 description 字段),正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与 pubDate。
Jul 6, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 8 日的 RSS 公告中披露,已向 SEC 秘密递交 S-1 招股书草案。本条来自 OpenAI RSS 公告(无 description 字段),正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与 pubDate。
Jul 3, 2026
官方
Anthropic
Anthropic 在 2026 年 7 月 3 日的公告中描述了 Fable 5 网络安全分类器「会拦什么 / 不拦什么」,并发布越狱严重度框架的初版草案。
Jul 3, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 26 日的 RSS 公告中预告 GPT-5.6 Sol — 一款下一代模型,在 coding、科学与网络安全能力上更强,并配以最先进的 safety stack。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 3, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 23 日的 RSS 公告中称,OpenAI 协助建立先进 AI 的共享标准,通过 Appia Foundation 支持评估框架、安全实践与全球合作。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 3, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 22 日的 RSS 公告中介绍 Daybreak,一套包含 Codex Security 与 GPT-5.5-Cyber 的工具集,帮助组织大规模发现、验证并修补漏洞。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 3, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 22 日的 RSS 公告中介绍 Patch the Planet,一个 Daybreak 旗下计划,帮助开源维护者用 AI 与专家评审发现、验证并修补漏洞。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 3, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 22 日的 RSS 公告中称,Jason Liu 用 Codex 保留上下文、管理复杂项目,并让工作能跨越单次 prompt 继续推进。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 3, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 21 日的 RSS 公告中称,三星电子在全球范围内为员工部署 ChatGPT Enterprise 与 Codex,这是 OpenAI 规模最大的企业 AI 推广之一。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 3, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 18 日的 RSS 公告中称,研究人员使用一款 OpenAI 推理模型帮助诊断罕见病,在之前未确诊的病例中识别出 18 个新诊断。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 3, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 17 日的 RSS 公告中介绍 LifeSciBench,一个由专家撰写、专家评审的 benchmark,用于评估 AI 系统在真实生命科学研究任务与决策上的表现。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 3, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 11 日的 RSS 公告中称,天体物理学家 Chi-kwan Chan 用 Codex 构建黑洞模拟,帮助科学家研究极端物理并检验爱因斯坦的广义相对论。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 2, 2026
官方
Anthropic
Anthropic 在 2026 年 7 月 1 日的公告中称,正在发布 Claude Fable 5 与 Claude Mythos 5,并把 Fable 5 描述为「我们已为通用用途做好安全准备的一款 Mythos 级别模型」。
Jul 2, 2026
官方
Google 2026 年 7 月 1 日的博客文章称,Android 与 Samsung 帮助 B3 安全管理移动设备,并为管理层员工扩展 AI 能力。
Jul 2, 2026
官方
Google 2026 年 7 月 1 日的博客文章是一份 6 月 2026 综述,标题为「Google AI announcements from June 2026」,meta 描述只有一行「Here are Google's latest AI updates from June 2026」,具体产品与能力在页面正文。
Jul 2, 2026
官方
Google 2026 年 7 月 1 日的博客文章称,Google、New York Jobs CEO Council 与 Urban Assembly 共同主办了一场 AI 峰会,150 位教育界与产业界领袖参加。
Jul 2, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 30 日的 RSS 公告中称,OpenAI 工程师使用大规模 core dump 分析排查罕见的基建崩溃,发现一处硬件故障和一个长期存在的软件 bug。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 2, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 29 日的 RSS 公告中称,一份新的 OpenAI 报告描绘了 AI 将如何重塑欧盟的工作岗位,标出哪些职业可能面临自动化、增长或工作流变化。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 2, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 28 日的 RSS 公告中称,HP Inc. 扩大其与 OpenAI 的 Frontier 合作,在客户体验、软件开发与企业运营中部署 AI。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 2, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 25 日的 RSS 公告中称,一份新的 OpenAI 研究论文展示了 AI agent 如何改变工作方式,让任务变长、更复杂,并在不同角色中扩展生产力。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 2, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 24 日的 RSS 公告中称,OpenAI 与 Broadcom 推出 Jalapeño,一款为 LLM 推理定制的 AI 芯片,用于在 AI 系统中改善性能、能效与规模。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 2, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 23 日的 RSS 公告中称,GPT-5 Pro 帮助解决了一个 3 年未解的免疫学难题,带来关于 T 细胞行为的新洞见,这一突破有望支持癌症与自身免疫研究。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 1, 2026
官方
Anthropic
Anthropic 在 2026 年 7 月 1 日的公告中称,出口管制解除后,Anthropic 从 7 月 1 日起重新部署 Claude Fable 5,带更新的网络安全防护与新发布的「行业越狱框架」。
Jul 1, 2026
官方
Anthropic
Anthropic 于 2026 年 6 月 30 日发布 Claude Sonnet 5,描述为「迄今最具 agentic 能力的 Sonnet,在 coding 与日常专业工作上提供顶级智能」。
Jul 1, 2026
官方
Anthropic
Anthropic 于 2026 年 6 月 30 日发布 Claude Science,一个可定制的科研 app,集成研究者常用的工具与包,产出可审计 artifacts,并提供灵活的算力访问。
Jul 1, 2026
官方
Google 于 2026 年 6 月 30 日发布 Nano Banana 2 Lite(描述为「最快、最具性价比的 Gemini 图像模型」)与 Gemini Omni Flash(主打高质量视频与对话式编辑)。
Jul 1, 2026
官方
Google 2026 年 6 月 30 日的 Gemini Spark 更新把 Spark 带到 macOS Gemini app,可与常用 app 连接,并实时跟踪话题。
Jul 1, 2026
官方
Google UK 2026 年 6 月 30 日的公告分享 Google 在英国的 Economic Impact Report,以及如何让更多人从 AI 技术中获益。
Jul 1, 2026
官方
Google 于 2026 年 6 月 30 日发布第 11 份 Environmental Report,提供 2025 年可持续发展表现的全局视角。
Jul 1, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 30 日的 RSS 公告中介绍 GeneBench-Pro,使用复杂真实数据集测试 AI 在基因组学、生物学与科学研究中的表现。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 1, 2026
官方
OpenAI
OpenAI 在 2026 年 6 月 30 日的 RSS 公告中称,新的 OpenAI Signals 数据表明 ChatGPT 正在全球范围内扩大普及,用户使用量上升、探索更多能力,并在不同地区和语言中推动增长。OpenAI 公告页正文受 Cloudflare 机器人保护,本条仅基于 RSS 标题与描述。
Jul 1, 2026
官方
Google 在 2026 年 6 月 25 日的 ISTE 2026 公告中发布 Google Education 的 AI 工具,帮助教师支持教学目标并为学生提供个性化学习体验。
Jul 1, 2026
官方
Anthropic
Anthropic 公开介绍 Frontier Red Team:通过对 AI 系统进行压力测试,理解其当前能力的全部范围并预判下一步,提供基于证据的 AI 影响分析。
Jun 30, 2026
官方
MiniMax
MiniMax 官网导航(2026-06-30 抓取)把 MiniMax M3 标为「NEW」,与 M2.7 / M2.5 并列。M3 模型页描述其采用 MiniMax 自研 MiniMax Sparse Attention (MSA) 架构,支持 1M token 上下文(最低保证 512K),从训练第 0 步起原生多模态;BrowseComp 得分 83.5,超过 Opus 4.7 的 79.3。
Jun 30, 2026
官方
Z.AI (智谱)
智谱 Z.AI 官网(2026-06-30 抓取)称 GLM-5.2 在 Artificial Analysis 综合榜单上取得 51 分,与 Anthropic、OpenAI 并列前三,位列开源模型 SOTA;GLM-5.2 同时是 Coding 开源 SOTA,支持 1M 无损上下文。
Jun 30, 2026
官方
Z.AI (智谱)
智谱 Z.AI 官网(2026-06-30 抓取)将 GLM-5V-Turbo 定位为「原生融合视觉与文本」的多模态 Coding 模型,针对视觉编程与龙虾类 Agent 任务做了专门优化。
Jun 30, 2026
官方
Moonshot AI (月之暗面)
月之暗面 Kimi 官网(2026-06-30 抓取)把 Kimi K2.6 定位为当前旗舰,配套 Kimi Claw / Kimi Code / Kimi Doodle 产品,以及升级后的 Agent 集群和 Office 文档一键转技能。
Jun 30, 2026
官方
Qwen (阿里通义)
阿里通义 Qwen 官网(2026-06-30 抓取)把 Qwen Studio 定位为一个统一的产品界面,覆盖聊天机器人、图像与视频理解、图像生成、文档处理、联网搜索集成、工具调用与 artifacts。
Jun 30, 2026
官方
Google 2026 年 6 月 29 日发布博客文章,介绍三位使用 Gemma 4(Google 最新一代开源生成式 AI 模型家族)的创作者案例。
Jun 30, 2026
官方
Google 2026 年 6 月 29 日把 Gemini 应用的 Personal Intelligence(个性化智能)向更多用户开放,在用户授权下可从 Gmail、Google Photos、YouTube 与 Search 拉取信息,用于生成更贴合个人上下文的图像。
Jun 30, 2026
官方
Google 2026 年 6 月 29 日在 Google Meet 上线「Take notes for me」(帮我记笔记)功能,面向 Google AI Pro 与 Ultra 订阅用户,在部分语言开放。
Jun 30, 2026
官方
Google 2026 年 6 月 29 日宣布,Gemini for Education 进入马来西亚全部 20 所公立大学,覆盖 60 万名学生和 7.5 万名教师。
Jun 30, 2026
官方
Google 2026 年 6 月 29 日发布「Ask an AI expert: What exactly is the full stack?」解读文章,把 full-stack AI 定位为 Google 多年来 AI 工作的基础。
Jun 30, 2026
官方
Anthropic
Anthropic 发布研究文章,把 Claude Mythos Preview 描述为「在计算机安全任务上能力突出」的通用语言模型,并公开了评估方法。
Jun 30, 2026
官方
Anthropic
Anthropic 发布覆盖 8.1 万名 Claude 用户的调研,把人们对 AI 的经济担忧与 Claude 流量里观察到的模式对应起来。
Jun 30, 2026
官方
Anthropic
Anthropic 宣布与美国太平洋西北国家实验室(PNNL)合作,探索 AI 如何帮助防御方识别并修补关键基础设施中的漏洞。
Jun 30, 2026
官方
Anthropic
Anthropic 与盖茨基金会合作,承诺在 4 年内投入 2 亿美元,涵盖资助资金、Claude 使用额度和技术支持,面向全球健康、生命科学、教育和经济流动项目。
Jun 30, 2026
官方
Anthropic
Anthropic 发布「Core views on AI safety」,把「变革性 AI 可能在十年内出现」作为前提,并列出其研究方向。
Jun 29, 2026
官方
Anthropic
Anthropic 于 2026 年 6 月 26 日发布 6 月《Anthropic Economic Index》报告,主题为「Cadences」,三章分别讲对话的使用节律(早 7 点新闻、晚 6 点食谱 2.3 倍、4 月 14 日税务 8 倍高峰)、artifact 与算力(93% 对话产出 artifact、Claude Code 自主动作高出 0.37 分),以及约 9,700 名用户的感知调研(86% / 82% / 69% 自报速度、范围、质量提升)。
Jun 29, 2026
官方
Hugging Face
Hugging Face 于 2026 年 6 月 26 日发布官方教程,演示如何用 `hf jobs run` 一条命令启动 OpenAI 兼容的 vLLM 私有接口,按秒计费(a10g-large 1.50 美元/小时),以 Qwen3-4B 和 Qwen3.5-122B-A10B 为例,可挂 SSH 与工具调用(reasoning-parser / tool-call-parser)。
Jun 29, 2026
官方
Z.AI
智谱 Z.AI 于 2026 年 6 月 17 日在 Hugging Face 博客发布 GLM-5.2:参数量 753B、上下文 1M token(从 200K 扩展)、MIT 协议、权重同步上线 Hugging Face 与 ModelScope;公布 Terminal-Bench 2.1 = 81.0、SWE-bench Pro = 62.1、FrontierSWE = 74.4(开源最高)。
Jun 23, 2026
官方
DeepSeek
阿里通义、深度求索、月之暗面、智谱、字节豆包、腾讯混元都维护官方主页,发布当前模型版本、发布日期和产品或研究文章,创作者可以直接引用。
Jun 23, 2026
官方
OpenAI
OpenAI 与 Trail of Bits、HackerOne、Calif 联合推出 Patch the Planet,作为 Daybreak 旗下面向关键开源项目的安全计划,使用 GPT-5.5-Cyber 和 Codex Security 来发现、复核并修复漏洞,首批覆盖 cURL、NATS Server、pyca/cryptography、Sigstore 等 19 个项目。
Jun 23, 2026
官方
OpenAI
OpenAI 扩展了其 Daybreak 安全计划,推出新工具、合作伙伴关系和完整版 GPT-5.5-Cyber,同时更新 Codex Security 并启动 Daybreak Cyber Partner Program。
Jun 23, 2026
官方
OpenAI
OpenAI 与三星电子宣布,将 ChatGPT 和 Codex 部署到三星的全球员工,作为企业级合作的一部分。
Jun 23, 2026
官方
Anthropic
Anthropic 宣布在首尔开设办公室,并与韩国 AI 生态的伙伴机构建立新合作,标志着其在亚洲的区域扩张。
Jun 23, 2026
官方
OpenAI
OpenAI 推出 LifeSciBench 基准,评估 AI 在真实生命科学研究任务上的能力,补充了针对科学工作流的开放评测。
Jun 23, 2026
官方
Anthropic
Anthropic 首份《Anthropic Public Record》调研覆盖 51,993 名美国人,结果显示每个州最普遍的 AI 担忧都是失业(64%),只有 15% 的受访者信任 AI 公司决定 AI 的开发与使用。
Jun 23, 2026
官方
Anthropic
Anthropic 承诺向 Claude Corps 投入 1.5 亿美元初始资金,招募 1,000 名早期职业 Fellows,派驻到 400+ 个美国非营利组织全职实习一年,首批 100 人于 2026 年 10 月开始。
Jun 22, 2026
官方
OpenAI
OpenAI 升级了免费默认模型 GPT-5.5 Instant 的健康对话能力,医疗推理更强、上下文处理更好、表达更清晰。
Jun 22, 2026
官方
OpenAI
OpenAI 在 ChatGPT 推出定时任务,用户可以让它按计划发提醒、做周期性工作或监控变化,不再只是你问一句它答一句。
Jun 22, 2026
官方
Anthropic
Anthropic 以 CC0 协议公开了 Claude 的宪法,任何人都能读到这份塑造 Claude 回答与拒绝方式的价值观文档。
Jun 21, 2026
官方
Google Research 说明 AMIE 已经不只做一次性问诊,而是开始处理药物说明、临床指南和长期病程管理,医学 AI 的叙事正在从回答问题变成协助决策。
Jun 21, 2026
官方
Google 为 Gemini 增加 Google Business Profile 连接和 Business notebooks,说明 Gemini 正在从通用助手转向能理解品牌、客户和日常运营语境的业务助手。
Jun 17, 2026
官方
OpenAI
OpenAI Academy 新增 AI Foundations、Applied AI Foundations、Agents and Workflows 等课程,说明官方正在把 AI 使用教育从工具介绍推进到工作流训练。
Jun 17, 2026
官方
Anthropic
Anthropic 发布 Claude Opus 4.8,重点包括更好的动态工作流、effort control、工具使用和复杂任务可靠性,适合观察模型竞争从参数走向执行质量。
Jun 17, 2026
官方
Anthropic
Anthropic Frontier Red Team 将一年内被封禁的恶意网络活动映射到 MITRE ATT&CK 框架,提醒创作者讲 AI 安全时要区分真实风险和泛化恐慌。
Jun 17, 2026
官方
OpenAI
OpenAI 介绍 deployment simulation 方法,在模型真正发布前模拟真实用户场景,用来发现风险行为和上线后的安全边界。
Jun 17, 2026
官方
Google 介绍 Gemini Daily Brief、Gemini Spark、Gemini Omni 等方向,强调 Gemini App 将更主动地理解上下文、整理信息和辅助日常任务。
Jun 16, 2026
官方
Anthropic
Claude Code 官方页强调它可以在代码库中构建、调试和提交,并覆盖终端、IDE、桌面、网页和 Slack 等工作入口。
Jun 16, 2026
官方
Google 发布 Gemini CLI,定位为开源命令行 AI Agent,可用于编码、内容生成、调研和任务管理,并提供较高的个人免费使用额度。
Jun 16, 2026
官方
OpenAI
OpenAI 发布面向 Agent 应用的 Responses API、内置网页搜索、文件搜索、Computer Use 和 Agents SDK,说明 Agent 正从演示能力进入可编排的产品基础设施。