资讯归档

浏览全部历史资讯

全部已收录的资讯,按 AITopic 收录日期分组。用来补看错过的资讯,或回溯某个信源。

返回今日资讯

Aug 13, 2026

6 条

Aug 12, 2026

6 条

Aug 11, 2026

32 条

Aug 7, 2026

10 条

Aug 6, 2026

10 条

Aug 5, 2026

82 条
  • Aug 5, 2026

    媒体

    IT之家: 中文科技媒体覆盖 8/5 安全框架集群

    IT 之家:中文媒体覆盖 8/5 安全框架集群

    IT 之家首页快照覆盖 2026-08-05:Anthropic Constitutional AI 中文对齐、OpenAI Preparedness 中文社区、Google DeepMind Frontier Safety 中文研究、Meta Llama Guard 4 中文开源、Microsoft AI Red Team 中文企业、C2PA Content Credentials 中文内容真实性。

  • Aug 5, 2026

    论文

    arXiv 2607.14777: SEED — Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

    arXiv 2607.14777(7/17 索引):SEED — 自演化 on-policy distillation 让 agentic RL 在 ALFWorld / Search-QA / WebShop 三基准一致大跳

    Hugging Face 2026-07-17 索引的 arXiv 2607.14777 提出 SEED —— 一个用于长周期 agentic RL 的自演化 on-policy distillation 框架,把已完成轨迹转成 hindsight skills 再蒸馏回策略,消除稀疏奖励的 credit assignment 问题;两阶段:(1) Hindsight Skill SFT 用外部 analyzer(GLM-5.2)对 1,440 条轨迹(180 任务 × K0=8 rollouts)做注解,抽取可复用的自然语言 skills;(2) Self-Evolving OPD 当前 policy snapshot 同时担任 rollout actor 与 trajectory analyzer,每轮刷新让 actor 与 analyzer 共同演化;同一模型 actor + analyzer 共享参数;confidence-gated token-level distillation;sigmoid(β_opd × Δlog-prob);联合损失 L_SEED = L_RL(GRPO + KL 正则)+ λ_opd · L_OPD;梯度只流过 ordinary student 分支;推理时策略只从 ordinary history 行动。自报基准(ALFWorld / Search-QA / WebShop score / WebShop succ):Qwen2.5-3B-Instruct GRPO 75.0/36.4/79.8/63.3 vs Seed 91.8/45.7/88.5/78.9;Qwen2.5-7B-Instruct GRPO 81.2/42.0/80.9/72.6 vs Seed 96.1/48.6/89.7/78.1;Qwen3-1.7B-Instruct GRPO 46.1/40.8/67.3/38.3 vs Seed 92.0/42.2/87.1/77.3;sample efficiency:Seed 用 60% 训练数据(ALFWorld 80.7)就超过全量 GRPO(75.0);cross-domain:ALFWorld Unseen split +15.3 分(86.2 vs 70.9);multimodal:Qwen2.5-VL-3B Sokoban 82.0% / EZPoints 100.0%,平均 91.0% vs GRPO 77.0%。

    已选 1 个今日选题源发布于 Jul 17, 2026查看原文
  • Aug 5, 2026

    论文

    arXiv 2607.14952: LongStraw — Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

    arXiv 2607.14952(7/17 #1 Daily Paper):LongStraw — 百万 token RL post-training execution stack,8x H20 上跑到 2.1M positions

    Hugging Face 2026-07-17 索引(207 赞,#1 Daily Paper)的 arXiv 2607.14952(Mind Lab)提出 LongStraw —— 一个固定 GPU 预算下做百万 token RL post-training 的架构感知 execution stack,以 GRPO 实例化;方法:只用一次无 autograd 评估 shared prompt,只保留后续 token 所需的 model-specific state,短 response 分支在 autograd 下逐个 replay,把 live training graph 从「整段 prompt + response」压到「单条 response 分支」,用 replay 时间换 GPU 内存;模型实现:Qwen3.6-27B(hybrid recurrent + full-attention)与 GLM-5.2(compressed-attention MoE,78 层)。自报数字:8x H20 GPU 上 group=2 与 group=8 完成 grouped Qwen scoring + response backward 在 2.1M positions;group size 增长每档仅 +0.21 GB peak allocated memory;压力测试达到 4.46M positions;32x H20 GPU 上对 2.1M-token prompt 跑完整 78 层 GLM-5.2 做端到端验证。关键洞察:瞄准「inference(~1M token 上下文)与 RL post-training(经常 ≤256K token)」之间的差距,对带累积轨迹的 AI agent 尤其相关;作者说明这些实验只建立 execution capacity、不构成完整训练正确性。

    已选 1 个今日选题源发布于 Jul 17, 2026查看原文
  • Aug 5, 2026

    论文

    arXiv 2607.14935: VideoChat3 — Fully Open Video MLLM for Efficient and Generalist Video Understanding

    arXiv 2607.14935(7/17 索引):VideoChat3 — 4B 全栈开放视频 MLLM,H200 上 2048 帧推理比 Qwen3-VL 快 2 倍

    Hugging Face 2026-07-17 索引的 arXiv 2607.14935(MCG-Nanjing University)提出 VideoChat3 —— 4B 参数全栈开放视频 MLLM;架构:(1) Inflated 3D Vision Transformer (I3D-ViT)把 2D 空间 self-attention 扩成 3D 时空 self-attention,16x 时空压缩比;(2) Adaptive Frame Resolution for Streaming Video Perception 用 </Silence> / </Standby> / </Response> 三个状态 token 控制下一窗口像素预算(Silence/Response 224²,Standby 448²);训练数据 3M 样本:VideoChat3-Academic2M(2.27M)、VideoChat3-LV116K(116.2K)、VideoChat3-OL617K(617K),四阶段训练(tokenizer pre-training → video-language alignment → video instruction tuning → long & streaming instruction tuning);全栈开放 —— 权重 + 训练代码 + 训练策略 + 完整训练数据。自报基准(VideoChat3-4B vs open-weight Qwen3-VL-4B):MotionBench 61.7 vs 58.6、TempCompass 75.6 vs 70.8、Video-MME 70.1 vs 69.3、LVBench 56.7 vs 56.2、MMVU 56.4 vs 50.5、Charades TL mIoU 56.1 vs 46.4、VUE-TR V1 47.9 vs 32.9、VUE-TR V2 40.2 vs 19.6、MomentSeeker 25.9 vs 13.8;流式 ODVBench 72.3 vs StreamForest 59.9(+12.4);NVIDIA H200 上 2048 帧:总延迟 20.412s vs Qwen3-VL 44.449s、视觉 token 100,352 vs 200,704(一半)、GPU 内存省 26.14 GB;文章称在三个 TimeLens split 上超过 GPT-5 与 Gemini 2.5 Flash。

    已选 1 个今日选题源发布于 Jul 17, 2026查看原文
  • Aug 5, 2026

    社区

    IBM Research blog: It's time for cryptography to get its own abstraction layer

    IBM Research 7/17:加密学该有自己独立的抽象层 — intent-based API + PQC 迁移支持,API spec + Go SDK 已发布

    IBM Research 2026-07-17 博客《It's time for cryptography to get its own abstraction layer》主张加密学需要一层把高级意图与底层实现分开的标准层(参考当年文件系统与 socket 对存储与网络做的事);IBM 提议一个按 scopes 组织的 intent-based API,每个 scope 代表一类加密意图(标准数字签名 / 认证加密等),应用只表达「需要什么」、算法/参数/实现下沉到下层集中管理;关键特性:把策略(控制平面)与执行(数据平面)分开,参考 SDN 对网络的建模;把加密后端当作「单一接口后可互换的 provider」覆盖软件/硬件/云/TEE;允许算法升级不动应用代码;支持 PQC 迁移不必「替换算法本身」;IBM 同步放出 API spec、参考 standalone server、Go client SDK,邀请社区「explore the work, challenge the assumptions, help shape its evolution」。

    已选 1 个今日选题源发布于 Jul 17, 2026查看原文
  • Aug 5, 2026

    官方

    Cursor changelog: Improvements to Cursor in Slack

    Cursor 7/17 Cursor in Slack 三项改进:plan-upfront / multi-repo environment / cross-channel workflows

    Cursor 2026-07-17 changelog 记录三项改进:(1) 交互改进 —— Cursor 在开始前先回一个 plan,用户可早改向;执行中更新状态;in-message buttons 替换为「compact footer links」;表格 / PRs / 制品渲染更干净;(2) Multi-repo 环境支持 —— Cursor 可以在命名的多 repo 环境中启动(而非单一默认仓库),目标环境能访问所有相关 repo;运行中可用「Switch repository button」加进当前环境之外的 repo,Cursor 从中断处继续;(3) Cross-channel workflows —— Cursor 可在多个 Slack 频道/thread 之间读写,把上下文从工作区其他地方拉进来,把更新发回原 thread 或相关频道。

    暂未入选今日选题源发布于 Jul 17, 2026查看原文
  • Aug 5, 2026

    论文

    arXiv 2607.14749: WanSong v1.0 Technical Report

    arXiv 2607.14749(7/17 索引):WanSong v1.0 Technical Report — 商用级 text-to-music 纯扩散,可分 vocal / BGM 双 stem

    Hugging Face 2026-07-17 索引(arXiv 提交 7/16)的 arXiv 2607.14749(Wan-AI)给 WanSong v1.0 Technical Report —— 商用级 text-to-music 基础模型,单次端到端生成最长约 5 分钟歌曲,输出可分离的 vocal 与 BGM 双 stem;架构:连续 1-D VAE(44.1 kHz → 64 通道潜在,43.1 Hz 下采样 1024 倍)对抗式训练 + hybrid-MMDiT transformer(~25B 参数)处理 LLM 文本 token 与 dual-stem VAE 音频 token;能力:多语言(中/英/日/韩)最长 5 分钟歌曲、3 阶段预训练(90s → 300s → SFT)、为推理加速的 step-distillation、用 DPO 再 ReFL 的 RLHF 对齐;自报基准(WanSong Bench,~200 条 4 分钟 clips):PER 7.43% vs Suno V5 22.80% / Mureka V7.6 12.7% / LeVo 27.11%;SongEval 4.47/4.55/4.57/4.46/4.4;Muq 文本对齐 0.44;内部 musicality 5.49 vs Suno V5 4.18 / Mureka V7.6 3.83 / LeVo 1.69。

    暂未入选今日选题源发布于 Jul 17, 2026查看原文
  • Aug 5, 2026

    论文

    Hugging Face: SEED ablation thread

    SEED 三段 ablation:Hindsight Skill SFT -5.8 / Self-Evolving OPD -4.8 / 静态 offline skills -7.4 — on-policy + 自演化各贡献一半

    SEED 7/17 论文 ablation(ALFWorld avg):去掉 Hindsight-Skill SFT → 86.0(-5.8);去掉 Self-Evolving OPD → 87.0(-4.8);用静态 offline skills 替代 on-policy skills → 84.4(-7.4);三段 ablation 加起来约 -18 分,意味着 on-policy 自演化与 hindsight-skill SFT 是两个独立的贡献项,各贡献一半左右;用 60% 训练数据(ALFWorld 80.7)就超过全量 GRPO(75.0)展示 SEED sample efficiency 显著高于 baseline。

    已选 1 个今日选题源发布于 Jul 17, 2026查看原文
  • Aug 5, 2026

    论文

    Hugging Face: LongStraw cluster thread

    LongStraw 7/17 三模型实现 + #1 Daily Paper:Qwen3.6-27B / GLM-5.2 78 层 / 32x H20 端到端验证

    LongStraw 7/17 实现覆盖三个模型:Qwen3.6-27B(hybrid recurrent + full-attention)、GLM-5.2(compressed-attention MoE,78 层);HF daily papers 把 LongStraw 列为 7/17 #1 Daily Paper,获 207 赞;GitHub MindLab-Research/longstraw 41 stars;社区评论 O96a 质疑:对真实 agent loop(上下文在轨迹中间不可预测地增长)而非干净切成 prompt + generation 的场景,适用性如何?

    已选 1 个今日选题源发布于 Jul 17, 2026查看原文
  • Aug 5, 2026

    社区

    Hugging Face blog: Security incident disclosure — July 2026

    HF 7/16 安全事件披露:业界首例 autonomous AI agent 端到端攻击,HF 用 zai-org/GLM-5.2 取证

    Hugging Face 7 月 16 日博客披露一起由「autonomous AI agent 系统」端到端驱动、对 HF 部分生产基础设施的入侵;攻击者利用 dataset processing 的代码执行路径(远程代码 dataset loader + dataset configuration 的 template-injection)在处理 worker 上跑代码,升级到 node 级访问,窃取云与集群凭证,并在周末横向移动到多个内部集群;整个攻击由一个 autonomous agent framework 执行,在 swarm of short-lived sandboxes 中跑了数万次单个动作。披露的影响:部分内部 datasets 未授权访问,若干 HF 服务凭证被攻陷,公开面向用户的 models / datasets / Spaces 无被篡改证据,软件供应链(container images / published packages)验证 clean。HF 使用 zai-org/GLM-5.2 在自家基础设施上做 LLM-based triage over security telemetry,分析超过 17,000 条事件记录,原因是商业 API frontier model 因安全护栏把响应者也当成攻击者拦截。社区建议:预防性 rotate access tokens 与审查近期账号活动;security@huggingface.co 接报。

    已选 1 个今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    论文

    arXiv 2607.12395: Ring-Zero — Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

    arXiv 2607.12395(7/16 索引):Ring-Zero — 1T 参数 zero RL,自发涌现 5 种认知行为

    arXiv 2607.12395(在 HF daily papers 上 7/16 索引)提出 Ring-2.5-1T-Zero —— 一个用 zero RL 在预训练 base 模型上直接训练、不需要人工标注 CoT 数据、依赖 RLVR 的模型;架构使用 Ling-2.5-1T-Base(1T MoE / 63B 激活)与 Ling-2.5-flash-Base(104B MoE / 7.4B 激活)两个 base 模型,四阶段训练 pipeline(一阶段 RL 用 clipped importance sampling policy gradient + token-level loss 诱发推理 / 自蒸馏用最短正确 rollout + 自反思压缩冗长 CoT / 二阶段 RL 用 sample-level loss normalization 做稳定优化 / 三阶段 RL 引入 4k / 16k / 64k 三层 token budget tier);基础设施用 320x H200 GPU + Megatron + SGLang + Areal 编排,BF16 body + FP32 attention softmax / LM head 混合精度,context parallelism 针对 hybrid MLA + Lightning Attention 架构调优。Ring-2.5-1T-Zero(Second Stage RL)在 AIME 2024 上达 94.1%,在 AIME 2025-2026 / HMMT 2025-2026 / IMOAnswerBench 上有竞争力;自发涌现 5 种认知行为(anthropomorphism / structured formatting / self-verification / parallel reasoning / context anxiety);CoT trace 在 comprehensibility / reproducibility(Qwen-32B 自蒸馏比 DeepSeek-R1 高 5.8 分)/ efficiency(用不到一半 token)上优于 baseline。

    已选 1 个今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    社区

    vLLM blog: Keeping vLLM Production Quality

    vLLM 7/16 三层质量关卡:CI 37 组 / 266 任务 / perf-eval 17 个 model-hardware 配方 / 双周 release cycle

    vLLM 7 月 16 日博客《Keeping vLLM Production Quality》记录每个 PR 必经的三层关卡:Layer 1 CI(每个 PR 跑轻量 GitHub Actions,Buildkite 上 37 个测试组 / 266 个任务按 diff 动态选取,共享多阶段容器镜像,pip-compile lock 文件,58 个 runner 队列跨 AWS / Crusoe / LambdaLabs / Nebius / NVIDIA / Roblox / RunPod,MIG-slicing 与 autoscale-from-zero 每机器 runner,自定义仪表盘 ci.vllm.ai,夜间 CI-analyzer bot 每天约 1.5 个 auto-revert PR / 约 70% 正确诊断);Layer 2 性能与精度(github.com/vllm-project/perf-eval 夜间 pipeline 跨 H200 / B200 / MI300X / MI355X 跑 17 个 model-hardware 配方:DeepSeek V4 Pro/Flash、gpt-oss、Kimi K2.5、MiniMax M2.5/M3、Qwen3.5、GLM 5.1、Gemma 4、Nemotron 3 Super,度量 TTFT / TPOT / vllm-bench,精度 lm-eval GSM8K / GPQA / AIME,函数调用 BFCL);Layer 3 release 自 2025 年 11 月起的双周节奏(每隔一周的周一 release manager 从 main 切 releases/vX.Y.Z,周一至周三 cherry-pick 窗口,只有三层全通过才发布候选),每个 release 发 7 个 Python wheels + 11 个 Docker images,发布前每个都做 smoke-test。

    已选 1 个今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    官方

    Cohere blog: Cohere and the University of Toronto partner to advance responsible AI adoption at scale

    Cohere 7/16 × 多伦多大学:多年合作,把 North 平台做成 U of T 全校 AI 的 orchestration layer

    Cohere 7 月 16 日博客宣布与多伦多大学的多年合作 —— 把 Cohere 的企业 AI 技术集成到 U of T 即将上线的全校 AI 平台,支持教学、研究、学生服务、行政、运营五大场景的负责任 AI 落地;Cohere 的 North 平台作为 U of T AI 平台内的 orchestration layer,帮用户管理复杂任务、安全访问各大学系统中的可信信息,支持 faculty / librarian / staff / student,同时把敏感数据留在大学的控制之下;Cohere 的技术也将驱动 U of T 的「AI Kitchen」—— 一个通过审核过的应用、合适的数据访问与隐私优先框架来探索和评估 AI 工具的安全环境;这次合作是 Cohere 创始人的回家 —— 2019 年他们以 U of T 学生身份创立公司(Aidan Gomez、Nick Frosst、Ivan Zhang);文章未披露具体资金数字。

    已选 1 个今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    社区

    Hugging Face blog: Newer Models, Same Advantage — Dharma-AI

    Dharma-AI 7/16:在巴西葡萄牙语 OCR 上,Mistral OCR4 与 Unlimited-OCR 仍输给专门化 DharmaOCR

    Hugging Face 7 月 16 日博客《Newer Models, Same Advantage》(Dharma-AI)在巴西葡萄牙语 OCR 任务上对比 Mistral OCR4(0.798)、Unlimited-OCR(0.7587)与 DharmaOCR(0.925);两个更新的通用 / 多语言模型虽然更新、资源更充足,但分数都明显低于 DharmaOCR;文章把 DharmaOCR 的持续优势归因于结构特化 —— (1) 领域集中:全部参数都用在巴西葡萄牙语词汇、形态、拼写模式上,而非分散在多种语言;(2) 两阶段训练:监督微调建立领域能力,再用 Direct Preference Optimization 在完整输出连贯性(而非逐 token 预测)上做训练,降低视觉歧义下的文本崩坏;文章主张这种优势是结构性而非临时性的 —— 通用模型把资源分散在多领域,专家模型用有限资源在本领域拿到更多;Mistral OCR4 把「Chico Buarque」读成「Chico Barque」,Unlimited-OCR 输出「a dose de chico bique」这种不连贯文本。

    暂未入选今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    论文

    arXiv 2607.13285: Harness Handbook — Making Evolving Agent Harnesses Readable, Navigable, and Editable

    arXiv 2607.13285(7/16 索引):Tencent Hunyuan Harness Handbook — agent harness 可读 / 可导航 / 可编辑

    arXiv 2607.13285(在 HF daily papers 上 7/16 索引)是腾讯混元的一本 handbook / guide,讲如何设计更清晰、可导航、可编辑的 agent harness 架构。具体作者名单、架构模式目录、评估方法与参考实现均未提取。

    暂未入选今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    论文

    arXiv 2607.12747: Tracing Agentic Failure from the Flow of Success

    arXiv 2607.12747(7/16 索引):Tracing Agentic Failure from the Flow of Success — 4 作者从成功轨迹反推失败

    arXiv 2607.12747(在 HF daily papers 上 7/16 索引)是一篇 4 作者论文,从成功的轨迹里反推 agentic 失败模式 —— 即在同一条轨迹曾经成功的环节定位失败。具体作者名单、失败分类法、评估方法与所用 agent / benchmark 均未提取。

    暂未入选今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    论文

    arXiv 2607.12625: KnowAct-GUIClaw — Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

    arXiv 2607.12625(7/16 索引):KnowAct-GUIClaw — Lychee Team GUI assistant,带 self-evolving memory 与 skill 模块

    arXiv 2607.12625(在 HF daily papers 上 7/16 索引)提出了 KnowAct-GUIClaw —— Lychee Team 的 GUI assistant,带 self-evolving memory 和 skill 模块。具体作者名单、Android / Web / Desktop GUI agent benchmark 上的具体分数、memory 模块架构、self-evolution 机制均未提取。

    暂未入选今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    社区

    Hugging Face: Security incident cluster thread

    7/16 HF 安全事件三件套:Security Incident Disclosure 主文 + The Decoder 报道 + Anatomy 伴随深度技术时间线

    7 月 16 日 HF 安全事件三件套同日上:Hugging Face Security Incident Disclosure 主文(autonomous AI agent 端到端攻击 + GLM-5.2 取证)+ The Decoder tech-press 报道(autonomous agent 攻击向量、GLM-5.2 取证、合作伙伴 / 客户影响评估)+ Anatomy of a Frontier Lab Agent Intrusion 伴随深度技术时间线(HF blog 索引标注 security / Hot / 423 reactions)。三件套拼成「业界首例公开披露的 autonomous AI agent 攻击」完整叙事。

    已选 1 个今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    仓库

    vLLM perf-eval GitHub repo (companion)

    vLLM 7/16 perf-eval 仪表盘:17 个 model-hardware 配方覆盖 H200 / B200 / MI300X / MI355X,精度 lm-eval GSM8K / GPQA / AIME,函数调用 BFCL

    vLLM 7 月 16 日 perf-eval 仪表盘覆盖 17 个 model-hardware 配方,跨 H200 / B200 / MI300X / MI355X(DeepSeek V4 Pro/Flash、gpt-oss、Kimi K2.5、MiniMax M2.5/M3、Qwen3.5、GLM 5.1、Gemma 4、Nemotron 3 Super),度量 TTFT / TPOT / vllm-bench,精度 lm-eval GSM8K / GPQA / AIME,函数调用 BFCL;结果展示在 ci.vllm.ai/perf 与 ci.vllm.ai/eval。具体当前排行榜快照与每个 recipe 随时间的 TTFT / TPOT / 精度 delta 均未提取。

    已选 1 个今日选题源发布于 Jul 16, 2026查看原文
  • Aug 5, 2026

    社区

    Hugging Face: Welcome Inkling by Thinking Machines

    Thinking Machines 7/15 发 Inkling:~1T 多模态开源 MoE,975B 总参 / 41B 激活 / 1M 上下文 / 45T token 训练

    Hugging Face 7 月 15 日博客宣布 Thinking Machines 的 Inkling —— 一个 ~1T 参数的开源多模态模型,原生接受图像、文本、音频输入,在 45T token 上训练。架构:decoder-only 多模态 MoE,975B 总参 / 41B 激活,256 个 expert + top-6 + 2 shared expert,1M 上下文窗口,相对注意力(无 RoPE),5:1 sliding-window 与 global 混合注意力,hidden state 上的短 1D 卷积(SConv),视觉用 hierarchical MLP patchifier,音频用 mel-spectrogram 离散化;变体为 Inkling BF16(2 TB VRAM)与 Inkling NVFP4(600 GB),Inkling-Small BF16 600 GB(276B / 12B 激活)/ NVFP4 180 GB;自报分 Inkling vs Inkling-Small:HLE 文本 29.7% / 31.6%、HLE 带工具 46.0% / 47.8%、AIME 2026 97.1% / 95.5%、GPQA Diamond 87.2% / 89.5%、SWE-Bench Verified 77.6% / 80.2%、SWE-Bench Pro 54.3% / 55.9%、Terminal Bench 2.1 63.8 / 64.69、MCP Atlas 74.1% / 79.2%、MMMU Pro 73.3% / 74.0%、VoiceBench 91.4% / 90.1%;协议未公开。

    已选 1 个今日选题源发布于 Jul 15, 2026查看原文
  • Aug 5, 2026

    社区

    vLLM blog: TML Inkling on vLLM — Day-0 Support

    vLLM 7/15:Inkling day-0 支持 — 4x GB200 上 380 tok/s/user MTP8 + 1M 上下文

    vLLM 7 月 15 日博客记录 Inkling day-0 支持 —— NVFP4 + BF16 变体完整功能对等,带 8 个 MTP head(每次 forward step 最多 9 个 token),原生支持 1M token;在 4x NVIDIA GB200 上 380 tok/s/user(MTP8,平均 acceptance length 4.5)、140 tok/s/user(无 MTP);按长度桶的精度数据 2K-221K 99.09% (436/440)、294K-513K 95.68% (421/440)、586K-805K 81.36% (358/440)。

    已选 1 个今日选题源发布于 Jul 15, 2026查看原文
  • Aug 5, 2026

    社区

    Hugging Face: Real World VoiceEQ — Measuring the human quality of voice AI

    Hume + HF 7/15 发 Real World VoiceEQ:基于 100 万+ 人工评分的语音 AI 基准,40+ 模型 + 60+ 指标

    Hugging Face 7 月 15 日博客宣布 Real World VoiceEQ —— 由 Hume + HF 共同构建的语音 AI 质量基准,基于 100 万+ 跨人群、口音、声学环境的人工评分,覆盖 40+ 专有与开源语音模型、15+ 评测维度、60+ 指标(ASR / TTS / S2S / 语音理解);当前数据集 78.5 万条 TTS 评分、4.8 万条 STS 评分;每次评测在 Hume 的 Kairos 平台运行;引用噪声环境下语音转写 WER 约为音乐环境下的 4 倍;公开 leaderboard 在 huggingface.co/spaces/HumeAI/rw-voice-eq,技术报告在 arXiv 2607.14846。

    已选 1 个今日选题源发布于 Jul 15, 2026查看原文
  • Aug 5, 2026

    官方

    Cohere blog: The total cost of AI ownership

    Cohere 7/15 AI-TCO 框架:自有推理层 8x 优势于云、18x 优势于前沿 API、8-GPU 不到 4 个月回本

    Cohere 7 月 15 日博客《The total cost of AI ownership》把 AI 成本框定为「renting vs owning」跨数据中心、芯片、模型三层;引用 Gartner 2026 全球 AI 支出 2.52 万亿美元(YoY +44%)、IDC/DataRobot 96% 生成式 AI 与 92% agentic AI 部署面临高于预期成本、McKinsey ~1/3 组织把 AI 全企业规模化(5-6% 报告显著财务影响)、Mavvrik/Benchmarkit 80% 公司 AI 预测偏离 >25%、Uber 10% 已承诺代码由自主 agent 构建 12 个月预算 4 个月花光;NVIDIA Blackwell vs Hopper ~50x 每兆瓦 token / ~35x 每 token 成本;Lenovo 2026 摊销每百万 token 在自有 H100 ~$0.11、云实例 ~$0.89、前沿 API ~$2.00(对云 8x / 对 API 18x);8-GPU 服务器相对按需云在不到 4 个月内回本;收支平衡约在每天 4 小时使用率;SemiAnalysis InferenceX 在 GB300 上 $0.123 每百万 token。

    已选 1 个今日选题源发布于 Jul 15, 2026查看原文
  • Aug 5, 2026

    社区

    Hugging Face: Model Routing Is Simple. Until It Isn't. — IBM Research

    IBM Research 7/15 HF blog:Model Routing Is Simple. Until It Isn't.

    Hugging Face 7 月 15 日博客文章,由 IBM Research 发表,题为《Model Routing Is Simple. Until It Isn't.》,讨论为什么随着系统规模增长,模型路由(把查询导向不同 AI 模型)会变得复杂,与初始的简单印象相违。具体框架名、决策图、代码样例、基准方法学在已捕获摘要里未提取。

    暂未入选今日选题源发布于 Jul 15, 2026查看原文
  • Aug 5, 2026

    社区

    Hugging Face: Inkling day-0 cluster thread

    7/15 Inkling 一日三发:Thinking Machines 开源 + vLLM day-0 + LMSYS SGLang day-0

    7 月 15 日 Inkling 一日三发:Thinking Machines 在 HF 上发 ~1T 多模态开源 MoE、vLLM blog 发 day-0 支持(4x GB200 上 380 tok/s/user MTP8 + 1M 上下文)、LMSYS blog 发 SGLang day-0 支持(Blackwell 上 71.7k tok/s 输入吞吐);三方合起来把「1T 开源 + 一日就绪到推理引擎」做成了 7 月开源生态的最强一日之一。

    已选 1 个今日选题源发布于 Jul 15, 2026查看原文
  • Aug 5, 2026

    论文

    arXiv 2607.12463: Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

    arXiv 2607.12463(7/15 索引):Function-Aware Fill-in-the-Middle 作为 coding agent 基础模型的中训练

    arXiv 2607.12463(在 Hugging Face daily papers 上 2026-07-15 索引)提出了一种函数感知的 fill-in-the-middle 方法,用作 coding agent 基础模型的中训练(mid-training)。具体作者名单、HumanEval / SWE-Bench / LiveCodeBench 等基准的精确提升、训练算力开销、每步训练方法学在已捕获摘要里未提取。

    暂未入选今日选题源发布于 Jul 15, 2026查看原文
  • Aug 5, 2026

    论文

    arXiv 2607.11562: MonkeyOCRv2 — A Visual-Text Foundation Model for Document AI

    arXiv 2607.11562(7/15 索引):MonkeyOCRv2 — 文档 AI 的视觉-文本基础模型

    arXiv 2607.11562(在 Hugging Face daily papers 上 2026-07-15 索引)提出了 MonkeyOCRv2 —— 一个面向文档 AI 任务的视觉-文本基础模型。具体作者名单、DocVQA / InfoVQA / ChartQA / OmniDocBench 等基准的精确数字、模型规模、训练数据组成与协议在已捕获摘要里未提取。

    暂未入选今日选题源发布于 Jul 15, 2026查看原文
  • Aug 5, 2026

    官方

    Anthropic newsroom: Claude for Teachers

    Anthropic 7/14 Claude for Teachers:美国 K-12 教师免费,接 Learning Commons + 10 个教育平台

    Anthropic 7 月 14 日(7 月 21 日更新)新闻发布 Claude for Teachers —— 为美国已认证 K-12 教师免费提供 Claude 高级功能、教学 skill 库、Learning Commons 接入(覆盖 50 个州学术标准对齐);能力含差异化教学支持、Claude Code + Cowork 自主任务处理、数据分析工具(教师控制数据共享、不用于训练);平台集成 ASSISTments / Brisk Teaching / Canva Education / Coteach / Diffit / Eedi / MagicSchool / Snorkl / TeachFX,加 OpenSciEd + Illustrative Mathematics 课程资源;对已认证 K-12 教师免费,2027-06-30 前注册得一整年访问;18+ 政策、FERPA 通过 K-12 Data Processing Addendum 合规,Anthropic 正在与美国教师联合会(AFT)合作制定 Gold Standard。

    已选 1 个今日选题源发布于 Jul 14, 2026查看原文
  • Aug 5, 2026

    社区

    vLLM blog: vLLM x TileRT — Specialized Decode for Latency-Critical Serving

    vLLM 7/14 × TileRT 0.1.5:用 vLLM V1 connector 拆 prefill/decode,GLM-5.1-FP8 上 B200 latency 优化

    vLLM 7 月 14 日博客记录 vLLM × TileRT 集成 —— 通过 vLLM V1 公开 connector 接口把 prefill 留在 vLLM、decode 交给 TileRT;TileRT 0.1.5 随此集成发布;两池通过 MultiConnector 在单一 prefill 实例后共存,routing/claim filter 只把标 latency-critical 的流量导向 TileRT;评测在 8x NVIDIA B200 跑 GLM-5.1-FP8、输入 1K-192K / 输出 1K,MTP 平均 acceptance length 3.2(峰值 4.0);每 TileRT decode 节点同一时刻一个 in-flight 请求;模型覆盖 GLM-5/5.1 + DeepSeek-V3.2。

    暂未入选今日选题源发布于 Jul 14, 2026查看原文
  • Aug 5, 2026

    仓库

    SGLang release v0.5.15.post1

    SGLang 7/14 v0.5.15.post1:GLM-5.2 IndexShare 修复 DSA / flashinfer / NaN / PD-disaggregation

    SGLang 7 月 14 日发布 v0.5.15.post1 —— 针对 GLM-5.2 的稳定性补丁,修复非 CUDA / HIP 设备上的 DSA 模型启动、flashinfer 依赖、NaN 输出,以及 PD-disaggregation + context-parallel 设置下的 GLM-5.2 IndexShare;搭配 v0.5.15(7 月 10 日发布,Blackwell 上 GLM-5.2 NVFP4 生产调优、默认启用 Spec V2 +11% e2e TPS、IndexShare MTP、TopK V2、indexer-prologue fusion、新增 Hunyuan 3 / HRM-Text / Qwen3.6 NVFP4)。

    暂未入选今日选题源发布于 Jul 14, 2026查看原文

Jul 14, 2026

14 条

Jul 13, 2026

3 条
  • Jul 13, 2026

    官方

    Qwen Blog: Qwen3-Max

    Alibaba 7/12 Qwen3-Max:1.2T 总参 / 32B 激活 MoE,1M 上下文,原生工具调用

    阿里通义千问团队 2026-07-12 博客公开 Qwen3-Max:1.2T 总参 / 32B 激活 MoE,1M 上下文,原生 tool-use / function-calling schema;部署面 Tongyi Qianwen + Model Studio + DashScope OpenAI 兼容 API;协议 Apache-2.0 + 中国监管侧 acceptable-use 附约。自报基准数字:MMLU-Pro 87.1、GPQA-Diamond 81.4、LiveCodeBench v6 78.2、SWE-Bench Verified 74.5、BFCL v3 72.0、MTEB 多语 71.6、Terminal-Bench 2.1 81.0。语义边界:这是厂商发布 + Hugging Face 社区模型卡 + 一条 tech-press 报道,不是任何具体分数的独立复现。

    已选 1 个今日选题源发布于 Jul 12, 2026查看原文
  • Jul 13, 2026

    官方

    Mistral News: Mistral Large 3

    Mistral 7/12 Mistral Large 3:145B dense 旗舰,128K 上下文,原生 tool-use

    Mistral 2026-07-12 官方新闻公开 Mistral Large 3:145B 参数 dense 旗舰,128K 上下文,原生 function-calling + JSON-schema tool-use,配套 chat-instruct 变体;部署 Mistral La Plateforme + Azure AI Foundry + Bedrock;权重格式 BF16 sharded safetensors + MXFP4 推理快照;协议 Apache-2.0 + Mistral-research 附约。自报数字:MMLU-Pro 79.2、GPQA-Diamond 71.6、HumanEval+ 93.4、MultiPL-E 88.1、MT-Bench v3 9.21、IFEval strict 88.4。语义边界:厂商 + Hugging Face 社区模型卡;基准数字均为厂商自陈。

    已选 1 个今日选题源发布于 Jul 12, 2026查看原文
  • Jul 13, 2026

    官方

    Moonshot AI: Kimi K2.7-0913

    Moonshot 7/12 Kimi K2.7-0913:K2 系权重 re-tag,强化指令遵循与 agent 脚手架

    Moonshot AI 2026-07-12 平台博客公开 Kimi K2.7-0913:K2 系权重 re-tag(架构不变:1.1T 总参 / 32B 激活 MoE,Apache-2.0 + K2 acceptable-use 附约),强化长文本指令遵循 + agent 脚手架(browser / shell / file-system tool handler) + 良性长上下文场景拒答减少。相对 K2 的自报提升:IFEval strict 86.7(vs 81.4)、WildChat-Write 9.04(vs 8.81)、AgentBench-lite 78.4(vs 71.2)、64K NIAH 99.2%。语义边界:这是已有权重的刷新,不是基础模型迭代;提升数字是相对 K2 基线的厂商声明 delta。

    已选 1 个今日选题源发布于 Jul 12, 2026查看原文

Jul 10, 2026

3 条
  • Jul 10, 2026

    官方

    Anthropic Newsroom: Inviting hard questions

    Anthropic 7/9「邀请硬问题」:面向公众征集 AI 议题,公开承诺追踪并报告回应行动

    Anthropic 2026-07-09 在官方 Newsroom 公开「Inviting hard questions」倡议,邀请公众就 AI 对就业、社会等影响提出尖锐问题;Anthropic 明确表述为「征询最难的问题 + 承诺在处理过程中 show our work」。语义边界:这是一项公开征询 + 公开回应追踪承诺,而非新设独立监管或强制问责机制。

    已选 1 个今日选题源发布于 Jul 9, 2026查看原文
  • Jul 10, 2026

    官方

    Anthropic Newsroom: Ben Bernanke appointed to Long-Term Benefit Trust

    Anthropic 7/9 LTBT 新增 Ben Bernanke 受托人,累计 4 位具名受托人

    Anthropic 2026-07-09 官方公告:任命前美联储主席 Ben Bernanke 加入公司 Long-Term Benefit Trust,与现 Chair Neil Buddy Shah、Richard Fontaine、Mariano-Florentino Cuéllar 共同组成 4 位具名受托人;Co-Founder & President Daniela Amodei 公开阐述「AI 可能是现代史上经济影响最大的技术,Anthropic 有双重的理解与行动责任」。语义边界:LTBT 持有少数股权、并无对产品 / 研究决策的运营否决权,本次任命属于公司治理结构更新而非新增约束。

    已选 1 个今日选题源发布于 Jul 9, 2026查看原文
  • Jul 10, 2026

    官方

    Google Research Blog: SensorFM

    Google 7/9 SensorFM:1T+ 分钟传感器数据 + 5M 人预训练基础模型,可迁移 35 项健康预测任务

    Google Research 7/9 官方博客发表 SensorFM(Xin Liu + Daniel McDuff):面向可穿戴健康的通用基础模型,预训练数据「1 万亿 + 分钟传感器信号 / 来自约 500 万具名同意的人(100+ 国家 / 全美 50 州 / 20+ Fitbit 与 Pixel Watch 型号,数据窗口 2024-09 → 2025-09)」;5 种传感器(PPG、加速度、EDA、皮温、海拔)+ 34 个一分钟级聚合特征。规模曲线跨 4 个量级(~2M → 2B 传感器小时 / 100K → 100M 参数)。最大变体 SensorFM-B 较最小变体:reconstruction loss 下降 31%、分类 AUC 平均提升 9%、回归 Pearson 提升 21%,35 项迁移任务中胜 33 项。Personal Health Agent 评测:31 份参与者画像、1860 份临床医生评分。语义边界:这是研究博客公布的基础模型 + 迁移基准,不是 FDA 认证 / 临床部署 / 诊疗决策辅助;涉及健康话题时务必保留风险提示。

    已选 1 个今日选题源发布于 Jul 9, 2026查看原文

Jul 9, 2026

12 条

Jul 8, 2026

10 条

Jul 7, 2026

10 条
  • Jul 7, 2026

    仓库

    Hugging Face Hub: kernels repository directory

    HF Hub 同步上线 kernels 目录页:127 个仓库,kernels-community 占大头

    配合 7/6 Kernels 改版,Hub 上 huggingface.co/kernels 上线了[kernel] 仓库目录,共 127 个仓库、5 页。下载量最高的是 flash-attn3(6.79k)、flash-attn2(6.63k),更新最频繁的有 vllm-moe、flashrt-fp8-swiglu-ffn、aiter-kernels 等。发布者包括 kernels-community、kernels-staging、flashrt、MiniMaxAI 和大量个人贡献者。

  • Jul 7, 2026

    社区

    Hugging Face Blog: LeRobot v0.6.0 — Imagine, Evaluate, Improve

    HF 7/7 发 LeRobot v0.6.0:闭合机器人学习闭环,世界模型策略 + Robometer + 6 个新 sim 基准

    Hugging Face 7 月 7 日发 LeRobot v0.6.0(主题「Imagine, Evaluate, Improve」)。新引入三个世界模型策略 VLA-JEPA、LingBot-VA、FastWAM,让机器人在训练中「想象」未来状态;统一了 reward-models API,首发 Robometer(基于 Qwen3-VL-4B,产生逐帧进度曲线)与 zero-shot TOPReward;数据集层加了自定义视频编码(NVENC / VideoToolbox / VAAPI / QSV)、Intel RealSense 深度采集、lerobot-annotate CLI 生成 VLM 语言标注,加载速度最高 2x。一次性统一了 6 个新仿真基准 LIBERO-plus、RoboTwin 2.0、RoboCasa365、RoboCerebra、RoboMME、VLABench,全部进入 lerobot-eval CLI;部署侧新增 lerobot-rollout(DAgger 式人在回路纠错),训练侧加 FSDP 与 HF Jobs 一键云训练。底层基础依赖减少约 40%,支持 PyTorch 2.7-2.11 + CUDA 12.8,加 Foxglove 流式可视化与 pip 可装插件包。

  • Jul 7, 2026

    官方

    Anthropic News: Alberta Government + Claude cybersecurity case study

    Alberta 政府用 Claude Code 扫 4.66 亿行代码,20 小时完成,折合 6.5 年人工工作量

    Anthropic 7 月 6 日案例文章:加拿大 Alberta 政府科技创新部用 Claude Code(Opus + Sonnet)并行跑 ~50 个 agent,在 20 小时内跨 1,280 个应用、3,400 个仓库扫描 4.66 亿行代码;同样的活人工估计要 6.5 年。Pipeline 是「规则引擎 + 验证 agent(精确到文件/行号)」两步,然后自动改、写测试、重写老系统;还基于 Claude Agent SDK 组建红队 / 蓝队 agent,持续跑约 95 项安全控制。

    已选 1 个今日选题源发布于 Jul 6, 2026查看原文
  • Jul 7, 2026

    官方

    Anthropic Research: A global workspace in language models

    Anthropic 7/6 发可解释性研究:Claude 内部有「J-space」工作空间,因果驱动多步推理

    Anthropic 7 月 6 日的可解释性研究文章「A global workspace in language models」:用 Jacobian lens(J-lens)读出 Claude 内部一处自发涌现的小型「J-space」,其内容因果驱动多步推理——例如把 J-space 里的「Soccer」换成「Rugby」、「spider」→「ant」、「France」→「China」,下游行为会跟着变。J-space 仅占 Claude 内部活动不到十分之一,屏蔽它会让高阶推理消失,但语法流畅性和简单回忆不受影响。Neel Nanda(DeepMind)做了独立复现。

    已选 1 个今日选题源发布于 Jul 6, 2026查看原文
  • Jul 7, 2026

    社区

    Hugging Face Blog: 🤗 Kernels — Major Updates

    HF 7/6 重塑 🤗 Kernels:trusted publishers + Sigstore cosign + Torch Stable ABI + 首个非 Torch 框架 TVM FFI

    Hugging Face 7 月 6 日对自定义 compute kernel 的打包/分发/消费做了大改版:Hub 上线 [kernel] 仓库类型;新增两层安全——trusted kernel publishers(需用户 trust_remote_code 显式启用)+ Sigstore cosign 签名(临时密钥 + GitHub workflow 验证);kernels 和 kernel-builder 两个 CLI 拆分;新增 Torch Stable ABI(目标覆盖约 2 年的 Torch 版本)与首个非 Torch 框架 Apache TVM FFI;为 agent 自动开发 kernel 准备了 agent-optimized CLI + backend skills + HF Jobs 基准;同时把静态 libstdc++ 切到 manylinux_2_28 动态链接,解决了过去的 corruption/segfault。

    已选 1 个今日选题源发布于 Jul 6, 2026查看原文
  • Jul 7, 2026

    社区

    Hugging Face Blog: Photoroom PRX Part 4 — Our Data Strategy

    Photoroom 7/6 发 PRX Part 4:用 Qwen3-VL-8B 重写 caption,Lance + Mosaic Shards 撑流式训练

    Photoroom 7 月 6 日在 HF 博客发 PRX Part 4 — Our Data Strategy:用 Qwen3-VL-8B 对每一张 PRX 文生图训练图像重新打标,验证了「长的准确 caption 战胜短的 caption」、JPEG 质量 92 与 PNG 视觉上无明显差异,captioner 选用在 PRX 预训练上降了 FID / CMMD / DINO-MMD;数据用 Lance 探索、按分辨率与宽高比分桶重写进 Mosaic Data Shards 以支持流式读,轻量 caption 过滤和 perceptual-hash 去重用 skip list 而不是重写 shard。

    已选 1 个今日选题源发布于 Jul 6, 2026查看原文
  • Jul 7, 2026

    官方

    Anthropic News: Fable 5 cyber safeguards + jailbreak framework

    Anthropic 7/2 公开 Fable 5 网络安全细节 + 提案性 CJS jailbreak 评分框架

    Anthropic 7 月 2 日发布 Fable 5 的网络安全保护细节,并与 Glasswing 合作伙伴提出一个提案性的 Cyber Jailbreak Severity (CJS) 框架,从「能力获得 / 能力获得范围 / 武器化难度 / 可发现性」四个轴线对 jailbreak 做 0-4 评分,同时开通了 HackerOne 提交通道。

    已选 1 个今日选题源发布于 Jul 2, 2026查看原文
  • Jul 7, 2026

    论文

    arXiv 2607.02087: SUNTA — Hierarchical Video Prediction with Surprise-based Chunking

    arXiv 7/2 SUNTA:用「惊喜」驱动分块,HSSM 视频预测 250 步不掉点

    arXiv 编号 2607.02087 的论文 SUNTA(Iiyama / Suzuki / Matsuo,7/2 投稿):用「惊喜」(预测误差)驱动层次化状态空间模型 HSSM 的分块边界,而不是固定长度或相似度;通过解耦训练与「自上而下的内部不一致」充当 open-loop surprise 信号,在 2D 与 3D 视频预测上能稳 250 个时间步,而所有 baseline 在 10 个时间步内就开始退化。

    已选 1 个今日选题源发布于 Jul 2, 2026查看原文

Jul 6, 2026

10 条

Jul 3, 2026

10 条

Jul 2, 2026

10 条

Jul 1, 2026

11 条

Jun 30, 2026

15 条

Jun 29, 2026

3 条

Jun 23, 2026

8 条

Jun 22, 2026

3 条

Jun 21, 2026

2 条

Jun 17, 2026

5 条

Jun 16, 2026

3 条