资讯归档

浏览全部历史资讯

全部已收录的资讯,按 AITopic 收录日期分组。用来补看错过的资讯,或回溯某个信源。

返回今日资讯

Jul 14, 2026

14 条

Jul 13, 2026

3 条
  • Jul 13, 2026

    官方

    Qwen Blog: Qwen3-Max

    Alibaba 7/12 Qwen3-Max:1.2T 总参 / 32B 激活 MoE,1M 上下文,原生工具调用

    阿里通义千问团队 2026-07-12 博客公开 Qwen3-Max:1.2T 总参 / 32B 激活 MoE,1M 上下文,原生 tool-use / function-calling schema;部署面 Tongyi Qianwen + Model Studio + DashScope OpenAI 兼容 API;协议 Apache-2.0 + 中国监管侧 acceptable-use 附约。自报基准数字:MMLU-Pro 87.1、GPQA-Diamond 81.4、LiveCodeBench v6 78.2、SWE-Bench Verified 74.5、BFCL v3 72.0、MTEB 多语 71.6、Terminal-Bench 2.1 81.0。语义边界:这是厂商发布 + Hugging Face 社区模型卡 + 一条 tech-press 报道,不是任何具体分数的独立复现。

    已选 1 个今日选题源发布于 Jul 12, 2026查看原文
  • Jul 13, 2026

    官方

    Mistral News: Mistral Large 3

    Mistral 7/12 Mistral Large 3:145B dense 旗舰,128K 上下文,原生 tool-use

    Mistral 2026-07-12 官方新闻公开 Mistral Large 3:145B 参数 dense 旗舰,128K 上下文,原生 function-calling + JSON-schema tool-use,配套 chat-instruct 变体;部署 Mistral La Plateforme + Azure AI Foundry + Bedrock;权重格式 BF16 sharded safetensors + MXFP4 推理快照;协议 Apache-2.0 + Mistral-research 附约。自报数字:MMLU-Pro 79.2、GPQA-Diamond 71.6、HumanEval+ 93.4、MultiPL-E 88.1、MT-Bench v3 9.21、IFEval strict 88.4。语义边界:厂商 + Hugging Face 社区模型卡;基准数字均为厂商自陈。

    已选 1 个今日选题源发布于 Jul 12, 2026查看原文
  • Jul 13, 2026

    官方

    Moonshot AI: Kimi K2.7-0913

    Moonshot 7/12 Kimi K2.7-0913:K2 系权重 re-tag,强化指令遵循与 agent 脚手架

    Moonshot AI 2026-07-12 平台博客公开 Kimi K2.7-0913:K2 系权重 re-tag(架构不变:1.1T 总参 / 32B 激活 MoE,Apache-2.0 + K2 acceptable-use 附约),强化长文本指令遵循 + agent 脚手架(browser / shell / file-system tool handler) + 良性长上下文场景拒答减少。相对 K2 的自报提升:IFEval strict 86.7(vs 81.4)、WildChat-Write 9.04(vs 8.81)、AgentBench-lite 78.4(vs 71.2)、64K NIAH 99.2%。语义边界:这是已有权重的刷新,不是基础模型迭代;提升数字是相对 K2 基线的厂商声明 delta。

    已选 1 个今日选题源发布于 Jul 12, 2026查看原文

Jul 10, 2026

3 条
  • Jul 10, 2026

    官方

    Anthropic Newsroom: Inviting hard questions

    Anthropic 7/9「邀请硬问题」:面向公众征集 AI 议题,公开承诺追踪并报告回应行动

    Anthropic 2026-07-09 在官方 Newsroom 公开「Inviting hard questions」倡议,邀请公众就 AI 对就业、社会等影响提出尖锐问题;Anthropic 明确表述为「征询最难的问题 + 承诺在处理过程中 show our work」。语义边界:这是一项公开征询 + 公开回应追踪承诺,而非新设独立监管或强制问责机制。

    已选 1 个今日选题源发布于 Jul 9, 2026查看原文
  • Jul 10, 2026

    官方

    Anthropic Newsroom: Ben Bernanke appointed to Long-Term Benefit Trust

    Anthropic 7/9 LTBT 新增 Ben Bernanke 受托人,累计 4 位具名受托人

    Anthropic 2026-07-09 官方公告:任命前美联储主席 Ben Bernanke 加入公司 Long-Term Benefit Trust,与现 Chair Neil Buddy Shah、Richard Fontaine、Mariano-Florentino Cuéllar 共同组成 4 位具名受托人;Co-Founder & President Daniela Amodei 公开阐述「AI 可能是现代史上经济影响最大的技术,Anthropic 有双重的理解与行动责任」。语义边界:LTBT 持有少数股权、并无对产品 / 研究决策的运营否决权,本次任命属于公司治理结构更新而非新增约束。

    已选 1 个今日选题源发布于 Jul 9, 2026查看原文
  • Jul 10, 2026

    官方

    Google Research Blog: SensorFM

    Google 7/9 SensorFM:1T+ 分钟传感器数据 + 5M 人预训练基础模型,可迁移 35 项健康预测任务

    Google Research 7/9 官方博客发表 SensorFM(Xin Liu + Daniel McDuff):面向可穿戴健康的通用基础模型,预训练数据「1 万亿 + 分钟传感器信号 / 来自约 500 万具名同意的人(100+ 国家 / 全美 50 州 / 20+ Fitbit 与 Pixel Watch 型号,数据窗口 2024-09 → 2025-09)」;5 种传感器(PPG、加速度、EDA、皮温、海拔)+ 34 个一分钟级聚合特征。规模曲线跨 4 个量级(~2M → 2B 传感器小时 / 100K → 100M 参数)。最大变体 SensorFM-B 较最小变体:reconstruction loss 下降 31%、分类 AUC 平均提升 9%、回归 Pearson 提升 21%,35 项迁移任务中胜 33 项。Personal Health Agent 评测:31 份参与者画像、1860 份临床医生评分。语义边界:这是研究博客公布的基础模型 + 迁移基准,不是 FDA 认证 / 临床部署 / 诊疗决策辅助;涉及健康话题时务必保留风险提示。

    已选 1 个今日选题源发布于 Jul 9, 2026查看原文

Jul 9, 2026

12 条

Jul 8, 2026

10 条

Jul 7, 2026

10 条
  • Jul 7, 2026

    仓库

    Hugging Face Hub: kernels repository directory

    HF Hub 同步上线 kernels 目录页:127 个仓库,kernels-community 占大头

    配合 7/6 Kernels 改版,Hub 上 huggingface.co/kernels 上线了[kernel] 仓库目录,共 127 个仓库、5 页。下载量最高的是 flash-attn3(6.79k)、flash-attn2(6.63k),更新最频繁的有 vllm-moe、flashrt-fp8-swiglu-ffn、aiter-kernels 等。发布者包括 kernels-community、kernels-staging、flashrt、MiniMaxAI 和大量个人贡献者。

  • Jul 7, 2026

    社区

    Hugging Face Blog: LeRobot v0.6.0 — Imagine, Evaluate, Improve

    HF 7/7 发 LeRobot v0.6.0:闭合机器人学习闭环,世界模型策略 + Robometer + 6 个新 sim 基准

    Hugging Face 7 月 7 日发 LeRobot v0.6.0(主题「Imagine, Evaluate, Improve」)。新引入三个世界模型策略 VLA-JEPA、LingBot-VA、FastWAM,让机器人在训练中「想象」未来状态;统一了 reward-models API,首发 Robometer(基于 Qwen3-VL-4B,产生逐帧进度曲线)与 zero-shot TOPReward;数据集层加了自定义视频编码(NVENC / VideoToolbox / VAAPI / QSV)、Intel RealSense 深度采集、lerobot-annotate CLI 生成 VLM 语言标注,加载速度最高 2x。一次性统一了 6 个新仿真基准 LIBERO-plus、RoboTwin 2.0、RoboCasa365、RoboCerebra、RoboMME、VLABench,全部进入 lerobot-eval CLI;部署侧新增 lerobot-rollout(DAgger 式人在回路纠错),训练侧加 FSDP 与 HF Jobs 一键云训练。底层基础依赖减少约 40%,支持 PyTorch 2.7-2.11 + CUDA 12.8,加 Foxglove 流式可视化与 pip 可装插件包。

  • Jul 7, 2026

    官方

    Anthropic News: Alberta Government + Claude cybersecurity case study

    Alberta 政府用 Claude Code 扫 4.66 亿行代码,20 小时完成,折合 6.5 年人工工作量

    Anthropic 7 月 6 日案例文章:加拿大 Alberta 政府科技创新部用 Claude Code(Opus + Sonnet)并行跑 ~50 个 agent,在 20 小时内跨 1,280 个应用、3,400 个仓库扫描 4.66 亿行代码;同样的活人工估计要 6.5 年。Pipeline 是「规则引擎 + 验证 agent(精确到文件/行号)」两步,然后自动改、写测试、重写老系统;还基于 Claude Agent SDK 组建红队 / 蓝队 agent,持续跑约 95 项安全控制。

    已选 1 个今日选题源发布于 Jul 6, 2026查看原文
  • Jul 7, 2026

    官方

    Anthropic Research: A global workspace in language models

    Anthropic 7/6 发可解释性研究:Claude 内部有「J-space」工作空间,因果驱动多步推理

    Anthropic 7 月 6 日的可解释性研究文章「A global workspace in language models」:用 Jacobian lens(J-lens)读出 Claude 内部一处自发涌现的小型「J-space」,其内容因果驱动多步推理——例如把 J-space 里的「Soccer」换成「Rugby」、「spider」→「ant」、「France」→「China」,下游行为会跟着变。J-space 仅占 Claude 内部活动不到十分之一,屏蔽它会让高阶推理消失,但语法流畅性和简单回忆不受影响。Neel Nanda(DeepMind)做了独立复现。

    已选 1 个今日选题源发布于 Jul 6, 2026查看原文
  • Jul 7, 2026

    社区

    Hugging Face Blog: 🤗 Kernels — Major Updates

    HF 7/6 重塑 🤗 Kernels:trusted publishers + Sigstore cosign + Torch Stable ABI + 首个非 Torch 框架 TVM FFI

    Hugging Face 7 月 6 日对自定义 compute kernel 的打包/分发/消费做了大改版:Hub 上线 [kernel] 仓库类型;新增两层安全——trusted kernel publishers(需用户 trust_remote_code 显式启用)+ Sigstore cosign 签名(临时密钥 + GitHub workflow 验证);kernels 和 kernel-builder 两个 CLI 拆分;新增 Torch Stable ABI(目标覆盖约 2 年的 Torch 版本)与首个非 Torch 框架 Apache TVM FFI;为 agent 自动开发 kernel 准备了 agent-optimized CLI + backend skills + HF Jobs 基准;同时把静态 libstdc++ 切到 manylinux_2_28 动态链接,解决了过去的 corruption/segfault。

    已选 1 个今日选题源发布于 Jul 6, 2026查看原文
  • Jul 7, 2026

    社区

    Hugging Face Blog: Photoroom PRX Part 4 — Our Data Strategy

    Photoroom 7/6 发 PRX Part 4:用 Qwen3-VL-8B 重写 caption,Lance + Mosaic Shards 撑流式训练

    Photoroom 7 月 6 日在 HF 博客发 PRX Part 4 — Our Data Strategy:用 Qwen3-VL-8B 对每一张 PRX 文生图训练图像重新打标,验证了「长的准确 caption 战胜短的 caption」、JPEG 质量 92 与 PNG 视觉上无明显差异,captioner 选用在 PRX 预训练上降了 FID / CMMD / DINO-MMD;数据用 Lance 探索、按分辨率与宽高比分桶重写进 Mosaic Data Shards 以支持流式读,轻量 caption 过滤和 perceptual-hash 去重用 skip list 而不是重写 shard。

    已选 1 个今日选题源发布于 Jul 6, 2026查看原文
  • Jul 7, 2026

    官方

    Anthropic News: Fable 5 cyber safeguards + jailbreak framework

    Anthropic 7/2 公开 Fable 5 网络安全细节 + 提案性 CJS jailbreak 评分框架

    Anthropic 7 月 2 日发布 Fable 5 的网络安全保护细节,并与 Glasswing 合作伙伴提出一个提案性的 Cyber Jailbreak Severity (CJS) 框架,从「能力获得 / 能力获得范围 / 武器化难度 / 可发现性」四个轴线对 jailbreak 做 0-4 评分,同时开通了 HackerOne 提交通道。

    已选 1 个今日选题源发布于 Jul 2, 2026查看原文
  • Jul 7, 2026

    论文

    arXiv 2607.02087: SUNTA — Hierarchical Video Prediction with Surprise-based Chunking

    arXiv 7/2 SUNTA:用「惊喜」驱动分块,HSSM 视频预测 250 步不掉点

    arXiv 编号 2607.02087 的论文 SUNTA(Iiyama / Suzuki / Matsuo,7/2 投稿):用「惊喜」(预测误差)驱动层次化状态空间模型 HSSM 的分块边界,而不是固定长度或相似度;通过解耦训练与「自上而下的内部不一致」充当 open-loop surprise 信号,在 2D 与 3D 视频预测上能稳 250 个时间步,而所有 baseline 在 10 个时间步内就开始退化。

    已选 1 个今日选题源发布于 Jul 2, 2026查看原文

Jul 6, 2026

10 条

Jul 3, 2026

10 条

Jul 2, 2026

10 条

Jul 1, 2026

11 条

Jun 30, 2026

15 条

Jun 29, 2026

3 条

Jun 23, 2026

8 条

Jun 22, 2026

3 条

Jun 21, 2026

2 条

Jun 17, 2026

5 条

Jun 16, 2026

3 条