已核验 · Aug 5, 2026
已独立佐证VideoChat3 7/17(arXiv 2607.14935):4B 全栈开放视频 MLLM,3 个 response-state token 控制像素预算 + H200 上 2048 帧推理快 2 倍
2 个信源arXiv 2607.14935(7/17 索引,MCG-Nanjing University)提出 VideoChat3 —— 4B 参数全栈开放视频 MLLM;架构:(1) Inflated 3D Vision Transformer (I3D-ViT)把 2D 空间 self-attention 扩成 3D 时空 self-attention,16x 时空压缩比;(2) Adaptive Frame Resolution for Streaming Video Perception 用 </Silence> / </Standby> / </Response> 三个响应状态 token 控制下一窗口像素预算(Silence/Response 224²、Standby 448²);训练数据 3M 样本:VideoChat3-Academic2M(2.27M)、VideoChat3-LV116K(116.2K)、VideoChat3-OL617K(617K),四阶段训练;全栈开放 —— 权重 + 训练代码 + 训练策略 + 完整训练数据。自报基准(VideoChat3-4B vs open-weight Qwen3-VL-4B):MotionBench 61.7 vs 58.6、TempCompass 75.6 vs 70.8、Video-MME 70.1 vs 69.3、LVBench 56.7 vs 56.2、MMVU 56.4 vs 50.5、Charades TL mIoU 56.1 vs 46.4、VUE-TR V1 47.9 vs 32.9、VUE-TR V2 40.2 vs 19.6、MomentSeeker 25.9 vs 13.8;流式 ODVBench 72.3 vs StreamForest 59.9(+12.4);NVIDIA H200 上 2048 帧:总延迟 20.412s vs Qwen3-VL 44.449s、视觉 token 100,352 vs 200,704(一半)、GPU 内存省 26.14 GB;文章称在三个 TimeLens split 上超过 GPT-5 与 Gemini 2.5 Flash。
为什么现在讲
7/17 索引的 VideoChat3 是 7 月最强全栈开放视频 MLLM 研究 —— 4B 参数 + 全栈开放(权重 + 代码 + 训练策略 + 训练数据)+ 3 个 response-state token 控制像素预算 + 3M 训练数据 + H200 上 2048 帧推理快 2 倍;创作者可以做出「开放视频 MLLM 第一次在 TimeLens 上超过 GPT-5 与 Gemini 2.5 Flash」的对照内容
推荐理由
可演示空间大:可以拉 VideoChat3-4B 跑同一段视频(对话 vs 教学 vs 监控)对照 Qwen3-VL-4B,展示 3 个 response-state token 的具体效果
依据
arXiv 7/17 索引 + 全栈开放(权重 + 代码 + 训练策略 + 数据)+ 9 个 video benchmark 一致超 Qwen3-VL-4B + 3 个 TimeLens split 超 GPT-5 与 Gemini 2.5 Flash + H200 推理快 2 倍,作为单一研究事件热度中上
“「VideoChat3 7/17 上 arXiv —— 4B 全栈开放视频 MLLM(权重 + 代码 + 训练策略 + 训练数据),3 个 response-state token 控制像素预算,H200 上 2048 帧推理快 2 倍,3 个 TimeLens split 超 GPT-5 与 Gemini 2.5 Flash。」”
切入角度
把 VideoChat3(arXiv 2607.14935)讲成「7 月最强全栈开放视频 MLLM 研究」 —— 创作者做出「4B 参数 + 全栈开放(权重+代码+训练策略+训练数据)+ 9 个 video benchmark 超 Qwen3-VL-4B + 3 个 TimeLens split 超 GPT-5 与 Gemini 2.5 Flash + H200 推理快 2 倍」的多维对照
形式
长视频讲解
演示想法
做一段 10 分钟三段对照 demo:第一段 3 分钟讲「为什么视频 MLLM 难」(cross-domain 弱 / 计算开销大 / 训练资产开放不全);第二段 4 分钟讲「VideoChat3 三招架构创新」(Inflated 3D ViT 的 16x 时空压缩 / 3 个 response-state token 控制像素预算 / 3M 训练数据的四阶段训练);第三段 3 分钟讲「VideoChat3 vs Qwen3-VL-4B vs GPT-5 vs Gemini 2.5 Flash」(9 个 benchmark 一致超 + H200 上推理快 2 倍 + GPU 内存省 26.14 GB)
平台注意
基准数字与「超过 GPT-5 / Gemini 2.5 Flash」的论断是 MCG-Nanjing University 作者论文自陈(中等风险),不要改写为「第三方验证」;具体作者名单与确切协议摘要里都没给(中等风险),不要凭印象补
可用说法
- arXiv 2607.14935(在 HF daily papers 上 2026-07-17 索引)提出 VideoChat3 —— 一个 4B 参数、全栈开放、高效且通用、以视频为中心的多模态大模型;解决现有开源视频模型三个短板:跨域泛化弱、计算开销大、训练资产开放不全;架构:(1) Inflated 3D Vision Transformer (I3D-ViT)把预训练 image tokenizer 充气扩展,把 2D 空间 self-attention 扩成 3D 时空 self-attention,连续帧按 T=4 分块,做时空 self-attention 后做 temporal pooling,加 2x2 spatial downsampling 得到 16x 时空压缩比;(2) Adaptive Frame Resolution for Streaming Video Perception 用三个响应状态 token(</Silence>、</Standby>、</Response>)同时控制下一窗口的像素预算:Silence/Response → 224² 像素(低),Standby → 448² 像素(高);训练数据 3M 样本:VideoChat3-Academic2M(2.27M)、VideoChat3-LV116K(116.2K)、VideoChat3-OL617K(617K);四阶段训练(tokenizer pre-training → video-language alignment → video instruction tuning → long & streaming instruction tuning);全栈开放 —— 权重 + 训练代码 + 训练策略 + 完整训练数据;基准数字(VideoChat3-4B vs open-weight Qwen3-VL-4B):MotionBench 61.7 vs 58.6、TempCompass 75.6 vs 70.8、Video-MME 70.1 vs 69.3、LVBench 56.7 vs 56.2、MMVU 56.4 vs 50.5、Charades TL mIoU 56.1 vs 46.4、VUE-TR V1 47.9 vs 32.9、VUE-TR V2 40.2 vs 19.6、MomentSeeker 25.9 vs 13.8;流式:ODVBench 72.3 vs StreamForest 59.9(+12.4)、OVOBench task avg 62.5、StreamingBench Real-Time 83.0、River Avg 42.8、OVO-Timing Avg F1 35.5 vs Qwen3-VL-4B 8.1;NVIDIA H200 上 2048 帧效率:总延迟 20.412s vs Qwen3-VL 44.449s,总 FLOPs 80.775 × 10^15 vs 106.913 × 10^15,GPU 内存 80.775 GB vs 106.913 GB(省 26.14 GB),visual tokens 100,352 vs 200,704(一半);MotionBench(61.7)与 TempCompass(75.6)最佳全栈开放成绩;文章称 VideoChat3「在三个 TimeLens split 上都超过 GPT-5 和 Gemini 2.5 Flash」。
证据链
拆解
VideoChat3 单独念 9 个 benchmark 数字(MotionBench 61.7 / TempCompass 75.6 / VUE-TR V1 47.9 / V2 40.2 / ODVBench 72.3 等)会变成「benchmark 跳分念稿」。本篇解释怎么用「4B 参数 + 全栈开放 + 3 个 response-state token 控制像素预算 + H200 上 2048 帧推理快 2 倍」框架讲 —— 创作者做出「4B 参数全栈开放(权重+代码+训练策略+训练数据)+ 3 个 response-state token 控制像素预算(Silence/Response 224²、Standby 448²)+ H200 上 2048 帧推理快 2 倍 + 3 个 TimeLens split 超 GPT-5 与 Gemini 2.5 Flash」的多维对照。
信源
风险
- 固定链到每条 source,只引用摘要里已公开的内容,不要改写除摘要之外的基准分、性能指标、论文细节、集成里程碑或架构细节。
- 固定链到 arXiv 论文页面,只引用论文摘要里已公开的内容;明确指出基准数字与「超过 GPT-5 / Gemini 2.5 Flash」的论断均为 MCG-Nanjing University 作者论文自陈。
演示思路
- 在 H200 上跑 VideoChat3-4B vs Qwen3-VL-4B 同一段视频(对话 / 教学 / 监控),展示 9 个 benchmark 一致超 + H200 上 2048 帧推理快 2 倍 + GPU 内存省 26.14 GB
- 做一张「3 个 response-state token 控制像素预算」信息卡:Silence/Response 224²、Standby 448²,在视频监控 / 视频对话 / 长视频教学 3 个场景下分别配什么
- 录一段「全栈开放 vs 部分开放」对照 demo —— VideoChat3 同时放出 VideoChat3-Academic2M(2.27M)、VideoChat3-LV116K(116.2K)、VideoChat3-OL617K(617K)三个训练数据集 + 训练代码 + 权重 + 训练策略,讲清「为什么全栈开放比 partial open 重要」