图像分类器拿下视频理解:VideoMSN用10轮训练超越VideoMAE的1600轮

2026年9月30日,arXiv发布一篇论文。印度理工学院等机构的六位研究者提出VideoMSN框架,图像分类器无需改造即可直接处理视频,在三项标准基准上超越专为视频设计的先行方法,预训练代价降低100倍以上。该论文已被BMVC 2026收录。

VideoMSN-DINO(ViT-B规格)在Kinetics-400动作识别基准上取得83.3% top-1准确率,预训练轮数仅为10轮。VideoMAE实现81.5%需要1600轮,SMILE达到83.1%需要600轮。在UCF101基准上,VideoMSN以10轮训练达到95.4%,VideoMAE的91.3%对应3200轮。HMDB51上,VideoMSN以10轮达到70.4%,VideoMAE的62.6%消耗4800轮。VideoMSN的浮点运算量约为VideoMAE的1/8.9,挂钟时间快12.3倍。

把视频“压扁”成图片

VideoMSN将视频的多帧画面按网格方式拼合成一张大图,称为“超图像”(super image)。这一操作把三维时空数据转化为二维图像输入,使现成图像ViT可直接处理。

从同一段视频生成的超图像中构造两个视图:一个遮盖空间位置上的图像块(空间掩码),另一个遮盖时间维度上的若干帧(时间掩码),两者无信息泄露。共享的ViT编码器处理两个视图,通过掩码孪生损失对齐嵌入。流程无需解码器,不做像素级重建。

基础编码器选用Meta的DINO-v3和DeiT-v3。DINO-v3于2025年夏季发布,使用70亿参数的教师模型在17亿张图像上训练,是性能最强的图像自监督视觉编码器之一。VideoMSN直接在这些编码器基础上进行视频微调,将图像理解的先验知识迁移至时序场景。

反直觉的信号

视频理解领域过去十年的主流观点认为,图像模型无法真正理解运动,必须引入三维卷积或时序注意力。VideoMAE、TimeSformer等方法沿此路线设计架构。VideoMSN的实验结果与这一观点矛盾。

多帧平铺进同一张超图像时,空间上的相对位置携带时序信息,帧与帧之间的位置关系隐式编码运动方向和速度变化。ViT的全局注意力机制在二维平面内捕捉块与块的关联,即可学到跨帧运动模式。时间掩码迫使模型在缺失部分帧时重建嵌入,使编码器学习帧间连续性。

VideoMSN未改造图像模型,而是将视频问题重构为图像模型已擅长的问题。

效率来源

VideoMSN的效率来自三方面:DINO-v3等编码器已在海量图像上学到强健视觉语义,视频微调只需补充时序信息;无需解码器,省去VideoMAE重建掩码区域像素的计算;超图像将多帧打包进单次前向计算,批次效率高于逐帧3D方案。

VideoMAE在Kinetics-400上达到竞争力水平默认需要800轮,最佳配置使用1600轮;VideoMSN在相同ViT-B规格下,10轮已超过VideoMAE 1600轮的精度。在UCF101和HMDB51上差距更大。在仅有1000个训练样本的UCF101低样本实验中,VideoMSN-DINO达到89.0%,比SMILE高2.6个百分点。

算力门槛变化

视频自监督学习的算力要求是规模化主要障碍。VideoMAE在Kinetics-400上完成800轮预训练需要数十GPU小时,数千轮场景成本达数千美元,使该领域研究主要限于大型实验室。

VideoMSN的效率提升使单张消费级GPU一天内完成视频自监督预训练在理论上可行。若结果在更广场景验证,工业侧对定制化视频模型的需求将以更低算力预算得到满足。

当前局限

论文聚焦Kinetics-400、UCF101和HMDB51三个动作识别基准。这些数据集视频片段通常短于10秒,动作类别明确。超图像在短视频、集中动作场景下有效编码时序结构,在长达数分钟的复杂场景视频上的表现缺乏数据。

DINO-v3预训练数据以互联网图像为主,迁移至红外、超声波、卫星等非自然图像视频域时的表现需额外验证。

结论

VideoMSN证明图像ViT在恰当输入表示下,能以极少专门训练实现对视频时空信息的有效编码。10轮对1600轮、83.3%对81.5%的结果在标准基准上已难以用误差解释。