原创 图像分类器拿下视频理解:VideoMSN用10轮训练超越VideoMAE的1600轮 来自arXiv的最新研究VideoMSN提出将视频帧排列成"超图像"网格,用标准图像ViT编码器完成时空表征学习,无需3D架构或像素重建。在Kinetics-400基准上,VideoMSN仅用10轮预训练就达到83.3%准确率,而Video 视频自监督学习 VideoMSN Vision Transformer 计算机视觉 10小时前 25