https://github.com/PaddlePaddle/models/blob/develop/PaddleCV/video/models/nextvlad/README.md

PaddlePaddle / models

Officially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.

Apache License 2.0

6.91k stars 2.91k forks source link

NeXtVLAD模型是第二届Youtube-8M视频理解竞赛中效果最好的单模型，在参数量小于80M的情况下，能得到高于0.87的GAP指标。该模型提供了一种将桢级别的视频特征转化并压缩成特征向量，以适用于大尺寸视频文件的分类的方法。其基本出发点是在NetVLAD模型的基础上，将高维度的特征先进行分组，通过引入attention机制聚合提取时间维度的信息，这样既可以获得较高的准确率，又可以使用更少的参数量。详细内容请参考NeXtVLAD: An Efficient Neural Network to Aggregate Frame-level Features for Large-scale Video Classification。

该模型提供了一种将桢级别的视频特征转化并压缩成特征向量->帧级别

PaddlePaddle / models

https://github.com/PaddlePaddle/models/blob/develop/PaddleCV/video/models/nextvlad/README.md #5291