东京奥运会已经正式开幕,最新的IT技术也正在进入奥运会。
本届奥运会引入的AI辅助记分,起到了“助理裁判”的作用。这项技术可以追踪玩家的动作,并实时转换成三维图像。然后,系统根据图像对选手的身体旋转和扭动进行分析,最后根据评分标准判断选手的技术完成情况。可以说,机器视觉应用于世界顶级体育赛事的核心领域。

图1:AI在相机屏幕中捕捉玩家的动作
回到国内,业界对图形、音视频算法的探索和实践也在不断向前。近日,由中国马栏山视频文化创意产业园和芒果TV联合举办的第二届“马栏山杯”国际音视频算法大赛刚刚结束赛程。
顶级赛事代言,全球顶尖高校和一线厂商AI人才汇聚
除了输出众多国内顶级视频节目,马栏山视频文创产业园和芒果TV也是实践音视频领域最新AI技术的先行者。几年来,他们不断投入资源和资金,培养和扶持新兴的AI技术团队,已经进入第二年的“马栏山杯”国际音视频算法大赛就是在这种背景下诞生的。
作为顶级的音视频算法大赛,比赛规模庞大,评委和参赛选手的水平也一直保持着最高水平。截止到比赛结束,本次比赛参赛队伍总数达到1959支,参赛选手共计2052人。与去年相比,参赛队伍数量增长了51.4%。他们来自世界顶级科研院所和国内一线互联网技术厂商。他们是AI研究、学术、工程领域的从业者,也是AI领域最炙手可热的人才。
图2:中国排名前60的参与大学和一些国际大学
目前,大赛正式比赛阶段已经全部结束,选手们围绕视频补全、视频推荐、音乐节拍检测三大赛道展开技术对抗。最终,每个赛道都有十支队伍获胜。
三大赛道获奖名单公布,超强选手高水平发挥。
首先,视频完成了跟踪
今年的视频补全大赛题目,就是脱胎于视频行业非常重要的技术需求。视频后期制作希望通过AI利用机器学习技术对视频中的点和图像进行分析,从而实现劣质艺人的擦除、电视剧的擦除、logo的擦除、水印的擦除等操作。参赛者需要根据大赛提供的视频片段数据进行模型训练,利用AI算法完成缺失的视频区域。
视频完成赛道参赛队伍451支,参赛人数473人。在众多参赛选手中,不乏国内各大AI和算法竞赛的获奖者。其中获得第一名的单场选手郑慧是Xi电子科技大学博士,目前在阿里达摩院实习,也是去年大赛视频修复赛道的第二名。“Jing -artii”团队获得第二名,三名成员分别来自华南理工大学和迪士科技公司。他们还获得了音乐节拍检测赛道的第三名。第三名的两位选手都是阿里达摩院的员工。该视频完成了该曲目的前十名列表,如下所示:
图3:视频完成了该曲目的前十名
比赛中,视频完成赛道的基准成绩为68.7054,前十名选手的成绩远高于此,可见选手的技术实力和在本次比赛中的高水平表现。
此外,本次赛道季军的方案设计也有自己的特色。第一位参赛选手郑慧采用了端到端的训练方案STTN,即time 空联合变换器进行视频还原,通过自注意机制同时填充所有输入帧中的缺失区域,并利用L1+time 空拮抗损失优化STTN。为了加快速度和减少视频内存,他使用了半精确模型,并削减了输入。训练过程分两步:首先用小训练补丁训练网络,L1损失+对抗损失;然后用较大的训练面片和L1损耗对网络进行微调。在测试阶段,使用自集成策略来增强结果。

第二个设计了基于循环U网级联和注意力融合的深度学习模型,通过循环结构充分利用帧间信息。
第三个团队采用了STTN和DSTT两种深度模型,针对不同的遮罩类型使用不同的模型,更有针对性地解决了对应视频补全的问题。在实战中,他们发现DSTT对文本类型的水印效果更好,而STTN优于其他类似数据。基于此,他们用DSTT训练文本水印数据,用STTN训练其他数据,并在训练过程中采用各种策略优化网络。
以下是100个已完成视频下的前三名性能分析:
二、视频推荐曲目
大赛第二个题目是视频推荐。目标是通过数据驱动的设计和架构,提高视频推荐的点击率和人均有效观看时间。本次大赛基于芒果TV真实推荐业务场景,设置丰富的特征维度和海量数据信息,希望参赛者能够设计出精准有效的推荐模型,帮助提升视频推荐效果,提升平台用户体验。
推荐视频赛道参赛队伍627支,参赛人数651人。这个赛道是数据科学领域专家的聚集地。前三名都是国内外算法大赛的常客,都在Kaggle上拿过不少金牌。其中,第一名和第三名在Kaggle全球数据科学家最高综合排名中排名第12位,获得Kaggle特级大师称号。十大推荐视频曲目列表如下:
图4:视频推荐十大曲目。
赛马场参与者对竞赛题的设计思路也值得挖掘。第一名获奖者黄中善使用基于回忆+排序+回归的结构来预测本次比赛的多任务目标。在召回层设计中,他从相关视频fvid的历史曝光和点击记录,以及用户主站的观看行为,设置了七个策略。在排名层,主要依靠多维特征工程,如曝光日志、点击日志数据、用户主站行为序列数据等。在模型构建上,他选择了lightgbm,结合了负抽样、交叉验证等策略。
获得第二名的OTTO团队采用了基于召回+排序+多分类的架构。他们在特征工程上做了很多努力,主要包括基础特征、用户兴趣和时间特征。比如转化率、频率特征、标签在用户历史中的点击和转化、f vid下vid的最后一次点击时间与当前时间的距离等。最后用lightgbm对特征进行建模,得到预测结果。
季军姜立采用的是粗排+精排+二级分类的架构。姜立的团队使用了与前两个团队相同的信息和模型,但在架构理念上有所不同。团队采用粗排列+细排列+二分类预测的设计。其中,大致安排是每天召回3000w+样本,使用50个左右的特征;根据每个did-fvid,排选出top60作为候选,最后通过二元分类模型输出预测结果。
第三,音乐节拍检测跟踪
在大赛第三期音乐节拍检测赛道,参赛选手基于AI算法学习训练音乐的节奏和节拍,实现节拍步进匹配视频等创新应用。此题提供数据集,选手需要通过深度学习算法实现对拍和拍强拍的检测,并识别时间点。同时,他们也可以使用传统的音频算法。
音乐节拍测试赛道共有452支队伍参加,参赛人数为467人。前三名分别来自清华大学、湖南大学、厦门大学和华南理工大学。mg13078804B一队队员吴健是清华的硕士,府前亚二队队员王志宇是湖南大学的硕士,三是迪石科技和华南理工大学的校企联合团队。其他十强选手还有中国银行、华为等知名企业,以及多次获得AI大赛冠名的人工智能领域优秀人才。十大音乐节拍检测音轨列表如下:
图5:十大音乐节拍检测音轨

对于音乐节拍试题的分析和实现,赛道冠亚军三支队伍有不同的方案。首届参赛选手吴健在本次大赛中提出了基于TCN网络和GRU+MLP网络的两阶段解决方案,并通过模型整合策略进一步提高了结果的准确性。为了减少预测时间,固定fft大小用于特征提取,torch.stft是最有效的一种。此外,吴健在节拍处理过程中发现DBNBeatProcessor并不适合比赛数据,他通过自相关对网络预测结果进行了优化,提高了最终结果的准确性。
第二位府前崖战队队员王志宇提供了一个转学方案。通过BiLSTM网络对大赛提供的GTZAN数据集进行预训练,然后对验证集进行微调,使模型更适合大赛验证集的音乐风格。为了平衡模型的速度和精度,他只做单一模型来推理。
11月赛道季军肖邦提供了深度学习与规则后处理相结合的新解决方案。通过对音频数据使用不同的分析方法,他们为同一网络训练了两个模型,然后通过平均概率融合两个模型的预测结果。
纵观获奖团队对竞赛题的拆解和设计实践,我们可以看到,就像AI模型需要不断训练上千亿的参数一样,AI的应用也不再是理论上的探索,而是结合实际工程问题的大量研究和实践。电视的芒果音/视频算法大赛汇集了国内一线音/视频项目的真实痛点,也正因为如此,连续两年的大赛吸引了国内外顶尖的AI高手参赛。
本次大赛汇聚了来自视频节目制作人和知名高校、科技厂商的顶尖AI专家。为他们提供相互竞争、相互启发的场景,帮助他们制作出顶级的音视频算法方案,这也是“马兰山杯”国际音视频算法大赛更重要的意义。马兰山杯国际音视频算法大赛作为顶级赛事的算法大赛,促进了AI机器学习领域的多方共赢,也将成为AI音视频行业不可或缺的重要赛事。CSDN将持续跟进大赛后续发展和大赛最新技术实践,敬请关注。


