登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
VGG-Sound
VGG-Sound
收藏
kaggle
2021-01-10 更新
2024-03-08 收录
音视频对应
多媒体分析
数据链接:
https://www.kaggle.com/datasets/codebreaker619/vggsound
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Audio-Visual Correspondent Dataset
音视觉对应数据集(Audio-Visual Correspondent Dataset)
应用场景:
创建时间:
2021-01-10
相关数据集
hexuan21/test2
多媒体分析
音视频文本对齐
该数据集包含两个配置(default和real),每个配置包含多个特征,如id、images、text prompt、video link等。数据集主要用于测试,包含80个示例,每个示例都有关于视觉质量、时间一致性、动态程度、文本到视频对齐、事实一致性等方面的评分。此外,每个示例还包含对话信息,记录了对话的来源和内容。
Hugging Face
2024-06-22 更新
30
0
AvaMerg_Baseline
多模态学习
多媒体分析
数据集文件元信息以及数据文件,请浏览“数据集文件”页面获取。 当前数据集卡片使用的是默认模版,数据集的贡献者未提供更加详细的数据集介绍,但是您可以通过如下GIT Clone命令,或者ModelScope SDK来下载数据集 #### 下载方法 :modelscope-code[]{type="sdk"} :modelscope-code[]{type="git"} # 数据集处理与使用指南
魔搭社区
2025-06-30 更新
21
0
MDED-68
多域事件检测
多媒体分析
这是一个用于多域事件检测任务的数据集,即MDED-68数据集。该数据集包含23,874张Flickr图像,10,678篇来自数百个在线新闻媒体的新闻文章,以及1,337个YouTube视频。
github
2021-08-19 更新
19
0
MRSAudio
音频处理
多媒体分析
MRSAudio是一个大规模的多模态录音空间音频数据集,包含同步的双耳和全景声音频、外向和主观视频、运动轨迹以及详细的语义注释。这个数据集分为四个子集,分别是MRSLife、MRSSpeech、MRSSing和MRSMusic,它们分别针对日常活动、演讲、歌唱和音乐等不同场景,支持空间音频的检测、定位、生成等研究。
Hugging Face
2025-05-16 更新
30
0
NilanE/wfvae-192_17-L16-S10000
视频处理
多媒体分析
一个从TencentARC/MiraData中采样得到的小型测试数据集,用于https://github.com/NilanEkanayake/TiTok-Video项目。
Hugging Face
2024-12-13 更新
20
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广