登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Image-audio pairs (1 of 3)
Image-audio pairs (1 of 3)
收藏
kaggle
2024-06-17 更新
2024-06-22 收录
跨模态学习
多媒体分析
数据链接:
https://www.kaggle.com/datasets/jorvan/image-audio-pairs-1-of-3
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
(Pairs of related 512x512 images & 1 s audios)
成对的相关512x512图像与1秒音频
应用场景:
创建时间:
2024-06-17
相关数据集
moondream-data
跨模态学习
地理空间标注
该数据集包含图像和文本指令数据,主要面向空间标注任务。数据结构包含以下字段:图像数据(image)、操作指令文本(instruction)、二维坐标点(point,含x/y坐标)、边界框坐标(bbox,含x/y最小最大值)、元素类型(element_type)、元素标签(element_label)、来源网站名称(site_name)、原始URL(url)以及视口信息(viewport)。数据集分
Hugging Face
2026-03-11 更新
28
0
kashif-001
语音识别
多媒体分析
该数据集是一个包含多媒体内容的数据集,主要特征包括音频文件(采样率为16000Hz)和相关的文本信息。数据集中的每条记录包含音频ID、音频内容、文本描述、来源URL、视频ID、标题、时间片段起始和结束点、语言、字幕类型、覆盖率标记、是否重复下载标记、关键词列表、查询内容、关键词和查询的原始输出,以及标记这些输出是否为有效JSON格式的布尔值。数据集适用于语音识别、音频标注、多媒体内容分析等任务。数
Hugging Face
2026-03-24 更新
14
0
Learning Words from Images and Speech
跨模态学习
词汇语义表示
This paper explores the possibility to learn a semantically-relevant lexicon from images and speech only. For this, we train a multi-modal neural network working both on image fragments and on speech
Figshare
2016-01-19 更新
8
0
MDED-68
多域事件检测
多媒体分析
这是一个用于多域事件检测任务的数据集,即MDED-68数据集。该数据集包含23,874张Flickr图像,10,678篇来自数百个在线新闻媒体的新闻文章,以及1,337个YouTube视频。
github
2021-08-19 更新
19
0
VGG-Sound
音视频对应
多媒体分析
Audio-Visual Correspondent Dataset
kaggle
2021-01-10 更新
14
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广