相关数据集
microsoft/cats_vs_dogs
该数据集名为Cats Vs. Dogs,主要用于图像分类任务,特别是猫和狗的多类图像分类。数据集包含大量的猫和狗的图像,共有23410个训练样本。数据集的创建是为了测试计算机视觉算法是否能够击败Asirra CAPTCHA。数据集的图像来源于Petfinder.com,由美国各地的动物收容所的工作人员手动分类。数据集的特征包括图像和标签,标签为0表示猫,1表示狗。
Hugging Face2024-08-08 更新1660
microsoft/msr_text_compression
该数据集包含句子和短段落及其对应的压缩版本。每个输入文本最多有五个压缩版本,并附有关于其意义保留和语法性的质量判断。数据集来源于Open American National Corpus (OANC1),并通过众包方式进行标注。数据集主要用于文本摘要任务,包含训练集、验证集和测试集。
Hugging Face2024-01-18 更新640
microsoft/xglue
XGLUE 是一个新的基准数据集,用于评估跨语言预训练模型在跨语言自然语言理解和生成任务中的表现。XGLUE 包含 11 个任务,涵盖 19 种语言。对于每个任务,训练数据仅以英语提供,这意味着要在 XGLUE 上取得成功,模型必须具备强大的零样本跨语言迁移能力,能够从特定任务的英语数据中学习并将其迁移到其他语言。与同期工作 XTREME 相比,XGLUE 有两个特点:首先,它同时包含跨语言自然语
Hugging Face2023-06-30 更新190
microsoft/PEACE
GeoMap-Bench是一个为了评估多模态语言模型在地质图理解方面的性能的基准数据集。它包含了来自USGS(英文)和CGS(中文)的图像-问题对及注解答案,共有124张图像和3864个问题。这些问题分为三种类型:选择题、填空题和论述题。数据集覆盖了提取、定位、指代、推理和分析五种能力,并定义了25个任务。
Hugging Face2025-03-17 更新920
microsoft/Dayhoff
Dayhoff数据集是一个集成了蛋白质序列数据和生成语言模型的资源,包含了3.34亿个蛋白质序列,分布在1.7亿个聚类中,这些序列来自宏基因组、天然蛋白质序列、结构衍生的合成序列以及同源序列。该数据集用于训练蛋白质语言模型,能够预测突变对蛋白质适应性的影响,根据进化或结构背景生成支架结构基序,以及在指定的家族内指导生成新型蛋白质。Dayhoff模型结合了状态空间Mamba层和Transformer
Hugging Face2026-04-02 更新320



