官方服务:
资源简介:
daigt-v2-aug for LLM detect
应用场景:
创建时间:
2024-01-08
相关数据集
PV-ALE Dataset
PV-ALE数据集是由约克大学和都柏林城市大学创建的,旨在增强苹果叶病分类的多样性和复杂性。该数据集扩展了广泛使用的PlantVillage数据集,增加了新的苹果叶病类别,包含3,383张原始图像和20,808张通过数据增强技术生成的图像。数据集的创建过程包括图像收集、验证、裁剪和背景去除等步骤,确保了数据的质量和可靠性。PV-ALE数据集主要应用于苹果叶病的自动检测和分类,旨在提高模型的准确性和
arXiv2024-10-30 更新2710
distil-whisper/tedlium
Distil Whisper: TEDLIUM是TEDLIUM数据集的一个变体,增加了使用Whisper模型生成的伪标签转录。这些伪标签转录是通过使用Whisper large-v2模型对输入音频数据进行贪婪采样生成的。数据集的使用包括安装和加载数据集的步骤,支持流模式直接从Hub加载数据。此外,文件还提供了如何使用该数据集复现Distil Whisper训练过程的指导。
Hugging Face2023-09-25 更新290
soerenray/speech_commands_enriched_and_annotated
该数据集是一个增强版的语音命令数据集,包含了60,973个样本,分为30个类别(外加一个静音类别)。数据集旨在评估关键词识别模型,并通过添加音频嵌入、预测标签、注释和嵌入等信息进行了增强。数据集的结构包括音频、标签、是否为未知、说话者ID、话语ID、逻辑值、概率、预测标签、注释标签、嵌入和降维嵌入等特征。数据集支持的任务包括TensorFlow语音识别挑战,语言为英语。
Hugging Face2023-07-31 更新160
ILSVRC-2012
本研究中使用的数据集为ILSVRC-2012,由哈尔滨工业大学等机构创建,旨在通过自动数据增强技术提升图像识别任务的性能。该数据集通过网络获取了额外的1250万张图像,这些图像带有丰富的上下文信息,通过深度卷积神经网络(DCNN)进行自动标注。数据集的创建过程结合了网络的上下文信息和DCNN的视觉信息,以提高标注的准确性和数据集的丰富性。该数据集主要应用于图像识别领域,特别是通过自动增强现有数据集
arXiv2018-04-16 更新1750



