相关数据集
MultiTACRED
MultiTACRED数据集是TACRED数据集的多语言版本,由德国人工智能研究中心创建,包含12种语言,覆盖9个语系,总计约106,000个句子。该数据集通过机器翻译TACRED实例并自动投影实体标注创建,旨在促进多语言关系抽取的研究。数据集涵盖多种语言现象,如复合词、屈折变化和代词省略,适用于多语言模型训练和跨语言学习场景。
arXiv2023-05-15 更新350
BAAI-IndustryCorpus2.0-computer_programming_code
行业模型在推动企业智能化转型和创新发展中发挥着至关重要的作用。高质量的行业数据是提升大模型性能和实现行业应用落地的关键。然而,目前用于行业模型训练的数据集普遍存在数据量少、质量低、专业性不足等问题
智源2024-09-24 更新130
hadiqaemi/relational-triples-1000_relation_list
--- dataset_info: features: - name: example dtype: string splits: - name: train num_bytes: 4931211 num_examples: 12905 - name: test num_bytes: 76063 num_examples: 200 -
Hugging Face2024-04-21 更新100



