遇见数据集

AI4Agr/CROP-dataset

收藏
Hugging Face2024-12-02 更新2024-06-29 收录
官方服务:

资源简介:

--- license: cc-by-nc-4.0 --- ## Introduction Crop-dataset is a large-scale open-source instruction fine-tuning dataset for LLMs in crop science, which includes over 210K high-quality question-answer pairs in Chinese and English. <div style="text-align: center;"> <img src="./Figures/dataset_pre_distribution.png" alt="Dataset Framework" width="100%"/> </div> ## Basic Information Currently, Crop-dataset primarily includes two types of grains: rice and corn. The dataset contains a sufficient amount of single-turn and multi-turn question-answer pairs. ### Composition of the Single-round Dialogue Dataset | Cereal | Type | Task | English QA | Chinese QA | Total | |--------|------|-----------------------------|------------|------------|--------| | Rice | Closed QA | In-domain knowledge QA | 42951 | 83396 | 126347 | | | Open QA | In-domain knowledge QA | 2430 | 2037 | 4467 | | | | Event extraction | 1891 | 1030 | 2921 | | | | Named Entity Recognition| 2003 | 1604 | 3607 | | | | Summary | 1586 | 1628 | 3214 | | Corn | Closed QA | In-domain knowledge QA | 25259 | 27667 | 52926 | | | Open QA | In-domain knowledge QA | 3202 | 3047 | 6249 | | | | Event extraction | 2245 | 1322 | 3567 | | | | Named Entity Recognition| 2008 | 1316 | 3324 | | | | Summary | 1559 | 1857 | 3416 | | Others*| --- | --- | --- | --- | <1000 | | Overall| --- | --- | 85134 | 124904 | 210038 | *The 'Others' category includes data from other grains like wheat, which is less than 1000 QA pairs in total. Please note that despite our data-cleaning efforts, the final QA pairs inevitably contain a small amount of data (<0.5%) from other grains like wheat. Because we think this data does not dominantly influence the fine-tuning results, it is included in the rice and maize QA pairs, and we have listed it separately to avoid any misleading counts. ### Composition of the Multi-round Dialogue Dataset | Cereal | Scenario | Task | English QA | Chinese QA | Total | |--------|---------------------------|--------------------------|--------------------------------|-----------------------------|-------| | Rice | Problem Solving | Pest Control | 14 (3-turn) + 71 (4-turn) | 8 (3-turn) + 37 (4-turn) | 130 | | | | Nutrient Supplementation | 19 (3-turn) + 93 (4-turn) | 2 (3-turn) + 90 (4-turn) + 1 (5-turn) | 205 | | | | Disease Containment | 19 (3-turn) + 60 (4-turn) | 4 (3-turn) + 39 (4-turn) | 122 | | | Personalized Recommendation | Crop Variety Selection | 12 (3-turn) + 53 (4-turn) | 9 (3-turn) + 9 (4-turn) | 83 | | | | Resource Management | 4 (3-turn) + 110 (4-turn) + 1 (5-turn) | 5 (3-turn) + 50 (4-turn) | 170 | | | Knowledge Interpretation | Research Interpretation | 3 (3-turn) + 125 (4-turn) + 1 (5-turn) | 8 (3-turn) + 85 (4-turn) | 222 | | Corn | Problem Solving | Pest Control | 20 (3-turn) + 84 (4-turn) | 7 (3-turn) + 77 (4-turn) | 188 | | | | Nutrient Supplementation | 24 (3-turn) + 56 (4-turn) | 8 (3-turn) + 30 (4-turn) | 118 | | | | Disease Containment | 21 (3-turn) + 64 (4-turn) | 2 (3-turn) + 19 (4-turn) + 1 (5-turn) | 107 | | | Personalized Recommendation| Crop Variety Selection | 19 (3-turn) + 75 (4-turn) | 46 (3-turn) + 47 (4-turn) | 187 | | | | Resource Management | 8 (3-turn) + 94 (4-turn) | 1 (3-turn) + 69 (4-turn) | 172 | | | Knowledge Interpretation | Research Interpretation | 5 (3-turn) + 94 (4-turn) + 1 (5-turn) | 6 (3-turn) + 61 (4-turn) | 167 | | Overall| --- | --- | 1150 | 721 | 1871 | ## How to Use We have released our dataset in Alpaca format. All question-answer pairs are organized by task. The codes and prompts related to this dataset are released at https://github.com/RenqiChen/The_Crop. ## BibTeX & Citation If you find our codes and datasets useful, please consider citing our work: ```bibtex @inproceedings{zhangempowering, title={Empowering and Assessing the Utility of Large Language Models in Crop Science}, author={Zhang, Hang and Sun, Jiawei and Chen, Renqi and Liu, Wei and Yuan, Zhonghang and Zheng, Xinzhe and Wang, Zhefan and Yang, Zhiyuan and Yan, Hang and Zhong, Han-Sen and others}, booktitle={The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track} } ```

license: CC BY-NC 4.0(知识共享署名-非商业性使用4.0国际许可协议) ## 引言 作物数据集(Crop-dataset)是一款面向大语言模型(Large Language Models,LLMs)的大规模开源指令微调数据集,聚焦作物科学领域,涵盖超21万组中英双语高质量问答对。 <div style="text-align: center;"> <img src="./Figures/dataset_pre_distribution.png" alt="数据集框架" width="100%"/> </div> ## 基本信息 目前,作物数据集主要涵盖水稻与玉米两大类谷物,包含充足的单轮与多轮问答对。 ### 单轮对话数据集构成 | 谷物 | 类型 | 任务 | 英文问答对 | 中文问答对 | 总计 | |--------|--------|-----------------------------|------------|------------|---------| | 水稻 | 封闭问答 | 域内知识问答 | 42951 | 83396 | 126347 | | | 开放问答 | 域内知识问答 | 2430 | 2037 | 4467 | | | | 事件抽取 | 1891 | 1030 | 2921 | | | | 命名实体识别 | 2003 | 1604 | 3607 | | | | 文本摘要 | 1586 | 1628 | 3214 | | 玉米 | 封闭问答 | 域内知识问答 | 25259 | 27667 | 52926 | | | 开放问答 | 域内知识问答 | 3202 | 3047 | 6249 | | | | 事件抽取 | 2245 | 1322 | 3567 | | | | 命名实体识别 | 2008 | 1316 | 3324 | | | | 文本摘要 | 1559 | 1857 | 3416 | | 其他* | --- | --- | --- | --- | <1000 | | 总计 | --- | --- | 85134 | 124904 | 210038 | *「其他」类别包含小麦等其他谷物的数据,总问答对不足1000组。 请注意,尽管经过数据清洗流程,最终的问答对中仍包含少量(<0.5%)来自小麦等其他谷物的数据。我们认为此类数据不会对微调结果产生显著影响,因此将其并入水稻与玉米的问答对中,并单独列出以避免统计误导。 ### 多轮对话数据集构成 | 谷物 | 应用场景 | 任务 | 英文问答对 | 中文问答对 | 总计 | |--------|---------------------------|--------------------------|--------------------------------|-----------------------------|-------| | 水稻 | 问题解决 | 病虫害防治 | 14(3轮)+ 71(4轮) | 8(3轮)+ 37(4轮) | 130 | | | | 养分补给 | 19(3轮)+ 93(4轮) | 2(3轮)+ 90(4轮)+ 1(5轮)| 205 | | | | 病害防控 | 19(3轮)+ 60(4轮) | 4(3轮)+ 39(4轮) | 122 | | | 个性化推荐 | 作物品种选择 | 12(3轮)+ 53(4轮) | 9(3轮)+ 9(4轮) | 83 | | | | 资源管理 | 4(3轮)+ 110(4轮)+ 1(5轮) | 5(3轮)+ 50(4轮) | 170 | | | 知识解读 | 研究解读 | 3(3轮)+ 125(4轮)+ 1(5轮) | 8(3轮)+ 85(4轮) | 222 | | 玉米 | 问题解决 | 病虫害防治 | 20(3轮)+ 84(4轮) | 7(3轮)+ 77(4轮) | 188 | | | | 养分补给 | 24(3轮)+ 56(4轮) | 8(3轮)+ 30(4轮) | 118 | | | | 病害防控 | 21(3轮)+ 64(4轮) | 2(3轮)+ 19(4轮)+ 1(5轮)| 107 | | | 个性化推荐 | 作物品种选择 | 19(3轮)+ 75(4轮) | 46(3轮)+ 47(4轮) | 187 | | | | 资源管理 | 8(3轮)+ 94(4轮) | 1(3轮)+ 69(4轮) | 172 | | | 知识解读 | 研究解读 | 5(3轮)+ 94(4轮)+ 1(5轮) | 6(3轮)+ 61(4轮) | 167 | | 总计 | --- | --- | 1150 | 721 | 1871 | ## 使用方式 本数据集已以Alpaca格式发布,所有问答对均按任务类型组织。与本数据集相关的代码与提示词已发布于https://github.com/RenqiChen/The_Crop。 ## BibTeX 引用 若您认为本数据集与代码对您的研究有所帮助,请考虑引用我们的工作: bibtex @inproceedings{zhangempowering, title={Empowering and Assessing the Utility of Large Language Models in Crop Science}, author={Zhang, Hang and Sun, Jiawei and Chen, Renqi and Liu, Wei and Yuan, Zhonghang and Zheng, Xinzhe and Wang, Zhefan and Yang, Zhiyuan and Yan, Hang and Zhong, Han-Sen and others}, booktitle={The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track} }

提供机构:
AI4Agr
搜集汇总
数据集介绍
AI4Agr/CROP-dataset 数据集图片
构建方式
在作物科学领域,大规模语言模型的指令微调需要高质量、领域特化的数据集作为支撑。为此,CROP-dataset应运而生,这是一个面向作物科学的中英文双语大规模指令微调数据集,包含超过21万条高质量问答对。该数据集的构建以水稻和玉米两大主要谷物为核心,系统性地覆盖了单轮与多轮对话场景。单轮对话数据依据谷物种类(水稻/玉米)和任务类型(封闭式领域知识问答、开放式领域知识问答、事件抽取、命名实体识别、文本摘要)进行分层组织,其中封闭式问答占据了主体地位。多轮对话数据则围绕问题解决、个性化推荐和知识解读三类应用场景展开,涵盖了病虫害防治、养分补充、疾病控制、品种选择、资源管理及研究解读等具体任务,对话轮次以3轮和4轮为主。此外,数据集还包含少量其他谷物(如小麦)的问答对,但占比不足0.5%。
特点
CROP-dataset最显著的特点在于其大规模、双语覆盖与任务多样性。作为首个公开的作物科学指令微调数据集,其21万余条问答对中,中文问答对约12.5万条,英文约8.5万条,为跨语言作物科学大模型训练提供了宝贵资源。数据集的单轮对话部分以封闭式领域知识问答为主,确保了基础知识的扎实覆盖;同时融入事件抽取、命名实体识别等结构化任务,增强了模型的信息提取能力。多轮对话部分则模拟真实农业咨询场景,通过问题解决、个性化推荐和知识解读等复杂对话,考察模型的推理与交互能力。值得一提的是,数据集在构建过程中经过了严格的数据清洗,尽管仍包含微量其他谷物数据,但整体质量可控,不会对微调效果产生显著影响。
使用方法
该数据集以Alpaca格式发布,所有问答对均按任务类型进行清晰归类,极大便利了研究者的使用与集成。用户可直接从HuggingFace页面下载数据集,并利用其配套的代码与提示词模板(开源在https://github.com/RenqiChen/The_Crop)进行指令微调。使用时,可根据研究目标灵活选择单轮或多轮对话子集,也可按语言(中文/英文)或任务类型(如命名实体识别、事件抽取)进行筛选。数据集采用CC-BY-NC-4.0许可协议,仅限非商业用途。若在科研工作中使用该数据集,建议引用其对应的NeurIPS论文,以尊重原创团队的贡献。
背景与挑战
背景概述
在作物科学领域,大型语言模型(LLMs)的应用正逐步崭露头角,然而,缺乏高质量的指令微调数据集严重制约了其在该领域的性能提升。为此,由Zhang、Sun、Chen等多位研究人员组成的团队,在2024年NeurIPS数据集与基准评测轨道上发布了CROP-dataset。该数据集创建于2024年,旨在为作物科学中的LLMs提供大规模开源指令微调资源,涵盖超过21万条中英文高质量问答对,主要聚焦于水稻和玉米两大谷物。CROP-dataset不仅包含单轮对话数据,还设计了多轮对话场景,如问题解决、个性化推荐和知识解读,覆盖病虫害防治、养分补充、品种选择等关键任务。这一开创性工作填补了作物科学领域专用数据集的空白,为LLMs在精准农业和作物管理中的实际部署奠定了坚实基础,显著推动了该领域从通用模型向专业化应用的跨越。
当前挑战
CROP-dataset所面临的挑战首先体现在领域问题的复杂性上:作物科学知识体系庞大且地域性强,现有数据仅涵盖水稻和玉米两种谷物,对小麦等其他作物的覆盖不足(少于1000对问答),限制了模型的泛化能力。同时,多轮对话场景虽丰富,但数据量有限(总计1871对),尤其是5轮对话样本稀缺,难以支撑复杂交互任务的深度学习。在构建过程中,团队遭遇了数据清洗的难题,尽管尽力去噪,最终数据中仍混有约0.5%的小麦等非目标作物问答对,可能引入偏差。此外,双语问答对的比例失衡(中文124,904对,英文85,134对),以及单轮与多轮数据量的巨大差异(210,038对 vs. 1,871对),为模型训练中的平衡采样和任务适配带来了额外挑战。
常用场景
经典使用场景
在作物科学领域,CROP-dataset作为大规模指令微调数据集,其经典使用场景在于为大型语言模型(LLMs)提供领域内知识问答、事件抽取、命名实体识别及摘要生成等单轮对话任务,以及病虫害防治、养分补充、疾病控制等复杂多轮对话场景。该数据集涵盖水稻和玉米两大主粮作物,包含超过21万条中英文高质量问答对,为作物科学领域的模型训练提供了丰富的语义多样性和任务覆盖度,成为推动LLMs在农业垂直领域应用的基础性资源。
解决学术问题
CROP-dataset有效解决了作物科学领域缺乏大规模、高质量、结构化中英文指令数据集的核心学术瓶颈。传统农业知识库多呈碎片化或仅面向单一任务,难以支撑LLMs的领域适应能力。该数据集通过系统化构建封闭式与开放式问答、信息抽取、多轮对话等多元任务,显著提升了模型在作物病虫害诊断、品种推荐、资源管理等关键问题上的理解与推理能力,为农业知识图谱构建、智能决策支持系统等前沿研究奠定了数据基石。
衍生相关工作
围绕CROP-dataset已衍生出一系列具有影响力的工作,例如《Empowering and Assessing the Utility of Large Language Models in Crop Science》被NeurIPS 2024数据集与基准赛道收录,系统评估了LLMs在作物科学中的效用。此外,研究团队开源了配套代码与提示词库(GitHub: RenqiChen/The_Crop),推动了基于指令微调的作物领域模型开发。这些工作不仅验证了数据集的有效性,还激发了更多关于农业LLMs的可解释性、跨作物泛化能力及多语言适应性的后续探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务