akomma/uss-ratings-dataset
收藏资源简介:
--- license: mit task_categories: - text-classification - zero-shot-classification - conversational language: - en pretty_name: uss-ratings-dataset size_categories: - 10K<n<100K --- ### Dataset Description - **Homepage:** https://github.com/sunnweiwei/user-satisfaction-simulation - **Repository:** https://github.com/sunnweiwei/user-satisfaction-simulation - **Paper:** https://arxiv.org/pdf/2105.03748.pdf - **View records using Datasette:** [datasette-link](https://lite.datasette.io/?parquet=https%3A%2F%2Fhuggingface.co%2Fdatasets%2Fakomma%2Fuss-ratings-dataset%2Fresolve%2Fmain%2Fuss-ratings-dataset-datasette.parquet#/data/uss-ratings-dataset-datasette) ### Dataset Summary - Dialogs Quality Dataset - With both turn-level and dialog-level ratings provided on a scale of 1 to 5 by human annotators. - Each task has been annotated by multiple annotators. - Contains annotated dialogs from 4 different datasets (SGD, MultiWoz, ReDial, CCPE) - Total 34358 turns from 3500 dialogs |Dataset|Dialogs|Turns | |-------|------:|-----:| |SGD | 1000 | 11833| |MWOZ | 1000 | 10553| |Redial | 1000 | 6792 | |CCPE | 500 | 5180 | ### Column Definitions |Column |Type |Example Value |Description | |-------------------|-------|-------------------------|-----------------------------------------------| |split | str | CCPE;MWOZ;SGD;Redial | dataset name | |session_idx | int | 1 | dialog identifier | |turn_idx | int | 1 | turn identifier within a dialog | |tree_idx | int | 1 | tree identifier within a turn (is all 1s here)| |system | str | Do you like movies | system message | |user | str | No I don't like | user message | |turn_scores | list | [3; 2; 2] | list of turn-level quality scores from different human annotations| |mean_turn_rating | float | 2.33 | mean of turn-level annotator scores | |mode_turn_rating | int | 2 | mode of turn-level annotator scores | |dialog_scores | list | [3; 3; 3] | list of dialog-level quality scores from different human annotations| |mean_dialog_rating | float | 3.00 | mean of dialog-level annotator scores | |mode_dialog_rating | int | 3 | mode of dialog-level annotator scores | ### Dataset Description - **Homepage:** https://github.com/sunnweiwei/user-satisfaction-simulation - **Repository:** https://github.com/sunnweiwei/user-satisfaction-simulation - **Paper:** https://arxiv.org/pdf/2105.03748.pdf - **View records using Datasette:** [datasette-link](https://lite.datasette.io/?parquet=https%3A%2F%2Fhuggingface.co%2Fdatasets%2Fakomma%2Fuss-ratings-dataset%2Fresolve%2Fmain%2Fuss-ratings-dataset-datasette.parquet#/data/uss-ratings-dataset-datasette)
许可证:MIT 开源许可证 任务类别: - 文本分类 - 零样本分类(Zero-shot) - 对话式任务 语言:英语 展示名称:uss-ratings-dataset 样本量区间:10000 < 样本数 < 100000 ### 数据集说明 - **主页**:https://github.com/sunnweiwei/user-satisfaction-simulation - **代码仓库**:https://github.com/sunnweiwei/user-satisfaction-simulation - **相关论文**:https://arxiv.org/pdf/2105.03748.pdf - **使用 Datasette 查看数据记录**:[datasette-link](https://lite.datasette.io/?parquet=https%3A%2F%2Fhuggingface.co%2Fdatasets%2Fakomma%2Fuss-ratings-dataset%2Fresolve%2Fmain%2Fuss-ratings-dataset-datasette.parquet#/data/uss-ratings-dataset-datasette) ### 数据集概述 - 对话质量数据集 - 包含由人类标注者(human annotators)给出的1-5分制的轮次级(turn-level)与对话级(dialog-level)质量评分 - 每项任务均由多名标注者完成标注 - 涵盖来自SGD、MultiWoz、ReDial、CCPE共4个不同数据集的标注对话 - 总计包含3500个对话中的34358个对话轮次 | 数据集 | 对话数 | 轮次数 | |-------|-------:|-------:| | SGD | 1000 | 11833 | | MWOZ | 1000 | 10553 | | Redial| 1000 | 6792 | | CCPE | 500 | 5180 | ### 列定义 | 列名 | 数据类型 | 示例值 | 说明 | |---------------------|----------|-------------------------|-----------------------------------------------| | split | 字符串 | CCPE;MWOZ;SGD;Redial | 数据集名称 | | session_idx | 整数 | 1 | 对话标识符 | | turn_idx | 整数 | 1 | 对话内的轮次标识符 | | tree_idx | 整数 | 1 | 轮次内的树标识符(本数据集所有值均为1) | | system | 字符串 | Do you like movies | 系统回复消息 | | user | 字符串 | No I don't like | 用户消息 | | turn_scores | 列表 | [3; 2; 2] | 来自不同人类标注者的轮次级质量评分列表 | | mean_turn_rating | 浮点数 | 2.33 | 轮次级标注评分的平均值 | | mode_turn_rating | 整数 | 2 | 轮次级标注评分的众数 | | dialog_scores | 列表 | [3; 3; 3] | 来自不同人类标注者的对话级质量评分列表 | | mean_dialog_rating | 浮点数 | 3.00 | 对话级标注评分的平均值 | | mode_dialog_rating | 整数 | 3 | 对话级标注评分的众数 | ### 数据集说明 - **主页**:https://github.com/sunnweiwei/user-satisfaction-simulation - **代码仓库**:https://github.com/sunnweiwei/user-satisfaction-simulation - **相关论文**:https://arxiv.org/pdf/2105.03748.pdf - **使用 Datasette 查看数据记录**:[datasette-link](https://lite.datasette.io/?parquet=https%3A%2F%2Fhuggingface.co%2Fdatasets%2Fakomma%2Fuss-ratings-dataset%2Fresolve%2Fmain%2Fuss-ratings-dataset-datasette.parquet#/data/uss-ratings-dataset-datasette)
数据集概述
- 名称: uss-ratings-dataset
- 许可: MIT
- 任务类别:
- 文本分类
- 零样本分类
- 对话
- 语言: 英语
- 大小: 10K<n<100K
数据集详情
-
描述:
- 对话质量数据集,包含由人工标注者提供的1到5级的回合级和对话级评分。
- 每个任务均由多名标注者进行标注。
- 包含来自4个不同数据集(SGD, MultiWoz, ReDial, CCPE)的标注对话。
- 总计34358个回合,来自3500个对话。
-
数据集细分:
数据集 对话数 回合数 SGD 1000 11833 MWOZ 1000 10553 Redial 1000 6792 CCPE 500 5180 -
列定义:
列名 类型 示例值 描述 split str CCPE;MWOZ;SGD;Redial 数据集名称 session_idx int 1 对话标识符 turn_idx int 1 对话内回合标识符 tree_idx int 1 回合内树标识符(此处均为1) system str Do you like movies 系统消息 user str No I dont like 用户消息 turn_scores list [3; 2; 2] 不同人工标注的回合级质量分数列表 mean_turn_rating float 2.33 回合级标注者分数的平均值 mode_turn_rating int 2 回合级标注者分数的众数 dialog_scores list [3; 3; 3] 不同人工标注的对话级质量分数列表 mean_dialog_rating float 3.00 对话级标注者分数的平均值 mode_dialog_rating int 3 对话级标注者分数的众数
数据集使用
- 查看记录: 可通过Datasette查看数据集记录。




