MT-PREF|机器翻译数据集|偏好分析数据集
收藏MT-Pref 数据集概述
数据集简介
MT-Pref 数据集是一个用于机器翻译(MT)的偏好数据集,旨在通过自动评估指标来模拟用户偏好。该数据集包含 18,000 个实例,涵盖 18 种语言方向,文本来源包括多个领域,时间范围为 2022 年之后。
数据集内容
- 数据来源: 数据集包含多个高质量机器翻译系统生成的翻译结果,并由专业语言学家进行句子级别的质量评估。
- 自动评估指标: 数据集提供了多种自动评估指标的评分,用于分析这些指标在恢复人类偏好方面的能力。
- 附加数据: 数据集还包括在 WMT23 和 FLORES 基准测试上训练模型的所有评估结果,以确保可重复性。
数据集链接
MT-Pref 数据集可通过以下链接获取:sardinelab/MT-pref
数据集用途
该数据集主要用于训练和评估机器翻译模型,特别是那些旨在更好地处理语言细微差别和上下文特定变化的模型。通过使用 MT-Pref 数据集进行训练,模型在 WMT23 和 FLORES 基准测试上的翻译质量显著提升。

- 1Modeling User Preferences with Automatic Metrics: Creating a High-Quality Preference Dataset for Machine Translation电信研究所, 高等技术学院, 里斯本大学, Unbabel, ELLIS里斯本单位, 卡内基梅隆大学, MICS, 中央理工-高等电力学院, 巴黎-萨克雷大学 · 2024年
日食计算器
此日食计算器能够查询公元前3000至后3000年范围内的日食信息,生成每次日食的覆盖区、中心区范围数据,展示日食带的地图;并可根据用户在地图上点击的坐标在线计算该地日食各阶段时间、食分等观测信息。
国家天文科学数据中心 收录
糖尿病预测数据集
糖尿病相关的医学研究或者健康数据
AI_Studio 收录
Wind Turbine Data
该数据集包含风力涡轮机的运行数据,包括风速、风向、发电量等参数。数据记录了多个风力涡轮机在不同时间点的运行状态,适用于风能研究和风力发电系统的优化分析。
www.kaggle.com 收录
AIS数据集
该研究使用了多个公开的AIS数据集,这些数据集经过过滤、清理和统计分析。数据集涵盖了多种类型的船舶,并提供了关于船舶位置、速度和航向的关键信息。数据集包括来自19,185艘船舶的AIS消息,总计约6.4亿条记录。
github 收录
中国交通事故深度调查(CIDAS)数据集
交通事故深度调查数据通过采用科学系统方法现场调查中国道路上实际发生交通事故相关的道路环境、道路交通行为、车辆损坏、人员损伤信息,以探究碰撞事故中车损和人伤机理。目前已积累深度调查事故10000余例,单个案例信息包含人、车 、路和环境多维信息组成的3000多个字段。该数据集可作为深入分析中国道路交通事故工况特征,探索事故预防和损伤防护措施的关键数据源,为制定汽车安全法规和标准、完善汽车测评试验规程、
北方大数据交易中心 收录
