ViFactCheck
收藏资源简介:
ViFactCheck是第一个公开的越南语事实核查基准数据集,专门为越南语事实核查设计,包含7,232个人工标注的声明-证据对,涵盖了12个不同的主题。
ViFactCheck is the first publicly available Vietnamese fact-checking benchmark dataset, specifically designed for Vietnamese fact-checking tasks, comprising 7,232 manually annotated claim-evidence pairs and covering 12 distinct topics.
越南事实错误纠正数据集概述
数据集背景
- 任务:事实错误纠正(Factual Error Correction, FEC)是自然语言处理中的关键任务,旨在检测和纠正文本内容中的事实不一致性。
- 语言:尽管在英语方面取得了显著进展,但越南语的FEC任务仍因缺乏标注数据集和定制方法而未被充分探索。
- 项目:本项目基于论文《Zero-shot Faithful Factual Error Correction》提出了一种新的越南语FEC方法,是该任务在越南语中的初步尝试。
数据集详情
- 数据集名称:ViFactCheck
- 数据集描述:ViFactCheck是首个专门为越南语事实核查设计的公开基准数据集,包含7,232个人工标注的声明-证据对,涵盖12个不同主题。
- 数据集来源:数据集来源于越南知名在线新闻网站。
- 数据集用途:该数据集被重新用于事实错误纠正任务,剔除了信息不足的声明,并保留了所有被支持或反驳的声明。
- 数据集特征:
- Statement:输入声明
- Context:完整证据
- Topic:证据主题
- Author:新闻来源
- Url:在线新闻链接
- Evidence:检索证据
- Label:输入声明的标签
数据集获取
- 数据集地址:ViFactCheck-Dataset
使用方法
-
加载模型和数据集: python from utils.dataset import ViFactCheck from model.vi_zerofec import Vi_ZeroFEC
加载模型
corrector = Vi_ZeroFEC()
加载数据集
vifactcheck = ViFactCheck("dataset_url") dataset = vifactcheck.get_all()
-
处理单个样本: python sample = { evidence: Giải trình sau đó, về quy định sở hữu nhà chung cư như dự thảo, Bộ trưởng Bộ Xây dựng ..., input_claim: Khi chung cư bị tiêu hủy thì các giấy tờ sở hữu chung cư vẫn còn hiệu lực., label: Refuted } output = corrector.correct(sample)
-
批量处理: python samples = dataset[0:500] outputs = corrector.batch_correct(samples, "save_dir")
人类评估
- 评估过程:评估过程分为三轮,每轮结束后计算Cohen’s Kappa,并根据需要修订指南。
- 沟通:评估过程中保持频繁沟通,解答问题并解决不匹配问题。
贡献者




