登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
PII Detect GPT3.5 Synthetic Data [8k]
PII Detect GPT3.5 Synthetic Data [8k]
收藏
kaggle
2024-02-28 更新
2024-03-08 收录
数据生成
PII检测
数据链接:
https://www.kaggle.com/datasets/dileepjayamal/pii-detect-gpt3-5-synthetic-data-8k
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
GPT3.5 generated synthetic dataset ~ 8k
应用场景:
创建时间:
2024-02-28
相关数据集
CAPID
隐私保护
PII检测
CAPID是由滑铁卢大学和Vector Institute联合开发的合成数据集,专注于上下文相关的个人身份信息(PII)检测。该数据集包含2,307条样本,涵盖15种PII类型(如职业、健康、地理位置等),通过GPT-4.1-mini和GPT-5生成并经过人工验证,确保PII与问答任务的相关性标注准确性。其创新性在于首次量化PII的上下文相关性,支持训练本地小型语言模型(SLM)以实现隐私保护下的
arXiv
2026-02-11 更新
37
0
Synthetic Dataset Generation
数据生成
公平性研究
该项目实现了一种使用遗传算法的数据生成方法,旨在故意在多个统计公平性指标上诱导数据集偏差,用于更公平的不公平性研究。
github
2024-03-30 更新
30
0
Synthline v1
需求工程
数据生成
Synthline v1 是一个基于产品线方法的需求工程合成数据生成工具,旨在通过先进的生成策略和审查技术来生成高质量的合成需求数据。该工具通过提示策略、自动提示优化和生成后审查来控制合成数据的质量,以适应不同的需求工程分类任务。Synthline v1 的设计遵循设计科学研究方法,通过迭代设计和评估来提高工具的性能和实用性。
arXiv
2025-06-26 更新
16
0
Prasann15479/PII-Dataset
PII检测
--- license: apache-2.0 --- This Dataset was created using Gemini api using the kaggle notebook : https://www.kaggle.com/code/newtonbaba12345/pii-detection-data-generation-using-gemini
Hugging Face
2024-03-02 更新
35
0
refugees-gpt
自然语言处理
数据生成
该数据集名为'refugees-gpt',由distilabel工具生成。数据集包含一个`pipeline.yaml`文件,用于在distilabel中重现生成该数据集的管道。数据集的结构包括三个主要特征:system_prompt、prompt和completion,均为字符串类型。数据集分为一个训练集,包含500个样本。数据集的标签包括'synthetic'、'distilabel'、'rla
Hugging Face
2024-10-19 更新
19
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广