遇见数据集

CyberChangAn/MultiPriv

收藏
Hugging Face2025-11-21 更新2025-11-30 收录
官方服务:

资源简介:

MultiPriv是一个包含大量个人身份识别信息(PII)的中英文、多模态隐私数据集,旨在支持以下研究任务:文本与图像中的PII实体识别、隐私感知的文本/图像生成任务、大模型中的隐私泄露风险建模与评估、Prompt注入与红队测试等安全性研究。

MultiPriv is a multilingual (Chinese & English) and multimodal (text & image) dataset containing extensive personally identifiable information (PII). It is built to support research on privacy recognition, privacy-preserving generation, and privacy risk evaluation in LLMs.

提供机构:
CyberChangAn
搜集汇总
数据集介绍
CyberChangAn/MultiPriv 数据集图片
构建方式
在大模型隐私风险研究日益受到关注的背景下,MultiPriv数据集应运而生。该数据集通过合成生成、脱敏处理与合法采集相结合的方式构建,涵盖中英双语文本与图像两种模态。文本部分包含5000条中文与5000条英文个人数据记录,每条记录均结构化标注了姓名、性别、年龄、位置、国籍、职业、身份证号、邮箱、电话、健康信息、支付信息、资产信息等十余类PII实体,并附带自然段落描述与基于场景生成的隐私风险问题。图像部分包含810张属性级与个体级隐私图片,涵盖人脸、身份证、护照、驾照、车牌等视觉隐私信息,每张图片均提供对应的实体标注与语言标签。此外,数据集还整合了来自亚马逊、携程、微信等十大平台的智能体隐私数据,构建了面向LLM与VLM隐私评估的全面资源。
特点
MultiPriv数据集的核心特色在于其多语言、多模态与多层次的隐私覆盖能力。在语言维度上,数据集同时支持中文与英文,便于跨语言隐私风险研究。在模态维度上,文本与图像数据协同提供了从结构化实体到自然语言段落、从属性级到个体级的隐私信息层次。实体类型设计极为细致,文本部分涵盖个人身份、代码证件、联系方式、健康医疗、支付交易、资产信用等六大类共16种实体;图像部分则覆盖生物特征、特定身份、医疗健康、金融账户、旅行轨迹、财产设备、通用身份等七类视觉隐私信息。每个文本样本均配有基于真实场景生成的隐私风险问题与标注,使得数据集不仅适用于PII实体识别,更能支撑隐私推理、红队测试、安全对齐等前沿研究任务。
使用方法
研究者可通过HuggingFace平台直接加载CyberChangAn/MultiPriv数据集。文本数据以JSON格式提供,每条记录包含结构化PII字段与自然段落,可直接用于PII命名实体识别(NER)任务训练与评估。配套的prompt文件包含针对个人数据的中英文隐私风险问题,适用于LLM隐私泄露风险评估与红队测试。图像数据以PNG/JPEG格式与对应JSON元数据文件组织,元数据中标注了图像语言与所含隐私实体类型,可支持多模态隐私检测与VLM隐私推理任务。用户还可将文本与图像数据组合,构建图文结合的隐私识别流水线。数据集采用CC BY-NC-SA 4.0协议,仅限非商业研究用途,使用时需引用相关论文。
背景与挑战
背景概述
随着大语言模型与视觉-语言模型在各类场景中的广泛应用,个人隐私信息的泄露风险日益成为学术界与工业界关注的焦点。在此背景下,由西安电子科技大学等机构的研究人员于2025年提出的MultiPriv数据集应运而生。该数据集由Xiongtao Sun、Hui Li等人构建,旨在系统性地评估与提升模型在个体层面上的隐私推理能力。MultiPriv创新性地融合了中英文双语与图文多模态数据,涵盖文本与图像中丰富的个人身份识别信息(PII),包括姓名、身份证号、医疗记录、金融账户等十余种实体类型。其发布为隐私识别、隐私保护生成及模型安全对齐等研究提供了高质量的基准资源,推动了多模态隐私风险评测领域的发展。
当前挑战
MultiPriv所应对的核心挑战在于当前视觉-语言模型在复杂多模态场景中缺乏对个体隐私信息的细粒度感知与推理能力。具体而言,模型不仅需要从文本中准确识别隐式或显式的PII实体,还需在图像中辨别如人脸、证件号码等视觉隐私要素,并对跨模态的隐私风险进行综合判断。数据集构建本身亦面临多重困难:如何在确保数据合成与脱敏合规的前提下,生成真实且多样的隐私场景;如何平衡中英文双语数据的文化差异与语言特性;以及如何设计能够模拟真实用户行为的Prompt,从而有效诱发模型的隐私泄露倾向。此外,基于开源许可证限制,部分图像数据无法直接发布,需通过外部链接引用,进一步增加了数据集的维护与复现难度。
常用场景
经典使用场景
在大模型隐私风险研究的浪潮中,MultiPriv数据集以其多语言(中英文)与多模态(文本与图像)的独特架构,成为评估视觉-语言模型个体级隐私推理能力的标杆。该数据集最经典的使用场景聚焦于隐私感知推理任务,通过构造包含个人身份识别信息的自然段落与场景化提示,系统性地测试模型在医疗咨询、金融交易等敏感情境下对姓名、身份证号、疾病诊断等隐私实体的识别与响应能力。研究者可借助其精细的实体标注与隐私类型分类,量化模型在隐私泄露边缘的推理边界,为理解大模型如何在不经意间暴露用户敏感信息提供了关键实验范式。
实际应用
在产业界,MultiPriv数据集为构建安全可控的生成式AI系统提供了实战级测试工具。实际应用中,它可用于开发智能对话助手的隐私过滤模块,在医疗问诊或金融客服场景中实时屏蔽用户身份证号、银行账户等敏感信息;同时,移动端多模态大模型可借助其图像隐私实体标注,在拍照识物或文档扫描时自动检测人脸、车牌等视觉隐私内容并启动脱敏处理。此外,该数据集赋能了隐私风险审计平台的建设,企业能够通过模拟红队攻击场景,系统性地评估自家模型在用户提示注入下的隐私泄露概率,从而在合规与安全之间找到平衡。
衍生相关工作
围绕MultiPriv数据集已衍生出一系列具有影响力的研究工作,其中最引人注目的是DualTAP框架——一种面向移动多模态大模型代理的双任务对抗保护器,它利用该数据集中的隐私实体与多模态提示,设计了对抗性训练策略来增强模型在真实交互场景下的隐私防御能力。此外,基于MultiPriv的隐私推理基准,研究者进一步提出了个体级隐私推理评估方法,揭示了视觉-语言模型在融合图文信息时可能出现的隐私推断风险。这些衍生工作不仅验证了数据集在推动隐私保护技术演进中的核心价值,还催生了从静态实体识别到动态隐私推理的范式转变,为后续安全对齐与红队测试研究奠定了坚实的实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务