遇见数据集

OpenDFM/MoCon

收藏
Hugging Face2024-03-14 更新2024-03-04 收录
官方服务:

资源简介:

--- license: cc-by-nc-sa-4.0 tags: - GUI pretty_name: MoCon viewer: False --- # MoGUI😈 and MoCon🛡️ <div align="center"> 📃 [Paper](./MoGUI_Paper_v0.1.pdf) | 🛡️ [MoCon Data](https://huggingface.co/datasets/OpenDFM/MoCon) | 😈 [MoGUI Data](https://huggingface.co/datasets/OpenDFM/MoGUI) [简体中文](./README_zh.md) | English </div> ## 🔥 News - **[Cooming Soon]** We will release the complete technical report soon. - **[2024.3.1]** We have released [MoCon🛡️ data](https://huggingface.co/datasets/OpenDFM/MoCon). - **[2024.2.29]** We have released [MoGUI😈 data](https://huggingface.co/datasets/OpenDFM/MoGUI) and [pre-release paper](./MoGUI_Paper_v0.1.pdf). ## 📑 Citation If you find our work useful, please cite us! ``` @misc{zhu2024mogui, title={Technical Report of MoGUI and MoCon}, author={Zichen Zhu and Liangtai Sun and Danyang Zhang and Ziyuan Li and Guangpeng Li and Lu Chen and Kai Yu}, year={2024}, howpublished={\url{https://huggingface.co/datasets/OpenDFM/MoGUI}} } @inproceedings{sun2022meta, title={META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI}, author={Sun, Liangtai and Chen, Xingyu and Chen, Lu and Dai, Tianle and Zhu, Zichen and Yu, Kai}, booktitle={Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing}, pages={6699--6712}, year={2022} } @inproceedings{zhu2023cam, title={CAM-GUI: A Conversational Assistant on Mobile GUI}, author={Zhu, Zichen and Sun, Liangtai and Yang, Jingkai and Peng, Yifan and Zou, Weilin and Li, Ziyuan and Li, Wutao and Chen, Lu and Ma, Yingzi and Zhang, Danyang and others}, booktitle={National Conference on Man-Machine Speech Communication}, pages={302--315}, year={2023}, organization={Springer} } ``` ## 📧 Contact Us If you have any questions, please feel free to contact us via email `JamesZhutheThird@sjtu.edu.cn` and `zhang-dy20@sjtu.edu.cn`

许可证:知识共享署名-非商业性使用-相同方式共享4.0协议(CC BY-NC-SA 4.0) 标签:图形用户界面(Graphical User Interface,GUI) 数据集展示名称:MoCon 数据集查看器:已禁用 # MoGUI😈 与 MoCon🛡️ <div align="center"> 📃 [论文](./MoGUI_Paper_v0.1.pdf) | 🛡️ [MoCon数据集](https://huggingface.co/datasets/OpenDFM/MoCon) | 😈 [MoGUI数据集](https://huggingface.co/datasets/OpenDFM/MoGUI) [简体中文](./README_zh.md) | 英文 </div> ## 🔥 最新动态 - **[即将发布]** 我们将于近期发布完整技术报告。 - **[2024.3.1]** 我们已发布 [MoCon🛡️ 数据集](https://huggingface.co/datasets/OpenDFM/MoCon)。 - **[2024.2.29]** 我们已发布 [MoGUI😈 数据集](https://huggingface.co/datasets/OpenDFM/MoGUI) 与 [预印本论文](./MoGUI_Paper_v0.1.pdf)。 ## 📑 引用格式 如果您认为本项目对您的工作有所帮助,请引用我们的研究成果! @misc{zhu2024mogui, title={Technical Report of MoGUI and MoCon}, author={Zichen Zhu and Liangtai Sun and Danyang Zhang and Ziyuan Li and Guangpeng Li and Lu Chen and Kai Yu}, year={2024}, howpublished={url{https://huggingface.co/datasets/OpenDFM/MoGUI}} } @inproceedings{sun2022meta, title={META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI}, author={Sun, Liangtai and Chen, Xingyu and Chen, Lu and Dai, Tianle and Zhu, Zichen and Yu, Kai}, booktitle={Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing}, pages={6699--6712}, year={2022} } @inproceedings{zhu2023cam, title={CAM-GUI: A Conversational Assistant on Mobile GUI}, author={Zhu, Zichen and Sun, Liangtai and Yang, Jingkai and Peng, Yifan and Zou, Weilin and Li, Ziyuan and Li, Wutao and Chen, Lu and Ma, Yingzi and Zhang, Danyang and others}, booktitle={National Conference on Man-Machine Speech Communication}, pages={302--315}, year={2023}, organization={Springer} } ## 📧 联系我们 若您有任何疑问,欢迎通过以下邮箱联系我们:`JamesZhutheThird@sjtu.edu.cn` 与 `zhang-dy20@sjtu.edu.cn`

提供机构:
OpenDFM
原始信息汇总

MoGUI😈 和 MoCon🛡️ 数据集

数据集概述

  • 名称: MoGUI 和 MoCon
  • 标签: GUI
  • 许可证: cc-by-nc-sa-4.0
  • 查看器: False

最新消息

  • 2024.3.1: 发布了 MoCon🛡️ 数据。
  • 2024.2.29: 发布了 MoGUI😈 数据和预发布论文。

引用

如果发现我们的工作有用,请引用我们!

@misc{zhu2024mogui, title={Technical Report of MoGUI and MoCon}, author={Zichen Zhu and Liangtai Sun and Danyang Zhang and Ziyuan Li and Guangpeng Li and Lu Chen and Kai Yu}, year={2024}, howpublished={url{https://huggingface.co/datasets/OpenDFM/MoGUI}} }

@inproceedings{sun2022meta, title={META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI}, author={Sun, Liangtai and Chen, Xingyu and Chen, Lu and Dai, Tianle and Zhu, Zichen and Yu, Kai}, booktitle={Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing}, pages={6699--6712}, year={2022} }

@inproceedings{zhu2023cam, title={CAM-GUI: A Conversational Assistant on Mobile GUI}, author={Zhu, Zichen and Sun, Liangtai and Yang, Jingkai and Peng, Yifan and Zou, Weilin and Li, Ziyuan and Li, Wutao and Chen, Lu and Ma, Yingzi and Zhang, Danyang and others}, booktitle={National Conference on Man-Machine Speech Communication}, pages={302--315}, year={2023}, organization={Springer} }

联系方式

如有任何问题,请通过以下邮箱联系我们:

  • JamesZhutheThird@sjtu.edu.cn
  • zhang-dy20@sjtu.edu.cn
搜集汇总
数据集介绍
OpenDFM/MoCon 数据集图片
构建方式
在移动图形用户界面的研究领域,高质量的数据集是推动多模态对话系统发展的基石。MoCon数据集作为MoGUI项目的对抗性安全组件,其构建过程精心设计,旨在模拟真实世界中移动GUI交互的复杂场景。该数据集通过系统性地收集和标注来自多种移动应用的界面截图与操作轨迹,涵盖了包括点击、滑动、长按在内的多样化用户手势,并特别引入了对抗性扰动以评估模型在面对恶意输入时的鲁棒性。数据采集流程严格遵循隐私保护规范,确保所有样本均经过脱敏处理,从而在提供丰富研究资源的同时,维护用户数据的安全性。
特点
MoCon数据集的核心特点在于其对抗性视角与多模态融合的独特设计。相较于传统的GUI数据集,MoCon不仅包含了常规的界面元素与操作序列,还专门构建了对抗性样本,这些样本通过微小的、人类难以察觉的界面修改来挑战模型的决策边界。数据集中的每个样本均配有高保真的截图、详细的元数据以及对应的操作指令,形成了视觉与文本信息的深度耦合。此外,MoCon强调了指令跟随的精确性,其标注体系能够细致区分不同操作意图,为研究移动GUI环境中模型的鲁棒性与安全性提供了不可多得的测试基准。
使用方法
使用MoCon数据集时,研究者可将其作为评估和增强移动GUI智能体安全性的标准测试平台。数据集以HuggingFace Datasets格式发布,支持直接加载,便于集成到现有的深度学习工作流中。用户可依据任务需求,将数据划分为训练集、验证集和测试集,特别推荐利用其对抗性子集进行模型的压力测试。在模型微调或零样本评估场景下,MoCon的图文对结构允许同时输入界面截图与自然语言指令,输出预测的操作序列,从而检验模型在对抗环境下的泛化能力。详细的文档和示例代码随数据集一同提供,降低了使用门槛,促进了可复现研究。
背景与挑战
背景概述
在移动图形用户界面(GUI)自动化领域,智能体需要理解屏幕内容并执行精确操作,而现有数据集多聚焦于静态界面或单一任务,缺乏对动态交互过程中用户行为模式与系统状态变化的系统性刻画。为此,上海交通大学朱子辰、孙良泰等研究团队于2024年发布了MoCon数据集,旨在为移动GUI上的多模态对话智能体提供行为控制层面的训练与评估基准。该数据集属于OpenDFM系列,与同期发布的MoGUI数据集形成互补,共同推动GUI理解与操控的协同发展。MoCon的提出填补了动态行为控制数据的空白,为构建能够感知界面变化、规划操作序列的智能助手奠定了数据基础,在人机交互与多模态学习领域具有重要影响力。
当前挑战
MoCon数据集所面临的挑战首先体现于领域核心问题:移动GUI行为控制要求模型从高维视觉输入中提取细粒度操作意图,并生成精确的触控指令(如点击、滑动),这对视觉-动作映射的鲁棒性提出严苛要求。其次,构建过程中需解决动态环境下的数据采集难题,包括不同设备分辨率、操作系统版本及应用布局差异带来的标注一致性挑战,以及如何高效捕捉连续操作序列中的状态转移逻辑。此外,数据隐私保护与伦理合规性亦构成隐性障碍,例如在真实应用环境中采集用户交互轨迹时需规避敏感信息泄露,这限制了数据规模的扩展与共享的开放性。
常用场景
经典使用场景
MoCon数据集专注于移动图形用户界面(GUI)的交互建模,其经典使用场景在于为多模态对话代理提供结构化的界面状态与操作序列数据。研究者可借助该数据集训练模型理解GUI元素的语义关系、布局逻辑及用户操作意图,从而模拟人类在移动设备上的自然交互行为。例如,通过序列化的屏幕截图与对应的操作指令,模型能够学习从视觉输入到动作输出的映射,这在端到端的GUI自动化任务中具有奠基性作用。
解决学术问题
该数据集有效解决了移动GUI领域长期存在的标注数据匮乏与异构性难题。在学术研究中,它支撑了多模态语义对齐、界面状态追踪以及操作序列预测等关键问题的探索。MoCon的发布使得研究者能够系统性地评估模型在跨应用、跨场景下的泛化能力,推动了从静态界面理解到动态交互推理的研究范式转变,为构建更鲁棒的对话式GUI助手提供了标准化基准。
衍生相关工作
MoCon衍生了一系列具有影响力的学术工作,例如META-GUI首次提出了多模态对话代理在移动GUI上的统一框架,而CAM-GUI则进一步探索了对话上下文与界面状态的融合机制。这些工作均以MoCon为数据基石,验证了跨模态表征学习在GUI理解中的有效性。后续研究还拓展了该数据集在少样本学习与领域适应等方向的应用,形成了以数据驱动GUI智能的完整研究链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务