遇见数据集

合成数据集

收藏
arXiv2023-11-28 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

合成数据集是由伦敦城市大学和华威大学的研究团队开发,旨在评估和优化固定收益领域的资产配置方法。该数据集通过改进的CorrGAN模型生成合成相关性矩阵,并利用编码器-解码器模型生成资产的其他属性,如波动性、预期回报和未来回报。数据集的创建过程涉及高级的生成对抗网络技术,旨在减少对历史数据的依赖,提高资产配置方法在样本外期间的表现。该数据集特别适用于模拟基于资产配置策略的深入分析,帮助投资者构建更稳健的投资组合。

This synthetic dataset was developed by a research team from City, University of London and the University of Warwick, aiming to evaluate and optimize asset allocation methods in the fixed income domain. It generates synthetic correlation matrices via an improved CorrGAN model, and leverages encoder-decoder models to produce other asset attributes such as volatility, expected return and future return. The dataset creation process involves advanced generative adversarial network (GAN) technologies, with the goal of reducing reliance on historical data and improving the performance of asset allocation methods during out-of-sample periods. This dataset is particularly suitable for conducting in-depth analyses of asset allocation-based strategies through simulation, helping investors build more robust investment portfolios.

提供机构:
伦敦城市大学
创建时间:
2023-11-28
搜集汇总
数据集介绍
构建方式
该数据集为合成数据集,旨在探究大型语言模型内部是否隐式编码了线性空间世界模型。构建过程基于61个不同的物体名词和6种空间关系,如“above”、“below”、“to the left of”等,通过模板“The <object_1> is <relation> the <object_2>”生成自然语言句子。所有物体与关系两两组合,形成涵盖多种空间配置的短文本提示,每个样本均附有物体在欧几里得空间中的真实位置元组,作为后续探针训练和因果干预的基准。数据集按90%和10%划分为训练集与测试集,确保对未见物体对的泛化评估能力。
使用方法
该数据集主要用于探针训练和因果干预实验。研究者提取LLaMA-3.2模型在最后一个句号前令牌的残差流激活,训练线性和非线性探针以预测空间关系标签或物体坐标,从而检测空间信息的线性编码程度。进一步,通过主成分分析降维,评估反向关系的反对称性和组合关系的向量加法性质。因果实验中,利用识别出的空间方向向量对模型激活进行干预,观察输出是否向目标空间关系偏移,以此验证该表示是否被模型功能性地用于生成预测。数据集支持跨层分析,适用于评估不同深度下的空间表征质量。
背景与挑战
背景概述
在大型语言模型(LLMs)展现出超越原始自回归训练目标的涌现能力之际,关于其是否内化了关于环境动态的世界模型这一核心问题引发了广泛讨论。为探究LLMs是否隐式编码了线性空间世界模型——即物理空间与物体配置的线性表征——来自剑桥大学、普渡大学等机构的研究人员于2025年构建了该合成数据集。该数据集包含61个不同物体与6种空间关系,通过生成类似“杯子在桌子上方”的自然语言提示,系统性地探测模型对三维欧几里得空间中物体位置的编码能力。研究团队利用线性探针与因果干预实验,揭示了LLMs在残差流中确实存在一个与R^3同构的子空间,其中空间关系以线性方式组织,且这种表征在模型生成过程中被因果性地使用。该工作为理解LLMs的内部世界模型提供了关键实证,推动了可解释人工智能与空间推理领域的发展。
当前挑战
该数据集所应对的核心挑战在于验证LLMs是否真正拥有连贯的空间世界模型,而非仅依赖表面统计关联。具体而言,领域挑战包括:如何从高维、叠加的激活空间中解耦出与空间语义对应的线性子空间,并证明其中关系(如“上方”与“下方”)呈反平行、正交关系构成R^3基;以及如何通过因果干预证实该子空间对模型预测具有功能性作用。构建过程中,挑战则在于设计能覆盖多样物体与组合关系的合成语句,确保自然语言表述的多样性;同时需控制变量,避免物体名称的多词性对激活提取造成干扰,并设计可复现的探针训练与PCA降维流程,以精确量化空间表征的几何一致性。
常用场景
经典使用场景
该合成数据集专为探究大语言模型内部是否隐式编码线性空间世界模型而设计。其核心使用场景在于,通过构建包含61个物体与6种空间关系(如上、下、左、右、前、后)的短文本提示,系统性地提取模型在残差流中的上下文嵌入,并训练线性探针以解码物体在三维欧几里得空间中的位置。这一场景为验证语言模型是否具备结构化空间表征提供了可控且可重复的实验框架。
解决学术问题
该数据集有效回应了关于大语言模型是否仅依赖统计模仿而缺乏内部世界模型的学术争论。通过线性探针的近乎完美解码性能以及因果干预实验的成功,研究证实模型在激活空间中存在一个与R³同构的低维子空间,其中空间关系以正交且可组合的向量形式呈现。这为世界模型的线性表征假说提供了实证支持,深刻揭示了自回归语言模型在训练过程中隐式习得结构化因果表征的能力。
实际应用
在实际应用中,该数据集所揭示的空间世界模型可赋能需要空间推理的智能系统,例如机器人导航、人机交互中的物体定位以及虚拟环境的场景理解。通过识别并操控模型内部的空间表征,开发者能够更精确地引导语言模型生成符合物理直觉的响应,从而提升其在具身智能任务中的可靠性与可解释性,为安全部署奠定基础。
数据集最近研究
最新研究方向
在大语言模型内部世界模型的研究浪潮中,空间表征的涌现机制正成为核心议题。该合成数据集通过构建由61个物体与6种空间关系组成的结构化语言描述,系统性地验证了LLM内部存在线性空间世界模型。前沿研究聚焦于揭示模型隐式编码的三维欧几里得空间结构,发现其内部表征中形成了与语言基元对应的正交基向量,且空间关系呈现可组合的线性代数性质。这一发现不仅为理解模型认知架构提供了可解释的几何框架,更通过因果干预实验证实了该空间表征对模型预测行为的功能性影响。该工作推动了从统计关联到结构化世界模型的理论转向,为人机对齐、具身推理等前沿应用奠定了表征基础。
相关研究论文
  • 1
    驳回剑桥大学, 普渡大学 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务