遇见数据集

crimsonred-paper-replication

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

CrimsonRed 跨架构情感-基元引导复制数据集是一个用于可解释性人工智能研究的数据集,旨在复现并扩展 arXiv:2607.18691 论文中提出的情感-基元引导协议。核心发现是,当遵循论文参考代码(而非其文字描述)的注入协议时,语义基元配方在引导大型语言模型情感方面比 Scherer 评估方法更有效,且这一结论在多个模型架构(如 Llama-3.2-1B、Qwen3.5-2B、Gemma-4-E2B 等)上得到验证。数据集包含跨架构实验结果摘要、方法学审计报告,以及详细的数据生成过程:使用激活引导技术,在模型前向传播的残差连接处注入未归一化的探针权重方向,跨越三个模型层。引导方向来源于32个语义基元(从210个对比对中提取)、20个 Scherer 评估维度和13种基本情感。评估指标为目标情感在答案位置的对数偏移量,并计算偏移比率。目标情感包括内疚、愤怒、快乐和悲伤。数据集文件包括JSON格式的结果摘要、方法论文档和具体实验结果文件,适用于研究大型语言模型的情感机制、激活引导技术有效性、跨架构泛化性以及代码与论文一致性。

The CrimsonRed Cross-Architecture Sentiment-Priming Replication Dataset is a dataset for explainable artificial intelligence (XAI) research, aiming to reproduce and extend the sentiment-priming protocol proposed in the paper arXiv:2607.18691. The core finding is that when following the injection protocol specified in the paper's reference code (rather than its textual description), the semantic priming recipe is more effective in steering the sentiment of large language models than the Scherer evaluation method, and this conclusion has been validated across multiple model architectures including but not limited to Llama-3.2-1B, Qwen3.5-2B, Gemma-4-E2B and others. The dataset includes cross-architecture experimental result summaries, methodological audit reports, and detailed data generation procedures: activation steering techniques are used to inject unnormalized probe weight directions at residual connections during the model's forward pass across three model layers. The steering directions are derived from 32 semantic primitives extracted from 210 contrastive pairs, 20 Scherer evaluation dimensions, and 13 basic emotions. The evaluation metrics are the logarithmic offset of the target sentiment at the answer position, with the offset ratio calculated. The target sentiments include guilt, anger, joy and sadness. The dataset files contain JSON-formatted result summaries, methodological documents, and specific experimental result files, which are applicable to research on the sentiment mechanisms of large language models, the effectiveness of activation steering techniques, cross-architecture generalization, and the consistency between code and the published paper.

创建时间:
2026-07-27
原始信息汇总

数据集概述

数据集名称: CrimsonRed — Cross-Architecture Emotion-Prime Steering Replication

数据集地址: https://huggingface.co/datasets/musicakamusic/crimsonred-paper-replication

许可证: AGPL-3.0

任务类型: 文本生成

标签: emotion, steering, activation-steering, interpretability, replication, cross-architecture


核心发现

该数据集复现了 arXiv:2607.18691 论文中提出的情感-原语(emotion-prime)引导协议,并将其扩展至四种不同架构。核心发现为:当注入协议与参考代码(而非论文文本描述)匹配时,语义原语配方方向(prime recipe)比 Scherer 评估方向(appraisal)在跨架构上更强烈地引导情感,效果约为 2.9 倍。

模型 原语配方 单一评估 操作区间比 论文验证
Llama-3.2-1B 11 +0.26 +0.15 2.80×
Qwen3.5-2B 18 +0.09 +0.01 2.95×
Gemma-4-E2B 15 +0.04 −0.03 原语 >> 评估
Gemma-4-E4B 20 待定 待定 待定 待定

论文文本与代码的不一致(方法论贡献)

论文 §4 描述的注入方式与参考代码实际执行方式存在显著差异:

方面 论文 §4 描述 参考代码实现
方向 单位归一化 原始探针权重(未归一化)
缩放 β × 层平均残差范数 β × 1.0(固定值)
Token位置 所有位置 仅最后一个 token
层数 单层(L11) 跨度3层(L10, L11, L12)
对比去除 未提及 禁用(Beta2 = 0.0)

遵循论文文本会产生假阴性结果(Qwen 0.82×, Gemma 0.91×,看似“Llama特异性”),而遵循代码则在每个模型上复现了约 2.9 倍的论文结果。


协议说明(源模式)

  • 注入方式: 使用 Hugging Face register_forward_hook,在 MLP 后残差连接处,于最后一个 token 位置添加 β × raw_probe_weight,跨越3层。
  • 方向:
    • 32 个原语(L2 逻辑回归,C=1.0,每个原语 210 个对比对,保留验证准确率 0.987)
    • 20 个评估(Ridge α=5.0,基于 enVent 6,800 个事件)
    • 13 种情感(L2 逻辑回归,基于 enVent 标签)
  • 评估指标: 目标情感在 Tak 等人提出的2-shot分类提示中的答案位置处的 logit 变化。选择性限制在 [−1, 1] 区间。
  • 操作区间比: 在目标情感天花板变化为正的(目标, β)单元格中,原语/评估的变化比率。
  • 目标情感: 内疚、愤怒、喜悦、悲伤。

文件列表

路径 描述
summary_2026-07-27_source_mode.json 跨架构源模式摘要
docs/METHODOLOGY_AUDIT_PAPER_FAITHFUL_2026-07-27.md 与论文的完整方法论审计
docs/PAPER_DRAFT_CROSS_ARCH_PRIMES_2026-07-27.md 出版物草稿
results/source/paper_faithful_llama1b_L11_source_cal.json Llama L11 源模式,β=0.01–0.2
results/source/paper_faithful_qwen35_L18_source.json Qwen3.5-2B L18 源模式
results/source/paper_faithful_gemma_e2b_L15_source.json Gemma-4-E2B L15 源模式
results/source/paper_faithful_gemma_e4b_L20_source.json Gemma-4-E4B L20 源模式(运行完成时追加)
results/papermode/paper_faithful_llama1b_L11_sweep_v2.json Llama 论文模式 v2(修正指标)
results/papermode/paper_faithful_llama1b_L11_paperverse.json Llama 论文 β=0.5–2.0(崩溃)
legacy/… 早期论文模式结果,保留以追溯来源

复现命令

bash python scripts/paper_faithful_steering.py --model <path> --layer <L> --inject-tokens last --layer-span 3 --beta 0.01 0.02 0.05 0.1 0.2 --mode source --pairs-per-prime 210 --output data/<name>.json

来源项目: CrimsonRed

搜集汇总
数据集介绍
crimsonred-paper-replication 数据集图片
构建方式
CrimsonRed-paper-replication数据集旨在复现arXiv:2607.18691中提出的情感原语激活操控协议,并跨四种架构进行扩展验证。数据集的构建基于CrimsonRed项目中的scripts/paper_faithful_steering.py脚本,通过HuggingFace的register_forward_hook机制,在模型最后一个token位置的三层跨度的MLP后残差连接上,注入原始探针权重与超参数β的乘积。情感方向涵盖32个语义原语、20个评价维度和13个基础情绪,分别通过L2逻辑回归与岭回归从enVent语料库中学习得到。评估指标采用目标情绪在Tak等人设计的双样本分类提示答案位置处的logit偏移,选择性被限制在[-1, 1]区间内。
使用方法
数据集的使用方式主要面向大语言模型的可解释性与激活操控研究。研究者可通过运行reproduce部分提供的命令行脚本,指定模型路径、注入层号、操作模式与β参数范围,生成特定模型的操控结果。数据集提供的各模型各层源代码模式结果(如paper_faithful_llama1b_L11_source_cal.json)可直接用于分析不同架构下情感原语与评价方向的效果对比。建议在实验前仔细阅读docs/METHODOLOGY_AUDIT_PAPER_FAITHFUL_2026-07-27.md中对原始协议与实际代码差异的详细审计,以避免因误解文献表述而产生假阴性结论。
背景与挑战
背景概述
CrimsonRed跨架构情感启动引导复制数据集诞生于2026年,由匿名研究团队依托CrimsonRed项目开发,旨在验证arXiv:2607.18691中提出的语义原语情感引导主张是否具有跨架构稳健性。该数据集聚焦于大语言模型的可解释性与情感操控,核心研究问题在于评估基于语义原语的情感引导方向是否显著优于基于Scherer评估理论的情感方向。通过Llama-3.2-1B、Qwen3.5-2B、Gemma-4-E2B及Gemma-4-E4B四种不同架构模型的系统实验,数据集揭示了原始论文中叙述与实现代码间的关键偏差,并成功复现了约2.9倍的情感转移优势。这一成果为跨架构情感引导研究提供了可复现的基准,对推动语言模型语义可解释性领域具有重要方法论贡献。
当前挑战
该数据集所解决的领域挑战在于:大语言模型情感引导研究中,跨架构的复现性不足以及方法论偏差。原始论文的叙述与代码实现存在显著不一致(如方向归一化、尺度控制、令牌位置选择及层跨度),仅遵循文字描述会导致虚假的负面结果,误判为模型特异的失败。构建过程中面临的挑战包括:精确复现四种不同架构模型的引导协议,确保与参考代码而非论文文字匹配;处理Gemma-E2B模型中评估方向出现的负向引导现象;以及在高维语义空间中从32个语义原语、20个评估方向和13种情感标签中提取可靠的引导方向,并基于Tak等人两样本分类提示计算目标情感对数位移,以保证选择性度量在[-1,1]范围内一致有效。
常用场景
经典使用场景
该数据集的核心经典使用场景在于验证和复制大规模语言模型中基于语义原语的情感激活干预方法。具体而言,研究者利用该数据集复现了arXiv:2607.18691论文中提出的情感导向协议,通过在Llama、Qwen、Gemma等多种架构的模型最后一层的后MLP残差上注入原始探针权重,来比较语义原语配方与Scherer评价维度在引发目标情感(如内疚、愤怒、喜悦、悲伤)方面的强度差异。这一场景为跨架构的可解释性研究提供了标准化的实验基准。
解决学术问题
该数据集解决了自然语言处理领域一个关键的可重复性危机:论文文字描述与参考代码之间存在显著差异,导致早期复现尝试出现假阴性结果。通过系统性地审计并匹配实际代码协议(非标准化方向、固定缩放因子、仅最后一层令牌、三层跨度注入),该数据集证明了语义原语相对于评价维度具有约2.9倍的优势并非偶然,而是跨架构普遍存在的现象。这为理解情感在大语言模型中的表征机制提供了可靠的实证基础。
实际应用
在实际应用中,该数据集可服务于大语言模型安全调控与情感对齐领域。基于语义原语的情感导向技术能够被用于精细控制模型输出情感色彩,例如在心理健康辅助聊天机器人中增强共情表达,或在内容生成中避免不当情绪倾向。此外,跨架构的复现验证为商业化部署提供了信心,确保该技术在不同模型家族(如Llama、Qwen、Gemma)上均能稳定生效,从而推动情感计算在客服系统、教育辅助等场景的落地。
数据集最近研究
最新研究方向
该数据集围绕arXiv:2607.18691论文提出的情感启动操控协议,在Llama、Qwen、Gemma等多种架构上开展跨架构复现验证,揭示了文献描述与参考代码在注入方式、方向归一化、缩放尺度及token位置等关键环节的差异,结果表明严格遵循代码实现而非文字描述才能复现原始约2.9倍的情感语义基元优势效应。这一发现不仅推动了情感操控研究的可复现性建设,也为大模型可解释性领域中的激活操控方法论提供了重要校准依据,助力构建更为严谨、跨架构通用的语义操控评估框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务