遇见数据集

daichira/structeval-t-sft-hq-yaml-cleaned

收藏
Hugging Face2026-03-22 更新2026-03-29 收录
官方服务:

资源简介:

--- language: - ja - en tags: - structeval-t - yaml - data-cleaning - text-generation license: apache-2.0 task_categories: - text-generation size_categories: - n<3000 --- # StructEval-T SFT HQ YAML (Cleaned) このデータセットは、[daichira/structeval-t-sft-hq-yaml](https://huggingface.co/datasets/daichira/structeval-t-sft-hq-yaml) をベースに、厳密なフォーマット検証とノイズ除去(クリーニング)を行ったものです。 StructEval-T等の構造化データ生成タスク(SFT向け)に最適化されています。 ## クリーニング統計情報 本データセットの構築時に、以下のクリーニング結果が得られました。 * **オリジナルレコード数**: 2000 件 * **クリーニング後レコード数**: 2000 件 * **除去されたCoTノイズ**: 1528 件 ( `Approach: ... Output:` を物理的に切除 ) * **削減された無駄な文字列の総量**: 705728 文字 * **最終YAMLパース成功率**: 100% ## データセット構築パイプライン(クリーニング手法) 1. **不要テキストの物理的除去**: `Approach: ... Output:` といった思考プロセスや、マークダウンのコードフェンス (```yaml) を正規表現で完全に削除しました。 2. **仕様準拠パース検証**: Pythonの `yaml.safe_load` を用いて、全件がYAMLとして構文エラーなく読み込めることを確認しています。 3. **正規化 (Canonicalization)**: 意味的な同一性を担保するため、キーをアルファベット順にソートし、インデントやフォーマットを統一しました (`yaml.safe_dump` を使用)。 4. **完全一致の排除**: 正規化後、プロンプトと出力が完全に一致する重複データを検出し、排除しています。 ## 使い方 ```python from datasets import load_dataset ds = load_dataset("daichira/structeval-t-sft-hq-yaml-cleaned", split="train") print(ds[0]["messages"]) ```

language: - 日语 - 英语 tags: - structeval-t - YAML - 数据清洗 - 文本生成 license: Apache 2.0 task_categories: - 文本生成 size_categories: - n<3000 # StructEval-T SFT HQ YAML (Cleaned) 本数据集以[daichira/structeval-t-sft-hq-yaml](https://huggingface.co/datasets/daichira/structeval-t-sft-hq-yaml)为基础,经过严格的格式校验与噪声去除(清洗)处理构建而成,专为StructEval-T等面向监督微调(Supervised Fine-Tuning,SFT)的结构化数据生成任务优化。 ## 清洗统计信息 本数据集构建过程中,得到如下清洗统计结果: * **原始记录数**:2000条 * **清洗后记录数**:2000条 * **移除的思维链(Chain-of-Thought,CoT)噪声**:1528条(物理移除`Approach: ... Output:`格式内容) * **累计移除的冗余字符总量**:705728个 * **最终YAML解析成功率**:100% ## 数据集构建流水线(清洗方法) 1. **冗余文本物理移除**:通过正则表达式彻底删除如`Approach: ... Output:`类的思维过程文本,以及Markdown代码块分隔符(yaml)。 2. **合规性解析校验**:使用Python的`yaml.safe_load`工具,验证所有样本均可无语法错误地解析为YAML格式。 3. **规范化(Canonicalization)**:为确保语义一致性,将键按字母顺序排序,并使用`yaml.safe_dump`统一缩进与格式。 4. **全量重复数据剔除**:规范化完成后,检测并移除提示词与输出完全一致的重复样本。 ## 使用方法 python from datasets import load_dataset ds = load_dataset("daichira/structeval-t-sft-hq-yaml-cleaned", split="train") print(ds[0]["messages"])

提供机构:
daichira
二维码
社区交流群
二维码
科研交流群
商业服务