遇见数据集

allura-org/instruct-ppo-mix-20k

收藏
Hugging Face2024-11-06 更新2025-04-12 收录
官方服务:

资源简介:

Input dataset for PPO training, made out of a random subset of 10k rows from [Gryphe/Sonnet3.5-SlimOrcaDedupCleaned-20k](https://huggingface.co/datasets/Gryphe/Sonnet3.5-SlimOrcaDedupCleaned-20k) and a 10k rows subset from [arcee-ai/EvolKit-20k](https://huggingface.co/datasets/arcee-ai/EvolKit-20k). Converted to OpenRLHF prompt dataset format.

提供机构:
allura-org
二维码
社区交流群
二维码
科研交流群
商业服务