allura-org/instruct-ppo-mix-20k
收藏官方服务:
资源简介:
Input dataset for PPO training, made out of a random subset of 10k rows from [Gryphe/Sonnet3.5-SlimOrcaDedupCleaned-20k](https://huggingface.co/datasets/Gryphe/Sonnet3.5-SlimOrcaDedupCleaned-20k) and a 10k rows subset from [arcee-ai/EvolKit-20k](https://huggingface.co/datasets/arcee-ai/EvolKit-20k). Converted to OpenRLHF prompt dataset format.
提供机构:
allura-org


