遇见数据集

crozai/vllm-benchmark-coding

收藏
Hugging Face2025-03-05 更新2025-04-26 收录
官方服务:

资源简介:

这是一个用于轻松基准测试部署在服务模式下的LLM(大型语言模型)的数据集,设计上与vLLM的benchmark_serving.py兼容。数据集来源于四个不同的数据集,经过处理和过滤,只保留了涉及Java、TypeScript、React、Spring、Kafka等关键词的对话。数据集包含两个特征字段:from和value,都是字符串类型,并且划分为训练集。训练集共有36894个样本。

This is a dataset for easy benchmarking of deployed LLMs in serving mode, designed to be compatible with vLLMs benchmark_serving.py. The dataset is sourced from four different datasets, processed and filtered to keep only conversations involving keywords such as Java, TypeScript, React, Spring, Kafka. The dataset includes two feature fields: from and value, both of which are strings, and is split into a training set. The training set contains a total of 36,894 samples.

提供机构:
crozai
搜集汇总
数据集介绍
crozai/vllm-benchmark-coding 数据集图片
构建方式
在大型语言模型(LLM)服务性能评估领域,一个标准化的基准数据集对于衡量模型在推理阶段的响应速度与吞吐量至关重要。该数据集专为与vLLM框架的`benchmark_serving.py`脚本兼容而设计,其构建过程融合了来自四个公开ShareGPT格式数据源的高质量代码对话。具体而言,通过对原始数据集进行字段统一化处理,包括将`messages`列重命名为`conversations`、移除冗余的`id`列,并将`role`子列统一为`from`字段,确保了数据格式的严格一致性。此外,所有对话均经过关键词筛选,仅保留至少一条消息中包含`Java`、`TypeScript`、`React`、`Spring`或`Kafka`等编程语言或框架的样本,从而聚焦于编码相关场景的基准测试。
特点
该数据集的核心特点在于其专为LLM服务性能基准测试而优化的设计。包含约36,894条训练样本,数据规模适中,既保证了统计显著性,又避免了过大的计算开销。所有对话均采用ShareGPT格式组织,每条记录包含`from`(角色标识)和`value`(消息内容)两个子字段,结构简洁且易于解析。数据来源的多样性确保了覆盖不同编码任务与对话模式,而关键词过滤策略则强化了其在编码领域的针对性。这种精心设计使得数据集能够真实反映模型在编程问答场景下的服务性能,尤其适用于评估如vLLM等推理框架的延迟与吞吐量指标。
使用方法
使用该数据集进行性能评估时,需将其与vLLM框架的`benchmark_serving.py`脚本配合。用户可直接从HuggingFace加载`crozai/vllm-benchmark-coding`数据集的默认配置,该配置包含`train`分片下的所有数据文件。在运行基准测试脚本前,需确保数据集中的`conversations`列格式与脚本期望的输入结构完全匹配。典型的操作流程包括:加载数据集、迭代每条对话记录、将消息序列作为请求发送至已部署的LLM服务端点,并收集响应时间与吞吐量等指标。该流程无需额外预处理,即可直接用于衡量模型在编码任务上的服务性能表现。
背景与挑战
背景概述
在大规模语言模型(LLM)部署与推理优化的前沿领域,vLLM作为高性能服务框架,其基准测试工具的完善性对评估模型服务能力至关重要。2024年,由Crozai团队主导构建的vLLM Benchmarking: Coding数据集应运而生,旨在填补面向代码生成任务的LLM服务性能评测空白。该数据集整合了Code-feedback-sharegpt、Synthia-Coder-v1.5等四个高质量代码对话数据源,通过关键词筛选(如Java、React等编程术语)保留3.6万余条专业对话样本。其核心研究问题聚焦于为vLLM的benchmark_serving.py脚本提供标准化测试负载,从而量化模型在代码生成场景下的吞吐量与延迟表现。该数据集的发布显著降低了LLM服务化部署的评测门槛,为学术界与工业界在推理效率优化方面奠定了可复现的基准基础。
当前挑战
该数据集面临的挑战体现在多个层面。在领域问题层面,代码生成任务对LLM的推理一致性要求严苛,现有基准测试多聚焦于通用问答,缺乏对编程语言语法精确性、逻辑连贯性等专业维度的评估指标,导致服务性能评测与真实代码质量之间存在鸿沟。在构建过程中,数据集需处理多源异构数据的格式统一难题——原始数据集中存在列名差异(如messages与conversations的混用)、角色字段命名冲突(role与from的不一致),以及冗余字段(如id)的干扰,这些技术细节的规范化增加了预处理复杂度。此外,关键词过滤策略可能引入主题偏差,例如过度偏向Web开发相关语言,而低估其他编程领域的代表性,影响评测的全面性。
常用场景
经典使用场景
在大型语言模型(LLM)服务化部署的评测领域,该数据集专为vLLM推理框架的基准测试脚本benchmark_serving.py量身打造。其核心使用场景是评估已部署LLM在编码任务上的服务性能,通过汇聚来自Code-feedback-sharegpt、Synthia-Coder-v1.5等四个高质量代码对话数据源的36894条多轮会话,并聚焦Java、TypeScript、React等关键技术栈,为模型吞吐量、延迟等关键指标提供标准化测试负载。
实际应用
在实际工程应用中,该数据集成为AI代码助手服务部署的黄金测试基准。企业可借此评估自研或开源LLM在Spring、React等主流技术栈下的并发处理能力,为模型压缩、动态批处理等优化手段提供量化依据。同时,它支持云平台对代码补全、智能Debug等功能的SLA(服务等级协议)验证,确保生产环境下的用户体验稳定性。
衍生相关工作
该数据集的发布催生了若干衍生工作,包括基于其对话结构开发的动态请求调度算法,以及针对代码生成场景的延迟分布建模研究。后续工作进一步扩展了数据集的覆盖范围,引入Rust、Go等新兴语言,并衍生出面向多轮对话的上下文缓存策略评估工具。这些工作共同构建了从基准测试到服务优化的完整技术链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务