遇见数据集

SpotLake

收藏
arXiv2022-10-25 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

SpotLake是由韩国国立大学开发的一个云服务数据集存档系统,专注于提供多种云实例数据集的历史信息。该数据集包括云实例的价格、可用性和中断率等关键信息,旨在帮助用户更有效地利用云资源,降低成本。SpotLake通过收集和分析这些数据,为用户提供了一个全面的数据视图,以便于进行云系统的研究和优化。此外,SpotLake还提供了数据收集和系统实现的源代码,增强了数据集的透明度和可复用性。

SpotLake is a cloud service dataset archiving system developed by a South Korean national university, which is dedicated to providing historical information of various cloud instance datasets. This dataset covers key information such as the price, availability and interruption rate of cloud instances, aiming to help users utilize cloud resources more efficiently and reduce costs. By collecting and analyzing these data, SpotLake provides users with a comprehensive data view to facilitate research and optimization of cloud systems. In addition, SpotLake also provides the source code for data collection and system implementation, which enhances the transparency and reusability of the dataset.

提供机构:
国立大学
创建时间:
2022-02-07
搜集汇总
数据集介绍
SpotLake 数据集图片
构建方式
SpotLake的构建源于对云服务商提供的多种竞价实例(spot instance)数据集在采集与访问上面临的严峻挑战。不同于可编程获取的历史价格数据,竞价实例可用性与中断率数据集缺乏历史存档、存在严苛的查询限制(如每日最多50次独特查询)且缺乏程序化接口。为突破这些瓶颈,研究团队设计了一套基于无服务器架构的数据归档系统。通过将可用性查询问题抽象为装箱问题并利用混合整数规划求解器进行优化,将所需查询次数从9299次大幅减少至2226次。同时,针对中断率数据仅限网页访问的局限,借助SpotInfo工具实现程序化采集。所有数据以10分钟为间隔持续收集,并存入亚马逊Timestream时序数据库,最终通过API网关与Lambda函数为用户提供统一的查询入口。
特点
SpotLake的核心价值在于其首次提供了涵盖竞价实例可用性、中断频率、成本节省及价格的多维度历史数据集。经过长达181天的持续观测与分析,该数据集揭示了一个重要现象:不同来源的竞价实例数据之间普遍存在低相关性(Pearson相关系数多接近0),甚至频繁呈现相互矛盾的信息,例如高可用性评分与高中断率同时出现。通过真实世界实验验证,当可用性评分与中断率评分均高时,实例运行最为可靠;而当两者相悖时,可用性评分在预测请求成功方面更具主导地位。此外,该数据集还展现了显著的空间异质性——不同区域间的评分差异远大于时间波动,且加速计算实例家族的可用性普遍低于其他类型,为资源选择提供了精确指导。
使用方法
SpotLake以公开网页服务的形式提供,用户可通过指定时间戳、区域、可用区及实例类型等参数,灵活查询历史与当前的竞价实例状态信息。该平台不仅支持单一指标检索,更鼓励用户综合运用可用性评分、中断率评分及价格数据进行交叉分析,以规避单一数据源可能带来的误导。基于其丰富的历史数据,研究人员可构建机器学习模型(如随机森林)来预测实例中断事件,实验表明,即使使用简单的历史特征模型,其预测准确率也显著优于仅依赖当前瞬时信息的启发式方法。这一特性使得SpotLake成为优化混合竞价实例部署策略、降低任务中断风险、实现成本效益最大化的关键工具。
背景与挑战
背景概述
云计算资源的弹性计费模式深刻改变了计算资源的消费方式,其中竞价实例(spot instance)以远低于按需实例的价格提供富余计算资源,成为降低云使用成本的关键手段。然而,竞价实例可能因资源短缺而被强制回收,其不可靠性成为广泛应用的重大障碍。为提升竞价实例的可用性,云服务商提供了多种数据集,包括历史价格、可用性和中断率信息。然而,自2017年亚马逊云服务(AWS)调整竞价实例运营策略后,价格波动趋于平缓,传统依赖价格历史预测实例可靠性的方法已失效。在此背景下,韩国国民大学计算机科学系的Sungjae Lee、Jaeil Hwang和Kyungyong Lee于2022年构建了SpotLake数据集,旨在整合并归档竞价实例的可用性、中断率与价格等多源历史数据,为云系统研究提供可靠的数据基础,推动竞价实例的高效利用。
当前挑战
SpotLake数据集所应对的核心挑战源于竞价实例数据自身的复杂性与获取障碍。首先,云服务商提供的可用性与中断率数据集缺乏历史记录,用户仅能查询当前值,无法进行时序分析与趋势预测,这严重限制了竞价实例使用优化的可能性。其次,数据查询存在严苛限制,例如AWS的Spot Placement Score服务对每个账户每24小时仅允许50次唯一查询,且返回结果数量上限为10,使得大规模跨实例类型与区域的全面扫描几乎不可行。此外,中断率数据集仅通过网页界面访问,缺乏编程接口,阻碍了自动化数据采集与集成。构建过程中,研究者还需应对异构实例类型与全球区域组合带来的查询维度爆炸问题,通过优化查询策略(如装箱算法)将所需查询次数从9,299次降至2,226次,才得以实现系统性的数据归档。
常用场景
经典使用场景
SpotLake作为云资源优化领域的重要数据集,为研究者和工程师提供了亚马逊云服务(AWS)竞价实例的多维历史数据,涵盖实例可用性、中断率、成本节约及价格变化等关键指标。其经典使用场景集中于构建竞价实例可靠性预测模型,通过融合长时间序列的可用性评分与中断频率数据,精准评估不同实例类型、区域及可用区在特定时段内的运行稳定性。研究者可利用该数据集分析竞价实例在深度学习训练、大数据批处理及实时Web服务等负载下的行为模式,从而设计出兼顾成本与可靠性的资源调度策略。
实际应用
在实际应用中,SpotLake赋能云用户构建智能化的竞价实例选择与容错系统。企业可根据历史可用性数据自动规避中断率高的实例类型与区域组合,例如在深度学习训练任务中优先选择跨区域的GPU实例以降低中断概率。大数据处理平台可依据中断频率统计动态调整检查点策略,减少任务回滚成本。此外,云服务管理工具可集成SpotLake的实时与历史数据接口,为用户提供可视化的竞价资源健康度仪表盘,辅助制定混合实例采购方案,在保障服务连续性的前提下最大化成本节约效果。
衍生相关工作
SpotLake衍生了一系列推动云资源高效利用的经典工作。基于其提供的历史可用性数据集,研究者开发了随机森林、长短期记忆网络等机器学习模型,实现了对竞价实例中断事件的精准预测,预测精度远超仅依赖当前信息的启发式方法。在系统设计层面,相关工作包括利用SpotLake数据优化跨区域竞价实例集群的资源编排算法,以及构建面向分布式深度学习训练的容错调度框架。此外,该数据集还催生了针对多云环境竞价实例的对比分析研究,为跨供应商资源优化奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务