Avila, DSDD, MNIST, KDD, KITSUNE, KITSUNE10
收藏资源简介:
每个数据集的规模为:1. Avila 包含了 10,430 个数据点,每个点有 10 个维度,总计 12 个类。2. DSDD 包含了 58,509 个数据点,每个点有 48 个维度,总计 11 个类。3. MNIST 包含了 60,000 个数据点,每个点有 784 个维度,总计 10 个类。4. KDD 包含了 4,898,431 个数据点,每个点有 34 个维度,总计 23 个类。5. KITSUNE 包含了 20,253,460 个数据点,每个点有 115 个维度,总计 8 个类。6. KITSUNE10 包含了 1,868,224 个数据点,每个点有 115 个维度,总计 8 个类。
Each dataset's scale is specified as follows: 1. Avila: Contains 10,430 data points, each with 10 dimensions, with a total of 12 classes. 2. DSDD: Contains 58,509 data points, each with 48 dimensions, with a total of 11 classes. 3. MNIST: Contains 60,000 data points, each with 784 dimensions, with a total of 10 classes. 4. KDD: Contains 4,898,431 data points, each with 34 dimensions, with a total of 23 classes. 5. KITSUNE: Contains 20,253,460 data points, each with 115 dimensions, with a total of 8 classes. 6. KITSUNE10: Contains 1,868,224 data points, each with 115 dimensions, with a total of 8 classes.
数据集概述
数据集名称
- LOG-Means
数据集版本
- 0.1
数据集算法
- LOG-Means算法:一种新型、简化的、高效、对大数据集和大搜索空间具有强鲁棒性的簇数目估计方法。采用了二分搜索策略和递归细化策略,分别在大范围和小范围内进行簇数目估计,从而高效估计数据中的簇的个数。
算法实现细节
- LOG-Means算法:
- 定义键值数据结构K和M,用于存储k的已评估值和相应的SSE,以及k的已评估值与k和左侧邻值之间相应的SSE Ratio。
- 迭代过程中,分别对klow和khigh进行KMeans聚类,并计算kmid与klow、khigh的SSE Ratio。
- k-means||初始化:
- 随机选择一个中心点,计算满足概率条件的多个候选中心点C。
- 迭代r次(r=2),每次迭代取样O(k)个样本,最后得到大约O(kr)个样本。
- 使用带有权重的K-Means++算法从C中筛选出k个中心点。
- k-means++初始化:
- 随机选择一个中心点,计算每个点到中心点的距离,选择最远的点作为下一个中心点,重复直到选出k个中心点。
- random初始化:
- 随机选择k个点作为中心点。
- Elbow算法:
- 对于给定的数据集,分别计算k=1,2,...,kmax的KMeans聚类结果,计算每个k对应的SSE,选择拐点对应的k值作为簇数目估计值。
环境需求
- C++编译器(支持C++17或更高版本)
- 第三方库:Eigen3
数据集规模
- Avila:10,430个数据点,每个点有10个维度,总计12个类。
- DSDD:58,509个数据点,每个点有48个维度,总计11个类。
- MNIST:60,000个数据点,每个点有784个维度,总计10个类。
- KDD:4,898,431个数据点,每个点有34个维度,总计23个类。
- KITSUNE:20,253,460个数据点,每个点有115个维度,总计8个类。
- KITSUNE10:1,868,224个数据点,每个点有115个维度,总计8个类。
运行结果指标
- $delta_k=frac{k-c}{c}*100%$ (k是预估类数, c是真实类数)
- Runtime(s)
许可证
- Apache 2.0 License




