Mapping rural livelihood strategies in China using deep learning
收藏资源简介:
Abstract: Rural livelihood strategies significantly influence socio-ecological systems and sustainability outcomes. However, spatially explicit data on livelihood compositions remain scarce at national scales. We developed a Deep Rural Livelihood Model (DRLM) combining satellite imagery (Landsat, VIIRS) with household survey data to map four livelihood strategy probabilities across rural China in 2020: farming-only, farming-dominant mixed, non-farming-dominant mixed, and non-farming-only. Using quantile regression XGBoost for sample expansion (N=38,306 settlements) and a dual-branch ResNet architecture with Dirichlet regression, we achieved cross-validation R² values of 0.82-0.89 across livelihood categories and independent validation R² of 0.49-0.75 against actual survey data. This dataset provides settlement-scale information to support analyses of sustainability-related indicators, rural transformation, and its socio-ecological impacts. The primary data products consist of five GeoTIFF raster layers at 90 m spatial resolution covering all rural areas of mainland China:1. F_2020_90m.tif is the probability of farming-only (F) livelihood strategy.2. F_NF_2020_90m.tif is the probability of farming-dominated mixed non-farming (F_NF) livelihood strategy.3. NF_F_2020_90m.tif is the probability of non-farming-dominated mixed farming (NF_F) livelihood strategy.4. NF_2020_90m.tif is the probability of non-farming-only (NF) livelihood strategy5. max_confidence_2020_90m.tif is the maximum confidence indicator (maximum probability among the four livelihood components). For the four livelihood probability layers (files 1–4), pixel values range from 0 to 1, and the four probabilities sum to unity at each pixel location, satisfying the compositional constraint. The maximum confidence layer (file 5) provides a pixel-level measure of prediction certainty, with values closer to 1 indicating high confidence in the dominant livelihood category and values approaching 0.25 indicating substantial ambiguity among categories. In addition to the primary raster products, the repository includes supplementary datasets used in model training and validation: Sample_2020 folder includes RS_sampleData.shp, a vector shapefile containing 38,306 rural settlement polygons with model-assisted associated livelihood composition labels. Expansion_of_samples_2020_withXGBoost.csv, this table also includes median, 5th percentile, and 95th percentile estimates for each livelihood component, which describe uncertainty from the quantile-regression sample-expansion step. Township-level predictor variables used in sample expansion (e.g., floor height, air conditioner ownership rate, housing quality index, distance to roads, elevation, slope). Province_boundary folder includes Provinces_China.shp, which is a vector shapefile of provincial administrative boundaries used for region-informed model training and validation. The Zenodo repository includes six supporting CSV files that document model diagnostics and validation results: regional train/test R² summaries for the quantile-regression XGBoost sample-expansion model, SHAP importance summaries, baseline-model comparisons, settlement-level cross-validation outputs, fixed rural observation survey validation results, and CFPS county-level validation results.



