File size: 1,641 Bytes
3571a70 | 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 | {
"model_name": "TerraMind",
"model_type": "terramind",
"architectures": ["TerraMind", "Transformer"],
"framework": "PyTorch",
"domain": "earth-observation",
"task": "multimodal-any-to-any-generation",
"implementation": {
"entry_point": "model/terramind.py",
"scope": "dual-scale multimodal masked-token engineering reproduction with conditional any-to-any generation",
"train_script": "scripts/train.py",
"inference_script": "scripts/inference.py",
"evaluation_script": "scripts/result.py",
"synthetic_data_script": "scripts/fake_data.py"
},
"architecture": {
"family": "dual-scale multimodal transformer encoder-decoder",
"source_size": 264,
"input_size": 224,
"patch_size": 16,
"patch_grid": [14, 14],
"dim": 96,
"encoder_depth": 2,
"decoder_depth": 2,
"heads": 4,
"engineering_vocab_size": 256,
"visible_fraction": 0.35,
"pixel_modalities": {"s2l2a": 12, "s2l1c": 13, "s2rgb": 3, "s1grd": 2, "s1rtc": 2, "dem": 1},
"token_modalities": ["s2l2a", "s1grd", "s1rtc", "dem", "lulc", "ndvi", "coords", "caption"]
},
"data": {
"datasets": ["TerraMesh"],
"protocol": "terramind_synthetic_engineering_v2",
"format": "NPZ",
"train_file": "data/train.npz",
"test_file": "data/test.npz",
"source_spatial_shape": [264, 264],
"model_spatial_shape": [224, 224],
"required_metadata": ["format_version", "data_source", "coords", "caption", "token_map_lulc"]
},
"configuration_sources": ["conf/config.yaml", "model/terramind.py", "scripts/fake_data.py", "scripts/train.py", "scripts/inference.py", "scripts/result.py"]
}
|