File size: 1,641 Bytes
3571a70
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
{
  "model_name": "TerraMind",
  "model_type": "terramind",
  "architectures": ["TerraMind", "Transformer"],
  "framework": "PyTorch",
  "domain": "earth-observation",
  "task": "multimodal-any-to-any-generation",
  "implementation": {
    "entry_point": "model/terramind.py",
    "scope": "dual-scale multimodal masked-token engineering reproduction with conditional any-to-any generation",
    "train_script": "scripts/train.py",
    "inference_script": "scripts/inference.py",
    "evaluation_script": "scripts/result.py",
    "synthetic_data_script": "scripts/fake_data.py"
  },
  "architecture": {
    "family": "dual-scale multimodal transformer encoder-decoder",
    "source_size": 264,
    "input_size": 224,
    "patch_size": 16,
    "patch_grid": [14, 14],
    "dim": 96,
    "encoder_depth": 2,
    "decoder_depth": 2,
    "heads": 4,
    "engineering_vocab_size": 256,
    "visible_fraction": 0.35,
    "pixel_modalities": {"s2l2a": 12, "s2l1c": 13, "s2rgb": 3, "s1grd": 2, "s1rtc": 2, "dem": 1},
    "token_modalities": ["s2l2a", "s1grd", "s1rtc", "dem", "lulc", "ndvi", "coords", "caption"]
  },
  "data": {
    "datasets": ["TerraMesh"],
    "protocol": "terramind_synthetic_engineering_v2",
    "format": "NPZ",
    "train_file": "data/train.npz",
    "test_file": "data/test.npz",
    "source_spatial_shape": [264, 264],
    "model_spatial_shape": [224, 224],
    "required_metadata": ["format_version", "data_source", "coords", "caption", "token_map_lulc"]
  },
  "configuration_sources": ["conf/config.yaml", "model/terramind.py", "scripts/fake_data.py", "scripts/train.py", "scripts/inference.py", "scripts/result.py"]
}