dgcnz commited on
Commit
4d35c15
·
verified ·
1 Parent(s): 2264aab

sync run artifacts: vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/best.pt +3 -0
  2. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank0.log +28 -0
  3. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank1.log +28 -0
  4. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank10.log +28 -0
  5. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank11.log +28 -0
  6. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank12.log +28 -0
  7. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank13.log +28 -0
  8. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank14.log +28 -0
  9. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank15.log +28 -0
  10. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank2.log +28 -0
  11. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank3.log +28 -0
  12. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank4.log +28 -0
  13. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank5.log +28 -0
  14. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank6.log +28 -0
  15. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank7.log +28 -0
  16. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank8.log +28 -0
  17. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank9.log +28 -0
  18. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/git-info.txt +2 -0
  19. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_0_log.err +73 -0
  20. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_0_log.out +0 -0
  21. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_10_log.err +34 -0
  22. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_10_log.out +276 -0
  23. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_11_log.err +34 -0
  24. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_11_log.out +276 -0
  25. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_12_log.err +34 -0
  26. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_12_log.out +280 -0
  27. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_13_log.err +34 -0
  28. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_13_log.out +276 -0
  29. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_14_log.err +34 -0
  30. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_14_log.out +276 -0
  31. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_15_log.err +34 -0
  32. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_15_log.out +276 -0
  33. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_1_log.err +38 -0
  34. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_1_log.out +276 -0
  35. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_2_log.err +38 -0
  36. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_2_log.out +276 -0
  37. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_3_log.err +38 -0
  38. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_3_log.out +276 -0
  39. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_4_log.err +34 -0
  40. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_4_log.out +280 -0
  41. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_5_log.err +34 -0
  42. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_5_log.out +276 -0
  43. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_6_log.err +34 -0
  44. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_6_log.out +276 -0
  45. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_7_log.err +34 -0
  46. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_7_log.out +276 -0
  47. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_8_log.err +34 -0
  48. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_8_log.out +280 -0
  49. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_9_log.err +34 -0
  50. vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_9_log.out +276 -0
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/best.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d6bc222a7d5b17804aa9cd2e2d761ac4415cea396125d9456d3f2c7e877b0ffd
3
+ size 6191381293
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank0.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 0 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank1.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 1 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank10.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 10 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank11.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 11 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank12.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 12 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank13.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 13 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank14.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 14 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank15.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 15 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank2.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 2 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank3.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 3 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank4.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 4 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank5.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 5 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank6.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 6 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank7.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 7 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank8.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 8 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank9.log ADDED
@@ -0,0 +1,28 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ Rank 9 crashed at epoch 11, itr 59
2
+ Error: loss is nan
3
+
4
+ Traceback (most recent call last):
5
+ File "<frozen runpy>", line 198, in _run_module_as_main
6
+ File "<frozen runpy>", line 88, in _run_code
7
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
8
+ submitit_main()
9
+ ~~~~~~~~~~~~~^^
10
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
11
+ process_job(args.folder)
12
+ ~~~~~~~~~~~^^^^^^^^^^^^^
13
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
14
+ raise error
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
16
+ result = delayed.result()
17
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
18
+ self._result = self.function(*self.args, **self.kwargs)
19
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
20
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
21
+ pp = pprint.PrettyPrinter(indent=4)
22
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
23
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
24
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
26
+ assert not np.isnan(loss), "loss is nan"
27
+ ^^^^^^^^^^^^^^^^^^
28
+ AssertionError: loss is nan
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/git-info.txt ADDED
@@ -0,0 +1,2 @@
 
 
 
1
+ branch: main
2
+ commit: 4f75caae343937a59636f9600dd815d5d6b06a6f
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_0_log.err ADDED
@@ -0,0 +1,73 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/torch/distributed/c10d_logger.py:83: UserWarning: barrier(): using the device under current context. You can specify `device_id` in `init_process_group` to mute this warning.
4
+ return func(*args, **kwargs)
5
+ [rank0]:[W510 10:50:40.536263067 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
6
+ wandb: Currently logged in as: dgcnz (uvjepa) to https://api.wandb.ai. Use `wandb login --relogin` to force relogin
7
+ wandb: setting up run 0ebazd1x
8
+ wandb: Tracking run with wandb version 0.23.1
9
+ wandb: Run data is saved locally in /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/wandb/run-20260510_105047-0ebazd1x
10
+ wandb: Run `wandb offline` to turn off syncing.
11
+ wandb: Syncing run c001_vitl_k32_simple_cross_stable
12
+ wandb: ⭐️ View project at https://wandb.ai/uvjepa/vjepa_ujepaside
13
+ wandb: 🚀 View run at https://wandb.ai/uvjepa/vjepa_ujepaside/runs/0ebazd1x
14
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
15
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
16
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
17
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
18
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/torch/distributed/c10d_logger.py:83: UserWarning: barrier(): using the device under current context. You can specify `device_id` in `init_process_group` to mute this warning.
19
+ return func(*args, **kwargs)
20
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/torch/distributed/c10d_logger.py:83: UserWarning: barrier(): using the device under current context. You can specify `device_id` in `init_process_group` to mute this warning.
21
+ return func(*args, **kwargs)
22
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
23
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
24
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/torch/distributed/c10d_logger.py:83: UserWarning: barrier(): using the device under current context. You can specify `device_id` in `init_process_group` to mute this warning.
25
+ return func(*args, **kwargs)
26
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
27
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
28
+ submitit ERROR (2026-05-10 14:06:41,936) - Submitted job triggered an exception
29
+ Traceback (most recent call last):
30
+ File "<frozen runpy>", line 198, in _run_module_as_main
31
+ File "<frozen runpy>", line 88, in _run_code
32
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
33
+ submitit_main()
34
+ ~~~~~~~~~~~~~^^
35
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
36
+ process_job(args.folder)
37
+ ~~~~~~~~~~~^^^^^^^^^^^^^
38
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
39
+ raise error
40
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
41
+ result = delayed.result()
42
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
43
+ self._result = self.function(*self.args, **self.kwargs)
44
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
45
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
46
+ pp = pprint.PrettyPrinter(indent=4)
47
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
48
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
49
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
50
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
51
+ assert not np.isnan(loss), "loss is nan"
52
+ ^^^^^^^^^^^^^^^^^^
53
+ AssertionError: loss is nan
54
+ [rank0]:[W510 14:06:45.675209065 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
55
+ srun: error: gcn75: task 5: Exited with exit code 1
56
+ srun: Terminating StepId=22613067.0
57
+ [2026-05-10T14:06:45.953] error: *** STEP 22613067.0 ON gcn74 CANCELLED AT 2026-05-10T14:06:45 DUE TO TASK FAILURE ***
58
+ srun: error: gcn77: task 12: Exited with exit code 1
59
+ srun: error: gcn75: task 6: Exited with exit code 1
60
+ srun: error: gcn77: task 14: Exited with exit code 1
61
+ srun: error: gcn74: task 3: Exited with exit code 1
62
+ srun: error: gcn76: task 11: Terminated
63
+ srun: error: gcn75: task 7: Exited with exit code 1
64
+ srun: error: gcn76: task 9: Terminated
65
+ srun: error: gcn77: task 15: Exited with exit code 1
66
+ srun: error: gcn74: task 1: Exited with exit code 1
67
+ srun: error: gcn75: task 4: Terminated
68
+ srun: error: gcn76: task 8: Terminated
69
+ srun: error: gcn77: task 13: Exited with exit code 1
70
+ srun: error: gcn76: task 10: Terminated
71
+ srun: error: gcn74: task 2: Terminated
72
+ srun: error: gcn74: task 0: Terminated
73
+ srun: Force Terminated StepId=22613067.0
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_0_log.out ADDED
The diff for this file is too large to render. See raw diff
 
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_10_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank10]:[W510 10:49:36.780200773 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:41,946) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank10]:[W510 14:06:44.843889483 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_10_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn76.local.snellius.surf.nl, local_rank=2(4), node=2(4), global_rank=10(16))
2
+ submitit INFO (2026-05-10 10:45:50,696) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:33][app.vjepa.train ][main ] Initialized (rank/world-size) 10/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:33][root ][stage_datasets ] [local_rank 2/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:33][root ][_stage_targz_parts ] [rank 2] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:47][root ][_stage_targz_parts ] [local_rank 2] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:47:00][root ][_stage_targz_parts ] [local_rank 2] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:15][root ][_stage_targz_parts ] [local_rank 2] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:29][root ][_stage_targz_parts ] [local_rank 2] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:43][root ][_stage_targz_parts ] [local_rank 2] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:56][root ][_stage_targz_parts ] [local_rank 2] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:10][root ][_stage_targz_parts ] [local_rank 2] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:25][root ][_stage_targz_parts ] [local_rank 2] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:39][root ][_stage_targz_parts ] [local_rank 2] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:53][root ][_stage_targz_parts ] [local_rank 2] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:08][root ][_stage_targz_parts ] [local_rank 2] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:22][root ][_stage_targz_parts ] [local_rank 2] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:36][root ][_stage_targz_parts ] [local_rank 2] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:36][root ][stage_datasets ] [local_rank 2/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:11][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:23][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:51:28][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 10 / 16
270
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] Wrapping models in DDP (rank 10)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:41,946) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank10.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_11_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank11]:[W510 10:49:32.803633407 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:43,177) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank11]:[W510 14:06:44.814354209 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_11_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn76.local.snellius.surf.nl, local_rank=3(4), node=2(4), global_rank=11(16))
2
+ submitit INFO (2026-05-10 10:45:50,696) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:34][app.vjepa.train ][main ] Initialized (rank/world-size) 11/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:34][root ][stage_datasets ] [local_rank 3/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:34][root ][_stage_targz_parts ] [rank 3] Extracting 25/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:48][root ][_stage_targz_parts ] [local_rank 3] Extracted 2/25 parts
116
+ [INFO ][2026-05-10 10:47:02][root ][_stage_targz_parts ] [local_rank 3] Extracted 4/25 parts
117
+ [INFO ][2026-05-10 10:47:16][root ][_stage_targz_parts ] [local_rank 3] Extracted 6/25 parts
118
+ [INFO ][2026-05-10 10:47:30][root ][_stage_targz_parts ] [local_rank 3] Extracted 8/25 parts
119
+ [INFO ][2026-05-10 10:47:45][root ][_stage_targz_parts ] [local_rank 3] Extracted 10/25 parts
120
+ [INFO ][2026-05-10 10:47:59][root ][_stage_targz_parts ] [local_rank 3] Extracted 12/25 parts
121
+ [INFO ][2026-05-10 10:48:13][root ][_stage_targz_parts ] [local_rank 3] Extracted 14/25 parts
122
+ [INFO ][2026-05-10 10:48:28][root ][_stage_targz_parts ] [local_rank 3] Extracted 16/25 parts
123
+ [INFO ][2026-05-10 10:48:42][root ][_stage_targz_parts ] [local_rank 3] Extracted 18/25 parts
124
+ [INFO ][2026-05-10 10:48:56][root ][_stage_targz_parts ] [local_rank 3] Extracted 20/25 parts
125
+ [INFO ][2026-05-10 10:49:10][root ][_stage_targz_parts ] [local_rank 3] Extracted 22/25 parts
126
+ [INFO ][2026-05-10 10:49:24][root ][_stage_targz_parts ] [local_rank 3] Extracted 24/25 parts
127
+ [INFO ][2026-05-10 10:49:32][root ][_stage_targz_parts ] [local_rank 3] Extracted 25/25 parts
128
+ [INFO ][2026-05-10 10:49:32][root ][stage_datasets ] [local_rank 3/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:11][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:23][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:51:28][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 11 / 16
270
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] Wrapping models in DDP (rank 11)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:43,177) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:43][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank11.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_12_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank12]:[W510 10:50:31.359507529 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:41,226) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank12]:[W510 14:06:42.186233905 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_12_log.out ADDED
@@ -0,0 +1,280 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn77.local.snellius.surf.nl, local_rank=0(4), node=3(4), global_rank=12(16))
2
+ submitit INFO (2026-05-10 10:45:50,697) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:35][app.vjepa.train ][main ] Initialized (rank/world-size) 12/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:35][root ][stage_datasets ] [local_rank 0/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:35][root ][_stage_targz_parts ] [rank 0] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:49][root ][_stage_targz_parts ] [local_rank 0] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:47:03][root ][_stage_targz_parts ] [local_rank 0] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:16][root ][_stage_targz_parts ] [local_rank 0] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:30][root ][_stage_targz_parts ] [local_rank 0] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:44][root ][_stage_targz_parts ] [local_rank 0] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:59][root ][_stage_targz_parts ] [local_rank 0] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:13][root ][_stage_targz_parts ] [local_rank 0] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:27][root ][_stage_targz_parts ] [local_rank 0] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:41][root ][_stage_targz_parts ] [local_rank 0] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:55][root ][_stage_targz_parts ] [local_rank 0] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:09][root ][_stage_targz_parts ] [local_rank 0] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:24][root ][_stage_targz_parts ] [local_rank 0] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:38][root ][_stage_targz_parts ] [local_rank 0] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:38][root ][stage_datasets ] [local_rank 0/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:49:38][root ][_stage_multipart_tar ] [rank 0] Extracting multipart tar (2 files) to /scratch-node/dcanez.22613067/ssv2
130
+ [INFO ][2026-05-10 10:50:43][root ][stage_datasets ] Data staging completed in 248.4s (4.1min)
131
+ [INFO ][2026-05-10 10:50:43][root ][_rewrite_csv ] Wrote local CSV: /scratch-node/dcanez.22613067/kinetics_240/train.csv (239789 entries)
132
+ [INFO ][2026-05-10 10:50:44][root ][_rewrite_csv ] Wrote local CSV: /scratch-node/dcanez.22613067/ssv2/train.csv (168913 entries)
133
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
134
+ [INFO ][2026-05-10 10:51:11][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
135
+ [INFO ][2026-05-10 10:51:23][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
136
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] ViTMultiSeqWrapper(
137
+ (backbone): UJEPAside(
138
+ (patch_embed): PatchEmbed3D(
139
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
140
+ )
141
+ (rope): CAPI2DRoPE()
142
+ (blocks): ModuleList(
143
+ (0-23): 24 x Block(
144
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
145
+ (rope_impl): CAPI2DRoPE()
146
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
147
+ (drop_path1): Identity()
148
+ (drop_path2): Identity()
149
+ (attn): Attention(
150
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
151
+ (attn_drop): Dropout(p=0.0, inplace=False)
152
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
153
+ (proj_drop): Dropout(p=0.0, inplace=False)
154
+ (rope_impl): CAPI2DRoPE()
155
+ )
156
+ (mlp): MLP(
157
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
158
+ (act): GELU(approximate='none')
159
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
160
+ (drop): Dropout(p=0.0, inplace=False)
161
+ )
162
+ )
163
+ )
164
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
165
+ (st_blocks): ModuleList(
166
+ (0-23): 24 x Block(
167
+ (residual1): EfficientResidual(
168
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
169
+ (fn): Attention(
170
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
171
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
172
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
173
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
174
+ (rope_impl): CAPI3DRoPE()
175
+ )
176
+ )
177
+ (residual2): EfficientResidual(
178
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
179
+ (fn): MLP(
180
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
181
+ (act): GELU(approximate='none')
182
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
183
+ (drop): Dropout(p=0.0, inplace=False)
184
+ )
185
+ )
186
+ )
187
+ )
188
+ (st_rope): CAPI3DRoPE()
189
+ )
190
+ )
191
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
192
+ (backbone): PredictorV2(
193
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
194
+ (mask_tokens): ParameterList(
195
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
196
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
197
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
198
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
199
+ )
200
+ (predictor_blocks): ModuleList(
201
+ (0-5): 6 x Block(
202
+ (residual1): EfficientResidual(
203
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
204
+ (fn): Attention(
205
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
206
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
207
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
208
+ (proj): Linear(in_features=384, out_features=384, bias=False)
209
+ (rope): Rope()
210
+ )
211
+ )
212
+ (residual2): EfficientResidual(
213
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
214
+ (fn): MLP(
215
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
216
+ (act): GELU(approximate='none')
217
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
218
+ (drop): Dropout(p=0.0, inplace=False)
219
+ )
220
+ )
221
+ )
222
+ )
223
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
224
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
225
+ )
226
+ )
227
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] MultiSeqWrapper(
228
+ (backbone): Frozen2DTargetWrapper(
229
+ (backbone): Eva(
230
+ (patch_embed): PatchEmbed(
231
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
232
+ (norm): Identity()
233
+ )
234
+ (pos_drop): Dropout(p=0.0, inplace=False)
235
+ (norm_pre): Identity()
236
+ (blocks): ModuleList(
237
+ (0-23): 24 x EvaBlock(
238
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
239
+ (attn): EvaAttention(
240
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
241
+ (q_norm): Identity()
242
+ (k_norm): Identity()
243
+ (attn_drop): Dropout(p=0.0, inplace=False)
244
+ (norm): Identity()
245
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
246
+ (proj_drop): Dropout(p=0.0, inplace=False)
247
+ )
248
+ (drop_path1): Identity()
249
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
250
+ (mlp): Mlp(
251
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
252
+ (act): GELU(approximate='none')
253
+ (drop1): Dropout(p=0.0, inplace=False)
254
+ (norm): Identity()
255
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
256
+ (drop2): Dropout(p=0.0, inplace=False)
257
+ )
258
+ (drop_path2): Identity()
259
+ )
260
+ )
261
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
262
+ (fc_norm): Identity()
263
+ (head_drop): Dropout(p=0.0, inplace=False)
264
+ (head): Identity()
265
+ (rope): _CapiPatchRoPE()
266
+ )
267
+ )
268
+ )
269
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Encoder number of parameters: 302661632
270
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Predictor number of parameters: 11416192
271
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Target encoder number of parameters: 0
272
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset dataset created
273
+ [INFO ][2026-05-10 10:51:28][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 12 / 16
274
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset unsupervised data loader created
275
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
276
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] Wrapping models in DDP (rank 12)...
277
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
278
+ submitit ERROR (2026-05-10 14:06:41,226) - Submitted job triggered an exception
279
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
280
+ [ERROR ][2026-05-10 14:06:42][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank12.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_13_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank13]:[W510 10:49:35.472727121 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:43,172) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank13]:[W510 14:06:44.707111075 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_13_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn77.local.snellius.surf.nl, local_rank=1(4), node=3(4), global_rank=13(16))
2
+ submitit INFO (2026-05-10 10:45:50,696) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:33][app.vjepa.train ][main ] Initialized (rank/world-size) 13/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:33][root ][stage_datasets ] [local_rank 1/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:33][root ][_stage_targz_parts ] [rank 1] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:46][root ][_stage_targz_parts ] [local_rank 1] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:46:59][root ][_stage_targz_parts ] [local_rank 1] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:14][root ][_stage_targz_parts ] [local_rank 1] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:27][root ][_stage_targz_parts ] [local_rank 1] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:42][root ][_stage_targz_parts ] [local_rank 1] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:56][root ][_stage_targz_parts ] [local_rank 1] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:09][root ][_stage_targz_parts ] [local_rank 1] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:23][root ][_stage_targz_parts ] [local_rank 1] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:37][root ][_stage_targz_parts ] [local_rank 1] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:51][root ][_stage_targz_parts ] [local_rank 1] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:06][root ][_stage_targz_parts ] [local_rank 1] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:20][root ][_stage_targz_parts ] [local_rank 1] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:35][root ][_stage_targz_parts ] [local_rank 1] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:35][root ][stage_datasets ] [local_rank 1/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:11][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:23][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:51:28][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 13 / 16
270
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] Wrapping models in DDP (rank 13)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:43,172) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:43][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank13.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_14_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank14]:[W510 10:49:36.494686462 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:41,937) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank14]:[W510 14:06:44.703786579 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_14_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn77.local.snellius.surf.nl, local_rank=2(4), node=3(4), global_rank=14(16))
2
+ submitit INFO (2026-05-10 10:45:50,697) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:33][app.vjepa.train ][main ] Initialized (rank/world-size) 14/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:33][root ][stage_datasets ] [local_rank 2/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:33][root ][_stage_targz_parts ] [rank 2] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:46][root ][_stage_targz_parts ] [local_rank 2] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:47:00][root ][_stage_targz_parts ] [local_rank 2] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:14][root ][_stage_targz_parts ] [local_rank 2] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:29][root ][_stage_targz_parts ] [local_rank 2] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:43][root ][_stage_targz_parts ] [local_rank 2] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:57][root ][_stage_targz_parts ] [local_rank 2] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:11][root ][_stage_targz_parts ] [local_rank 2] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:25][root ][_stage_targz_parts ] [local_rank 2] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:39][root ][_stage_targz_parts ] [local_rank 2] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:53][root ][_stage_targz_parts ] [local_rank 2] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:07][root ][_stage_targz_parts ] [local_rank 2] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:21][root ][_stage_targz_parts ] [local_rank 2] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:36][root ][_stage_targz_parts ] [local_rank 2] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:36][root ][stage_datasets ] [local_rank 2/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:11][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:23][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:51:28][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 14 / 16
270
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] Wrapping models in DDP (rank 14)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:41,937) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank14.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_15_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank15]:[W510 10:49:32.526269737 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:41,946) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank15]:[W510 14:06:44.721708541 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_15_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn77.local.snellius.surf.nl, local_rank=3(4), node=3(4), global_rank=15(16))
2
+ submitit INFO (2026-05-10 10:45:50,697) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:34][app.vjepa.train ][main ] Initialized (rank/world-size) 15/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:34][root ][stage_datasets ] [local_rank 3/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:34][root ][_stage_targz_parts ] [rank 3] Extracting 25/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:48][root ][_stage_targz_parts ] [local_rank 3] Extracted 2/25 parts
116
+ [INFO ][2026-05-10 10:47:02][root ][_stage_targz_parts ] [local_rank 3] Extracted 4/25 parts
117
+ [INFO ][2026-05-10 10:47:16][root ][_stage_targz_parts ] [local_rank 3] Extracted 6/25 parts
118
+ [INFO ][2026-05-10 10:47:30][root ][_stage_targz_parts ] [local_rank 3] Extracted 8/25 parts
119
+ [INFO ][2026-05-10 10:47:45][root ][_stage_targz_parts ] [local_rank 3] Extracted 10/25 parts
120
+ [INFO ][2026-05-10 10:47:59][root ][_stage_targz_parts ] [local_rank 3] Extracted 12/25 parts
121
+ [INFO ][2026-05-10 10:48:13][root ][_stage_targz_parts ] [local_rank 3] Extracted 14/25 parts
122
+ [INFO ][2026-05-10 10:48:28][root ][_stage_targz_parts ] [local_rank 3] Extracted 16/25 parts
123
+ [INFO ][2026-05-10 10:48:41][root ][_stage_targz_parts ] [local_rank 3] Extracted 18/25 parts
124
+ [INFO ][2026-05-10 10:48:56][root ][_stage_targz_parts ] [local_rank 3] Extracted 20/25 parts
125
+ [INFO ][2026-05-10 10:49:10][root ][_stage_targz_parts ] [local_rank 3] Extracted 22/25 parts
126
+ [INFO ][2026-05-10 10:49:24][root ][_stage_targz_parts ] [local_rank 3] Extracted 24/25 parts
127
+ [INFO ][2026-05-10 10:49:32][root ][_stage_targz_parts ] [local_rank 3] Extracted 25/25 parts
128
+ [INFO ][2026-05-10 10:49:32][root ][stage_datasets ] [local_rank 3/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:11][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:23][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:51:28][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 15 / 16
270
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] Wrapping models in DDP (rank 15)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:41,946) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank15.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_1_log.err ADDED
@@ -0,0 +1,38 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank1]:[W510 10:49:35.449735542 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
9
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
10
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
11
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
12
+ submitit ERROR (2026-05-10 14:06:41,945) - Submitted job triggered an exception
13
+ Traceback (most recent call last):
14
+ File "<frozen runpy>", line 198, in _run_module_as_main
15
+ File "<frozen runpy>", line 88, in _run_code
16
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
17
+ submitit_main()
18
+ ~~~~~~~~~~~~~^^
19
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
20
+ process_job(args.folder)
21
+ ~~~~~~~~~~~^^^^^^^^^^^^^
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
23
+ raise error
24
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
25
+ result = delayed.result()
26
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
27
+ self._result = self.function(*self.args, **self.kwargs)
28
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
29
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
30
+ pp = pprint.PrettyPrinter(indent=4)
31
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
32
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
33
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
34
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
35
+ assert not np.isnan(loss), "loss is nan"
36
+ ^^^^^^^^^^^^^^^^^^
37
+ AssertionError: loss is nan
38
+ [rank1]:[W510 14:06:44.592867363 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_1_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn74.local.snellius.surf.nl, local_rank=1(4), node=0(4), global_rank=1(16))
2
+ submitit INFO (2026-05-10 10:45:50,696) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:31][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:31][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:31][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:32][app.vjepa.train ][main ] Initialized (rank/world-size) 1/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:32][root ][stage_datasets ] [local_rank 1/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:32][root ][_stage_targz_parts ] [rank 1] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:45][root ][_stage_targz_parts ] [local_rank 1] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:46:59][root ][_stage_targz_parts ] [local_rank 1] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:13][root ][_stage_targz_parts ] [local_rank 1] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:27][root ][_stage_targz_parts ] [local_rank 1] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:41][root ][_stage_targz_parts ] [local_rank 1] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:55][root ][_stage_targz_parts ] [local_rank 1] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:09][root ][_stage_targz_parts ] [local_rank 1] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:23][root ][_stage_targz_parts ] [local_rank 1] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:37][root ][_stage_targz_parts ] [local_rank 1] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:51][root ][_stage_targz_parts ] [local_rank 1] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:06][root ][_stage_targz_parts ] [local_rank 1] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:20][root ][_stage_targz_parts ] [local_rank 1] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:35][root ][_stage_targz_parts ] [local_rank 1] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:35][root ][stage_datasets ] [local_rank 1/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:52][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:58][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:52:01][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:52:01][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 1 / 16
270
+ [INFO ][2026-05-10 10:52:01][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Wrapping models in DDP (rank 1)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:41,945) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank1.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_2_log.err ADDED
@@ -0,0 +1,38 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank2]:[W510 10:49:36.441527182 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
9
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
10
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
11
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
12
+ submitit ERROR (2026-05-10 14:06:43,171) - Submitted job triggered an exception
13
+ Traceback (most recent call last):
14
+ File "<frozen runpy>", line 198, in _run_module_as_main
15
+ File "<frozen runpy>", line 88, in _run_code
16
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
17
+ submitit_main()
18
+ ~~~~~~~~~~~~~^^
19
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
20
+ process_job(args.folder)
21
+ ~~~~~~~~~~~^^^^^^^^^^^^^
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
23
+ raise error
24
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
25
+ result = delayed.result()
26
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
27
+ self._result = self.function(*self.args, **self.kwargs)
28
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
29
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
30
+ pp = pprint.PrettyPrinter(indent=4)
31
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
32
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
33
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
34
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
35
+ assert not np.isnan(loss), "loss is nan"
36
+ ^^^^^^^^^^^^^^^^^^
37
+ AssertionError: loss is nan
38
+ [rank2]:[W510 14:06:44.773812020 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_2_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn74.local.snellius.surf.nl, local_rank=2(4), node=0(4), global_rank=2(16))
2
+ submitit INFO (2026-05-10 10:45:50,696) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:31][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:31][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:31][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:33][app.vjepa.train ][main ] Initialized (rank/world-size) 2/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:33][root ][stage_datasets ] [local_rank 2/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:33][root ][_stage_targz_parts ] [rank 2] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:47][root ][_stage_targz_parts ] [local_rank 2] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:47:00][root ][_stage_targz_parts ] [local_rank 2] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:15][root ][_stage_targz_parts ] [local_rank 2] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:29][root ][_stage_targz_parts ] [local_rank 2] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:43][root ][_stage_targz_parts ] [local_rank 2] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:57][root ][_stage_targz_parts ] [local_rank 2] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:11][root ][_stage_targz_parts ] [local_rank 2] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:25][root ][_stage_targz_parts ] [local_rank 2] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:39][root ][_stage_targz_parts ] [local_rank 2] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:53][root ][_stage_targz_parts ] [local_rank 2] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:08][root ][_stage_targz_parts ] [local_rank 2] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:22][root ][_stage_targz_parts ] [local_rank 2] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:36][root ][_stage_targz_parts ] [local_rank 2] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:36][root ][stage_datasets ] [local_rank 2/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:52][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:58][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:59][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:59][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:59][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:59][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:52:01][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:52:01][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 2 / 16
270
+ [INFO ][2026-05-10 10:52:01][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Wrapping models in DDP (rank 2)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:43,171) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:43][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank2.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_3_log.err ADDED
@@ -0,0 +1,38 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank3]:[W510 10:49:32.556389443 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
9
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
10
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
11
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
12
+ submitit ERROR (2026-05-10 14:06:41,226) - Submitted job triggered an exception
13
+ Traceback (most recent call last):
14
+ File "<frozen runpy>", line 198, in _run_module_as_main
15
+ File "<frozen runpy>", line 88, in _run_code
16
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
17
+ submitit_main()
18
+ ~~~~~~~~~~~~~^^
19
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
20
+ process_job(args.folder)
21
+ ~~~~~~~~~~~^^^^^^^^^^^^^
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
23
+ raise error
24
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
25
+ result = delayed.result()
26
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
27
+ self._result = self.function(*self.args, **self.kwargs)
28
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
29
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
30
+ pp = pprint.PrettyPrinter(indent=4)
31
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
32
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
33
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
34
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
35
+ assert not np.isnan(loss), "loss is nan"
36
+ ^^^^^^^^^^^^^^^^^^
37
+ AssertionError: loss is nan
38
+ [rank3]:[W510 14:06:42.736826829 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_3_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn74.local.snellius.surf.nl, local_rank=3(4), node=0(4), global_rank=3(16))
2
+ submitit INFO (2026-05-10 10:45:50,696) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:31][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:31][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:31][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:33][app.vjepa.train ][main ] Initialized (rank/world-size) 3/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:33][root ][stage_datasets ] [local_rank 3/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:33][root ][_stage_targz_parts ] [rank 3] Extracting 25/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:47][root ][_stage_targz_parts ] [local_rank 3] Extracted 2/25 parts
116
+ [INFO ][2026-05-10 10:47:02][root ][_stage_targz_parts ] [local_rank 3] Extracted 4/25 parts
117
+ [INFO ][2026-05-10 10:47:16][root ][_stage_targz_parts ] [local_rank 3] Extracted 6/25 parts
118
+ [INFO ][2026-05-10 10:47:30][root ][_stage_targz_parts ] [local_rank 3] Extracted 8/25 parts
119
+ [INFO ][2026-05-10 10:47:45][root ][_stage_targz_parts ] [local_rank 3] Extracted 10/25 parts
120
+ [INFO ][2026-05-10 10:47:59][root ][_stage_targz_parts ] [local_rank 3] Extracted 12/25 parts
121
+ [INFO ][2026-05-10 10:48:13][root ][_stage_targz_parts ] [local_rank 3] Extracted 14/25 parts
122
+ [INFO ][2026-05-10 10:48:28][root ][_stage_targz_parts ] [local_rank 3] Extracted 16/25 parts
123
+ [INFO ][2026-05-10 10:48:41][root ][_stage_targz_parts ] [local_rank 3] Extracted 18/25 parts
124
+ [INFO ][2026-05-10 10:48:56][root ][_stage_targz_parts ] [local_rank 3] Extracted 20/25 parts
125
+ [INFO ][2026-05-10 10:49:10][root ][_stage_targz_parts ] [local_rank 3] Extracted 22/25 parts
126
+ [INFO ][2026-05-10 10:49:24][root ][_stage_targz_parts ] [local_rank 3] Extracted 24/25 parts
127
+ [INFO ][2026-05-10 10:49:32][root ][_stage_targz_parts ] [local_rank 3] Extracted 25/25 parts
128
+ [INFO ][2026-05-10 10:49:32][root ][stage_datasets ] [local_rank 3/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:52][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:58][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:58][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:52:01][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:52:01][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 3 / 16
270
+ [INFO ][2026-05-10 10:52:01][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Wrapping models in DDP (rank 3)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:41,226) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:41][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank3.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_4_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank4]:[W510 10:50:42.458578063 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:41,946) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank4]:[W510 14:06:44.681088353 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_4_log.out ADDED
@@ -0,0 +1,280 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:47,883) - Starting with JobEnvironment(job_id=22613067, hostname=gcn75.local.snellius.surf.nl, local_rank=0(4), node=1(4), global_rank=4(16))
2
+ submitit INFO (2026-05-10 10:45:47,883) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:43][app.vjepa.train ][main ] Initialized (rank/world-size) 4/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:43][root ][stage_datasets ] [local_rank 0/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:43][root ][_stage_targz_parts ] [rank 0] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:57][root ][_stage_targz_parts ] [local_rank 0] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:47:11][root ][_stage_targz_parts ] [local_rank 0] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:24][root ][_stage_targz_parts ] [local_rank 0] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:39][root ][_stage_targz_parts ] [local_rank 0] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:53][root ][_stage_targz_parts ] [local_rank 0] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:48:07][root ][_stage_targz_parts ] [local_rank 0] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:21][root ][_stage_targz_parts ] [local_rank 0] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:35][root ][_stage_targz_parts ] [local_rank 0] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:49][root ][_stage_targz_parts ] [local_rank 0] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:49:03][root ][_stage_targz_parts ] [local_rank 0] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:17][root ][_stage_targz_parts ] [local_rank 0] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:31][root ][_stage_targz_parts ] [local_rank 0] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:45][root ][_stage_targz_parts ] [local_rank 0] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:45][root ][stage_datasets ] [local_rank 0/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:49:45][root ][_stage_multipart_tar ] [rank 0] Extracting multipart tar (2 files) to /scratch-node/dcanez.22613067/ssv2
130
+ [INFO ][2026-05-10 10:50:43][root ][stage_datasets ] Data staging completed in 240.4s (4.0min)
131
+ [INFO ][2026-05-10 10:50:43][root ][_rewrite_csv ] Wrote local CSV: /scratch-node/dcanez.22613067/kinetics_240/train.csv (239789 entries)
132
+ [INFO ][2026-05-10 10:50:44][root ][_rewrite_csv ] Wrote local CSV: /scratch-node/dcanez.22613067/ssv2/train.csv (168913 entries)
133
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
134
+ [INFO ][2026-05-10 10:51:10][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
135
+ [INFO ][2026-05-10 10:51:21][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
136
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] ViTMultiSeqWrapper(
137
+ (backbone): UJEPAside(
138
+ (patch_embed): PatchEmbed3D(
139
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
140
+ )
141
+ (rope): CAPI2DRoPE()
142
+ (blocks): ModuleList(
143
+ (0-23): 24 x Block(
144
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
145
+ (rope_impl): CAPI2DRoPE()
146
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
147
+ (drop_path1): Identity()
148
+ (drop_path2): Identity()
149
+ (attn): Attention(
150
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
151
+ (attn_drop): Dropout(p=0.0, inplace=False)
152
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
153
+ (proj_drop): Dropout(p=0.0, inplace=False)
154
+ (rope_impl): CAPI2DRoPE()
155
+ )
156
+ (mlp): MLP(
157
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
158
+ (act): GELU(approximate='none')
159
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
160
+ (drop): Dropout(p=0.0, inplace=False)
161
+ )
162
+ )
163
+ )
164
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
165
+ (st_blocks): ModuleList(
166
+ (0-23): 24 x Block(
167
+ (residual1): EfficientResidual(
168
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
169
+ (fn): Attention(
170
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
171
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
172
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
173
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
174
+ (rope_impl): CAPI3DRoPE()
175
+ )
176
+ )
177
+ (residual2): EfficientResidual(
178
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
179
+ (fn): MLP(
180
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
181
+ (act): GELU(approximate='none')
182
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
183
+ (drop): Dropout(p=0.0, inplace=False)
184
+ )
185
+ )
186
+ )
187
+ )
188
+ (st_rope): CAPI3DRoPE()
189
+ )
190
+ )
191
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
192
+ (backbone): PredictorV2(
193
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
194
+ (mask_tokens): ParameterList(
195
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
196
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
197
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
198
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
199
+ )
200
+ (predictor_blocks): ModuleList(
201
+ (0-5): 6 x Block(
202
+ (residual1): EfficientResidual(
203
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
204
+ (fn): Attention(
205
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
206
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
207
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
208
+ (proj): Linear(in_features=384, out_features=384, bias=False)
209
+ (rope): Rope()
210
+ )
211
+ )
212
+ (residual2): EfficientResidual(
213
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
214
+ (fn): MLP(
215
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
216
+ (act): GELU(approximate='none')
217
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
218
+ (drop): Dropout(p=0.0, inplace=False)
219
+ )
220
+ )
221
+ )
222
+ )
223
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
224
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
225
+ )
226
+ )
227
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] MultiSeqWrapper(
228
+ (backbone): Frozen2DTargetWrapper(
229
+ (backbone): Eva(
230
+ (patch_embed): PatchEmbed(
231
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
232
+ (norm): Identity()
233
+ )
234
+ (pos_drop): Dropout(p=0.0, inplace=False)
235
+ (norm_pre): Identity()
236
+ (blocks): ModuleList(
237
+ (0-23): 24 x EvaBlock(
238
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
239
+ (attn): EvaAttention(
240
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
241
+ (q_norm): Identity()
242
+ (k_norm): Identity()
243
+ (attn_drop): Dropout(p=0.0, inplace=False)
244
+ (norm): Identity()
245
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
246
+ (proj_drop): Dropout(p=0.0, inplace=False)
247
+ )
248
+ (drop_path1): Identity()
249
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
250
+ (mlp): Mlp(
251
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
252
+ (act): GELU(approximate='none')
253
+ (drop1): Dropout(p=0.0, inplace=False)
254
+ (norm): Identity()
255
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
256
+ (drop2): Dropout(p=0.0, inplace=False)
257
+ )
258
+ (drop_path2): Identity()
259
+ )
260
+ )
261
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
262
+ (fc_norm): Identity()
263
+ (head_drop): Dropout(p=0.0, inplace=False)
264
+ (head): Identity()
265
+ (rope): _CapiPatchRoPE()
266
+ )
267
+ )
268
+ )
269
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Encoder number of parameters: 302661632
270
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Predictor number of parameters: 11416192
271
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Target encoder number of parameters: 0
272
+ [INFO ][2026-05-10 10:51:22][root ][make_videodataset ] VideoDataset dataset created
273
+ [INFO ][2026-05-10 10:51:22][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 4 / 16
274
+ [INFO ][2026-05-10 10:51:22][root ][make_videodataset ] VideoDataset unsupervised data loader created
275
+ [INFO ][2026-05-10 10:51:22][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
276
+ [INFO ][2026-05-10 10:51:22][app.vjepa.train ][main ] Wrapping models in DDP (rank 4)...
277
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
278
+ submitit ERROR (2026-05-10 14:06:41,946) - Submitted job triggered an exception
279
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
280
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank4.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_5_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank5]:[W510 10:49:36.789639922 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:41,226) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank5]:[W510 14:06:42.480093455 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_5_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:47,883) - Starting with JobEnvironment(job_id=22613067, hostname=gcn75.local.snellius.surf.nl, local_rank=1(4), node=1(4), global_rank=5(16))
2
+ submitit INFO (2026-05-10 10:45:47,883) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:34][app.vjepa.train ][main ] Initialized (rank/world-size) 5/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:34][root ][stage_datasets ] [local_rank 1/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:34][root ][_stage_targz_parts ] [rank 1] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:47][root ][_stage_targz_parts ] [local_rank 1] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:47:01][root ][_stage_targz_parts ] [local_rank 1] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:15][root ][_stage_targz_parts ] [local_rank 1] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:29][root ][_stage_targz_parts ] [local_rank 1] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:43][root ][_stage_targz_parts ] [local_rank 1] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:57][root ][_stage_targz_parts ] [local_rank 1] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:10][root ][_stage_targz_parts ] [local_rank 1] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:24][root ][_stage_targz_parts ] [local_rank 1] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:39][root ][_stage_targz_parts ] [local_rank 1] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:53][root ][_stage_targz_parts ] [local_rank 1] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:07][root ][_stage_targz_parts ] [local_rank 1] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:22][root ][_stage_targz_parts ] [local_rank 1] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:36][root ][_stage_targz_parts ] [local_rank 1] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:36][root ][stage_datasets ] [local_rank 1/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:10][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:21][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:51:22][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:51:22][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 5 / 16
270
+ [INFO ][2026-05-10 10:51:22][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:51:22][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:51:22][app.vjepa.train ][main ] Wrapping models in DDP (rank 5)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:41,226) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:41][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank5.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_6_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank6]:[W510 10:49:36.414267391 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:43,183) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank6]:[W510 14:06:44.647457979 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_6_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:47,883) - Starting with JobEnvironment(job_id=22613067, hostname=gcn75.local.snellius.surf.nl, local_rank=2(4), node=1(4), global_rank=6(16))
2
+ submitit INFO (2026-05-10 10:45:47,883) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:32][app.vjepa.train ][main ] Initialized (rank/world-size) 6/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:32][root ][stage_datasets ] [local_rank 2/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:32][root ][_stage_targz_parts ] [rank 2] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:46][root ][_stage_targz_parts ] [local_rank 2] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:47:00][root ][_stage_targz_parts ] [local_rank 2] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:14][root ][_stage_targz_parts ] [local_rank 2] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:29][root ][_stage_targz_parts ] [local_rank 2] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:43][root ][_stage_targz_parts ] [local_rank 2] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:57][root ][_stage_targz_parts ] [local_rank 2] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:10][root ][_stage_targz_parts ] [local_rank 2] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:25][root ][_stage_targz_parts ] [local_rank 2] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:39][root ][_stage_targz_parts ] [local_rank 2] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:53][root ][_stage_targz_parts ] [local_rank 2] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:08][root ][_stage_targz_parts ] [local_rank 2] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:22][root ][_stage_targz_parts ] [local_rank 2] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:35][root ][_stage_targz_parts ] [local_rank 2] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:35][root ][stage_datasets ] [local_rank 2/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:10][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:21][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:51:22][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:51:22][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 6 / 16
270
+ [INFO ][2026-05-10 10:51:22][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:51:22][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:51:22][app.vjepa.train ][main ] Wrapping models in DDP (rank 6)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:43,183) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:43][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank6.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_7_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank7]:[W510 10:49:34.461031118 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:41,937) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank7]:[W510 14:06:43.548753326 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_7_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:47,883) - Starting with JobEnvironment(job_id=22613067, hostname=gcn75.local.snellius.surf.nl, local_rank=3(4), node=1(4), global_rank=7(16))
2
+ submitit INFO (2026-05-10 10:45:47,883) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:08][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:36][app.vjepa.train ][main ] Initialized (rank/world-size) 7/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:36][root ][stage_datasets ] [local_rank 3/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:36][root ][_stage_targz_parts ] [rank 3] Extracting 25/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:50][root ][_stage_targz_parts ] [local_rank 3] Extracted 2/25 parts
116
+ [INFO ][2026-05-10 10:47:05][root ][_stage_targz_parts ] [local_rank 3] Extracted 4/25 parts
117
+ [INFO ][2026-05-10 10:47:19][root ][_stage_targz_parts ] [local_rank 3] Extracted 6/25 parts
118
+ [INFO ][2026-05-10 10:47:33][root ][_stage_targz_parts ] [local_rank 3] Extracted 8/25 parts
119
+ [INFO ][2026-05-10 10:47:48][root ][_stage_targz_parts ] [local_rank 3] Extracted 10/25 parts
120
+ [INFO ][2026-05-10 10:48:02][root ][_stage_targz_parts ] [local_rank 3] Extracted 12/25 parts
121
+ [INFO ][2026-05-10 10:48:16][root ][_stage_targz_parts ] [local_rank 3] Extracted 14/25 parts
122
+ [INFO ][2026-05-10 10:48:30][root ][_stage_targz_parts ] [local_rank 3] Extracted 16/25 parts
123
+ [INFO ][2026-05-10 10:48:44][root ][_stage_targz_parts ] [local_rank 3] Extracted 18/25 parts
124
+ [INFO ][2026-05-10 10:48:58][root ][_stage_targz_parts ] [local_rank 3] Extracted 20/25 parts
125
+ [INFO ][2026-05-10 10:49:13][root ][_stage_targz_parts ] [local_rank 3] Extracted 22/25 parts
126
+ [INFO ][2026-05-10 10:49:26][root ][_stage_targz_parts ] [local_rank 3] Extracted 24/25 parts
127
+ [INFO ][2026-05-10 10:49:34][root ][_stage_targz_parts ] [local_rank 3] Extracted 25/25 parts
128
+ [INFO ][2026-05-10 10:49:34][root ][stage_datasets ] [local_rank 3/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:10][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:21][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:21][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:51:22][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:51:22][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 7 / 16
270
+ [INFO ][2026-05-10 10:51:22][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:51:22][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:51:22][app.vjepa.train ][main ] Wrapping models in DDP (rank 7)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:41,937) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:42][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank7.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_8_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank8]:[W510 10:50:31.090660717 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:43,172) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank8]:[W510 14:06:44.809824319 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_8_log.out ADDED
@@ -0,0 +1,280 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn76.local.snellius.surf.nl, local_rank=0(4), node=2(4), global_rank=8(16))
2
+ submitit INFO (2026-05-10 10:45:50,696) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:32][app.vjepa.train ][main ] Initialized (rank/world-size) 8/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:32][root ][stage_datasets ] [local_rank 0/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:32][root ][_stage_targz_parts ] [rank 0] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:46][root ][_stage_targz_parts ] [local_rank 0] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:47:01][root ][_stage_targz_parts ] [local_rank 0] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:15][root ][_stage_targz_parts ] [local_rank 0] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:29][root ][_stage_targz_parts ] [local_rank 0] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:43][root ][_stage_targz_parts ] [local_rank 0] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:58][root ][_stage_targz_parts ] [local_rank 0] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:12][root ][_stage_targz_parts ] [local_rank 0] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:27][root ][_stage_targz_parts ] [local_rank 0] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:41][root ][_stage_targz_parts ] [local_rank 0] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:55][root ][_stage_targz_parts ] [local_rank 0] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:09][root ][_stage_targz_parts ] [local_rank 0] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:24][root ][_stage_targz_parts ] [local_rank 0] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:38][root ][_stage_targz_parts ] [local_rank 0] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:38][root ][stage_datasets ] [local_rank 0/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:49:38][root ][_stage_multipart_tar ] [rank 0] Extracting multipart tar (2 files) to /scratch-node/dcanez.22613067/ssv2
130
+ [INFO ][2026-05-10 10:50:43][root ][stage_datasets ] Data staging completed in 250.8s (4.2min)
131
+ [INFO ][2026-05-10 10:50:43][root ][_rewrite_csv ] Wrote local CSV: /scratch-node/dcanez.22613067/kinetics_240/train.csv (239789 entries)
132
+ [INFO ][2026-05-10 10:50:44][root ][_rewrite_csv ] Wrote local CSV: /scratch-node/dcanez.22613067/ssv2/train.csv (168913 entries)
133
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
134
+ [INFO ][2026-05-10 10:51:11][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
135
+ [INFO ][2026-05-10 10:51:23][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
136
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] ViTMultiSeqWrapper(
137
+ (backbone): UJEPAside(
138
+ (patch_embed): PatchEmbed3D(
139
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
140
+ )
141
+ (rope): CAPI2DRoPE()
142
+ (blocks): ModuleList(
143
+ (0-23): 24 x Block(
144
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
145
+ (rope_impl): CAPI2DRoPE()
146
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
147
+ (drop_path1): Identity()
148
+ (drop_path2): Identity()
149
+ (attn): Attention(
150
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
151
+ (attn_drop): Dropout(p=0.0, inplace=False)
152
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
153
+ (proj_drop): Dropout(p=0.0, inplace=False)
154
+ (rope_impl): CAPI2DRoPE()
155
+ )
156
+ (mlp): MLP(
157
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
158
+ (act): GELU(approximate='none')
159
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
160
+ (drop): Dropout(p=0.0, inplace=False)
161
+ )
162
+ )
163
+ )
164
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
165
+ (st_blocks): ModuleList(
166
+ (0-23): 24 x Block(
167
+ (residual1): EfficientResidual(
168
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
169
+ (fn): Attention(
170
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
171
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
172
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
173
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
174
+ (rope_impl): CAPI3DRoPE()
175
+ )
176
+ )
177
+ (residual2): EfficientResidual(
178
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
179
+ (fn): MLP(
180
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
181
+ (act): GELU(approximate='none')
182
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
183
+ (drop): Dropout(p=0.0, inplace=False)
184
+ )
185
+ )
186
+ )
187
+ )
188
+ (st_rope): CAPI3DRoPE()
189
+ )
190
+ )
191
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
192
+ (backbone): PredictorV2(
193
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
194
+ (mask_tokens): ParameterList(
195
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
196
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
197
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
198
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
199
+ )
200
+ (predictor_blocks): ModuleList(
201
+ (0-5): 6 x Block(
202
+ (residual1): EfficientResidual(
203
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
204
+ (fn): Attention(
205
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
206
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
207
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
208
+ (proj): Linear(in_features=384, out_features=384, bias=False)
209
+ (rope): Rope()
210
+ )
211
+ )
212
+ (residual2): EfficientResidual(
213
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
214
+ (fn): MLP(
215
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
216
+ (act): GELU(approximate='none')
217
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
218
+ (drop): Dropout(p=0.0, inplace=False)
219
+ )
220
+ )
221
+ )
222
+ )
223
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
224
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
225
+ )
226
+ )
227
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] MultiSeqWrapper(
228
+ (backbone): Frozen2DTargetWrapper(
229
+ (backbone): Eva(
230
+ (patch_embed): PatchEmbed(
231
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
232
+ (norm): Identity()
233
+ )
234
+ (pos_drop): Dropout(p=0.0, inplace=False)
235
+ (norm_pre): Identity()
236
+ (blocks): ModuleList(
237
+ (0-23): 24 x EvaBlock(
238
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
239
+ (attn): EvaAttention(
240
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
241
+ (q_norm): Identity()
242
+ (k_norm): Identity()
243
+ (attn_drop): Dropout(p=0.0, inplace=False)
244
+ (norm): Identity()
245
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
246
+ (proj_drop): Dropout(p=0.0, inplace=False)
247
+ )
248
+ (drop_path1): Identity()
249
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
250
+ (mlp): Mlp(
251
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
252
+ (act): GELU(approximate='none')
253
+ (drop1): Dropout(p=0.0, inplace=False)
254
+ (norm): Identity()
255
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
256
+ (drop2): Dropout(p=0.0, inplace=False)
257
+ )
258
+ (drop_path2): Identity()
259
+ )
260
+ )
261
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
262
+ (fc_norm): Identity()
263
+ (head_drop): Dropout(p=0.0, inplace=False)
264
+ (head): Identity()
265
+ (rope): _CapiPatchRoPE()
266
+ )
267
+ )
268
+ )
269
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Encoder number of parameters: 302661632
270
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Predictor number of parameters: 11416192
271
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Target encoder number of parameters: 0
272
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset dataset created
273
+ [INFO ][2026-05-10 10:51:28][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 8 / 16
274
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset unsupervised data loader created
275
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
276
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] Wrapping models in DDP (rank 8)...
277
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
278
+ submitit ERROR (2026-05-10 14:06:43,172) - Submitted job triggered an exception
279
+ [ERROR ][2026-05-10 14:06:43][submitit ][process_job ] Submitted job triggered an exception
280
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank8.log
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_9_log.err ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ /scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/timm/models/layers/__init__.py:49: FutureWarning: Importing from timm.models.layers is deprecated, please import via timm.layers
2
+ warnings.warn(f"Importing from {__name__} is deprecated, please import via timm.layers", FutureWarning)
3
+ [rank9]:[W510 10:49:36.464305364 ProcessGroupNCCL.cpp:5138] Guessing device ID based on global rank. This can cause a hang if rank to GPU mapping is heterogeneous. You can specify device_id in init_process_group()
4
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/utils.py:796: FutureWarning: `torch.cuda.amp.GradScaler(args...)` is deprecated. Please use `torch.amp.GradScaler('cuda', args...)` instead.
5
+ scaler = torch.cuda.amp.GradScaler() if mixed_precision else None
6
+ /gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py:955: FutureWarning: `torch.cuda.amp.autocast(args...)` is deprecated. Please use `torch.amp.autocast('cuda', args...)` instead.
7
+ with torch.cuda.amp.autocast(dtype=dtype, enabled=mixed_precision):
8
+ submitit ERROR (2026-05-10 14:06:41,937) - Submitted job triggered an exception
9
+ Traceback (most recent call last):
10
+ File "<frozen runpy>", line 198, in _run_module_as_main
11
+ File "<frozen runpy>", line 88, in _run_code
12
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/_submit.py", line 11, in <module>
13
+ submitit_main()
14
+ ~~~~~~~~~~~~~^^
15
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 76, in submitit_main
16
+ process_job(args.folder)
17
+ ~~~~~~~~~~~^^^^^^^^^^^^^
18
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 69, in process_job
19
+ raise error
20
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/submission.py", line 55, in process_job
21
+ result = delayed.result()
22
+ File "/scratch-shared/dcanez/.cache/uv5/virtualenvs/vd/lib/python3.13/site-packages/submitit/core/utils.py", line 137, in result
23
+ self._result = self.function(*self.args, **self.kwargs)
24
+ ~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/gpfs/home2/dcanez/vd/app/main_distributed.py", line 97, in __call__
26
+ pp = pprint.PrettyPrinter(indent=4)
27
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/scaffold.py", line 17, in main
28
+ return importlib.import_module(f"app.{app}.train").main(args=args, resume_preempt=resume_preempt)
29
+ ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/gpfs/scratch1/shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/code/app/vjepa/train.py", line 1189, in main
31
+ assert not np.isnan(loss), "loss is nan"
32
+ ^^^^^^^^^^^^^^^^^^
33
+ AssertionError: loss is nan
34
+ [rank9]:[W510 14:06:44.834298574 ProcessGroupNCCL.cpp:1553] Warning: WARNING: destroy_process_group() was not called before program exit, which can leak resources. For more info, please see https://pytorch.org/docs/stable/distributed.html#shutdown (function operator())
vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_9_log.out ADDED
@@ -0,0 +1,276 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ submitit INFO (2026-05-10 10:45:50,696) - Starting with JobEnvironment(job_id=22613067, hostname=gcn76.local.snellius.surf.nl, local_rank=1(4), node=2(4), global_rank=9(16))
2
+ submitit INFO (2026-05-10 10:45:50,696) - Loading pickle: /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/job_22613067/22613067_submitted.pkl
3
+ INFO:root:loaded pretrain params...
4
+ { 'app': 'vjepa',
5
+ 'cpus_per_task': 16,
6
+ 'data': { 'batch_size': 64,
7
+ 'crop_size': 224,
8
+ 'dataset_fpcs': [16, 16],
9
+ 'dataset_type': 'VideoDataset',
10
+ 'datasets': [ '/scratch-shared/dcanez/data/kinetics/k400/train.csv',
11
+ '/scratch-shared/dcanez/data/ssv2/train.csv'],
12
+ 'datasets_weights': [0.65, 0.35],
13
+ 'fps': 4,
14
+ 'num_workers': 10,
15
+ 'patch_size': 14,
16
+ 'persistent_workers': True,
17
+ 'pin_mem': True,
18
+ 'stage': [ { 'dest': 'kinetics_240',
19
+ 'format': 'targz_parts',
20
+ 'src': '/scratch-shared/dcanez/data/kinetics/k400/tars_240/'},
21
+ { 'dest': 'ssv2',
22
+ 'format': 'multipart_tar',
23
+ 'src': '/scratch-nvme/ml-datasets/something-something-v2/'}],
24
+ 'tubelet_size': 1},
25
+ 'data_aug': { 'auto_augment': False,
26
+ 'motion_shift': False,
27
+ 'random_resize_aspect_ratio': [0.75, 1.35],
28
+ 'random_resize_scale': [0.3, 1.0],
29
+ 'reprob': 0.0},
30
+ 'folder': '/scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable',
31
+ 'loss': {'loss_exp': 1.0},
32
+ 'mask': [ { 'aspect_ratio': [0.75, 1.5],
33
+ 'full_complement': False,
34
+ 'max_keep': None,
35
+ 'max_temporal_keep': 1.0,
36
+ 'num_blocks': 8,
37
+ 'spatial_scale': [0.15, 0.15],
38
+ 'temporal_scale': [1.0, 1.0]},
39
+ { 'aspect_ratio': [0.75, 1.5],
40
+ 'full_complement': False,
41
+ 'max_keep': None,
42
+ 'max_temporal_keep': 1.0,
43
+ 'num_blocks': 2,
44
+ 'spatial_scale': [0.7, 0.7],
45
+ 'temporal_scale': [1.0, 1.0]}],
46
+ 'mem_per_gpu': '180G',
47
+ 'meta': { 'dtype': 'bfloat16',
48
+ 'knn_eval_epoch0': False,
49
+ 'knn_eval_freq': 5,
50
+ 'knn_eval_presets': [ { 'config': { 'batch_size': 64,
51
+ 'dataset_train': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/train.csv',
52
+ 'dataset_val': '/scratch-shared/mdorkenw/ucf101/ucfTrainTestlist/val.csv',
53
+ 'eval_videos_per_class': 25,
54
+ 'num_workers': 8,
55
+ 'pool_type': 'slot_temporal_concat',
56
+ 'train_videos_per_class': 100},
57
+ 'preset': 'ucf101'},
58
+ { 'config': { 'batch_size': 64,
59
+ 'dataset_train': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/train_coarse10.csv',
60
+ 'dataset_val': '/scratch-shared/mdorkenw/20bn-something-something-v2/something-something-v2-annotations/val_coarse10.csv',
61
+ 'eval_videos_per_class': 100,
62
+ 'linear_probe': True,
63
+ 'num_workers': 8,
64
+ 'pool_type': 'slot_temporal_concat',
65
+ 'train_videos_per_class': 500},
66
+ 'preset': 'ssv2_coarse10'}],
67
+ 'load_checkpoint': True,
68
+ 'read_checkpoint': None,
69
+ 'save_every_freq': 5,
70
+ 'seed': 239,
71
+ 'use_sdpa': True,
72
+ 'use_wandb': True,
73
+ 'wandb_project': 'vjepa_ujepaside'},
74
+ 'metrics': {'sigreg': {}, 'std': {}},
75
+ 'model': { 'model_name': 'ujepaside_large_patch14_capi_lvd1689m',
76
+ 'pred_depth': 6,
77
+ 'pred_embed_dim': 384,
78
+ 'pred_num_heads': 12,
79
+ 'predictor': 'v2_cross',
80
+ 'st_causal': False,
81
+ 'st_drop_path': 0.2,
82
+ 'st_flex_enable': False,
83
+ 'st_layer_scale_init': 1e-05,
84
+ 'st_num_slots': 32,
85
+ 'st_slots_causal_within_frame': False,
86
+ 'target_kind': 'frozen_2d',
87
+ 'target_type': 'vit_large_patch14_capi.lvd1689m',
88
+ 'temporal_spacing': 1.0,
89
+ 'uniform_power': True,
90
+ 'use_activation_checkpointing': True,
91
+ 'use_mask_tokens': True,
92
+ 'use_rope': True,
93
+ 'use_sdpa': True,
94
+ 'zero_init_mask_tokens': True},
95
+ 'nodes': 4,
96
+ 'optimization': { 'clip_grad': 3.0,
97
+ 'ema': [0.99925, 0.99925],
98
+ 'epochs': 100,
99
+ 'final_lr': 0.0001,
100
+ 'final_weight_decay': 0.04,
101
+ 'ipe': 300,
102
+ 'ipe_scale': 1.0,
103
+ 'lr': 0.0005,
104
+ 'start_lr': 0.0001,
105
+ 'warmup': 10,
106
+ 'weight_decay': 0.04},
107
+ 'tasks_per_node': 4}
108
+ INFO:root:Running pre-training of app: vjepa
109
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] which_dtype='bfloat16'
110
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] Disabling persistent_workers (incompatible with KNN eval)
111
+ [INFO ][2026-05-10 10:46:30][app.vjepa.train ][main ] NCCL_SOCKET_IFNAME=eno
112
+ [INFO ][2026-05-10 10:46:34][app.vjepa.train ][main ] Initialized (rank/world-size) 9/16, tasks_per_node=4
113
+ [INFO ][2026-05-10 10:46:34][root ][stage_datasets ] [local_rank 1/4] Staging kinetics_240 (targz_parts)
114
+ [INFO ][2026-05-10 10:46:34][root ][_stage_targz_parts ] [rank 1] Extracting 26/103 tar.gz parts to /scratch-node/dcanez.22613067/kinetics_240
115
+ [INFO ][2026-05-10 10:46:47][root ][_stage_targz_parts ] [local_rank 1] Extracted 2/26 parts
116
+ [INFO ][2026-05-10 10:47:00][root ][_stage_targz_parts ] [local_rank 1] Extracted 4/26 parts
117
+ [INFO ][2026-05-10 10:47:14][root ][_stage_targz_parts ] [local_rank 1] Extracted 6/26 parts
118
+ [INFO ][2026-05-10 10:47:28][root ][_stage_targz_parts ] [local_rank 1] Extracted 8/26 parts
119
+ [INFO ][2026-05-10 10:47:43][root ][_stage_targz_parts ] [local_rank 1] Extracted 10/26 parts
120
+ [INFO ][2026-05-10 10:47:57][root ][_stage_targz_parts ] [local_rank 1] Extracted 12/26 parts
121
+ [INFO ][2026-05-10 10:48:10][root ][_stage_targz_parts ] [local_rank 1] Extracted 14/26 parts
122
+ [INFO ][2026-05-10 10:48:24][root ][_stage_targz_parts ] [local_rank 1] Extracted 16/26 parts
123
+ [INFO ][2026-05-10 10:48:38][root ][_stage_targz_parts ] [local_rank 1] Extracted 18/26 parts
124
+ [INFO ][2026-05-10 10:48:53][root ][_stage_targz_parts ] [local_rank 1] Extracted 20/26 parts
125
+ [INFO ][2026-05-10 10:49:07][root ][_stage_targz_parts ] [local_rank 1] Extracted 22/26 parts
126
+ [INFO ][2026-05-10 10:49:21][root ][_stage_targz_parts ] [local_rank 1] Extracted 24/26 parts
127
+ [INFO ][2026-05-10 10:49:35][root ][_stage_targz_parts ] [local_rank 1] Extracted 26/26 parts
128
+ [INFO ][2026-05-10 10:49:35][root ][stage_datasets ] [local_rank 1/4] Staging ssv2 (multipart_tar)
129
+ [INFO ][2026-05-10 10:50:44][app.vjepa.train ][main ] Staged datasets: ['/scratch-node/dcanez.22613067/kinetics_240/train.csv', '/scratch-node/dcanez.22613067/ssv2/train.csv']
130
+ [INFO ][2026-05-10 10:51:11][experiments.stmodels.vision_transformers_v3][vit_large_patch14_capi_lvd1689m] Loading pretrained weights for vit_large_patch14_capi_lvd1689m from https://dl.fbaipublicfiles.com/capi/capi_vitl14_lvd.pth
131
+ [INFO ][2026-05-10 10:51:23][root ][_build_frozen_2d_target ] Loaded frozen_2d target from timm: vit_large_patch14_capi.lvd1689m
132
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] ViTMultiSeqWrapper(
133
+ (backbone): UJEPAside(
134
+ (patch_embed): PatchEmbed3D(
135
+ (proj): Conv3d(3, 1024, kernel_size=(1, 14, 14), stride=(1, 14, 14))
136
+ )
137
+ (rope): CAPI2DRoPE()
138
+ (blocks): ModuleList(
139
+ (0-23): 24 x Block(
140
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
141
+ (rope_impl): CAPI2DRoPE()
142
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
143
+ (drop_path1): Identity()
144
+ (drop_path2): Identity()
145
+ (attn): Attention(
146
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
147
+ (attn_drop): Dropout(p=0.0, inplace=False)
148
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
149
+ (proj_drop): Dropout(p=0.0, inplace=False)
150
+ (rope_impl): CAPI2DRoPE()
151
+ )
152
+ (mlp): MLP(
153
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
154
+ (act): GELU(approximate='none')
155
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
156
+ (drop): Dropout(p=0.0, inplace=False)
157
+ )
158
+ )
159
+ )
160
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=False)
161
+ (st_blocks): ModuleList(
162
+ (0-23): 24 x Block(
163
+ (residual1): EfficientResidual(
164
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
165
+ (fn): Attention(
166
+ (q_proj): Linear(in_features=1024, out_features=1024, bias=False)
167
+ (k_proj): Linear(in_features=1024, out_features=1024, bias=False)
168
+ (v_proj): Linear(in_features=1024, out_features=1024, bias=False)
169
+ (proj): Linear(in_features=1024, out_features=1024, bias=False)
170
+ (rope_impl): CAPI3DRoPE()
171
+ )
172
+ )
173
+ (residual2): EfficientResidual(
174
+ (norm): LayerNorm((1024,), eps=1e-06, elementwise_affine=True)
175
+ (fn): MLP(
176
+ (fc1): Linear(in_features=1024, out_features=4096, bias=False)
177
+ (act): GELU(approximate='none')
178
+ (fc2): Linear(in_features=4096, out_features=1024, bias=False)
179
+ (drop): Dropout(p=0.0, inplace=False)
180
+ )
181
+ )
182
+ )
183
+ )
184
+ (st_rope): CAPI3DRoPE()
185
+ )
186
+ )
187
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] UJEPAsidePredictorMultiSeqWrapper(
188
+ (backbone): PredictorV2(
189
+ (predictor_embed): Linear(in_features=1024, out_features=384, bias=True)
190
+ (mask_tokens): ParameterList(
191
+ (0): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
192
+ (1): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
193
+ (2): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
194
+ (3): Parameter containing: [torch.float32 of size 1x384 (cuda:0)]
195
+ )
196
+ (predictor_blocks): ModuleList(
197
+ (0-5): 6 x Block(
198
+ (residual1): EfficientResidual(
199
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
200
+ (fn): Attention(
201
+ (q_proj): Linear(in_features=384, out_features=384, bias=False)
202
+ (k_proj): Linear(in_features=384, out_features=384, bias=False)
203
+ (v_proj): Linear(in_features=384, out_features=384, bias=False)
204
+ (proj): Linear(in_features=384, out_features=384, bias=False)
205
+ (rope): Rope()
206
+ )
207
+ )
208
+ (residual2): EfficientResidual(
209
+ (norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
210
+ (fn): MLP(
211
+ (fc1): Linear(in_features=384, out_features=1536, bias=False)
212
+ (act): GELU(approximate='none')
213
+ (fc2): Linear(in_features=1536, out_features=384, bias=False)
214
+ (drop): Dropout(p=0.0, inplace=False)
215
+ )
216
+ )
217
+ )
218
+ )
219
+ (predictor_norm): LayerNorm((384,), eps=1e-05, elementwise_affine=True)
220
+ (predictor_proj): Linear(in_features=384, out_features=1024, bias=True)
221
+ )
222
+ )
223
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] MultiSeqWrapper(
224
+ (backbone): Frozen2DTargetWrapper(
225
+ (backbone): Eva(
226
+ (patch_embed): PatchEmbed(
227
+ (proj): Conv2d(3, 1024, kernel_size=(14, 14), stride=(14, 14))
228
+ (norm): Identity()
229
+ )
230
+ (pos_drop): Dropout(p=0.0, inplace=False)
231
+ (norm_pre): Identity()
232
+ (blocks): ModuleList(
233
+ (0-23): 24 x EvaBlock(
234
+ (norm1): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
235
+ (attn): EvaAttention(
236
+ (qkv): Linear(in_features=1024, out_features=3072, bias=False)
237
+ (q_norm): Identity()
238
+ (k_norm): Identity()
239
+ (attn_drop): Dropout(p=0.0, inplace=False)
240
+ (norm): Identity()
241
+ (proj): Linear(in_features=1024, out_features=1024, bias=True)
242
+ (proj_drop): Dropout(p=0.0, inplace=False)
243
+ )
244
+ (drop_path1): Identity()
245
+ (norm2): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
246
+ (mlp): Mlp(
247
+ (fc1): Linear(in_features=1024, out_features=4096, bias=True)
248
+ (act): GELU(approximate='none')
249
+ (drop1): Dropout(p=0.0, inplace=False)
250
+ (norm): Identity()
251
+ (fc2): Linear(in_features=4096, out_features=1024, bias=True)
252
+ (drop2): Dropout(p=0.0, inplace=False)
253
+ )
254
+ (drop_path2): Identity()
255
+ )
256
+ )
257
+ (norm): RMSNorm((1024,), eps=1e-05, elementwise_affine=True)
258
+ (fc_norm): Identity()
259
+ (head_drop): Dropout(p=0.0, inplace=False)
260
+ (head): Identity()
261
+ (rope): _CapiPatchRoPE()
262
+ )
263
+ )
264
+ )
265
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Encoder number of parameters: 302661632
266
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Predictor number of parameters: 11416192
267
+ [INFO ][2026-05-10 10:51:23][root ][init_video_model ] Target encoder number of parameters: 0
268
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset dataset created
269
+ [INFO ][2026-05-10 10:51:28][WeightedSampler ][__init__ ] Using DistributedWeightedSampler with rank 9 / 16
270
+ [INFO ][2026-05-10 10:51:28][root ][make_videodataset ] VideoDataset unsupervised data loader created
271
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] iterations per epoch/dataset length: 300/399
272
+ [INFO ][2026-05-10 10:51:28][app.vjepa.train ][main ] Wrapping models in DDP (rank 9)...
273
+ [INFO ][2026-05-10 10:52:01][app.vjepa.train ][main ] Initializing loader...
274
+ submitit ERROR (2026-05-10 14:06:41,937) - Submitted job triggered an exception
275
+ [ERROR ][2026-05-10 14:06:41][submitit ][process_job ] Submitted job triggered an exception
276
+ [ERROR ][2026-05-10 14:06:43][app.vjepa.train ][_save_crash ] Saved crash log to /scratch-shared/dcanez/runs/vjepa/ujepaside_capi_lvd/c001_vitl_k32_simple_cross_stable/crash_rank9.log