w-ahmad commited on
Commit
8fddf67
·
verified ·
1 Parent(s): f08df4b

Auto upload zain 2026-08-14T21:30:04.912464 (part 4)

Browse files
This view is limited to 50 files because it contains too many changes.   See raw diff
Files changed (50) hide show
  1. .gitattributes +1 -0
  2. zain/Activation/wandb/run-20260814_195151-ix6wcbwv/logs/debug-core.log +7 -0
  3. zain/Activation/wandb/run-20260814_200425-npumf6lz/logs/debug-core.log +13 -0
  4. zain/Activation/wandb/run-20260814_200503-bdhnr27j/logs/debug-core.log +7 -0
  5. zain/Activation/wandb/run-20260814_201615-w8mr4w6k/logs/debug-core.log +13 -0
  6. zain/Activation/wandb/run-20260814_202128-twgo1e89/logs/debug-core.log +7 -0
  7. zain/Activation/wandb/run-20260814_202806-g2ch84q3/logs/debug-core.log +13 -0
  8. zain/Activation/wandb/run-20260814_203803-7p5140bq/logs/debug-core.log +7 -0
  9. zain/Activation/wandb/run-20260814_203945-j86czemo/logs/debug-core.log +13 -0
  10. zain/Activation/wandb/run-20260814_205135-0vnbmyac/logs/debug-core.log +13 -0
  11. zain/Activation/wandb/run-20260814_210109-qauftiuh/logs/debug-core.log +7 -0
  12. zain/Activation/wandb/run-20260814_210155-rxpj34pj/logs/debug-core.log +13 -0
  13. zain/Activation/wandb/run-20260814_210809-a6574zx8/logs/debug-core.log +7 -0
  14. zain/Activation/wandb/run-20260814_211407-i85cngas/files/config.yaml +439 -0
  15. zain/Activation/wandb/run-20260814_211407-i85cngas/files/output.log +18 -1
  16. zain/Activation/wandb/run-20260814_211407-i85cngas/files/wandb-summary.json +1 -0
  17. zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug-core.log +13 -0
  18. zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug-internal.log +16 -0
  19. zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug.log +5 -0
  20. zain/Activation/wandb/run-20260814_211407-i85cngas/run-i85cngas.wandb +2 -2
  21. zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug-core.log +7 -0
  22. zain/Activation/wandb/run-20260814_212208-n6fjpg9o/files/config.yaml +439 -0
  23. zain/Activation/wandb/run-20260814_212208-n6fjpg9o/files/output.log +68 -1
  24. zain/Activation/wandb/run-20260814_212208-n6fjpg9o/files/wandb-summary.json +0 -0
  25. zain/Activation/wandb/run-20260814_212208-n6fjpg9o/logs/debug-core.log +7 -0
  26. zain/Activation/wandb/run-20260814_212208-n6fjpg9o/logs/debug-internal.log +34 -0
  27. zain/Activation/wandb/run-20260814_212208-n6fjpg9o/logs/debug.log +5 -0
  28. zain/Activation/wandb/run-20260814_212208-n6fjpg9o/run-n6fjpg9o.wandb +2 -2
  29. zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/config.yaml +438 -0
  30. zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/output.log +51 -0
  31. zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/requirements.txt +149 -0
  32. zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/wandb-metadata.json +101 -0
  33. zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/wandb-summary.json +1 -0
  34. zain/Activation/wandb/run-20260814_212814-vtp6pf3m/logs/debug-core.log +32 -0
  35. zain/Activation/wandb/run-20260814_212814-vtp6pf3m/logs/debug-internal.log +17 -0
  36. zain/Activation/wandb/run-20260814_212814-vtp6pf3m/logs/debug.log +27 -0
  37. zain/Activation/wandb/run-20260814_212814-vtp6pf3m/run-vtp6pf3m.wandb +0 -0
  38. zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/config.yaml +438 -0
  39. zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/output.log +49 -0
  40. zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/requirements.txt +149 -0
  41. zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/wandb-metadata.json +101 -0
  42. zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/wandb-summary.json +1 -0
  43. zain/Activation/wandb/run-20260814_212818-fj94kr9p/logs/debug-core.log +32 -0
  44. zain/Activation/wandb/run-20260814_212818-fj94kr9p/logs/debug-internal.log +17 -0
  45. zain/Activation/wandb/run-20260814_212818-fj94kr9p/logs/debug.log +24 -0
  46. zain/Activation/wandb/run-20260814_212818-fj94kr9p/run-fj94kr9p.wandb +0 -0
  47. zain/Activation/wandb/run-20260814_212820-ucwxn3gs/files/config.yaml +438 -0
  48. zain/Activation/wandb/run-20260814_212820-ucwxn3gs/files/output.log +3 -0
  49. zain/Activation/wandb/run-20260814_212820-ucwxn3gs/files/requirements.txt +149 -0
  50. zain/Activation/wandb/run-20260814_212820-ucwxn3gs/files/wandb-metadata.json +101 -0
.gitattributes CHANGED
@@ -61,3 +61,4 @@ zain/Activation/wandb/run-20260814_211407-i85cngas/run-i85cngas.wandb filter=lfs
61
  zain/Activation/wandb/run-20260814_211507-54wnyexz/run-54wnyexz.wandb filter=lfs diff=lfs merge=lfs -text
62
  zain/Activation/wandb/run-20260814_212208-n6fjpg9o/run-n6fjpg9o.wandb filter=lfs diff=lfs merge=lfs -text
63
  zain/Activation/out/glu-waleed10-100L_trash_run/training_log.jsonl filter=lfs diff=lfs merge=lfs -text
 
 
61
  zain/Activation/wandb/run-20260814_211507-54wnyexz/run-54wnyexz.wandb filter=lfs diff=lfs merge=lfs -text
62
  zain/Activation/wandb/run-20260814_212208-n6fjpg9o/run-n6fjpg9o.wandb filter=lfs diff=lfs merge=lfs -text
63
  zain/Activation/out/glu-waleed10-100L_trash_run/training_log.jsonl filter=lfs diff=lfs merge=lfs -text
64
+ zain/Activation/wandb/run-20260814_212835-gqskne0x/run-gqskne0x.wandb filter=lfs diff=lfs merge=lfs -text
zain/Activation/wandb/run-20260814_195151-ix6wcbwv/logs/debug-core.log CHANGED
@@ -68,3 +68,10 @@
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
 
 
 
 
 
 
 
 
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
71
+ {"time":"2026-08-14T21:28:18.727248774Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
72
+ {"time":"2026-08-14T21:28:20.378913364Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
73
+ {"time":"2026-08-14T21:28:20.400345521Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"n6fjpg9o","id":"3(@)"}
74
+ {"time":"2026-08-14T21:28:20.400969576Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"n6fjpg9o","id":"3(@)"}
75
+ {"time":"2026-08-14T21:28:35.344777056Z","level":"INFO","msg":"handleInformInit: received","streamId":"gqskne0x","id":"3(@)"}
76
+ {"time":"2026-08-14T21:28:35.603024157Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"gqskne0x","id":"3(@)"}
77
+ {"time":"2026-08-14T21:28:41.078893683Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"yxbo55z35lse"}
zain/Activation/wandb/run-20260814_200425-npumf6lz/logs/debug-core.log CHANGED
@@ -47,3 +47,16 @@
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
50
+ {"time":"2026-08-14T21:25:58.658206835Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
51
+ {"time":"2026-08-14T21:25:59.189862536Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
52
+ {"time":"2026-08-14T21:25:59.191285843Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"i85cngas","id":"1(@)"}
53
+ {"time":"2026-08-14T21:25:59.192218621Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"i85cngas","id":"1(@)"}
54
+ {"time":"2026-08-14T21:25:59.492428474Z","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
55
+ {"time":"2026-08-14T21:25:59.492473057Z","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
56
+ {"time":"2026-08-14T21:25:59.492482505Z","level":"INFO","msg":"connection: closing","id":"1(@)"}
57
+ {"time":"2026-08-14T21:25:59.492489625Z","level":"INFO","msg":"server: is shutting down"}
58
+ {"time":"2026-08-14T21:25:59.492505848Z","level":"INFO","msg":"processOutgoingData: finished","id":"1(@)"}
59
+ {"time":"2026-08-14T21:25:59.492527496Z","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
60
+ {"time":"2026-08-14T21:25:59.492557564Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
61
+ {"time":"2026-08-14T21:25:59.492679293Z","level":"INFO","msg":"server: listener closed","addr":{"Name":"/tmp/wandb-409188-410559-1836801570/socket","Net":"unix"}}
62
+ {"time":"2026-08-14T21:25:59.492751296Z","level":"INFO","msg":"server: all connections closed"}
zain/Activation/wandb/run-20260814_200503-bdhnr27j/logs/debug-core.log CHANGED
@@ -68,3 +68,10 @@
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
 
 
 
 
 
 
 
 
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
71
+ {"time":"2026-08-14T21:28:18.727248774Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
72
+ {"time":"2026-08-14T21:28:20.378913364Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
73
+ {"time":"2026-08-14T21:28:20.400345521Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"n6fjpg9o","id":"3(@)"}
74
+ {"time":"2026-08-14T21:28:20.400969576Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"n6fjpg9o","id":"3(@)"}
75
+ {"time":"2026-08-14T21:28:35.344777056Z","level":"INFO","msg":"handleInformInit: received","streamId":"gqskne0x","id":"3(@)"}
76
+ {"time":"2026-08-14T21:28:35.603024157Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"gqskne0x","id":"3(@)"}
77
+ {"time":"2026-08-14T21:28:41.078893683Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"yxbo55z35lse"}
zain/Activation/wandb/run-20260814_201615-w8mr4w6k/logs/debug-core.log CHANGED
@@ -47,3 +47,16 @@
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
50
+ {"time":"2026-08-14T21:25:58.658206835Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
51
+ {"time":"2026-08-14T21:25:59.189862536Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
52
+ {"time":"2026-08-14T21:25:59.191285843Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"i85cngas","id":"1(@)"}
53
+ {"time":"2026-08-14T21:25:59.192218621Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"i85cngas","id":"1(@)"}
54
+ {"time":"2026-08-14T21:25:59.492428474Z","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
55
+ {"time":"2026-08-14T21:25:59.492473057Z","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
56
+ {"time":"2026-08-14T21:25:59.492482505Z","level":"INFO","msg":"connection: closing","id":"1(@)"}
57
+ {"time":"2026-08-14T21:25:59.492489625Z","level":"INFO","msg":"server: is shutting down"}
58
+ {"time":"2026-08-14T21:25:59.492505848Z","level":"INFO","msg":"processOutgoingData: finished","id":"1(@)"}
59
+ {"time":"2026-08-14T21:25:59.492527496Z","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
60
+ {"time":"2026-08-14T21:25:59.492557564Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
61
+ {"time":"2026-08-14T21:25:59.492679293Z","level":"INFO","msg":"server: listener closed","addr":{"Name":"/tmp/wandb-409188-410559-1836801570/socket","Net":"unix"}}
62
+ {"time":"2026-08-14T21:25:59.492751296Z","level":"INFO","msg":"server: all connections closed"}
zain/Activation/wandb/run-20260814_202128-twgo1e89/logs/debug-core.log CHANGED
@@ -68,3 +68,10 @@
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
 
 
 
 
 
 
 
 
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
71
+ {"time":"2026-08-14T21:28:18.727248774Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
72
+ {"time":"2026-08-14T21:28:20.378913364Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
73
+ {"time":"2026-08-14T21:28:20.400345521Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"n6fjpg9o","id":"3(@)"}
74
+ {"time":"2026-08-14T21:28:20.400969576Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"n6fjpg9o","id":"3(@)"}
75
+ {"time":"2026-08-14T21:28:35.344777056Z","level":"INFO","msg":"handleInformInit: received","streamId":"gqskne0x","id":"3(@)"}
76
+ {"time":"2026-08-14T21:28:35.603024157Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"gqskne0x","id":"3(@)"}
77
+ {"time":"2026-08-14T21:28:41.078893683Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"yxbo55z35lse"}
zain/Activation/wandb/run-20260814_202806-g2ch84q3/logs/debug-core.log CHANGED
@@ -47,3 +47,16 @@
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
50
+ {"time":"2026-08-14T21:25:58.658206835Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
51
+ {"time":"2026-08-14T21:25:59.189862536Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
52
+ {"time":"2026-08-14T21:25:59.191285843Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"i85cngas","id":"1(@)"}
53
+ {"time":"2026-08-14T21:25:59.192218621Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"i85cngas","id":"1(@)"}
54
+ {"time":"2026-08-14T21:25:59.492428474Z","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
55
+ {"time":"2026-08-14T21:25:59.492473057Z","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
56
+ {"time":"2026-08-14T21:25:59.492482505Z","level":"INFO","msg":"connection: closing","id":"1(@)"}
57
+ {"time":"2026-08-14T21:25:59.492489625Z","level":"INFO","msg":"server: is shutting down"}
58
+ {"time":"2026-08-14T21:25:59.492505848Z","level":"INFO","msg":"processOutgoingData: finished","id":"1(@)"}
59
+ {"time":"2026-08-14T21:25:59.492527496Z","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
60
+ {"time":"2026-08-14T21:25:59.492557564Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
61
+ {"time":"2026-08-14T21:25:59.492679293Z","level":"INFO","msg":"server: listener closed","addr":{"Name":"/tmp/wandb-409188-410559-1836801570/socket","Net":"unix"}}
62
+ {"time":"2026-08-14T21:25:59.492751296Z","level":"INFO","msg":"server: all connections closed"}
zain/Activation/wandb/run-20260814_203803-7p5140bq/logs/debug-core.log CHANGED
@@ -68,3 +68,10 @@
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
 
 
 
 
 
 
 
 
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
71
+ {"time":"2026-08-14T21:28:18.727248774Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
72
+ {"time":"2026-08-14T21:28:20.378913364Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
73
+ {"time":"2026-08-14T21:28:20.400345521Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"n6fjpg9o","id":"3(@)"}
74
+ {"time":"2026-08-14T21:28:20.400969576Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"n6fjpg9o","id":"3(@)"}
75
+ {"time":"2026-08-14T21:28:35.344777056Z","level":"INFO","msg":"handleInformInit: received","streamId":"gqskne0x","id":"3(@)"}
76
+ {"time":"2026-08-14T21:28:35.603024157Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"gqskne0x","id":"3(@)"}
77
+ {"time":"2026-08-14T21:28:41.078893683Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"yxbo55z35lse"}
zain/Activation/wandb/run-20260814_203945-j86czemo/logs/debug-core.log CHANGED
@@ -47,3 +47,16 @@
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
50
+ {"time":"2026-08-14T21:25:58.658206835Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
51
+ {"time":"2026-08-14T21:25:59.189862536Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
52
+ {"time":"2026-08-14T21:25:59.191285843Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"i85cngas","id":"1(@)"}
53
+ {"time":"2026-08-14T21:25:59.192218621Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"i85cngas","id":"1(@)"}
54
+ {"time":"2026-08-14T21:25:59.492428474Z","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
55
+ {"time":"2026-08-14T21:25:59.492473057Z","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
56
+ {"time":"2026-08-14T21:25:59.492482505Z","level":"INFO","msg":"connection: closing","id":"1(@)"}
57
+ {"time":"2026-08-14T21:25:59.492489625Z","level":"INFO","msg":"server: is shutting down"}
58
+ {"time":"2026-08-14T21:25:59.492505848Z","level":"INFO","msg":"processOutgoingData: finished","id":"1(@)"}
59
+ {"time":"2026-08-14T21:25:59.492527496Z","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
60
+ {"time":"2026-08-14T21:25:59.492557564Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
61
+ {"time":"2026-08-14T21:25:59.492679293Z","level":"INFO","msg":"server: listener closed","addr":{"Name":"/tmp/wandb-409188-410559-1836801570/socket","Net":"unix"}}
62
+ {"time":"2026-08-14T21:25:59.492751296Z","level":"INFO","msg":"server: all connections closed"}
zain/Activation/wandb/run-20260814_205135-0vnbmyac/logs/debug-core.log CHANGED
@@ -47,3 +47,16 @@
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
50
+ {"time":"2026-08-14T21:25:58.658206835Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
51
+ {"time":"2026-08-14T21:25:59.189862536Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
52
+ {"time":"2026-08-14T21:25:59.191285843Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"i85cngas","id":"1(@)"}
53
+ {"time":"2026-08-14T21:25:59.192218621Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"i85cngas","id":"1(@)"}
54
+ {"time":"2026-08-14T21:25:59.492428474Z","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
55
+ {"time":"2026-08-14T21:25:59.492473057Z","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
56
+ {"time":"2026-08-14T21:25:59.492482505Z","level":"INFO","msg":"connection: closing","id":"1(@)"}
57
+ {"time":"2026-08-14T21:25:59.492489625Z","level":"INFO","msg":"server: is shutting down"}
58
+ {"time":"2026-08-14T21:25:59.492505848Z","level":"INFO","msg":"processOutgoingData: finished","id":"1(@)"}
59
+ {"time":"2026-08-14T21:25:59.492527496Z","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
60
+ {"time":"2026-08-14T21:25:59.492557564Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
61
+ {"time":"2026-08-14T21:25:59.492679293Z","level":"INFO","msg":"server: listener closed","addr":{"Name":"/tmp/wandb-409188-410559-1836801570/socket","Net":"unix"}}
62
+ {"time":"2026-08-14T21:25:59.492751296Z","level":"INFO","msg":"server: all connections closed"}
zain/Activation/wandb/run-20260814_210109-qauftiuh/logs/debug-core.log CHANGED
@@ -68,3 +68,10 @@
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
 
 
 
 
 
 
 
 
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
71
+ {"time":"2026-08-14T21:28:18.727248774Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
72
+ {"time":"2026-08-14T21:28:20.378913364Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
73
+ {"time":"2026-08-14T21:28:20.400345521Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"n6fjpg9o","id":"3(@)"}
74
+ {"time":"2026-08-14T21:28:20.400969576Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"n6fjpg9o","id":"3(@)"}
75
+ {"time":"2026-08-14T21:28:35.344777056Z","level":"INFO","msg":"handleInformInit: received","streamId":"gqskne0x","id":"3(@)"}
76
+ {"time":"2026-08-14T21:28:35.603024157Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"gqskne0x","id":"3(@)"}
77
+ {"time":"2026-08-14T21:28:41.078893683Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"yxbo55z35lse"}
zain/Activation/wandb/run-20260814_210155-rxpj34pj/logs/debug-core.log CHANGED
@@ -47,3 +47,16 @@
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
50
+ {"time":"2026-08-14T21:25:58.658206835Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
51
+ {"time":"2026-08-14T21:25:59.189862536Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
52
+ {"time":"2026-08-14T21:25:59.191285843Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"i85cngas","id":"1(@)"}
53
+ {"time":"2026-08-14T21:25:59.192218621Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"i85cngas","id":"1(@)"}
54
+ {"time":"2026-08-14T21:25:59.492428474Z","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
55
+ {"time":"2026-08-14T21:25:59.492473057Z","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
56
+ {"time":"2026-08-14T21:25:59.492482505Z","level":"INFO","msg":"connection: closing","id":"1(@)"}
57
+ {"time":"2026-08-14T21:25:59.492489625Z","level":"INFO","msg":"server: is shutting down"}
58
+ {"time":"2026-08-14T21:25:59.492505848Z","level":"INFO","msg":"processOutgoingData: finished","id":"1(@)"}
59
+ {"time":"2026-08-14T21:25:59.492527496Z","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
60
+ {"time":"2026-08-14T21:25:59.492557564Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
61
+ {"time":"2026-08-14T21:25:59.492679293Z","level":"INFO","msg":"server: listener closed","addr":{"Name":"/tmp/wandb-409188-410559-1836801570/socket","Net":"unix"}}
62
+ {"time":"2026-08-14T21:25:59.492751296Z","level":"INFO","msg":"server: all connections closed"}
zain/Activation/wandb/run-20260814_210809-a6574zx8/logs/debug-core.log CHANGED
@@ -68,3 +68,10 @@
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
 
 
 
 
 
 
 
 
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
71
+ {"time":"2026-08-14T21:28:18.727248774Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
72
+ {"time":"2026-08-14T21:28:20.378913364Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
73
+ {"time":"2026-08-14T21:28:20.400345521Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"n6fjpg9o","id":"3(@)"}
74
+ {"time":"2026-08-14T21:28:20.400969576Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"n6fjpg9o","id":"3(@)"}
75
+ {"time":"2026-08-14T21:28:35.344777056Z","level":"INFO","msg":"handleInformInit: received","streamId":"gqskne0x","id":"3(@)"}
76
+ {"time":"2026-08-14T21:28:35.603024157Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"gqskne0x","id":"3(@)"}
77
+ {"time":"2026-08-14T21:28:41.078893683Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"yxbo55z35lse"}
zain/Activation/wandb/run-20260814_211407-i85cngas/files/config.yaml ADDED
@@ -0,0 +1,439 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ _name_or_path:
2
+ value: ""
3
+ _wandb:
4
+ value:
5
+ cli_version: 0.28.1
6
+ e:
7
+ unk3a3lapicd752rmq1uqlvx1kx26i7e:
8
+ args:
9
+ - --config
10
+ - /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline.yaml
11
+ - --variants
12
+ - glu-waleed10
13
+ - glu-silu-waleed10
14
+ - mlp-waleed10
15
+ - mlp-silu-waleed10
16
+ - glu-waleed
17
+ - glu-situglu_low
18
+ - glu-waleedglu_low
19
+ codePath: sweep.py
20
+ codePathLocal: sweep.py
21
+ cpu_count: 112
22
+ cpu_count_logical: 224
23
+ cudaVersion: "12.4"
24
+ disk:
25
+ /:
26
+ total: "1560765693952"
27
+ used: "701346242560"
28
+ email: deepnevro@gmail.com
29
+ executable: /mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python
30
+ git:
31
+ commit: 3fb47c6943d6927eafc39bd399a3d3a520bae74a
32
+ remote: https://github.com/w-ahmad1a10/Activation.git
33
+ gpu: NVIDIA H100 80GB HBM3
34
+ gpu_count: 8
35
+ gpu_nvidia:
36
+ - architecture: Hopper
37
+ cudaCores: 16896
38
+ memoryTotal: "85520809984"
39
+ name: NVIDIA H100 80GB HBM3
40
+ uuid: GPU-39c684a5-fde6-83d7-1663-0859795881ae
41
+ - architecture: Hopper
42
+ cudaCores: 16896
43
+ memoryTotal: "85520809984"
44
+ name: NVIDIA H100 80GB HBM3
45
+ uuid: GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3
46
+ - architecture: Hopper
47
+ cudaCores: 16896
48
+ memoryTotal: "85520809984"
49
+ name: NVIDIA H100 80GB HBM3
50
+ uuid: GPU-132944c4-b689-2b5f-89a4-d730401677ab
51
+ - architecture: Hopper
52
+ cudaCores: 16896
53
+ memoryTotal: "85520809984"
54
+ name: NVIDIA H100 80GB HBM3
55
+ uuid: GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864
56
+ - architecture: Hopper
57
+ cudaCores: 16896
58
+ memoryTotal: "85520809984"
59
+ name: NVIDIA H100 80GB HBM3
60
+ uuid: GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef
61
+ - architecture: Hopper
62
+ cudaCores: 16896
63
+ memoryTotal: "85520809984"
64
+ name: NVIDIA H100 80GB HBM3
65
+ uuid: GPU-bc6c3e3c-9b90-09ca-c034-774961847c54
66
+ - architecture: Hopper
67
+ cudaCores: 16896
68
+ memoryTotal: "85520809984"
69
+ name: NVIDIA H100 80GB HBM3
70
+ uuid: GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9
71
+ - architecture: Hopper
72
+ cudaCores: 16896
73
+ memoryTotal: "85520809984"
74
+ name: NVIDIA H100 80GB HBM3
75
+ uuid: GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea
76
+ host: deeplens-k3s-node1
77
+ memory:
78
+ total: "2164089937920"
79
+ os: Linux-5.15.0-126-generic-x86_64-with-glibc2.35
80
+ program: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py
81
+ python: CPython 3.11.15
82
+ root: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation
83
+ startedAt: "2026-08-14T21:14:07.908466Z"
84
+ writerId: unk3a3lapicd752rmq1uqlvx1kx26i7e
85
+ m:
86
+ - "1": train/global_step
87
+ "6":
88
+ - 3
89
+ "7": []
90
+ - "2": '*'
91
+ "5": 1
92
+ "6":
93
+ - 1
94
+ "7": []
95
+ python_version: 3.11.15
96
+ t:
97
+ "1":
98
+ - 1
99
+ - 5
100
+ - 11
101
+ - 41
102
+ - 49
103
+ - 51
104
+ - 53
105
+ - 71
106
+ "2":
107
+ - 1
108
+ - 5
109
+ - 11
110
+ - 41
111
+ - 49
112
+ - 51
113
+ - 53
114
+ - 71
115
+ "3":
116
+ - 2
117
+ - 7
118
+ - 13
119
+ - 19
120
+ - 62
121
+ - 66
122
+ "4": 3.11.15
123
+ "5": 0.28.1
124
+ "6": 5.16.0.dev0
125
+ "9":
126
+ "1": transformers_trainer
127
+ "12": 0.28.1
128
+ "13": linux-x86_64
129
+ accelerator_config:
130
+ value:
131
+ dispatch_batches: null
132
+ even_batches: true
133
+ gradient_accumulation_kwargs: null
134
+ non_blocking: false
135
+ split_batches: false
136
+ use_seedable_sampler: true
137
+ activation:
138
+ value: waleedglu_low
139
+ adam_beta1:
140
+ value: 0.9
141
+ adam_beta2:
142
+ value: 0.999
143
+ adam_epsilon:
144
+ value: 1e-08
145
+ architectures:
146
+ value: null
147
+ attention_bias:
148
+ value: false
149
+ attention_dropout:
150
+ value: 0
151
+ auto_find_batch_size:
152
+ value: false
153
+ average_tokens_across_devices:
154
+ value: true
155
+ batch_eval_metrics:
156
+ value: false
157
+ bf16:
158
+ value: true
159
+ bf16_full_eval:
160
+ value: false
161
+ bos_token_id:
162
+ value: 1
163
+ chunk_size_feed_forward:
164
+ value: 0
165
+ data_seed:
166
+ value: 42
167
+ dataloader_drop_last:
168
+ value: false
169
+ dataloader_in_order:
170
+ value: true
171
+ dataloader_multiprocessing_context:
172
+ value: null
173
+ dataloader_num_workers:
174
+ value: 0
175
+ dataloader_persistent_workers:
176
+ value: false
177
+ dataloader_pin_memory:
178
+ value: true
179
+ dataloader_prefetch_factor:
180
+ value: null
181
+ ddp_backend:
182
+ value: null
183
+ ddp_broadcast_buffers:
184
+ value: null
185
+ ddp_bucket_cap_mb:
186
+ value: null
187
+ ddp_find_unused_parameters:
188
+ value: null
189
+ ddp_static_graph:
190
+ value: null
191
+ ddp_timeout:
192
+ value: 1800
193
+ debug:
194
+ value: []
195
+ deepspeed:
196
+ value: null
197
+ disable_tqdm:
198
+ value: false
199
+ do_eval:
200
+ value: true
201
+ do_predict:
202
+ value: false
203
+ do_train:
204
+ value: false
205
+ dtype:
206
+ value: null
207
+ enable_jit_checkpoint:
208
+ value: false
209
+ eos_token_id:
210
+ value: 2
211
+ eval_accumulation_steps:
212
+ value: null
213
+ eval_delay:
214
+ value: 0
215
+ eval_do_concat_batches:
216
+ value: true
217
+ eval_on_start:
218
+ value: false
219
+ eval_steps:
220
+ value: 60000
221
+ eval_strategy:
222
+ value: steps
223
+ eval_use_gather_object:
224
+ value: false
225
+ fp16:
226
+ value: false
227
+ fp16_full_eval:
228
+ value: false
229
+ fsdp:
230
+ value: null
231
+ fsdp_config:
232
+ value: null
233
+ full_determinism:
234
+ value: false
235
+ gradient_accumulation_steps:
236
+ value: 1
237
+ gradient_checkpointing:
238
+ value: false
239
+ gradient_checkpointing_kwargs:
240
+ value: null
241
+ greater_is_better:
242
+ value: null
243
+ head_dim:
244
+ value: 32
245
+ hidden_act:
246
+ value: silu
247
+ hidden_size:
248
+ value: 128
249
+ hub_always_push:
250
+ value: false
251
+ hub_model_id:
252
+ value: w-ahmad/A-glu-waleedglu_low-9L
253
+ hub_private_repo:
254
+ value: null
255
+ hub_revision:
256
+ value: null
257
+ hub_strategy:
258
+ value: every_save
259
+ hub_token:
260
+ value: <HUB_TOKEN>
261
+ id2label:
262
+ value:
263
+ "0": LABEL_0
264
+ "1": LABEL_1
265
+ ignore_data_skip:
266
+ value: false
267
+ include_for_metrics:
268
+ value: []
269
+ include_num_input_tokens_seen:
270
+ value: "no"
271
+ initializer_range:
272
+ value: 0.02
273
+ intermediate_size:
274
+ value: 256
275
+ is_encoder_decoder:
276
+ value: false
277
+ label_names:
278
+ value: null
279
+ label_smoothing_factor:
280
+ value: 0
281
+ label2id:
282
+ value:
283
+ LABEL_0: 0
284
+ LABEL_1: 1
285
+ learning_rate:
286
+ value: 0.001
287
+ length_column_name:
288
+ value: length
289
+ liger_kernel_config:
290
+ value: null
291
+ load_best_model_at_end:
292
+ value: false
293
+ local_rank:
294
+ value: -1
295
+ log_level:
296
+ value: passive
297
+ log_level_replica:
298
+ value: warning
299
+ log_on_each_node:
300
+ value: true
301
+ logging_first_step:
302
+ value: false
303
+ logging_nan_inf_filter:
304
+ value: true
305
+ logging_steps:
306
+ value: 20
307
+ logging_strategy:
308
+ value: steps
309
+ lr_scheduler_kwargs:
310
+ value: null
311
+ lr_scheduler_type:
312
+ value: constant
313
+ max_grad_norm:
314
+ value: 1
315
+ max_position_embeddings:
316
+ value: 512
317
+ max_steps:
318
+ value: 1000
319
+ metric_for_best_model:
320
+ value: null
321
+ mlp_bias:
322
+ value: false
323
+ mlp_type:
324
+ value: glu
325
+ model/num_parameters:
326
+ value: 2001280
327
+ model_type:
328
+ value: tiny_llama
329
+ neftune_noise_alpha:
330
+ value: null
331
+ num_attention_heads:
332
+ value: 4
333
+ num_hidden_layers:
334
+ value: 9
335
+ num_key_value_heads:
336
+ value: 4
337
+ num_train_epochs:
338
+ value: 1
339
+ optim:
340
+ value: adamw_torch
341
+ optim_args:
342
+ value: null
343
+ optim_target_modules:
344
+ value: null
345
+ output_attentions:
346
+ value: false
347
+ output_dir:
348
+ value: out/glu-waleedglu_low-9L_run
349
+ output_hidden_states:
350
+ value: false
351
+ pad_token_id:
352
+ value: 0
353
+ parallelism_config:
354
+ value: null
355
+ per_device_eval_batch_size:
356
+ value: 512
357
+ per_device_train_batch_size:
358
+ value: 512
359
+ prediction_loss_only:
360
+ value: false
361
+ pretraining_tp:
362
+ value: 1
363
+ problem_type:
364
+ value: null
365
+ project:
366
+ value: huggingface
367
+ push_to_hub:
368
+ value: false
369
+ remove_unused_columns:
370
+ value: false
371
+ report_to:
372
+ value:
373
+ - wandb
374
+ restore_callback_states_from_checkpoint:
375
+ value: false
376
+ resume_from_checkpoint:
377
+ value: null
378
+ return_dict:
379
+ value: true
380
+ rms_norm_eps:
381
+ value: 1e-06
382
+ rope_parameters:
383
+ value:
384
+ rope_theta: 10000
385
+ rope_type: default
386
+ run_name:
387
+ value: LM-glu-waleedglu_low-9L-2.0M-20260814-211407
388
+ save_on_each_node:
389
+ value: false
390
+ save_only_model:
391
+ value: false
392
+ save_steps:
393
+ value: 100
394
+ save_strategy:
395
+ value: steps
396
+ save_total_limit:
397
+ value: null
398
+ seed:
399
+ value: 42
400
+ skip_memory_metrics:
401
+ value: true
402
+ tf32:
403
+ value: null
404
+ tie_word_embeddings:
405
+ value: true
406
+ tokenizer_name:
407
+ value: w-ahmad/tiny-stories-tokenizer
408
+ torch_compile:
409
+ value: false
410
+ torch_compile_backend:
411
+ value: null
412
+ torch_compile_mode:
413
+ value: null
414
+ torch_empty_cache_steps:
415
+ value: null
416
+ trackio_bucket_id:
417
+ value: null
418
+ trackio_space_id:
419
+ value: null
420
+ trackio_static_space_id:
421
+ value: null
422
+ train_sampling_strategy:
423
+ value: random
424
+ transformers_version:
425
+ value: 5.16.0.dev0
426
+ use_cache:
427
+ value: false
428
+ use_cpu:
429
+ value: false
430
+ use_liger_kernel:
431
+ value: false
432
+ vocab_size:
433
+ value: 4096
434
+ waleed_beta:
435
+ value: 10
436
+ warmup_steps:
437
+ value: 0
438
+ weight_decay:
439
+ value: 0.01
zain/Activation/wandb/run-20260814_211407-i85cngas/files/output.log CHANGED
@@ -88,6 +88,23 @@ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 155
88
  - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
89
  - If you are not the owner of the model architecture class, please contact the model code owner to update it.
90
  Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 156.87it/s]
91
- 95%|█████████| 949/1000 [10:54<00:34, 1.47it/s]?, ?it/s]
92
  {'loss': '2.268', 'grad_norm': '0.9023', 'learning_rate': '0.001', 'epoch': '0.496', 'train/total_time_seconds': '284.7', 'train/time_per_step_avg': '0.3259', 'train/epoch_time_elapsed': '634.1', 'train/estimated_remaining_minutes': '0.4126'}
93
  {'loss': '2.264', 'grad_norm': '0.6562', 'learning_rate': '0.001', 'epoch': '0.5067', 'train/total_time_seconds': '291.5', 'train/time_per_step_avg': '0.3278', 'train/epoch_time_elapsed': '648.6', 'train/estimated_remaining_minutes': '0.3102'}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
88
  - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
89
  - If you are not the owner of the model architecture class, please contact the model code owner to update it.
90
  Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 156.87it/s]
91
+ 100%|█████████| 1000/1000 [11:40<00:00, 1.33i[transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
92
  {'loss': '2.268', 'grad_norm': '0.9023', 'learning_rate': '0.001', 'epoch': '0.496', 'train/total_time_seconds': '284.7', 'train/time_per_step_avg': '0.3259', 'train/epoch_time_elapsed': '634.1', 'train/estimated_remaining_minutes': '0.4126'}
93
  {'loss': '2.264', 'grad_norm': '0.6562', 'learning_rate': '0.001', 'epoch': '0.5067', 'train/total_time_seconds': '291.5', 'train/time_per_step_avg': '0.3278', 'train/epoch_time_elapsed': '648.6', 'train/estimated_remaining_minutes': '0.3102'}
94
+ {'loss': '2.258', 'grad_norm': '0.6406', 'learning_rate': '0.001', 'epoch': '0.5175', 'train/total_time_seconds': '298', 'train/time_per_step_avg': '0.3264', 'train/epoch_time_elapsed': '662.8', 'train/estimated_remaining_minutes': '0.207'}
95
+ {'loss': '2.251', 'grad_norm': '0.6484', 'learning_rate': '0.001', 'epoch': '0.5283', 'train/total_time_seconds': '304.5', 'train/time_per_step_avg': '0.3226', 'train/epoch_time_elapsed': '676.9', 'train/estimated_remaining_minutes': '0.1036'}
96
+ {'loss': '2.245', 'grad_norm': '0.5703', 'learning_rate': '0.001', 'epoch': '0.5391', 'train/total_time_seconds': '311.1', 'train/time_per_step_avg': '0.3265', 'train/epoch_time_elapsed': '691.1', 'train/estimated_remaining_minutes': '0'}
97
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
98
+ {'eval_loss': '2.239', 'eval_runtime': '9.298', 'eval_samples_per_second': '1025', 'eval_steps_per_second': '2.044', 'epoch': '0.5391', 'train/total_time_seconds': '311.1', 'train/time_per_step_avg': '0.3265', 'train/epoch_time_elapsed': '700.4', 'train/estimated_remaining_minutes': '0'}
99
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
100
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
101
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 158.67it/s]
102
+ 100%|██████████| 1000/1000 [11:40<00:00, 1.43it/s], ?it/s]
103
+ {'train_runtime': '701.3', 'train_samples_per_second': '730.1', 'train_steps_per_second': '1.426', 'train_loss': '2.97', 'epoch': '0.5391', 'train/total_time_seconds': '311.1', 'train/time_per_step_avg': '0.3265', 'train/epoch_time_elapsed': '700.4', 'train/estimated_remaining_minutes': '0'}
104
+ 100%|██████████| 19/19 [00:08<00:00, 2.17it/s]
105
+ [transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
106
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
107
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
108
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
109
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 154.24it/s]
110
+ >>> FINISHED glu-waleedglu_low-9L successfully
zain/Activation/wandb/run-20260814_211407-i85cngas/files/wandb-summary.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"total_flos":2.323107545088e+15,"eval/runtime":9.5433,"_timestamp":1.786742758641734e+09,"train_samples_per_second":730.125,"train_loss":2.969754108428955,"train/learning_rate":0.001,"train/epoch":0.5390835579514824,"_step":52,"_wandb":{"runtime":710},"train/grad_norm":0.5703125,"train/global_step":1000,"eval/steps_per_second":1.991,"train_steps_per_second":1.426,"eval/loss":2.23911452293396,"_runtime":710,"eval/samples_per_second":998.289,"train_runtime":701.2502,"train/loss":2.245043182373047}
zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug-core.log CHANGED
@@ -47,3 +47,16 @@
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  {"time":"2026-08-14T21:14:07.911109006Z","level":"INFO","msg":"handleInformInit: received","streamId":"i85cngas","id":"1(@)"}
48
  {"time":"2026-08-14T21:14:08.168219613Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"i85cngas","id":"1(@)"}
49
  {"time":"2026-08-14T21:14:13.672910923Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
50
+ {"time":"2026-08-14T21:25:58.658206835Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
51
+ {"time":"2026-08-14T21:25:59.189862536Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"d8p4y9v5n05m"}
52
+ {"time":"2026-08-14T21:25:59.191285843Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"i85cngas","id":"1(@)"}
53
+ {"time":"2026-08-14T21:25:59.192218621Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"i85cngas","id":"1(@)"}
54
+ {"time":"2026-08-14T21:25:59.492428474Z","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
55
+ {"time":"2026-08-14T21:25:59.492473057Z","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
56
+ {"time":"2026-08-14T21:25:59.492482505Z","level":"INFO","msg":"connection: closing","id":"1(@)"}
57
+ {"time":"2026-08-14T21:25:59.492489625Z","level":"INFO","msg":"server: is shutting down"}
58
+ {"time":"2026-08-14T21:25:59.492505848Z","level":"INFO","msg":"processOutgoingData: finished","id":"1(@)"}
59
+ {"time":"2026-08-14T21:25:59.492527496Z","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
60
+ {"time":"2026-08-14T21:25:59.492557564Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
61
+ {"time":"2026-08-14T21:25:59.492679293Z","level":"INFO","msg":"server: listener closed","addr":{"Name":"/tmp/wandb-409188-410559-1836801570/socket","Net":"unix"}}
62
+ {"time":"2026-08-14T21:25:59.492751296Z","level":"INFO","msg":"server: all connections closed"}
zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug-internal.log CHANGED
@@ -93,3 +93,19 @@
93
  {"time":"2026-08-14T21:24:38.835784304Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
94
  {"time":"2026-08-14T21:24:53.676283225Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":45,"history_lines":1,"events_offset":83,"events_lines":2,"console_offset":82,"console_lines":10}
95
  {"time":"2026-08-14T21:24:53.807963308Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
93
  {"time":"2026-08-14T21:24:38.835784304Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
94
  {"time":"2026-08-14T21:24:53.676283225Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":45,"history_lines":1,"events_offset":83,"events_lines":2,"console_offset":82,"console_lines":10}
95
  {"time":"2026-08-14T21:24:53.807963308Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
96
+ {"time":"2026-08-14T21:25:08.67577254Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":46,"history_lines":1,"events_offset":85,"events_lines":2,"console_offset":90,"console_lines":1}
97
+ {"time":"2026-08-14T21:25:08.813221459Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
98
+ {"time":"2026-08-14T21:25:23.675748872Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":47,"history_lines":1,"events_offset":87,"events_lines":2,"console_offset":90,"console_lines":1}
99
+ {"time":"2026-08-14T21:25:23.862250657Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
100
+ {"time":"2026-08-14T21:25:38.675553902Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":48,"history_lines":1,"events_offset":89,"events_lines":2,"console_offset":90,"console_lines":1}
101
+ {"time":"2026-08-14T21:25:38.897653817Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
102
+ {"time":"2026-08-14T21:25:53.676490134Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":49,"history_lines":3,"events_offset":91,"events_lines":2,"console_offset":90,"console_lines":1}
103
+ {"time":"2026-08-14T21:25:53.925875438Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
104
+ {"time":"2026-08-14T21:25:59.040344747Z","level":"INFO","msg":"fileTransfer: Close: file transfer manager closed"}
105
+ {"time":"2026-08-14T21:25:59.040864542Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":52,"history_lines":1,"events_offset":93,"events_lines":1,"console_offset":92,"console_lines":18,"uploaded_len":3,"complete":true,"exit_code":0}
106
+ {"time":"2026-08-14T21:25:59.187205462Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
107
+ {"time":"2026-08-14T21:25:59.188550421Z","level":"INFO","msg":"handler: operation stats","stats":{}}
108
+ {"time":"2026-08-14T21:25:59.191308472Z","level":"INFO","msg":"stream: finishing up"}
109
+ {"time":"2026-08-14T21:25:59.191335194Z","level":"INFO","msg":"handler: closed"}
110
+ {"time":"2026-08-14T21:25:59.191433704Z","level":"INFO","msg":"sender: closed"}
111
+ {"time":"2026-08-14T21:25:59.191438728Z","level":"INFO","msg":"stream: all finished"}
zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug.log CHANGED
@@ -17,3 +17,8 @@ config: {'_wandb': {}}
17
  2026-08-14 21:14:08,672 INFO MainThread:409188 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 9, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'waleedglu_low', 'waleed_beta': 10.0, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-waleedglu_low-9L_run', 'per_device_train_batch_size': 512, 'num_train_epochs': 1, 'max_steps': 1000, 'learning_rate': 0.001, 'lr_scheduler_type': 'constant', 'lr_scheduler_kwargs': None, 'warmup_steps': 0, 'optim': 'adamw_torch', 'optim_args': None, 'weight_decay': 0.01, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-waleedglu_low-9L-2.0M-20260814-211407', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 60000, 'eval_delay': 0, 'per_device_eval_batch_size': 512, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 100, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/A-glu-waleedglu_low-9L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
18
  2026-08-14 21:14:08,674 INFO MainThread:409188 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 2001280 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x153f494c3450>>
19
  2026-08-14 21:14:08,674 INFO MainThread:409188 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 2001280 None
 
 
 
 
 
 
17
  2026-08-14 21:14:08,672 INFO MainThread:409188 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 9, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'waleedglu_low', 'waleed_beta': 10.0, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-waleedglu_low-9L_run', 'per_device_train_batch_size': 512, 'num_train_epochs': 1, 'max_steps': 1000, 'learning_rate': 0.001, 'lr_scheduler_type': 'constant', 'lr_scheduler_kwargs': None, 'warmup_steps': 0, 'optim': 'adamw_torch', 'optim_args': None, 'weight_decay': 0.01, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-waleedglu_low-9L-2.0M-20260814-211407', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 60000, 'eval_delay': 0, 'per_device_eval_batch_size': 512, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 100, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/A-glu-waleedglu_low-9L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
18
  2026-08-14 21:14:08,674 INFO MainThread:409188 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 2001280 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x153f494c3450>>
19
  2026-08-14 21:14:08,674 INFO MainThread:409188 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 2001280 None
20
+ 2026-08-14 21:25:58,657 INFO MainThread:409188 [wandb_run.py:_finish():2383] finishing run deepnevro-deepnevro/research1/i85cngas
21
+ 2026-08-14 21:25:58,657 INFO MainThread:409188 [wandb_run.py:_atexit_cleanup():2588] got exitcode: 0
22
+ 2026-08-14 21:25:58,658 INFO MainThread:409188 [wandb_run.py:_restore():2570] restore
23
+ 2026-08-14 21:25:58,658 INFO MainThread:409188 [wandb_run.py:_restore():2576] restore done
24
+ 2026-08-14 21:25:59,190 INFO MainThread:409188 [wandb_run.py:_footer_sync_info():3993] logging synced files
zain/Activation/wandb/run-20260814_211407-i85cngas/run-i85cngas.wandb CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b0ebd0512cdc3282aa723f19ce33fc677dc5c04ef4430505d970ad61518c4800
3
- size 458752
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c4205d484f8c5c9946f91a69fae62658e7117137decdea8fec4aa2fb4748d2f1
3
+ size 525167
zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug-core.log CHANGED
@@ -68,3 +68,10 @@
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
 
 
 
 
 
 
 
 
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
71
+ {"time":"2026-08-14T21:28:18.727248774Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
72
+ {"time":"2026-08-14T21:28:20.378913364Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
73
+ {"time":"2026-08-14T21:28:20.400345521Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"n6fjpg9o","id":"3(@)"}
74
+ {"time":"2026-08-14T21:28:20.400969576Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"n6fjpg9o","id":"3(@)"}
75
+ {"time":"2026-08-14T21:28:35.344777056Z","level":"INFO","msg":"handleInformInit: received","streamId":"gqskne0x","id":"3(@)"}
76
+ {"time":"2026-08-14T21:28:35.603024157Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"gqskne0x","id":"3(@)"}
77
+ {"time":"2026-08-14T21:28:41.078893683Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"yxbo55z35lse"}
zain/Activation/wandb/run-20260814_212208-n6fjpg9o/files/config.yaml ADDED
@@ -0,0 +1,439 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ _name_or_path:
2
+ value: ""
3
+ _wandb:
4
+ value:
5
+ cli_version: 0.28.1
6
+ e:
7
+ dwqr38wvfx2faq20nlxzk1aeem4hvapm:
8
+ args:
9
+ - --config
10
+ - /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline100l.yaml
11
+ - --variants
12
+ - glu-relu
13
+ - glu-gelu
14
+ - glu-sigmoid
15
+ - glu-waleed10
16
+ - glu-silu-waleed10
17
+ codePath: sweep.py
18
+ codePathLocal: sweep.py
19
+ cpu_count: 112
20
+ cpu_count_logical: 224
21
+ cudaVersion: "12.4"
22
+ disk:
23
+ /:
24
+ total: "1560765693952"
25
+ used: "706493382656"
26
+ email: deepnevro@gmail.com
27
+ executable: /mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python
28
+ git:
29
+ commit: 3fb47c6943d6927eafc39bd399a3d3a520bae74a
30
+ remote: https://github.com/w-ahmad1a10/Activation.git
31
+ gpu: NVIDIA H100 80GB HBM3
32
+ gpu_count: 8
33
+ gpu_nvidia:
34
+ - architecture: Hopper
35
+ cudaCores: 16896
36
+ memoryTotal: "85520809984"
37
+ name: NVIDIA H100 80GB HBM3
38
+ uuid: GPU-39c684a5-fde6-83d7-1663-0859795881ae
39
+ - architecture: Hopper
40
+ cudaCores: 16896
41
+ memoryTotal: "85520809984"
42
+ name: NVIDIA H100 80GB HBM3
43
+ uuid: GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3
44
+ - architecture: Hopper
45
+ cudaCores: 16896
46
+ memoryTotal: "85520809984"
47
+ name: NVIDIA H100 80GB HBM3
48
+ uuid: GPU-132944c4-b689-2b5f-89a4-d730401677ab
49
+ - architecture: Hopper
50
+ cudaCores: 16896
51
+ memoryTotal: "85520809984"
52
+ name: NVIDIA H100 80GB HBM3
53
+ uuid: GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864
54
+ - architecture: Hopper
55
+ cudaCores: 16896
56
+ memoryTotal: "85520809984"
57
+ name: NVIDIA H100 80GB HBM3
58
+ uuid: GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef
59
+ - architecture: Hopper
60
+ cudaCores: 16896
61
+ memoryTotal: "85520809984"
62
+ name: NVIDIA H100 80GB HBM3
63
+ uuid: GPU-bc6c3e3c-9b90-09ca-c034-774961847c54
64
+ - architecture: Hopper
65
+ cudaCores: 16896
66
+ memoryTotal: "85520809984"
67
+ name: NVIDIA H100 80GB HBM3
68
+ uuid: GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9
69
+ - architecture: Hopper
70
+ cudaCores: 16896
71
+ memoryTotal: "85520809984"
72
+ name: NVIDIA H100 80GB HBM3
73
+ uuid: GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea
74
+ host: deeplens-k3s-node1
75
+ memory:
76
+ total: "2164089937920"
77
+ os: Linux-5.15.0-126-generic-x86_64-with-glibc2.35
78
+ program: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py
79
+ python: CPython 3.11.15
80
+ root: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation
81
+ startedAt: "2026-08-14T21:22:08.715735Z"
82
+ writerId: dwqr38wvfx2faq20nlxzk1aeem4hvapm
83
+ m:
84
+ - "1": train/global_step
85
+ "6":
86
+ - 3
87
+ "7": []
88
+ - "2": '*'
89
+ "5": 1
90
+ "6":
91
+ - 1
92
+ "7": []
93
+ python_version: 3.11.15
94
+ t:
95
+ "1":
96
+ - 1
97
+ - 5
98
+ - 11
99
+ - 41
100
+ - 49
101
+ - 51
102
+ - 53
103
+ - 71
104
+ "2":
105
+ - 1
106
+ - 5
107
+ - 11
108
+ - 41
109
+ - 49
110
+ - 51
111
+ - 53
112
+ - 71
113
+ "3":
114
+ - 2
115
+ - 7
116
+ - 13
117
+ - 19
118
+ - 41
119
+ - 61
120
+ - 62
121
+ - 66
122
+ "4": 3.11.15
123
+ "5": 0.28.1
124
+ "6": 5.16.0.dev0
125
+ "9":
126
+ "1": transformers_trainer
127
+ "12": 0.28.1
128
+ "13": linux-x86_64
129
+ accelerator_config:
130
+ value:
131
+ dispatch_batches: null
132
+ even_batches: true
133
+ gradient_accumulation_kwargs: null
134
+ non_blocking: false
135
+ split_batches: false
136
+ use_seedable_sampler: true
137
+ activation:
138
+ value: waleed10
139
+ adam_beta1:
140
+ value: 0.9
141
+ adam_beta2:
142
+ value: 0.999
143
+ adam_epsilon:
144
+ value: 1e-08
145
+ architectures:
146
+ value: null
147
+ attention_bias:
148
+ value: false
149
+ attention_dropout:
150
+ value: 0
151
+ auto_find_batch_size:
152
+ value: false
153
+ average_tokens_across_devices:
154
+ value: true
155
+ batch_eval_metrics:
156
+ value: false
157
+ bf16:
158
+ value: true
159
+ bf16_full_eval:
160
+ value: false
161
+ bos_token_id:
162
+ value: 1
163
+ chunk_size_feed_forward:
164
+ value: 0
165
+ data_seed:
166
+ value: 42
167
+ dataloader_drop_last:
168
+ value: false
169
+ dataloader_in_order:
170
+ value: true
171
+ dataloader_multiprocessing_context:
172
+ value: null
173
+ dataloader_num_workers:
174
+ value: 0
175
+ dataloader_persistent_workers:
176
+ value: false
177
+ dataloader_pin_memory:
178
+ value: true
179
+ dataloader_prefetch_factor:
180
+ value: null
181
+ ddp_backend:
182
+ value: null
183
+ ddp_broadcast_buffers:
184
+ value: null
185
+ ddp_bucket_cap_mb:
186
+ value: null
187
+ ddp_find_unused_parameters:
188
+ value: null
189
+ ddp_static_graph:
190
+ value: null
191
+ ddp_timeout:
192
+ value: 1800
193
+ debug:
194
+ value: []
195
+ deepspeed:
196
+ value: null
197
+ disable_tqdm:
198
+ value: false
199
+ do_eval:
200
+ value: true
201
+ do_predict:
202
+ value: false
203
+ do_train:
204
+ value: false
205
+ dtype:
206
+ value: null
207
+ enable_jit_checkpoint:
208
+ value: false
209
+ eos_token_id:
210
+ value: 2
211
+ eval_accumulation_steps:
212
+ value: null
213
+ eval_delay:
214
+ value: 0
215
+ eval_do_concat_batches:
216
+ value: true
217
+ eval_on_start:
218
+ value: false
219
+ eval_steps:
220
+ value: 2498
221
+ eval_strategy:
222
+ value: steps
223
+ eval_use_gather_object:
224
+ value: false
225
+ fp16:
226
+ value: false
227
+ fp16_full_eval:
228
+ value: false
229
+ fsdp:
230
+ value: null
231
+ fsdp_config:
232
+ value: null
233
+ full_determinism:
234
+ value: false
235
+ gradient_accumulation_steps:
236
+ value: 1
237
+ gradient_checkpointing:
238
+ value: false
239
+ gradient_checkpointing_kwargs:
240
+ value: null
241
+ greater_is_better:
242
+ value: null
243
+ head_dim:
244
+ value: 32
245
+ hidden_act:
246
+ value: silu
247
+ hidden_size:
248
+ value: 128
249
+ hub_always_push:
250
+ value: false
251
+ hub_model_id:
252
+ value: w-ahmad/6L-glu-waleed10-100L
253
+ hub_private_repo:
254
+ value: null
255
+ hub_revision:
256
+ value: null
257
+ hub_strategy:
258
+ value: every_save
259
+ hub_token:
260
+ value: <HUB_TOKEN>
261
+ id2label:
262
+ value:
263
+ "0": LABEL_0
264
+ "1": LABEL_1
265
+ ignore_data_skip:
266
+ value: false
267
+ include_for_metrics:
268
+ value: []
269
+ include_num_input_tokens_seen:
270
+ value: "no"
271
+ initializer_range:
272
+ value: 0.02
273
+ intermediate_size:
274
+ value: 256
275
+ is_encoder_decoder:
276
+ value: false
277
+ label_names:
278
+ value: null
279
+ label_smoothing_factor:
280
+ value: 0
281
+ label2id:
282
+ value:
283
+ LABEL_0: 0
284
+ LABEL_1: 1
285
+ learning_rate:
286
+ value: 9e-05
287
+ length_column_name:
288
+ value: length
289
+ liger_kernel_config:
290
+ value: null
291
+ load_best_model_at_end:
292
+ value: false
293
+ local_rank:
294
+ value: -1
295
+ log_level:
296
+ value: passive
297
+ log_level_replica:
298
+ value: warning
299
+ log_on_each_node:
300
+ value: true
301
+ logging_first_step:
302
+ value: false
303
+ logging_nan_inf_filter:
304
+ value: true
305
+ logging_steps:
306
+ value: 20
307
+ logging_strategy:
308
+ value: steps
309
+ lr_scheduler_kwargs:
310
+ value: null
311
+ lr_scheduler_type:
312
+ value: constant_with_warmup
313
+ max_grad_norm:
314
+ value: 1
315
+ max_position_embeddings:
316
+ value: 512
317
+ max_steps:
318
+ value: 3500
319
+ metric_for_best_model:
320
+ value: null
321
+ mlp_bias:
322
+ value: false
323
+ mlp_type:
324
+ value: glu
325
+ model/num_parameters:
326
+ value: 16934016
327
+ model_type:
328
+ value: tiny_llama
329
+ neftune_noise_alpha:
330
+ value: null
331
+ num_attention_heads:
332
+ value: 4
333
+ num_hidden_layers:
334
+ value: 100
335
+ num_key_value_heads:
336
+ value: 4
337
+ num_train_epochs:
338
+ value: 1
339
+ optim:
340
+ value: adamw_torch_fused
341
+ optim_args:
342
+ value: null
343
+ optim_target_modules:
344
+ value: null
345
+ output_attentions:
346
+ value: false
347
+ output_dir:
348
+ value: out/glu-waleed10-100L_trash_run
349
+ output_hidden_states:
350
+ value: false
351
+ pad_token_id:
352
+ value: 0
353
+ parallelism_config:
354
+ value: null
355
+ per_device_eval_batch_size:
356
+ value: 1024
357
+ per_device_train_batch_size:
358
+ value: 64
359
+ prediction_loss_only:
360
+ value: false
361
+ pretraining_tp:
362
+ value: 1
363
+ problem_type:
364
+ value: null
365
+ project:
366
+ value: huggingface
367
+ push_to_hub:
368
+ value: false
369
+ remove_unused_columns:
370
+ value: false
371
+ report_to:
372
+ value:
373
+ - wandb
374
+ restore_callback_states_from_checkpoint:
375
+ value: false
376
+ resume_from_checkpoint:
377
+ value: null
378
+ return_dict:
379
+ value: true
380
+ rms_norm_eps:
381
+ value: 1e-06
382
+ rope_parameters:
383
+ value:
384
+ rope_theta: 10000
385
+ rope_type: default
386
+ run_name:
387
+ value: LM-glu-waleed10-100L-16.9M-20260814-212207
388
+ save_on_each_node:
389
+ value: false
390
+ save_only_model:
391
+ value: false
392
+ save_steps:
393
+ value: 50
394
+ save_strategy:
395
+ value: steps
396
+ save_total_limit:
397
+ value: null
398
+ seed:
399
+ value: 42
400
+ skip_memory_metrics:
401
+ value: true
402
+ tf32:
403
+ value: null
404
+ tie_word_embeddings:
405
+ value: true
406
+ tokenizer_name:
407
+ value: w-ahmad/tiny-stories-tokenizer
408
+ torch_compile:
409
+ value: false
410
+ torch_compile_backend:
411
+ value: null
412
+ torch_compile_mode:
413
+ value: null
414
+ torch_empty_cache_steps:
415
+ value: null
416
+ trackio_bucket_id:
417
+ value: null
418
+ trackio_space_id:
419
+ value: null
420
+ trackio_static_space_id:
421
+ value: null
422
+ train_sampling_strategy:
423
+ value: random
424
+ transformers_version:
425
+ value: 5.16.0.dev0
426
+ use_cache:
427
+ value: false
428
+ use_cpu:
429
+ value: false
430
+ use_liger_kernel:
431
+ value: false
432
+ vocab_size:
433
+ value: 4096
434
+ waleed_beta:
435
+ value: 4
436
+ warmup_steps:
437
+ value: 50
438
+ weight_decay:
439
+ value: 0
zain/Activation/wandb/run-20260814_212208-n6fjpg9o/files/output.log CHANGED
@@ -39,6 +39,73 @@ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 18.
39
  - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
40
  - If you are not the owner of the model architecture class, please contact the model code owner to update it.
41
  Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 14.39it/s]
42
- 84%|████████ | 2955/3500 [02:49<03:39, 2.48it/s], ?it/s]
43
  {'loss': '7.945', 'grad_norm': '2.851e+06', 'learning_rate': '9e-05', 'epoch': '0.1968', 'train/total_time_seconds': '133.2', 'train/time_per_step_avg': '0.3165', 'train/epoch_time_elapsed': '156.7', 'train/estimated_remaining_minutes': '0.4411', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.3', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001747', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.6', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001678', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3906', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3164', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3906', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.707', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4447', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.009949', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.539', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.156', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.719', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.156', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '11.88', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4448', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.006439', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.539', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.438', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.375', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.438', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '10.81', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '6.545e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '24.88', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '20', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '101', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.6769', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '1.109', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '101', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '99.89', 'train/tensor_act_model_layers_0_mlp/norm': '7920', 'train/tensor_act_model_layers_0_mlp/mean': '3.859', 'train/tensor_act_model_layers_0_mlp/std': '0.3281', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '1.078', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '2.922', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '7926', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '3.859', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.3418', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.312', 'train/tensor_act_model_lay
44
  {'loss': '7.946', 'grad_norm': '2.064e+06', 'learning_rate': '9e-05', 'epoch': '0.1982', 'train/total_time_seconds': '139.5', 'train/time_per_step_avg': '0.3138', 'train/epoch_time_elapsed': '164', 'train/estimated_remaining_minutes': '0.443'}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
39
  - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
40
  - If you are not the owner of the model architecture class, please contact the model code owner to update it.
41
  Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 14.39it/s]
42
+ 86%|████████ | 3000/3500 [03:05<02:55, 2.85it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
43
  {'loss': '7.945', 'grad_norm': '2.851e+06', 'learning_rate': '9e-05', 'epoch': '0.1968', 'train/total_time_seconds': '133.2', 'train/time_per_step_avg': '0.3165', 'train/epoch_time_elapsed': '156.7', 'train/estimated_remaining_minutes': '0.4411', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.3', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001747', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.6', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001678', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3906', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3164', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3906', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.707', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4447', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.009949', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.539', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.156', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.719', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.156', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '11.88', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4448', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.006439', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.539', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.438', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.375', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.438', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '10.81', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '6.545e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '24.88', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '20', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '101', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.6769', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '1.109', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '101', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '99.89', 'train/tensor_act_model_layers_0_mlp/norm': '7920', 'train/tensor_act_model_layers_0_mlp/mean': '3.859', 'train/tensor_act_model_layers_0_mlp/std': '0.3281', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '1.078', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '2.922', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '7926', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '3.859', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.3418', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.312', 'train/tensor_act_model_lay
44
  {'loss': '7.946', 'grad_norm': '2.064e+06', 'learning_rate': '9e-05', 'epoch': '0.1982', 'train/total_time_seconds': '139.5', 'train/time_per_step_avg': '0.3138', 'train/epoch_time_elapsed': '164', 'train/estimated_remaining_minutes': '0.443'}
45
+ {'loss': '7.938', 'grad_norm': '1.499e+06', 'learning_rate': '9e-05', 'epoch': '0.1995', 'train/total_time_seconds': '146', 'train/time_per_step_avg': '0.3136', 'train/epoch_time_elapsed': '171.6', 'train/estimated_remaining_minutes': '0.4438', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.3', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001625', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.7', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001595', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3906', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3418', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3906', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.7324', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4585', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.01001', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.586', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.312', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.719', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.312', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.03', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4587', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.005768', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.586', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.75', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.469', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.75', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.22', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '7.202e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '28.38', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '20.75', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '107', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.8107', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '1.93', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '107', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '105.1', 'train/tensor_act_model_layers_0_mlp/norm': '8099', 'train/tensor_act_model_layers_0_mlp/mean': '3.953', 'train/tensor_act_model_layers_0_mlp/std': '0.1328', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '1.789', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '2.211', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8104', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '3.953', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.1621', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.375', 'train/tensor_act_model_layer
46
+ {'loss': '7.943', 'grad_norm': '1.057e+06', 'learning_rate': '9e-05', 'epoch': '0.2009', 'train/total_time_seconds': '152', 'train/time_per_step_avg': '0.3155', 'train/epoch_time_elapsed': '178.7', 'train/estimated_remaining_minutes': '0.442'}
47
+ {'loss': '7.944', 'grad_norm': '8.069e+05', 'learning_rate': '9e-05', 'epoch': '0.2022', 'train/total_time_seconds': '158', 'train/time_per_step_avg': '0.3142', 'train/epoch_time_elapsed': '185.7', 'train/estimated_remaining_minutes': '0.4388'}
48
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
49
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
50
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
51
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 15.48it/s]
52
+ 89%|████████▊ | 3100/3500 [03:41<01:56, 3.44it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
53
+ {'loss': '7.943', 'grad_norm': '6.226e+05', 'learning_rate': '9e-05', 'epoch': '0.2036', 'train/total_time_seconds': '164.9', 'train/time_per_step_avg': '0.3162', 'train/epoch_time_elapsed': '193.9', 'train/estimated_remaining_minutes': '0.4367', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.5', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001663', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.7', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.00164', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3496', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3066', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3496', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.6562', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4633', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.009521', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.602', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.531', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.75', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.531', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.28', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4635', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.004761', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.602', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.5', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.344', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.5', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '10.84', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '7.552e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '30.25', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '21', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '108', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.8997', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '2.891', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '108', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '105.1', 'train/tensor_act_model_layers_0_mlp/norm': '8153', 'train/tensor_act_model_layers_0_mlp/mean': '3.984', 'train/tensor_act_model_layers_0_mlp/std': '0.05884', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '2.469', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '1.531', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8159', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '3.984', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.1094', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.312', 'train/tensor_act_model_layers_
54
+ {'loss': '7.948', 'grad_norm': '4.669e+05', 'learning_rate': '9e-05', 'epoch': '0.2049', 'train/total_time_seconds': '170.6', 'train/time_per_step_avg': '0.3105', 'train/epoch_time_elapsed': '200.7', 'train/estimated_remaining_minutes': '0.4302'}
55
+ {'loss': '7.942', 'grad_norm': '3.645e+05', 'learning_rate': '9e-05', 'epoch': '0.2063', 'train/total_time_seconds': '177.6', 'train/time_per_step_avg': '0.316', 'train/epoch_time_elapsed': '208.8', 'train/estimated_remaining_minutes': '0.4256', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.2', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001671', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.5', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.00161', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3301', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3281', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3301', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.6582', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4695', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.009033', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.625', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.531', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.844', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.531', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.38', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4694', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.007019', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.406', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.03', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '7.853e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '32', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '21.12', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '114.5', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.9573', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '4.219', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '114.5', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '110.3', 'train/tensor_act_model_layers_0_mlp/norm': '8175', 'train/tensor_act_model_layers_0_mlp/mean': '3.984', 'train/tensor_act_model_layers_0_mlp/std': '0.02795', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '3.141', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '0.8594', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8180', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '4', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.09619', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.312', 'train/tensor_act_model_la
56
+ {'loss': '7.942', 'grad_norm': '3.052e+05', 'learning_rate': '9e-05', 'epoch': '0.2076', 'train/total_time_seconds': '183', 'train/time_per_step_avg': '0.3101', 'train/epoch_time_elapsed': '215.2', 'train/estimated_remaining_minutes': '0.4158'}
57
+ {'loss': '7.946', 'grad_norm': '2.437e+05', 'learning_rate': '9e-05', 'epoch': '0.209', 'train/total_time_seconds': '188', 'train/time_per_step_avg': '0.3008', 'train/epoch_time_elapsed': '221.3', 'train/estimated_remaining_minutes': '0.4044'}
58
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
59
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
60
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
61
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 18.72it/s]
62
+ 91%|█████████▏| 3200/3500 [04:10<01:21, 3.69it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
63
+ {'loss': '7.948', 'grad_norm': '1.976e+05', 'learning_rate': '9e-05', 'epoch': '0.2103', 'train/total_time_seconds': '193.7', 'train/time_per_step_avg': '0.2887', 'train/epoch_time_elapsed': '228.3', 'train/estimated_remaining_minutes': '0.3933', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.4', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001686', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.6', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001694', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3262', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3262', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3203', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.6465', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4683', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.008606', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.438', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.875', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.438', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.31', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4678', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.005646', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.656', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.344', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.656', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '7.929e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '32.5', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '21', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '116', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.9792', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '5.5', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '116', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '110.5', 'train/tensor_act_model_layers_0_mlp/norm': '8181', 'train/tensor_act_model_layers_0_mlp/mean': '4', 'train/tensor_act_model_layers_0_mlp/std': '0.01721', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '3.516', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '0.4844', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8187', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '4', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.09375', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.312', 'train/tensor_act_model_layers_0_resi
64
+ {'loss': '7.943', 'grad_norm': '1.649e+05', 'learning_rate': '9e-05', 'epoch': '0.2117', 'train/total_time_seconds': '198.4', 'train/time_per_step_avg': '0.278', 'train/epoch_time_elapsed': '234', 'train/estimated_remaining_minutes': '0.3791'}
65
+ {'loss': '7.944', 'grad_norm': '1.505e+05', 'learning_rate': '9e-05', 'epoch': '0.213', 'train/total_time_seconds': '203.3', 'train/time_per_step_avg': '0.2569', 'train/epoch_time_elapsed': '240', 'train/estimated_remaining_minutes': '0.3645', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.3', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001633', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.5', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001633', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3418', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3418', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3301', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.6719', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4703', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.009766', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.625', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.344', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.719', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.344', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.06', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4697', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.006012', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.625', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.406', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.03', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '8.064e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '33.25', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '21', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '116.5', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.9919', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '6.625', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '116.5', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '109.9', 'train/tensor_act_model_layers_0_mlp/norm': '8186', 'train/tensor_act_model_layers_0_mlp/mean': '4', 'train/tensor_act_model_layers_0_mlp/std': '0.01105', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '3.719', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '0.2812', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8191', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '4', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.09277', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.344', 'train/tensor_act_model_layers
66
+ {'loss': '7.941', 'grad_norm': '1.249e+05', 'learning_rate': '9e-05', 'epoch': '0.2144', 'train/total_time_seconds': '207.7', 'train/time_per_step_avg': '0.2475', 'train/epoch_time_elapsed': '245.5', 'train/estimated_remaining_minutes': '0.3484'}
67
+ {'loss': '7.943', 'grad_norm': '1.162e+05', 'learning_rate': '9e-05', 'epoch': '0.2157', 'train/total_time_seconds': '212.2', 'train/time_per_step_avg': '0.2413', 'train/epoch_time_elapsed': '251', 'train/estimated_remaining_minutes': '0.3315'}
68
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
69
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
70
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
71
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 17.05it/s]
72
+ 94%|█████████▍| 3300/3500 [04:39<00:54, 3.69it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
73
+ {'loss': '7.946', 'grad_norm': '9.216e+04', 'learning_rate': '9e-05', 'epoch': '0.2171', 'train/total_time_seconds': '217', 'train/time_per_step_avg': '0.2331', 'train/epoch_time_elapsed': '257.1', 'train/estimated_remaining_minutes': '0.3146', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.5', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001595', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.8', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001617', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3418', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3418', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3281', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.6699', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4696', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.009766', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.625', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.469', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.875', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.469', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.34', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4690', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.006653', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.594', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.5', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.594', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.09', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '8.094e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '33.5', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '20.88', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '114.5', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.9958', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '7.406', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '114.5', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '107.1', 'train/tensor_act_model_layers_0_mlp/norm': '8188', 'train/tensor_act_model_layers_0_mlp/mean': '4', 'train/tensor_act_model_layers_0_mlp/std': '0.007935', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '3.812', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '0.1875', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8193', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '4', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.09277', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.312', 'train/tensor_act_model_laye
74
+ {'loss': '7.944', 'grad_norm': '8.96e+04', 'learning_rate': '9e-05', 'epoch': '0.2184', 'train/total_time_seconds': '221.5', 'train/time_per_step_avg': '0.2309', 'train/epoch_time_elapsed': '262.9', 'train/estimated_remaining_minutes': '0.2962'}
75
+ {'loss': '7.945', 'grad_norm': '8.09e+04', 'learning_rate': '9e-05', 'epoch': '0.2198', 'train/total_time_seconds': '226.4', 'train/time_per_step_avg': '0.2313', 'train/epoch_time_elapsed': '269', 'train/estimated_remaining_minutes': '0.2778', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.5', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001648', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.8', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.00164', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3262', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3242', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3262', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.6504', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4682', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.00766', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.469', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-6.031', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.469', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.5', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4675', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.007874', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.688', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.344', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.688', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.03', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '8.103e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '33.75', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '20.88', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '110.5', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.9976', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '8', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '110.5', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '102.5', 'train/tensor_act_model_layers_0_mlp/norm': '8189', 'train/tensor_act_model_layers_0_mlp/mean': '4', 'train/tensor_act_model_layers_0_mlp/std': '0.006287', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '3.859', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '0.1406', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8194', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '4', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.312', 'train/tensor_act_model_layers_0_r
76
+ {'loss': '7.945', 'grad_norm': '7.117e+04', 'learning_rate': '9e-05', 'epoch': '0.2211', 'train/total_time_seconds': '230.8', 'train/time_per_step_avg': '0.2309', 'train/epoch_time_elapsed': '274.5', 'train/estimated_remaining_minutes': '0.258'}
77
+ {'loss': '7.945', 'grad_norm': '6.605e+04', 'learning_rate': '9e-05', 'epoch': '0.2224', 'train/total_time_seconds': '235.3', 'train/time_per_step_avg': '0.2309', 'train/epoch_time_elapsed': '279.9', 'train/estimated_remaining_minutes': '0.2376'}
78
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
79
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
80
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
81
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 18.23it/s]
82
+ 97%|█████████▋| 3400/3500 [05:08<00:27, 3.68it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
83
+ {'loss': '7.941', 'grad_norm': '5.555e+04', 'learning_rate': '9e-05', 'epoch': '0.2238', 'train/total_time_seconds': '240.1', 'train/time_per_step_avg': '0.2306', 'train/epoch_time_elapsed': '286.1', 'train/estimated_remaining_minutes': '0.217', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.3', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001633', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.5', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001617', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3223', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3223', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3203', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.6426', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4695', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.008484', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.219', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.906', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.219', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.12', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4687', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.006805', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.344', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '10.97', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '8.162e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '34', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '20.75', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '111.5', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.9984', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '8.062', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '111.5', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '103.4', 'train/tensor_act_model_layers_0_mlp/norm': '8190', 'train/tensor_act_model_layers_0_mlp/mean': '4', 'train/tensor_act_model_layers_0_mlp/std': '0.005157', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '3.859', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '0.1406', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8195', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '4', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.312', 'train/tensor_act_model_laye
84
+ {'loss': '7.943', 'grad_norm': '5.094e+04', 'learning_rate': '9e-05', 'epoch': '0.2251', 'train/total_time_seconds': '244.5', 'train/time_per_step_avg': '0.2306', 'train/epoch_time_elapsed': '291.5', 'train/estimated_remaining_minutes': '0.1952'}
85
+ {'loss': '7.945', 'grad_norm': '4.506e+04', 'learning_rate': '9e-05', 'epoch': '0.2265', 'train/total_time_seconds': '249.4', 'train/time_per_step_avg': '0.2299', 'train/epoch_time_elapsed': '297.5', 'train/estimated_remaining_minutes': '0.1732', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.1', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001587', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.4', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001564', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3906', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3281', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3906', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.7188', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4705', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.008057', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.625', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.375', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.812', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.375', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.19', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4697', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.008301', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.625', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.562', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.19', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '8.235e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '34.5', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '20.75', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '112', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.9994', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '8.75', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '112', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '103.2', 'train/tensor_act_model_layers_0_mlp/norm': '8190', 'train/tensor_act_model_layers_0_mlp/mean': '4', 'train/tensor_act_model_layers_0_mlp/std': '0.004181', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '3.906', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '0.09375', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8195', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '4', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.375', 'train/tensor_act_model_layer
86
+ {'loss': '7.945', 'grad_norm': '4.147e+04', 'learning_rate': '9e-05', 'epoch': '0.2278', 'train/total_time_seconds': '253.9', 'train/time_per_step_avg': '0.2303', 'train/epoch_time_elapsed': '303', 'train/estimated_remaining_minutes': '0.1502'}
87
+ {'loss': '7.947', 'grad_norm': '3.61e+04', 'learning_rate': '9e-05', 'epoch': '0.2292', 'train/total_time_seconds': '258.3', 'train/time_per_step_avg': '0.2302', 'train/epoch_time_elapsed': '308.4', 'train/estimated_remaining_minutes': '0.1266'}
88
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
89
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
90
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
91
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 15.84it/s]
92
+ 100%|██████████| 3500/3500 [05:52<00:00, 3.66i[transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
93
+ {'loss': '7.943', 'grad_norm': '3.098e+04', 'learning_rate': '9e-05', 'epoch': '0.2305', 'train/total_time_seconds': '263.1', 'train/time_per_step_avg': '0.2301', 'train/epoch_time_elapsed': '314.6', 'train/estimated_remaining_minutes': '0.1026', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.3', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001648', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.6', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001602', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.3125', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3125', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3105', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.623', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4703', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.008362', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.625', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.469', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.938', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.469', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.41', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4690', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.00705', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.812', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.812', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.44', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '8.271e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '34.5', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '20.88', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '112', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0.9999', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '9.375', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '112', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '102.6', 'train/tensor_act_model_layers_0_mlp/norm': '8191', 'train/tensor_act_model_layers_0_mlp/mean': '4', 'train/tensor_act_model_layers_0_mlp/std': '0.003555', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '3.922', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '0.07812', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8196', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '4', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.312', 'train/tensor_act_model_layer
94
+ {'loss': '7.943', 'grad_norm': '2.598e+04', 'learning_rate': '9e-05', 'epoch': '0.2319', 'train/total_time_seconds': '267.6', 'train/time_per_step_avg': '0.2306', 'train/epoch_time_elapsed': '320.1', 'train/estimated_remaining_minutes': '0.07779'}
95
+ {'loss': '7.947', 'grad_norm': '2.125e+04', 'learning_rate': '9e-05', 'epoch': '0.2332', 'train/total_time_seconds': '272.5', 'train/time_per_step_avg': '0.2308', 'train/epoch_time_elapsed': '326.1', 'train/estimated_remaining_minutes': '0.0525', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.5', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001755', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.09131', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2715', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5469', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '188.8', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001747', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.373', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.3418', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.373', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.7148', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '4689', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.007751', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '6.25', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.844', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '6.25', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '12.09', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '4675', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.008545', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '1.617', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.5', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.625', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.12', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '8.314e+04', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '34.75', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '21', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '112', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '1', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '8.188', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '112', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '103.8', 'train/tensor_act_model_layers_0_mlp/norm': '8191', 'train/tensor_act_model_layers_0_mlp/mean': '4', 'train/tensor_act_model_layers_0_mlp/std': '0.002655', 'train/tensor_act_model_layers_0_mlp/max_abs': '4', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '3.875', 'train/tensor_act_model_layers_0_mlp/max': '4', 'train/tensor_act_model_layers_0_mlp/range': '0.125', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '8196', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '4', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.09229', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.375', 'train/tensor_act_model_layers_0_residual_
96
+ {'loss': '7.947', 'grad_norm': '1.933e+04', 'learning_rate': '9e-05', 'epoch': '0.2346', 'train/total_time_seconds': '277', 'train/time_per_step_avg': '0.2314', 'train/epoch_time_elapsed': '331.7', 'train/estimated_remaining_minutes': '0.02653'}
97
+ {'loss': '7.949', 'grad_norm': '1.389e+04', 'learning_rate': '9e-05', 'epoch': '0.2359', 'train/total_time_seconds': '281.5', 'train/time_per_step_avg': '0.232', 'train/epoch_time_elapsed': '337.2', 'train/estimated_remaining_minutes': '0'}
98
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
99
+ {'eval_loss': '7.945', 'eval_runtime': '15.6', 'eval_samples_per_second': '610.9', 'eval_steps_per_second': '0.641', 'epoch': '0.2359', 'train/total_time_seconds': '281.5', 'train/time_per_step_avg': '0.232', 'train/epoch_time_elapsed': '352.8', 'train/estimated_remaining_minutes': '0'}
100
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
101
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
102
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 14.20it/s]
103
+ 100%|██████████| 3500/3500 [05:53<00:00, 9.91it/s], ?it/s]
104
+ {'train_runtime': '353.9', 'train_samples_per_second': '632.9', 'train_steps_per_second': '9.889', 'train_loss': '2.171', 'epoch': '0.2359', 'train/total_time_seconds': '281.5', 'train/time_per_step_avg': '0.232', 'train/epoch_time_elapsed': '353', 'train/estimated_remaining_minutes': '0'}
105
+ 100%|██████████| 10/10 [00:13<00:00, 1.40s/it]
106
+ [transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
107
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
108
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
109
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
110
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 15.65it/s]
111
+ >>> FINISHED glu-waleed10-100L successfully
zain/Activation/wandb/run-20260814_212208-n6fjpg9o/files/wandb-summary.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/wandb/run-20260814_212208-n6fjpg9o/logs/debug-core.log CHANGED
@@ -68,3 +68,10 @@
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
 
 
 
 
 
 
 
 
68
  {"time":"2026-08-14T21:22:08.718181031Z","level":"INFO","msg":"handleInformInit: received","streamId":"n6fjpg9o","id":"3(@)"}
69
  {"time":"2026-08-14T21:22:08.976795469Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"n6fjpg9o","id":"3(@)"}
70
  {"time":"2026-08-14T21:22:14.472169125Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
71
+ {"time":"2026-08-14T21:28:18.727248774Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
72
+ {"time":"2026-08-14T21:28:20.378913364Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"qlc6t75fdq0u"}
73
+ {"time":"2026-08-14T21:28:20.400345521Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"n6fjpg9o","id":"3(@)"}
74
+ {"time":"2026-08-14T21:28:20.400969576Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"n6fjpg9o","id":"3(@)"}
75
+ {"time":"2026-08-14T21:28:35.344777056Z","level":"INFO","msg":"handleInformInit: received","streamId":"gqskne0x","id":"3(@)"}
76
+ {"time":"2026-08-14T21:28:35.603024157Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"gqskne0x","id":"3(@)"}
77
+ {"time":"2026-08-14T21:28:41.078893683Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"yxbo55z35lse"}
zain/Activation/wandb/run-20260814_212208-n6fjpg9o/logs/debug-internal.log CHANGED
@@ -37,3 +37,37 @@
37
  {"time":"2026-08-14T21:24:40.427030871Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
38
  {"time":"2026-08-14T21:24:54.460542104Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":20,"history_lines":2,"events_offset":19,"events_lines":2,"console_offset":35,"console_lines":9}
39
  {"time":"2026-08-14T21:24:55.385800453Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
37
  {"time":"2026-08-14T21:24:40.427030871Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
38
  {"time":"2026-08-14T21:24:54.460542104Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":20,"history_lines":2,"events_offset":19,"events_lines":2,"console_offset":35,"console_lines":9}
39
  {"time":"2026-08-14T21:24:55.385800453Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
40
+ {"time":"2026-08-14T21:25:09.459223532Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":22,"history_lines":2,"events_offset":21,"events_lines":2,"console_offset":41,"console_lines":1}
41
+ {"time":"2026-08-14T21:25:10.338668442Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
42
+ {"time":"2026-08-14T21:25:24.454676952Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":24,"history_lines":2,"events_offset":23,"events_lines":2,"console_offset":41,"console_lines":1}
43
+ {"time":"2026-08-14T21:25:25.245490507Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
44
+ {"time":"2026-08-14T21:25:39.467654857Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":26,"history_lines":2,"events_offset":25,"events_lines":2,"console_offset":44,"console_lines":11}
45
+ {"time":"2026-08-14T21:25:40.389907102Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
46
+ {"time":"2026-08-14T21:25:54.463154808Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":28,"history_lines":2,"events_offset":27,"events_lines":2,"console_offset":51,"console_lines":1}
47
+ {"time":"2026-08-14T21:25:55.24970084Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
48
+ {"time":"2026-08-14T21:26:09.464095349Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":30,"history_lines":2,"events_offset":29,"events_lines":2,"console_offset":55,"console_lines":9}
49
+ {"time":"2026-08-14T21:26:10.391736659Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
50
+ {"time":"2026-08-14T21:26:24.458991962Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":32,"history_lines":3,"events_offset":31,"events_lines":2,"console_offset":61,"console_lines":1}
51
+ {"time":"2026-08-14T21:26:25.382996244Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
52
+ {"time":"2026-08-14T21:26:39.461578547Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":35,"history_lines":3,"events_offset":33,"events_lines":2,"console_offset":64,"console_lines":11}
53
+ {"time":"2026-08-14T21:26:40.376873392Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
54
+ {"time":"2026-08-14T21:26:54.461092479Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":38,"history_lines":2,"events_offset":35,"events_lines":2,"console_offset":71,"console_lines":1}
55
+ {"time":"2026-08-14T21:26:55.499948157Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
56
+ {"time":"2026-08-14T21:27:09.464018745Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":40,"history_lines":3,"events_offset":37,"events_lines":2,"console_offset":75,"console_lines":10}
57
+ {"time":"2026-08-14T21:27:10.348585635Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
58
+ {"time":"2026-08-14T21:27:24.46119055Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":43,"history_lines":3,"events_offset":39,"events_lines":2,"console_offset":81,"console_lines":1}
59
+ {"time":"2026-08-14T21:27:25.337127716Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
60
+ {"time":"2026-08-14T21:27:39.459568913Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":46,"history_lines":2,"events_offset":41,"events_lines":2,"console_offset":85,"console_lines":10}
61
+ {"time":"2026-08-14T21:27:40.420961456Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
62
+ {"time":"2026-08-14T21:27:54.460221415Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":48,"history_lines":2,"events_offset":43,"events_lines":2,"console_offset":91,"console_lines":1}
63
+ {"time":"2026-08-14T21:27:55.378108654Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
64
+ {"time":"2026-08-14T21:28:09.454435714Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":50,"history_lines":2,"events_offset":45,"events_lines":2,"console_offset":91,"console_lines":1}
65
+ {"time":"2026-08-14T21:28:10.354369244Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
66
+ {"time":"2026-08-14T21:28:19.516181311Z","level":"INFO","msg":"fileTransfer: Close: file transfer manager closed"}
67
+ {"time":"2026-08-14T21:28:19.529178819Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":52,"history_lines":1,"events_offset":47,"events_lines":1,"console_offset":95,"console_lines":16,"uploaded_len":3,"complete":true,"exit_code":0}
68
+ {"time":"2026-08-14T21:28:20.359553197Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
69
+ {"time":"2026-08-14T21:28:20.360958219Z","level":"INFO","msg":"handler: operation stats","stats":{}}
70
+ {"time":"2026-08-14T21:28:20.40038758Z","level":"INFO","msg":"stream: finishing up"}
71
+ {"time":"2026-08-14T21:28:20.400431303Z","level":"INFO","msg":"handler: closed"}
72
+ {"time":"2026-08-14T21:28:20.400559672Z","level":"INFO","msg":"sender: closed"}
73
+ {"time":"2026-08-14T21:28:20.400565215Z","level":"INFO","msg":"stream: all finished"}
zain/Activation/wandb/run-20260814_212208-n6fjpg9o/logs/debug.log CHANGED
@@ -18,3 +18,8 @@ config: {'_wandb': {}}
18
  2026-08-14 21:22:09,429 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 100, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'waleed10', 'waleed_beta': 4, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-waleed10-100L_trash_run', 'per_device_train_batch_size': 64, 'num_train_epochs': 1, 'max_steps': 3500, 'learning_rate': 9e-05, 'lr_scheduler_type': 'constant_with_warmup', 'lr_scheduler_kwargs': None, 'warmup_steps': 50, 'optim': 'adamw_torch_fused', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-waleed10-100L-16.9M-20260814-212207', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 2498, 'eval_delay': 0, 'per_device_eval_batch_size': 1024, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 50, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/6L-glu-waleed10-100L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
19
  2026-08-14 21:22:09,434 INFO MainThread:936813 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 16934016 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x14ee39bf4050>>
20
  2026-08-14 21:22:09,434 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 16934016 None
 
 
 
 
 
 
18
  2026-08-14 21:22:09,429 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 100, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'waleed10', 'waleed_beta': 4, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-waleed10-100L_trash_run', 'per_device_train_batch_size': 64, 'num_train_epochs': 1, 'max_steps': 3500, 'learning_rate': 9e-05, 'lr_scheduler_type': 'constant_with_warmup', 'lr_scheduler_kwargs': None, 'warmup_steps': 50, 'optim': 'adamw_torch_fused', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-waleed10-100L-16.9M-20260814-212207', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 2498, 'eval_delay': 0, 'per_device_eval_batch_size': 1024, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 50, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/6L-glu-waleed10-100L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
19
  2026-08-14 21:22:09,434 INFO MainThread:936813 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 16934016 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x14ee39bf4050>>
20
  2026-08-14 21:22:09,434 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 16934016 None
21
+ 2026-08-14 21:28:18,726 INFO MainThread:936813 [wandb_run.py:_finish():2383] finishing run deepnevro-deepnevro/research7/n6fjpg9o
22
+ 2026-08-14 21:28:18,726 INFO MainThread:936813 [wandb_run.py:_atexit_cleanup():2588] got exitcode: 0
23
+ 2026-08-14 21:28:18,727 INFO MainThread:936813 [wandb_run.py:_restore():2570] restore
24
+ 2026-08-14 21:28:18,727 INFO MainThread:936813 [wandb_run.py:_restore():2576] restore done
25
+ 2026-08-14 21:28:20,399 INFO MainThread:936813 [wandb_run.py:_footer_sync_info():3993] logging synced files
zain/Activation/wandb/run-20260814_212208-n6fjpg9o/run-n6fjpg9o.wandb CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e0184c598b27cc4154a7f934240743bb9d6d7505a18ca9a86ea5a3eeebfdaf07
3
- size 22315008
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:270aeec28f07f1e18ac8153551f79ad41dae1453006422476b3eba2307f8afbc
3
+ size 51292143
zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/config.yaml ADDED
@@ -0,0 +1,438 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ _name_or_path:
2
+ value: ""
3
+ _wandb:
4
+ value:
5
+ cli_version: 0.28.1
6
+ e:
7
+ yu21vcw1fqgtt12osjsu76tw34s21eqd:
8
+ args:
9
+ - --config
10
+ - /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline.yaml
11
+ - --variants
12
+ - glu-waleed10
13
+ - glu-silu-waleed10
14
+ - mlp-waleed10
15
+ - mlp-silu-waleed10
16
+ - glu-waleed
17
+ - glu-situglu_low
18
+ - glu-waleedglu_low
19
+ codePath: sweep.py
20
+ codePathLocal: sweep.py
21
+ cpu_count: 112
22
+ cpu_count_logical: 224
23
+ cudaVersion: "12.4"
24
+ disk:
25
+ /:
26
+ total: "1560765693952"
27
+ used: "706489905152"
28
+ email: deepnevro@gmail.com
29
+ executable: /mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python
30
+ git:
31
+ commit: 3fb47c6943d6927eafc39bd399a3d3a520bae74a
32
+ remote: https://github.com/w-ahmad1a10/Activation.git
33
+ gpu: NVIDIA H100 80GB HBM3
34
+ gpu_count: 8
35
+ gpu_nvidia:
36
+ - architecture: Hopper
37
+ cudaCores: 16896
38
+ memoryTotal: "85520809984"
39
+ name: NVIDIA H100 80GB HBM3
40
+ uuid: GPU-39c684a5-fde6-83d7-1663-0859795881ae
41
+ - architecture: Hopper
42
+ cudaCores: 16896
43
+ memoryTotal: "85520809984"
44
+ name: NVIDIA H100 80GB HBM3
45
+ uuid: GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3
46
+ - architecture: Hopper
47
+ cudaCores: 16896
48
+ memoryTotal: "85520809984"
49
+ name: NVIDIA H100 80GB HBM3
50
+ uuid: GPU-132944c4-b689-2b5f-89a4-d730401677ab
51
+ - architecture: Hopper
52
+ cudaCores: 16896
53
+ memoryTotal: "85520809984"
54
+ name: NVIDIA H100 80GB HBM3
55
+ uuid: GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864
56
+ - architecture: Hopper
57
+ cudaCores: 16896
58
+ memoryTotal: "85520809984"
59
+ name: NVIDIA H100 80GB HBM3
60
+ uuid: GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef
61
+ - architecture: Hopper
62
+ cudaCores: 16896
63
+ memoryTotal: "85520809984"
64
+ name: NVIDIA H100 80GB HBM3
65
+ uuid: GPU-bc6c3e3c-9b90-09ca-c034-774961847c54
66
+ - architecture: Hopper
67
+ cudaCores: 16896
68
+ memoryTotal: "85520809984"
69
+ name: NVIDIA H100 80GB HBM3
70
+ uuid: GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9
71
+ - architecture: Hopper
72
+ cudaCores: 16896
73
+ memoryTotal: "85520809984"
74
+ name: NVIDIA H100 80GB HBM3
75
+ uuid: GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea
76
+ host: deeplens-k3s-node1
77
+ memory:
78
+ total: "2164089937920"
79
+ os: Linux-5.15.0-126-generic-x86_64-with-glibc2.35
80
+ program: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py
81
+ python: CPython 3.11.15
82
+ root: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation
83
+ startedAt: "2026-08-14T21:28:14.182237Z"
84
+ writerId: yu21vcw1fqgtt12osjsu76tw34s21eqd
85
+ m:
86
+ - "1": train/global_step
87
+ "6":
88
+ - 3
89
+ "7": []
90
+ - "2": '*'
91
+ "5": 1
92
+ "6":
93
+ - 1
94
+ "7": []
95
+ python_version: 3.11.15
96
+ t:
97
+ "1":
98
+ - 1
99
+ - 5
100
+ - 11
101
+ - 41
102
+ - 49
103
+ - 51
104
+ - 53
105
+ - 71
106
+ "2":
107
+ - 1
108
+ - 5
109
+ - 11
110
+ - 41
111
+ - 49
112
+ - 51
113
+ - 53
114
+ - 71
115
+ "3":
116
+ - 2
117
+ - 7
118
+ - 13
119
+ - 19
120
+ - 66
121
+ "4": 3.11.15
122
+ "5": 0.28.1
123
+ "6": 5.16.0.dev0
124
+ "9":
125
+ "1": transformers_trainer
126
+ "12": 0.28.1
127
+ "13": linux-x86_64
128
+ accelerator_config:
129
+ value:
130
+ dispatch_batches: null
131
+ even_batches: true
132
+ gradient_accumulation_kwargs: null
133
+ non_blocking: false
134
+ split_batches: false
135
+ use_seedable_sampler: true
136
+ activation:
137
+ value: waleed10
138
+ adam_beta1:
139
+ value: 0.9
140
+ adam_beta2:
141
+ value: 0.999
142
+ adam_epsilon:
143
+ value: 1e-08
144
+ architectures:
145
+ value: null
146
+ attention_bias:
147
+ value: false
148
+ attention_dropout:
149
+ value: 0
150
+ auto_find_batch_size:
151
+ value: false
152
+ average_tokens_across_devices:
153
+ value: true
154
+ batch_eval_metrics:
155
+ value: false
156
+ bf16:
157
+ value: true
158
+ bf16_full_eval:
159
+ value: false
160
+ bos_token_id:
161
+ value: 1
162
+ chunk_size_feed_forward:
163
+ value: 0
164
+ data_seed:
165
+ value: 42
166
+ dataloader_drop_last:
167
+ value: false
168
+ dataloader_in_order:
169
+ value: true
170
+ dataloader_multiprocessing_context:
171
+ value: null
172
+ dataloader_num_workers:
173
+ value: 0
174
+ dataloader_persistent_workers:
175
+ value: false
176
+ dataloader_pin_memory:
177
+ value: true
178
+ dataloader_prefetch_factor:
179
+ value: null
180
+ ddp_backend:
181
+ value: null
182
+ ddp_broadcast_buffers:
183
+ value: null
184
+ ddp_bucket_cap_mb:
185
+ value: null
186
+ ddp_find_unused_parameters:
187
+ value: null
188
+ ddp_static_graph:
189
+ value: null
190
+ ddp_timeout:
191
+ value: 1800
192
+ debug:
193
+ value: []
194
+ deepspeed:
195
+ value: null
196
+ disable_tqdm:
197
+ value: false
198
+ do_eval:
199
+ value: true
200
+ do_predict:
201
+ value: false
202
+ do_train:
203
+ value: false
204
+ dtype:
205
+ value: null
206
+ enable_jit_checkpoint:
207
+ value: false
208
+ eos_token_id:
209
+ value: 2
210
+ eval_accumulation_steps:
211
+ value: null
212
+ eval_delay:
213
+ value: 0
214
+ eval_do_concat_batches:
215
+ value: true
216
+ eval_on_start:
217
+ value: false
218
+ eval_steps:
219
+ value: 60000
220
+ eval_strategy:
221
+ value: steps
222
+ eval_use_gather_object:
223
+ value: false
224
+ fp16:
225
+ value: false
226
+ fp16_full_eval:
227
+ value: false
228
+ fsdp:
229
+ value: null
230
+ fsdp_config:
231
+ value: null
232
+ full_determinism:
233
+ value: false
234
+ gradient_accumulation_steps:
235
+ value: 1
236
+ gradient_checkpointing:
237
+ value: false
238
+ gradient_checkpointing_kwargs:
239
+ value: null
240
+ greater_is_better:
241
+ value: null
242
+ head_dim:
243
+ value: 32
244
+ hidden_act:
245
+ value: silu
246
+ hidden_size:
247
+ value: 128
248
+ hub_always_push:
249
+ value: false
250
+ hub_model_id:
251
+ value: w-ahmad/A-glu-waleed10-21L
252
+ hub_private_repo:
253
+ value: null
254
+ hub_revision:
255
+ value: null
256
+ hub_strategy:
257
+ value: every_save
258
+ hub_token:
259
+ value: <HUB_TOKEN>
260
+ id2label:
261
+ value:
262
+ "0": LABEL_0
263
+ "1": LABEL_1
264
+ ignore_data_skip:
265
+ value: false
266
+ include_for_metrics:
267
+ value: []
268
+ include_num_input_tokens_seen:
269
+ value: "no"
270
+ initializer_range:
271
+ value: 0.02
272
+ intermediate_size:
273
+ value: 256
274
+ is_encoder_decoder:
275
+ value: false
276
+ label_names:
277
+ value: null
278
+ label_smoothing_factor:
279
+ value: 0
280
+ label2id:
281
+ value:
282
+ LABEL_0: 0
283
+ LABEL_1: 1
284
+ learning_rate:
285
+ value: 0.001
286
+ length_column_name:
287
+ value: length
288
+ liger_kernel_config:
289
+ value: null
290
+ load_best_model_at_end:
291
+ value: false
292
+ local_rank:
293
+ value: -1
294
+ log_level:
295
+ value: passive
296
+ log_level_replica:
297
+ value: warning
298
+ log_on_each_node:
299
+ value: true
300
+ logging_first_step:
301
+ value: false
302
+ logging_nan_inf_filter:
303
+ value: true
304
+ logging_steps:
305
+ value: 20
306
+ logging_strategy:
307
+ value: steps
308
+ lr_scheduler_kwargs:
309
+ value: null
310
+ lr_scheduler_type:
311
+ value: constant
312
+ max_grad_norm:
313
+ value: 1
314
+ max_position_embeddings:
315
+ value: 512
316
+ max_steps:
317
+ value: 1000
318
+ metric_for_best_model:
319
+ value: null
320
+ mlp_bias:
321
+ value: false
322
+ mlp_type:
323
+ value: glu
324
+ model/num_parameters:
325
+ value: 3970432
326
+ model_type:
327
+ value: tiny_llama
328
+ neftune_noise_alpha:
329
+ value: null
330
+ num_attention_heads:
331
+ value: 4
332
+ num_hidden_layers:
333
+ value: 21
334
+ num_key_value_heads:
335
+ value: 4
336
+ num_train_epochs:
337
+ value: 1
338
+ optim:
339
+ value: adamw_torch
340
+ optim_args:
341
+ value: null
342
+ optim_target_modules:
343
+ value: null
344
+ output_attentions:
345
+ value: false
346
+ output_dir:
347
+ value: out/glu-waleed10-21L_run
348
+ output_hidden_states:
349
+ value: false
350
+ pad_token_id:
351
+ value: 0
352
+ parallelism_config:
353
+ value: null
354
+ per_device_eval_batch_size:
355
+ value: 512
356
+ per_device_train_batch_size:
357
+ value: 512
358
+ prediction_loss_only:
359
+ value: false
360
+ pretraining_tp:
361
+ value: 1
362
+ problem_type:
363
+ value: null
364
+ project:
365
+ value: huggingface
366
+ push_to_hub:
367
+ value: false
368
+ remove_unused_columns:
369
+ value: false
370
+ report_to:
371
+ value:
372
+ - wandb
373
+ restore_callback_states_from_checkpoint:
374
+ value: false
375
+ resume_from_checkpoint:
376
+ value: null
377
+ return_dict:
378
+ value: true
379
+ rms_norm_eps:
380
+ value: 1e-06
381
+ rope_parameters:
382
+ value:
383
+ rope_theta: 10000
384
+ rope_type: default
385
+ run_name:
386
+ value: LM-glu-waleed10-21L-4.0M-20260814-212813
387
+ save_on_each_node:
388
+ value: false
389
+ save_only_model:
390
+ value: false
391
+ save_steps:
392
+ value: 100
393
+ save_strategy:
394
+ value: steps
395
+ save_total_limit:
396
+ value: null
397
+ seed:
398
+ value: 42
399
+ skip_memory_metrics:
400
+ value: true
401
+ tf32:
402
+ value: null
403
+ tie_word_embeddings:
404
+ value: true
405
+ tokenizer_name:
406
+ value: w-ahmad/tiny-stories-tokenizer
407
+ torch_compile:
408
+ value: false
409
+ torch_compile_backend:
410
+ value: null
411
+ torch_compile_mode:
412
+ value: null
413
+ torch_empty_cache_steps:
414
+ value: null
415
+ trackio_bucket_id:
416
+ value: null
417
+ trackio_space_id:
418
+ value: null
419
+ trackio_static_space_id:
420
+ value: null
421
+ train_sampling_strategy:
422
+ value: random
423
+ transformers_version:
424
+ value: 5.16.0.dev0
425
+ use_cache:
426
+ value: false
427
+ use_cpu:
428
+ value: false
429
+ use_liger_kernel:
430
+ value: false
431
+ vocab_size:
432
+ value: 4096
433
+ waleed_beta:
434
+ value: 10
435
+ warmup_steps:
436
+ value: 0
437
+ weight_decay:
438
+ value: 0.01
zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/output.log ADDED
@@ -0,0 +1,51 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 0%| | 0/1000 [00:00<?, ?it/s][transformers] `use_return_dict` is deprecated! Use `return_dict` instead!
2
+ [INFO] Causal mask (float with -inf) applied to all attention layers.
3
+ !!! VARIANT glu-waleed10-21L FAILED with: CUDA out of memory. Tried to allocate 3.99 GiB. GPU 0 has a total capacity of 79.32 GiB of which 3.05 GiB is free. Process 936813 has 43.96 GiB memory in use. Including non-PyTorch memory, this process has 32.30 GiB memory in use. Of the allocated memory 31.63 GiB is allocated by PyTorch, and 11.41 MiB is reserved by PyTorch but unallocated. If reserved but unallocated memory is large try setting PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True to avoid fragmentation. See documentation for Memory Management (https://pytorch.org/docs/stable/notes/cuda.html#environment-variables)
4
+ Traceback (most recent call last):
5
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py", line 171, in main
6
+ trainer.train(resume_from_checkpoint=checkpoint_path)
7
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 1449, in train
8
+ return inner_training_loop(
9
+ ^^^^^^^^^^^^^^^^^^^^
10
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 1531, in _inner_training_loop
11
+ self._run_epoch(
12
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 1759, in _run_epoch
13
+ tr_loss_step = self.training_step(model, inputs, num_items_in_batch)
14
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
15
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 1931, in training_step
16
+ loss = self.compute_loss(model, inputs, num_items_in_batch=num_items_in_batch)
17
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
18
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 2005, in compute_loss
19
+ outputs = model(**inputs)
20
+ ^^^^^^^^^^^^^^^
21
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/module.py", line 1739, in _wrapped_call_impl
22
+ return self._call_impl(*args, **kwargs)
23
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
24
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/module.py", line 1750, in _call_impl
25
+ return forward_call(*args, **kwargs)
26
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
27
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/accelerate/utils/operations.py", line 943, in forward
28
+ return model_forward(*args, **kwargs)
29
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
30
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/accelerate/utils/operations.py", line 931, in __call__
31
+ return convert_to_fp32(self.model_forward(*args, **kwargs))
32
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
33
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/amp/autocast_mode.py", line 44, in decorate_autocast
34
+ return func(*args, **kwargs)
35
+ ^^^^^^^^^^^^^^^^^^^^^
36
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/exp.py", line 320, in forward
37
+ loss = loss_fct(shift_logits.view(-1, self.config.vocab_size), shift_labels.view(-1))
38
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
39
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/module.py", line 1739, in _wrapped_call_impl
40
+ return self._call_impl(*args, **kwargs)
41
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
42
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/module.py", line 1750, in _call_impl
43
+ return forward_call(*args, **kwargs)
44
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
45
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/loss.py", line 1295, in forward
46
+ return F.cross_entropy(
47
+ ^^^^^^^^^^^^^^^^
48
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/functional.py", line 3494, in cross_entropy
49
+ return torch._C._nn.cross_entropy_loss(
50
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
51
+ torch.OutOfMemoryError: CUDA out of memory. Tried to allocate 3.99 GiB. GPU 0 has a total capacity of 79.32 GiB of which 3.05 GiB is free. Process 936813 has 43.96 GiB memory in use. Including non-PyTorch memory, this process has 32.30 GiB memory in use. Of the allocated memory 31.63 GiB is allocated by PyTorch, and 11.41 MiB is reserved by PyTorch but unallocated. If reserved but unallocated memory is large try setting PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True to avoid fragmentation. See documentation for Memory Management (https://pytorch.org/docs/stable/notes/cuda.html#environment-variables)
zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/requirements.txt ADDED
@@ -0,0 +1,149 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ asttokens==3.0.1
2
+ comm==0.2.3
3
+ debugpy==1.8.21
4
+ decorator==5.3.1
5
+ executing==2.2.1
6
+ nest-asyncio==1.6.0
7
+ parso==0.8.7
8
+ platformdirs==4.11.0
9
+ psutil==7.2.2
10
+ ptyprocess==0.7.0
11
+ pure_eval==0.2.3
12
+ Pygments==2.20.0
13
+ pyzmq==27.1.0
14
+ setuptools==83.0.0
15
+ six==1.17.0
16
+ tornado==6.5.7
17
+ traitlets==5.15.0
18
+ fsspec==2026.4.0
19
+ wcwidth==0.8.2
20
+ ipython_pygments_lexers==1.1.1
21
+ jedi==0.20.0
22
+ jupyter_core==5.9.1
23
+ matplotlib-inline==0.2.2
24
+ pexpect==4.9.0
25
+ prompt_toolkit==3.0.53
26
+ python-dateutil==2.9.0.post0
27
+ stack_data==0.6.3
28
+ wheel==0.47.0
29
+ jupyter_client==8.9.1
30
+ pip==26.1.2
31
+ ipython==9.15.0
32
+ ipykernel==7.2.0
33
+ threadpoolctl==3.6.0
34
+ pyparsing==3.3.2
35
+ typing_extensions==4.15.0
36
+ Jinja2==3.1.6
37
+ narwhals==2.24.0
38
+ kiwisolver==1.5.0
39
+ joblib==1.5.3
40
+ fonttools==4.63.0
41
+ cycler==0.12.1
42
+ scipy==1.17.1
43
+ pandas==3.0.5
44
+ contourpy==1.3.3
45
+ scikit-learn==1.9.0
46
+ matplotlib==3.11.1
47
+ urllib3==2.7.0
48
+ tqdm==4.70.0
49
+ idna==3.18
50
+ charset-normalizer==3.4.9
51
+ certifi==2026.7.22
52
+ requests==2.34.2
53
+ seaborn==0.13.2
54
+ uv==0.12.0
55
+ shellingham==1.5.4
56
+ mpmath==1.3.0
57
+ attrs==26.1.0
58
+ hf-xet==1.5.2
59
+ nvidia-nccl-cu12==2.21.5
60
+ MarkupSafe==3.0.3
61
+ regex==2026.7.19
62
+ importlib_metadata==9.0.0
63
+ httpcore==1.0.9
64
+ annotated-doc==0.0.5
65
+ multidict==6.7.1
66
+ aiohttp==3.14.3
67
+ aiosignal==1.4.0
68
+ xxhash==3.8.1
69
+ aiohappyeyeballs==2.7.1
70
+ mdurl==0.1.2
71
+ cuda-toolkit==13.0.3.0
72
+ networkx==3.6.1
73
+ PyYAML==6.0.3
74
+ nvidia-cufile==1.15.1.6
75
+ typer==0.27.0
76
+ torchaudio==2.6.0+cu124
77
+ rich==15.0.0
78
+ nvidia-cufft-cu12==11.2.1.3
79
+ h11==0.16.0
80
+ dill==0.4.1
81
+ cuda-pathfinder==1.6.0
82
+ filelock==3.29.0
83
+ nvidia-nvtx-cu12==12.4.127
84
+ httpx==0.28.1
85
+ anyio==4.14.2
86
+ numpy==2.4.4
87
+ yarl==1.24.5
88
+ click==8.4.2
89
+ triton==3.2.0
90
+ frozenlist==1.8.0
91
+ zipp==4.1.0
92
+ propcache==0.5.2
93
+ tokenizers==0.22.2
94
+ markdown-it-py==4.2.0
95
+ nvidia-cuda-runtime==13.0.96
96
+ cuda-bindings==13.3.1
97
+ nvidia-cuda-cupti==13.0.85
98
+ torch==2.6.0+cu124
99
+ multiprocess==0.70.19
100
+ pillow==12.2.0
101
+ transformers==5.16.0.dev0
102
+ wandb==0.28.1
103
+ nvidia-curand==10.4.0.35
104
+ sympy==1.13.1
105
+ nvidia-cusparse==12.6.3.3
106
+ nvidia-cuda-nvrtc==13.0.88
107
+ typing-inspection==0.4.2
108
+ nvidia-cusolver==12.0.4.66
109
+ nvidia-cufft==12.0.0.61
110
+ nvidia-cudnn-cu13==9.20.0.48
111
+ nvidia-cublas==13.1.1.3
112
+ pyarrow==25.0.0
113
+ evaluate==0.4.6
114
+ diffusers==0.39.0
115
+ pydantic==2.13.4
116
+ annotated-types==0.8.0
117
+ protobuf==7.35.1
118
+ sentry-sdk==2.66.1
119
+ einops==0.8.2
120
+ packaging==26.2
121
+ nvidia-nvjitlink-cu12==12.4.127
122
+ nvidia-curand-cu12==10.3.5.147
123
+ nvidia-cusparselt-cu12==0.6.2
124
+ nvidia-cusparse-cu12==12.3.1.170
125
+ nvidia-cuda-runtime-cu12==12.4.127
126
+ torchvision==0.21.0+cu124
127
+ nvidia-cuda-nvrtc-cu12==12.4.127
128
+ nvidia-cuda-cupti-cu12==12.4.127
129
+ nvidia-cusolver-cu12==11.6.1.9
130
+ nvidia-cublas-cu12==12.4.5.8
131
+ nvidia-cudnn-cu12==9.1.0.70
132
+ huggingface_hub==1.26.0
133
+ datasets==5.0.1
134
+ safetensors==0.8.0
135
+ accelerate==1.14.0
136
+ pydantic_core==2.46.4
137
+ ninja==1.13.0
138
+ autocommand==2.2.2
139
+ backports.tarfile==1.2.0
140
+ importlib_metadata==8.7.1
141
+ jaraco.text==4.0.0
142
+ jaraco.context==6.1.0
143
+ jaraco.functools==4.4.0
144
+ more-itertools==10.8.0
145
+ packaging==26.0
146
+ platformdirs==4.4.0
147
+ tomli==2.4.0
148
+ wheel==0.46.3
149
+ zipp==3.23.0
zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/wandb-metadata.json ADDED
@@ -0,0 +1,101 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "os": "Linux-5.15.0-126-generic-x86_64-with-glibc2.35",
3
+ "python": "CPython 3.11.15",
4
+ "startedAt": "2026-08-14T21:28:14.182237Z",
5
+ "args": [
6
+ "--config",
7
+ "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline.yaml",
8
+ "--variants",
9
+ "glu-waleed10",
10
+ "glu-silu-waleed10",
11
+ "mlp-waleed10",
12
+ "mlp-silu-waleed10",
13
+ "glu-waleed",
14
+ "glu-situglu_low",
15
+ "glu-waleedglu_low"
16
+ ],
17
+ "program": "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py",
18
+ "codePath": "sweep.py",
19
+ "codePathLocal": "sweep.py",
20
+ "git": {
21
+ "remote": "https://github.com/w-ahmad1a10/Activation.git",
22
+ "commit": "3fb47c6943d6927eafc39bd399a3d3a520bae74a"
23
+ },
24
+ "email": "deepnevro@gmail.com",
25
+ "root": "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation",
26
+ "host": "deeplens-k3s-node1",
27
+ "executable": "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python",
28
+ "cpu_count": 112,
29
+ "cpu_count_logical": 224,
30
+ "gpu": "NVIDIA H100 80GB HBM3",
31
+ "gpu_count": 8,
32
+ "disk": {
33
+ "/": {
34
+ "total": "1560765693952",
35
+ "used": "706489905152"
36
+ }
37
+ },
38
+ "memory": {
39
+ "total": "2164089937920"
40
+ },
41
+ "gpu_nvidia": [
42
+ {
43
+ "name": "NVIDIA H100 80GB HBM3",
44
+ "memoryTotal": "85520809984",
45
+ "cudaCores": 16896,
46
+ "architecture": "Hopper",
47
+ "uuid": "GPU-39c684a5-fde6-83d7-1663-0859795881ae"
48
+ },
49
+ {
50
+ "name": "NVIDIA H100 80GB HBM3",
51
+ "memoryTotal": "85520809984",
52
+ "cudaCores": 16896,
53
+ "architecture": "Hopper",
54
+ "uuid": "GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3"
55
+ },
56
+ {
57
+ "name": "NVIDIA H100 80GB HBM3",
58
+ "memoryTotal": "85520809984",
59
+ "cudaCores": 16896,
60
+ "architecture": "Hopper",
61
+ "uuid": "GPU-132944c4-b689-2b5f-89a4-d730401677ab"
62
+ },
63
+ {
64
+ "name": "NVIDIA H100 80GB HBM3",
65
+ "memoryTotal": "85520809984",
66
+ "cudaCores": 16896,
67
+ "architecture": "Hopper",
68
+ "uuid": "GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864"
69
+ },
70
+ {
71
+ "name": "NVIDIA H100 80GB HBM3",
72
+ "memoryTotal": "85520809984",
73
+ "cudaCores": 16896,
74
+ "architecture": "Hopper",
75
+ "uuid": "GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef"
76
+ },
77
+ {
78
+ "name": "NVIDIA H100 80GB HBM3",
79
+ "memoryTotal": "85520809984",
80
+ "cudaCores": 16896,
81
+ "architecture": "Hopper",
82
+ "uuid": "GPU-bc6c3e3c-9b90-09ca-c034-774961847c54"
83
+ },
84
+ {
85
+ "name": "NVIDIA H100 80GB HBM3",
86
+ "memoryTotal": "85520809984",
87
+ "cudaCores": 16896,
88
+ "architecture": "Hopper",
89
+ "uuid": "GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9"
90
+ },
91
+ {
92
+ "name": "NVIDIA H100 80GB HBM3",
93
+ "memoryTotal": "85520809984",
94
+ "cudaCores": 16896,
95
+ "architecture": "Hopper",
96
+ "uuid": "GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea"
97
+ }
98
+ ],
99
+ "cudaVersion": "12.4",
100
+ "writerId": "yu21vcw1fqgtt12osjsu76tw34s21eqd"
101
+ }
zain/Activation/wandb/run-20260814_212814-vtp6pf3m/files/wandb-summary.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"_wandb":{"runtime":1},"_runtime":1}
zain/Activation/wandb/run-20260814_212814-vtp6pf3m/logs/debug-core.log ADDED
@@ -0,0 +1,32 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-08-14T21:28:13.875214015Z","level":"INFO","msg":"main: starting server","port-filename":"/tmp/tmp61t5kns7/port-1193850.txt","pid":1193850,"detached":false,"idle-timeout":600000000000,"log-level":0,"disable-analytics":false,"shutdown-on-parent-exit":false,"enable-dcgm-profiling":false}
2
+ {"time":"2026-08-14T21:28:13.875684603Z","level":"INFO","msg":"server: will exit if parent process dies","ppid":1193850}
3
+ {"time":"2026-08-14T21:28:13.875676582Z","level":"INFO","msg":"server: accepting connections","addr":{"Name":"/tmp/wandb-1193850-1195287-1939645545/socket","Net":"unix"}}
4
+ {"time":"2026-08-14T21:28:14.052767875Z","level":"INFO","msg":"connection: ManageConnectionData: new connection created","id":"1(@)"}
5
+ {"time":"2026-08-14T21:28:14.184824068Z","level":"INFO","msg":"handleInformInit: received","streamId":"vtp6pf3m","id":"1(@)"}
6
+ {"time":"2026-08-14T21:28:14.445813383Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"vtp6pf3m","id":"1(@)"}
7
+ {"time":"2026-08-14T21:28:16.535398722Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"ppjgf4bx6kkl"}
8
+ {"time":"2026-08-14T21:28:17.132108791Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"ppjgf4bx6kkl"}
9
+ {"time":"2026-08-14T21:28:17.133244824Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"vtp6pf3m","id":"1(@)"}
10
+ {"time":"2026-08-14T21:28:17.13384059Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"vtp6pf3m","id":"1(@)"}
11
+ {"time":"2026-08-14T21:28:18.176700551Z","level":"INFO","msg":"handleInformInit: received","streamId":"fj94kr9p","id":"1(@)"}
12
+ {"time":"2026-08-14T21:28:18.417597198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"fj94kr9p","id":"1(@)"}
13
+ {"time":"2026-08-14T21:28:19.674866991Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"e4d4etq11mlq"}
14
+ {"time":"2026-08-14T21:28:20.222556488Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"e4d4etq11mlq"}
15
+ {"time":"2026-08-14T21:28:20.223783577Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"fj94kr9p","id":"1(@)"}
16
+ {"time":"2026-08-14T21:28:20.224344691Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"fj94kr9p","id":"1(@)"}
17
+ {"time":"2026-08-14T21:28:20.755487912Z","level":"INFO","msg":"handleInformInit: received","streamId":"ucwxn3gs","id":"1(@)"}
18
+ {"time":"2026-08-14T21:28:20.996759448Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"ucwxn3gs","id":"1(@)"}
19
+ {"time":"2026-08-14T21:28:26.491790165Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"4jw8kj1lwl6y"}
20
+ {"time":"2026-08-14T21:29:01.918410879Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"4jw8kj1lwl6y"}
21
+ {"time":"2026-08-14T21:29:02.578939706Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"4jw8kj1lwl6y"}
22
+ {"time":"2026-08-14T21:29:02.580571999Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"ucwxn3gs","id":"1(@)"}
23
+ {"time":"2026-08-14T21:29:02.581104066Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"ucwxn3gs","id":"1(@)"}
24
+ {"time":"2026-08-14T21:29:02.642980411Z","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
25
+ {"time":"2026-08-14T21:29:02.643036973Z","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
26
+ {"time":"2026-08-14T21:29:02.643048401Z","level":"INFO","msg":"connection: closing","id":"1(@)"}
27
+ {"time":"2026-08-14T21:29:02.643056857Z","level":"INFO","msg":"server: is shutting down"}
28
+ {"time":"2026-08-14T21:29:02.643101792Z","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
29
+ {"time":"2026-08-14T21:29:02.643077696Z","level":"INFO","msg":"processOutgoingData: finished","id":"1(@)"}
30
+ {"time":"2026-08-14T21:29:02.643124976Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
31
+ {"time":"2026-08-14T21:29:02.643304099Z","level":"INFO","msg":"server: listener closed","addr":{"Name":"/tmp/wandb-1193850-1195287-1939645545/socket","Net":"unix"}}
32
+ {"time":"2026-08-14T21:29:02.643377148Z","level":"INFO","msg":"server: all connections closed"}
zain/Activation/wandb/run-20260814_212814-vtp6pf3m/logs/debug-internal.log ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-08-14T21:28:14.184976796Z","level":"INFO","msg":"wandb-core"}
2
+ {"time":"2026-08-14T21:28:14.185271443Z","level":"INFO","msg":"stream: starting","core version":"0.28.1"}
3
+ {"time":"2026-08-14T21:28:14.445644603Z","level":"INFO","msg":"stream: created new stream","id":"vtp6pf3m"}
4
+ {"time":"2026-08-14T21:28:14.445718126Z","level":"INFO","msg":"handler: started"}
5
+ {"time":"2026-08-14T21:28:14.445807645Z","level":"INFO","msg":"stream: started"}
6
+ {"time":"2026-08-14T21:28:14.445824533Z","level":"INFO","msg":"writer: started","stream_id":"vtp6pf3m"}
7
+ {"time":"2026-08-14T21:28:14.44583799Z","level":"INFO","msg":"sender: started"}
8
+ {"time":"2026-08-14T21:28:15.020933363Z","level":"INFO","msg":"filestream: sending request","total_files":1,"console_offset":0,"console_lines":1}
9
+ {"time":"2026-08-14T21:28:15.163288394Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
10
+ {"time":"2026-08-14T21:28:16.980913802Z","level":"INFO","msg":"fileTransfer: Close: file transfer manager closed"}
11
+ {"time":"2026-08-14T21:28:16.981147036Z","level":"INFO","msg":"filestream: sending request","total_files":2,"console_offset":0,"console_lines":51,"uploaded_len":5,"complete":true,"exit_code":0}
12
+ {"time":"2026-08-14T21:28:17.128640703Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
13
+ {"time":"2026-08-14T21:28:17.130769132Z","level":"INFO","msg":"handler: operation stats","stats":{}}
14
+ {"time":"2026-08-14T21:28:17.133288135Z","level":"INFO","msg":"stream: finishing up"}
15
+ {"time":"2026-08-14T21:28:17.133316341Z","level":"INFO","msg":"handler: closed"}
16
+ {"time":"2026-08-14T21:28:17.133386114Z","level":"INFO","msg":"sender: closed"}
17
+ {"time":"2026-08-14T21:28:17.133391408Z","level":"INFO","msg":"stream: all finished"}
zain/Activation/wandb/run-20260814_212814-vtp6pf3m/logs/debug.log ADDED
@@ -0,0 +1,27 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 2026-08-14 21:28:14,183 INFO MainThread:1193850 [wandb_setup.py:_flush():81] Current SDK version is 0.28.1
2
+ 2026-08-14 21:28:14,183 INFO MainThread:1193850 [wandb_setup.py:_flush():81] Configure stats pid to 1193850
3
+ 2026-08-14 21:28:14,183 INFO MainThread:1193850 [wandb_setup.py:_flush():81] Loading settings from environment variables
4
+ 2026-08-14 21:28:14,183 INFO MainThread:1193850 [wandb_init.py:setup_run_log_directory():729] Logging user logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_212814-vtp6pf3m/logs/debug.log
5
+ 2026-08-14 21:28:14,183 INFO MainThread:1193850 [wandb_init.py:setup_run_log_directory():730] Logging internal logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_212814-vtp6pf3m/logs/debug-internal.log
6
+ 2026-08-14 21:28:14,183 INFO MainThread:1193850 [wandb_init.py:init():772] calling init triggers
7
+ 2026-08-14 21:28:14,183 INFO MainThread:1193850 [wandb_init.py:init():777] wandb.init called with sweep_config: {}
8
+ config: {'_wandb': {}}
9
+ 2026-08-14 21:28:14,183 INFO MainThread:1193850 [wandb_init.py:init():820] starting backend
10
+ 2026-08-14 21:28:14,183 INFO MainThread:1193850 [wandb_init.py:init():835] sending inform_init request
11
+ 2026-08-14 21:28:14,446 INFO MainThread:1193850 [wandb_init.py:init():840] backend started and connected
12
+ 2026-08-14 21:28:14,447 INFO MainThread:1193850 [wandb_init.py:init():910] updated telemetry
13
+ 2026-08-14 21:28:14,454 INFO MainThread:1193850 [wandb_init.py:init():933] communicating run to backend with 90.0 second timeout
14
+ 2026-08-14 21:28:14,939 INFO MainThread:1193850 [wandb_init.py:init():978] starting run threads in backend
15
+ 2026-08-14 21:28:15,013 INFO MainThread:1193850 [wandb_run.py:_console_start():2621] atexit reg
16
+ 2026-08-14 21:28:15,013 INFO MainThread:1193850 [wandb_run.py:_redirect():2471] redirect: wrap_raw
17
+ 2026-08-14 21:28:15,013 INFO MainThread:1193850 [wandb_run.py:_redirect():2540] Wrapping output streams.
18
+ 2026-08-14 21:28:15,013 INFO MainThread:1193850 [wandb_run.py:_redirect():2563] Redirects installed.
19
+ 2026-08-14 21:28:15,016 INFO MainThread:1193850 [wandb_init.py:init():1016] run started, returning control to user process
20
+ 2026-08-14 21:28:15,017 INFO MainThread:1193850 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 21, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'waleed10', 'waleed_beta': 10.0, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-waleed10-21L_run', 'per_device_train_batch_size': 512, 'num_train_epochs': 1, 'max_steps': 1000, 'learning_rate': 0.001, 'lr_scheduler_type': 'constant', 'lr_scheduler_kwargs': None, 'warmup_steps': 0, 'optim': 'adamw_torch', 'optim_args': None, 'weight_decay': 0.01, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-waleed10-21L-4.0M-20260814-212813', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 60000, 'eval_delay': 0, 'per_device_eval_batch_size': 512, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 100, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/A-glu-waleed10-21L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
21
+ 2026-08-14 21:28:15,019 INFO MainThread:1193850 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 3970432 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x1462d29d2090>>
22
+ 2026-08-14 21:28:15,019 INFO MainThread:1193850 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 3970432 None
23
+ 2026-08-14 21:28:16,533 INFO MainThread:1193850 [wandb_run.py:_finish():2383] finishing run deepnevro-deepnevro/research1/vtp6pf3m
24
+ 2026-08-14 21:28:16,534 INFO MainThread:1193850 [wandb_run.py:_atexit_cleanup():2588] got exitcode: 0
25
+ 2026-08-14 21:28:16,535 INFO MainThread:1193850 [wandb_run.py:_restore():2570] restore
26
+ 2026-08-14 21:28:16,535 INFO MainThread:1193850 [wandb_run.py:_restore():2576] restore done
27
+ 2026-08-14 21:28:17,132 INFO MainThread:1193850 [wandb_run.py:_footer_sync_info():3993] logging synced files
zain/Activation/wandb/run-20260814_212814-vtp6pf3m/run-vtp6pf3m.wandb ADDED
Binary file (14.2 kB). View file
 
zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/config.yaml ADDED
@@ -0,0 +1,438 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ _name_or_path:
2
+ value: ""
3
+ _wandb:
4
+ value:
5
+ cli_version: 0.28.1
6
+ e:
7
+ xio5js2delb7osbi95ndowruwry5o7mi:
8
+ args:
9
+ - --config
10
+ - /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline.yaml
11
+ - --variants
12
+ - glu-waleed10
13
+ - glu-silu-waleed10
14
+ - mlp-waleed10
15
+ - mlp-silu-waleed10
16
+ - glu-waleed
17
+ - glu-situglu_low
18
+ - glu-waleedglu_low
19
+ codePath: sweep.py
20
+ codePathLocal: sweep.py
21
+ cpu_count: 112
22
+ cpu_count_logical: 224
23
+ cudaVersion: "12.4"
24
+ disk:
25
+ /:
26
+ total: "1560765693952"
27
+ used: "706489917440"
28
+ email: deepnevro@gmail.com
29
+ executable: /mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python
30
+ git:
31
+ commit: 3fb47c6943d6927eafc39bd399a3d3a520bae74a
32
+ remote: https://github.com/w-ahmad1a10/Activation.git
33
+ gpu: NVIDIA H100 80GB HBM3
34
+ gpu_count: 8
35
+ gpu_nvidia:
36
+ - architecture: Hopper
37
+ cudaCores: 16896
38
+ memoryTotal: "85520809984"
39
+ name: NVIDIA H100 80GB HBM3
40
+ uuid: GPU-39c684a5-fde6-83d7-1663-0859795881ae
41
+ - architecture: Hopper
42
+ cudaCores: 16896
43
+ memoryTotal: "85520809984"
44
+ name: NVIDIA H100 80GB HBM3
45
+ uuid: GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3
46
+ - architecture: Hopper
47
+ cudaCores: 16896
48
+ memoryTotal: "85520809984"
49
+ name: NVIDIA H100 80GB HBM3
50
+ uuid: GPU-132944c4-b689-2b5f-89a4-d730401677ab
51
+ - architecture: Hopper
52
+ cudaCores: 16896
53
+ memoryTotal: "85520809984"
54
+ name: NVIDIA H100 80GB HBM3
55
+ uuid: GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864
56
+ - architecture: Hopper
57
+ cudaCores: 16896
58
+ memoryTotal: "85520809984"
59
+ name: NVIDIA H100 80GB HBM3
60
+ uuid: GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef
61
+ - architecture: Hopper
62
+ cudaCores: 16896
63
+ memoryTotal: "85520809984"
64
+ name: NVIDIA H100 80GB HBM3
65
+ uuid: GPU-bc6c3e3c-9b90-09ca-c034-774961847c54
66
+ - architecture: Hopper
67
+ cudaCores: 16896
68
+ memoryTotal: "85520809984"
69
+ name: NVIDIA H100 80GB HBM3
70
+ uuid: GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9
71
+ - architecture: Hopper
72
+ cudaCores: 16896
73
+ memoryTotal: "85520809984"
74
+ name: NVIDIA H100 80GB HBM3
75
+ uuid: GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea
76
+ host: deeplens-k3s-node1
77
+ memory:
78
+ total: "2164089937920"
79
+ os: Linux-5.15.0-126-generic-x86_64-with-glibc2.35
80
+ program: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py
81
+ python: CPython 3.11.15
82
+ root: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation
83
+ startedAt: "2026-08-14T21:28:18.170018Z"
84
+ writerId: xio5js2delb7osbi95ndowruwry5o7mi
85
+ m:
86
+ - "1": train/global_step
87
+ "6":
88
+ - 3
89
+ "7": []
90
+ - "2": '*'
91
+ "5": 1
92
+ "6":
93
+ - 1
94
+ "7": []
95
+ python_version: 3.11.15
96
+ t:
97
+ "1":
98
+ - 1
99
+ - 5
100
+ - 11
101
+ - 41
102
+ - 49
103
+ - 51
104
+ - 53
105
+ - 71
106
+ "2":
107
+ - 1
108
+ - 5
109
+ - 11
110
+ - 41
111
+ - 49
112
+ - 51
113
+ - 53
114
+ - 71
115
+ "3":
116
+ - 2
117
+ - 7
118
+ - 13
119
+ - 19
120
+ - 66
121
+ "4": 3.11.15
122
+ "5": 0.28.1
123
+ "6": 5.16.0.dev0
124
+ "9":
125
+ "1": transformers_trainer
126
+ "12": 0.28.1
127
+ "13": linux-x86_64
128
+ accelerator_config:
129
+ value:
130
+ dispatch_batches: null
131
+ even_batches: true
132
+ gradient_accumulation_kwargs: null
133
+ non_blocking: false
134
+ split_batches: false
135
+ use_seedable_sampler: true
136
+ activation:
137
+ value: silu-waleed10
138
+ adam_beta1:
139
+ value: 0.9
140
+ adam_beta2:
141
+ value: 0.999
142
+ adam_epsilon:
143
+ value: 1e-08
144
+ architectures:
145
+ value: null
146
+ attention_bias:
147
+ value: false
148
+ attention_dropout:
149
+ value: 0
150
+ auto_find_batch_size:
151
+ value: false
152
+ average_tokens_across_devices:
153
+ value: true
154
+ batch_eval_metrics:
155
+ value: false
156
+ bf16:
157
+ value: true
158
+ bf16_full_eval:
159
+ value: false
160
+ bos_token_id:
161
+ value: 1
162
+ chunk_size_feed_forward:
163
+ value: 0
164
+ data_seed:
165
+ value: 42
166
+ dataloader_drop_last:
167
+ value: false
168
+ dataloader_in_order:
169
+ value: true
170
+ dataloader_multiprocessing_context:
171
+ value: null
172
+ dataloader_num_workers:
173
+ value: 0
174
+ dataloader_persistent_workers:
175
+ value: false
176
+ dataloader_pin_memory:
177
+ value: true
178
+ dataloader_prefetch_factor:
179
+ value: null
180
+ ddp_backend:
181
+ value: null
182
+ ddp_broadcast_buffers:
183
+ value: null
184
+ ddp_bucket_cap_mb:
185
+ value: null
186
+ ddp_find_unused_parameters:
187
+ value: null
188
+ ddp_static_graph:
189
+ value: null
190
+ ddp_timeout:
191
+ value: 1800
192
+ debug:
193
+ value: []
194
+ deepspeed:
195
+ value: null
196
+ disable_tqdm:
197
+ value: false
198
+ do_eval:
199
+ value: true
200
+ do_predict:
201
+ value: false
202
+ do_train:
203
+ value: false
204
+ dtype:
205
+ value: null
206
+ enable_jit_checkpoint:
207
+ value: false
208
+ eos_token_id:
209
+ value: 2
210
+ eval_accumulation_steps:
211
+ value: null
212
+ eval_delay:
213
+ value: 0
214
+ eval_do_concat_batches:
215
+ value: true
216
+ eval_on_start:
217
+ value: false
218
+ eval_steps:
219
+ value: 60000
220
+ eval_strategy:
221
+ value: steps
222
+ eval_use_gather_object:
223
+ value: false
224
+ fp16:
225
+ value: false
226
+ fp16_full_eval:
227
+ value: false
228
+ fsdp:
229
+ value: null
230
+ fsdp_config:
231
+ value: null
232
+ full_determinism:
233
+ value: false
234
+ gradient_accumulation_steps:
235
+ value: 1
236
+ gradient_checkpointing:
237
+ value: false
238
+ gradient_checkpointing_kwargs:
239
+ value: null
240
+ greater_is_better:
241
+ value: null
242
+ head_dim:
243
+ value: 32
244
+ hidden_act:
245
+ value: silu
246
+ hidden_size:
247
+ value: 128
248
+ hub_always_push:
249
+ value: false
250
+ hub_model_id:
251
+ value: w-ahmad/A-glu-silu-waleed10-21L
252
+ hub_private_repo:
253
+ value: null
254
+ hub_revision:
255
+ value: null
256
+ hub_strategy:
257
+ value: every_save
258
+ hub_token:
259
+ value: <HUB_TOKEN>
260
+ id2label:
261
+ value:
262
+ "0": LABEL_0
263
+ "1": LABEL_1
264
+ ignore_data_skip:
265
+ value: false
266
+ include_for_metrics:
267
+ value: []
268
+ include_num_input_tokens_seen:
269
+ value: "no"
270
+ initializer_range:
271
+ value: 0.02
272
+ intermediate_size:
273
+ value: 256
274
+ is_encoder_decoder:
275
+ value: false
276
+ label_names:
277
+ value: null
278
+ label_smoothing_factor:
279
+ value: 0
280
+ label2id:
281
+ value:
282
+ LABEL_0: 0
283
+ LABEL_1: 1
284
+ learning_rate:
285
+ value: 0.001
286
+ length_column_name:
287
+ value: length
288
+ liger_kernel_config:
289
+ value: null
290
+ load_best_model_at_end:
291
+ value: false
292
+ local_rank:
293
+ value: -1
294
+ log_level:
295
+ value: passive
296
+ log_level_replica:
297
+ value: warning
298
+ log_on_each_node:
299
+ value: true
300
+ logging_first_step:
301
+ value: false
302
+ logging_nan_inf_filter:
303
+ value: true
304
+ logging_steps:
305
+ value: 20
306
+ logging_strategy:
307
+ value: steps
308
+ lr_scheduler_kwargs:
309
+ value: null
310
+ lr_scheduler_type:
311
+ value: constant
312
+ max_grad_norm:
313
+ value: 1
314
+ max_position_embeddings:
315
+ value: 512
316
+ max_steps:
317
+ value: 1000
318
+ metric_for_best_model:
319
+ value: null
320
+ mlp_bias:
321
+ value: false
322
+ mlp_type:
323
+ value: glu
324
+ model/num_parameters:
325
+ value: 3970432
326
+ model_type:
327
+ value: tiny_llama
328
+ neftune_noise_alpha:
329
+ value: null
330
+ num_attention_heads:
331
+ value: 4
332
+ num_hidden_layers:
333
+ value: 21
334
+ num_key_value_heads:
335
+ value: 4
336
+ num_train_epochs:
337
+ value: 1
338
+ optim:
339
+ value: adamw_torch
340
+ optim_args:
341
+ value: null
342
+ optim_target_modules:
343
+ value: null
344
+ output_attentions:
345
+ value: false
346
+ output_dir:
347
+ value: out/glu-silu-waleed10-21L_run
348
+ output_hidden_states:
349
+ value: false
350
+ pad_token_id:
351
+ value: 0
352
+ parallelism_config:
353
+ value: null
354
+ per_device_eval_batch_size:
355
+ value: 512
356
+ per_device_train_batch_size:
357
+ value: 512
358
+ prediction_loss_only:
359
+ value: false
360
+ pretraining_tp:
361
+ value: 1
362
+ problem_type:
363
+ value: null
364
+ project:
365
+ value: huggingface
366
+ push_to_hub:
367
+ value: false
368
+ remove_unused_columns:
369
+ value: false
370
+ report_to:
371
+ value:
372
+ - wandb
373
+ restore_callback_states_from_checkpoint:
374
+ value: false
375
+ resume_from_checkpoint:
376
+ value: null
377
+ return_dict:
378
+ value: true
379
+ rms_norm_eps:
380
+ value: 1e-06
381
+ rope_parameters:
382
+ value:
383
+ rope_theta: 10000
384
+ rope_type: default
385
+ run_name:
386
+ value: LM-glu-silu-waleed10-21L-4.0M-20260814-212817
387
+ save_on_each_node:
388
+ value: false
389
+ save_only_model:
390
+ value: false
391
+ save_steps:
392
+ value: 100
393
+ save_strategy:
394
+ value: steps
395
+ save_total_limit:
396
+ value: null
397
+ seed:
398
+ value: 42
399
+ skip_memory_metrics:
400
+ value: true
401
+ tf32:
402
+ value: null
403
+ tie_word_embeddings:
404
+ value: true
405
+ tokenizer_name:
406
+ value: w-ahmad/tiny-stories-tokenizer
407
+ torch_compile:
408
+ value: false
409
+ torch_compile_backend:
410
+ value: null
411
+ torch_compile_mode:
412
+ value: null
413
+ torch_empty_cache_steps:
414
+ value: null
415
+ trackio_bucket_id:
416
+ value: null
417
+ trackio_space_id:
418
+ value: null
419
+ trackio_static_space_id:
420
+ value: null
421
+ train_sampling_strategy:
422
+ value: random
423
+ transformers_version:
424
+ value: 5.16.0.dev0
425
+ use_cache:
426
+ value: false
427
+ use_cpu:
428
+ value: false
429
+ use_liger_kernel:
430
+ value: false
431
+ vocab_size:
432
+ value: 4096
433
+ waleed_beta:
434
+ value: 10
435
+ warmup_steps:
436
+ value: 0
437
+ weight_decay:
438
+ value: 0.01
zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/output.log ADDED
@@ -0,0 +1,49 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 0%| | 0/1000 [00:00<?, ?it/s]Traceback (most recent call last):
2
+ !!! VARIANT glu-silu-waleed10-21L FAILED with: CUDA out of memory. Tried to allocate 3.99 GiB. GPU 0 has a total capacity of 79.32 GiB of which 428.75 MiB is free. Process 936813 has 43.96 GiB memory in use. Including non-PyTorch memory, this process has 34.93 GiB memory in use. Of the allocated memory 34.26 GiB is allocated by PyTorch, and 13.41 MiB is reserved by PyTorch but unallocated. If reserved but unallocated memory is large try setting PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True to avoid fragmentation. See documentation for Memory Management (https://pytorch.org/docs/stable/notes/cuda.html#environment-variables)
3
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py", line 171, in main
4
+ trainer.train(resume_from_checkpoint=checkpoint_path)
5
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 1449, in train
6
+ return inner_training_loop(
7
+ ^^^^^^^^^^^^^^^^^^^^
8
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 1531, in _inner_training_loop
9
+ self._run_epoch(
10
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 1759, in _run_epoch
11
+ tr_loss_step = self.training_step(model, inputs, num_items_in_batch)
12
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
13
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 1931, in training_step
14
+ loss = self.compute_loss(model, inputs, num_items_in_batch=num_items_in_batch)
15
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
16
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/transformers/trainer.py", line 2005, in compute_loss
17
+ outputs = model(**inputs)
18
+ ^^^^^^^^^^^^^^^
19
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/module.py", line 1739, in _wrapped_call_impl
20
+ return self._call_impl(*args, **kwargs)
21
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
22
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/module.py", line 1750, in _call_impl
23
+ return forward_call(*args, **kwargs)
24
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
25
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/accelerate/utils/operations.py", line 943, in forward
26
+ return model_forward(*args, **kwargs)
27
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
28
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/accelerate/utils/operations.py", line 931, in __call__
29
+ return convert_to_fp32(self.model_forward(*args, **kwargs))
30
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
31
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/amp/autocast_mode.py", line 44, in decorate_autocast
32
+ return func(*args, **kwargs)
33
+ ^^^^^^^^^^^^^^^^^^^^^
34
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/exp.py", line 320, in forward
35
+ loss = loss_fct(shift_logits.view(-1, self.config.vocab_size), shift_labels.view(-1))
36
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
37
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/module.py", line 1739, in _wrapped_call_impl
38
+ return self._call_impl(*args, **kwargs)
39
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
40
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/module.py", line 1750, in _call_impl
41
+ return forward_call(*args, **kwargs)
42
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
43
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/modules/loss.py", line 1295, in forward
44
+ return F.cross_entropy(
45
+ ^^^^^^^^^^^^^^^^
46
+ File "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/lib/python3.11/site-packages/torch/nn/functional.py", line 3494, in cross_entropy
47
+ return torch._C._nn.cross_entropy_loss(
48
+ ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
49
+ torch.OutOfMemoryError: CUDA out of memory. Tried to allocate 3.99 GiB. GPU 0 has a total capacity of 79.32 GiB of which 428.75 MiB is free. Process 936813 has 43.96 GiB memory in use. Including non-PyTorch memory, this process has 34.93 GiB memory in use. Of the allocated memory 34.26 GiB is allocated by PyTorch, and 13.41 MiB is reserved by PyTorch but unallocated. If reserved but unallocated memory is large try setting PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True to avoid fragmentation. See documentation for Memory Management (https://pytorch.org/docs/stable/notes/cuda.html#environment-variables)
zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/requirements.txt ADDED
@@ -0,0 +1,149 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ asttokens==3.0.1
2
+ comm==0.2.3
3
+ debugpy==1.8.21
4
+ decorator==5.3.1
5
+ executing==2.2.1
6
+ nest-asyncio==1.6.0
7
+ parso==0.8.7
8
+ platformdirs==4.11.0
9
+ psutil==7.2.2
10
+ ptyprocess==0.7.0
11
+ pure_eval==0.2.3
12
+ Pygments==2.20.0
13
+ pyzmq==27.1.0
14
+ setuptools==83.0.0
15
+ six==1.17.0
16
+ tornado==6.5.7
17
+ traitlets==5.15.0
18
+ fsspec==2026.4.0
19
+ wcwidth==0.8.2
20
+ ipython_pygments_lexers==1.1.1
21
+ jedi==0.20.0
22
+ jupyter_core==5.9.1
23
+ matplotlib-inline==0.2.2
24
+ pexpect==4.9.0
25
+ prompt_toolkit==3.0.53
26
+ python-dateutil==2.9.0.post0
27
+ stack_data==0.6.3
28
+ wheel==0.47.0
29
+ jupyter_client==8.9.1
30
+ pip==26.1.2
31
+ ipython==9.15.0
32
+ ipykernel==7.2.0
33
+ threadpoolctl==3.6.0
34
+ pyparsing==3.3.2
35
+ typing_extensions==4.15.0
36
+ Jinja2==3.1.6
37
+ narwhals==2.24.0
38
+ kiwisolver==1.5.0
39
+ joblib==1.5.3
40
+ fonttools==4.63.0
41
+ cycler==0.12.1
42
+ scipy==1.17.1
43
+ pandas==3.0.5
44
+ contourpy==1.3.3
45
+ scikit-learn==1.9.0
46
+ matplotlib==3.11.1
47
+ urllib3==2.7.0
48
+ tqdm==4.70.0
49
+ idna==3.18
50
+ charset-normalizer==3.4.9
51
+ certifi==2026.7.22
52
+ requests==2.34.2
53
+ seaborn==0.13.2
54
+ uv==0.12.0
55
+ shellingham==1.5.4
56
+ mpmath==1.3.0
57
+ attrs==26.1.0
58
+ hf-xet==1.5.2
59
+ nvidia-nccl-cu12==2.21.5
60
+ MarkupSafe==3.0.3
61
+ regex==2026.7.19
62
+ importlib_metadata==9.0.0
63
+ httpcore==1.0.9
64
+ annotated-doc==0.0.5
65
+ multidict==6.7.1
66
+ aiohttp==3.14.3
67
+ aiosignal==1.4.0
68
+ xxhash==3.8.1
69
+ aiohappyeyeballs==2.7.1
70
+ mdurl==0.1.2
71
+ cuda-toolkit==13.0.3.0
72
+ networkx==3.6.1
73
+ PyYAML==6.0.3
74
+ nvidia-cufile==1.15.1.6
75
+ typer==0.27.0
76
+ torchaudio==2.6.0+cu124
77
+ rich==15.0.0
78
+ nvidia-cufft-cu12==11.2.1.3
79
+ h11==0.16.0
80
+ dill==0.4.1
81
+ cuda-pathfinder==1.6.0
82
+ filelock==3.29.0
83
+ nvidia-nvtx-cu12==12.4.127
84
+ httpx==0.28.1
85
+ anyio==4.14.2
86
+ numpy==2.4.4
87
+ yarl==1.24.5
88
+ click==8.4.2
89
+ triton==3.2.0
90
+ frozenlist==1.8.0
91
+ zipp==4.1.0
92
+ propcache==0.5.2
93
+ tokenizers==0.22.2
94
+ markdown-it-py==4.2.0
95
+ nvidia-cuda-runtime==13.0.96
96
+ cuda-bindings==13.3.1
97
+ nvidia-cuda-cupti==13.0.85
98
+ torch==2.6.0+cu124
99
+ multiprocess==0.70.19
100
+ pillow==12.2.0
101
+ transformers==5.16.0.dev0
102
+ wandb==0.28.1
103
+ nvidia-curand==10.4.0.35
104
+ sympy==1.13.1
105
+ nvidia-cusparse==12.6.3.3
106
+ nvidia-cuda-nvrtc==13.0.88
107
+ typing-inspection==0.4.2
108
+ nvidia-cusolver==12.0.4.66
109
+ nvidia-cufft==12.0.0.61
110
+ nvidia-cudnn-cu13==9.20.0.48
111
+ nvidia-cublas==13.1.1.3
112
+ pyarrow==25.0.0
113
+ evaluate==0.4.6
114
+ diffusers==0.39.0
115
+ pydantic==2.13.4
116
+ annotated-types==0.8.0
117
+ protobuf==7.35.1
118
+ sentry-sdk==2.66.1
119
+ einops==0.8.2
120
+ packaging==26.2
121
+ nvidia-nvjitlink-cu12==12.4.127
122
+ nvidia-curand-cu12==10.3.5.147
123
+ nvidia-cusparselt-cu12==0.6.2
124
+ nvidia-cusparse-cu12==12.3.1.170
125
+ nvidia-cuda-runtime-cu12==12.4.127
126
+ torchvision==0.21.0+cu124
127
+ nvidia-cuda-nvrtc-cu12==12.4.127
128
+ nvidia-cuda-cupti-cu12==12.4.127
129
+ nvidia-cusolver-cu12==11.6.1.9
130
+ nvidia-cublas-cu12==12.4.5.8
131
+ nvidia-cudnn-cu12==9.1.0.70
132
+ huggingface_hub==1.26.0
133
+ datasets==5.0.1
134
+ safetensors==0.8.0
135
+ accelerate==1.14.0
136
+ pydantic_core==2.46.4
137
+ ninja==1.13.0
138
+ autocommand==2.2.2
139
+ backports.tarfile==1.2.0
140
+ importlib_metadata==8.7.1
141
+ jaraco.text==4.0.0
142
+ jaraco.context==6.1.0
143
+ jaraco.functools==4.4.0
144
+ more-itertools==10.8.0
145
+ packaging==26.0
146
+ platformdirs==4.4.0
147
+ tomli==2.4.0
148
+ wheel==0.46.3
149
+ zipp==3.23.0
zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/wandb-metadata.json ADDED
@@ -0,0 +1,101 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "os": "Linux-5.15.0-126-generic-x86_64-with-glibc2.35",
3
+ "python": "CPython 3.11.15",
4
+ "startedAt": "2026-08-14T21:28:18.170018Z",
5
+ "args": [
6
+ "--config",
7
+ "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline.yaml",
8
+ "--variants",
9
+ "glu-waleed10",
10
+ "glu-silu-waleed10",
11
+ "mlp-waleed10",
12
+ "mlp-silu-waleed10",
13
+ "glu-waleed",
14
+ "glu-situglu_low",
15
+ "glu-waleedglu_low"
16
+ ],
17
+ "program": "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py",
18
+ "codePath": "sweep.py",
19
+ "codePathLocal": "sweep.py",
20
+ "git": {
21
+ "remote": "https://github.com/w-ahmad1a10/Activation.git",
22
+ "commit": "3fb47c6943d6927eafc39bd399a3d3a520bae74a"
23
+ },
24
+ "email": "deepnevro@gmail.com",
25
+ "root": "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation",
26
+ "host": "deeplens-k3s-node1",
27
+ "executable": "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python",
28
+ "cpu_count": 112,
29
+ "cpu_count_logical": 224,
30
+ "gpu": "NVIDIA H100 80GB HBM3",
31
+ "gpu_count": 8,
32
+ "disk": {
33
+ "/": {
34
+ "total": "1560765693952",
35
+ "used": "706489917440"
36
+ }
37
+ },
38
+ "memory": {
39
+ "total": "2164089937920"
40
+ },
41
+ "gpu_nvidia": [
42
+ {
43
+ "name": "NVIDIA H100 80GB HBM3",
44
+ "memoryTotal": "85520809984",
45
+ "cudaCores": 16896,
46
+ "architecture": "Hopper",
47
+ "uuid": "GPU-39c684a5-fde6-83d7-1663-0859795881ae"
48
+ },
49
+ {
50
+ "name": "NVIDIA H100 80GB HBM3",
51
+ "memoryTotal": "85520809984",
52
+ "cudaCores": 16896,
53
+ "architecture": "Hopper",
54
+ "uuid": "GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3"
55
+ },
56
+ {
57
+ "name": "NVIDIA H100 80GB HBM3",
58
+ "memoryTotal": "85520809984",
59
+ "cudaCores": 16896,
60
+ "architecture": "Hopper",
61
+ "uuid": "GPU-132944c4-b689-2b5f-89a4-d730401677ab"
62
+ },
63
+ {
64
+ "name": "NVIDIA H100 80GB HBM3",
65
+ "memoryTotal": "85520809984",
66
+ "cudaCores": 16896,
67
+ "architecture": "Hopper",
68
+ "uuid": "GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864"
69
+ },
70
+ {
71
+ "name": "NVIDIA H100 80GB HBM3",
72
+ "memoryTotal": "85520809984",
73
+ "cudaCores": 16896,
74
+ "architecture": "Hopper",
75
+ "uuid": "GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef"
76
+ },
77
+ {
78
+ "name": "NVIDIA H100 80GB HBM3",
79
+ "memoryTotal": "85520809984",
80
+ "cudaCores": 16896,
81
+ "architecture": "Hopper",
82
+ "uuid": "GPU-bc6c3e3c-9b90-09ca-c034-774961847c54"
83
+ },
84
+ {
85
+ "name": "NVIDIA H100 80GB HBM3",
86
+ "memoryTotal": "85520809984",
87
+ "cudaCores": 16896,
88
+ "architecture": "Hopper",
89
+ "uuid": "GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9"
90
+ },
91
+ {
92
+ "name": "NVIDIA H100 80GB HBM3",
93
+ "memoryTotal": "85520809984",
94
+ "cudaCores": 16896,
95
+ "architecture": "Hopper",
96
+ "uuid": "GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea"
97
+ }
98
+ ],
99
+ "cudaVersion": "12.4",
100
+ "writerId": "xio5js2delb7osbi95ndowruwry5o7mi"
101
+ }
zain/Activation/wandb/run-20260814_212818-fj94kr9p/files/wandb-summary.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"_runtime":1,"_wandb":{"runtime":1}}
zain/Activation/wandb/run-20260814_212818-fj94kr9p/logs/debug-core.log ADDED
@@ -0,0 +1,32 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-08-14T21:28:13.875214015Z","level":"INFO","msg":"main: starting server","port-filename":"/tmp/tmp61t5kns7/port-1193850.txt","pid":1193850,"detached":false,"idle-timeout":600000000000,"log-level":0,"disable-analytics":false,"shutdown-on-parent-exit":false,"enable-dcgm-profiling":false}
2
+ {"time":"2026-08-14T21:28:13.875684603Z","level":"INFO","msg":"server: will exit if parent process dies","ppid":1193850}
3
+ {"time":"2026-08-14T21:28:13.875676582Z","level":"INFO","msg":"server: accepting connections","addr":{"Name":"/tmp/wandb-1193850-1195287-1939645545/socket","Net":"unix"}}
4
+ {"time":"2026-08-14T21:28:14.052767875Z","level":"INFO","msg":"connection: ManageConnectionData: new connection created","id":"1(@)"}
5
+ {"time":"2026-08-14T21:28:14.184824068Z","level":"INFO","msg":"handleInformInit: received","streamId":"vtp6pf3m","id":"1(@)"}
6
+ {"time":"2026-08-14T21:28:14.445813383Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"vtp6pf3m","id":"1(@)"}
7
+ {"time":"2026-08-14T21:28:16.535398722Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"ppjgf4bx6kkl"}
8
+ {"time":"2026-08-14T21:28:17.132108791Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"ppjgf4bx6kkl"}
9
+ {"time":"2026-08-14T21:28:17.133244824Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"vtp6pf3m","id":"1(@)"}
10
+ {"time":"2026-08-14T21:28:17.13384059Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"vtp6pf3m","id":"1(@)"}
11
+ {"time":"2026-08-14T21:28:18.176700551Z","level":"INFO","msg":"handleInformInit: received","streamId":"fj94kr9p","id":"1(@)"}
12
+ {"time":"2026-08-14T21:28:18.417597198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"fj94kr9p","id":"1(@)"}
13
+ {"time":"2026-08-14T21:28:19.674866991Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"e4d4etq11mlq"}
14
+ {"time":"2026-08-14T21:28:20.222556488Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"e4d4etq11mlq"}
15
+ {"time":"2026-08-14T21:28:20.223783577Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"fj94kr9p","id":"1(@)"}
16
+ {"time":"2026-08-14T21:28:20.224344691Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"fj94kr9p","id":"1(@)"}
17
+ {"time":"2026-08-14T21:28:20.755487912Z","level":"INFO","msg":"handleInformInit: received","streamId":"ucwxn3gs","id":"1(@)"}
18
+ {"time":"2026-08-14T21:28:20.996759448Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"ucwxn3gs","id":"1(@)"}
19
+ {"time":"2026-08-14T21:28:26.491790165Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"4jw8kj1lwl6y"}
20
+ {"time":"2026-08-14T21:29:01.918410879Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"4jw8kj1lwl6y"}
21
+ {"time":"2026-08-14T21:29:02.578939706Z","level":"INFO","msg":"connection: cancelling request","id":"1(@)","requestId":"4jw8kj1lwl6y"}
22
+ {"time":"2026-08-14T21:29:02.580571999Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"ucwxn3gs","id":"1(@)"}
23
+ {"time":"2026-08-14T21:29:02.581104066Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"ucwxn3gs","id":"1(@)"}
24
+ {"time":"2026-08-14T21:29:02.642980411Z","level":"INFO","msg":"handleInformTeardown: server teardown initiated","id":"1(@)"}
25
+ {"time":"2026-08-14T21:29:02.643036973Z","level":"INFO","msg":"handleInformTeardown: server shutdown complete","id":"1(@)"}
26
+ {"time":"2026-08-14T21:29:02.643048401Z","level":"INFO","msg":"connection: closing","id":"1(@)"}
27
+ {"time":"2026-08-14T21:29:02.643056857Z","level":"INFO","msg":"server: is shutting down"}
28
+ {"time":"2026-08-14T21:29:02.643101792Z","level":"INFO","msg":"connection: closed successfully","id":"1(@)"}
29
+ {"time":"2026-08-14T21:29:02.643077696Z","level":"INFO","msg":"processOutgoingData: finished","id":"1(@)"}
30
+ {"time":"2026-08-14T21:29:02.643124976Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"1(@)"}
31
+ {"time":"2026-08-14T21:29:02.643304099Z","level":"INFO","msg":"server: listener closed","addr":{"Name":"/tmp/wandb-1193850-1195287-1939645545/socket","Net":"unix"}}
32
+ {"time":"2026-08-14T21:29:02.643377148Z","level":"INFO","msg":"server: all connections closed"}
zain/Activation/wandb/run-20260814_212818-fj94kr9p/logs/debug-internal.log ADDED
@@ -0,0 +1,17 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-08-14T21:28:18.176855561Z","level":"INFO","msg":"wandb-core"}
2
+ {"time":"2026-08-14T21:28:18.176991497Z","level":"INFO","msg":"stream: starting","core version":"0.28.1"}
3
+ {"time":"2026-08-14T21:28:18.417418398Z","level":"INFO","msg":"stream: created new stream","id":"fj94kr9p"}
4
+ {"time":"2026-08-14T21:28:18.417508597Z","level":"INFO","msg":"handler: started"}
5
+ {"time":"2026-08-14T21:28:18.417590145Z","level":"INFO","msg":"stream: started"}
6
+ {"time":"2026-08-14T21:28:18.417602631Z","level":"INFO","msg":"writer: started","stream_id":"fj94kr9p"}
7
+ {"time":"2026-08-14T21:28:18.417629181Z","level":"INFO","msg":"sender: started"}
8
+ {"time":"2026-08-14T21:28:18.755471757Z","level":"INFO","msg":"filestream: sending request","total_files":1,"console_offset":0,"console_lines":1}
9
+ {"time":"2026-08-14T21:28:18.858554768Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
10
+ {"time":"2026-08-14T21:28:20.070727266Z","level":"INFO","msg":"fileTransfer: Close: file transfer manager closed"}
11
+ {"time":"2026-08-14T21:28:20.070978952Z","level":"INFO","msg":"filestream: sending request","total_files":2,"console_offset":0,"console_lines":49,"uploaded_len":5,"complete":true,"exit_code":0}
12
+ {"time":"2026-08-14T21:28:20.219838371Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
13
+ {"time":"2026-08-14T21:28:20.221222209Z","level":"INFO","msg":"handler: operation stats","stats":{}}
14
+ {"time":"2026-08-14T21:28:20.223817082Z","level":"INFO","msg":"stream: finishing up"}
15
+ {"time":"2026-08-14T21:28:20.223834217Z","level":"INFO","msg":"handler: closed"}
16
+ {"time":"2026-08-14T21:28:20.22390683Z","level":"INFO","msg":"sender: closed"}
17
+ {"time":"2026-08-14T21:28:20.223912113Z","level":"INFO","msg":"stream: all finished"}
zain/Activation/wandb/run-20260814_212818-fj94kr9p/logs/debug.log ADDED
@@ -0,0 +1,24 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 2026-08-14 21:28:18,171 INFO MainThread:1193850 [wandb_init.py:setup_run_log_directory():729] Logging user logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_212818-fj94kr9p/logs/debug.log
2
+ 2026-08-14 21:28:18,175 INFO MainThread:1193850 [wandb_init.py:setup_run_log_directory():730] Logging internal logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_212818-fj94kr9p/logs/debug-internal.log
3
+ 2026-08-14 21:28:18,175 INFO MainThread:1193850 [wandb_init.py:init():772] calling init triggers
4
+ 2026-08-14 21:28:18,175 INFO MainThread:1193850 [wandb_init.py:init():777] wandb.init called with sweep_config: {}
5
+ config: {'_wandb': {}}
6
+ 2026-08-14 21:28:18,175 INFO MainThread:1193850 [wandb_init.py:init():820] starting backend
7
+ 2026-08-14 21:28:18,175 INFO MainThread:1193850 [wandb_init.py:init():835] sending inform_init request
8
+ 2026-08-14 21:28:18,418 INFO MainThread:1193850 [wandb_init.py:init():840] backend started and connected
9
+ 2026-08-14 21:28:18,419 INFO MainThread:1193850 [wandb_init.py:init():910] updated telemetry
10
+ 2026-08-14 21:28:18,425 INFO MainThread:1193850 [wandb_init.py:init():933] communicating run to backend with 90.0 second timeout
11
+ 2026-08-14 21:28:18,670 INFO MainThread:1193850 [wandb_init.py:init():978] starting run threads in backend
12
+ 2026-08-14 21:28:18,749 INFO MainThread:1193850 [wandb_run.py:_console_start():2621] atexit reg
13
+ 2026-08-14 21:28:18,750 INFO MainThread:1193850 [wandb_run.py:_redirect():2471] redirect: wrap_raw
14
+ 2026-08-14 21:28:18,750 INFO MainThread:1193850 [wandb_run.py:_redirect():2540] Wrapping output streams.
15
+ 2026-08-14 21:28:18,750 INFO MainThread:1193850 [wandb_run.py:_redirect():2563] Redirects installed.
16
+ 2026-08-14 21:28:18,751 INFO MainThread:1193850 [wandb_init.py:init():1016] run started, returning control to user process
17
+ 2026-08-14 21:28:18,752 INFO MainThread:1193850 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 21, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'silu-waleed10', 'waleed_beta': 10.0, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-silu-waleed10-21L_run', 'per_device_train_batch_size': 512, 'num_train_epochs': 1, 'max_steps': 1000, 'learning_rate': 0.001, 'lr_scheduler_type': 'constant', 'lr_scheduler_kwargs': None, 'warmup_steps': 0, 'optim': 'adamw_torch', 'optim_args': None, 'weight_decay': 0.01, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-silu-waleed10-21L-4.0M-20260814-212817', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 60000, 'eval_delay': 0, 'per_device_eval_batch_size': 512, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 100, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/A-glu-silu-waleed10-21L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
18
+ 2026-08-14 21:28:18,754 INFO MainThread:1193850 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 3970432 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x1462d29e8f90>>
19
+ 2026-08-14 21:28:18,754 INFO MainThread:1193850 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 3970432 None
20
+ 2026-08-14 21:28:19,673 INFO MainThread:1193850 [wandb_run.py:_finish():2383] finishing run deepnevro-deepnevro/research1/fj94kr9p
21
+ 2026-08-14 21:28:19,674 INFO MainThread:1193850 [wandb_run.py:_atexit_cleanup():2588] got exitcode: 0
22
+ 2026-08-14 21:28:19,674 INFO MainThread:1193850 [wandb_run.py:_restore():2570] restore
23
+ 2026-08-14 21:28:19,674 INFO MainThread:1193850 [wandb_run.py:_restore():2576] restore done
24
+ 2026-08-14 21:28:20,223 INFO MainThread:1193850 [wandb_run.py:_footer_sync_info():3993] logging synced files
zain/Activation/wandb/run-20260814_212818-fj94kr9p/run-fj94kr9p.wandb ADDED
Binary file (13.9 kB). View file
 
zain/Activation/wandb/run-20260814_212820-ucwxn3gs/files/config.yaml ADDED
@@ -0,0 +1,438 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ _name_or_path:
2
+ value: ""
3
+ _wandb:
4
+ value:
5
+ cli_version: 0.28.1
6
+ e:
7
+ 2drnyjxeagicq7ia3qgncq8z361n6gif:
8
+ args:
9
+ - --config
10
+ - /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline.yaml
11
+ - --variants
12
+ - glu-waleed10
13
+ - glu-silu-waleed10
14
+ - mlp-waleed10
15
+ - mlp-silu-waleed10
16
+ - glu-waleed
17
+ - glu-situglu_low
18
+ - glu-waleedglu_low
19
+ codePath: sweep.py
20
+ codePathLocal: sweep.py
21
+ cpu_count: 112
22
+ cpu_count_logical: 224
23
+ cudaVersion: "12.4"
24
+ disk:
25
+ /:
26
+ total: "1560765693952"
27
+ used: "706489917440"
28
+ email: deepnevro@gmail.com
29
+ executable: /mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python
30
+ git:
31
+ commit: 3fb47c6943d6927eafc39bd399a3d3a520bae74a
32
+ remote: https://github.com/w-ahmad1a10/Activation.git
33
+ gpu: NVIDIA H100 80GB HBM3
34
+ gpu_count: 8
35
+ gpu_nvidia:
36
+ - architecture: Hopper
37
+ cudaCores: 16896
38
+ memoryTotal: "85520809984"
39
+ name: NVIDIA H100 80GB HBM3
40
+ uuid: GPU-39c684a5-fde6-83d7-1663-0859795881ae
41
+ - architecture: Hopper
42
+ cudaCores: 16896
43
+ memoryTotal: "85520809984"
44
+ name: NVIDIA H100 80GB HBM3
45
+ uuid: GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3
46
+ - architecture: Hopper
47
+ cudaCores: 16896
48
+ memoryTotal: "85520809984"
49
+ name: NVIDIA H100 80GB HBM3
50
+ uuid: GPU-132944c4-b689-2b5f-89a4-d730401677ab
51
+ - architecture: Hopper
52
+ cudaCores: 16896
53
+ memoryTotal: "85520809984"
54
+ name: NVIDIA H100 80GB HBM3
55
+ uuid: GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864
56
+ - architecture: Hopper
57
+ cudaCores: 16896
58
+ memoryTotal: "85520809984"
59
+ name: NVIDIA H100 80GB HBM3
60
+ uuid: GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef
61
+ - architecture: Hopper
62
+ cudaCores: 16896
63
+ memoryTotal: "85520809984"
64
+ name: NVIDIA H100 80GB HBM3
65
+ uuid: GPU-bc6c3e3c-9b90-09ca-c034-774961847c54
66
+ - architecture: Hopper
67
+ cudaCores: 16896
68
+ memoryTotal: "85520809984"
69
+ name: NVIDIA H100 80GB HBM3
70
+ uuid: GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9
71
+ - architecture: Hopper
72
+ cudaCores: 16896
73
+ memoryTotal: "85520809984"
74
+ name: NVIDIA H100 80GB HBM3
75
+ uuid: GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea
76
+ host: deeplens-k3s-node1
77
+ memory:
78
+ total: "2164089937920"
79
+ os: Linux-5.15.0-126-generic-x86_64-with-glibc2.35
80
+ program: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py
81
+ python: CPython 3.11.15
82
+ root: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation
83
+ startedAt: "2026-08-14T21:28:20.753237Z"
84
+ writerId: 2drnyjxeagicq7ia3qgncq8z361n6gif
85
+ m:
86
+ - "1": train/global_step
87
+ "6":
88
+ - 3
89
+ "7": []
90
+ - "2": '*'
91
+ "5": 1
92
+ "6":
93
+ - 1
94
+ "7": []
95
+ python_version: 3.11.15
96
+ t:
97
+ "1":
98
+ - 1
99
+ - 5
100
+ - 11
101
+ - 41
102
+ - 49
103
+ - 51
104
+ - 53
105
+ - 71
106
+ "2":
107
+ - 1
108
+ - 5
109
+ - 11
110
+ - 41
111
+ - 49
112
+ - 51
113
+ - 53
114
+ - 71
115
+ "3":
116
+ - 2
117
+ - 7
118
+ - 13
119
+ - 19
120
+ - 66
121
+ "4": 3.11.15
122
+ "5": 0.28.1
123
+ "6": 5.16.0.dev0
124
+ "9":
125
+ "1": transformers_trainer
126
+ "12": 0.28.1
127
+ "13": linux-x86_64
128
+ accelerator_config:
129
+ value:
130
+ dispatch_batches: null
131
+ even_batches: true
132
+ gradient_accumulation_kwargs: null
133
+ non_blocking: false
134
+ split_batches: false
135
+ use_seedable_sampler: true
136
+ activation:
137
+ value: waleed10
138
+ adam_beta1:
139
+ value: 0.9
140
+ adam_beta2:
141
+ value: 0.999
142
+ adam_epsilon:
143
+ value: 1e-08
144
+ architectures:
145
+ value: null
146
+ attention_bias:
147
+ value: false
148
+ attention_dropout:
149
+ value: 0
150
+ auto_find_batch_size:
151
+ value: false
152
+ average_tokens_across_devices:
153
+ value: true
154
+ batch_eval_metrics:
155
+ value: false
156
+ bf16:
157
+ value: true
158
+ bf16_full_eval:
159
+ value: false
160
+ bos_token_id:
161
+ value: 1
162
+ chunk_size_feed_forward:
163
+ value: 0
164
+ data_seed:
165
+ value: 42
166
+ dataloader_drop_last:
167
+ value: false
168
+ dataloader_in_order:
169
+ value: true
170
+ dataloader_multiprocessing_context:
171
+ value: null
172
+ dataloader_num_workers:
173
+ value: 0
174
+ dataloader_persistent_workers:
175
+ value: false
176
+ dataloader_pin_memory:
177
+ value: true
178
+ dataloader_prefetch_factor:
179
+ value: null
180
+ ddp_backend:
181
+ value: null
182
+ ddp_broadcast_buffers:
183
+ value: null
184
+ ddp_bucket_cap_mb:
185
+ value: null
186
+ ddp_find_unused_parameters:
187
+ value: null
188
+ ddp_static_graph:
189
+ value: null
190
+ ddp_timeout:
191
+ value: 1800
192
+ debug:
193
+ value: []
194
+ deepspeed:
195
+ value: null
196
+ disable_tqdm:
197
+ value: false
198
+ do_eval:
199
+ value: true
200
+ do_predict:
201
+ value: false
202
+ do_train:
203
+ value: false
204
+ dtype:
205
+ value: null
206
+ enable_jit_checkpoint:
207
+ value: false
208
+ eos_token_id:
209
+ value: 2
210
+ eval_accumulation_steps:
211
+ value: null
212
+ eval_delay:
213
+ value: 0
214
+ eval_do_concat_batches:
215
+ value: true
216
+ eval_on_start:
217
+ value: false
218
+ eval_steps:
219
+ value: 60000
220
+ eval_strategy:
221
+ value: steps
222
+ eval_use_gather_object:
223
+ value: false
224
+ fp16:
225
+ value: false
226
+ fp16_full_eval:
227
+ value: false
228
+ fsdp:
229
+ value: null
230
+ fsdp_config:
231
+ value: null
232
+ full_determinism:
233
+ value: false
234
+ gradient_accumulation_steps:
235
+ value: 1
236
+ gradient_checkpointing:
237
+ value: false
238
+ gradient_checkpointing_kwargs:
239
+ value: null
240
+ greater_is_better:
241
+ value: null
242
+ head_dim:
243
+ value: 32
244
+ hidden_act:
245
+ value: silu
246
+ hidden_size:
247
+ value: 128
248
+ hub_always_push:
249
+ value: false
250
+ hub_model_id:
251
+ value: w-ahmad/A-mlp-waleed10-21L
252
+ hub_private_repo:
253
+ value: null
254
+ hub_revision:
255
+ value: null
256
+ hub_strategy:
257
+ value: every_save
258
+ hub_token:
259
+ value: <HUB_TOKEN>
260
+ id2label:
261
+ value:
262
+ "0": LABEL_0
263
+ "1": LABEL_1
264
+ ignore_data_skip:
265
+ value: false
266
+ include_for_metrics:
267
+ value: []
268
+ include_num_input_tokens_seen:
269
+ value: "no"
270
+ initializer_range:
271
+ value: 0.02
272
+ intermediate_size:
273
+ value: 256
274
+ is_encoder_decoder:
275
+ value: false
276
+ label_names:
277
+ value: null
278
+ label_smoothing_factor:
279
+ value: 0
280
+ label2id:
281
+ value:
282
+ LABEL_0: 0
283
+ LABEL_1: 1
284
+ learning_rate:
285
+ value: 0.001
286
+ length_column_name:
287
+ value: length
288
+ liger_kernel_config:
289
+ value: null
290
+ load_best_model_at_end:
291
+ value: false
292
+ local_rank:
293
+ value: -1
294
+ log_level:
295
+ value: passive
296
+ log_level_replica:
297
+ value: warning
298
+ log_on_each_node:
299
+ value: true
300
+ logging_first_step:
301
+ value: false
302
+ logging_nan_inf_filter:
303
+ value: true
304
+ logging_steps:
305
+ value: 20
306
+ logging_strategy:
307
+ value: steps
308
+ lr_scheduler_kwargs:
309
+ value: null
310
+ lr_scheduler_type:
311
+ value: constant
312
+ max_grad_norm:
313
+ value: 1
314
+ max_position_embeddings:
315
+ value: 512
316
+ max_steps:
317
+ value: 1000
318
+ metric_for_best_model:
319
+ value: null
320
+ mlp_bias:
321
+ value: false
322
+ mlp_type:
323
+ value: mlp
324
+ model/num_parameters:
325
+ value: 3970432
326
+ model_type:
327
+ value: tiny_llama
328
+ neftune_noise_alpha:
329
+ value: null
330
+ num_attention_heads:
331
+ value: 4
332
+ num_hidden_layers:
333
+ value: 21
334
+ num_key_value_heads:
335
+ value: 4
336
+ num_train_epochs:
337
+ value: 1
338
+ optim:
339
+ value: adamw_torch
340
+ optim_args:
341
+ value: null
342
+ optim_target_modules:
343
+ value: null
344
+ output_attentions:
345
+ value: false
346
+ output_dir:
347
+ value: out/mlp-waleed10-21L_run
348
+ output_hidden_states:
349
+ value: false
350
+ pad_token_id:
351
+ value: 0
352
+ parallelism_config:
353
+ value: null
354
+ per_device_eval_batch_size:
355
+ value: 512
356
+ per_device_train_batch_size:
357
+ value: 512
358
+ prediction_loss_only:
359
+ value: false
360
+ pretraining_tp:
361
+ value: 1
362
+ problem_type:
363
+ value: null
364
+ project:
365
+ value: huggingface
366
+ push_to_hub:
367
+ value: false
368
+ remove_unused_columns:
369
+ value: false
370
+ report_to:
371
+ value:
372
+ - wandb
373
+ restore_callback_states_from_checkpoint:
374
+ value: false
375
+ resume_from_checkpoint:
376
+ value: null
377
+ return_dict:
378
+ value: true
379
+ rms_norm_eps:
380
+ value: 1e-06
381
+ rope_parameters:
382
+ value:
383
+ rope_theta: 10000
384
+ rope_type: default
385
+ run_name:
386
+ value: LM-mlp-waleed10-21L-4.0M-20260814-212820
387
+ save_on_each_node:
388
+ value: false
389
+ save_only_model:
390
+ value: false
391
+ save_steps:
392
+ value: 100
393
+ save_strategy:
394
+ value: steps
395
+ save_total_limit:
396
+ value: null
397
+ seed:
398
+ value: 42
399
+ skip_memory_metrics:
400
+ value: true
401
+ tf32:
402
+ value: null
403
+ tie_word_embeddings:
404
+ value: true
405
+ tokenizer_name:
406
+ value: w-ahmad/tiny-stories-tokenizer
407
+ torch_compile:
408
+ value: false
409
+ torch_compile_backend:
410
+ value: null
411
+ torch_compile_mode:
412
+ value: null
413
+ torch_empty_cache_steps:
414
+ value: null
415
+ trackio_bucket_id:
416
+ value: null
417
+ trackio_space_id:
418
+ value: null
419
+ trackio_static_space_id:
420
+ value: null
421
+ train_sampling_strategy:
422
+ value: random
423
+ transformers_version:
424
+ value: 5.16.0.dev0
425
+ use_cache:
426
+ value: false
427
+ use_cpu:
428
+ value: false
429
+ use_liger_kernel:
430
+ value: false
431
+ vocab_size:
432
+ value: 4096
433
+ waleed_beta:
434
+ value: 10
435
+ warmup_steps:
436
+ value: 0
437
+ weight_decay:
438
+ value: 0.01
zain/Activation/wandb/run-20260814_212820-ucwxn3gs/files/output.log ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ 5%|▍ | 46/1000 [00:39<15:11, 1.05it/s]
2
+ {'loss': '7.273', 'grad_norm': '1.055', 'learning_rate': '0.001', 'epoch': '0.01078', 'train/total_time_seconds': '6.615', 'train/time_per_step_avg': '0.3307', 'train/epoch_time_elapsed': '14.85', 'train/estimated_remaining_minutes': '5.402'}
3
+ {'loss': '5.986', 'grad_norm': '0.8242', 'learning_rate': '0.001', 'epoch': '0.02156', 'train/total_time_seconds': '18.31', 'train/time_per_step_avg': '0.4577', 'train/epoch_time_elapsed': '34.23', 'train/estimated_remaining_minutes': '7.323'}
zain/Activation/wandb/run-20260814_212820-ucwxn3gs/files/requirements.txt ADDED
@@ -0,0 +1,149 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ asttokens==3.0.1
2
+ comm==0.2.3
3
+ debugpy==1.8.21
4
+ decorator==5.3.1
5
+ executing==2.2.1
6
+ nest-asyncio==1.6.0
7
+ parso==0.8.7
8
+ platformdirs==4.11.0
9
+ psutil==7.2.2
10
+ ptyprocess==0.7.0
11
+ pure_eval==0.2.3
12
+ Pygments==2.20.0
13
+ pyzmq==27.1.0
14
+ setuptools==83.0.0
15
+ six==1.17.0
16
+ tornado==6.5.7
17
+ traitlets==5.15.0
18
+ fsspec==2026.4.0
19
+ wcwidth==0.8.2
20
+ ipython_pygments_lexers==1.1.1
21
+ jedi==0.20.0
22
+ jupyter_core==5.9.1
23
+ matplotlib-inline==0.2.2
24
+ pexpect==4.9.0
25
+ prompt_toolkit==3.0.53
26
+ python-dateutil==2.9.0.post0
27
+ stack_data==0.6.3
28
+ wheel==0.47.0
29
+ jupyter_client==8.9.1
30
+ pip==26.1.2
31
+ ipython==9.15.0
32
+ ipykernel==7.2.0
33
+ threadpoolctl==3.6.0
34
+ pyparsing==3.3.2
35
+ typing_extensions==4.15.0
36
+ Jinja2==3.1.6
37
+ narwhals==2.24.0
38
+ kiwisolver==1.5.0
39
+ joblib==1.5.3
40
+ fonttools==4.63.0
41
+ cycler==0.12.1
42
+ scipy==1.17.1
43
+ pandas==3.0.5
44
+ contourpy==1.3.3
45
+ scikit-learn==1.9.0
46
+ matplotlib==3.11.1
47
+ urllib3==2.7.0
48
+ tqdm==4.70.0
49
+ idna==3.18
50
+ charset-normalizer==3.4.9
51
+ certifi==2026.7.22
52
+ requests==2.34.2
53
+ seaborn==0.13.2
54
+ uv==0.12.0
55
+ shellingham==1.5.4
56
+ mpmath==1.3.0
57
+ attrs==26.1.0
58
+ hf-xet==1.5.2
59
+ nvidia-nccl-cu12==2.21.5
60
+ MarkupSafe==3.0.3
61
+ regex==2026.7.19
62
+ importlib_metadata==9.0.0
63
+ httpcore==1.0.9
64
+ annotated-doc==0.0.5
65
+ multidict==6.7.1
66
+ aiohttp==3.14.3
67
+ aiosignal==1.4.0
68
+ xxhash==3.8.1
69
+ aiohappyeyeballs==2.7.1
70
+ mdurl==0.1.2
71
+ cuda-toolkit==13.0.3.0
72
+ networkx==3.6.1
73
+ PyYAML==6.0.3
74
+ nvidia-cufile==1.15.1.6
75
+ typer==0.27.0
76
+ torchaudio==2.6.0+cu124
77
+ rich==15.0.0
78
+ nvidia-cufft-cu12==11.2.1.3
79
+ h11==0.16.0
80
+ dill==0.4.1
81
+ cuda-pathfinder==1.6.0
82
+ filelock==3.29.0
83
+ nvidia-nvtx-cu12==12.4.127
84
+ httpx==0.28.1
85
+ anyio==4.14.2
86
+ numpy==2.4.4
87
+ yarl==1.24.5
88
+ click==8.4.2
89
+ triton==3.2.0
90
+ frozenlist==1.8.0
91
+ zipp==4.1.0
92
+ propcache==0.5.2
93
+ tokenizers==0.22.2
94
+ markdown-it-py==4.2.0
95
+ nvidia-cuda-runtime==13.0.96
96
+ cuda-bindings==13.3.1
97
+ nvidia-cuda-cupti==13.0.85
98
+ torch==2.6.0+cu124
99
+ multiprocess==0.70.19
100
+ pillow==12.2.0
101
+ transformers==5.16.0.dev0
102
+ wandb==0.28.1
103
+ nvidia-curand==10.4.0.35
104
+ sympy==1.13.1
105
+ nvidia-cusparse==12.6.3.3
106
+ nvidia-cuda-nvrtc==13.0.88
107
+ typing-inspection==0.4.2
108
+ nvidia-cusolver==12.0.4.66
109
+ nvidia-cufft==12.0.0.61
110
+ nvidia-cudnn-cu13==9.20.0.48
111
+ nvidia-cublas==13.1.1.3
112
+ pyarrow==25.0.0
113
+ evaluate==0.4.6
114
+ diffusers==0.39.0
115
+ pydantic==2.13.4
116
+ annotated-types==0.8.0
117
+ protobuf==7.35.1
118
+ sentry-sdk==2.66.1
119
+ einops==0.8.2
120
+ packaging==26.2
121
+ nvidia-nvjitlink-cu12==12.4.127
122
+ nvidia-curand-cu12==10.3.5.147
123
+ nvidia-cusparselt-cu12==0.6.2
124
+ nvidia-cusparse-cu12==12.3.1.170
125
+ nvidia-cuda-runtime-cu12==12.4.127
126
+ torchvision==0.21.0+cu124
127
+ nvidia-cuda-nvrtc-cu12==12.4.127
128
+ nvidia-cuda-cupti-cu12==12.4.127
129
+ nvidia-cusolver-cu12==11.6.1.9
130
+ nvidia-cublas-cu12==12.4.5.8
131
+ nvidia-cudnn-cu12==9.1.0.70
132
+ huggingface_hub==1.26.0
133
+ datasets==5.0.1
134
+ safetensors==0.8.0
135
+ accelerate==1.14.0
136
+ pydantic_core==2.46.4
137
+ ninja==1.13.0
138
+ autocommand==2.2.2
139
+ backports.tarfile==1.2.0
140
+ importlib_metadata==8.7.1
141
+ jaraco.text==4.0.0
142
+ jaraco.context==6.1.0
143
+ jaraco.functools==4.4.0
144
+ more-itertools==10.8.0
145
+ packaging==26.0
146
+ platformdirs==4.4.0
147
+ tomli==2.4.0
148
+ wheel==0.46.3
149
+ zipp==3.23.0
zain/Activation/wandb/run-20260814_212820-ucwxn3gs/files/wandb-metadata.json ADDED
@@ -0,0 +1,101 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "os": "Linux-5.15.0-126-generic-x86_64-with-glibc2.35",
3
+ "python": "CPython 3.11.15",
4
+ "startedAt": "2026-08-14T21:28:20.753237Z",
5
+ "args": [
6
+ "--config",
7
+ "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline.yaml",
8
+ "--variants",
9
+ "glu-waleed10",
10
+ "glu-silu-waleed10",
11
+ "mlp-waleed10",
12
+ "mlp-silu-waleed10",
13
+ "glu-waleed",
14
+ "glu-situglu_low",
15
+ "glu-waleedglu_low"
16
+ ],
17
+ "program": "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py",
18
+ "codePath": "sweep.py",
19
+ "codePathLocal": "sweep.py",
20
+ "git": {
21
+ "remote": "https://github.com/w-ahmad1a10/Activation.git",
22
+ "commit": "3fb47c6943d6927eafc39bd399a3d3a520bae74a"
23
+ },
24
+ "email": "deepnevro@gmail.com",
25
+ "root": "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation",
26
+ "host": "deeplens-k3s-node1",
27
+ "executable": "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python",
28
+ "cpu_count": 112,
29
+ "cpu_count_logical": 224,
30
+ "gpu": "NVIDIA H100 80GB HBM3",
31
+ "gpu_count": 8,
32
+ "disk": {
33
+ "/": {
34
+ "total": "1560765693952",
35
+ "used": "706489917440"
36
+ }
37
+ },
38
+ "memory": {
39
+ "total": "2164089937920"
40
+ },
41
+ "gpu_nvidia": [
42
+ {
43
+ "name": "NVIDIA H100 80GB HBM3",
44
+ "memoryTotal": "85520809984",
45
+ "cudaCores": 16896,
46
+ "architecture": "Hopper",
47
+ "uuid": "GPU-39c684a5-fde6-83d7-1663-0859795881ae"
48
+ },
49
+ {
50
+ "name": "NVIDIA H100 80GB HBM3",
51
+ "memoryTotal": "85520809984",
52
+ "cudaCores": 16896,
53
+ "architecture": "Hopper",
54
+ "uuid": "GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3"
55
+ },
56
+ {
57
+ "name": "NVIDIA H100 80GB HBM3",
58
+ "memoryTotal": "85520809984",
59
+ "cudaCores": 16896,
60
+ "architecture": "Hopper",
61
+ "uuid": "GPU-132944c4-b689-2b5f-89a4-d730401677ab"
62
+ },
63
+ {
64
+ "name": "NVIDIA H100 80GB HBM3",
65
+ "memoryTotal": "85520809984",
66
+ "cudaCores": 16896,
67
+ "architecture": "Hopper",
68
+ "uuid": "GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864"
69
+ },
70
+ {
71
+ "name": "NVIDIA H100 80GB HBM3",
72
+ "memoryTotal": "85520809984",
73
+ "cudaCores": 16896,
74
+ "architecture": "Hopper",
75
+ "uuid": "GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef"
76
+ },
77
+ {
78
+ "name": "NVIDIA H100 80GB HBM3",
79
+ "memoryTotal": "85520809984",
80
+ "cudaCores": 16896,
81
+ "architecture": "Hopper",
82
+ "uuid": "GPU-bc6c3e3c-9b90-09ca-c034-774961847c54"
83
+ },
84
+ {
85
+ "name": "NVIDIA H100 80GB HBM3",
86
+ "memoryTotal": "85520809984",
87
+ "cudaCores": 16896,
88
+ "architecture": "Hopper",
89
+ "uuid": "GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9"
90
+ },
91
+ {
92
+ "name": "NVIDIA H100 80GB HBM3",
93
+ "memoryTotal": "85520809984",
94
+ "cudaCores": 16896,
95
+ "architecture": "Hopper",
96
+ "uuid": "GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea"
97
+ }
98
+ ],
99
+ "cudaVersion": "12.4",
100
+ "writerId": "2drnyjxeagicq7ia3qgncq8z361n6gif"
101
+ }