w-ahmad commited on
Commit
c3f55d9
·
verified ·
1 Parent(s): 8c0fb15

Auto upload zain 2026-08-14T21:19:40.486080 (part 4)

Browse files
Files changed (26) hide show
  1. .gitattributes +2 -0
  2. zain/Activation/wandb/debug-internal.log +65 -12
  3. zain/Activation/wandb/debug.log +19 -18
  4. zain/Activation/wandb/run-20260814_193907-kk1xbqht/logs/debug-core.log +7 -0
  5. zain/Activation/wandb/run-20260814_195151-ix6wcbwv/logs/debug-core.log +7 -0
  6. zain/Activation/wandb/run-20260814_200503-bdhnr27j/logs/debug-core.log +7 -0
  7. zain/Activation/wandb/run-20260814_202128-twgo1e89/logs/debug-core.log +7 -0
  8. zain/Activation/wandb/run-20260814_203803-7p5140bq/logs/debug-core.log +7 -0
  9. zain/Activation/wandb/run-20260814_210109-qauftiuh/logs/debug-core.log +7 -0
  10. zain/Activation/wandb/run-20260814_210809-a6574zx8/files/config.yaml +439 -0
  11. zain/Activation/wandb/run-20260814_210809-a6574zx8/files/output.log +7 -0
  12. zain/Activation/wandb/run-20260814_210809-a6574zx8/files/wandb-summary.json +0 -0
  13. zain/Activation/wandb/run-20260814_210809-a6574zx8/logs/debug-core.log +7 -0
  14. zain/Activation/wandb/run-20260814_210809-a6574zx8/logs/debug-internal.log +10 -0
  15. zain/Activation/wandb/run-20260814_210809-a6574zx8/logs/debug.log +5 -0
  16. zain/Activation/wandb/run-20260814_210809-a6574zx8/run-a6574zx8.wandb +2 -2
  17. zain/Activation/wandb/run-20260814_211407-i85cngas/files/output.log +43 -1
  18. zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug-internal.log +40 -0
  19. zain/Activation/wandb/run-20260814_211407-i85cngas/run-i85cngas.wandb +0 -0
  20. zain/Activation/wandb/run-20260814_211507-54wnyexz/files/output.log +74 -0
  21. zain/Activation/wandb/run-20260814_211507-54wnyexz/files/requirements.txt +149 -0
  22. zain/Activation/wandb/run-20260814_211507-54wnyexz/files/wandb-metadata.json +99 -0
  23. zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug-core.log +63 -0
  24. zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug-internal.log +65 -0
  25. zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug.log +20 -0
  26. zain/Activation/wandb/run-20260814_211507-54wnyexz/run-54wnyexz.wandb +3 -0
.gitattributes CHANGED
@@ -57,3 +57,5 @@ zain/Activation/wandb/run-20260814_210155-rxpj34pj/run-rxpj34pj.wandb filter=lfs
57
  zain/Activation/wandb/run-20260814_210809-a6574zx8/run-a6574zx8.wandb filter=lfs diff=lfs merge=lfs -text
58
  zain/Activation/out/glu-gelu-100L_trash_run/training_log.jsonl filter=lfs diff=lfs merge=lfs -text
59
  zain/Activation/out/glu-sigmoid-100L_trash_run/training_log.jsonl filter=lfs diff=lfs merge=lfs -text
 
 
 
57
  zain/Activation/wandb/run-20260814_210809-a6574zx8/run-a6574zx8.wandb filter=lfs diff=lfs merge=lfs -text
58
  zain/Activation/out/glu-gelu-100L_trash_run/training_log.jsonl filter=lfs diff=lfs merge=lfs -text
59
  zain/Activation/out/glu-sigmoid-100L_trash_run/training_log.jsonl filter=lfs diff=lfs merge=lfs -text
60
+ zain/Activation/wandb/run-20260814_211407-i85cngas/run-i85cngas.wandb filter=lfs diff=lfs merge=lfs -text
61
+ zain/Activation/wandb/run-20260814_211507-54wnyexz/run-54wnyexz.wandb filter=lfs diff=lfs merge=lfs -text
zain/Activation/wandb/debug-internal.log CHANGED
@@ -1,12 +1,65 @@
1
- {"time":"2026-08-14T21:14:07.911227197Z","level":"INFO","msg":"wandb-core"}
2
- {"time":"2026-08-14T21:14:07.911377478Z","level":"INFO","msg":"stream: starting","core version":"0.28.1"}
3
- {"time":"2026-08-14T21:14:08.168044483Z","level":"INFO","msg":"stream: created new stream","id":"i85cngas"}
4
- {"time":"2026-08-14T21:14:08.16812752Z","level":"INFO","msg":"handler: started"}
5
- {"time":"2026-08-14T21:14:08.168213295Z","level":"INFO","msg":"stream: started"}
6
- {"time":"2026-08-14T21:14:08.168225298Z","level":"INFO","msg":"writer: started","stream_id":"i85cngas"}
7
- {"time":"2026-08-14T21:14:08.168254998Z","level":"INFO","msg":"sender: started"}
8
- {"time":"2026-08-14T21:14:08.675326195Z","level":"INFO","msg":"filestream: sending request","total_files":1,"console_offset":0,"console_lines":1}
9
- {"time":"2026-08-14T21:14:08.803069742Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
10
- {"time":"2026-08-14T21:14:23.675538684Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":0,"history_lines":1,"events_offset":0,"events_lines":1,"console_offset":0,"console_lines":2,"uploaded_len":2}
11
- {"time":"2026-08-14T21:14:23.78531736Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
12
- {"time":"2026-08-14T21:14:38.67602145Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1,"history_lines":1,"events_offset":1,"events_lines":2,"console_offset":0,"console_lines":1}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-08-14T21:15:07.169424866Z","level":"INFO","msg":"wandb-core"}
2
+ {"time":"2026-08-14T21:15:07.169567468Z","level":"INFO","msg":"stream: starting","core version":"0.28.1"}
3
+ {"time":"2026-08-14T21:15:07.435532929Z","level":"INFO","msg":"stream: created new stream","id":"54wnyexz"}
4
+ {"time":"2026-08-14T21:15:07.435601691Z","level":"INFO","msg":"handler: started"}
5
+ {"time":"2026-08-14T21:15:07.435689178Z","level":"INFO","msg":"stream: started"}
6
+ {"time":"2026-08-14T21:15:07.43571596Z","level":"INFO","msg":"sender: started"}
7
+ {"time":"2026-08-14T21:15:07.435698857Z","level":"INFO","msg":"writer: started","stream_id":"54wnyexz"}
8
+ {"time":"2026-08-14T21:15:07.865306518Z","level":"INFO","msg":"filestream: sending request","total_files":1,"console_offset":0,"console_lines":2}
9
+ {"time":"2026-08-14T21:15:07.979243259Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
10
+ {"time":"2026-08-14T21:15:22.8655656Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":0,"history_lines":1,"events_offset":0,"events_lines":1,"console_offset":1,"console_lines":2,"uploaded_len":2}
11
+ {"time":"2026-08-14T21:15:23.014629997Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
12
+ {"time":"2026-08-14T21:15:23.378577725Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":1538}
13
+ {"time":"2026-08-14T21:15:23.378611071Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":1}
14
+ {"time":"2026-08-14T21:15:23.38845317Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":4102}
15
+ {"time":"2026-08-14T21:15:23.388483609Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":1}
16
+ {"time":"2026-08-14T21:15:23.389724048Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":4603}
17
+ {"time":"2026-08-14T21:15:23.389898245Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":36}
18
+ {"time":"2026-08-14T21:15:23.39094459Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":5037}
19
+ {"time":"2026-08-14T21:15:23.391389079Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":103}
20
+ {"time":"2026-08-14T21:15:23.391844857Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":5345}
21
+ {"time":"2026-08-14T21:15:23.398774475Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":2645}
22
+ {"time":"2026-08-14T21:15:23.399288691Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":8229}
23
+ {"time":"2026-08-14T21:15:23.400206063Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":379}
24
+ {"time":"2026-08-14T21:15:23.400644516Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":8832}
25
+ {"time":"2026-08-14T21:15:23.400737823Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":19}
26
+ {"time":"2026-08-14T21:15:23.400946664Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":8941}
27
+ {"time":"2026-08-14T21:15:23.401087444Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":37}
28
+ {"time":"2026-08-14T21:15:23.405809502Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":10867}
29
+ {"time":"2026-08-14T21:15:23.405942913Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":22}
30
+ {"time":"2026-08-14T21:15:23.407538574Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":11526}
31
+ {"time":"2026-08-14T21:15:23.408103184Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":213}
32
+ {"time":"2026-08-14T21:15:37.883634237Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1,"history_lines":2,"events_offset":1,"events_lines":2,"console_offset":1,"console_lines":1}
33
+ {"time":"2026-08-14T21:15:38.603529933Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
34
+ {"time":"2026-08-14T21:15:52.884551759Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":3,"history_lines":3,"events_offset":3,"events_lines":2,"console_offset":1,"console_lines":1}
35
+ {"time":"2026-08-14T21:15:53.827374416Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
36
+ {"time":"2026-08-14T21:16:07.891440937Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":6,"history_lines":2,"events_offset":5,"events_lines":2,"console_offset":3,"console_lines":12}
37
+ {"time":"2026-08-14T21:16:08.876461742Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
38
+ {"time":"2026-08-14T21:16:22.890274165Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":8,"history_lines":2,"events_offset":7,"events_lines":2,"console_offset":11,"console_lines":1}
39
+ {"time":"2026-08-14T21:16:23.704159399Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
40
+ {"time":"2026-08-14T21:16:37.88767292Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":10,"history_lines":2,"events_offset":9,"events_lines":2,"console_offset":15,"console_lines":9}
41
+ {"time":"2026-08-14T21:16:38.690316648Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
42
+ {"time":"2026-08-14T21:16:52.886427045Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":12,"history_lines":2,"events_offset":11,"events_lines":2,"console_offset":21,"console_lines":1}
43
+ {"time":"2026-08-14T21:16:54.006407739Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
44
+ {"time":"2026-08-14T21:17:07.874889179Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":14,"history_lines":2,"events_offset":13,"events_lines":2,"console_offset":21,"console_lines":1}
45
+ {"time":"2026-08-14T21:17:08.765471891Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
46
+ {"time":"2026-08-14T21:17:22.884402781Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":16,"history_lines":2,"events_offset":15,"events_lines":2,"console_offset":24,"console_lines":11}
47
+ {"time":"2026-08-14T21:17:23.782618431Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
48
+ {"time":"2026-08-14T21:17:37.894674616Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":18,"history_lines":2,"events_offset":17,"events_lines":2,"console_offset":31,"console_lines":1}
49
+ {"time":"2026-08-14T21:17:38.741283006Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
50
+ {"time":"2026-08-14T21:17:52.887547658Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":20,"history_lines":2,"events_offset":19,"events_lines":2,"console_offset":35,"console_lines":9}
51
+ {"time":"2026-08-14T21:17:53.759903107Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
52
+ {"time":"2026-08-14T21:18:07.894710599Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":22,"history_lines":2,"events_offset":21,"events_lines":2,"console_offset":41,"console_lines":1}
53
+ {"time":"2026-08-14T21:18:08.817504637Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
54
+ {"time":"2026-08-14T21:18:22.875702416Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":24,"history_lines":2,"events_offset":23,"events_lines":2,"console_offset":41,"console_lines":1}
55
+ {"time":"2026-08-14T21:18:23.642998715Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
56
+ {"time":"2026-08-14T21:18:37.887794344Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":26,"history_lines":2,"events_offset":25,"events_lines":2,"console_offset":44,"console_lines":11}
57
+ {"time":"2026-08-14T21:18:38.696615712Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
58
+ {"time":"2026-08-14T21:18:52.883505832Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":28,"history_lines":2,"events_offset":27,"events_lines":2,"console_offset":51,"console_lines":1}
59
+ {"time":"2026-08-14T21:18:53.743917259Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
60
+ {"time":"2026-08-14T21:19:07.888490889Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":30,"history_lines":2,"events_offset":29,"events_lines":2,"console_offset":55,"console_lines":9}
61
+ {"time":"2026-08-14T21:19:08.707657114Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
62
+ {"time":"2026-08-14T21:19:22.884734385Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":32,"history_lines":2,"events_offset":31,"events_lines":2,"console_offset":61,"console_lines":1}
63
+ {"time":"2026-08-14T21:19:23.790343089Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
64
+ {"time":"2026-08-14T21:19:37.875793912Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":34,"history_lines":2,"events_offset":33,"events_lines":2,"console_offset":61,"console_lines":1}
65
+ {"time":"2026-08-14T21:19:38.585616478Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
zain/Activation/wandb/debug.log CHANGED
@@ -1,19 +1,20 @@
1
- 2026-08-14 21:14:07,909 INFO MainThread:409188 [wandb_init.py:setup_run_log_directory():729] Logging user logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug.log
2
- 2026-08-14 21:14:07,910 INFO MainThread:409188 [wandb_init.py:setup_run_log_directory():730] Logging internal logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug-internal.log
3
- 2026-08-14 21:14:07,910 INFO MainThread:409188 [wandb_init.py:init():772] calling init triggers
4
- 2026-08-14 21:14:07,910 INFO MainThread:409188 [wandb_init.py:init():777] wandb.init called with sweep_config: {}
5
  config: {'_wandb': {}}
6
- 2026-08-14 21:14:07,910 INFO MainThread:409188 [wandb_init.py:init():820] starting backend
7
- 2026-08-14 21:14:07,910 INFO MainThread:409188 [wandb_init.py:init():835] sending inform_init request
8
- 2026-08-14 21:14:08,168 INFO MainThread:409188 [wandb_init.py:init():840] backend started and connected
9
- 2026-08-14 21:14:08,169 INFO MainThread:409188 [wandb_init.py:init():910] updated telemetry
10
- 2026-08-14 21:14:08,176 INFO MainThread:409188 [wandb_init.py:init():933] communicating run to backend with 90.0 second timeout
11
- 2026-08-14 21:14:08,594 INFO MainThread:409188 [wandb_init.py:init():978] starting run threads in backend
12
- 2026-08-14 21:14:08,670 INFO MainThread:409188 [wandb_run.py:_console_start():2621] atexit reg
13
- 2026-08-14 21:14:08,670 INFO MainThread:409188 [wandb_run.py:_redirect():2471] redirect: wrap_raw
14
- 2026-08-14 21:14:08,670 INFO MainThread:409188 [wandb_run.py:_redirect():2540] Wrapping output streams.
15
- 2026-08-14 21:14:08,670 INFO MainThread:409188 [wandb_run.py:_redirect():2563] Redirects installed.
16
- 2026-08-14 21:14:08,671 INFO MainThread:409188 [wandb_init.py:init():1016] run started, returning control to user process
17
- 2026-08-14 21:14:08,672 INFO MainThread:409188 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 9, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'waleedglu_low', 'waleed_beta': 10.0, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-waleedglu_low-9L_run', 'per_device_train_batch_size': 512, 'num_train_epochs': 1, 'max_steps': 1000, 'learning_rate': 0.001, 'lr_scheduler_type': 'constant', 'lr_scheduler_kwargs': None, 'warmup_steps': 0, 'optim': 'adamw_torch', 'optim_args': None, 'weight_decay': 0.01, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-waleedglu_low-9L-2.0M-20260814-211407', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 60000, 'eval_delay': 0, 'per_device_eval_batch_size': 512, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 100, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/A-glu-waleedglu_low-9L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
18
- 2026-08-14 21:14:08,674 INFO MainThread:409188 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 2001280 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x153f494c3450>>
19
- 2026-08-14 21:14:08,674 INFO MainThread:409188 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 2001280 None
 
 
1
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:setup_run_log_directory():729] Logging user logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug.log
2
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:setup_run_log_directory():730] Logging internal logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug-internal.log
3
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():772] calling init triggers
4
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():777] wandb.init called with sweep_config: {}
5
  config: {'_wandb': {}}
6
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():820] starting backend
7
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():826] Connected to an existing wandb-core service via WANDB_SERVICE
8
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():835] sending inform_init request
9
+ 2026-08-14 21:15:07,436 INFO MainThread:936813 [wandb_init.py:init():840] backend started and connected
10
+ 2026-08-14 21:15:07,437 INFO MainThread:936813 [wandb_init.py:init():910] updated telemetry
11
+ 2026-08-14 21:15:07,444 INFO MainThread:936813 [wandb_init.py:init():933] communicating run to backend with 90.0 second timeout
12
+ 2026-08-14 21:15:07,772 INFO MainThread:936813 [wandb_init.py:init():978] starting run threads in backend
13
+ 2026-08-14 21:15:07,851 INFO MainThread:936813 [wandb_run.py:_console_start():2621] atexit reg
14
+ 2026-08-14 21:15:07,851 INFO MainThread:936813 [wandb_run.py:_redirect():2471] redirect: wrap_raw
15
+ 2026-08-14 21:15:07,851 INFO MainThread:936813 [wandb_run.py:_redirect():2540] Wrapping output streams.
16
+ 2026-08-14 21:15:07,851 INFO MainThread:936813 [wandb_run.py:_redirect():2563] Redirects installed.
17
+ 2026-08-14 21:15:07,852 INFO MainThread:936813 [wandb_init.py:init():1016] run started, returning control to user process
18
+ 2026-08-14 21:15:07,853 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 100, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'sigmoid', 'waleed_beta': 4, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-sigmoid-100L_trash_run', 'per_device_train_batch_size': 64, 'num_train_epochs': 1, 'max_steps': 3500, 'learning_rate': 9e-05, 'lr_scheduler_type': 'constant_with_warmup', 'lr_scheduler_kwargs': None, 'warmup_steps': 50, 'optim': 'adamw_torch_fused', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-sigmoid-100L-16.9M-20260814-211506', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 2498, 'eval_delay': 0, 'per_device_eval_batch_size': 1024, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 50, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/6L-glu-sigmoid-100L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
19
+ 2026-08-14 21:15:07,858 INFO MainThread:936813 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 16934016 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x14ee39eebe10>>
20
+ 2026-08-14 21:15:07,858 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 16934016 None
zain/Activation/wandb/run-20260814_193907-kk1xbqht/logs/debug-core.log CHANGED
@@ -54,3 +54,10 @@
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
 
 
 
 
 
 
 
 
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
57
+ {"time":"2026-08-14T21:14:51.274587185Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
58
+ {"time":"2026-08-14T21:14:52.85240857Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
59
+ {"time":"2026-08-14T21:14:52.873645397Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"a6574zx8","id":"3(@)"}
60
+ {"time":"2026-08-14T21:14:52.874311484Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"a6574zx8","id":"3(@)"}
61
+ {"time":"2026-08-14T21:15:07.169254211Z","level":"INFO","msg":"handleInformInit: received","streamId":"54wnyexz","id":"3(@)"}
62
+ {"time":"2026-08-14T21:15:07.435699541Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"54wnyexz","id":"3(@)"}
63
+ {"time":"2026-08-14T21:15:12.853675736Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"fzqy9cymfofj"}
zain/Activation/wandb/run-20260814_195151-ix6wcbwv/logs/debug-core.log CHANGED
@@ -54,3 +54,10 @@
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
 
 
 
 
 
 
 
 
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
57
+ {"time":"2026-08-14T21:14:51.274587185Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
58
+ {"time":"2026-08-14T21:14:52.85240857Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
59
+ {"time":"2026-08-14T21:14:52.873645397Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"a6574zx8","id":"3(@)"}
60
+ {"time":"2026-08-14T21:14:52.874311484Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"a6574zx8","id":"3(@)"}
61
+ {"time":"2026-08-14T21:15:07.169254211Z","level":"INFO","msg":"handleInformInit: received","streamId":"54wnyexz","id":"3(@)"}
62
+ {"time":"2026-08-14T21:15:07.435699541Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"54wnyexz","id":"3(@)"}
63
+ {"time":"2026-08-14T21:15:12.853675736Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"fzqy9cymfofj"}
zain/Activation/wandb/run-20260814_200503-bdhnr27j/logs/debug-core.log CHANGED
@@ -54,3 +54,10 @@
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
 
 
 
 
 
 
 
 
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
57
+ {"time":"2026-08-14T21:14:51.274587185Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
58
+ {"time":"2026-08-14T21:14:52.85240857Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
59
+ {"time":"2026-08-14T21:14:52.873645397Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"a6574zx8","id":"3(@)"}
60
+ {"time":"2026-08-14T21:14:52.874311484Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"a6574zx8","id":"3(@)"}
61
+ {"time":"2026-08-14T21:15:07.169254211Z","level":"INFO","msg":"handleInformInit: received","streamId":"54wnyexz","id":"3(@)"}
62
+ {"time":"2026-08-14T21:15:07.435699541Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"54wnyexz","id":"3(@)"}
63
+ {"time":"2026-08-14T21:15:12.853675736Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"fzqy9cymfofj"}
zain/Activation/wandb/run-20260814_202128-twgo1e89/logs/debug-core.log CHANGED
@@ -54,3 +54,10 @@
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
 
 
 
 
 
 
 
 
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
57
+ {"time":"2026-08-14T21:14:51.274587185Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
58
+ {"time":"2026-08-14T21:14:52.85240857Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
59
+ {"time":"2026-08-14T21:14:52.873645397Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"a6574zx8","id":"3(@)"}
60
+ {"time":"2026-08-14T21:14:52.874311484Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"a6574zx8","id":"3(@)"}
61
+ {"time":"2026-08-14T21:15:07.169254211Z","level":"INFO","msg":"handleInformInit: received","streamId":"54wnyexz","id":"3(@)"}
62
+ {"time":"2026-08-14T21:15:07.435699541Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"54wnyexz","id":"3(@)"}
63
+ {"time":"2026-08-14T21:15:12.853675736Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"fzqy9cymfofj"}
zain/Activation/wandb/run-20260814_203803-7p5140bq/logs/debug-core.log CHANGED
@@ -54,3 +54,10 @@
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
 
 
 
 
 
 
 
 
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
57
+ {"time":"2026-08-14T21:14:51.274587185Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
58
+ {"time":"2026-08-14T21:14:52.85240857Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
59
+ {"time":"2026-08-14T21:14:52.873645397Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"a6574zx8","id":"3(@)"}
60
+ {"time":"2026-08-14T21:14:52.874311484Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"a6574zx8","id":"3(@)"}
61
+ {"time":"2026-08-14T21:15:07.169254211Z","level":"INFO","msg":"handleInformInit: received","streamId":"54wnyexz","id":"3(@)"}
62
+ {"time":"2026-08-14T21:15:07.435699541Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"54wnyexz","id":"3(@)"}
63
+ {"time":"2026-08-14T21:15:12.853675736Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"fzqy9cymfofj"}
zain/Activation/wandb/run-20260814_210109-qauftiuh/logs/debug-core.log CHANGED
@@ -54,3 +54,10 @@
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
 
 
 
 
 
 
 
 
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
57
+ {"time":"2026-08-14T21:14:51.274587185Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
58
+ {"time":"2026-08-14T21:14:52.85240857Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
59
+ {"time":"2026-08-14T21:14:52.873645397Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"a6574zx8","id":"3(@)"}
60
+ {"time":"2026-08-14T21:14:52.874311484Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"a6574zx8","id":"3(@)"}
61
+ {"time":"2026-08-14T21:15:07.169254211Z","level":"INFO","msg":"handleInformInit: received","streamId":"54wnyexz","id":"3(@)"}
62
+ {"time":"2026-08-14T21:15:07.435699541Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"54wnyexz","id":"3(@)"}
63
+ {"time":"2026-08-14T21:15:12.853675736Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"fzqy9cymfofj"}
zain/Activation/wandb/run-20260814_210809-a6574zx8/files/config.yaml ADDED
@@ -0,0 +1,439 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ _name_or_path:
2
+ value: ""
3
+ _wandb:
4
+ value:
5
+ cli_version: 0.28.1
6
+ e:
7
+ upcn9ahkwrhy5vr293v2ixhfn8n9p8k0:
8
+ args:
9
+ - --config
10
+ - /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline100l.yaml
11
+ - --variants
12
+ - glu-relu
13
+ - glu-gelu
14
+ - glu-sigmoid
15
+ - glu-waleed10
16
+ - glu-silu-waleed10
17
+ codePath: sweep.py
18
+ codePathLocal: sweep.py
19
+ cpu_count: 112
20
+ cpu_count_logical: 224
21
+ cudaVersion: "12.4"
22
+ disk:
23
+ /:
24
+ total: "1560765693952"
25
+ used: "701339574272"
26
+ email: deepnevro@gmail.com
27
+ executable: /mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python
28
+ git:
29
+ commit: 3fb47c6943d6927eafc39bd399a3d3a520bae74a
30
+ remote: https://github.com/w-ahmad1a10/Activation.git
31
+ gpu: NVIDIA H100 80GB HBM3
32
+ gpu_count: 8
33
+ gpu_nvidia:
34
+ - architecture: Hopper
35
+ cudaCores: 16896
36
+ memoryTotal: "85520809984"
37
+ name: NVIDIA H100 80GB HBM3
38
+ uuid: GPU-39c684a5-fde6-83d7-1663-0859795881ae
39
+ - architecture: Hopper
40
+ cudaCores: 16896
41
+ memoryTotal: "85520809984"
42
+ name: NVIDIA H100 80GB HBM3
43
+ uuid: GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3
44
+ - architecture: Hopper
45
+ cudaCores: 16896
46
+ memoryTotal: "85520809984"
47
+ name: NVIDIA H100 80GB HBM3
48
+ uuid: GPU-132944c4-b689-2b5f-89a4-d730401677ab
49
+ - architecture: Hopper
50
+ cudaCores: 16896
51
+ memoryTotal: "85520809984"
52
+ name: NVIDIA H100 80GB HBM3
53
+ uuid: GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864
54
+ - architecture: Hopper
55
+ cudaCores: 16896
56
+ memoryTotal: "85520809984"
57
+ name: NVIDIA H100 80GB HBM3
58
+ uuid: GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef
59
+ - architecture: Hopper
60
+ cudaCores: 16896
61
+ memoryTotal: "85520809984"
62
+ name: NVIDIA H100 80GB HBM3
63
+ uuid: GPU-bc6c3e3c-9b90-09ca-c034-774961847c54
64
+ - architecture: Hopper
65
+ cudaCores: 16896
66
+ memoryTotal: "85520809984"
67
+ name: NVIDIA H100 80GB HBM3
68
+ uuid: GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9
69
+ - architecture: Hopper
70
+ cudaCores: 16896
71
+ memoryTotal: "85520809984"
72
+ name: NVIDIA H100 80GB HBM3
73
+ uuid: GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea
74
+ host: deeplens-k3s-node1
75
+ memory:
76
+ total: "2164089937920"
77
+ os: Linux-5.15.0-126-generic-x86_64-with-glibc2.35
78
+ program: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py
79
+ python: CPython 3.11.15
80
+ root: /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation
81
+ startedAt: "2026-08-14T21:08:09.034947Z"
82
+ writerId: upcn9ahkwrhy5vr293v2ixhfn8n9p8k0
83
+ m:
84
+ - "1": train/global_step
85
+ "6":
86
+ - 3
87
+ "7": []
88
+ - "2": '*'
89
+ "5": 1
90
+ "6":
91
+ - 1
92
+ "7": []
93
+ python_version: 3.11.15
94
+ t:
95
+ "1":
96
+ - 1
97
+ - 5
98
+ - 11
99
+ - 41
100
+ - 49
101
+ - 51
102
+ - 53
103
+ - 71
104
+ "2":
105
+ - 1
106
+ - 5
107
+ - 11
108
+ - 41
109
+ - 49
110
+ - 51
111
+ - 53
112
+ - 71
113
+ "3":
114
+ - 2
115
+ - 7
116
+ - 13
117
+ - 19
118
+ - 41
119
+ - 61
120
+ - 62
121
+ - 66
122
+ "4": 3.11.15
123
+ "5": 0.28.1
124
+ "6": 5.16.0.dev0
125
+ "9":
126
+ "1": transformers_trainer
127
+ "12": 0.28.1
128
+ "13": linux-x86_64
129
+ accelerator_config:
130
+ value:
131
+ dispatch_batches: null
132
+ even_batches: true
133
+ gradient_accumulation_kwargs: null
134
+ non_blocking: false
135
+ split_batches: false
136
+ use_seedable_sampler: true
137
+ activation:
138
+ value: gelu
139
+ adam_beta1:
140
+ value: 0.9
141
+ adam_beta2:
142
+ value: 0.999
143
+ adam_epsilon:
144
+ value: 1e-08
145
+ architectures:
146
+ value: null
147
+ attention_bias:
148
+ value: false
149
+ attention_dropout:
150
+ value: 0
151
+ auto_find_batch_size:
152
+ value: false
153
+ average_tokens_across_devices:
154
+ value: true
155
+ batch_eval_metrics:
156
+ value: false
157
+ bf16:
158
+ value: true
159
+ bf16_full_eval:
160
+ value: false
161
+ bos_token_id:
162
+ value: 1
163
+ chunk_size_feed_forward:
164
+ value: 0
165
+ data_seed:
166
+ value: 42
167
+ dataloader_drop_last:
168
+ value: false
169
+ dataloader_in_order:
170
+ value: true
171
+ dataloader_multiprocessing_context:
172
+ value: null
173
+ dataloader_num_workers:
174
+ value: 0
175
+ dataloader_persistent_workers:
176
+ value: false
177
+ dataloader_pin_memory:
178
+ value: true
179
+ dataloader_prefetch_factor:
180
+ value: null
181
+ ddp_backend:
182
+ value: null
183
+ ddp_broadcast_buffers:
184
+ value: null
185
+ ddp_bucket_cap_mb:
186
+ value: null
187
+ ddp_find_unused_parameters:
188
+ value: null
189
+ ddp_static_graph:
190
+ value: null
191
+ ddp_timeout:
192
+ value: 1800
193
+ debug:
194
+ value: []
195
+ deepspeed:
196
+ value: null
197
+ disable_tqdm:
198
+ value: false
199
+ do_eval:
200
+ value: true
201
+ do_predict:
202
+ value: false
203
+ do_train:
204
+ value: false
205
+ dtype:
206
+ value: null
207
+ enable_jit_checkpoint:
208
+ value: false
209
+ eos_token_id:
210
+ value: 2
211
+ eval_accumulation_steps:
212
+ value: null
213
+ eval_delay:
214
+ value: 0
215
+ eval_do_concat_batches:
216
+ value: true
217
+ eval_on_start:
218
+ value: false
219
+ eval_steps:
220
+ value: 2498
221
+ eval_strategy:
222
+ value: steps
223
+ eval_use_gather_object:
224
+ value: false
225
+ fp16:
226
+ value: false
227
+ fp16_full_eval:
228
+ value: false
229
+ fsdp:
230
+ value: null
231
+ fsdp_config:
232
+ value: null
233
+ full_determinism:
234
+ value: false
235
+ gradient_accumulation_steps:
236
+ value: 1
237
+ gradient_checkpointing:
238
+ value: false
239
+ gradient_checkpointing_kwargs:
240
+ value: null
241
+ greater_is_better:
242
+ value: null
243
+ head_dim:
244
+ value: 32
245
+ hidden_act:
246
+ value: silu
247
+ hidden_size:
248
+ value: 128
249
+ hub_always_push:
250
+ value: false
251
+ hub_model_id:
252
+ value: w-ahmad/6L-glu-gelu-100L
253
+ hub_private_repo:
254
+ value: null
255
+ hub_revision:
256
+ value: null
257
+ hub_strategy:
258
+ value: every_save
259
+ hub_token:
260
+ value: <HUB_TOKEN>
261
+ id2label:
262
+ value:
263
+ "0": LABEL_0
264
+ "1": LABEL_1
265
+ ignore_data_skip:
266
+ value: false
267
+ include_for_metrics:
268
+ value: []
269
+ include_num_input_tokens_seen:
270
+ value: "no"
271
+ initializer_range:
272
+ value: 0.02
273
+ intermediate_size:
274
+ value: 256
275
+ is_encoder_decoder:
276
+ value: false
277
+ label_names:
278
+ value: null
279
+ label_smoothing_factor:
280
+ value: 0
281
+ label2id:
282
+ value:
283
+ LABEL_0: 0
284
+ LABEL_1: 1
285
+ learning_rate:
286
+ value: 9e-05
287
+ length_column_name:
288
+ value: length
289
+ liger_kernel_config:
290
+ value: null
291
+ load_best_model_at_end:
292
+ value: false
293
+ local_rank:
294
+ value: -1
295
+ log_level:
296
+ value: passive
297
+ log_level_replica:
298
+ value: warning
299
+ log_on_each_node:
300
+ value: true
301
+ logging_first_step:
302
+ value: false
303
+ logging_nan_inf_filter:
304
+ value: true
305
+ logging_steps:
306
+ value: 20
307
+ logging_strategy:
308
+ value: steps
309
+ lr_scheduler_kwargs:
310
+ value: null
311
+ lr_scheduler_type:
312
+ value: constant_with_warmup
313
+ max_grad_norm:
314
+ value: 1
315
+ max_position_embeddings:
316
+ value: 512
317
+ max_steps:
318
+ value: 3500
319
+ metric_for_best_model:
320
+ value: null
321
+ mlp_bias:
322
+ value: false
323
+ mlp_type:
324
+ value: glu
325
+ model/num_parameters:
326
+ value: 16934016
327
+ model_type:
328
+ value: tiny_llama
329
+ neftune_noise_alpha:
330
+ value: null
331
+ num_attention_heads:
332
+ value: 4
333
+ num_hidden_layers:
334
+ value: 100
335
+ num_key_value_heads:
336
+ value: 4
337
+ num_train_epochs:
338
+ value: 1
339
+ optim:
340
+ value: adamw_torch_fused
341
+ optim_args:
342
+ value: null
343
+ optim_target_modules:
344
+ value: null
345
+ output_attentions:
346
+ value: false
347
+ output_dir:
348
+ value: out/glu-gelu-100L_trash_run
349
+ output_hidden_states:
350
+ value: false
351
+ pad_token_id:
352
+ value: 0
353
+ parallelism_config:
354
+ value: null
355
+ per_device_eval_batch_size:
356
+ value: 1024
357
+ per_device_train_batch_size:
358
+ value: 64
359
+ prediction_loss_only:
360
+ value: false
361
+ pretraining_tp:
362
+ value: 1
363
+ problem_type:
364
+ value: null
365
+ project:
366
+ value: huggingface
367
+ push_to_hub:
368
+ value: false
369
+ remove_unused_columns:
370
+ value: false
371
+ report_to:
372
+ value:
373
+ - wandb
374
+ restore_callback_states_from_checkpoint:
375
+ value: false
376
+ resume_from_checkpoint:
377
+ value: null
378
+ return_dict:
379
+ value: true
380
+ rms_norm_eps:
381
+ value: 1e-06
382
+ rope_parameters:
383
+ value:
384
+ rope_theta: 10000
385
+ rope_type: default
386
+ run_name:
387
+ value: LM-glu-gelu-100L-16.9M-20260814-210807
388
+ save_on_each_node:
389
+ value: false
390
+ save_only_model:
391
+ value: false
392
+ save_steps:
393
+ value: 50
394
+ save_strategy:
395
+ value: steps
396
+ save_total_limit:
397
+ value: null
398
+ seed:
399
+ value: 42
400
+ skip_memory_metrics:
401
+ value: true
402
+ tf32:
403
+ value: null
404
+ tie_word_embeddings:
405
+ value: true
406
+ tokenizer_name:
407
+ value: w-ahmad/tiny-stories-tokenizer
408
+ torch_compile:
409
+ value: false
410
+ torch_compile_backend:
411
+ value: null
412
+ torch_compile_mode:
413
+ value: null
414
+ torch_empty_cache_steps:
415
+ value: null
416
+ trackio_bucket_id:
417
+ value: null
418
+ trackio_space_id:
419
+ value: null
420
+ trackio_static_space_id:
421
+ value: null
422
+ train_sampling_strategy:
423
+ value: random
424
+ transformers_version:
425
+ value: 5.16.0.dev0
426
+ use_cache:
427
+ value: false
428
+ use_cpu:
429
+ value: false
430
+ use_liger_kernel:
431
+ value: false
432
+ vocab_size:
433
+ value: 4096
434
+ waleed_beta:
435
+ value: 4
436
+ warmup_steps:
437
+ value: 50
438
+ weight_decay:
439
+ value: 0
zain/Activation/wandb/run-20260814_210809-a6574zx8/files/output.log CHANGED
@@ -102,3 +102,10 @@ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 16.
102
  Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 18.61it/s]
103
  100%|██████████| 3500/3500 [06:23<00:00, 9.12it/s], ?it/s]
104
  {'train_runtime': '385', 'train_samples_per_second': '581.9', 'train_steps_per_second': '9.091', 'train_loss': '2.202', 'epoch': '0.2359', 'train/total_time_seconds': '308.9', 'train/time_per_step_avg': '0.2828', 'train/epoch_time_elapsed': '383.8', 'train/estimated_remaining_minutes': '0'}
 
 
 
 
 
 
 
 
102
  Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 18.61it/s]
103
  100%|██████████| 3500/3500 [06:23<00:00, 9.12it/s], ?it/s]
104
  {'train_runtime': '385', 'train_samples_per_second': '581.9', 'train_steps_per_second': '9.091', 'train_loss': '2.202', 'epoch': '0.2359', 'train/total_time_seconds': '308.9', 'train/time_per_step_avg': '0.2828', 'train/epoch_time_elapsed': '383.8', 'train/estimated_remaining_minutes': '0'}
105
+ 100%|██████████| 10/10 [00:15<00:00, 1.51s/it]
106
+ [transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
107
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
108
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
109
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
110
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 16.64it/s]
111
+ >>> FINISHED glu-gelu-100L successfully
zain/Activation/wandb/run-20260814_210809-a6574zx8/files/wandb-summary.json ADDED
The diff for this file is too large to render. See raw diff
 
zain/Activation/wandb/run-20260814_210809-a6574zx8/logs/debug-core.log CHANGED
@@ -54,3 +54,10 @@
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
 
 
 
 
 
 
 
 
54
  {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
  {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
  {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
57
+ {"time":"2026-08-14T21:14:51.274587185Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
58
+ {"time":"2026-08-14T21:14:52.85240857Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
59
+ {"time":"2026-08-14T21:14:52.873645397Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"a6574zx8","id":"3(@)"}
60
+ {"time":"2026-08-14T21:14:52.874311484Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"a6574zx8","id":"3(@)"}
61
+ {"time":"2026-08-14T21:15:07.169254211Z","level":"INFO","msg":"handleInformInit: received","streamId":"54wnyexz","id":"3(@)"}
62
+ {"time":"2026-08-14T21:15:07.435699541Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"54wnyexz","id":"3(@)"}
63
+ {"time":"2026-08-14T21:15:12.853675736Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"fzqy9cymfofj"}
zain/Activation/wandb/run-20260814_210809-a6574zx8/logs/debug-internal.log CHANGED
@@ -59,3 +59,13 @@
59
  {"time":"2026-08-14T21:14:10.945223769Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
60
  {"time":"2026-08-14T21:14:24.907797301Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":49,"history_lines":1,"events_offset":47,"events_lines":2,"console_offset":91,"console_lines":1}
61
  {"time":"2026-08-14T21:14:25.747074137Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
 
 
 
 
 
 
 
 
 
 
 
59
  {"time":"2026-08-14T21:14:10.945223769Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
60
  {"time":"2026-08-14T21:14:24.907797301Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":49,"history_lines":1,"events_offset":47,"events_lines":2,"console_offset":91,"console_lines":1}
61
  {"time":"2026-08-14T21:14:25.747074137Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
62
+ {"time":"2026-08-14T21:14:39.910134146Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":50,"history_lines":2,"events_offset":49,"events_lines":2,"console_offset":91,"console_lines":1}
63
+ {"time":"2026-08-14T21:14:40.657863657Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
64
+ {"time":"2026-08-14T21:14:52.017579403Z","level":"INFO","msg":"fileTransfer: Close: file transfer manager closed"}
65
+ {"time":"2026-08-14T21:14:52.026614872Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":52,"history_lines":1,"events_offset":51,"events_lines":1,"console_offset":96,"console_lines":15,"uploaded_len":3,"complete":true,"exit_code":0}
66
+ {"time":"2026-08-14T21:14:52.832575952Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
67
+ {"time":"2026-08-14T21:14:52.833971568Z","level":"INFO","msg":"handler: operation stats","stats":{}}
68
+ {"time":"2026-08-14T21:14:52.873689012Z","level":"INFO","msg":"stream: finishing up"}
69
+ {"time":"2026-08-14T21:14:52.873727527Z","level":"INFO","msg":"handler: closed"}
70
+ {"time":"2026-08-14T21:14:52.873803974Z","level":"INFO","msg":"sender: closed"}
71
+ {"time":"2026-08-14T21:14:52.873808726Z","level":"INFO","msg":"stream: all finished"}
zain/Activation/wandb/run-20260814_210809-a6574zx8/logs/debug.log CHANGED
@@ -18,3 +18,8 @@ config: {'_wandb': {}}
18
  2026-08-14 21:08:09,886 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 100, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'gelu', 'waleed_beta': 4, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-gelu-100L_trash_run', 'per_device_train_batch_size': 64, 'num_train_epochs': 1, 'max_steps': 3500, 'learning_rate': 9e-05, 'lr_scheduler_type': 'constant_with_warmup', 'lr_scheduler_kwargs': None, 'warmup_steps': 50, 'optim': 'adamw_torch_fused', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-gelu-100L-16.9M-20260814-210807', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 2498, 'eval_delay': 0, 'per_device_eval_batch_size': 1024, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 50, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/6L-glu-gelu-100L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
19
  2026-08-14 21:08:09,891 INFO MainThread:936813 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 16934016 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x14ee39e0dd90>>
20
  2026-08-14 21:08:09,891 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 16934016 None
 
 
 
 
 
 
18
  2026-08-14 21:08:09,886 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 100, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'gelu', 'waleed_beta': 4, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-gelu-100L_trash_run', 'per_device_train_batch_size': 64, 'num_train_epochs': 1, 'max_steps': 3500, 'learning_rate': 9e-05, 'lr_scheduler_type': 'constant_with_warmup', 'lr_scheduler_kwargs': None, 'warmup_steps': 50, 'optim': 'adamw_torch_fused', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-gelu-100L-16.9M-20260814-210807', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 2498, 'eval_delay': 0, 'per_device_eval_batch_size': 1024, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 50, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/6L-glu-gelu-100L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
19
  2026-08-14 21:08:09,891 INFO MainThread:936813 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 16934016 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x14ee39e0dd90>>
20
  2026-08-14 21:08:09,891 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 16934016 None
21
+ 2026-08-14 21:14:51,273 INFO MainThread:936813 [wandb_run.py:_finish():2383] finishing run deepnevro-deepnevro/research7/a6574zx8
22
+ 2026-08-14 21:14:51,274 INFO MainThread:936813 [wandb_run.py:_atexit_cleanup():2588] got exitcode: 0
23
+ 2026-08-14 21:14:51,274 INFO MainThread:936813 [wandb_run.py:_restore():2570] restore
24
+ 2026-08-14 21:14:51,274 INFO MainThread:936813 [wandb_run.py:_restore():2576] restore done
25
+ 2026-08-14 21:14:52,872 INFO MainThread:936813 [wandb_run.py:_footer_sync_info():3993] logging synced files
zain/Activation/wandb/run-20260814_210809-a6574zx8/run-a6574zx8.wandb CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3fadffc1235472998d6b03b8d907af7ec4e5b94a9fce797b5be85ac572592c60
3
- size 52264960
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6d299e1b6e5245f9b4c77e34837e862f629cd6e5e8bc9f8e4606f02fcc51a163
3
+ size 52308490
zain/Activation/wandb/run-20260814_211407-i85cngas/files/output.log CHANGED
@@ -1,3 +1,45 @@
1
- 4%| | 44/1000 [00:29<09:55, 1.61it/s]
2
  {'loss': '7.143', 'grad_norm': '0.9727', 'learning_rate': '0.001', 'epoch': '0.01078', 'train/total_time_seconds': '5.76', 'train/time_per_step_avg': '0.288', 'train/epoch_time_elapsed': '13.8', 'train/estimated_remaining_minutes': '4.704'}
3
  {'loss': '5.904', 'grad_norm': '0.8125', 'learning_rate': '0.001', 'epoch': '0.02156', 'train/total_time_seconds': '11.67', 'train/time_per_step_avg': '0.2917', 'train/epoch_time_elapsed': '27.3', 'train/estimated_remaining_minutes': '4.668'}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 10%| | 100/1000 [01:02<09:54, 1.51it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
2
  {'loss': '7.143', 'grad_norm': '0.9727', 'learning_rate': '0.001', 'epoch': '0.01078', 'train/total_time_seconds': '5.76', 'train/time_per_step_avg': '0.288', 'train/epoch_time_elapsed': '13.8', 'train/estimated_remaining_minutes': '4.704'}
3
  {'loss': '5.904', 'grad_norm': '0.8125', 'learning_rate': '0.001', 'epoch': '0.02156', 'train/total_time_seconds': '11.67', 'train/time_per_step_avg': '0.2917', 'train/epoch_time_elapsed': '27.3', 'train/estimated_remaining_minutes': '4.668'}
4
+ {'loss': '5.334', 'grad_norm': '0.75', 'learning_rate': '0.001', 'epoch': '0.03235', 'train/total_time_seconds': '16.46', 'train/time_per_step_avg': '0.2744', 'train/epoch_time_elapsed': '39.57', 'train/estimated_remaining_minutes': '4.299'}
5
+ {'loss': '4.782', 'grad_norm': '0.4121', 'learning_rate': '0.001', 'epoch': '0.04313', 'train/total_time_seconds': '20.63', 'train/time_per_step_avg': '0.2579', 'train/epoch_time_elapsed': '51.19', 'train/estimated_remaining_minutes': '3.954'}
6
+ {'loss': '4.378', 'grad_norm': '0.6055', 'learning_rate': '0.001', 'epoch': '0.05391', 'train/total_time_seconds': '24.69', 'train/time_per_step_avg': '0.2469', 'train/epoch_time_elapsed': '62.89', 'train/estimated_remaining_minutes': '3.703'}
7
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
8
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
9
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
10
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 154.20it/s]
11
+ 20%|██ | 200/1000 [02:13<09:01, 1.48it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
12
+ {'loss': '4.12', 'grad_norm': '1.125', 'learning_rate': '0.001', 'epoch': '0.06469', 'train/total_time_seconds': '31.46', 'train/time_per_step_avg': '0.257', 'train/epoch_time_elapsed': '77.2', 'train/estimated_remaining_minutes': '3.845'}
13
+ {'loss': '3.904', 'grad_norm': '0.8047', 'learning_rate': '0.001', 'epoch': '0.07547', 'train/total_time_seconds': '37.8', 'train/time_per_step_avg': '0.2613', 'train/epoch_time_elapsed': '91.15', 'train/estimated_remaining_minutes': '3.87'}
14
+ {'loss': '3.715', 'grad_norm': '1.258', 'learning_rate': '0.001', 'epoch': '0.08625', 'train/total_time_seconds': '44.08', 'train/time_per_step_avg': '0.2762', 'train/epoch_time_elapsed': '105', 'train/estimated_remaining_minutes': '3.857'}
15
+ {'loss': '3.565', 'grad_norm': '0.6289', 'learning_rate': '0.001', 'epoch': '0.09704', 'train/total_time_seconds': '50.42', 'train/time_per_step_avg': '0.2979', 'train/epoch_time_elapsed': '118.9', 'train/estimated_remaining_minutes': '3.828'}
16
+ {'loss': '3.437', 'grad_norm': '0.5781', 'learning_rate': '0.001', 'epoch': '0.1078', 'train/total_time_seconds': '57.4', 'train/time_per_step_avg': '0.3272', 'train/epoch_time_elapsed': '133.4', 'train/estimated_remaining_minutes': '3.827'}
17
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
18
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
19
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
20
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 161.42it/s]
21
+ 30%|███ | 300/1000 [03:23<07:49, 1.49it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
22
+ {'loss': '3.323', 'grad_norm': '0.832', 'learning_rate': '0.001', 'epoch': '0.1186', 'train/total_time_seconds': '64.54', 'train/time_per_step_avg': '0.3309', 'train/epoch_time_elapsed': '148', 'train/estimated_remaining_minutes': '3.814'}
23
+ {'loss': '3.229', 'grad_norm': '0.6211', 'learning_rate': '0.001', 'epoch': '0.1294', 'train/total_time_seconds': '70.94', 'train/time_per_step_avg': '0.3314', 'train/epoch_time_elapsed': '161.9', 'train/estimated_remaining_minutes': '3.744'}
24
+ {'loss': '3.139', 'grad_norm': '0.5859', 'learning_rate': '0.001', 'epoch': '0.1402', 'train/total_time_seconds': '77.43', 'train/time_per_step_avg': '0.3335', 'train/epoch_time_elapsed': '175.9', 'train/estimated_remaining_minutes': '3.673'}
25
+ {'loss': '3.056', 'grad_norm': '0.9492', 'learning_rate': '0.001', 'epoch': '0.1509', 'train/total_time_seconds': '83.82', 'train/time_per_step_avg': '0.3341', 'train/epoch_time_elapsed': '189.9', 'train/estimated_remaining_minutes': '3.592'}
26
+ {'loss': '2.987', 'grad_norm': '0.4531', 'learning_rate': '0.001', 'epoch': '0.1617', 'train/total_time_seconds': '90.28', 'train/time_per_step_avg': '0.3288', 'train/epoch_time_elapsed': '203.7', 'train/estimated_remaining_minutes': '3.511'}
27
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
28
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
29
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
30
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 156.30it/s]
31
+ 40%|████ | 400/1000 [04:34<07:23, 1.35it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
32
+ {'loss': '2.924', 'grad_norm': '0.5938', 'learning_rate': '0.001', 'epoch': '0.1725', 'train/total_time_seconds': '96.87', 'train/time_per_step_avg': '0.3232', 'train/epoch_time_elapsed': '217.9', 'train/estimated_remaining_minutes': '3.431'}
33
+ {'loss': '2.863', 'grad_norm': '0.6836', 'learning_rate': '0.001', 'epoch': '0.1833', 'train/total_time_seconds': '103.1', 'train/time_per_step_avg': '0.3219', 'train/epoch_time_elapsed': '231.7', 'train/estimated_remaining_minutes': '3.336'}
34
+ {'loss': '2.815', 'grad_norm': '0.582', 'learning_rate': '0.001', 'epoch': '0.1941', 'train/total_time_seconds': '109.8', 'train/time_per_step_avg': '0.3233', 'train/epoch_time_elapsed': '245.9', 'train/estimated_remaining_minutes': '3.252'}
35
+ {'loss': '2.769', 'grad_norm': '0.6719', 'learning_rate': '0.001', 'epoch': '0.2049', 'train/total_time_seconds': '116.7', 'train/time_per_step_avg': '0.3286', 'train/epoch_time_elapsed': '260.4', 'train/estimated_remaining_minutes': '3.173'}
36
+ {'loss': '2.726', 'grad_norm': '0.5781', 'learning_rate': '0.001', 'epoch': '0.2156', 'train/total_time_seconds': '123.6', 'train/time_per_step_avg': '0.3337', 'train/epoch_time_elapsed': '274.8', 'train/estimated_remaining_minutes': '3.091'}
37
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
38
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
39
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
40
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 164.59it/s]
41
+ 49%|████▉ | 493/1000 [05:39<06:06, 1.38it/s]?, ?it/s]
42
+ {'loss': '2.691', 'grad_norm': '0.7578', 'learning_rate': '0.001', 'epoch': '0.2264', 'train/total_time_seconds': '130.1', 'train/time_per_step_avg': '0.3322', 'train/epoch_time_elapsed': '288.8', 'train/estimated_remaining_minutes': '2.994'}
43
+ {'loss': '2.668', 'grad_norm': '0.6133', 'learning_rate': '0.001', 'epoch': '0.2372', 'train/total_time_seconds': '136.4', 'train/time_per_step_avg': '0.333', 'train/epoch_time_elapsed': '302.7', 'train/estimated_remaining_minutes': '2.894'}
44
+ {'loss': '2.632', 'grad_norm': '0.7461', 'learning_rate': '0.001', 'epoch': '0.248', 'train/total_time_seconds': '142.8', 'train/time_per_step_avg': '0.3306', 'train/epoch_time_elapsed': '316.7', 'train/estimated_remaining_minutes': '2.794'}
45
+ {'loss': '2.6', 'grad_norm': '0.6758', 'learning_rate': '0.001', 'epoch': '0.2588', 'train/total_time_seconds': '149.2', 'train/time_per_step_avg': '0.3248', 'train/epoch_time_elapsed': '330.5', 'train/estimated_remaining_minutes': '2.693'}
zain/Activation/wandb/run-20260814_211407-i85cngas/logs/debug-internal.log CHANGED
@@ -11,3 +11,43 @@
11
  {"time":"2026-08-14T21:14:23.78531736Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
12
  {"time":"2026-08-14T21:14:38.67602145Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1,"history_lines":1,"events_offset":1,"events_lines":2,"console_offset":0,"console_lines":1}
13
  {"time":"2026-08-14T21:14:39.034739883Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
11
  {"time":"2026-08-14T21:14:23.78531736Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
12
  {"time":"2026-08-14T21:14:38.67602145Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1,"history_lines":1,"events_offset":1,"events_lines":2,"console_offset":0,"console_lines":1}
13
  {"time":"2026-08-14T21:14:39.034739883Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
14
+ {"time":"2026-08-14T21:14:53.675822723Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":2,"history_lines":1,"events_offset":3,"events_lines":2,"console_offset":0,"console_lines":1}
15
+ {"time":"2026-08-14T21:14:53.807395658Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
16
+ {"time":"2026-08-14T21:15:08.675941416Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":3,"history_lines":1,"events_offset":5,"events_lines":2,"console_offset":0,"console_lines":1}
17
+ {"time":"2026-08-14T21:15:08.796615184Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
18
+ {"time":"2026-08-14T21:15:23.67592928Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":4,"history_lines":1,"events_offset":7,"events_lines":2,"console_offset":0,"console_lines":1}
19
+ {"time":"2026-08-14T21:15:23.823808371Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
20
+ {"time":"2026-08-14T21:15:38.676060528Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":5,"history_lines":1,"events_offset":9,"events_lines":2,"console_offset":2,"console_lines":10}
21
+ {"time":"2026-08-14T21:15:38.800433515Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
22
+ {"time":"2026-08-14T21:15:53.676379163Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":6,"history_lines":1,"events_offset":11,"events_lines":2,"console_offset":10,"console_lines":1}
23
+ {"time":"2026-08-14T21:15:53.864573795Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
24
+ {"time":"2026-08-14T21:16:08.676451313Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":7,"history_lines":2,"events_offset":13,"events_lines":2,"console_offset":10,"console_lines":1}
25
+ {"time":"2026-08-14T21:16:08.846470743Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
26
+ {"time":"2026-08-14T21:16:23.676410533Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":9,"history_lines":1,"events_offset":15,"events_lines":2,"console_offset":10,"console_lines":1}
27
+ {"time":"2026-08-14T21:16:23.824402577Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
28
+ {"time":"2026-08-14T21:16:38.676105689Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":10,"history_lines":1,"events_offset":17,"events_lines":2,"console_offset":12,"console_lines":10}
29
+ {"time":"2026-08-14T21:16:38.797045956Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
30
+ {"time":"2026-08-14T21:16:53.675927055Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":11,"history_lines":1,"events_offset":19,"events_lines":2,"console_offset":20,"console_lines":1}
31
+ {"time":"2026-08-14T21:16:53.988742485Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
32
+ {"time":"2026-08-14T21:17:08.67565261Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":12,"history_lines":1,"events_offset":21,"events_lines":2,"console_offset":20,"console_lines":1}
33
+ {"time":"2026-08-14T21:17:08.864252802Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
34
+ {"time":"2026-08-14T21:17:23.676114146Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":13,"history_lines":1,"events_offset":23,"events_lines":2,"console_offset":20,"console_lines":1}
35
+ {"time":"2026-08-14T21:17:23.795170156Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
36
+ {"time":"2026-08-14T21:17:38.675750893Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":14,"history_lines":1,"events_offset":25,"events_lines":2,"console_offset":20,"console_lines":1}
37
+ {"time":"2026-08-14T21:17:38.802369133Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
38
+ {"time":"2026-08-14T21:17:53.676337561Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":15,"history_lines":1,"events_offset":27,"events_lines":2,"console_offset":22,"console_lines":10}
39
+ {"time":"2026-08-14T21:17:53.805970984Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
40
+ {"time":"2026-08-14T21:18:08.675591884Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":16,"history_lines":1,"events_offset":29,"events_lines":2,"console_offset":30,"console_lines":1}
41
+ {"time":"2026-08-14T21:18:08.820307105Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
42
+ {"time":"2026-08-14T21:18:23.675794412Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":17,"history_lines":1,"events_offset":31,"events_lines":2,"console_offset":30,"console_lines":1}
43
+ {"time":"2026-08-14T21:18:23.797813599Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
44
+ {"time":"2026-08-14T21:18:38.67592157Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":18,"history_lines":1,"events_offset":33,"events_lines":2,"console_offset":30,"console_lines":1}
45
+ {"time":"2026-08-14T21:18:38.803567824Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
46
+ {"time":"2026-08-14T21:18:53.675427349Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":19,"history_lines":1,"events_offset":35,"events_lines":2,"console_offset":30,"console_lines":1}
47
+ {"time":"2026-08-14T21:18:53.788763708Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
48
+ {"time":"2026-08-14T21:19:08.675868235Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":20,"history_lines":1,"events_offset":37,"events_lines":2,"console_offset":32,"console_lines":10}
49
+ {"time":"2026-08-14T21:19:08.789887478Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
50
+ {"time":"2026-08-14T21:19:23.67545652Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":21,"history_lines":1,"events_offset":39,"events_lines":2,"console_offset":40,"console_lines":1}
51
+ {"time":"2026-08-14T21:19:23.817761924Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
52
+ {"time":"2026-08-14T21:19:38.676157583Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":22,"history_lines":1,"events_offset":41,"events_lines":2,"console_offset":40,"console_lines":1}
53
+ {"time":"2026-08-14T21:19:38.796224235Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
zain/Activation/wandb/run-20260814_211407-i85cngas/run-i85cngas.wandb CHANGED
Binary files a/zain/Activation/wandb/run-20260814_211407-i85cngas/run-i85cngas.wandb and b/zain/Activation/wandb/run-20260814_211407-i85cngas/run-i85cngas.wandb differ
 
zain/Activation/wandb/run-20260814_211507-54wnyexz/files/output.log ADDED
@@ -0,0 +1,74 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ [Override] Activated with value = -10.0
2
+ 74%|███████▍ | 2600/3500 [00:37<00:39, 22.64it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
3
+ {'loss': '2.273', 'grad_norm': '2.11e+07', 'learning_rate': '3.42e-05', 'epoch': '0.1699', 'train/total_time_seconds': '7.155', 'train/time_per_step_avg': '0.3578', 'train/epoch_time_elapsed': '8.346', 'train/estimated_remaining_minutes': '0.04638', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.6', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001129', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2656', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5488', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.5', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001122', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09277', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.459', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.459', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8848', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2591', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.1885', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.875', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.594', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-4.031', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.594', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '8.625', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '757.3', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '0.0003414', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.2617', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '1.375', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-1.375', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '1.367', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '2.742', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '197', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.0005646', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.09619', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '0.6289', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.6289', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '0.5898', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '1.219', 'train/tensor_act_model_layers_0_mlp/norm': '197', 'train/tensor_act_model_layers_0_mlp/mean': '0.0005646', 'train/tensor_act_model_layers_0_mlp/std': '0.09619', 'train/tensor_act_model_layers_0_mlp/max_abs': '0.6289', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.6289', 'train/tensor_act_model_layers_0_mlp/max': '0.5898', 'train/tensor_act_model_layers_0_mlp/range': '1.219', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '287.1', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.001694', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.1406', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '0.7383',
4
+ {'loss': '2.34', 'grad_norm': '3.67e+07', 'learning_rate': '7.02e-05', 'epoch': '0.1712', 'train/total_time_seconds': '13.29', 'train/time_per_step_avg': '0.3323', 'train/epoch_time_elapsed': '15.5', 'train/estimated_remaining_minutes': '0.08373'}
5
+ {'loss': '5.932', 'grad_norm': '1.326e+08', 'learning_rate': '9e-05', 'epoch': '0.1726', 'train/total_time_seconds': '19.63', 'train/time_per_step_avg': '0.3272', 'train/epoch_time_elapsed': '22.94', 'train/estimated_remaining_minutes': '0.1202', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.7', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001091', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5625', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.4', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001183', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09277', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4648', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.4648', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8906', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2584', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.1758', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.875', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.406', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-4.094', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.406', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '8.5', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '780.5', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.0003738', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.2695', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '1.398', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-1.398', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '1.375', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '2.773', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '203.4', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.01099', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.09863', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '0.6758', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.6758', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '0.6328', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '1.309', 'train/tensor_act_model_layers_0_mlp/norm': '203.4', 'train/tensor_act_model_layers_0_mlp/mean': '0.01099', 'train/tensor_act_model_layers_0_mlp/std': '0.09863', 'train/tensor_act_model_layers_0_mlp/max_abs': '0.6758', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.6758', 'train/tensor_act_model_layers_0_mlp/max': '0.6328', 'train/tensor_act_model_layers_0_mlp/range': '1.309', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '292.8', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.01215', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.1426', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '0.7422', 't
6
+ {'loss': '7.863', 'grad_norm': '2.349e+08', 'learning_rate': '9e-05', 'epoch': '0.1739', 'train/total_time_seconds': '25.74', 'train/time_per_step_avg': '0.3217', 'train/epoch_time_elapsed': '30.09', 'train/estimated_remaining_minutes': '0.153'}
7
+ {'loss': '8.117', 'grad_norm': '3.544e+08', 'learning_rate': '9e-05', 'epoch': '0.1753', 'train/total_time_seconds': '31.87', 'train/time_per_step_avg': '0.3187', 'train/epoch_time_elapsed': '37.23', 'train/estimated_remaining_minutes': '0.1839'}
8
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
9
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
10
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
11
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 14.22it/s]
12
+ 77%|███████▋ | 2700/3500 [01:13<04:29, 2.97it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
13
+ {'loss': '8.233', 'grad_norm': '4.823e+08', 'learning_rate': '9e-05', 'epoch': '0.1766', 'train/total_time_seconds': '38.22', 'train/time_per_step_avg': '0.3106', 'train/epoch_time_elapsed': '44.91', 'train/estimated_remaining_minutes': '0.2139', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.6', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001053', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5625', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.5', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001129', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09277', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3945', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8203', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2607', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.1621', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.8867', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.844', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-3.984', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.844', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '8.828', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '841.2', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.0009842', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.291', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '1.43', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-1.43', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '1.422', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '2.852', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '229.8', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.02795', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.1089', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '0.6953', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.6953', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '0.5586', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '1.254', 'train/tensor_act_model_layers_0_mlp/norm': '229.8', 'train/tensor_act_model_layers_0_mlp/mean': '0.02795', 'train/tensor_act_model_layers_0_mlp/std': '0.1089', 'train/tensor_act_model_layers_0_mlp/max_abs': '0.6953', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.6953', 'train/tensor_act_model_layers_0_mlp/max': '0.5586', 'train/tensor_act_model_layers_0_mlp/range': '1.254', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '312.4', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.02905', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.1494', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '0.7422', 'tra
14
+ {'loss': '8.297', 'grad_norm': '6.082e+08', 'learning_rate': '9e-05', 'epoch': '0.178', 'train/total_time_seconds': '44.21', 'train/time_per_step_avg': '0.3092', 'train/epoch_time_elapsed': '51.93', 'train/estimated_remaining_minutes': '0.24'}
15
+ {'loss': '8.347', 'grad_norm': '7.256e+08', 'learning_rate': '9e-05', 'epoch': '0.1793', 'train/total_time_seconds': '50.67', 'train/time_per_step_avg': '0.3104', 'train/epoch_time_elapsed': '59.5', 'train/estimated_remaining_minutes': '0.2667', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '188.1', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001144', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5625', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.9', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001152', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.4023', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8281', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2621', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.1504', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.8906', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.812', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-4', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.812', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '8.812', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '899.6', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.000267', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.3105', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '1.719', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-1.641', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '1.719', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '3.359', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '267.3', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.04395', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.123', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '0.6836', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.6836', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '0.582', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '1.266', 'train/tensor_act_model_layers_0_mlp/norm': '267.3', 'train/tensor_act_model_layers_0_mlp/mean': '0.04395', 'train/tensor_act_model_layers_0_mlp/std': '0.123', 'train/tensor_act_model_layers_0_mlp/max_abs': '0.6836', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.6836', 'train/tensor_act_model_layers_0_mlp/max': '0.582', 'train/tensor_act_model_layers_0_mlp/range': '1.266', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '341.9', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.04492', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.1611', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '0.7539', 'train/tens
16
+ {'loss': '8.382', 'grad_norm': '8.347e+08', 'learning_rate': '9e-05', 'epoch': '0.1807', 'train/total_time_seconds': '56.64', 'train/time_per_step_avg': '0.309', 'train/epoch_time_elapsed': '66.53', 'train/estimated_remaining_minutes': '0.2888'}
17
+ {'loss': '8.44', 'grad_norm': '9.311e+08', 'learning_rate': '9e-05', 'epoch': '0.182', 'train/total_time_seconds': '62.96', 'train/time_per_step_avg': '0.3109', 'train/epoch_time_elapsed': '73.86', 'train/estimated_remaining_minutes': '0.3109'}
18
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
19
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
20
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
21
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 17.04it/s]
22
+ 80%|████████ | 2800/3500 [01:50<03:46, 3.09it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
23
+ {'loss': '8.472', 'grad_norm': '1.04e+09', 'learning_rate': '9e-05', 'epoch': '0.1834', 'train/total_time_seconds': '70.05', 'train/time_per_step_avg': '0.3183', 'train/epoch_time_elapsed': '82.22', 'train/estimated_remaining_minutes': '0.3348', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.9', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001205', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5625', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.6', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001236', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.457', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.457', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8828', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2647', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.1396', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.9023', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.5', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-3.984', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.5', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '8.484', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '969.8', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '0.0004234', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.334', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '2.281', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-2.25', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '2.281', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '4.531', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '332.1', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.06543', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.1484', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '0.6953', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.6953', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '0.5938', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '1.289', 'train/tensor_act_model_layers_0_mlp/norm': '332.1', 'train/tensor_act_model_layers_0_mlp/mean': '0.06543', 'train/tensor_act_model_layers_0_mlp/std': '0.1484', 'train/tensor_act_model_layers_0_mlp/max_abs': '0.6953', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.6953', 'train/tensor_act_model_layers_0_mlp/max': '0.5938', 'train/tensor_act_model_layers_0_mlp/range': '1.289', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '395.3', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.06689', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.1807', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '0.7891', 'train/tens
24
+ {'loss': '8.497', 'grad_norm': '1.132e+09', 'learning_rate': '9e-05', 'epoch': '0.1847', 'train/total_time_seconds': '76.2', 'train/time_per_step_avg': '0.3199', 'train/epoch_time_elapsed': '89.42', 'train/estimated_remaining_minutes': '0.3523'}
25
+ {'loss': '8.525', 'grad_norm': '1.208e+09', 'learning_rate': '9e-05', 'epoch': '0.186', 'train/total_time_seconds': '82.59', 'train/time_per_step_avg': '0.3191', 'train/epoch_time_elapsed': '96.95', 'train/estimated_remaining_minutes': '0.369', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '188', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001038', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5625', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.8', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001137', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.4219', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8477', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2677', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.1279', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.9141', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.438', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-4.031', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.438', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '8.469', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '1056', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '0.0005379', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.3652', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '2.922', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-2.734', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '2.922', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '5.656', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '443.7', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.1006', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.1924', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '0.8203', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.7188', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '0.8203', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '1.539', 'train/tensor_act_model_layers_0_mlp/norm': '443.7', 'train/tensor_act_model_layers_0_mlp/mean': '0.1006', 'train/tensor_act_model_layers_0_mlp/std': '0.1924', 'train/tensor_act_model_layers_0_mlp/max_abs': '0.8203', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.7188', 'train/tensor_act_model_layers_0_mlp/max': '0.8203', 'train/tensor_act_model_layers_0_mlp/range': '1.539', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '493.9', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.1016', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.2188', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '0.9766', 'train/ten
26
+ {'loss': '8.553', 'grad_norm': '1.267e+09', 'learning_rate': '9e-05', 'epoch': '0.1874', 'train/total_time_seconds': '88.72', 'train/time_per_step_avg': '0.3209', 'train/epoch_time_elapsed': '104.2', 'train/estimated_remaining_minutes': '0.383'}
27
+ {'loss': '8.564', 'grad_norm': '1.351e+09', 'learning_rate': '9e-05', 'epoch': '0.1887', 'train/total_time_seconds': '94.48', 'train/time_per_step_avg': '0.3152', 'train/epoch_time_elapsed': '110.9', 'train/estimated_remaining_minutes': '0.3936'}
28
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
29
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
30
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
31
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 17.10it/s]
32
+ 83%|████████▎ | 2900/3500 [02:27<03:28, 2.88it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
33
+ {'loss': '8.574', 'grad_norm': '1.443e+09', 'learning_rate': '9e-05', 'epoch': '0.1901', 'train/total_time_seconds': '101', 'train/time_per_step_avg': '0.3093', 'train/epoch_time_elapsed': '118.9', 'train/estimated_remaining_minutes': '0.4058', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.8', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001137', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5547', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.7', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001129', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3867', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8125', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2715', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.126', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.9297', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.875', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-4.25', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.875', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '9.125', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '1166', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '0.00174', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.4023', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '3.578', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-3.438', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '3.578', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '7.016', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '635.9', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.1602', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.2656', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '1.188', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.7422', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '1.188', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '1.93', 'train/tensor_act_model_layers_0_mlp/norm': '635.9', 'train/tensor_act_model_layers_0_mlp/mean': '0.1602', 'train/tensor_act_model_layers_0_mlp/std': '0.2656', 'train/tensor_act_model_layers_0_mlp/max_abs': '1.188', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.7422', 'train/tensor_act_model_layers_0_mlp/max': '1.188', 'train/tensor_act_model_layers_0_mlp/range': '1.93', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '673.6', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.1611', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.2871', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '1.305', 'train/tensor_act_m
34
+ {'loss': '8.589', 'grad_norm': '1.485e+09', 'learning_rate': '9e-05', 'epoch': '0.1914', 'train/total_time_seconds': '107.2', 'train/time_per_step_avg': '0.3096', 'train/epoch_time_elapsed': '126.2', 'train/estimated_remaining_minutes': '0.4151'}
35
+ {'loss': '8.59', 'grad_norm': '1.544e+09', 'learning_rate': '9e-05', 'epoch': '0.1928', 'train/total_time_seconds': '114.1', 'train/time_per_step_avg': '0.3148', 'train/epoch_time_elapsed': '134.2', 'train/estimated_remaining_minutes': '0.4254', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '188.2', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001305', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2656', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5488', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '191.1', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001266', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4004', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4004', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3887', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.7891', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2748', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.1172', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.9414', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.844', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-4.156', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.844', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '9', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '1282', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '0.003021', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.4434', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '4.156', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-3.859', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '4.156', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '8.016', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '891.8', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.2363', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.3652', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '1.641', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.7852', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '1.641', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '2.426', 'train/tensor_act_model_layers_0_mlp/norm': '891.8', 'train/tensor_act_model_layers_0_mlp/mean': '0.2363', 'train/tensor_act_model_layers_0_mlp/std': '0.3652', 'train/tensor_act_model_layers_0_mlp/max_abs': '1.641', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.7852', 'train/tensor_act_model_layers_0_mlp/max': '1.641', 'train/tensor_act_model_layers_0_mlp/range': '2.426', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '920.8', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.2373', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.3809', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '1.695', 'train/tensor_act
36
+ {'loss': '8.597', 'grad_norm': '1.602e+09', 'learning_rate': '9e-05', 'epoch': '0.1941', 'train/total_time_seconds': '119.9', 'train/time_per_step_avg': '0.3118', 'train/epoch_time_elapsed': '141.1', 'train/estimated_remaining_minutes': '0.4302'}
37
+ {'loss': '8.607', 'grad_norm': '1.644e+09', 'learning_rate': '9e-05', 'epoch': '0.1955', 'train/total_time_seconds': '125.7', 'train/time_per_step_avg': '0.3125', 'train/epoch_time_elapsed': '147.9', 'train/estimated_remaining_minutes': '0.4335'}
38
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
39
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
40
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
41
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 16.79it/s]
42
+ 86%|████████▌ | 3000/3500 [03:04<02:46, 3.01it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
43
+ {'loss': '8.605', 'grad_norm': '1.703e+09', 'learning_rate': '9e-05', 'epoch': '0.1968', 'train/total_time_seconds': '132.5', 'train/time_per_step_avg': '0.3149', 'train/epoch_time_elapsed': '155.9', 'train/estimated_remaining_minutes': '0.4386', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.9', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001228', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5625', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.7', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001419', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.418', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8438', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2795', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.1035', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.9609', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.719', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-4.719', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.688', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '9.406', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '1418', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '0.002075', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.4902', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '4.719', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-4.344', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '4.719', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '9.062', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '1195', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.3242', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.4844', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '2.094', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.7695', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '2.094', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '2.863', 'train/tensor_act_model_layers_0_mlp/norm': '1195', 'train/tensor_act_model_layers_0_mlp/mean': '0.3242', 'train/tensor_act_model_layers_0_mlp/std': '0.4844', 'train/tensor_act_model_layers_0_mlp/max_abs': '2.094', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.7695', 'train/tensor_act_model_layers_0_mlp/max': '2.094', 'train/tensor_act_model_layers_0_mlp/range': '2.863', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '1219', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.3262', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.498', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '2.141', 'train/tensor_act
44
+ {'loss': '8.618', 'grad_norm': '1.736e+09', 'learning_rate': '9e-05', 'epoch': '0.1982', 'train/total_time_seconds': '138.1', 'train/time_per_step_avg': '0.3098', 'train/epoch_time_elapsed': '162.6', 'train/estimated_remaining_minutes': '0.4386'}
45
+ {'loss': '8.625', 'grad_norm': '1.778e+09', 'learning_rate': '9e-05', 'epoch': '0.1995', 'train/total_time_seconds': '144.8', 'train/time_per_step_avg': '0.3076', 'train/epoch_time_elapsed': '170.4', 'train/estimated_remaining_minutes': '0.4403', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.8', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.00116', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5625', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.8', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001213', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3926', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8184', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2880', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.09277', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '0.9883', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '5.25', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.25', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.844', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '10.09', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '1594', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '0.001572', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.5508', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.156', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.031', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.156', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '10.19', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '1654', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.4648', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.6602', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '2.703', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.793', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '2.703', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '3.496', 'train/tensor_act_model_layers_0_mlp/norm': '1654', 'train/tensor_act_model_layers_0_mlp/mean': '0.4648', 'train/tensor_act_model_layers_0_mlp/std': '0.6602', 'train/tensor_act_model_layers_0_mlp/max_abs': '2.703', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.793', 'train/tensor_act_model_layers_0_mlp/max': '2.703', 'train/tensor_act_model_layers_0_mlp/range': '3.496', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '1673', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.4648', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.6719', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '2.75', 'train/tensor_act_mo
46
+ {'loss': '8.63', 'grad_norm': '1.812e+09', 'learning_rate': '9e-05', 'epoch': '0.2009', 'train/total_time_seconds': '150.6', 'train/time_per_step_avg': '0.3071', 'train/epoch_time_elapsed': '177.2', 'train/estimated_remaining_minutes': '0.438'}
47
+ {'loss': '8.634', 'grad_norm': '1.871e+09', 'learning_rate': '9e-05', 'epoch': '0.2022', 'train/total_time_seconds': '156.6', 'train/time_per_step_avg': '0.3082', 'train/epoch_time_elapsed': '184.2', 'train/estimated_remaining_minutes': '0.4349'}
48
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
49
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
50
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
51
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 18.00it/s]
52
+ 89%|████████▊ | 3100/3500 [03:41<02:16, 2.93it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
53
+ {'loss': '8.635', 'grad_norm': '1.904e+09', 'learning_rate': '9e-05', 'epoch': '0.2036', 'train/total_time_seconds': '163.8', 'train/time_per_step_avg': '0.3128', 'train/epoch_time_elapsed': '192.7', 'train/estimated_remaining_minutes': '0.4338', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.9', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001167', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5625', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.8', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001152', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.418', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8438', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '2962', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.08008', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.023', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '4.938', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-4.938', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.812', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '9.75', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '1790', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '0.000843', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.6172', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.5', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.188', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.5', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '10.69', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '2286', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.6484', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '0.9102', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '3.562', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.9023', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '3.562', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '4.465', 'train/tensor_act_model_layers_0_mlp/norm': '2286', 'train/tensor_act_model_layers_0_mlp/mean': '0.6484', 'train/tensor_act_model_layers_0_mlp/std': '0.9102', 'train/tensor_act_model_layers_0_mlp/max_abs': '3.562', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.9023', 'train/tensor_act_model_layers_0_mlp/max': '3.562', 'train/tensor_act_model_layers_0_mlp/range': '4.465', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '2302', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.6484', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '0.918', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '3.609', 'train/tensor_act_mode
54
+ {'loss': '8.64', 'grad_norm': '1.913e+09', 'learning_rate': '9e-05', 'epoch': '0.2049', 'train/total_time_seconds': '169.7', 'train/time_per_step_avg': '0.3157', 'train/epoch_time_elapsed': '199.7', 'train/estimated_remaining_minutes': '0.428'}
55
+ {'loss': '8.641', 'grad_norm': '1.929e+09', 'learning_rate': '9e-05', 'epoch': '0.2063', 'train/total_time_seconds': '176.3', 'train/time_per_step_avg': '0.3147', 'train/epoch_time_elapsed': '207.4', 'train/estimated_remaining_minutes': '0.4225', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.7', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001274', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2754', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5547', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.6', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001251', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4316', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4316', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3926', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8242', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '3076', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.07324', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.062', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '5.062', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.062', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.812', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '9.875', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '1999', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.0003624', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.6914', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.719', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.594', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.719', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.31', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '3112', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '0.9062', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '1.219', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '4.438', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.8594', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '4.438', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '5.297', 'train/tensor_act_model_layers_0_mlp/norm': '3112', 'train/tensor_act_model_layers_0_mlp/mean': '0.9062', 'train/tensor_act_model_layers_0_mlp/std': '1.219', 'train/tensor_act_model_layers_0_mlp/max_abs': '4.438', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.8594', 'train/tensor_act_model_layers_0_mlp/max': '4.438', 'train/tensor_act_model_layers_0_mlp/range': '5.297', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '3125', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '0.9102', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '1.227', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '4.5', 'train/tensor_act_
56
+ {'loss': '8.64', 'grad_norm': '1.963e+09', 'learning_rate': '9e-05', 'epoch': '0.2076', 'train/total_time_seconds': '182.7', 'train/time_per_step_avg': '0.3205', 'train/epoch_time_elapsed': '214.8', 'train/estimated_remaining_minutes': '0.4152'}
57
+ {'loss': '8.642', 'grad_norm': '1.98e+09', 'learning_rate': '9e-05', 'epoch': '0.209', 'train/total_time_seconds': '188.4', 'train/time_per_step_avg': '0.3186', 'train/epoch_time_elapsed': '221.6', 'train/estimated_remaining_minutes': '0.4052'}
58
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
59
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
60
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
61
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 15.92it/s]
62
+ 91%|█████████▏| 3200/3500 [04:17<01:41, 2.95it/s][transformers] TinyLlamaForCausalLM has generative capabilities, as `prepare_inputs_for_generation` is explicitly defined. However, it doesn't directly inherit from `GenerationMixin`. From 👉v4.50👈 onwards, `PreTrainedModel` will NOT inherit from `GenerationMixin`, and this model will lose the ability to call `generate` and other related functions.
63
+ {'loss': '8.642', 'grad_norm': '2.022e+09', 'learning_rate': '9e-05', 'epoch': '0.2103', 'train/total_time_seconds': '195.1', 'train/time_per_step_avg': '0.3132', 'train/epoch_time_elapsed': '229.5', 'train/estimated_remaining_minutes': '0.396', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.8', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001183', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2656', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5488', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.6', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001228', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.3828', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8086', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '3152', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.05542', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.086', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '5.281', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.281', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.812', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '10.09', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '2182', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.002289', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.7539', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.875', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.75', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.875', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.62', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '3886', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '1.133', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '1.523', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '5.375', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.9141', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '5.375', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '6.289', 'train/tensor_act_model_layers_0_mlp/norm': '3886', 'train/tensor_act_model_layers_0_mlp/mean': '1.133', 'train/tensor_act_model_layers_0_mlp/std': '1.523', 'train/tensor_act_model_layers_0_mlp/max_abs': '5.375', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.9141', 'train/tensor_act_model_layers_0_mlp/max': '5.375', 'train/tensor_act_model_layers_0_mlp/range': '6.289', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '3897', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '1.141', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '1.523', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '5.406', 'train/tensor_act_mode
64
+ {'loss': '8.641', 'grad_norm': '2.03e+09', 'learning_rate': '9e-05', 'epoch': '0.2117', 'train/total_time_seconds': '200.7', 'train/time_per_step_avg': '0.3102', 'train/epoch_time_elapsed': '236.2', 'train/estimated_remaining_minutes': '0.3836'}
65
+ {'loss': '8.635', 'grad_norm': '2.013e+09', 'learning_rate': '9e-05', 'epoch': '0.213', 'train/total_time_seconds': '207.4', 'train/time_per_step_avg': '0.3112', 'train/epoch_time_elapsed': '244', 'train/estimated_remaining_minutes': '0.3719', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '187.8', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.001183', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2793', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5625', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.6', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001366', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.377', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8027', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '3254', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.04736', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.125', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '5.344', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.344', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '4.906', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '10.25', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '2363', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.003601', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.8164', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.938', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.812', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.938', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.75', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '4667', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '1.375', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '1.812', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '6.375', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-0.9531', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '6.375', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '7.328', 'train/tensor_act_model_layers_0_mlp/norm': '4667', 'train/tensor_act_model_layers_0_mlp/mean': '1.375', 'train/tensor_act_model_layers_0_mlp/std': '1.812', 'train/tensor_act_model_layers_0_mlp/max_abs': '6.375', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-0.9531', 'train/tensor_act_model_layers_0_mlp/max': '6.375', 'train/tensor_act_model_layers_0_mlp/range': '7.328', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '4678', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '1.383', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '1.82', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '6.5', 'train/tensor_act_model_lay
66
+ {'loss': '8.637', 'grad_norm': '2.038e+09', 'learning_rate': '9e-05', 'epoch': '0.2144', 'train/total_time_seconds': '213.1', 'train/time_per_step_avg': '0.3043', 'train/epoch_time_elapsed': '250.8', 'train/estimated_remaining_minutes': '0.3574'}
67
+ {'loss': '8.642', 'grad_norm': '2.038e+09', 'learning_rate': '9e-05', 'epoch': '0.2157', 'train/total_time_seconds': '218.9', 'train/time_per_step_avg': '0.3049', 'train/epoch_time_elapsed': '257.6', 'train/estimated_remaining_minutes': '0.342'}
68
+ - If you're using `trust_remote_code=True`, you can get rid of this warning by loading the model with an auto class. See https://huggingface.co/docs/transformers/en/model_doc/auto#auto-classes
69
+ - If you are the owner of the model architecture code, please modify your model class such that it inherits from `GenerationMixin` (after `PreTrainedModel`, otherwise you'll get an exception).
70
+ - If you are not the owner of the model architecture class, please contact the model code owner to update it.
71
+ Writing model shards: 100%|██████████| 1/1 [00:00<00:00, 14.13it/s]
72
+ 93%|█████████▎| 3257/3500 [04:39<01:40, 2.41it/s], ?it/s]
73
+ {'loss': '8.636', 'grad_norm': '2.097e+09', 'learning_rate': '9e-05', 'epoch': '0.2171', 'train/total_time_seconds': '225.9', 'train/time_per_step_avg': '0.308', 'train/epoch_time_elapsed': '265.8', 'train/estimated_remaining_minutes': '0.3273', 'train/tensor_act_model_layers_0_residual_pre_attn/norm': '188', 'train/tensor_act_model_layers_0_residual_pre_attn/mean': '0.00116', 'train/tensor_act_model_layers_0_residual_pre_attn/std': '0.0918', 'train/tensor_act_model_layers_0_residual_pre_attn/max_abs': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_pre_attn/min': '-0.2656', 'train/tensor_act_model_layers_0_residual_pre_attn/max': '0.2832', 'train/tensor_act_model_layers_0_residual_pre_attn/range': '0.5488', 'train/tensor_act_model_layers_0_residual_post_attn/norm': '190.9', 'train/tensor_act_model_layers_0_residual_post_attn/mean': '0.001183', 'train/tensor_act_model_layers_0_residual_post_attn/std': '0.09326', 'train/tensor_act_model_layers_0_residual_post_attn/max_abs': '0.4609', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_residual_post_attn/min': '-0.4258', 'train/tensor_act_model_layers_0_residual_post_attn/max': '0.4609', 'train/tensor_act_model_layers_0_residual_post_attn/range': '0.8867', 'train/tensor_act_model_layers_0_mlp_gate_proj/norm': '3337', 'train/tensor_act_model_layers_0_mlp_gate_proj/mean': '-0.03711', 'train/tensor_act_model_layers_0_mlp_gate_proj/std': '1.148', 'train/tensor_act_model_layers_0_mlp_gate_proj/max_abs': '5.5', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_gate_proj/min': '-5.5', 'train/tensor_act_model_layers_0_mlp_gate_proj/max': '5.312', 'train/tensor_act_model_layers_0_mlp_gate_proj/range': '10.81', 'train/tensor_act_model_layers_0_mlp_up_proj/norm': '2511', 'train/tensor_act_model_layers_0_mlp_up_proj/mean': '-0.005219', 'train/tensor_act_model_layers_0_mlp_up_proj/std': '0.8672', 'train/tensor_act_model_layers_0_mlp_up_proj/max_abs': '5.938', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_up_proj/min': '-5.906', 'train/tensor_act_model_layers_0_mlp_up_proj/max': '5.938', 'train/tensor_act_model_layers_0_mlp_up_proj/range': '11.84', 'train/tensor_act_model_layers_0_mlp_down_proj/norm': '5459', 'train/tensor_act_model_layers_0_mlp_down_proj/mean': '1.625', 'train/tensor_act_model_layers_0_mlp_down_proj/std': '2.109', 'train/tensor_act_model_layers_0_mlp_down_proj/max_abs': '7.469', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp_down_proj/min': '-1.008', 'train/tensor_act_model_layers_0_mlp_down_proj/max': '7.469', 'train/tensor_act_model_layers_0_mlp_down_proj/range': '8.477', 'train/tensor_act_model_layers_0_mlp/norm': '5459', 'train/tensor_act_model_layers_0_mlp/mean': '1.625', 'train/tensor_act_model_layers_0_mlp/std': '2.109', 'train/tensor_act_model_layers_0_mlp/max_abs': '7.469', 'train/tensor_act_model_layers_0_mlp/frac_near_dtype_limit': '0', 'train/tensor_act_model_layers_0_mlp/frac_near_user_limit': '0', 'train/tensor_act_model_layers_0_mlp/min': '-1.008', 'train/tensor_act_model_layers_0_mlp/max': '7.469', 'train/tensor_act_model_layers_0_mlp/range': '8.477', 'train/tensor_act_model_layers_0_residual_post_mlp/norm': '5468', 'train/tensor_act_model_layers_0_residual_post_mlp/mean': '1.625', 'train/tensor_act_model_layers_0_residual_post_mlp/std': '2.125', 'train/tensor_act_model_layers_0_residual_post_mlp/max_abs': '7.594', 'train/tensor_act_model_layers
74
+ {'loss': '8.637', 'grad_norm': '2.097e+09', 'learning_rate': '9e-05', 'epoch': '0.2184', 'train/total_time_seconds': '231.8', 'train/time_per_step_avg': '0.3103', 'train/epoch_time_elapsed': '272.8', 'train/estimated_remaining_minutes': '0.31'}
zain/Activation/wandb/run-20260814_211507-54wnyexz/files/requirements.txt ADDED
@@ -0,0 +1,149 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ asttokens==3.0.1
2
+ comm==0.2.3
3
+ debugpy==1.8.21
4
+ decorator==5.3.1
5
+ executing==2.2.1
6
+ nest-asyncio==1.6.0
7
+ parso==0.8.7
8
+ platformdirs==4.11.0
9
+ psutil==7.2.2
10
+ ptyprocess==0.7.0
11
+ pure_eval==0.2.3
12
+ Pygments==2.20.0
13
+ pyzmq==27.1.0
14
+ setuptools==83.0.0
15
+ six==1.17.0
16
+ tornado==6.5.7
17
+ traitlets==5.15.0
18
+ fsspec==2026.4.0
19
+ wcwidth==0.8.2
20
+ ipython_pygments_lexers==1.1.1
21
+ jedi==0.20.0
22
+ jupyter_core==5.9.1
23
+ matplotlib-inline==0.2.2
24
+ pexpect==4.9.0
25
+ prompt_toolkit==3.0.53
26
+ python-dateutil==2.9.0.post0
27
+ stack_data==0.6.3
28
+ wheel==0.47.0
29
+ jupyter_client==8.9.1
30
+ pip==26.1.2
31
+ ipython==9.15.0
32
+ ipykernel==7.2.0
33
+ threadpoolctl==3.6.0
34
+ pyparsing==3.3.2
35
+ typing_extensions==4.15.0
36
+ Jinja2==3.1.6
37
+ narwhals==2.24.0
38
+ kiwisolver==1.5.0
39
+ joblib==1.5.3
40
+ fonttools==4.63.0
41
+ cycler==0.12.1
42
+ scipy==1.17.1
43
+ pandas==3.0.5
44
+ contourpy==1.3.3
45
+ scikit-learn==1.9.0
46
+ matplotlib==3.11.1
47
+ urllib3==2.7.0
48
+ tqdm==4.70.0
49
+ idna==3.18
50
+ charset-normalizer==3.4.9
51
+ certifi==2026.7.22
52
+ requests==2.34.2
53
+ seaborn==0.13.2
54
+ uv==0.12.0
55
+ shellingham==1.5.4
56
+ mpmath==1.3.0
57
+ attrs==26.1.0
58
+ hf-xet==1.5.2
59
+ nvidia-nccl-cu12==2.21.5
60
+ MarkupSafe==3.0.3
61
+ regex==2026.7.19
62
+ importlib_metadata==9.0.0
63
+ httpcore==1.0.9
64
+ annotated-doc==0.0.5
65
+ multidict==6.7.1
66
+ aiohttp==3.14.3
67
+ aiosignal==1.4.0
68
+ xxhash==3.8.1
69
+ aiohappyeyeballs==2.7.1
70
+ mdurl==0.1.2
71
+ cuda-toolkit==13.0.3.0
72
+ networkx==3.6.1
73
+ PyYAML==6.0.3
74
+ nvidia-cufile==1.15.1.6
75
+ typer==0.27.0
76
+ torchaudio==2.6.0+cu124
77
+ rich==15.0.0
78
+ nvidia-cufft-cu12==11.2.1.3
79
+ h11==0.16.0
80
+ dill==0.4.1
81
+ cuda-pathfinder==1.6.0
82
+ filelock==3.29.0
83
+ nvidia-nvtx-cu12==12.4.127
84
+ httpx==0.28.1
85
+ anyio==4.14.2
86
+ numpy==2.4.4
87
+ yarl==1.24.5
88
+ click==8.4.2
89
+ triton==3.2.0
90
+ frozenlist==1.8.0
91
+ zipp==4.1.0
92
+ propcache==0.5.2
93
+ tokenizers==0.22.2
94
+ markdown-it-py==4.2.0
95
+ nvidia-cuda-runtime==13.0.96
96
+ cuda-bindings==13.3.1
97
+ nvidia-cuda-cupti==13.0.85
98
+ torch==2.6.0+cu124
99
+ multiprocess==0.70.19
100
+ pillow==12.2.0
101
+ transformers==5.16.0.dev0
102
+ wandb==0.28.1
103
+ nvidia-curand==10.4.0.35
104
+ sympy==1.13.1
105
+ nvidia-cusparse==12.6.3.3
106
+ nvidia-cuda-nvrtc==13.0.88
107
+ typing-inspection==0.4.2
108
+ nvidia-cusolver==12.0.4.66
109
+ nvidia-cufft==12.0.0.61
110
+ nvidia-cudnn-cu13==9.20.0.48
111
+ nvidia-cublas==13.1.1.3
112
+ pyarrow==25.0.0
113
+ evaluate==0.4.6
114
+ diffusers==0.39.0
115
+ pydantic==2.13.4
116
+ annotated-types==0.8.0
117
+ protobuf==7.35.1
118
+ sentry-sdk==2.66.1
119
+ einops==0.8.2
120
+ packaging==26.2
121
+ nvidia-nvjitlink-cu12==12.4.127
122
+ nvidia-curand-cu12==10.3.5.147
123
+ nvidia-cusparselt-cu12==0.6.2
124
+ nvidia-cusparse-cu12==12.3.1.170
125
+ nvidia-cuda-runtime-cu12==12.4.127
126
+ torchvision==0.21.0+cu124
127
+ nvidia-cuda-nvrtc-cu12==12.4.127
128
+ nvidia-cuda-cupti-cu12==12.4.127
129
+ nvidia-cusolver-cu12==11.6.1.9
130
+ nvidia-cublas-cu12==12.4.5.8
131
+ nvidia-cudnn-cu12==9.1.0.70
132
+ huggingface_hub==1.26.0
133
+ datasets==5.0.1
134
+ safetensors==0.8.0
135
+ accelerate==1.14.0
136
+ pydantic_core==2.46.4
137
+ ninja==1.13.0
138
+ autocommand==2.2.2
139
+ backports.tarfile==1.2.0
140
+ importlib_metadata==8.7.1
141
+ jaraco.text==4.0.0
142
+ jaraco.context==6.1.0
143
+ jaraco.functools==4.4.0
144
+ more-itertools==10.8.0
145
+ packaging==26.0
146
+ platformdirs==4.4.0
147
+ tomli==2.4.0
148
+ wheel==0.46.3
149
+ zipp==3.23.0
zain/Activation/wandb/run-20260814_211507-54wnyexz/files/wandb-metadata.json ADDED
@@ -0,0 +1,99 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "os": "Linux-5.15.0-126-generic-x86_64-with-glibc2.35",
3
+ "python": "CPython 3.11.15",
4
+ "startedAt": "2026-08-14T21:15:07.166881Z",
5
+ "args": [
6
+ "--config",
7
+ "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/configs/baseline100l.yaml",
8
+ "--variants",
9
+ "glu-relu",
10
+ "glu-gelu",
11
+ "glu-sigmoid",
12
+ "glu-waleed10",
13
+ "glu-silu-waleed10"
14
+ ],
15
+ "program": "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/sweep.py",
16
+ "codePath": "sweep.py",
17
+ "codePathLocal": "sweep.py",
18
+ "git": {
19
+ "remote": "https://github.com/w-ahmad1a10/Activation.git",
20
+ "commit": "3fb47c6943d6927eafc39bd399a3d3a520bae74a"
21
+ },
22
+ "email": "deepnevro@gmail.com",
23
+ "root": "/mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation",
24
+ "host": "deeplens-k3s-node1",
25
+ "executable": "/mnt/data/zainulabideen/zain-exp/notebooks/my_env/bin/python",
26
+ "cpu_count": 112,
27
+ "cpu_count_logical": 224,
28
+ "gpu": "NVIDIA H100 80GB HBM3",
29
+ "gpu_count": 8,
30
+ "disk": {
31
+ "/": {
32
+ "total": "1560765693952",
33
+ "used": "703915499520"
34
+ }
35
+ },
36
+ "memory": {
37
+ "total": "2164089937920"
38
+ },
39
+ "gpu_nvidia": [
40
+ {
41
+ "name": "NVIDIA H100 80GB HBM3",
42
+ "memoryTotal": "85520809984",
43
+ "cudaCores": 16896,
44
+ "architecture": "Hopper",
45
+ "uuid": "GPU-39c684a5-fde6-83d7-1663-0859795881ae"
46
+ },
47
+ {
48
+ "name": "NVIDIA H100 80GB HBM3",
49
+ "memoryTotal": "85520809984",
50
+ "cudaCores": 16896,
51
+ "architecture": "Hopper",
52
+ "uuid": "GPU-68012e5a-38b6-b643-0ca6-62fb66720bf3"
53
+ },
54
+ {
55
+ "name": "NVIDIA H100 80GB HBM3",
56
+ "memoryTotal": "85520809984",
57
+ "cudaCores": 16896,
58
+ "architecture": "Hopper",
59
+ "uuid": "GPU-132944c4-b689-2b5f-89a4-d730401677ab"
60
+ },
61
+ {
62
+ "name": "NVIDIA H100 80GB HBM3",
63
+ "memoryTotal": "85520809984",
64
+ "cudaCores": 16896,
65
+ "architecture": "Hopper",
66
+ "uuid": "GPU-2df386cc-6d26-d0e2-7a2d-a057b0d95864"
67
+ },
68
+ {
69
+ "name": "NVIDIA H100 80GB HBM3",
70
+ "memoryTotal": "85520809984",
71
+ "cudaCores": 16896,
72
+ "architecture": "Hopper",
73
+ "uuid": "GPU-bfa16575-1d94-1aa2-4537-2c93433f42ef"
74
+ },
75
+ {
76
+ "name": "NVIDIA H100 80GB HBM3",
77
+ "memoryTotal": "85520809984",
78
+ "cudaCores": 16896,
79
+ "architecture": "Hopper",
80
+ "uuid": "GPU-bc6c3e3c-9b90-09ca-c034-774961847c54"
81
+ },
82
+ {
83
+ "name": "NVIDIA H100 80GB HBM3",
84
+ "memoryTotal": "85520809984",
85
+ "cudaCores": 16896,
86
+ "architecture": "Hopper",
87
+ "uuid": "GPU-00a441e1-7c95-e7d6-4c35-43d6b291aea9"
88
+ },
89
+ {
90
+ "name": "NVIDIA H100 80GB HBM3",
91
+ "memoryTotal": "85520809984",
92
+ "cudaCores": 16896,
93
+ "architecture": "Hopper",
94
+ "uuid": "GPU-1c4d29a2-4647-6fce-d8fc-0c5ecfbbd6ea"
95
+ }
96
+ ],
97
+ "cudaVersion": "12.4",
98
+ "writerId": "uv0hmrczrs2tjhgzcbqlzz1jsid4scka"
99
+ }
zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug-core.log ADDED
@@ -0,0 +1,63 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-08-14T19:38:51.636058907Z","level":"INFO","msg":"main: starting server","port-filename":"/tmp/tmp54729boe/port-1375539.txt","pid":1375539,"detached":false,"idle-timeout":600000000000,"log-level":0,"disable-analytics":false,"shutdown-on-parent-exit":false,"enable-dcgm-profiling":false}
2
+ {"time":"2026-08-14T19:38:51.639970993Z","level":"INFO","msg":"server: will exit if parent process dies","ppid":1375539}
3
+ {"time":"2026-08-14T19:38:51.639940209Z","level":"INFO","msg":"server: accepting connections","addr":{"Name":"/tmp/wandb-1375539-170701-251437063/socket","Net":"unix"}}
4
+ {"time":"2026-08-14T19:38:51.812900736Z","level":"INFO","msg":"connection: ManageConnectionData: new connection created","id":"1(@)"}
5
+ {"time":"2026-08-14T19:39:07.276688434Z","level":"INFO","msg":"connection: ManageConnectionData: new connection created","id":"2(@)"}
6
+ {"time":"2026-08-14T19:39:07.370077387Z","level":"INFO","msg":"handleInformInit: received","streamId":"kk1xbqht","id":"2(@)"}
7
+ {"time":"2026-08-14T19:39:07.640206016Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"kk1xbqht","id":"2(@)"}
8
+ {"time":"2026-08-14T19:39:13.074249733Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"zj3lg1k64oen"}
9
+ {"time":"2026-08-14T19:51:49.732364673Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"zj3lg1k64oen"}
10
+ {"time":"2026-08-14T19:51:50.223490459Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"zj3lg1k64oen"}
11
+ {"time":"2026-08-14T19:51:50.225275352Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"kk1xbqht","id":"2(@)"}
12
+ {"time":"2026-08-14T19:51:50.225791347Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"kk1xbqht","id":"2(@)"}
13
+ {"time":"2026-08-14T19:51:51.140595835Z","level":"INFO","msg":"handleInformInit: received","streamId":"ix6wcbwv","id":"2(@)"}
14
+ {"time":"2026-08-14T19:51:51.407779103Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"ix6wcbwv","id":"2(@)"}
15
+ {"time":"2026-08-14T19:51:56.793135206Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"m2u1nqrk4r4j"}
16
+ {"time":"2026-08-14T20:05:01.389026301Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"m2u1nqrk4r4j"}
17
+ {"time":"2026-08-14T20:05:01.891785946Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"m2u1nqrk4r4j"}
18
+ {"time":"2026-08-14T20:05:01.893356932Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"ix6wcbwv","id":"2(@)"}
19
+ {"time":"2026-08-14T20:05:01.894067235Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"ix6wcbwv","id":"2(@)"}
20
+ {"time":"2026-08-14T20:05:03.038763184Z","level":"INFO","msg":"handleInformInit: received","streamId":"bdhnr27j","id":"2(@)"}
21
+ {"time":"2026-08-14T20:05:03.299131712Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"bdhnr27j","id":"2(@)"}
22
+ {"time":"2026-08-14T20:05:08.644597551Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"u5vxhmn1tauv"}
23
+ {"time":"2026-08-14T20:21:26.598738734Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"u5vxhmn1tauv"}
24
+ {"time":"2026-08-14T20:21:27.243676424Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"u5vxhmn1tauv"}
25
+ {"time":"2026-08-14T20:21:27.245262581Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"bdhnr27j","id":"2(@)"}
26
+ {"time":"2026-08-14T20:21:27.245859065Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"bdhnr27j","id":"2(@)"}
27
+ {"time":"2026-08-14T20:21:28.155191217Z","level":"INFO","msg":"handleInformInit: received","streamId":"twgo1e89","id":"2(@)"}
28
+ {"time":"2026-08-14T20:21:28.414618766Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"twgo1e89","id":"2(@)"}
29
+ {"time":"2026-08-14T20:21:33.76572887Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"smlkpmpk76rp"}
30
+ {"time":"2026-08-14T20:38:01.401128169Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"smlkpmpk76rp"}
31
+ {"time":"2026-08-14T20:38:02.166866415Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"smlkpmpk76rp"}
32
+ {"time":"2026-08-14T20:38:02.168373578Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"twgo1e89","id":"2(@)"}
33
+ {"time":"2026-08-14T20:38:02.169204491Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"twgo1e89","id":"2(@)"}
34
+ {"time":"2026-08-14T20:38:03.474631884Z","level":"INFO","msg":"handleInformInit: received","streamId":"7p5140bq","id":"2(@)"}
35
+ {"time":"2026-08-14T20:38:03.739404113Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"7p5140bq","id":"2(@)"}
36
+ {"time":"2026-08-14T20:38:09.1668666Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"9gr96sam7ydd"}
37
+ {"time":"2026-08-14T20:54:40.077063626Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"9gr96sam7ydd"}
38
+ {"time":"2026-08-14T20:54:40.77979146Z","level":"INFO","msg":"connection: cancelling request","id":"2(@)","requestId":"9gr96sam7ydd"}
39
+ {"time":"2026-08-14T20:54:40.781496498Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"7p5140bq","id":"2(@)"}
40
+ {"time":"2026-08-14T20:54:40.782279361Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"7p5140bq","id":"2(@)"}
41
+ {"time":"2026-08-14T20:54:42.400855251Z","level":"INFO","msg":"connection: closing","id":"2(@)"}
42
+ {"time":"2026-08-14T20:54:42.40094641Z","level":"INFO","msg":"connection: closed successfully","id":"2(@)"}
43
+ {"time":"2026-08-14T20:54:42.400864953Z","level":"INFO","msg":"processOutgoingData: finished","id":"2(@)"}
44
+ {"time":"2026-08-14T20:54:42.400960827Z","level":"INFO","msg":"connection: ManageConnectionData: connection closed","id":"2(@)"}
45
+ {"time":"2026-08-14T21:01:09.497626422Z","level":"INFO","msg":"connection: ManageConnectionData: new connection created","id":"3(@)"}
46
+ {"time":"2026-08-14T21:01:09.714752804Z","level":"INFO","msg":"handleInformInit: received","streamId":"qauftiuh","id":"3(@)"}
47
+ {"time":"2026-08-14T21:01:09.994191533Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"qauftiuh","id":"3(@)"}
48
+ {"time":"2026-08-14T21:01:15.507216386Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"wd49dhcig506"}
49
+ {"time":"2026-08-14T21:07:53.011770412Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"wd49dhcig506"}
50
+ {"time":"2026-08-14T21:07:54.661515353Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"wd49dhcig506"}
51
+ {"time":"2026-08-14T21:07:54.926288764Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"qauftiuh","id":"3(@)"}
52
+ {"time":"2026-08-14T21:07:54.927423677Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"qauftiuh","id":"3(@)"}
53
+ {"time":"2026-08-14T21:08:09.037499672Z","level":"INFO","msg":"handleInformInit: received","streamId":"a6574zx8","id":"3(@)"}
54
+ {"time":"2026-08-14T21:08:09.296770198Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"a6574zx8","id":"3(@)"}
55
+ {"time":"2026-08-14T21:08:09.806890437Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"bsqpd0c29zk9"}
56
+ {"time":"2026-08-14T21:08:14.888124439Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
57
+ {"time":"2026-08-14T21:14:51.274587185Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
58
+ {"time":"2026-08-14T21:14:52.85240857Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"ilk9hnwtzxxz"}
59
+ {"time":"2026-08-14T21:14:52.873645397Z","level":"INFO","msg":"handleInformFinish: finish message received","streamId":"a6574zx8","id":"3(@)"}
60
+ {"time":"2026-08-14T21:14:52.874311484Z","level":"INFO","msg":"handleInformFinish: stream closed","streamId":"a6574zx8","id":"3(@)"}
61
+ {"time":"2026-08-14T21:15:07.169254211Z","level":"INFO","msg":"handleInformInit: received","streamId":"54wnyexz","id":"3(@)"}
62
+ {"time":"2026-08-14T21:15:07.435699541Z","level":"INFO","msg":"handleInformInit: stream started","streamId":"54wnyexz","id":"3(@)"}
63
+ {"time":"2026-08-14T21:15:12.853675736Z","level":"INFO","msg":"connection: cancelling request","id":"3(@)","requestId":"fzqy9cymfofj"}
zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug-internal.log ADDED
@@ -0,0 +1,65 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"time":"2026-08-14T21:15:07.169424866Z","level":"INFO","msg":"wandb-core"}
2
+ {"time":"2026-08-14T21:15:07.169567468Z","level":"INFO","msg":"stream: starting","core version":"0.28.1"}
3
+ {"time":"2026-08-14T21:15:07.435532929Z","level":"INFO","msg":"stream: created new stream","id":"54wnyexz"}
4
+ {"time":"2026-08-14T21:15:07.435601691Z","level":"INFO","msg":"handler: started"}
5
+ {"time":"2026-08-14T21:15:07.435689178Z","level":"INFO","msg":"stream: started"}
6
+ {"time":"2026-08-14T21:15:07.43571596Z","level":"INFO","msg":"sender: started"}
7
+ {"time":"2026-08-14T21:15:07.435698857Z","level":"INFO","msg":"writer: started","stream_id":"54wnyexz"}
8
+ {"time":"2026-08-14T21:15:07.865306518Z","level":"INFO","msg":"filestream: sending request","total_files":1,"console_offset":0,"console_lines":2}
9
+ {"time":"2026-08-14T21:15:07.979243259Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
10
+ {"time":"2026-08-14T21:15:22.8655656Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":0,"history_lines":1,"events_offset":0,"events_lines":1,"console_offset":1,"console_lines":2,"uploaded_len":2}
11
+ {"time":"2026-08-14T21:15:23.014629997Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
12
+ {"time":"2026-08-14T21:15:23.378577725Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":1538}
13
+ {"time":"2026-08-14T21:15:23.378611071Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":1}
14
+ {"time":"2026-08-14T21:15:23.38845317Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":4102}
15
+ {"time":"2026-08-14T21:15:23.388483609Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":1}
16
+ {"time":"2026-08-14T21:15:23.389724048Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":4603}
17
+ {"time":"2026-08-14T21:15:23.389898245Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":36}
18
+ {"time":"2026-08-14T21:15:23.39094459Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":5037}
19
+ {"time":"2026-08-14T21:15:23.391389079Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":103}
20
+ {"time":"2026-08-14T21:15:23.391844857Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":5345}
21
+ {"time":"2026-08-14T21:15:23.398774475Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":2645}
22
+ {"time":"2026-08-14T21:15:23.399288691Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":8229}
23
+ {"time":"2026-08-14T21:15:23.400206063Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":379}
24
+ {"time":"2026-08-14T21:15:23.400644516Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":8832}
25
+ {"time":"2026-08-14T21:15:23.400737823Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":19}
26
+ {"time":"2026-08-14T21:15:23.400946664Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":8941}
27
+ {"time":"2026-08-14T21:15:23.401087444Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":37}
28
+ {"time":"2026-08-14T21:15:23.405809502Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":10867}
29
+ {"time":"2026-08-14T21:15:23.405942913Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":22}
30
+ {"time":"2026-08-14T21:15:23.407538574Z","level":"INFO","msg":"flowcontrol: backed up, offloading to disk","recordNumber":11526}
31
+ {"time":"2026-08-14T21:15:23.408103184Z","level":"INFO","msg":"flowcontrol: unblocked","totalOffloaded":213}
32
+ {"time":"2026-08-14T21:15:37.883634237Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":1,"history_lines":2,"events_offset":1,"events_lines":2,"console_offset":1,"console_lines":1}
33
+ {"time":"2026-08-14T21:15:38.603529933Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
34
+ {"time":"2026-08-14T21:15:52.884551759Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":3,"history_lines":3,"events_offset":3,"events_lines":2,"console_offset":1,"console_lines":1}
35
+ {"time":"2026-08-14T21:15:53.827374416Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
36
+ {"time":"2026-08-14T21:16:07.891440937Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":6,"history_lines":2,"events_offset":5,"events_lines":2,"console_offset":3,"console_lines":12}
37
+ {"time":"2026-08-14T21:16:08.876461742Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
38
+ {"time":"2026-08-14T21:16:22.890274165Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":8,"history_lines":2,"events_offset":7,"events_lines":2,"console_offset":11,"console_lines":1}
39
+ {"time":"2026-08-14T21:16:23.704159399Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
40
+ {"time":"2026-08-14T21:16:37.88767292Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":10,"history_lines":2,"events_offset":9,"events_lines":2,"console_offset":15,"console_lines":9}
41
+ {"time":"2026-08-14T21:16:38.690316648Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
42
+ {"time":"2026-08-14T21:16:52.886427045Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":12,"history_lines":2,"events_offset":11,"events_lines":2,"console_offset":21,"console_lines":1}
43
+ {"time":"2026-08-14T21:16:54.006407739Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
44
+ {"time":"2026-08-14T21:17:07.874889179Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":14,"history_lines":2,"events_offset":13,"events_lines":2,"console_offset":21,"console_lines":1}
45
+ {"time":"2026-08-14T21:17:08.765471891Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
46
+ {"time":"2026-08-14T21:17:22.884402781Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":16,"history_lines":2,"events_offset":15,"events_lines":2,"console_offset":24,"console_lines":11}
47
+ {"time":"2026-08-14T21:17:23.782618431Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
48
+ {"time":"2026-08-14T21:17:37.894674616Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":18,"history_lines":2,"events_offset":17,"events_lines":2,"console_offset":31,"console_lines":1}
49
+ {"time":"2026-08-14T21:17:38.741283006Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
50
+ {"time":"2026-08-14T21:17:52.887547658Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":20,"history_lines":2,"events_offset":19,"events_lines":2,"console_offset":35,"console_lines":9}
51
+ {"time":"2026-08-14T21:17:53.759903107Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
52
+ {"time":"2026-08-14T21:18:07.894710599Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":22,"history_lines":2,"events_offset":21,"events_lines":2,"console_offset":41,"console_lines":1}
53
+ {"time":"2026-08-14T21:18:08.817504637Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
54
+ {"time":"2026-08-14T21:18:22.875702416Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":24,"history_lines":2,"events_offset":23,"events_lines":2,"console_offset":41,"console_lines":1}
55
+ {"time":"2026-08-14T21:18:23.642998715Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
56
+ {"time":"2026-08-14T21:18:37.887794344Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":26,"history_lines":2,"events_offset":25,"events_lines":2,"console_offset":44,"console_lines":11}
57
+ {"time":"2026-08-14T21:18:38.696615712Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
58
+ {"time":"2026-08-14T21:18:52.883505832Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":28,"history_lines":2,"events_offset":27,"events_lines":2,"console_offset":51,"console_lines":1}
59
+ {"time":"2026-08-14T21:18:53.743917259Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
60
+ {"time":"2026-08-14T21:19:07.888490889Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":30,"history_lines":2,"events_offset":29,"events_lines":2,"console_offset":55,"console_lines":9}
61
+ {"time":"2026-08-14T21:19:08.707657114Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
62
+ {"time":"2026-08-14T21:19:22.884734385Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":32,"history_lines":2,"events_offset":31,"events_lines":2,"console_offset":61,"console_lines":1}
63
+ {"time":"2026-08-14T21:19:23.790343089Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
64
+ {"time":"2026-08-14T21:19:37.875793912Z","level":"INFO","msg":"filestream: sending request","total_files":4,"history_offset":34,"history_lines":2,"events_offset":33,"events_lines":2,"console_offset":61,"console_lines":1}
65
+ {"time":"2026-08-14T21:19:38.585616478Z","level":"INFO","msg":"filestream: request sent","status":"200 OK"}
zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug.log ADDED
@@ -0,0 +1,20 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:setup_run_log_directory():729] Logging user logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug.log
2
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:setup_run_log_directory():730] Logging internal logs to /mnt/data/zainulabideen/zain-exp/notebooks/zain/Activation/wandb/run-20260814_211507-54wnyexz/logs/debug-internal.log
3
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():772] calling init triggers
4
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():777] wandb.init called with sweep_config: {}
5
+ config: {'_wandb': {}}
6
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():820] starting backend
7
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():826] Connected to an existing wandb-core service via WANDB_SERVICE
8
+ 2026-08-14 21:15:07,168 INFO MainThread:936813 [wandb_init.py:init():835] sending inform_init request
9
+ 2026-08-14 21:15:07,436 INFO MainThread:936813 [wandb_init.py:init():840] backend started and connected
10
+ 2026-08-14 21:15:07,437 INFO MainThread:936813 [wandb_init.py:init():910] updated telemetry
11
+ 2026-08-14 21:15:07,444 INFO MainThread:936813 [wandb_init.py:init():933] communicating run to backend with 90.0 second timeout
12
+ 2026-08-14 21:15:07,772 INFO MainThread:936813 [wandb_init.py:init():978] starting run threads in backend
13
+ 2026-08-14 21:15:07,851 INFO MainThread:936813 [wandb_run.py:_console_start():2621] atexit reg
14
+ 2026-08-14 21:15:07,851 INFO MainThread:936813 [wandb_run.py:_redirect():2471] redirect: wrap_raw
15
+ 2026-08-14 21:15:07,851 INFO MainThread:936813 [wandb_run.py:_redirect():2540] Wrapping output streams.
16
+ 2026-08-14 21:15:07,851 INFO MainThread:936813 [wandb_run.py:_redirect():2563] Redirects installed.
17
+ 2026-08-14 21:15:07,852 INFO MainThread:936813 [wandb_init.py:init():1016] run started, returning control to user process
18
+ 2026-08-14 21:15:07,853 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb None None {'transformers_version': '5.16.0.dev0', 'architectures': None, 'output_hidden_states': False, 'return_dict': True, 'dtype': None, 'chunk_size_feed_forward': 0, 'is_encoder_decoder': False, 'id2label': {0: 'LABEL_0', 1: 'LABEL_1'}, 'label2id': {'LABEL_0': 0, 'LABEL_1': 1}, 'problem_type': None, 'vocab_size': 4096, 'hidden_size': 128, 'intermediate_size': 256, 'num_hidden_layers': 100, 'num_attention_heads': 4, 'num_key_value_heads': 4, 'hidden_act': 'silu', 'max_position_embeddings': 512, 'initializer_range': 0.02, 'rms_norm_eps': 1e-06, 'use_cache': False, 'pad_token_id': 0, 'bos_token_id': 1, 'eos_token_id': 2, 'pretraining_tp': 1, 'tie_word_embeddings': True, 'rope_parameters': {'rope_theta': 10000.0, 'rope_type': 'default'}, 'attention_bias': False, 'attention_dropout': 0.0, 'mlp_bias': False, 'head_dim': 32, '_name_or_path': '', 'tokenizer_name': 'w-ahmad/tiny-stories-tokenizer', 'mlp_type': 'glu', 'activation': 'sigmoid', 'waleed_beta': 4, 'model_type': 'tiny_llama', 'output_attentions': False, 'output_dir': 'out/glu-sigmoid-100L_trash_run', 'per_device_train_batch_size': 64, 'num_train_epochs': 1, 'max_steps': 3500, 'learning_rate': 9e-05, 'lr_scheduler_type': 'constant_with_warmup', 'lr_scheduler_kwargs': None, 'warmup_steps': 50, 'optim': 'adamw_torch_fused', 'optim_args': None, 'weight_decay': 0.0, 'adam_beta1': 0.9, 'adam_beta2': 0.999, 'adam_epsilon': 1e-08, 'optim_target_modules': None, 'gradient_accumulation_steps': 1, 'average_tokens_across_devices': True, 'max_grad_norm': 1.0, 'label_smoothing_factor': 0.0, 'bf16': True, 'fp16': False, 'bf16_full_eval': False, 'fp16_full_eval': False, 'tf32': None, 'gradient_checkpointing': False, 'gradient_checkpointing_kwargs': None, 'torch_compile': False, 'torch_compile_backend': None, 'torch_compile_mode': None, 'use_liger_kernel': False, 'liger_kernel_config': None, 'neftune_noise_alpha': None, 'torch_empty_cache_steps': None, 'auto_find_batch_size': False, 'logging_strategy': 'steps', 'logging_steps': 20, 'logging_first_step': False, 'log_on_each_node': True, 'logging_nan_inf_filter': True, 'include_num_input_tokens_seen': 'no', 'log_level': 'passive', 'log_level_replica': 'warning', 'disable_tqdm': False, 'report_to': ['wandb'], 'run_name': 'LM-glu-sigmoid-100L-16.9M-20260814-211506', 'project': 'huggingface', 'trackio_space_id': None, 'trackio_bucket_id': None, 'trackio_static_space_id': None, 'eval_strategy': 'steps', 'eval_steps': 2498, 'eval_delay': 0, 'per_device_eval_batch_size': 1024, 'prediction_loss_only': False, 'eval_on_start': False, 'eval_do_concat_batches': True, 'eval_use_gather_object': False, 'eval_accumulation_steps': None, 'include_for_metrics': [], 'batch_eval_metrics': False, 'save_only_model': False, 'save_strategy': 'steps', 'save_steps': 50, 'save_on_each_node': False, 'save_total_limit': None, 'enable_jit_checkpoint': False, 'push_to_hub': False, 'hub_token': '<HUB_TOKEN>', 'hub_private_repo': None, 'hub_model_id': 'w-ahmad/6L-glu-sigmoid-100L', 'hub_strategy': 'every_save', 'hub_always_push': False, 'hub_revision': None, 'load_best_model_at_end': False, 'metric_for_best_model': None, 'greater_is_better': None, 'ignore_data_skip': False, 'restore_callback_states_from_checkpoint': False, 'full_determinism': False, 'seed': 42, 'data_seed': 42, 'use_cpu': False, 'accelerator_config': {'split_batches': False, 'dispatch_batches': None, 'even_batches': True, 'use_seedable_sampler': True, 'non_blocking': False, 'gradient_accumulation_kwargs': None}, 'parallelism_config': None, 'dataloader_drop_last': False, 'dataloader_num_workers': 0, 'dataloader_pin_memory': True, 'dataloader_persistent_workers': False, 'dataloader_prefetch_factor': None, 'dataloader_multiprocessing_context': None, 'dataloader_in_order': True, 'remove_unused_columns': False, 'label_names': None, 'train_sampling_strategy': 'random', 'length_column_name': 'length', 'ddp_find_unused_parameters': None, 'ddp_bucket_cap_mb': None, 'ddp_broadcast_buffers': None, 'ddp_static_graph': None, 'ddp_backend': None, 'ddp_timeout': 1800, 'fsdp': None, 'fsdp_config': None, 'deepspeed': None, 'debug': [], 'skip_memory_metrics': True, 'do_train': False, 'do_eval': True, 'do_predict': False, 'resume_from_checkpoint': None, 'local_rank': -1}
19
+ 2026-08-14 21:15:07,858 INFO MainThread:936813 [wandb_config.py:__setitem__():155] [no run ID] config set model/num_parameters = 16934016 - <bound method Run._config_callback of <wandb.sdk.wandb_run.Run object at 0x14ee39eebe10>>
20
+ 2026-08-14 21:15:07,858 INFO MainThread:936813 [wandb_run.py:_config_callback():1346] config_cb model/num_parameters 16934016 None
zain/Activation/wandb/run-20260814_211507-54wnyexz/run-54wnyexz.wandb ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:94d0301065b1dbd1d98ffb4d98d6bb8e62964643c148bc6e9e326f26b94cae64
3
+ size 37814272