diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/args.json b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/args.json new file mode 100644 index 0000000000000000000000000000000000000000..2e27b316c5563799a08df5c0fd309bc18fa9eccf --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/args.json @@ -0,0 +1,382 @@ +{ + "output_dir": "/NHNHOME/data/sanghyeok/qwen-cua/runs/wm_abtest_sem/v0-20260623-034830", + "per_device_train_batch_size": 1, + "num_train_epochs": 3.0, + "max_steps": 1000, + "learning_rate": 1e-05, + "lr_scheduler_type": "cosine", + "lr_scheduler_kwargs": null, + "warmup_steps": 50.0, + "optim": "adamw_torch_fused", + "optim_args": null, + "weight_decay": 0.0, + "adam_beta1": 0.9, + "adam_beta2": 0.95, + "adam_epsilon": 1e-08, + "optim_target_modules": null, + "gradient_accumulation_steps": 16, + "average_tokens_across_devices": true, + "max_grad_norm": 1.0, + "label_smoothing_factor": 0.0, + "bf16": true, + "fp16": false, + "bf16_full_eval": false, + "fp16_full_eval": false, + "tf32": true, + "gradient_checkpointing": true, + "gradient_checkpointing_kwargs": null, + "torch_compile": false, + "torch_compile_backend": null, + "torch_compile_mode": null, + "use_liger_kernel": false, + "liger_kernel_config": null, + "use_cache": false, + "neftune_noise_alpha": null, + "torch_empty_cache_steps": null, + "auto_find_batch_size": false, + "logging_strategy": "steps", + "logging_steps": 1, + "logging_first_step": true, + "log_on_each_node": true, + "logging_nan_inf_filter": true, + "include_num_input_tokens_seen": false, + "log_level": "passive", + "log_level_replica": "warning", + "disable_tqdm": null, + "report_to": [ + "wandb" + ], + "run_name": "wm_abtest_sem", + "project": "huggingface", + "trackio_space_id": null, + "trackio_bucket_id": null, + "trackio_static_space_id": null, + "eval_strategy": "steps", + "eval_steps": 500.0, + "eval_delay": 0, + "per_device_eval_batch_size": 1, + "prediction_loss_only": false, + "eval_on_start": false, + "eval_do_concat_batches": true, + "eval_use_gather_object": false, + "eval_accumulation_steps": null, + "include_for_metrics": [], + "batch_eval_metrics": false, + "save_only_model": false, + "save_strategy": "steps", + "save_steps": 500.0, + "save_on_each_node": false, + "save_total_limit": 4, + "enable_jit_checkpoint": false, + "push_to_hub": false, + "hub_token": null, + "hub_private_repo": null, + "hub_model_id": null, + "hub_strategy": "every_save", + "hub_always_push": false, + "hub_revision": null, + "load_best_model_at_end": false, + "metric_for_best_model": "loss", + "greater_is_better": false, + "ignore_data_skip": false, + "restore_callback_states_from_checkpoint": false, + "full_determinism": false, + "seed": 42, + "data_seed": 42, + "use_cpu": false, + "accelerator_config": { + "dispatch_batches": false + }, + "parallelism_config": null, + "dataloader_drop_last": false, + "dataloader_num_workers": 8, + "dataloader_pin_memory": true, + "dataloader_persistent_workers": true, + "dataloader_prefetch_factor": 4, + "remove_unused_columns": true, + "label_names": null, + "train_sampling_strategy": "random", + "length_column_name": "length", + "ddp_find_unused_parameters": null, + "ddp_bucket_cap_mb": null, + "ddp_broadcast_buffers": null, + "ddp_static_graph": null, + "ddp_backend": null, + "ddp_timeout": 18000000, + "fsdp": [], + "fsdp_config": null, + "deepspeed": { + "bf16": { + "enabled": true + }, + "fp16": { + "enabled": false + }, + "zero_optimization": { + "stage": 2, + "overlap_comm": true, + "contiguous_gradients": true, + "reduce_bucket_size": 500000000.0, + "allgather_bucket_size": 500000000.0, + "reduce_scatter": true, + "round_robin_gradients": true + }, + "gradient_clipping": "auto", + "gradient_accumulation_steps": "auto", + "train_batch_size": "auto", + "train_micro_batch_size_per_gpu": "auto", + "steps_per_print": 100, + "wall_clock_breakdown": false, + "_comment_bf16_safety": "DeepSpeed 0.19 BF16_Optimizer keeps fp32 master grad partitions (fp32_groups_flat_partition + accumulate_hp_grads_and_remove_lp hook), so gradient accumulation across many micro-batches is done in fp32. bf16 is only used for the param master copy and forward/backward activations. This is safe at grad_accum=16+; no need to force fp32 collectives." + }, + "debug": null, + "skip_memory_metrics": true, + "do_train": false, + "do_eval": false, + "do_predict": false, + "resume_from_checkpoint": null, + "warmup_ratio": null, + "logging_dir": "/NHNHOME/data/sanghyeok/qwen-cua/runs/wm_abtest_sem/v0-20260623-034830/runs", + "local_rank": 0, + "sortish_sampler": false, + "predict_with_generate": false, + "generation_max_length": null, + "generation_num_beams": null, + "generation_config": null, + "tuner_backend": "peft", + "vit_gradient_checkpointing": false, + "router_aux_loss_coef": 0.0, + "enable_dft_loss": false, + "enable_channel_loss": false, + "safe_serialization": true, + "max_shard_size": "5GB", + "check_model": true, + "acc_strategy": "token", + "train_dataloader_shuffle": true, + "group_by_length": false, + "max_epochs": null, + "aligner_lr": null, + "vit_lr": null, + "use_logits_to_keep": null, + "ds3_gather_for_generation": true, + "resume_only_model": false, + "optimizer": null, + "loss_type": null, + "eval_metric": null, + "callbacks": [], + "early_stop_interval": null, + "eval_use_evalscope": false, + "eval_dataset": [], + "eval_dataset_args": null, + "eval_limit": null, + "eval_generation_config": null, + "extra_eval_args": null, + "tuner_type": "full", + "use_galore": false, + "galore_target_modules": null, + "galore_rank": 128, + "galore_update_proj_gap": 50, + "galore_scale": 1.0, + "galore_proj_type": "std", + "galore_optim_per_parameter": false, + "galore_with_embedding": false, + "galore_quantization": false, + "galore_proj_quant": false, + "galore_proj_bits": 4, + "galore_proj_group_size": 256, + "galore_cos_threshold": 0.4, + "galore_gamma_proj": 2, + "galore_queue_size": 5, + "lisa_activated_layers": 0, + "lisa_step_interval": 20, + "use_flash_ckpt": false, + "use_ray": false, + "ray_exp_name": null, + "device_groups": null, + "model": "/NHNHOME/data/sanghyeok/qwen-cua/hf_cache/hub/models--Qwen--Qwen3.5-4B/snapshots/851bf6e806efd8d0a36b00ddf55e13ccb7b8cd0a", + "model_type": "qwen3_5", + "model_revision": null, + "task_type": "causal_lm", + "torch_dtype": "bfloat16", + "attn_impl": "flash_attention_2", + "experts_impl": null, + "new_special_tokens": [], + "num_labels": null, + "problem_type": null, + "rope_scaling": null, + "device_map": null, + "max_memory": {}, + "max_model_len": null, + "local_repo_path": null, + "init_strategy": null, + "template": "qwen3_5", + "system": null, + "max_length": 12288, + "truncation_strategy": "delete", + "max_pixels": 16777216, + "agent_template": null, + "norm_bbox": null, + "use_chat_template": true, + "padding_side": "right", + "padding_free": false, + "loss_scale": "default", + "sequence_parallel_size": 1, + "template_backend": "swift", + "response_prefix": null, + "enable_thinking": null, + "add_non_thinking_prefix": true, + "dataset": [ + "/NHNHOME/data/sanghyeok/qwen-cua/data/AgentNet/l1/ubuntu/train_wm.jsonl#35000", + "/NHNHOME/data/sanghyeok/qwen-cua/data/AgentNet/l2/ubuntu/train_wm.jsonl#35000", + "/NHNHOME/data/sanghyeok/qwen-cua/data/AgentNet/l3/ubuntu/train_wm.jsonl#35000", + "/NHNHOME/data/sanghyeok/qwen-cua/data/AgentNet/l1/win_mac/train_wm.jsonl#100000", + "/NHNHOME/data/sanghyeok/qwen-cua/data/AgentNet/l2/win_mac/train_wm.jsonl#100000", + "/NHNHOME/data/sanghyeok/qwen-cua/data/AgentNet/l3/win_mac/train_wm.jsonl#100000", + "/NHNHOME/data/sanghyeok/qwen-cua/data/GUI-360/l1/train_wm.jsonl#50000", + "/NHNHOME/data/sanghyeok/qwen-cua/data/GUI-360/l2/train_wm.jsonl#50000", + "/NHNHOME/data/sanghyeok/qwen-cua/data/GUI-360/l3/train_wm.jsonl#50000" + ], + "val_dataset": [ + "/NHNHOME/data/sanghyeok/qwen-cua/data/AgentNet/l2/ubuntu/val_wm.jsonl" + ], + "cached_dataset": [], + "cached_val_dataset": [], + "split_dataset_ratio": 0.0, + "dataset_num_proc": 4, + "load_from_cache_file": false, + "dataset_shuffle": true, + "val_dataset_shuffle": false, + "streaming": false, + "interleave_prob": null, + "stopping_strategy": "first_exhausted", + "shuffle_buffer_size": 1000, + "download_mode": "reuse_dataset_if_exists", + "columns": {}, + "strict": false, + "disable_auto_column_mapping": false, + "model_name": null, + "model_author": null, + "custom_dataset_info": [], + "quant_method": null, + "quant_bits": null, + "hqq_axis": null, + "bnb_4bit_compute_dtype": "bfloat16", + "bnb_4bit_quant_type": "nf4", + "bnb_4bit_use_double_quant": true, + "bnb_4bit_quant_storage": null, + "max_new_tokens": 64, + "temperature": 0.0, + "top_k": null, + "top_p": null, + "repetition_penalty": null, + "num_beams": 1, + "stream": false, + "stop_words": [], + "logprobs": false, + "top_logprobs": null, + "structured_outputs_regex": null, + "adapters": [], + "external_plugins": [], + "custom_register_path": [], + "model_kwargs": {}, + "enable_npu_model_patch": true, + "load_args": false, + "load_data_args": false, + "packing": false, + "packing_length": null, + "packing_num_proc": 1, + "lazy_tokenize": true, + "use_hf": false, + "ignore_args_error": false, + "use_swift_lora": false, + "freeze_parameters": [ + "model.visual", + "model.visual.merger" + ], + "freeze_parameters_regex": null, + "freeze_parameters_ratio": 0.0, + "trainable_parameters": [], + "trainable_parameters_regex": null, + "freeze_llm": false, + "freeze_vit": true, + "freeze_aligner": true, + "target_modules": [ + "all-linear" + ], + "target_regex": null, + "target_parameters": null, + "modules_to_save": [], + "lora_rank": 8, + "lora_alpha": 32, + "lora_dropout": 0.05, + "lora_bias": "none", + "lora_dtype": null, + "lorap_lr_ratio": null, + "use_rslora": false, + "use_dora": false, + "lora_ga_batch_size": 2, + "lora_ga_iters": 2, + "lora_ga_max_length": 1024, + "lora_ga_direction": "ArB2r", + "lora_ga_scale": "stable", + "lora_ga_stable_gamma": 16, + "init_weights": true, + "fourier_n_frequency": 2000, + "fourier_scaling": 300.0, + "boft_block_size": 4, + "boft_block_num": 0, + "boft_n_butterfly_factor": 1, + "boft_dropout": 0.0, + "vera_rank": 256, + "vera_projection_prng_key": 0, + "vera_dropout": 0.0, + "vera_d_initial": 0.1, + "adapter_act": "gelu", + "adapter_length": 128, + "adalora_target_r": 8, + "adalora_init_r": 12, + "adalora_tinit": 0, + "adalora_tfinal": 0, + "adalora_deltaT": 1, + "adalora_beta1": 0.85, + "adalora_beta2": 0.85, + "adalora_orth_reg_weight": 0.5, + "llamapro_num_new_blocks": 4, + "llamapro_num_groups": null, + "reft_layer_key": null, + "reft_layers": null, + "reft_rank": 4, + "reft_intervention_type": "LoreftIntervention", + "reft_args": null, + "swanlab_token": null, + "swanlab_project": "ms-swift", + "swanlab_workspace": null, + "swanlab_exp_name": null, + "swanlab_notification_method": null, + "swanlab_webhook_url": null, + "swanlab_secret": null, + "swanlab_sender_email": null, + "swanlab_receiver_email": null, + "swanlab_smtp_server": null, + "swanlab_smtp_port": null, + "swanlab_email_language": "zh", + "swanlab_mode": "cloud", + "add_version": true, + "create_checkpoint_symlink": false, + "zero_hpz_partition_size": null, + "deepspeed_autotp_size": null, + "swift_version": "4.2.1", + "ckpt_dir": null, + "rank": 0, + "global_world_size": 4, + "local_world_size": 4, + "model_suffix": "Qwen3.5-4B", + "model_info": "ModelInfo(model_type='qwen3_5', model_dir='/NHNHOME/data/sanghyeok/qwen-cua/hf_cache/hub/models--Qwen--Qwen3.5-4B/snapshots/851bf6e806efd8d0a36b00ddf55e13ccb7b8cd0a', torch_dtype=torch.bfloat16, max_model_len=262144, quant_method=None, quant_bits=None, rope_scaling=None, is_moe_model=False, is_multimodal=True, config=None, task_type='causal_lm', num_labels=None)", + "model_meta": "ModelMeta(model_type='qwen3_5', model_groups=[ModelGroup(models=[Model(ms_model_id='Qwen/Qwen3.5-0.8B', hf_model_id='Qwen/Qwen3.5-0.8B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.5-2B', hf_model_id='Qwen/Qwen3.5-2B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.5-4B', hf_model_id='Qwen/Qwen3.5-4B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.5-9B', hf_model_id='Qwen/Qwen3.5-9B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.5-27B', hf_model_id='Qwen/Qwen3.5-27B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.5-27B-FP8', hf_model_id='Qwen/Qwen3.5-27B-FP8', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.5-0.8B-Base', hf_model_id='Qwen/Qwen3.5-0.8B-Base', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.5-2B-Base', hf_model_id='Qwen/Qwen3.5-2B-Base', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.5-4B-Base', hf_model_id='Qwen/Qwen3.5-4B-Base', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.5-9B-Base', hf_model_id='Qwen/Qwen3.5-9B-Base', model_path=None, ms_revision=None, hf_revision=None)], template='qwen3_5', ignore_patterns=None, requires=None, tags=[]), ModelGroup(models=[Model(ms_model_id='Qwen/Qwen3.6-27B', hf_model_id='Qwen/Qwen3.6-27B', model_path=None, ms_revision=None, hf_revision=None), Model(ms_model_id='Qwen/Qwen3.6-27B-FP8', hf_model_id='Qwen/Qwen3.6-27B-FP8', model_path=None, ms_revision=None, hf_revision=None)], template='qwen3_5', ignore_patterns=None, requires=None, tags=[])], loader=, template='qwen3_5', model_arch=MultiModelKeys(arch_name='qwen2_vl', embedding=None, module_list=None, lm_head=None, q_proj=None, k_proj=None, v_proj=None, o_proj=None, attention=None, mlp=None, down_proj=None, qkv_proj=None, qk_proj=None, qa_proj=None, qb_proj=None, kv_proj=None, kva_proj=None, kvb_proj=None, language_model=['model.language_model', 'lm_head'], aligner=['model.visual.merger'], vision_tower=['model.visual'], generator=[]), mcore_model_type=None, architectures=['Qwen3_5ForConditionalGeneration'], additional_saved_files=[], torch_dtype=None, is_multimodal=True, is_reward=False, task_type=None, ignore_patterns=None, requires=['transformers>=5.0.0.dev', 'qwen_vl_utils>=0.0.14', 'decord'], tags=[])", + "model_dir": "/NHNHOME/data/sanghyeok/qwen-cua/hf_cache/hub/models--Qwen--Qwen3.5-4B/snapshots/851bf6e806efd8d0a36b00ddf55e13ccb7b8cd0a", + "template_meta": "QwenTemplateMeta(template_type='qwen3_5', prefix=[], prompt=['<|im_start|>user\\n{{QUERY}}<|im_end|>\\n<|im_start|>assistant\\n'], chat_sep=['<|im_end|>\\n'], suffix=['<|im_end|>\\n'], template_cls=, system_prefix=['<|im_start|>system\\n{{SYSTEM}}<|im_end|>\\n'], default_system=None, auto_add_bos=False, stop_words=['<|endoftext|>'], agent_template='qwen3_5', is_thinking=True, thinking_prefix='\\n', non_thinking_prefix='\\n\\n\\n\\n', history_thinking_prefix='')", + "_val_dataset_exists": true, + "hub": "", + "evaluation_strategy": "steps", + "training_args": "Seq2SeqTrainingArguments(output_dir='/NHNHOME/data/sanghyeok/qwen-cua/runs/wm_abtest_sem/v0-20260623-034830', per_device_train_batch_size=1, num_train_epochs=3.0, max_steps=1000, learning_rate=1e-05, lr_scheduler_type=, lr_scheduler_kwargs=None, warmup_steps=50.0, optim=, optim_args=None, weight_decay=0.0, adam_beta1=0.9, adam_beta2=0.95, adam_epsilon=1e-08, optim_target_modules=None, gradient_accumulation_steps=16, average_tokens_across_devices=None, max_grad_norm=1.0, label_smoothing_factor=0.0, bf16=True, fp16=False, bf16_full_eval=False, fp16_full_eval=False, tf32=True, gradient_checkpointing=True, gradient_checkpointing_kwargs=None, torch_compile=False, torch_compile_backend=None, torch_compile_mode=None, use_liger_kernel=False, liger_kernel_config=None, use_cache=False, neftune_noise_alpha=None, torch_empty_cache_steps=None, auto_find_batch_size=False, logging_strategy=, logging_steps=1, logging_first_step=True, log_on_each_node=True, logging_nan_inf_filter=True, include_num_input_tokens_seen=None, log_level='passive', log_level_replica='warning', disable_tqdm=False, report_to=['wandb'], run_name='wm_abtest_sem', project='huggingface', trackio_space_id=None, trackio_bucket_id=None, trackio_static_space_id=None, eval_strategy=, eval_steps=500, eval_delay=0, per_device_eval_batch_size=1, prediction_loss_only=False, eval_on_start=False, eval_do_concat_batches=True, eval_use_gather_object=False, eval_accumulation_steps=None, include_for_metrics=[], batch_eval_metrics=False, save_only_model=False, save_strategy=, save_steps=500, save_on_each_node=False, save_total_limit=4, enable_jit_checkpoint=False, push_to_hub=False, hub_token=None, hub_private_repo=None, hub_model_id=None, hub_strategy=, hub_always_push=False, hub_revision=None, load_best_model_at_end=False, metric_for_best_model='loss', greater_is_better=False, ignore_data_skip=False, restore_callback_states_from_checkpoint=False, full_determinism=False, seed=42, data_seed=42, use_cpu=False, accelerator_config=AcceleratorConfig(split_batches=False, dispatch_batches=False, even_batches=True, use_seedable_sampler=True, non_blocking=False, gradient_accumulation_kwargs=None, use_configured_state=False), parallelism_config=None, dataloader_drop_last=False, dataloader_num_workers=8, dataloader_pin_memory=True, dataloader_persistent_workers=True, dataloader_prefetch_factor=4, remove_unused_columns=False, label_names=None, train_sampling_strategy='random', length_column_name='length', ddp_find_unused_parameters=None, ddp_bucket_cap_mb=None, ddp_broadcast_buffers=None, ddp_static_graph=None, ddp_backend=None, ddp_timeout=18000000, fsdp=[], fsdp_config={'min_num_params': 0, 'xla': False, 'xla_fsdp_v2': False, 'xla_fsdp_grad_ckpt': False}, deepspeed={'bf16': {'enabled': True}, 'fp16': {'enabled': False}, 'zero_optimization': {'stage': 2, 'overlap_comm': True, 'contiguous_gradients': True, 'reduce_bucket_size': 500000000.0, 'allgather_bucket_size': 500000000.0, 'reduce_scatter': True, 'round_robin_gradients': True}, 'gradient_clipping': 'auto', 'gradient_accumulation_steps': 'auto', 'train_batch_size': 'auto', 'train_micro_batch_size_per_gpu': 'auto', 'steps_per_print': 100, 'wall_clock_breakdown': False, '_comment_bf16_safety': 'DeepSpeed 0.19 BF16_Optimizer keeps fp32 master grad partitions (fp32_groups_flat_partition + accumulate_hp_grads_and_remove_lp hook), so gradient accumulation across many micro-batches is done in fp32. bf16 is only used for the param master copy and forward/backward activations. This is safe at grad_accum=16+; no need to force fp32 collectives.'}, debug=[], skip_memory_metrics=True, do_train=False, do_eval=True, do_predict=False, resume_from_checkpoint=None, warmup_ratio=None, logging_dir='/NHNHOME/data/sanghyeok/qwen-cua/runs/wm_abtest_sem/v0-20260623-034830/runs', local_rank=0, sortish_sampler=False, predict_with_generate=False, generation_max_length=None, generation_num_beams=None, generation_config=None, tuner_backend='peft', vit_gradient_checkpointing=False, router_aux_loss_coef=0.0, enable_dft_loss=False, enable_channel_loss=False, safe_serialization=True, max_shard_size='5GB', check_model=True, acc_strategy='token', train_dataloader_shuffle=True, group_by_length=False, max_epochs=None, aligner_lr=None, vit_lr=None, use_logits_to_keep=None, ds3_gather_for_generation=True, resume_only_model=False, optimizer=None, loss_type=None, eval_metric=None, callbacks=[], early_stop_interval=None, eval_use_evalscope=False, eval_dataset=[], eval_dataset_args=None, eval_limit=None, eval_generation_config=None, extra_eval_args=None, tuner_type='full', use_galore=False, galore_target_modules=None, galore_rank=128, galore_update_proj_gap=50, galore_scale=1.0, galore_proj_type='std', galore_optim_per_parameter=False, galore_with_embedding=False, galore_quantization=False, galore_proj_quant=False, galore_proj_bits=4, galore_proj_group_size=256, galore_cos_threshold=0.4, galore_gamma_proj=2, galore_queue_size=5, lisa_activated_layers=0, lisa_step_interval=20, use_flash_ckpt=False)" +} \ No newline at end of file diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/chat_template.jinja b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/chat_template.jinja new file mode 100644 index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/config.json b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/config.json new file mode 100644 index 0000000000000000000000000000000000000000..78b0a7f7fc180d6e053fad8c9398d6ab59b34e28 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/config.json @@ -0,0 +1,122 @@ +{ + "architectures": [ + "Qwen35VLLatentForConditionalGeneration" + ], + "dtype": "bfloat16", + "eos_token_id": 248046, + "hidden_size": 2560, + "image_token_id": 248056, + "latent_end_id": 248078, + "latent_pad_id": 248079, + "latent_sep_token_ids": [ + 198 + ], + "latent_start_id": 248077, + "model_type": "qwen3_5", + "pad_token_id": 248044, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attn_output_gate": true, + "bos_token_id": null, + "dtype": "bfloat16", + "eos_token_id": 248044, + "full_attention_interval": 4, + "head_dim": 256, + "hidden_act": "silu", + "hidden_size": 2560, + "initializer_range": 0.02, + "intermediate_size": 9216, + "latent_end_id": 248078, + "latent_pad_id": 248079, + "latent_start_id": 248077, + "layer_types": [ + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention" + ], + "linear_conv_kernel_dim": 4, + "linear_key_head_dim": 128, + "linear_num_key_heads": 16, + "linear_num_value_heads": 32, + "linear_value_head_dim": 128, + "mamba_ssm_dtype": "float32", + "max_position_embeddings": 262144, + "mlp_only_layers": [], + "model_type": "qwen3_5_text", + "mtp_num_hidden_layers": 1, + "mtp_use_dedicated_embeddings": false, + "num_attention_heads": 16, + "num_hidden_layers": 32, + "num_key_value_heads": 4, + "pad_token_id": 248044, + "partial_rotary_factor": 0.25, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "partial_rotary_factor": 0.25, + "rope_theta": 10000000, + "rope_type": "default" + }, + "tie_word_embeddings": true, + "use_cache": false, + "vocab_size": 248080 + }, + "tie_word_embeddings": true, + "transformers_version": "5.8.1", + "use_cache": false, + "video_token_id": 248057, + "vision_config": { + "deepstack_visual_indexes": [], + "depth": 24, + "dtype": "bfloat16", + "hidden_act": "gelu_pytorch_tanh", + "hidden_size": 1024, + "in_channels": 3, + "initializer_range": 0.02, + "intermediate_size": 4096, + "model_type": "qwen3_5_vision", + "num_heads": 16, + "num_position_embeddings": 2304, + "out_hidden_size": 2560, + "patch_size": 16, + "spatial_merge_size": 2, + "temporal_patch_size": 2 + }, + "vision_end_token_id": 248054, + "vision_start_token_id": 248053 +} diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/generation_config.json b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/generation_config.json new file mode 100644 index 0000000000000000000000000000000000000000..1f1ab970fed81cb788c2945bed33833d247b9091 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/generation_config.json @@ -0,0 +1,9 @@ +{ + "_from_model_config": true, + "eos_token_id": [ + 248044, + 248046 + ], + "transformers_version": "5.8.1", + "use_cache": true +} diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/latest b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/latest new file mode 100644 index 0000000000000000000000000000000000000000..f0b47ce15fff9a01b2a416a473b2148085048a50 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/latest @@ -0,0 +1 @@ +global_step500 \ No newline at end of file diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model-00001-of-00003.safetensors b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model-00001-of-00003.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..f3ecb89f7fc740f63e76683767fdbd7b017888bb --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model-00001-of-00003.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:70234dedf6b41ab4ebe575961f96f28fd5fb19f3dc62991e79f3df5bb3f5eb5d +size 4986709992 diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model-00002-of-00003.safetensors b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model-00002-of-00003.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..7f45e671a1155e8c41a3af3a7e6eb4cdd5bf35e0 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model-00002-of-00003.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:c3d3dfec275ec0fd39edae627c50f375ab660a60e23d9db8a630bcbcf6d43889 +size 4993498424 diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model-00003-of-00003.safetensors b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model-00003-of-00003.safetensors new file mode 100644 index 0000000000000000000000000000000000000000..4ab8023a740649342f1bc7e224320898de73054c --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model-00003-of-00003.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:9132529e66cac3079a828b70ff720888e735b62dcc8a839f7c42730ef896d42c +size 398327248 diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model.safetensors.index.json b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model.safetensors.index.json new file mode 100644 index 0000000000000000000000000000000000000000..864beaae94dfe223c146afaf9d95797636829506 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/model.safetensors.index.json @@ -0,0 +1,747 @@ +{ + "metadata": { + "total_parameters": 4554137728, + "total_size": 10378445056 + }, + "weight_map": { + "alignment_projector.action_proj.bias": "model-00001-of-00003.safetensors", + "alignment_projector.action_proj.weight": "model-00001-of-00003.safetensors", + "alignment_projector.ln_action.bias": "model-00001-of-00003.safetensors", + "alignment_projector.ln_action.weight": "model-00001-of-00003.safetensors", + "alignment_projector.ln_state.bias": "model-00001-of-00003.safetensors", + "alignment_projector.ln_state.weight": "model-00001-of-00003.safetensors", + "alignment_projector.mlp.1.bias": "model-00001-of-00003.safetensors", + "alignment_projector.mlp.1.weight": "model-00001-of-00003.safetensors", + "alignment_projector.mlp.3.bias": "model-00001-of-00003.safetensors", + "alignment_projector.mlp.3.weight": "model-00001-of-00003.safetensors", + "alignment_projector.norm.bias": "model-00001-of-00003.safetensors", + "alignment_projector.norm.weight": "model-00001-of-00003.safetensors", + "alignment_projector.state_proj.bias": "model-00001-of-00003.safetensors", + "alignment_projector.state_proj.weight": "model-00001-of-00003.safetensors", + "latent_init_embedding": "model-00001-of-00003.safetensors", + "lm_head.weight": "model-00001-of-00003.safetensors", + "model.language_model.embed_tokens.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.linear_attn.A_log": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.linear_attn.dt_bias": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.linear_attn.norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.linear_attn.A_log": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.linear_attn.dt_bias": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.linear_attn.norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.linear_attn.A_log": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.linear_attn.dt_bias": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.linear_attn.norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.10.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.10.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.11.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.linear_attn.A_log": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.linear_attn.dt_bias": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.linear_attn.norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.22.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.23.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.24.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.25.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.26.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.27.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.28.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.29.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.30.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.linear_attn.A_log": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.linear_attn.conv1d.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.linear_attn.dt_bias": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.linear_attn.in_proj_a.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.linear_attn.in_proj_b.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.linear_attn.in_proj_qkv.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.linear_attn.in_proj_z.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.linear_attn.norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.linear_attn.out_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.30.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.input_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.31.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "model.language_model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.linear_attn.A_log": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.linear_attn.dt_bias": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.linear_attn.norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.linear_attn.A_log": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.linear_attn.dt_bias": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.linear_attn.norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.linear_attn.A_log": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.linear_attn.dt_bias": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.linear_attn.norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.linear_attn.A_log": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.linear_attn.dt_bias": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.linear_attn.norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.8.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.input_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.linear_attn.A_log": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.linear_attn.conv1d.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.linear_attn.dt_bias": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.linear_attn.in_proj_a.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.linear_attn.in_proj_b.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.linear_attn.in_proj_qkv.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.linear_attn.in_proj_z.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.linear_attn.norm.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.linear_attn.out_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "model.language_model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "model.language_model.norm.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.0.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.1.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.10.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.10.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.10.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.10.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.10.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.10.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.10.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.10.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.10.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.10.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.10.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.10.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.11.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.12.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.13.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.14.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.15.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.16.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.17.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.18.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.19.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.2.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.2.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.20.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.20.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.21.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.22.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.attn.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.attn.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.attn.qkv.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.attn.qkv.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.mlp.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.mlp.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.mlp.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.mlp.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.norm1.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.norm1.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.norm2.bias": "model-00003-of-00003.safetensors", + "model.visual.blocks.23.norm2.weight": "model-00003-of-00003.safetensors", + "model.visual.blocks.3.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.3.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.4.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.5.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.6.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.7.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.8.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.attn.proj.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.attn.proj.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.attn.qkv.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.attn.qkv.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.mlp.linear_fc1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.mlp.linear_fc1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.mlp.linear_fc2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.mlp.linear_fc2.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.norm1.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.norm1.weight": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.norm2.bias": "model-00002-of-00003.safetensors", + "model.visual.blocks.9.norm2.weight": "model-00002-of-00003.safetensors", + "model.visual.merger.linear_fc1.bias": "model-00003-of-00003.safetensors", + "model.visual.merger.linear_fc1.weight": "model-00003-of-00003.safetensors", + "model.visual.merger.linear_fc2.bias": "model-00003-of-00003.safetensors", + "model.visual.merger.linear_fc2.weight": "model-00003-of-00003.safetensors", + "model.visual.merger.norm.bias": "model-00003-of-00003.safetensors", + "model.visual.merger.norm.weight": "model-00003-of-00003.safetensors", + "model.visual.patch_embed.proj.bias": "model-00003-of-00003.safetensors", + "model.visual.patch_embed.proj.weight": "model-00003-of-00003.safetensors", + "model.visual.pos_embed.weight": "model-00003-of-00003.safetensors" + } +} diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/preprocessor_config.json b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/preprocessor_config.json new file mode 100644 index 0000000000000000000000000000000000000000..2ea84a437d448ff71b08df68fdd949d5cc4ebb64 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "image_processor_type": "Qwen2VLImageProcessorFast" +} \ No newline at end of file diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/processor_config.json b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/processor_config.json new file mode 100644 index 0000000000000000000000000000000000000000..33818c7f9e991ad735fd240209f4fa73e6c28c50 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/processor_config.json @@ -0,0 +1,60 @@ +{ + "image_processor": { + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_processor_type": "Qwen2VLImageProcessor", + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "merge_size": 2, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "temporal_patch_size": 2 + }, + "processor_class": "Qwen3VLProcessor", + "video_processor": { + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "do_sample_frames": true, + "fps": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "max_frames": 768, + "merge_size": 2, + "min_frames": 4, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "return_metadata": false, + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "temporal_patch_size": 2, + "video_processor_type": "Qwen3VLVideoProcessor" + } +} diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/tokenizer.json b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/tokenizer.json new file mode 100644 index 0000000000000000000000000000000000000000..9e8ac8634b7c90a05a65182d43516ddf7371c521 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:4012eb888c8edaca05866241a3a8319ca02d45c367eef3da25b8ba4ef002f5b3 +size 19989885 diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/tokenizer_config.json b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/tokenizer_config.json new file mode 100644 index 0000000000000000000000000000000000000000..1d134cd298be1e3be25db393d93a1cefe80e3214 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/tokenizer_config.json @@ -0,0 +1,33 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": true, + "local_files_only": false, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "processor_class": "Qwen3VLProcessor", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/trainer_state.json b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/trainer_state.json new file mode 100644 index 0000000000000000000000000000000000000000..740c09c10e90c56e1d3e33f300fd910cf157dbc9 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/trainer_state.json @@ -0,0 +1,7049 @@ +{ + "best_global_step": 500, + "best_metric": 0.65898627, + "best_model_checkpoint": "/NHNHOME/data/sanghyeok/qwen-cua/runs/wm_abtest_sem/v0-20260623-034830/checkpoint-500", + "epoch": 0.05765765765765766, + "eval_steps": 500, + "global_step": 500, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00011531531531531531, + "grad_norm": 407.2061462402344, + "learning_rate": 2.0000000000000002e-07, + "loss": 23.642864227294922, + "loss_alignment": 0.7705078125, + "loss_alignment_w": 0.38525390625, + "loss_sft": 1.0912348926067352, + "loss_total_v6": 1.4776789546012878, + "step": 1 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00023063063063063062, + "grad_norm": 530.0486450195312, + "learning_rate": 4.0000000000000003e-07, + "loss": 25.579524993896484, + "loss_alignment": 0.7734375, + "loss_alignment_w": 0.38671875, + "loss_sft": 1.2124592959880829, + "loss_total_v6": 1.5987202823162079, + "step": 2 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00034594594594594593, + "grad_norm": 481.3425598144531, + "learning_rate": 6.000000000000001e-07, + "loss": 24.88933753967285, + "loss_alignment": 0.80078125, + "loss_alignment_w": 0.400390625, + "loss_sft": 1.1542469263076782, + "loss_total_v6": 1.5555835962295532, + "step": 3 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00046126126126126124, + "grad_norm": 554.7191772460938, + "learning_rate": 8.000000000000001e-07, + "loss": 25.33448600769043, + "loss_alignment": 0.6865234375, + "loss_alignment_w": 0.34326171875, + "loss_sft": 1.240021526813507, + "loss_total_v6": 1.5834053456783295, + "step": 4 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0005765765765765766, + "grad_norm": 558.9281616210938, + "learning_rate": 1.0000000000000002e-06, + "loss": 25.384843826293945, + "loss_alignment": 0.63623046875, + "loss_alignment_w": 0.318115234375, + "loss_sft": 1.2685900628566742, + "loss_total_v6": 1.586552768945694, + "step": 5 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0006918918918918919, + "grad_norm": 350.4936218261719, + "learning_rate": 1.2000000000000002e-06, + "loss": 23.584701538085938, + "loss_alignment": 0.712890625, + "loss_alignment_w": 0.3564453125, + "loss_sft": 1.1171714663505554, + "loss_total_v6": 1.4740438163280487, + "step": 6 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0008072072072072072, + "grad_norm": 316.0477294921875, + "learning_rate": 1.4000000000000001e-06, + "loss": 22.141462326049805, + "loss_alignment": 0.66943359375, + "loss_alignment_w": 0.334716796875, + "loss_sft": 1.0496433079242706, + "loss_total_v6": 1.3838413953781128, + "step": 7 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0009225225225225225, + "grad_norm": 244.99623107910156, + "learning_rate": 1.6000000000000001e-06, + "loss": 20.55976104736328, + "loss_alignment": 0.71875, + "loss_alignment_w": 0.359375, + "loss_sft": 0.9244808554649353, + "loss_total_v6": 1.284984976053238, + "step": 8 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0010378378378378377, + "grad_norm": 200.92636108398438, + "learning_rate": 1.8000000000000001e-06, + "loss": 19.604190826416016, + "loss_alignment": 0.7373046875, + "loss_alignment_w": 0.36865234375, + "loss_sft": 0.8565791100263596, + "loss_total_v6": 1.2252619564533234, + "step": 9 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0011531531531531532, + "grad_norm": 150.11126708984375, + "learning_rate": 2.0000000000000003e-06, + "loss": 19.3916072845459, + "loss_alignment": 0.7080078125, + "loss_alignment_w": 0.35400390625, + "loss_sft": 0.8580936044454575, + "loss_total_v6": 1.2119754552841187, + "step": 10 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0012684684684684685, + "grad_norm": 185.6168670654297, + "learning_rate": 2.2e-06, + "loss": 18.420320510864258, + "loss_alignment": 0.6533203125, + "loss_alignment_w": 0.32666015625, + "loss_sft": 0.8239080309867859, + "loss_total_v6": 1.1512700021266937, + "step": 11 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0013837837837837837, + "grad_norm": 130.25831604003906, + "learning_rate": 2.4000000000000003e-06, + "loss": 17.901620864868164, + "loss_alignment": 0.7431640625, + "loss_alignment_w": 0.37158203125, + "loss_sft": 0.7468724846839905, + "loss_total_v6": 1.1188512444496155, + "step": 12 + }, + { + "action_cond_aligned": 0.609375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0014990990990990992, + "grad_norm": 108.1146011352539, + "learning_rate": 2.6e-06, + "loss": 17.198169708251953, + "loss_alignment": 0.580078125, + "loss_alignment_w": 0.2900390625, + "loss_sft": 0.7844497710466385, + "loss_total_v6": 1.0748855769634247, + "step": 13 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0016144144144144145, + "grad_norm": 94.52630615234375, + "learning_rate": 2.8000000000000003e-06, + "loss": 17.57098388671875, + "loss_alignment": 0.7529296875, + "loss_alignment_w": 0.37646484375, + "loss_sft": 0.7214469760656357, + "loss_total_v6": 1.0981864631175995, + "step": 14 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0017297297297297297, + "grad_norm": 93.49566650390625, + "learning_rate": 3e-06, + "loss": 15.778778076171875, + "loss_alignment": 0.623046875, + "loss_alignment_w": 0.3115234375, + "loss_sft": 0.6744060963392258, + "loss_total_v6": 0.9861736297607422, + "step": 15 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.001845045045045045, + "grad_norm": 94.75877380371094, + "learning_rate": 3.2000000000000003e-06, + "loss": 15.746747970581055, + "loss_alignment": 0.6279296875, + "loss_alignment_w": 0.31396484375, + "loss_sft": 0.6710918545722961, + "loss_total_v6": 0.9841717332601547, + "step": 16 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0019603603603603604, + "grad_norm": 74.50211334228516, + "learning_rate": 3.4000000000000005e-06, + "loss": 15.640385627746582, + "loss_alignment": 0.62060546875, + "loss_alignment_w": 0.310302734375, + "loss_sft": 0.6674655079841614, + "loss_total_v6": 0.9775241017341614, + "step": 17 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0020756756756756755, + "grad_norm": 66.43067932128906, + "learning_rate": 3.6000000000000003e-06, + "loss": 14.936685562133789, + "loss_alignment": 0.67578125, + "loss_alignment_w": 0.337890625, + "loss_sft": 0.595987856388092, + "loss_total_v6": 0.9335428178310394, + "step": 18 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.002190990990990991, + "grad_norm": 65.92147827148438, + "learning_rate": 3.8000000000000005e-06, + "loss": 14.242525100708008, + "loss_alignment": 0.5849609375, + "loss_alignment_w": 0.29248046875, + "loss_sft": 0.5972195267677307, + "loss_total_v6": 0.8901577740907669, + "step": 19 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0023063063063063064, + "grad_norm": 59.70549774169922, + "learning_rate": 4.000000000000001e-06, + "loss": 14.380578994750977, + "loss_alignment": 0.55322265625, + "loss_alignment_w": 0.276611328125, + "loss_sft": 0.6218697726726532, + "loss_total_v6": 0.8987862020730972, + "step": 20 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0024216216216216215, + "grad_norm": 64.31708526611328, + "learning_rate": 4.2000000000000004e-06, + "loss": 13.50525188446045, + "loss_alignment": 0.5341796875, + "loss_alignment_w": 0.26708984375, + "loss_sft": 0.5769578963518143, + "loss_total_v6": 0.8440782725811005, + "step": 21 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.002536936936936937, + "grad_norm": 90.75245666503906, + "learning_rate": 4.4e-06, + "loss": 13.718778610229492, + "loss_alignment": 0.49462890625, + "loss_alignment_w": 0.247314453125, + "loss_sft": 0.6101092398166656, + "loss_total_v6": 0.8574236780405045, + "step": 22 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0026522522522522524, + "grad_norm": 69.71820068359375, + "learning_rate": 4.600000000000001e-06, + "loss": 14.477478981018066, + "loss_alignment": 0.55224609375, + "loss_alignment_w": 0.276123046875, + "loss_sft": 0.6289024502038956, + "loss_total_v6": 0.904842421412468, + "step": 23 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0027675675675675675, + "grad_norm": 64.14742279052734, + "learning_rate": 4.800000000000001e-06, + "loss": 14.256143569946289, + "loss_alignment": 0.53564453125, + "loss_alignment_w": 0.267822265625, + "loss_sft": 0.6222712397575378, + "loss_total_v6": 0.8910090029239655, + "step": 24 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.002882882882882883, + "grad_norm": 61.360599517822266, + "learning_rate": 5e-06, + "loss": 13.767984390258789, + "loss_alignment": 0.54443359375, + "loss_alignment_w": 0.272216796875, + "loss_sft": 0.5888315886259079, + "loss_total_v6": 0.8604990690946579, + "step": 25 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0029981981981981984, + "grad_norm": 61.61384582519531, + "learning_rate": 5.2e-06, + "loss": 13.5242919921875, + "loss_alignment": 0.4912109375, + "loss_alignment_w": 0.24560546875, + "loss_sft": 0.5995101928710938, + "loss_total_v6": 0.8452682495117188, + "step": 26 + }, + { + "action_cond_aligned": 0.609375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0031135135135135134, + "grad_norm": 56.33893966674805, + "learning_rate": 5.400000000000001e-06, + "loss": 12.671478271484375, + "loss_alignment": 0.42236328125, + "loss_alignment_w": 0.211181640625, + "loss_sft": 0.580877348780632, + "loss_total_v6": 0.7919674068689346, + "step": 27 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.003228828828828829, + "grad_norm": 50.50098419189453, + "learning_rate": 5.600000000000001e-06, + "loss": 13.55427074432373, + "loss_alignment": 0.5478515625, + "loss_alignment_w": 0.27392578125, + "loss_sft": 0.5737044215202332, + "loss_total_v6": 0.8471419215202332, + "step": 28 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.003344144144144144, + "grad_norm": 59.107810974121094, + "learning_rate": 5.8e-06, + "loss": 12.681778907775879, + "loss_alignment": 0.4384765625, + "loss_alignment_w": 0.21923828125, + "loss_sft": 0.5730372220277786, + "loss_total_v6": 0.7926111817359924, + "step": 29 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0034594594594594594, + "grad_norm": 52.47283935546875, + "learning_rate": 6e-06, + "loss": 13.172666549682617, + "loss_alignment": 0.4814453125, + "loss_alignment_w": 0.24072265625, + "loss_sft": 0.5821722447872162, + "loss_total_v6": 0.8232916444540024, + "step": 30 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.003574774774774775, + "grad_norm": 53.894813537597656, + "learning_rate": 6.200000000000001e-06, + "loss": 12.669779777526855, + "loss_alignment": 0.498046875, + "loss_alignment_w": 0.2490234375, + "loss_sft": 0.5426851958036423, + "loss_total_v6": 0.7918612360954285, + "step": 31 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00369009009009009, + "grad_norm": 55.39790725708008, + "learning_rate": 6.4000000000000006e-06, + "loss": 11.145750045776367, + "loss_alignment": 0.40869140625, + "loss_alignment_w": 0.204345703125, + "loss_sft": 0.49223314225673676, + "loss_total_v6": 0.6966093480587006, + "step": 32 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0038054054054054054, + "grad_norm": 57.77032470703125, + "learning_rate": 6.600000000000001e-06, + "loss": 13.225976943969727, + "loss_alignment": 0.470703125, + "loss_alignment_w": 0.2353515625, + "loss_sft": 0.5910888910293579, + "loss_total_v6": 0.8266235589981079, + "step": 33 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.003920720720720721, + "grad_norm": 59.41911315917969, + "learning_rate": 6.800000000000001e-06, + "loss": 13.794926643371582, + "loss_alignment": 0.48974609375, + "loss_alignment_w": 0.244873046875, + "loss_sft": 0.6172182410955429, + "loss_total_v6": 0.8621829003095627, + "step": 34 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.004036036036036036, + "grad_norm": 63.91349411010742, + "learning_rate": 7e-06, + "loss": 12.84215259552002, + "loss_alignment": 0.4482421875, + "loss_alignment_w": 0.22412109375, + "loss_sft": 0.57863549888134, + "loss_total_v6": 0.8026345372200012, + "step": 35 + }, + { + "action_cond_aligned": 0.875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.004151351351351351, + "grad_norm": 55.68564987182617, + "learning_rate": 7.2000000000000005e-06, + "loss": 12.653459548950195, + "loss_alignment": 0.5458984375, + "loss_alignment_w": 0.27294921875, + "loss_sft": 0.5180750638246536, + "loss_total_v6": 0.7908411771059036, + "step": 36 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.004266666666666667, + "grad_norm": 63.180728912353516, + "learning_rate": 7.4e-06, + "loss": 12.79519271850586, + "loss_alignment": 0.44775390625, + "loss_alignment_w": 0.223876953125, + "loss_sft": 0.575792133808136, + "loss_total_v6": 0.7996995896100998, + "step": 37 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.004381981981981982, + "grad_norm": 48.08530044555664, + "learning_rate": 7.600000000000001e-06, + "loss": 12.159341812133789, + "loss_alignment": 0.43310546875, + "loss_alignment_w": 0.216552734375, + "loss_sft": 0.5437723398208618, + "loss_total_v6": 0.7599588334560394, + "step": 38 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.004497297297297297, + "grad_norm": 44.77143096923828, + "learning_rate": 7.800000000000002e-06, + "loss": 12.63101863861084, + "loss_alignment": 0.43310546875, + "loss_alignment_w": 0.216552734375, + "loss_sft": 0.5734047293663025, + "loss_total_v6": 0.7894386947154999, + "step": 39 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.004612612612612613, + "grad_norm": 46.80359649658203, + "learning_rate": 8.000000000000001e-06, + "loss": 12.19167423248291, + "loss_alignment": 0.38330078125, + "loss_alignment_w": 0.191650390625, + "loss_sft": 0.5705123543739319, + "loss_total_v6": 0.7619796395301819, + "step": 40 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.004727927927927928, + "grad_norm": 47.3371696472168, + "learning_rate": 8.2e-06, + "loss": 12.526318550109863, + "loss_alignment": 0.4853515625, + "loss_alignment_w": 0.24267578125, + "loss_sft": 0.5399139523506165, + "loss_total_v6": 0.7828948944807053, + "step": 41 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.004843243243243243, + "grad_norm": 69.42951202392578, + "learning_rate": 8.400000000000001e-06, + "loss": 12.888118743896484, + "loss_alignment": 0.44287109375, + "loss_alignment_w": 0.221435546875, + "loss_sft": 0.5841328799724579, + "loss_total_v6": 0.8055074214935303, + "step": 42 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.004958558558558559, + "grad_norm": 50.725101470947266, + "learning_rate": 8.6e-06, + "loss": 12.422379493713379, + "loss_alignment": 0.42236328125, + "loss_alignment_w": 0.211181640625, + "loss_sft": 0.565003514289856, + "loss_total_v6": 0.7763987332582474, + "step": 43 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.005073873873873874, + "grad_norm": 47.51005935668945, + "learning_rate": 8.8e-06, + "loss": 11.832914352416992, + "loss_alignment": 0.44775390625, + "loss_alignment_w": 0.223876953125, + "loss_sft": 0.5153444558382034, + "loss_total_v6": 0.7395571321249008, + "step": 44 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.005189189189189189, + "grad_norm": 53.002967834472656, + "learning_rate": 9e-06, + "loss": 12.828873634338379, + "loss_alignment": 0.466796875, + "loss_alignment_w": 0.2333984375, + "loss_sft": 0.5687418878078461, + "loss_total_v6": 0.8018046021461487, + "step": 45 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.005304504504504505, + "grad_norm": 45.67454147338867, + "learning_rate": 9.200000000000002e-06, + "loss": 12.4541015625, + "loss_alignment": 0.4677734375, + "loss_alignment_w": 0.23388671875, + "loss_sft": 0.5446776896715164, + "loss_total_v6": 0.7783813029527664, + "step": 46 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00541981981981982, + "grad_norm": 55.78976821899414, + "learning_rate": 9.4e-06, + "loss": 12.58407211303711, + "loss_alignment": 0.4287109375, + "loss_alignment_w": 0.21435546875, + "loss_sft": 0.5719048380851746, + "loss_total_v6": 0.7865044623613358, + "step": 47 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.005535135135135135, + "grad_norm": 48.29545593261719, + "learning_rate": 9.600000000000001e-06, + "loss": 11.703300476074219, + "loss_alignment": 0.4462890625, + "loss_alignment_w": 0.22314453125, + "loss_sft": 0.5079759806394577, + "loss_total_v6": 0.7314562350511551, + "step": 48 + }, + { + "action_cond_aligned": 0.609375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.005650450450450451, + "grad_norm": 49.96865463256836, + "learning_rate": 9.800000000000001e-06, + "loss": 11.420673370361328, + "loss_alignment": 0.36474609375, + "loss_alignment_w": 0.182373046875, + "loss_sft": 0.5308391973376274, + "loss_total_v6": 0.7137921005487442, + "step": 49 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.005765765765765766, + "grad_norm": 47.02370071411133, + "learning_rate": 1e-05, + "loss": 12.081998825073242, + "loss_alignment": 0.43408203125, + "loss_alignment_w": 0.217041015625, + "loss_sft": 0.5375956445932388, + "loss_total_v6": 0.7551249265670776, + "step": 50 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.005881081081081081, + "grad_norm": 45.999202728271484, + "learning_rate": 9.999972660400536e-06, + "loss": 11.815361022949219, + "loss_alignment": 0.3759765625, + "loss_alignment_w": 0.18798828125, + "loss_sft": 0.5501360446214676, + "loss_total_v6": 0.7384600937366486, + "step": 51 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.005996396396396397, + "grad_norm": 48.85914611816406, + "learning_rate": 9.999890641901124e-06, + "loss": 11.467751502990723, + "loss_alignment": 0.38232421875, + "loss_alignment_w": 0.191162109375, + "loss_sft": 0.5249314606189728, + "loss_total_v6": 0.7167344689369202, + "step": 52 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.006111711711711712, + "grad_norm": 49.4818115234375, + "learning_rate": 9.999753945398704e-06, + "loss": 11.480488777160645, + "loss_alignment": 0.38330078125, + "loss_alignment_w": 0.191650390625, + "loss_sft": 0.5257580578327179, + "loss_total_v6": 0.7175305187702179, + "step": 53 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.006227027027027027, + "grad_norm": 48.56816482543945, + "learning_rate": 9.99956257238817e-06, + "loss": 11.92318058013916, + "loss_alignment": 0.4287109375, + "loss_alignment_w": 0.21435546875, + "loss_sft": 0.5308433473110199, + "loss_total_v6": 0.7451988160610199, + "step": 54 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.006342342342342342, + "grad_norm": 49.231143951416016, + "learning_rate": 9.999316524962347e-06, + "loss": 11.745312690734863, + "loss_alignment": 0.388671875, + "loss_alignment_w": 0.1943359375, + "loss_sft": 0.5397460907697678, + "loss_total_v6": 0.734082043170929, + "step": 55 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.006457657657657658, + "grad_norm": 46.409881591796875, + "learning_rate": 9.999015805811965e-06, + "loss": 11.37634563446045, + "loss_alignment": 0.40966796875, + "loss_alignment_w": 0.204833984375, + "loss_sft": 0.5057603418827057, + "loss_total_v6": 0.7110215872526169, + "step": 56 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.006572972972972973, + "grad_norm": 45.55757522583008, + "learning_rate": 9.998660418225645e-06, + "loss": 12.861443519592285, + "loss_alignment": 0.43701171875, + "loss_alignment_w": 0.218505859375, + "loss_sft": 0.584785059094429, + "loss_total_v6": 0.8038402199745178, + "step": 57 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.006688288288288288, + "grad_norm": 47.95383071899414, + "learning_rate": 9.998250366089848e-06, + "loss": 11.984904289245605, + "loss_alignment": 0.48486328125, + "loss_alignment_w": 0.242431640625, + "loss_sft": 0.5061061009764671, + "loss_total_v6": 0.7490565478801727, + "step": 58 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.006803603603603604, + "grad_norm": 46.272701263427734, + "learning_rate": 9.997785653888835e-06, + "loss": 11.24374771118164, + "loss_alignment": 0.38427734375, + "loss_alignment_w": 0.192138671875, + "loss_sft": 0.5102903619408607, + "loss_total_v6": 0.7027342468500137, + "step": 59 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.006918918918918919, + "grad_norm": 44.753726959228516, + "learning_rate": 9.99726628670463e-06, + "loss": 12.324908256530762, + "loss_alignment": 0.427734375, + "loss_alignment_w": 0.2138671875, + "loss_sft": 0.5563174933195114, + "loss_total_v6": 0.7703067660331726, + "step": 60 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.007034234234234234, + "grad_norm": 49.85947799682617, + "learning_rate": 9.996692270216946e-06, + "loss": 11.527015686035156, + "loss_alignment": 0.4404296875, + "loss_alignment_w": 0.22021484375, + "loss_sft": 0.5003457590937614, + "loss_total_v6": 0.7204384952783585, + "step": 61 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00714954954954955, + "grad_norm": 50.705909729003906, + "learning_rate": 9.996063610703138e-06, + "loss": 12.090047836303711, + "loss_alignment": 0.42138671875, + "loss_alignment_w": 0.210693359375, + "loss_sft": 0.5458501130342484, + "loss_total_v6": 0.7556279748678207, + "step": 62 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.007264864864864865, + "grad_norm": 50.130245208740234, + "learning_rate": 9.995380315038119e-06, + "loss": 11.85178279876709, + "loss_alignment": 0.43701171875, + "loss_alignment_w": 0.218505859375, + "loss_sft": 0.5214066281914711, + "loss_total_v6": 0.7407364249229431, + "step": 63 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00738018018018018, + "grad_norm": 43.424354553222656, + "learning_rate": 9.994642390694308e-06, + "loss": 12.043560981750488, + "loss_alignment": 0.4150390625, + "loss_alignment_w": 0.20751953125, + "loss_sft": 0.5452945530414581, + "loss_total_v6": 0.7527225464582443, + "step": 64 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.007495495495495496, + "grad_norm": 51.02634048461914, + "learning_rate": 9.993849845741525e-06, + "loss": 11.339422225952148, + "loss_alignment": 0.38671875, + "loss_alignment_w": 0.193359375, + "loss_sft": 0.5148662030696869, + "loss_total_v6": 0.7087138742208481, + "step": 65 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.007610810810810811, + "grad_norm": 43.729942321777344, + "learning_rate": 9.993002688846913e-06, + "loss": 12.128459930419922, + "loss_alignment": 0.46533203125, + "loss_alignment_w": 0.232666015625, + "loss_sft": 0.5250270366668701, + "loss_total_v6": 0.7580287605524063, + "step": 66 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.007726126126126126, + "grad_norm": 50.43552017211914, + "learning_rate": 9.992100929274848e-06, + "loss": 11.223955154418945, + "loss_alignment": 0.37060546875, + "loss_alignment_w": 0.185302734375, + "loss_sft": 0.5163775980472565, + "loss_total_v6": 0.7014971822500229, + "step": 67 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.007841441441441442, + "grad_norm": 43.67860794067383, + "learning_rate": 9.991144576886824e-06, + "loss": 11.510127067565918, + "loss_alignment": 0.41552734375, + "loss_alignment_w": 0.207763671875, + "loss_sft": 0.5114666447043419, + "loss_total_v6": 0.7193829119205475, + "step": 68 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.007956756756756757, + "grad_norm": 45.841224670410156, + "learning_rate": 9.990133642141359e-06, + "loss": 11.512622833251953, + "loss_alignment": 0.39697265625, + "loss_alignment_w": 0.198486328125, + "loss_sft": 0.5208999365568161, + "loss_total_v6": 0.7195389121770859, + "step": 69 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.008072072072072072, + "grad_norm": 47.75693893432617, + "learning_rate": 9.989068136093873e-06, + "loss": 11.230972290039062, + "loss_alignment": 0.41552734375, + "loss_alignment_w": 0.207763671875, + "loss_sft": 0.4942025914788246, + "loss_total_v6": 0.7019357532262802, + "step": 70 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.008187387387387387, + "grad_norm": 48.05889892578125, + "learning_rate": 9.987948070396572e-06, + "loss": 11.236026763916016, + "loss_alignment": 0.37890625, + "loss_alignment_w": 0.189453125, + "loss_sft": 0.5132562592625618, + "loss_total_v6": 0.7022516280412674, + "step": 71 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.008302702702702702, + "grad_norm": 46.03535079956055, + "learning_rate": 9.986773457298311e-06, + "loss": 11.207443237304688, + "loss_alignment": 0.38330078125, + "loss_alignment_w": 0.191650390625, + "loss_sft": 0.508479155600071, + "loss_total_v6": 0.7004652321338654, + "step": 72 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.008418018018018019, + "grad_norm": 44.74018478393555, + "learning_rate": 9.985544309644474e-06, + "loss": 11.610492706298828, + "loss_alignment": 0.36865234375, + "loss_alignment_w": 0.184326171875, + "loss_sft": 0.5405667051672935, + "loss_total_v6": 0.7256557643413544, + "step": 73 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.008533333333333334, + "grad_norm": 46.97052001953125, + "learning_rate": 9.984260640876821e-06, + "loss": 12.05638313293457, + "loss_alignment": 0.466796875, + "loss_alignment_w": 0.2333984375, + "loss_sft": 0.5207358300685883, + "loss_total_v6": 0.7535239011049271, + "step": 74 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.008648648648648649, + "grad_norm": 41.75102996826172, + "learning_rate": 9.98292246503335e-06, + "loss": 11.125972747802734, + "loss_alignment": 0.39111328125, + "loss_alignment_w": 0.195556640625, + "loss_sft": 0.4996030256152153, + "loss_total_v6": 0.6953732669353485, + "step": 75 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.008763963963963964, + "grad_norm": 42.86528015136719, + "learning_rate": 9.981529796748135e-06, + "loss": 12.537795066833496, + "loss_alignment": 0.427734375, + "loss_alignment_w": 0.2138671875, + "loss_sft": 0.5692872256040573, + "loss_total_v6": 0.7836122065782547, + "step": 76 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.008879279279279279, + "grad_norm": 41.28361892700195, + "learning_rate": 9.980082651251175e-06, + "loss": 11.02248764038086, + "loss_alignment": 0.404296875, + "loss_alignment_w": 0.2021484375, + "loss_sft": 0.4870011433959007, + "loss_total_v6": 0.6889054328203201, + "step": 77 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.008994594594594594, + "grad_norm": 49.07997131347656, + "learning_rate": 9.97858104436822e-06, + "loss": 10.97546672821045, + "loss_alignment": 0.39990234375, + "loss_alignment_w": 0.199951171875, + "loss_sft": 0.4858018606901169, + "loss_total_v6": 0.6859666705131531, + "step": 78 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00910990990990991, + "grad_norm": 44.11867141723633, + "learning_rate": 9.977024992520604e-06, + "loss": 10.664531707763672, + "loss_alignment": 0.38525390625, + "loss_alignment_w": 0.192626953125, + "loss_sft": 0.4737231880426407, + "loss_total_v6": 0.6665332168340683, + "step": 79 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.009225225225225226, + "grad_norm": 39.785972595214844, + "learning_rate": 9.975414512725058e-06, + "loss": 11.864603996276855, + "loss_alignment": 0.4052734375, + "loss_alignment_w": 0.20263671875, + "loss_sft": 0.5387789830565453, + "loss_total_v6": 0.7415377348661423, + "step": 80 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00934054054054054, + "grad_norm": 40.88325119018555, + "learning_rate": 9.973749622593534e-06, + "loss": 11.86978530883789, + "loss_alignment": 0.455078125, + "loss_alignment_w": 0.2275390625, + "loss_sft": 0.5144750624895096, + "loss_total_v6": 0.7418615818023682, + "step": 81 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.009455855855855856, + "grad_norm": 40.965667724609375, + "learning_rate": 9.972030340333e-06, + "loss": 11.444992065429688, + "loss_alignment": 0.4072265625, + "loss_alignment_w": 0.20361328125, + "loss_sft": 0.5120954215526581, + "loss_total_v6": 0.7153119891881943, + "step": 82 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.00957117117117117, + "grad_norm": 43.58540725708008, + "learning_rate": 9.970256684745258e-06, + "loss": 12.154552459716797, + "loss_alignment": 0.44140625, + "loss_alignment_w": 0.220703125, + "loss_sft": 0.5388649106025696, + "loss_total_v6": 0.759659543633461, + "step": 83 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.009686486486486486, + "grad_norm": 43.78575897216797, + "learning_rate": 9.968428675226714e-06, + "loss": 11.877842903137207, + "loss_alignment": 0.40673828125, + "loss_alignment_w": 0.203369140625, + "loss_sft": 0.5396674275398254, + "loss_total_v6": 0.7423651814460754, + "step": 84 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.009801801801801803, + "grad_norm": 39.05548858642578, + "learning_rate": 9.966546331768192e-06, + "loss": 11.079513549804688, + "loss_alignment": 0.388671875, + "loss_alignment_w": 0.1943359375, + "loss_sft": 0.4978589862585068, + "loss_total_v6": 0.692469596862793, + "step": 85 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.009917117117117118, + "grad_norm": 47.42577362060547, + "learning_rate": 9.964609674954696e-06, + "loss": 11.156253814697266, + "loss_alignment": 0.39990234375, + "loss_alignment_w": 0.199951171875, + "loss_sft": 0.4976503625512123, + "loss_total_v6": 0.6972658485174179, + "step": 86 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.010032432432432433, + "grad_norm": 43.53191375732422, + "learning_rate": 9.962618725965196e-06, + "loss": 10.926606178283691, + "loss_alignment": 0.3544921875, + "loss_alignment_w": 0.17724609375, + "loss_sft": 0.5060635805130005, + "loss_total_v6": 0.6829128861427307, + "step": 87 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.010147747747747748, + "grad_norm": 46.03475570678711, + "learning_rate": 9.960573506572391e-06, + "loss": 12.030237197875977, + "loss_alignment": 0.4453125, + "loss_alignment_w": 0.22265625, + "loss_sft": 0.5296303108334541, + "loss_total_v6": 0.7518897950649261, + "step": 88 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.010263063063063063, + "grad_norm": 40.45746612548828, + "learning_rate": 9.95847403914247e-06, + "loss": 11.281168937683105, + "loss_alignment": 0.39111328125, + "loss_alignment_w": 0.195556640625, + "loss_sft": 0.5098826289176941, + "loss_total_v6": 0.7050730586051941, + "step": 89 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.010378378378378378, + "grad_norm": 79.82403564453125, + "learning_rate": 9.956320346634877e-06, + "loss": 11.47000503540039, + "loss_alignment": 0.416015625, + "loss_alignment_w": 0.2080078125, + "loss_sft": 0.5091421604156494, + "loss_total_v6": 0.716875284910202, + "step": 90 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.010493693693693693, + "grad_norm": 38.543190002441406, + "learning_rate": 9.954112452602045e-06, + "loss": 10.935478210449219, + "loss_alignment": 0.40380859375, + "loss_alignment_w": 0.201904296875, + "loss_sft": 0.48089177906513214, + "loss_total_v6": 0.6834674328565598, + "step": 91 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01060900900900901, + "grad_norm": 42.7241096496582, + "learning_rate": 9.951850381189152e-06, + "loss": 11.544370651245117, + "loss_alignment": 0.4130859375, + "loss_alignment_w": 0.20654296875, + "loss_sft": 0.5154380053281784, + "loss_total_v6": 0.721523180603981, + "step": 92 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.010724324324324325, + "grad_norm": 42.20027160644531, + "learning_rate": 9.949534157133844e-06, + "loss": 11.940376281738281, + "loss_alignment": 0.44384765625, + "loss_alignment_w": 0.221923828125, + "loss_sft": 0.5245632901787758, + "loss_total_v6": 0.7462735176086426, + "step": 93 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01083963963963964, + "grad_norm": 33.31574249267578, + "learning_rate": 9.94716380576598e-06, + "loss": 11.99799633026123, + "loss_alignment": 0.447265625, + "loss_alignment_w": 0.2236328125, + "loss_sft": 0.5264555811882019, + "loss_total_v6": 0.7498747706413269, + "step": 94 + }, + { + "action_cond_aligned": 0.84375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.010954954954954955, + "grad_norm": 42.01817321777344, + "learning_rate": 9.944739353007344e-06, + "loss": 12.150979995727539, + "loss_alignment": 0.48388671875, + "loss_alignment_w": 0.241943359375, + "loss_sft": 0.516882486641407, + "loss_total_v6": 0.75943623483181, + "step": 95 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01107027027027027, + "grad_norm": 38.45635223388672, + "learning_rate": 9.942260825371359e-06, + "loss": 11.135976791381836, + "loss_alignment": 0.3955078125, + "loss_alignment_w": 0.19775390625, + "loss_sft": 0.49842772632837296, + "loss_total_v6": 0.6959985196590424, + "step": 96 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.011185585585585585, + "grad_norm": 37.8065299987793, + "learning_rate": 9.939728249962808e-06, + "loss": 10.963369369506836, + "loss_alignment": 0.37939453125, + "loss_alignment_w": 0.189697265625, + "loss_sft": 0.49548280984163284, + "loss_total_v6": 0.6852106004953384, + "step": 97 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.011300900900900902, + "grad_norm": 45.282649993896484, + "learning_rate": 9.937141654477529e-06, + "loss": 10.98514461517334, + "loss_alignment": 0.3837890625, + "loss_alignment_w": 0.19189453125, + "loss_sft": 0.4941582679748535, + "loss_total_v6": 0.6865715682506561, + "step": 98 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.011416216216216217, + "grad_norm": 38.232364654541016, + "learning_rate": 9.934501067202117e-06, + "loss": 10.718931198120117, + "loss_alignment": 0.39111328125, + "loss_alignment_w": 0.195556640625, + "loss_sft": 0.4743461087346077, + "loss_total_v6": 0.6699332445859909, + "step": 99 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.011531531531531532, + "grad_norm": 44.78959655761719, + "learning_rate": 9.931806517013612e-06, + "loss": 11.280073165893555, + "loss_alignment": 0.4228515625, + "loss_alignment_w": 0.21142578125, + "loss_sft": 0.4931820183992386, + "loss_total_v6": 0.7050045281648636, + "step": 100 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.011646846846846847, + "grad_norm": 76.37452697753906, + "learning_rate": 9.929058033379181e-06, + "loss": 10.33703899383545, + "loss_alignment": 0.3408203125, + "loss_alignment_w": 0.17041015625, + "loss_sft": 0.475837878882885, + "loss_total_v6": 0.6460649520158768, + "step": 101 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.011762162162162162, + "grad_norm": 40.24941635131836, + "learning_rate": 9.926255646355804e-06, + "loss": 11.247539520263672, + "loss_alignment": 0.39306640625, + "loss_alignment_w": 0.196533203125, + "loss_sft": 0.5064380839467049, + "loss_total_v6": 0.7029712498188019, + "step": 102 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.011877477477477477, + "grad_norm": 38.41650390625, + "learning_rate": 9.923399386589933e-06, + "loss": 11.409405708312988, + "loss_alignment": 0.42578125, + "loss_alignment_w": 0.212890625, + "loss_sft": 0.5001361519098282, + "loss_total_v6": 0.7130878269672394, + "step": 103 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.011992792792792794, + "grad_norm": 38.248287200927734, + "learning_rate": 9.920489285317169e-06, + "loss": 11.463066101074219, + "loss_alignment": 0.359375, + "loss_alignment_w": 0.1796875, + "loss_sft": 0.5371203869581223, + "loss_total_v6": 0.7164416313171387, + "step": 104 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.012108108108108109, + "grad_norm": 47.97269821166992, + "learning_rate": 9.917525374361913e-06, + "loss": 11.811556816101074, + "loss_alignment": 0.3935546875, + "loss_alignment_w": 0.19677734375, + "loss_sft": 0.5418417006731033, + "loss_total_v6": 0.7382223010063171, + "step": 105 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.012223423423423424, + "grad_norm": 43.72230911254883, + "learning_rate": 9.91450768613702e-06, + "loss": 11.548731803894043, + "loss_alignment": 0.38525390625, + "loss_alignment_w": 0.192626953125, + "loss_sft": 0.5292908251285553, + "loss_total_v6": 0.7217957377433777, + "step": 106 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.012338738738738739, + "grad_norm": 38.385475158691406, + "learning_rate": 9.911436253643445e-06, + "loss": 11.318323135375977, + "loss_alignment": 0.42333984375, + "loss_alignment_w": 0.211669921875, + "loss_sft": 0.4955422133207321, + "loss_total_v6": 0.7073952108621597, + "step": 107 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.012454054054054054, + "grad_norm": 38.34065246582031, + "learning_rate": 9.908311110469881e-06, + "loss": 10.984535217285156, + "loss_alignment": 0.36181640625, + "loss_alignment_w": 0.180908203125, + "loss_sft": 0.5055337324738503, + "loss_total_v6": 0.6865334659814835, + "step": 108 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.012569369369369369, + "grad_norm": 39.78327941894531, + "learning_rate": 9.905132290792395e-06, + "loss": 11.728338241577148, + "loss_alignment": 0.37548828125, + "loss_alignment_w": 0.187744140625, + "loss_sft": 0.5451549142599106, + "loss_total_v6": 0.7330211251974106, + "step": 109 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.012684684684684684, + "grad_norm": 37.994197845458984, + "learning_rate": 9.901899829374048e-06, + "loss": 11.334863662719727, + "loss_alignment": 0.39990234375, + "loss_alignment_w": 0.199951171875, + "loss_sft": 0.5085693448781967, + "loss_total_v6": 0.7084289491176605, + "step": 110 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0128, + "grad_norm": 39.19221115112305, + "learning_rate": 9.89861376156452e-06, + "loss": 11.028471946716309, + "loss_alignment": 0.38037109375, + "loss_alignment_w": 0.190185546875, + "loss_sft": 0.4989107996225357, + "loss_total_v6": 0.6892794966697693, + "step": 111 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.012915315315315316, + "grad_norm": 39.974830627441406, + "learning_rate": 9.895274123299724e-06, + "loss": 11.476688385009766, + "loss_alignment": 0.38818359375, + "loss_alignment_w": 0.194091796875, + "loss_sft": 0.5225297957658768, + "loss_total_v6": 0.717292994260788, + "step": 112 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01303063063063063, + "grad_norm": 38.04823684692383, + "learning_rate": 9.891880951101407e-06, + "loss": 11.865182876586914, + "loss_alignment": 0.39501953125, + "loss_alignment_w": 0.197509765625, + "loss_sft": 0.5441862195730209, + "loss_total_v6": 0.7415739595890045, + "step": 113 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.013145945945945946, + "grad_norm": 35.42141342163086, + "learning_rate": 9.888434282076759e-06, + "loss": 11.115006446838379, + "loss_alignment": 0.431640625, + "loss_alignment_w": 0.2158203125, + "loss_sft": 0.4791727140545845, + "loss_total_v6": 0.6946878731250763, + "step": 114 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01326126126126126, + "grad_norm": 34.405174255371094, + "learning_rate": 9.884934153917998e-06, + "loss": 11.037485122680664, + "loss_alignment": 0.3955078125, + "loss_alignment_w": 0.19775390625, + "loss_sft": 0.4916311353445053, + "loss_total_v6": 0.6898427903652191, + "step": 115 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.013376576576576576, + "grad_norm": 39.95820999145508, + "learning_rate": 9.881380604901964e-06, + "loss": 11.176095962524414, + "loss_alignment": 0.4111328125, + "loss_alignment_w": 0.20556640625, + "loss_sft": 0.49278702586889267, + "loss_total_v6": 0.6985060125589371, + "step": 116 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.013491891891891893, + "grad_norm": 35.98461151123047, + "learning_rate": 9.877773673889702e-06, + "loss": 11.920989036560059, + "loss_alignment": 0.42333984375, + "loss_alignment_w": 0.211669921875, + "loss_sft": 0.5335750132799149, + "loss_total_v6": 0.7450618147850037, + "step": 117 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.013607207207207208, + "grad_norm": 37.00596237182617, + "learning_rate": 9.874113400326031e-06, + "loss": 11.753758430480957, + "loss_alignment": 0.36767578125, + "loss_alignment_w": 0.183837890625, + "loss_sft": 0.550588920712471, + "loss_total_v6": 0.7346099019050598, + "step": 118 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.013722522522522523, + "grad_norm": 38.397422790527344, + "learning_rate": 9.870399824239116e-06, + "loss": 11.167131423950195, + "loss_alignment": 0.3642578125, + "loss_alignment_w": 0.18212890625, + "loss_sft": 0.515816792845726, + "loss_total_v6": 0.6979457288980484, + "step": 119 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.013837837837837838, + "grad_norm": 36.04999923706055, + "learning_rate": 9.86663298624003e-06, + "loss": 11.029327392578125, + "loss_alignment": 0.36083984375, + "loss_alignment_w": 0.180419921875, + "loss_sft": 0.5095844268798828, + "loss_total_v6": 0.6893329620361328, + "step": 120 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.013953153153153153, + "grad_norm": 40.774269104003906, + "learning_rate": 9.86281292752231e-06, + "loss": 10.615886688232422, + "loss_alignment": 0.39501953125, + "loss_alignment_w": 0.197509765625, + "loss_sft": 0.46601368486881256, + "loss_total_v6": 0.6634929329156876, + "step": 121 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.014068468468468468, + "grad_norm": 37.91816329956055, + "learning_rate": 9.858939689861506e-06, + "loss": 10.788103103637695, + "loss_alignment": 0.36083984375, + "loss_alignment_w": 0.180419921875, + "loss_sft": 0.49401962012052536, + "loss_total_v6": 0.6742564737796783, + "step": 122 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.014183783783783785, + "grad_norm": 34.14409255981445, + "learning_rate": 9.855013315614725e-06, + "loss": 11.67635726928711, + "loss_alignment": 0.37890625, + "loss_alignment_w": 0.189453125, + "loss_sft": 0.5406549423933029, + "loss_total_v6": 0.7297723442316055, + "step": 123 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0142990990990991, + "grad_norm": 40.29840850830078, + "learning_rate": 9.851033847720167e-06, + "loss": 11.612295150756836, + "loss_alignment": 0.39453125, + "loss_alignment_w": 0.197265625, + "loss_sft": 0.5285027846693993, + "loss_total_v6": 0.7257684171199799, + "step": 124 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.014414414414414415, + "grad_norm": 39.22963333129883, + "learning_rate": 9.847001329696653e-06, + "loss": 10.930414199829102, + "loss_alignment": 0.34814453125, + "loss_alignment_w": 0.174072265625, + "loss_sft": 0.5094143152236938, + "loss_total_v6": 0.6831508725881577, + "step": 125 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01452972972972973, + "grad_norm": 37.3372688293457, + "learning_rate": 9.842915805643156e-06, + "loss": 11.254518508911133, + "loss_alignment": 0.44384765625, + "loss_alignment_w": 0.221923828125, + "loss_sft": 0.4819718226790428, + "loss_total_v6": 0.7034073919057846, + "step": 126 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.014645045045045045, + "grad_norm": 34.54289245605469, + "learning_rate": 9.838777320238312e-06, + "loss": 10.652044296264648, + "loss_alignment": 0.384765625, + "loss_alignment_w": 0.1923828125, + "loss_sft": 0.4735835939645767, + "loss_total_v6": 0.6657527685165405, + "step": 127 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01476036036036036, + "grad_norm": 41.44737243652344, + "learning_rate": 9.834585918739936e-06, + "loss": 10.492988586425781, + "loss_alignment": 0.34326171875, + "loss_alignment_w": 0.171630859375, + "loss_sft": 0.4841504916548729, + "loss_total_v6": 0.6558118164539337, + "step": 128 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.014875675675675677, + "grad_norm": 37.54391860961914, + "learning_rate": 9.830341646984521e-06, + "loss": 11.794503211975098, + "loss_alignment": 0.38818359375, + "loss_alignment_w": 0.194091796875, + "loss_sft": 0.5432172417640686, + "loss_total_v6": 0.7371564358472824, + "step": 129 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.014990990990990992, + "grad_norm": 33.861900329589844, + "learning_rate": 9.826044551386743e-06, + "loss": 11.417277336120605, + "loss_alignment": 0.39306640625, + "loss_alignment_w": 0.196533203125, + "loss_sft": 0.5167108997702599, + "loss_total_v6": 0.7135798037052155, + "step": 130 + }, + { + "action_cond_aligned": 0.609375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.015106306306306307, + "grad_norm": 35.33546829223633, + "learning_rate": 9.821694678938954e-06, + "loss": 10.206665992736816, + "loss_alignment": 0.30859375, + "loss_alignment_w": 0.154296875, + "loss_sft": 0.4835282117128372, + "loss_total_v6": 0.637916624546051, + "step": 131 + }, + { + "action_cond_aligned": 0.609375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.015221621621621622, + "grad_norm": 40.45652389526367, + "learning_rate": 9.817292077210658e-06, + "loss": 10.73394775390625, + "loss_alignment": 0.32666015625, + "loss_alignment_w": 0.163330078125, + "loss_sft": 0.5069617629051208, + "loss_total_v6": 0.6708717048168182, + "step": 132 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.015336936936936937, + "grad_norm": 37.16210174560547, + "learning_rate": 9.812836794348005e-06, + "loss": 11.066583633422852, + "loss_alignment": 0.3720703125, + "loss_alignment_w": 0.18603515625, + "loss_sft": 0.5057178810238838, + "loss_total_v6": 0.6916615068912506, + "step": 133 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.015452252252252252, + "grad_norm": 39.74161148071289, + "learning_rate": 9.808328879073251e-06, + "loss": 11.361067771911621, + "loss_alignment": 0.41259765625, + "loss_alignment_w": 0.206298828125, + "loss_sft": 0.5038594454526901, + "loss_total_v6": 0.7100667357444763, + "step": 134 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.015567567567567567, + "grad_norm": 38.46805191040039, + "learning_rate": 9.803768380684242e-06, + "loss": 11.074579238891602, + "loss_alignment": 0.357421875, + "loss_alignment_w": 0.1787109375, + "loss_sft": 0.5134197100996971, + "loss_total_v6": 0.6921612173318863, + "step": 135 + }, + { + "action_cond_aligned": 0.546875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.015682882882882884, + "grad_norm": 40.415771484375, + "learning_rate": 9.79915534905385e-06, + "loss": 11.02964973449707, + "loss_alignment": 0.28564453125, + "loss_alignment_w": 0.142822265625, + "loss_sft": 0.5465613603591919, + "loss_total_v6": 0.6893531233072281, + "step": 136 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.015798198198198197, + "grad_norm": 37.411521911621094, + "learning_rate": 9.794489834629457e-06, + "loss": 10.519876480102539, + "loss_alignment": 0.35791015625, + "loss_alignment_w": 0.178955078125, + "loss_sft": 0.4785677269101143, + "loss_total_v6": 0.6574922949075699, + "step": 137 + }, + { + "action_cond_aligned": 0.609375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.015913513513513514, + "grad_norm": 37.20720291137695, + "learning_rate": 9.789771888432375e-06, + "loss": 9.917542457580566, + "loss_alignment": 0.2998046875, + "loss_alignment_w": 0.14990234375, + "loss_sft": 0.4693947359919548, + "loss_total_v6": 0.6198464035987854, + "step": 138 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01602882882882883, + "grad_norm": 36.463924407958984, + "learning_rate": 9.785001562057311e-06, + "loss": 11.003753662109375, + "loss_alignment": 0.380859375, + "loss_alignment_w": 0.1904296875, + "loss_sft": 0.49727440625429153, + "loss_total_v6": 0.6877346038818359, + "step": 139 + }, + { + "action_cond_aligned": 0.578125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.016144144144144144, + "grad_norm": 50.236572265625, + "learning_rate": 9.780178907671788e-06, + "loss": 10.398574829101562, + "loss_alignment": 0.3037109375, + "loss_alignment_w": 0.15185546875, + "loss_sft": 0.49829956144094467, + "loss_total_v6": 0.6499109268188477, + "step": 140 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01625945945945946, + "grad_norm": 32.426143646240234, + "learning_rate": 9.775303978015585e-06, + "loss": 11.848718643188477, + "loss_alignment": 0.40478515625, + "loss_alignment_w": 0.202392578125, + "loss_sft": 0.5376640260219574, + "loss_total_v6": 0.7405449151992798, + "step": 141 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.016374774774774774, + "grad_norm": 43.73902893066406, + "learning_rate": 9.77037682640015e-06, + "loss": 10.430076599121094, + "loss_alignment": 0.34033203125, + "loss_alignment_w": 0.170166015625, + "loss_sft": 0.48165280371904373, + "loss_total_v6": 0.6518798321485519, + "step": 142 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01649009009009009, + "grad_norm": 35.5573844909668, + "learning_rate": 9.765397506708023e-06, + "loss": 10.245532035827637, + "loss_alignment": 0.3623046875, + "loss_alignment_w": 0.18115234375, + "loss_sft": 0.4587356299161911, + "loss_total_v6": 0.6403457671403885, + "step": 143 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.016605405405405404, + "grad_norm": 34.53725051879883, + "learning_rate": 9.760366073392246e-06, + "loss": 11.177001953125, + "loss_alignment": 0.374755859375, + "loss_alignment_w": 0.1873779296875, + "loss_sft": 0.5109710171818733, + "loss_total_v6": 0.6985625922679901, + "step": 144 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01672072072072072, + "grad_norm": 33.772823333740234, + "learning_rate": 9.755282581475769e-06, + "loss": 11.235665321350098, + "loss_alignment": 0.39892578125, + "loss_alignment_w": 0.199462890625, + "loss_sft": 0.5024000033736229, + "loss_total_v6": 0.7022290676832199, + "step": 145 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.016836036036036037, + "grad_norm": 40.54448699951172, + "learning_rate": 9.750147086550843e-06, + "loss": 9.85325813293457, + "loss_alignment": 0.32568359375, + "loss_alignment_w": 0.162841796875, + "loss_sft": 0.4529869183897972, + "loss_total_v6": 0.6158286780118942, + "step": 146 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01695135135135135, + "grad_norm": 37.96028137207031, + "learning_rate": 9.744959644778422e-06, + "loss": 11.656577110290527, + "loss_alignment": 0.38720703125, + "loss_alignment_w": 0.193603515625, + "loss_sft": 0.5348104909062386, + "loss_total_v6": 0.7285360842943192, + "step": 147 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.017066666666666667, + "grad_norm": 42.25545120239258, + "learning_rate": 9.739720312887536e-06, + "loss": 10.581480026245117, + "loss_alignment": 0.32861328125, + "loss_alignment_w": 0.164306640625, + "loss_sft": 0.497127428650856, + "loss_total_v6": 0.661342516541481, + "step": 148 + }, + { + "action_cond_aligned": 0.59375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01718198198198198, + "grad_norm": 38.17348861694336, + "learning_rate": 9.734429148174676e-06, + "loss": 10.618032455444336, + "loss_alignment": 0.29638671875, + "loss_alignment_w": 0.148193359375, + "loss_sft": 0.5153421014547348, + "loss_total_v6": 0.663627028465271, + "step": 149 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.017297297297297298, + "grad_norm": 34.61387634277344, + "learning_rate": 9.729086208503174e-06, + "loss": 11.433370590209961, + "loss_alignment": 0.3603515625, + "loss_alignment_w": 0.18017578125, + "loss_sft": 0.5343489050865173, + "loss_total_v6": 0.7145856767892838, + "step": 150 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.017412612612612614, + "grad_norm": 35.70179748535156, + "learning_rate": 9.723691552302563e-06, + "loss": 10.323122024536133, + "loss_alignment": 0.3544921875, + "loss_alignment_w": 0.17724609375, + "loss_sft": 0.4678574502468109, + "loss_total_v6": 0.6451951116323471, + "step": 151 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.017527927927927928, + "grad_norm": 36.7366828918457, + "learning_rate": 9.718245238567939e-06, + "loss": 10.607959747314453, + "loss_alignment": 0.353515625, + "loss_alignment_w": 0.1767578125, + "loss_sft": 0.4859955757856369, + "loss_total_v6": 0.6629974693059921, + "step": 152 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.017643243243243244, + "grad_norm": 38.786354064941406, + "learning_rate": 9.712747326859316e-06, + "loss": 11.730378150939941, + "loss_alignment": 0.4140625, + "loss_alignment_w": 0.20703125, + "loss_sft": 0.5259343087673187, + "loss_total_v6": 0.7331486344337463, + "step": 153 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.017758558558558558, + "grad_norm": 35.860294342041016, + "learning_rate": 9.707197877300974e-06, + "loss": 11.02009391784668, + "loss_alignment": 0.353515625, + "loss_alignment_w": 0.1767578125, + "loss_sft": 0.5121200680732727, + "loss_total_v6": 0.6887558549642563, + "step": 154 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.017873873873873874, + "grad_norm": 41.58584213256836, + "learning_rate": 9.701596950580807e-06, + "loss": 10.185293197631836, + "loss_alignment": 0.35107421875, + "loss_alignment_w": 0.175537109375, + "loss_sft": 0.4607080742716789, + "loss_total_v6": 0.6365808695554733, + "step": 155 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.017989189189189188, + "grad_norm": 39.950523376464844, + "learning_rate": 9.69594460794965e-06, + "loss": 10.989348411560059, + "loss_alignment": 0.35009765625, + "loss_alignment_w": 0.175048828125, + "loss_sft": 0.5114192068576813, + "loss_total_v6": 0.6868342459201813, + "step": 156 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.018104504504504505, + "grad_norm": 35.7664680480957, + "learning_rate": 9.690240911220618e-06, + "loss": 11.268933296203613, + "loss_alignment": 0.3505859375, + "loss_alignment_w": 0.17529296875, + "loss_sft": 0.528893306851387, + "loss_total_v6": 0.7043083161115646, + "step": 157 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01821981981981982, + "grad_norm": 36.805301666259766, + "learning_rate": 9.684485922768422e-06, + "loss": 10.944342613220215, + "loss_alignment": 0.316162109375, + "loss_alignment_w": 0.1580810546875, + "loss_sft": 0.5251164138317108, + "loss_total_v6": 0.6840214133262634, + "step": 158 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.018335135135135135, + "grad_norm": 34.68510437011719, + "learning_rate": 9.678679705528699e-06, + "loss": 10.98135757446289, + "loss_alignment": 0.36962890625, + "loss_alignment_w": 0.184814453125, + "loss_sft": 0.5013372302055359, + "loss_total_v6": 0.6863348037004471, + "step": 159 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01845045045045045, + "grad_norm": 36.3839225769043, + "learning_rate": 9.672822322997305e-06, + "loss": 11.456241607666016, + "loss_alignment": 0.3994140625, + "loss_alignment_w": 0.19970703125, + "loss_sft": 0.5165216699242592, + "loss_total_v6": 0.7160150706768036, + "step": 160 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.018565765765765765, + "grad_norm": 34.66144561767578, + "learning_rate": 9.666913839229639e-06, + "loss": 11.315988540649414, + "loss_alignment": 0.375, + "loss_alignment_w": 0.1875, + "loss_sft": 0.5196882709860802, + "loss_total_v6": 0.7072492986917496, + "step": 161 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01868108108108108, + "grad_norm": 35.57512664794922, + "learning_rate": 9.660954318839934e-06, + "loss": 10.799245834350586, + "loss_alignment": 0.3515625, + "loss_alignment_w": 0.17578125, + "loss_sft": 0.4985917806625366, + "loss_total_v6": 0.6749528497457504, + "step": 162 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.018796396396396395, + "grad_norm": 35.41111373901367, + "learning_rate": 9.654943827000548e-06, + "loss": 10.816347122192383, + "loss_alignment": 0.37060546875, + "loss_alignment_w": 0.185302734375, + "loss_sft": 0.4901696518063545, + "loss_total_v6": 0.6760216504335403, + "step": 163 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01891171171171171, + "grad_norm": 35.46927261352539, + "learning_rate": 9.648882429441258e-06, + "loss": 11.123701095581055, + "loss_alignment": 0.3427734375, + "loss_alignment_w": 0.17138671875, + "loss_sft": 0.5237531512975693, + "loss_total_v6": 0.6952313184738159, + "step": 164 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01902702702702703, + "grad_norm": 36.92467498779297, + "learning_rate": 9.642770192448537e-06, + "loss": 10.944113731384277, + "loss_alignment": 0.38671875, + "loss_alignment_w": 0.193359375, + "loss_sft": 0.49028152972459793, + "loss_total_v6": 0.6840071082115173, + "step": 165 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01914234234234234, + "grad_norm": 33.98771667480469, + "learning_rate": 9.636607182864828e-06, + "loss": 10.966022491455078, + "loss_alignment": 0.3515625, + "loss_alignment_w": 0.17578125, + "loss_sft": 0.5094426050782204, + "loss_total_v6": 0.6853763908147812, + "step": 166 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01925765765765766, + "grad_norm": 36.57232666015625, + "learning_rate": 9.630393468087818e-06, + "loss": 10.834887504577637, + "loss_alignment": 0.33544921875, + "loss_alignment_w": 0.167724609375, + "loss_sft": 0.5095169320702553, + "loss_total_v6": 0.6771804839372635, + "step": 167 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.019372972972972972, + "grad_norm": 36.943851470947266, + "learning_rate": 9.624129116069695e-06, + "loss": 11.381841659545898, + "loss_alignment": 0.38671875, + "loss_alignment_w": 0.193359375, + "loss_sft": 0.5181277692317963, + "loss_total_v6": 0.7113650888204575, + "step": 168 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01948828828828829, + "grad_norm": 35.527587890625, + "learning_rate": 9.61781419531641e-06, + "loss": 10.364584922790527, + "loss_alignment": 0.35009765625, + "loss_alignment_w": 0.175048828125, + "loss_sft": 0.47340916097164154, + "loss_total_v6": 0.647786557674408, + "step": 169 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.019603603603603605, + "grad_norm": 36.07157516479492, + "learning_rate": 9.611448774886925e-06, + "loss": 11.165797233581543, + "loss_alignment": 0.40185546875, + "loss_alignment_w": 0.200927734375, + "loss_sft": 0.49669040739536285, + "loss_total_v6": 0.6978623121976852, + "step": 170 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01971891891891892, + "grad_norm": 33.640384674072266, + "learning_rate": 9.605032924392457e-06, + "loss": 10.946937561035156, + "loss_alignment": 0.3876953125, + "loss_alignment_w": 0.19384765625, + "loss_sft": 0.49003080278635025, + "loss_total_v6": 0.6841836273670197, + "step": 171 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.019834234234234235, + "grad_norm": 32.480247497558594, + "learning_rate": 9.598566713995718e-06, + "loss": 11.913656234741211, + "loss_alignment": 0.40380859375, + "loss_alignment_w": 0.201904296875, + "loss_sft": 0.5430654734373093, + "loss_total_v6": 0.7446035444736481, + "step": 172 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.01994954954954955, + "grad_norm": 45.84501266479492, + "learning_rate": 9.592050214410152e-06, + "loss": 10.576227188110352, + "loss_alignment": 0.3271484375, + "loss_alignment_w": 0.16357421875, + "loss_sft": 0.49765364080667496, + "loss_total_v6": 0.6610142439603806, + "step": 173 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.020064864864864865, + "grad_norm": 39.40104675292969, + "learning_rate": 9.585483496899151e-06, + "loss": 11.293769836425781, + "loss_alignment": 0.37646484375, + "loss_alignment_w": 0.188232421875, + "loss_sft": 0.5169567763805389, + "loss_total_v6": 0.7058605998754501, + "step": 174 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02018018018018018, + "grad_norm": 37.37687301635742, + "learning_rate": 9.578866633275289e-06, + "loss": 11.031691551208496, + "loss_alignment": 0.34033203125, + "loss_alignment_w": 0.170166015625, + "loss_sft": 0.5192841738462448, + "loss_total_v6": 0.689480721950531, + "step": 175 + }, + { + "action_cond_aligned": 0.84375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.020295495495495496, + "grad_norm": 37.673160552978516, + "learning_rate": 9.572199695899522e-06, + "loss": 11.797551155090332, + "loss_alignment": 0.39794921875, + "loss_alignment_w": 0.198974609375, + "loss_sft": 0.538891151547432, + "loss_total_v6": 0.7373469769954681, + "step": 176 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.020410810810810812, + "grad_norm": 41.246124267578125, + "learning_rate": 9.565482757680415e-06, + "loss": 10.521644592285156, + "loss_alignment": 0.298828125, + "loss_alignment_w": 0.1494140625, + "loss_sft": 0.5084328353404999, + "loss_total_v6": 0.6576027423143387, + "step": 177 + }, + { + "action_cond_aligned": 0.609375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.020526126126126126, + "grad_norm": 34.867340087890625, + "learning_rate": 9.558715892073324e-06, + "loss": 10.44816780090332, + "loss_alignment": 0.31201171875, + "loss_alignment_w": 0.156005859375, + "loss_sft": 0.4972488135099411, + "loss_total_v6": 0.6530105322599411, + "step": 178 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.020641441441441442, + "grad_norm": 35.768733978271484, + "learning_rate": 9.551899173079607e-06, + "loss": 10.183735847473145, + "loss_alignment": 0.31396484375, + "loss_alignment_w": 0.156982421875, + "loss_sft": 0.47986727952957153, + "loss_total_v6": 0.6364834904670715, + "step": 179 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.020756756756756756, + "grad_norm": 32.445587158203125, + "learning_rate": 9.545032675245814e-06, + "loss": 10.903032302856445, + "loss_alignment": 0.35595703125, + "loss_alignment_w": 0.177978515625, + "loss_sft": 0.5037356540560722, + "loss_total_v6": 0.6814394742250443, + "step": 180 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.020872072072072072, + "grad_norm": 35.791961669921875, + "learning_rate": 9.538116473662862e-06, + "loss": 10.05699348449707, + "loss_alignment": 0.3173828125, + "loss_alignment_w": 0.15869140625, + "loss_sft": 0.4699012413620949, + "loss_total_v6": 0.6285621225833893, + "step": 181 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.020987387387387386, + "grad_norm": 37.04840850830078, + "learning_rate": 9.531150643965224e-06, + "loss": 10.844073295593262, + "loss_alignment": 0.321044921875, + "loss_alignment_w": 0.1605224609375, + "loss_sft": 0.5172931179404259, + "loss_total_v6": 0.6777545660734177, + "step": 182 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.021102702702702703, + "grad_norm": 33.035404205322266, + "learning_rate": 9.524135262330098e-06, + "loss": 10.427494049072266, + "loss_alignment": 0.3427734375, + "loss_alignment_w": 0.17138671875, + "loss_sft": 0.4807894825935364, + "loss_total_v6": 0.6517183929681778, + "step": 183 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02121801801801802, + "grad_norm": 52.576663970947266, + "learning_rate": 9.517070405476575e-06, + "loss": 10.709270477294922, + "loss_alignment": 0.30078125, + "loss_alignment_w": 0.150390625, + "loss_sft": 0.5188776776194572, + "loss_total_v6": 0.669329360127449, + "step": 184 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.021333333333333333, + "grad_norm": 32.41947555541992, + "learning_rate": 9.509956150664796e-06, + "loss": 10.262691497802734, + "loss_alignment": 0.356689453125, + "loss_alignment_w": 0.1783447265625, + "loss_sft": 0.4628598913550377, + "loss_total_v6": 0.6414182484149933, + "step": 185 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02144864864864865, + "grad_norm": 33.35493087768555, + "learning_rate": 9.502792575695112e-06, + "loss": 11.033699035644531, + "loss_alignment": 0.37255859375, + "loss_alignment_w": 0.186279296875, + "loss_sft": 0.5033574476838112, + "loss_total_v6": 0.6896061897277832, + "step": 186 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.021563963963963963, + "grad_norm": 34.41209411621094, + "learning_rate": 9.495579758907231e-06, + "loss": 10.472491264343262, + "loss_alignment": 0.3212890625, + "loss_alignment_w": 0.16064453125, + "loss_sft": 0.49403873831033707, + "loss_total_v6": 0.6545306891202927, + "step": 187 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02167927927927928, + "grad_norm": 36.52956008911133, + "learning_rate": 9.48831777917936e-06, + "loss": 11.20093822479248, + "loss_alignment": 0.35888671875, + "loss_alignment_w": 0.179443359375, + "loss_sft": 0.5203711092472076, + "loss_total_v6": 0.7000586241483688, + "step": 188 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.021794594594594596, + "grad_norm": 33.19914627075195, + "learning_rate": 9.481006715927352e-06, + "loss": 11.104903221130371, + "loss_alignment": 0.36865234375, + "loss_alignment_w": 0.184326171875, + "loss_sft": 0.5098828822374344, + "loss_total_v6": 0.694056436419487, + "step": 189 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02190990990990991, + "grad_norm": 34.529571533203125, + "learning_rate": 9.473646649103819e-06, + "loss": 11.093311309814453, + "loss_alignment": 0.37939453125, + "loss_alignment_w": 0.189697265625, + "loss_sft": 0.5036346614360809, + "loss_total_v6": 0.6933319121599197, + "step": 190 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.022025225225225226, + "grad_norm": 37.93177032470703, + "learning_rate": 9.466237659197271e-06, + "loss": 10.966110229492188, + "loss_alignment": 0.33251953125, + "loss_alignment_w": 0.166259765625, + "loss_sft": 0.5191831365227699, + "loss_total_v6": 0.6853819042444229, + "step": 191 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02214054054054054, + "grad_norm": 35.41047668457031, + "learning_rate": 9.458779827231237e-06, + "loss": 9.495319366455078, + "loss_alignment": 0.30615234375, + "loss_alignment_w": 0.153076171875, + "loss_sft": 0.4401370882987976, + "loss_total_v6": 0.5934574156999588, + "step": 192 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.022255855855855856, + "grad_norm": 35.39752960205078, + "learning_rate": 9.451273234763372e-06, + "loss": 10.344264030456543, + "loss_alignment": 0.3564453125, + "loss_alignment_w": 0.17822265625, + "loss_sft": 0.46783609688282013, + "loss_total_v6": 0.6465165019035339, + "step": 193 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02237117117117117, + "grad_norm": 36.807411193847656, + "learning_rate": 9.443717963884568e-06, + "loss": 10.873353004455566, + "loss_alignment": 0.34228515625, + "loss_alignment_w": 0.171142578125, + "loss_sft": 0.5087776482105255, + "loss_total_v6": 0.6795845478773117, + "step": 194 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.022486486486486486, + "grad_norm": 32.42237854003906, + "learning_rate": 9.43611409721806e-06, + "loss": 10.299345970153809, + "loss_alignment": 0.365234375, + "loss_alignment_w": 0.1826171875, + "loss_sft": 0.461214043200016, + "loss_total_v6": 0.6437091529369354, + "step": 195 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.022601801801801803, + "grad_norm": 36.26038360595703, + "learning_rate": 9.428461717918512e-06, + "loss": 10.253604888916016, + "loss_alignment": 0.32080078125, + "loss_alignment_w": 0.160400390625, + "loss_sft": 0.4798395037651062, + "loss_total_v6": 0.6408502608537674, + "step": 196 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.022717117117117117, + "grad_norm": 33.69107437133789, + "learning_rate": 9.420760909671119e-06, + "loss": 11.180656433105469, + "loss_alignment": 0.36279296875, + "loss_alignment_w": 0.181396484375, + "loss_sft": 0.5177912786602974, + "loss_total_v6": 0.698791041970253, + "step": 197 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.022832432432432433, + "grad_norm": 35.43405532836914, + "learning_rate": 9.413011756690686e-06, + "loss": 11.367717742919922, + "loss_alignment": 0.3779296875, + "loss_alignment_w": 0.18896484375, + "loss_sft": 0.5212123617529869, + "loss_total_v6": 0.7104823738336563, + "step": 198 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.022947747747747747, + "grad_norm": 34.35371780395508, + "learning_rate": 9.405214343720708e-06, + "loss": 11.62018871307373, + "loss_alignment": 0.390625, + "loss_alignment_w": 0.1953125, + "loss_sft": 0.5308272391557693, + "loss_total_v6": 0.7262617945671082, + "step": 199 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.023063063063063063, + "grad_norm": 35.389896392822266, + "learning_rate": 9.397368756032445e-06, + "loss": 11.359642028808594, + "loss_alignment": 0.35791015625, + "loss_alignment_w": 0.178955078125, + "loss_sft": 0.5306868329644203, + "loss_total_v6": 0.7099776118993759, + "step": 200 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.023178378378378377, + "grad_norm": 65.65064239501953, + "learning_rate": 9.389475079423988e-06, + "loss": 10.495899200439453, + "loss_alignment": 0.3095703125, + "loss_alignment_w": 0.15478515625, + "loss_sft": 0.501300074160099, + "loss_total_v6": 0.6559936851263046, + "step": 201 + }, + { + "action_cond_aligned": 0.84375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.023293693693693693, + "grad_norm": 34.108131408691406, + "learning_rate": 9.381533400219319e-06, + "loss": 11.195253372192383, + "loss_alignment": 0.38818359375, + "loss_alignment_w": 0.194091796875, + "loss_sft": 0.5052148476243019, + "loss_total_v6": 0.6997033506631851, + "step": 202 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02340900900900901, + "grad_norm": 34.07207489013672, + "learning_rate": 9.373543805267367e-06, + "loss": 11.616744041442871, + "loss_alignment": 0.3876953125, + "loss_alignment_w": 0.19384765625, + "loss_sft": 0.5321072861552238, + "loss_total_v6": 0.7260465025901794, + "step": 203 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.023524324324324324, + "grad_norm": 32.93382263183594, + "learning_rate": 9.365506381941066e-06, + "loss": 10.958948135375977, + "loss_alignment": 0.3720703125, + "loss_alignment_w": 0.18603515625, + "loss_sft": 0.49911269545555115, + "loss_total_v6": 0.6849342286586761, + "step": 204 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02363963963963964, + "grad_norm": 78.25447082519531, + "learning_rate": 9.357421218136387e-06, + "loss": 10.943607330322266, + "loss_alignment": 0.3701171875, + "loss_alignment_w": 0.18505859375, + "loss_sft": 0.499008446931839, + "loss_total_v6": 0.683975487947464, + "step": 205 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.023754954954954954, + "grad_norm": 35.335853576660156, + "learning_rate": 9.349288402271387e-06, + "loss": 9.422879219055176, + "loss_alignment": 0.328125, + "loss_alignment_w": 0.1640625, + "loss_sft": 0.4249894917011261, + "loss_total_v6": 0.5889299213886261, + "step": 206 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02387027027027027, + "grad_norm": 38.8150749206543, + "learning_rate": 9.341108023285239e-06, + "loss": 11.079994201660156, + "loss_alignment": 0.294921875, + "loss_alignment_w": 0.1474609375, + "loss_sft": 0.544794574379921, + "loss_total_v6": 0.692499652504921, + "step": 207 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.023985585585585587, + "grad_norm": 34.645259857177734, + "learning_rate": 9.332880170637252e-06, + "loss": 11.073735237121582, + "loss_alignment": 0.3740234375, + "loss_alignment_w": 0.18701171875, + "loss_sft": 0.5049136579036713, + "loss_total_v6": 0.6921084374189377, + "step": 208 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0241009009009009, + "grad_norm": 45.18635940551758, + "learning_rate": 9.324604934305911e-06, + "loss": 11.10751724243164, + "loss_alignment": 0.3740234375, + "loss_alignment_w": 0.18701171875, + "loss_sft": 0.5078794658184052, + "loss_total_v6": 0.6942197978496552, + "step": 209 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.024216216216216217, + "grad_norm": 42.962833404541016, + "learning_rate": 9.31628240478787e-06, + "loss": 10.475255012512207, + "loss_alignment": 0.3203125, + "loss_alignment_w": 0.16015625, + "loss_sft": 0.49463874101638794, + "loss_total_v6": 0.6547034382820129, + "step": 210 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02433153153153153, + "grad_norm": 34.284671783447266, + "learning_rate": 9.30791267309698e-06, + "loss": 10.402878761291504, + "loss_alignment": 0.373046875, + "loss_alignment_w": 0.1865234375, + "loss_sft": 0.4639005959033966, + "loss_total_v6": 0.6501799151301384, + "step": 211 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.024446846846846847, + "grad_norm": 39.562320709228516, + "learning_rate": 9.299495830763285e-06, + "loss": 9.979244232177734, + "loss_alignment": 0.30419921875, + "loss_alignment_w": 0.152099609375, + "loss_sft": 0.4716947227716446, + "loss_total_v6": 0.6237027794122696, + "step": 212 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02456216216216216, + "grad_norm": 38.065853118896484, + "learning_rate": 9.291031969832026e-06, + "loss": 10.602561950683594, + "loss_alignment": 0.34326171875, + "loss_alignment_w": 0.171630859375, + "loss_sft": 0.49060193449258804, + "loss_total_v6": 0.662660077214241, + "step": 213 + }, + { + "action_cond_aligned": 0.84375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.024677477477477477, + "grad_norm": 32.70936965942383, + "learning_rate": 9.28252118286263e-06, + "loss": 11.327253341674805, + "loss_alignment": 0.3896484375, + "loss_alignment_w": 0.19482421875, + "loss_sft": 0.5141056701540947, + "loss_total_v6": 0.7079533040523529, + "step": 214 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.024792792792792794, + "grad_norm": 34.60350799560547, + "learning_rate": 9.273963562927695e-06, + "loss": 10.880210876464844, + "loss_alignment": 0.3056640625, + "loss_alignment_w": 0.15283203125, + "loss_sft": 0.5267538502812386, + "loss_total_v6": 0.6800131499767303, + "step": 215 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.024908108108108108, + "grad_norm": 34.552921295166016, + "learning_rate": 9.265359203611988e-06, + "loss": 10.75362491607666, + "loss_alignment": 0.361328125, + "loss_alignment_w": 0.1806640625, + "loss_sft": 0.49113229662179947, + "loss_total_v6": 0.6721015274524689, + "step": 216 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.025023423423423424, + "grad_norm": 43.20185089111328, + "learning_rate": 9.256708199011402e-06, + "loss": 10.425251960754395, + "loss_alignment": 0.31298828125, + "loss_alignment_w": 0.156494140625, + "loss_sft": 0.49477897584438324, + "loss_total_v6": 0.651578277349472, + "step": 217 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.025138738738738738, + "grad_norm": 33.43575668334961, + "learning_rate": 9.248010643731936e-06, + "loss": 10.726112365722656, + "loss_alignment": 0.35107421875, + "loss_alignment_w": 0.175537109375, + "loss_sft": 0.4944176971912384, + "loss_total_v6": 0.6703820377588272, + "step": 218 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.025254054054054054, + "grad_norm": 34.91511154174805, + "learning_rate": 9.23926663288866e-06, + "loss": 9.569765090942383, + "loss_alignment": 0.3046875, + "loss_alignment_w": 0.15234375, + "loss_sft": 0.44558345526456833, + "loss_total_v6": 0.5981103032827377, + "step": 219 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.025369369369369368, + "grad_norm": 37.04256820678711, + "learning_rate": 9.230476262104678e-06, + "loss": 11.635795593261719, + "loss_alignment": 0.38232421875, + "loss_alignment_w": 0.191162109375, + "loss_sft": 0.5364413931965828, + "loss_total_v6": 0.727237269282341, + "step": 220 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.025484684684684684, + "grad_norm": 36.33439636230469, + "learning_rate": 9.221639627510076e-06, + "loss": 11.019021987915039, + "loss_alignment": 0.32958984375, + "loss_alignment_w": 0.164794921875, + "loss_sft": 0.5233446806669235, + "loss_total_v6": 0.6886889040470123, + "step": 221 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0256, + "grad_norm": 38.61065673828125, + "learning_rate": 9.212756825740874e-06, + "loss": 10.491334915161133, + "loss_alignment": 0.334228515625, + "loss_alignment_w": 0.1671142578125, + "loss_sft": 0.488502599298954, + "loss_total_v6": 0.655708409845829, + "step": 222 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.025715315315315315, + "grad_norm": 42.27479553222656, + "learning_rate": 9.203827953937969e-06, + "loss": 9.665157318115234, + "loss_alignment": 0.31005859375, + "loss_alignment_w": 0.155029296875, + "loss_sft": 0.44901251792907715, + "loss_total_v6": 0.604072317481041, + "step": 223 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02583063063063063, + "grad_norm": 32.744903564453125, + "learning_rate": 9.194853109746073e-06, + "loss": 10.714887619018555, + "loss_alignment": 0.329833984375, + "loss_alignment_w": 0.1649169921875, + "loss_sft": 0.5048244968056679, + "loss_total_v6": 0.6696804910898209, + "step": 224 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.025945945945945945, + "grad_norm": 35.33586502075195, + "learning_rate": 9.185832391312644e-06, + "loss": 10.573336601257324, + "loss_alignment": 0.3330078125, + "loss_alignment_w": 0.16650390625, + "loss_sft": 0.49417711794376373, + "loss_total_v6": 0.6608335673809052, + "step": 225 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02606126126126126, + "grad_norm": 33.29075241088867, + "learning_rate": 9.176765897286812e-06, + "loss": 10.447154998779297, + "loss_alignment": 0.327392578125, + "loss_alignment_w": 0.1636962890625, + "loss_sft": 0.48958657681941986, + "loss_total_v6": 0.6529471725225449, + "step": 226 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.026176576576576578, + "grad_norm": 46.57279586791992, + "learning_rate": 9.167653726818305e-06, + "loss": 10.186938285827637, + "loss_alignment": 0.3369140625, + "loss_alignment_w": 0.16845703125, + "loss_sft": 0.4680434465408325, + "loss_total_v6": 0.6366836428642273, + "step": 227 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02629189189189189, + "grad_norm": 32.392459869384766, + "learning_rate": 9.15849597955636e-06, + "loss": 10.247684478759766, + "loss_alignment": 0.35400390625, + "loss_alignment_w": 0.177001953125, + "loss_sft": 0.46372246742248535, + "loss_total_v6": 0.6404802948236465, + "step": 228 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.026407207207207208, + "grad_norm": 36.01199722290039, + "learning_rate": 9.149292755648631e-06, + "loss": 11.012960433959961, + "loss_alignment": 0.32861328125, + "loss_alignment_w": 0.164306640625, + "loss_sft": 0.5241864621639252, + "loss_total_v6": 0.688309982419014, + "step": 229 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02652252252252252, + "grad_norm": 32.043766021728516, + "learning_rate": 9.140044155740102e-06, + "loss": 10.943845748901367, + "loss_alignment": 0.37646484375, + "loss_alignment_w": 0.188232421875, + "loss_sft": 0.49520864337682724, + "loss_total_v6": 0.6839903593063354, + "step": 230 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02663783783783784, + "grad_norm": 38.27821350097656, + "learning_rate": 9.130750280971978e-06, + "loss": 10.356667518615723, + "loss_alignment": 0.32666015625, + "loss_alignment_w": 0.163330078125, + "loss_sft": 0.4846024662256241, + "loss_total_v6": 0.6472917199134827, + "step": 231 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02675315315315315, + "grad_norm": 37.10710525512695, + "learning_rate": 9.121411232980589e-06, + "loss": 10.612457275390625, + "loss_alignment": 0.3427734375, + "loss_alignment_w": 0.17138671875, + "loss_sft": 0.49222756922245026, + "loss_total_v6": 0.6632786244153976, + "step": 232 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02686846846846847, + "grad_norm": 35.520870208740234, + "learning_rate": 9.112027113896262e-06, + "loss": 10.737728118896484, + "loss_alignment": 0.32763671875, + "loss_alignment_w": 0.163818359375, + "loss_sft": 0.5071980655193329, + "loss_total_v6": 0.6711080074310303, + "step": 233 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.026983783783783785, + "grad_norm": 38.37420654296875, + "learning_rate": 9.102598026342223e-06, + "loss": 9.938348770141602, + "loss_alignment": 0.3466796875, + "loss_alignment_w": 0.17333984375, + "loss_sft": 0.4483562856912613, + "loss_total_v6": 0.6211468130350113, + "step": 234 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0270990990990991, + "grad_norm": 36.605472564697266, + "learning_rate": 9.093124073433464e-06, + "loss": 10.7322359085083, + "loss_alignment": 0.33447265625, + "loss_alignment_w": 0.167236328125, + "loss_sft": 0.5030706971883774, + "loss_total_v6": 0.6707647740840912, + "step": 235 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.027214414414414415, + "grad_norm": 36.70407485961914, + "learning_rate": 9.083605358775612e-06, + "loss": 9.757039070129395, + "loss_alignment": 0.307861328125, + "loss_alignment_w": 0.1539306640625, + "loss_sft": 0.4559147506952286, + "loss_total_v6": 0.6098149418830872, + "step": 236 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02732972972972973, + "grad_norm": 39.597904205322266, + "learning_rate": 9.074041986463808e-06, + "loss": 9.064135551452637, + "loss_alignment": 0.283203125, + "loss_alignment_w": 0.1416015625, + "loss_sft": 0.4249679297208786, + "loss_total_v6": 0.5665084570646286, + "step": 237 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.027445045045045045, + "grad_norm": 39.10135269165039, + "learning_rate": 9.064434061081562e-06, + "loss": 10.10378360748291, + "loss_alignment": 0.32666015625, + "loss_alignment_w": 0.163330078125, + "loss_sft": 0.46873628348112106, + "loss_total_v6": 0.6314864903688431, + "step": 238 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02756036036036036, + "grad_norm": 33.99856948852539, + "learning_rate": 9.0547816876996e-06, + "loss": 10.316468238830566, + "loss_alignment": 0.30126953125, + "loss_alignment_w": 0.150634765625, + "loss_sft": 0.4937783256173134, + "loss_total_v6": 0.6447792798280716, + "step": 239 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.027675675675675675, + "grad_norm": 41.684303283691406, + "learning_rate": 9.045084971874738e-06, + "loss": 9.935555458068848, + "loss_alignment": 0.330078125, + "loss_alignment_w": 0.1650390625, + "loss_sft": 0.4559026509523392, + "loss_total_v6": 0.6209722310304642, + "step": 240 + }, + { + "action_cond_aligned": 0.5625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.027790990990990992, + "grad_norm": 33.343658447265625, + "learning_rate": 9.035344019648701e-06, + "loss": 9.05201530456543, + "loss_alignment": 0.239990234375, + "loss_alignment_w": 0.1199951171875, + "loss_sft": 0.44563373178243637, + "loss_total_v6": 0.565750926733017, + "step": 241 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.027906306306306305, + "grad_norm": 35.62724685668945, + "learning_rate": 9.025558937546987e-06, + "loss": 10.321231842041016, + "loss_alignment": 0.3408203125, + "loss_alignment_w": 0.17041015625, + "loss_sft": 0.47509413212537766, + "loss_total_v6": 0.6450770348310471, + "step": 242 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.028021621621621622, + "grad_norm": 36.483009338378906, + "learning_rate": 9.015729832577681e-06, + "loss": 11.130064010620117, + "loss_alignment": 0.3388671875, + "loss_alignment_w": 0.16943359375, + "loss_sft": 0.5262259915471077, + "loss_total_v6": 0.6956290304660797, + "step": 243 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.028136936936936936, + "grad_norm": 36.61176300048828, + "learning_rate": 9.005856812230304e-06, + "loss": 11.053373336791992, + "loss_alignment": 0.37109375, + "loss_alignment_w": 0.185546875, + "loss_sft": 0.5053805261850357, + "loss_total_v6": 0.6908358335494995, + "step": 244 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.028252252252252252, + "grad_norm": 38.782562255859375, + "learning_rate": 8.995939984474624e-06, + "loss": 10.276103973388672, + "loss_alignment": 0.3212890625, + "loss_alignment_w": 0.16064453125, + "loss_sft": 0.4818866476416588, + "loss_total_v6": 0.642256498336792, + "step": 245 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02836756756756757, + "grad_norm": 35.59376525878906, + "learning_rate": 8.98597945775948e-06, + "loss": 10.661823272705078, + "loss_alignment": 0.32763671875, + "loss_alignment_w": 0.163818359375, + "loss_sft": 0.502881333231926, + "loss_total_v6": 0.6663639694452286, + "step": 246 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.028482882882882882, + "grad_norm": 31.881046295166016, + "learning_rate": 8.975975341011595e-06, + "loss": 10.26231575012207, + "loss_alignment": 0.302490234375, + "loss_alignment_w": 0.1512451171875, + "loss_sft": 0.4902716875076294, + "loss_total_v6": 0.6413946896791458, + "step": 247 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0285981981981982, + "grad_norm": 31.35333251953125, + "learning_rate": 8.96592774363439e-06, + "loss": 10.431207656860352, + "loss_alignment": 0.2939453125, + "loss_alignment_w": 0.14697265625, + "loss_sft": 0.5046726390719414, + "loss_total_v6": 0.651950478553772, + "step": 248 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.028713513513513512, + "grad_norm": 32.88202667236328, + "learning_rate": 8.955836775506776e-06, + "loss": 10.49549388885498, + "loss_alignment": 0.3193359375, + "loss_alignment_w": 0.15966796875, + "loss_sft": 0.4960867613554001, + "loss_total_v6": 0.6559683531522751, + "step": 249 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02882882882882883, + "grad_norm": 36.97794723510742, + "learning_rate": 8.94570254698197e-06, + "loss": 10.152398109436035, + "loss_alignment": 0.3037109375, + "loss_alignment_w": 0.15185546875, + "loss_sft": 0.4828830361366272, + "loss_total_v6": 0.6345248818397522, + "step": 250 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.028944144144144143, + "grad_norm": 32.46168518066406, + "learning_rate": 8.935525168886263e-06, + "loss": 10.256977081298828, + "loss_alignment": 0.317138671875, + "loss_alignment_w": 0.1585693359375, + "loss_sft": 0.4827053174376488, + "loss_total_v6": 0.6410610377788544, + "step": 251 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02905945945945946, + "grad_norm": 37.58749008178711, + "learning_rate": 8.92530475251784e-06, + "loss": 9.572423934936523, + "loss_alignment": 0.306640625, + "loss_alignment_w": 0.1533203125, + "loss_sft": 0.4447731301188469, + "loss_total_v6": 0.5982765406370163, + "step": 252 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.029174774774774776, + "grad_norm": 34.528987884521484, + "learning_rate": 8.91504140964553e-06, + "loss": 10.132831573486328, + "loss_alignment": 0.270263671875, + "loss_alignment_w": 0.1351318359375, + "loss_sft": 0.4983227774500847, + "loss_total_v6": 0.6333020180463791, + "step": 253 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02929009009009009, + "grad_norm": 35.28181838989258, + "learning_rate": 8.90473525250761e-06, + "loss": 9.94505500793457, + "loss_alignment": 0.2861328125, + "loss_alignment_w": 0.14306640625, + "loss_sft": 0.47868259251117706, + "loss_total_v6": 0.6215658932924271, + "step": 254 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.029405405405405406, + "grad_norm": 30.795907974243164, + "learning_rate": 8.894386393810563e-06, + "loss": 10.24649429321289, + "loss_alignment": 0.2783203125, + "loss_alignment_w": 0.13916015625, + "loss_sft": 0.5016424208879471, + "loss_total_v6": 0.6404058635234833, + "step": 255 + }, + { + "action_cond_aligned": 0.84375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.02952072072072072, + "grad_norm": 37.66702651977539, + "learning_rate": 8.883994946727848e-06, + "loss": 10.230026245117188, + "loss_alignment": 0.353515625, + "loss_alignment_w": 0.1767578125, + "loss_sft": 0.46313754469156265, + "loss_total_v6": 0.6393765956163406, + "step": 256 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.029636036036036036, + "grad_norm": 32.8068962097168, + "learning_rate": 8.873561024898668e-06, + "loss": 10.957551956176758, + "loss_alignment": 0.35009765625, + "loss_alignment_w": 0.175048828125, + "loss_sft": 0.5094929859042168, + "loss_total_v6": 0.6848469972610474, + "step": 257 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.029751351351351353, + "grad_norm": 38.322654724121094, + "learning_rate": 8.863084742426719e-06, + "loss": 9.882150650024414, + "loss_alignment": 0.30126953125, + "loss_alignment_w": 0.150634765625, + "loss_sft": 0.4670301452279091, + "loss_total_v6": 0.6176344007253647, + "step": 258 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.029866666666666666, + "grad_norm": 35.2371711730957, + "learning_rate": 8.852566213878947e-06, + "loss": 10.244927406311035, + "loss_alignment": 0.2861328125, + "loss_alignment_w": 0.14306640625, + "loss_sft": 0.4975467845797539, + "loss_total_v6": 0.6403079777956009, + "step": 259 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.029981981981981983, + "grad_norm": 33.12450408935547, + "learning_rate": 8.842005554284296e-06, + "loss": 10.832182884216309, + "loss_alignment": 0.3427734375, + "loss_alignment_w": 0.17138671875, + "loss_sft": 0.5052890032529831, + "loss_total_v6": 0.6770114004611969, + "step": 260 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.030097297297297296, + "grad_norm": 33.73298645019531, + "learning_rate": 8.831402879132447e-06, + "loss": 9.977575302124023, + "loss_alignment": 0.33154296875, + "loss_alignment_w": 0.165771484375, + "loss_sft": 0.45813213288784027, + "loss_total_v6": 0.6235984414815903, + "step": 261 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.030212612612612613, + "grad_norm": 36.5324592590332, + "learning_rate": 8.820758304372557e-06, + "loss": 10.143705368041992, + "loss_alignment": 0.29638671875, + "loss_alignment_w": 0.148193359375, + "loss_sft": 0.4853304773569107, + "loss_total_v6": 0.6339815855026245, + "step": 262 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.030327927927927927, + "grad_norm": 32.37842559814453, + "learning_rate": 8.810071946411989e-06, + "loss": 10.731255531311035, + "loss_alignment": 0.34228515625, + "loss_alignment_w": 0.171142578125, + "loss_sft": 0.4992251917719841, + "loss_total_v6": 0.6707035005092621, + "step": 263 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.030443243243243243, + "grad_norm": 34.01800537109375, + "learning_rate": 8.799343922115045e-06, + "loss": 10.55971622467041, + "loss_alignment": 0.323974609375, + "loss_alignment_w": 0.1619873046875, + "loss_sft": 0.4986053332686424, + "loss_total_v6": 0.6599822640419006, + "step": 264 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03055855855855856, + "grad_norm": 32.39742660522461, + "learning_rate": 8.788574348801676e-06, + "loss": 10.139873504638672, + "loss_alignment": 0.3310546875, + "loss_alignment_w": 0.16552734375, + "loss_sft": 0.4687640517950058, + "loss_total_v6": 0.6337421089410782, + "step": 265 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.030673873873873873, + "grad_norm": 38.63645553588867, + "learning_rate": 8.777763344246209e-06, + "loss": 9.669636726379395, + "loss_alignment": 0.28662109375, + "loss_alignment_w": 0.143310546875, + "loss_sft": 0.46140794456005096, + "loss_total_v6": 0.6043522953987122, + "step": 266 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03078918918918919, + "grad_norm": 33.50242614746094, + "learning_rate": 8.766911026676063e-06, + "loss": 10.658174514770508, + "loss_alignment": 0.3095703125, + "loss_alignment_w": 0.15478515625, + "loss_sft": 0.5113202705979347, + "loss_total_v6": 0.6661359220743179, + "step": 267 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.030904504504504503, + "grad_norm": 36.408111572265625, + "learning_rate": 8.756017514770444e-06, + "loss": 9.530118942260742, + "loss_alignment": 0.284912109375, + "loss_alignment_w": 0.1424560546875, + "loss_sft": 0.453420527279377, + "loss_total_v6": 0.5956324189901352, + "step": 268 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03101981981981982, + "grad_norm": 36.977481842041016, + "learning_rate": 8.745082927659048e-06, + "loss": 10.082154273986816, + "loss_alignment": 0.32275390625, + "loss_alignment_w": 0.161376953125, + "loss_sft": 0.4688492566347122, + "loss_total_v6": 0.6301346272230148, + "step": 269 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.031135135135135134, + "grad_norm": 35.56598663330078, + "learning_rate": 8.734107384920771e-06, + "loss": 10.38624382019043, + "loss_alignment": 0.33154296875, + "loss_alignment_w": 0.165771484375, + "loss_sft": 0.48294151574373245, + "loss_total_v6": 0.6491402387619019, + "step": 270 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.031250450450450454, + "grad_norm": 42.082279205322266, + "learning_rate": 8.72309100658239e-06, + "loss": 9.923840522766113, + "loss_alignment": 0.306640625, + "loss_alignment_w": 0.1533203125, + "loss_sft": 0.46637044101953506, + "loss_total_v6": 0.6202400624752045, + "step": 271 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03136576576576577, + "grad_norm": 36.033164978027344, + "learning_rate": 8.71203391311725e-06, + "loss": 10.778310775756836, + "loss_alignment": 0.33056640625, + "loss_alignment_w": 0.165283203125, + "loss_sft": 0.5079034268856049, + "loss_total_v6": 0.6736443936824799, + "step": 272 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03148108108108108, + "grad_norm": 35.704593658447266, + "learning_rate": 8.700936225443958e-06, + "loss": 11.274166107177734, + "loss_alignment": 0.30810546875, + "loss_alignment_w": 0.154052734375, + "loss_sft": 0.5507352352142334, + "loss_total_v6": 0.7046353816986084, + "step": 273 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.031596396396396394, + "grad_norm": 31.606006622314453, + "learning_rate": 8.689798064925049e-06, + "loss": 10.181005477905273, + "loss_alignment": 0.32666015625, + "loss_alignment_w": 0.163330078125, + "loss_sft": 0.4726775288581848, + "loss_total_v6": 0.636312797665596, + "step": 274 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.031711711711711714, + "grad_norm": 37.10310745239258, + "learning_rate": 8.67861955336566e-06, + "loss": 9.420589447021484, + "loss_alignment": 0.294921875, + "loss_alignment_w": 0.1474609375, + "loss_sft": 0.4412037953734398, + "loss_total_v6": 0.5887868255376816, + "step": 275 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03182702702702703, + "grad_norm": 41.7866096496582, + "learning_rate": 8.6674008130122e-06, + "loss": 9.544770240783691, + "loss_alignment": 0.271240234375, + "loss_alignment_w": 0.1356201171875, + "loss_sft": 0.4616604521870613, + "loss_total_v6": 0.5965481400489807, + "step": 276 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03194234234234234, + "grad_norm": 33.76570510864258, + "learning_rate": 8.65614196655102e-06, + "loss": 9.939787864685059, + "loss_alignment": 0.31787109375, + "loss_alignment_w": 0.158935546875, + "loss_sft": 0.46208760887384415, + "loss_total_v6": 0.6212367415428162, + "step": 277 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03205765765765766, + "grad_norm": 39.1094970703125, + "learning_rate": 8.644843137107058e-06, + "loss": 11.158384323120117, + "loss_alignment": 0.33544921875, + "loss_alignment_w": 0.167724609375, + "loss_sft": 0.5304067805409431, + "loss_total_v6": 0.6973990350961685, + "step": 278 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.032172972972972974, + "grad_norm": 40.201454162597656, + "learning_rate": 8.633504448242504e-06, + "loss": 10.18044662475586, + "loss_alignment": 0.2861328125, + "loss_alignment_w": 0.14306640625, + "loss_sft": 0.4930894002318382, + "loss_total_v6": 0.6362778842449188, + "step": 279 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03228828828828829, + "grad_norm": 33.74076843261719, + "learning_rate": 8.622126023955446e-06, + "loss": 10.00650405883789, + "loss_alignment": 0.30859375, + "loss_alignment_w": 0.154296875, + "loss_sft": 0.4709875285625458, + "loss_total_v6": 0.6254064738750458, + "step": 280 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0324036036036036, + "grad_norm": 37.57029724121094, + "learning_rate": 8.610707988678504e-06, + "loss": 10.078147888183594, + "loss_alignment": 0.2919921875, + "loss_alignment_w": 0.14599609375, + "loss_sft": 0.48370499908924103, + "loss_total_v6": 0.6298842132091522, + "step": 281 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03251891891891892, + "grad_norm": 35.0482177734375, + "learning_rate": 8.599250467277483e-06, + "loss": 10.973350524902344, + "loss_alignment": 0.34716796875, + "loss_alignment_w": 0.173583984375, + "loss_sft": 0.5121894106268883, + "loss_total_v6": 0.6858344078063965, + "step": 282 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.032634234234234234, + "grad_norm": 31.248044967651367, + "learning_rate": 8.587753585050004e-06, + "loss": 10.228967666625977, + "loss_alignment": 0.35107421875, + "loss_alignment_w": 0.175537109375, + "loss_sft": 0.46380389481782913, + "loss_total_v6": 0.6393104791641235, + "step": 283 + }, + { + "action_cond_aligned": 0.859375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03274954954954955, + "grad_norm": 44.05198669433594, + "learning_rate": 8.576217467724129e-06, + "loss": 10.634648323059082, + "loss_alignment": 0.3681640625, + "loss_alignment_w": 0.18408203125, + "loss_sft": 0.48094963282346725, + "loss_total_v6": 0.6646655052900314, + "step": 284 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03286486486486487, + "grad_norm": 35.767547607421875, + "learning_rate": 8.564642241456986e-06, + "loss": 10.258331298828125, + "loss_alignment": 0.31689453125, + "loss_alignment_w": 0.158447265625, + "loss_sft": 0.48254579305648804, + "loss_total_v6": 0.6411456763744354, + "step": 285 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03298018018018018, + "grad_norm": 32.57012939453125, + "learning_rate": 8.553028032833397e-06, + "loss": 9.504171371459961, + "loss_alignment": 0.28076171875, + "loss_alignment_w": 0.140380859375, + "loss_sft": 0.45359934121370316, + "loss_total_v6": 0.5940107256174088, + "step": 286 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.033095495495495494, + "grad_norm": 38.456214904785156, + "learning_rate": 8.541374968864486e-06, + "loss": 10.588327407836914, + "loss_alignment": 0.306640625, + "loss_alignment_w": 0.1533203125, + "loss_sft": 0.5086333006620407, + "loss_total_v6": 0.6617704778909683, + "step": 287 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03321081081081081, + "grad_norm": 31.68507194519043, + "learning_rate": 8.529683176986295e-06, + "loss": 9.611595153808594, + "loss_alignment": 0.2666015625, + "loss_alignment_w": 0.13330078125, + "loss_sft": 0.4674544855952263, + "loss_total_v6": 0.6007247418165207, + "step": 288 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03332612612612613, + "grad_norm": 34.039215087890625, + "learning_rate": 8.517952785058385e-06, + "loss": 10.441686630249023, + "loss_alignment": 0.31103515625, + "loss_alignment_w": 0.155517578125, + "loss_sft": 0.49669114500284195, + "loss_total_v6": 0.6526053994894028, + "step": 289 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03344144144144144, + "grad_norm": 31.856386184692383, + "learning_rate": 8.506183921362443e-06, + "loss": 9.696606636047363, + "loss_alignment": 0.30908203125, + "loss_alignment_w": 0.154541015625, + "loss_sft": 0.4514358788728714, + "loss_total_v6": 0.6060379147529602, + "step": 290 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.033556756756756755, + "grad_norm": 30.155492782592773, + "learning_rate": 8.494376714600878e-06, + "loss": 10.707985877990723, + "loss_alignment": 0.30419921875, + "loss_alignment_w": 0.152099609375, + "loss_sft": 0.5169053748250008, + "loss_total_v6": 0.6692491322755814, + "step": 291 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.033672072072072075, + "grad_norm": 33.37957000732422, + "learning_rate": 8.482531293895412e-06, + "loss": 10.462789535522461, + "loss_alignment": 0.32568359375, + "loss_alignment_w": 0.162841796875, + "loss_sft": 0.4913267269730568, + "loss_total_v6": 0.653924360871315, + "step": 292 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03378738738738739, + "grad_norm": 35.15346908569336, + "learning_rate": 8.470647788785665e-06, + "loss": 9.807063102722168, + "loss_alignment": 0.280517578125, + "loss_alignment_w": 0.1402587890625, + "loss_sft": 0.4724690318107605, + "loss_total_v6": 0.6129414588212967, + "step": 293 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0339027027027027, + "grad_norm": 33.984928131103516, + "learning_rate": 8.458726329227748e-06, + "loss": 9.524442672729492, + "loss_alignment": 0.30859375, + "loss_alignment_w": 0.154296875, + "loss_sft": 0.44128599762916565, + "loss_total_v6": 0.5952776670455933, + "step": 294 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.034018018018018015, + "grad_norm": 36.36509323120117, + "learning_rate": 8.446767045592829e-06, + "loss": 10.22340202331543, + "loss_alignment": 0.30810546875, + "loss_alignment_w": 0.154052734375, + "loss_sft": 0.4854286462068558, + "loss_total_v6": 0.638962596654892, + "step": 295 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.034133333333333335, + "grad_norm": 35.08005905151367, + "learning_rate": 8.434770068665723e-06, + "loss": 10.456308364868164, + "loss_alignment": 0.3232421875, + "loss_alignment_w": 0.16162109375, + "loss_sft": 0.49131835252046585, + "loss_total_v6": 0.6535192877054214, + "step": 296 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03424864864864865, + "grad_norm": 38.423484802246094, + "learning_rate": 8.422735529643445e-06, + "loss": 10.456151008605957, + "loss_alignment": 0.318359375, + "loss_alignment_w": 0.1591796875, + "loss_sft": 0.4939635694026947, + "loss_total_v6": 0.6535094380378723, + "step": 297 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03436396396396396, + "grad_norm": 34.82440948486328, + "learning_rate": 8.410663560133784e-06, + "loss": 9.361818313598633, + "loss_alignment": 0.27099609375, + "loss_alignment_w": 0.135498046875, + "loss_sft": 0.44946303218603134, + "loss_total_v6": 0.5851136595010757, + "step": 298 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03447927927927928, + "grad_norm": 34.82002639770508, + "learning_rate": 8.398554292153866e-06, + "loss": 10.014408111572266, + "loss_alignment": 0.31201171875, + "loss_alignment_w": 0.156005859375, + "loss_sft": 0.470077782869339, + "loss_total_v6": 0.6259005069732666, + "step": 299 + }, + { + "action_cond_aligned": 0.609375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.034594594594594595, + "grad_norm": 37.579185485839844, + "learning_rate": 8.386407858128707e-06, + "loss": 9.457788467407227, + "loss_alignment": 0.27099609375, + "loss_alignment_w": 0.135498046875, + "loss_sft": 0.45561371743679047, + "loss_total_v6": 0.5911117643117905, + "step": 300 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03470990990990991, + "grad_norm": 35.55014419555664, + "learning_rate": 8.37422439088976e-06, + "loss": 11.175882339477539, + "loss_alignment": 0.34912109375, + "loss_alignment_w": 0.174560546875, + "loss_sft": 0.5240236520767212, + "loss_total_v6": 0.698492631316185, + "step": 301 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03482522522522523, + "grad_norm": 30.25316047668457, + "learning_rate": 8.362004023673473e-06, + "loss": 10.541275024414062, + "loss_alignment": 0.32421875, + "loss_alignment_w": 0.162109375, + "loss_sft": 0.4971780627965927, + "loss_total_v6": 0.6588296741247177, + "step": 302 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03494054054054054, + "grad_norm": 32.615257263183594, + "learning_rate": 8.349746890119826e-06, + "loss": 9.831146240234375, + "loss_alignment": 0.306640625, + "loss_alignment_w": 0.1533203125, + "loss_sft": 0.4613400027155876, + "loss_total_v6": 0.6144466698169708, + "step": 303 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.035055855855855855, + "grad_norm": 45.79723358154297, + "learning_rate": 8.337453124270864e-06, + "loss": 9.205963134765625, + "loss_alignment": 0.291015625, + "loss_alignment_w": 0.1455078125, + "loss_sft": 0.4296512007713318, + "loss_total_v6": 0.575372651219368, + "step": 304 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03517117117117117, + "grad_norm": 34.758644104003906, + "learning_rate": 8.325122860569241e-06, + "loss": 9.852325439453125, + "loss_alignment": 0.275390625, + "loss_alignment_w": 0.1376953125, + "loss_sft": 0.47844117134809494, + "loss_total_v6": 0.6157703250646591, + "step": 305 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03528648648648649, + "grad_norm": 33.743919372558594, + "learning_rate": 8.31275623385675e-06, + "loss": 10.026254653930664, + "loss_alignment": 0.296142578125, + "loss_alignment_w": 0.1480712890625, + "loss_sft": 0.4787832722067833, + "loss_total_v6": 0.6266409158706665, + "step": 306 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0354018018018018, + "grad_norm": 34.002479553222656, + "learning_rate": 8.300353379372834e-06, + "loss": 9.740594863891602, + "loss_alignment": 0.30517578125, + "loss_alignment_w": 0.152587890625, + "loss_sft": 0.4555584415793419, + "loss_total_v6": 0.6087871789932251, + "step": 307 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.035517117117117115, + "grad_norm": 37.664852142333984, + "learning_rate": 8.287914432753123e-06, + "loss": 10.204620361328125, + "loss_alignment": 0.305908203125, + "loss_alignment_w": 0.1529541015625, + "loss_sft": 0.4850788339972496, + "loss_total_v6": 0.6377888023853302, + "step": 308 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.035632432432432436, + "grad_norm": 33.027854919433594, + "learning_rate": 8.275439530027948e-06, + "loss": 10.150879859924316, + "loss_alignment": 0.295654296875, + "loss_alignment_w": 0.1478271484375, + "loss_sft": 0.4866028353571892, + "loss_total_v6": 0.634430006146431, + "step": 309 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03574774774774775, + "grad_norm": 43.220947265625, + "learning_rate": 8.262928807620843e-06, + "loss": 10.848834991455078, + "loss_alignment": 0.337890625, + "loss_alignment_w": 0.1689453125, + "loss_sft": 0.5091068893671036, + "loss_total_v6": 0.6780521720647812, + "step": 310 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03586306306306306, + "grad_norm": 33.95647430419922, + "learning_rate": 8.250382402347066e-06, + "loss": 9.952128410339355, + "loss_alignment": 0.29541015625, + "loss_alignment_w": 0.147705078125, + "loss_sft": 0.47424185276031494, + "loss_total_v6": 0.6220079958438873, + "step": 311 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.035978378378378376, + "grad_norm": 32.44717788696289, + "learning_rate": 8.237800451412095e-06, + "loss": 9.738142967224121, + "loss_alignment": 0.274658203125, + "loss_alignment_w": 0.1373291015625, + "loss_sft": 0.47103019058704376, + "loss_total_v6": 0.6086339354515076, + "step": 312 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.036093693693693696, + "grad_norm": 35.7349967956543, + "learning_rate": 8.225183092410128e-06, + "loss": 9.611570358276367, + "loss_alignment": 0.30078125, + "loss_alignment_w": 0.150390625, + "loss_sft": 0.45024097710847855, + "loss_total_v6": 0.6007231771945953, + "step": 313 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03620900900900901, + "grad_norm": 36.69313430786133, + "learning_rate": 8.212530463322584e-06, + "loss": 9.060304641723633, + "loss_alignment": 0.2374267578125, + "loss_alignment_w": 0.11871337890625, + "loss_sft": 0.44749459624290466, + "loss_total_v6": 0.5662690252065659, + "step": 314 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03632432432432432, + "grad_norm": 38.485599517822266, + "learning_rate": 8.199842702516584e-06, + "loss": 9.944281578063965, + "loss_alignment": 0.31005859375, + "loss_alignment_w": 0.155029296875, + "loss_sft": 0.466396726667881, + "loss_total_v6": 0.6215175837278366, + "step": 315 + }, + { + "action_cond_aligned": 0.84375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03643963963963964, + "grad_norm": 32.75215148925781, + "learning_rate": 8.18711994874345e-06, + "loss": 10.488309860229492, + "loss_alignment": 0.3408203125, + "loss_alignment_w": 0.17041015625, + "loss_sft": 0.48507872223854065, + "loss_total_v6": 0.6555193960666656, + "step": 316 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.036554954954954956, + "grad_norm": 32.61997604370117, + "learning_rate": 8.174362341137177e-06, + "loss": 9.78361701965332, + "loss_alignment": 0.278076171875, + "loss_alignment_w": 0.1390380859375, + "loss_sft": 0.47246847301721573, + "loss_total_v6": 0.6114760488271713, + "step": 317 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03667027027027027, + "grad_norm": 32.93280792236328, + "learning_rate": 8.161570019212921e-06, + "loss": 10.002171516418457, + "loss_alignment": 0.322265625, + "loss_alignment_w": 0.1611328125, + "loss_sft": 0.464277520775795, + "loss_total_v6": 0.6251357197761536, + "step": 318 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03678558558558558, + "grad_norm": 65.05309295654297, + "learning_rate": 8.148743122865463e-06, + "loss": 8.556910514831543, + "loss_alignment": 0.267333984375, + "loss_alignment_w": 0.1336669921875, + "loss_sft": 0.400773748755455, + "loss_total_v6": 0.534806914627552, + "step": 319 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0369009009009009, + "grad_norm": 35.470802307128906, + "learning_rate": 8.135881792367686e-06, + "loss": 8.77038288116455, + "loss_alignment": 0.29052734375, + "loss_alignment_w": 0.145263671875, + "loss_sft": 0.40315988659858704, + "loss_total_v6": 0.5481489449739456, + "step": 320 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.037016216216216216, + "grad_norm": 34.0860595703125, + "learning_rate": 8.12298616836904e-06, + "loss": 9.929081916809082, + "loss_alignment": 0.294921875, + "loss_alignment_w": 0.1474609375, + "loss_sft": 0.47328981757164, + "loss_total_v6": 0.6205676198005676, + "step": 321 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03713153153153153, + "grad_norm": 35.60441207885742, + "learning_rate": 8.110056391894005e-06, + "loss": 9.549202919006348, + "loss_alignment": 0.28857421875, + "loss_alignment_w": 0.144287109375, + "loss_sft": 0.45287375152111053, + "loss_total_v6": 0.5968251675367355, + "step": 322 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03724684684684685, + "grad_norm": 33.82248306274414, + "learning_rate": 8.097092604340543e-06, + "loss": 10.603633880615234, + "loss_alignment": 0.3037109375, + "loss_alignment_w": 0.15185546875, + "loss_sft": 0.5109326615929604, + "loss_total_v6": 0.6627270877361298, + "step": 323 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03736216216216216, + "grad_norm": 34.8277702331543, + "learning_rate": 8.084094947478556e-06, + "loss": 9.547247886657715, + "loss_alignment": 0.28564453125, + "loss_alignment_w": 0.142822265625, + "loss_sft": 0.4538196921348572, + "loss_total_v6": 0.5967029929161072, + "step": 324 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.037477477477477476, + "grad_norm": 34.07522201538086, + "learning_rate": 8.071063563448341e-06, + "loss": 10.153743743896484, + "loss_alignment": 0.307861328125, + "loss_alignment_w": 0.1539306640625, + "loss_sft": 0.48080041259527206, + "loss_total_v6": 0.6346089765429497, + "step": 325 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03759279279279279, + "grad_norm": 35.187835693359375, + "learning_rate": 8.057998594759022e-06, + "loss": 9.25355052947998, + "loss_alignment": 0.28857421875, + "loss_alignment_w": 0.144287109375, + "loss_sft": 0.43427347391843796, + "loss_total_v6": 0.5783469080924988, + "step": 326 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03770810810810811, + "grad_norm": 32.712703704833984, + "learning_rate": 8.044900184287007e-06, + "loss": 10.020336151123047, + "loss_alignment": 0.282958984375, + "loss_alignment_w": 0.1414794921875, + "loss_sft": 0.48460838943719864, + "loss_total_v6": 0.6262710094451904, + "step": 327 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03782342342342342, + "grad_norm": 32.42856216430664, + "learning_rate": 8.031768475274412e-06, + "loss": 10.19295883178711, + "loss_alignment": 0.32470703125, + "loss_alignment_w": 0.162353515625, + "loss_sft": 0.47437071055173874, + "loss_total_v6": 0.6370599418878555, + "step": 328 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.037938738738738736, + "grad_norm": 36.935951232910156, + "learning_rate": 8.018603611327505e-06, + "loss": 9.388998031616211, + "loss_alignment": 0.2607421875, + "loss_alignment_w": 0.13037109375, + "loss_sft": 0.4565938636660576, + "loss_total_v6": 0.5868123769760132, + "step": 329 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03805405405405406, + "grad_norm": 34.35771942138672, + "learning_rate": 8.005405736415127e-06, + "loss": 9.453032493591309, + "loss_alignment": 0.306640625, + "loss_alignment_w": 0.1533203125, + "loss_sft": 0.4368228539824486, + "loss_total_v6": 0.5908145308494568, + "step": 330 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03816936936936937, + "grad_norm": 33.83060073852539, + "learning_rate": 7.992174994867124e-06, + "loss": 10.309258460998535, + "loss_alignment": 0.3232421875, + "loss_alignment_w": 0.16162109375, + "loss_sft": 0.48261599987745285, + "loss_total_v6": 0.6443286389112473, + "step": 331 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03828468468468468, + "grad_norm": 41.970001220703125, + "learning_rate": 7.978911531372764e-06, + "loss": 9.8212890625, + "loss_alignment": 0.250732421875, + "loss_alignment_w": 0.1253662109375, + "loss_sft": 0.488403283059597, + "loss_total_v6": 0.61383056640625, + "step": 332 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0384, + "grad_norm": 31.397130966186523, + "learning_rate": 7.965615490979165e-06, + "loss": 10.138473510742188, + "loss_alignment": 0.3115234375, + "loss_alignment_w": 0.15576171875, + "loss_sft": 0.47847268730401993, + "loss_total_v6": 0.6336545944213867, + "step": 333 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03851531531531532, + "grad_norm": 32.351749420166016, + "learning_rate": 7.952287019089686e-06, + "loss": 9.782791137695312, + "loss_alignment": 0.29541015625, + "loss_alignment_w": 0.147705078125, + "loss_sft": 0.46362780779600143, + "loss_total_v6": 0.6114244610071182, + "step": 334 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03863063063063063, + "grad_norm": 28.297449111938477, + "learning_rate": 7.938926261462366e-06, + "loss": 10.81993293762207, + "loss_alignment": 0.3349609375, + "loss_alignment_w": 0.16748046875, + "loss_sft": 0.5082465186715126, + "loss_total_v6": 0.6762457638978958, + "step": 335 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.038745945945945943, + "grad_norm": 30.349931716918945, + "learning_rate": 7.925533364208308e-06, + "loss": 9.920637130737305, + "loss_alignment": 0.302734375, + "loss_alignment_w": 0.1513671875, + "loss_sft": 0.46864207834005356, + "loss_total_v6": 0.6200398057699203, + "step": 336 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.038861261261261264, + "grad_norm": 31.351621627807617, + "learning_rate": 7.912108473790092e-06, + "loss": 9.988248825073242, + "loss_alignment": 0.26953125, + "loss_alignment_w": 0.134765625, + "loss_sft": 0.48949991911649704, + "loss_total_v6": 0.6242655366659164, + "step": 337 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03897657657657658, + "grad_norm": 36.10573196411133, + "learning_rate": 7.898651737020166e-06, + "loss": 10.771095275878906, + "loss_alignment": 0.306640625, + "loss_alignment_w": 0.1533203125, + "loss_sft": 0.5192933604121208, + "loss_total_v6": 0.673193484544754, + "step": 338 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03909189189189189, + "grad_norm": 33.84638977050781, + "learning_rate": 7.885163301059251e-06, + "loss": 10.304464340209961, + "loss_alignment": 0.24609375, + "loss_alignment_w": 0.123046875, + "loss_sft": 0.5207990184426308, + "loss_total_v6": 0.6440290212631226, + "step": 339 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03920720720720721, + "grad_norm": 33.05794906616211, + "learning_rate": 7.871643313414718e-06, + "loss": 9.993268966674805, + "loss_alignment": 0.28369140625, + "loss_alignment_w": 0.141845703125, + "loss_sft": 0.4826725199818611, + "loss_total_v6": 0.6245792955160141, + "step": 340 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.039322522522522524, + "grad_norm": 33.355472564697266, + "learning_rate": 7.858091921938989e-06, + "loss": 9.82764720916748, + "loss_alignment": 0.2822265625, + "loss_alignment_w": 0.14111328125, + "loss_sft": 0.47271788120269775, + "loss_total_v6": 0.6142279207706451, + "step": 341 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03943783783783784, + "grad_norm": 36.060489654541016, + "learning_rate": 7.844509274827907e-06, + "loss": 10.352829933166504, + "loss_alignment": 0.31689453125, + "loss_alignment_w": 0.158447265625, + "loss_sft": 0.4885741397738457, + "loss_total_v6": 0.6470519006252289, + "step": 342 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03955315315315315, + "grad_norm": 36.43827438354492, + "learning_rate": 7.830895520619129e-06, + "loss": 9.915433883666992, + "loss_alignment": 0.306396484375, + "loss_alignment_w": 0.1531982421875, + "loss_sft": 0.4670657515525818, + "loss_total_v6": 0.6197146624326706, + "step": 343 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.03966846846846847, + "grad_norm": 33.290306091308594, + "learning_rate": 7.817250808190483e-06, + "loss": 10.290292739868164, + "loss_alignment": 0.294921875, + "loss_alignment_w": 0.1474609375, + "loss_sft": 0.49556027352809906, + "loss_total_v6": 0.6431432962417603, + "step": 344 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.039783783783783784, + "grad_norm": 36.0533447265625, + "learning_rate": 7.803575286758365e-06, + "loss": 9.497026443481445, + "loss_alignment": 0.28173828125, + "loss_alignment_w": 0.140869140625, + "loss_sft": 0.45300018042325974, + "loss_total_v6": 0.5935641974210739, + "step": 345 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0398990990990991, + "grad_norm": 35.08295440673828, + "learning_rate": 7.789869105876083e-06, + "loss": 9.352834701538086, + "loss_alignment": 0.2841796875, + "loss_alignment_w": 0.14208984375, + "loss_sft": 0.44243183732032776, + "loss_total_v6": 0.5845522060990334, + "step": 346 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04001441441441442, + "grad_norm": 34.24534606933594, + "learning_rate": 7.776132415432234e-06, + "loss": 9.764751434326172, + "loss_alignment": 0.303466796875, + "loss_alignment_w": 0.1517333984375, + "loss_sft": 0.45816684514284134, + "loss_total_v6": 0.6102969273924828, + "step": 347 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04012972972972973, + "grad_norm": 31.711904525756836, + "learning_rate": 7.762365365649068e-06, + "loss": 9.191326141357422, + "loss_alignment": 0.273681640625, + "loss_alignment_w": 0.1368408203125, + "loss_sft": 0.43722040951251984, + "loss_total_v6": 0.5744579285383224, + "step": 348 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.040245045045045044, + "grad_norm": 33.50541305541992, + "learning_rate": 7.748568107080831e-06, + "loss": 9.836718559265137, + "loss_alignment": 0.287109375, + "loss_alignment_w": 0.1435546875, + "loss_sft": 0.47099608182907104, + "loss_total_v6": 0.614794909954071, + "step": 349 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04036036036036036, + "grad_norm": 36.90428161621094, + "learning_rate": 7.734740790612137e-06, + "loss": 9.939472198486328, + "loss_alignment": 0.27294921875, + "loss_alignment_w": 0.136474609375, + "loss_sft": 0.4845288097858429, + "loss_total_v6": 0.6212170571088791, + "step": 350 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04047567567567568, + "grad_norm": 33.363258361816406, + "learning_rate": 7.720883567456299e-06, + "loss": 9.745265007019043, + "loss_alignment": 0.296875, + "loss_alignment_w": 0.1484375, + "loss_sft": 0.46061109751462936, + "loss_total_v6": 0.6090790629386902, + "step": 351 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04059099099099099, + "grad_norm": 32.44856643676758, + "learning_rate": 7.70699658915369e-06, + "loss": 10.273038864135742, + "loss_alignment": 0.33935546875, + "loss_alignment_w": 0.169677734375, + "loss_sft": 0.4722651019692421, + "loss_total_v6": 0.6420649290084839, + "step": 352 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.040706306306306304, + "grad_norm": 33.79998016357422, + "learning_rate": 7.693080007570084e-06, + "loss": 9.501867294311523, + "loss_alignment": 0.263427734375, + "loss_alignment_w": 0.1317138671875, + "loss_sft": 0.4620918035507202, + "loss_total_v6": 0.5938667058944702, + "step": 353 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.040821621621621625, + "grad_norm": 32.95574951171875, + "learning_rate": 7.679133974894984e-06, + "loss": 9.640528678894043, + "loss_alignment": 0.30322265625, + "loss_alignment_w": 0.151611328125, + "loss_sft": 0.4508606791496277, + "loss_total_v6": 0.6025330424308777, + "step": 354 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04093693693693694, + "grad_norm": 33.72992706298828, + "learning_rate": 7.66515864363997e-06, + "loss": 9.877306938171387, + "loss_alignment": 0.294189453125, + "loss_alignment_w": 0.1470947265625, + "loss_sft": 0.47017592191696167, + "loss_total_v6": 0.6173316836357117, + "step": 355 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04105225225225225, + "grad_norm": 34.86708450317383, + "learning_rate": 7.651154166637025e-06, + "loss": 9.412878036499023, + "loss_alignment": 0.27880859375, + "loss_alignment_w": 0.139404296875, + "loss_sft": 0.4493277743458748, + "loss_total_v6": 0.5883048325777054, + "step": 356 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.041167567567567565, + "grad_norm": 32.26172637939453, + "learning_rate": 7.637120697036866e-06, + "loss": 10.489726066589355, + "loss_alignment": 0.3447265625, + "loss_alignment_w": 0.17236328125, + "loss_sft": 0.4833666905760765, + "loss_total_v6": 0.6556079089641571, + "step": 357 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.041282882882882885, + "grad_norm": 30.10211181640625, + "learning_rate": 7.62305838830727e-06, + "loss": 9.782981872558594, + "loss_alignment": 0.27783203125, + "loss_alignment_w": 0.138916015625, + "loss_sft": 0.4723982438445091, + "loss_total_v6": 0.6114363372325897, + "step": 358 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0413981981981982, + "grad_norm": 34.27760696411133, + "learning_rate": 7.608967394231387e-06, + "loss": 10.526490211486816, + "loss_alignment": 0.2880859375, + "loss_alignment_w": 0.14404296875, + "loss_sft": 0.5139847695827484, + "loss_total_v6": 0.6579056531190872, + "step": 359 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04151351351351351, + "grad_norm": 34.36589050292969, + "learning_rate": 7.594847868906076e-06, + "loss": 9.087697982788086, + "loss_alignment": 0.267822265625, + "loss_alignment_w": 0.1339111328125, + "loss_sft": 0.43428361415863037, + "loss_total_v6": 0.5679811239242554, + "step": 360 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04162882882882883, + "grad_norm": 30.88846778869629, + "learning_rate": 7.580699966740201e-06, + "loss": 10.140052795410156, + "loss_alignment": 0.2900390625, + "loss_alignment_w": 0.14501953125, + "loss_sft": 0.48861169815063477, + "loss_total_v6": 0.6337532997131348, + "step": 361 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.041744144144144145, + "grad_norm": 31.07417869567871, + "learning_rate": 7.566523842452958e-06, + "loss": 9.131248474121094, + "loss_alignment": 0.2685546875, + "loss_alignment_w": 0.13427734375, + "loss_sft": 0.43636471033096313, + "loss_total_v6": 0.5707030743360519, + "step": 362 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04185945945945946, + "grad_norm": 32.31984329223633, + "learning_rate": 7.552319651072164e-06, + "loss": 10.510178565979004, + "loss_alignment": 0.281982421875, + "loss_alignment_w": 0.1409912109375, + "loss_sft": 0.5154981762170792, + "loss_total_v6": 0.6568861454725266, + "step": 363 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04197477477477477, + "grad_norm": 32.3032341003418, + "learning_rate": 7.5380875479325855e-06, + "loss": 8.797342300415039, + "loss_alignment": 0.249267578125, + "loss_alignment_w": 0.1246337890625, + "loss_sft": 0.42532214522361755, + "loss_total_v6": 0.5498338788747787, + "step": 364 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04209009009009009, + "grad_norm": 29.81424331665039, + "learning_rate": 7.52382768867422e-06, + "loss": 9.891196250915527, + "loss_alignment": 0.298828125, + "loss_alignment_w": 0.1494140625, + "loss_sft": 0.46841948479413986, + "loss_total_v6": 0.6181997656822205, + "step": 365 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.042205405405405405, + "grad_norm": 34.14840316772461, + "learning_rate": 7.509540229240601e-06, + "loss": 9.679933547973633, + "loss_alignment": 0.260986328125, + "loss_alignment_w": 0.1304931640625, + "loss_sft": 0.47468575090169907, + "loss_total_v6": 0.6049958169460297, + "step": 366 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04232072072072072, + "grad_norm": 30.323518753051758, + "learning_rate": 7.4952253258771036e-06, + "loss": 9.501544952392578, + "loss_alignment": 0.2880859375, + "loss_alignment_w": 0.14404296875, + "loss_sft": 0.44995612651109695, + "loss_total_v6": 0.5938465446233749, + "step": 367 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04243603603603604, + "grad_norm": 33.0410041809082, + "learning_rate": 7.480883135129211e-06, + "loss": 10.30534839630127, + "loss_alignment": 0.29248046875, + "loss_alignment_w": 0.146240234375, + "loss_sft": 0.49753890186548233, + "loss_total_v6": 0.6440843045711517, + "step": 368 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04255135135135135, + "grad_norm": 33.90877151489258, + "learning_rate": 7.4665138138408255e-06, + "loss": 9.718826293945312, + "loss_alignment": 0.298583984375, + "loss_alignment_w": 0.1492919921875, + "loss_sft": 0.45822618901729584, + "loss_total_v6": 0.6074266359210014, + "step": 369 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.042666666666666665, + "grad_norm": 31.8975830078125, + "learning_rate": 7.452117519152542e-06, + "loss": 9.204017639160156, + "loss_alignment": 0.262939453125, + "loss_alignment_w": 0.1314697265625, + "loss_sft": 0.4439644515514374, + "loss_total_v6": 0.5752510875463486, + "step": 370 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04278198198198198, + "grad_norm": 37.203189849853516, + "learning_rate": 7.437694408499932e-06, + "loss": 9.52830982208252, + "loss_alignment": 0.28271484375, + "loss_alignment_w": 0.141357421875, + "loss_sft": 0.45407038927078247, + "loss_total_v6": 0.5955193638801575, + "step": 371 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0428972972972973, + "grad_norm": 36.3126106262207, + "learning_rate": 7.4232446396118265e-06, + "loss": 9.652877807617188, + "loss_alignment": 0.3037109375, + "loss_alignment_w": 0.15185546875, + "loss_sft": 0.4517545849084854, + "loss_total_v6": 0.6033048778772354, + "step": 372 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04301261261261261, + "grad_norm": 37.854530334472656, + "learning_rate": 7.408768370508577e-06, + "loss": 9.92282485961914, + "loss_alignment": 0.297119140625, + "loss_alignment_w": 0.1485595703125, + "loss_sft": 0.4715254679322243, + "loss_total_v6": 0.6201765984296799, + "step": 373 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.043127927927927925, + "grad_norm": 32.494911193847656, + "learning_rate": 7.394265759500348e-06, + "loss": 9.584494590759277, + "loss_alignment": 0.29248046875, + "loss_alignment_w": 0.146240234375, + "loss_sft": 0.45346205681562424, + "loss_total_v6": 0.5990309119224548, + "step": 374 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.043243243243243246, + "grad_norm": 31.910978317260742, + "learning_rate": 7.379736965185369e-06, + "loss": 9.215009689331055, + "loss_alignment": 0.267822265625, + "loss_alignment_w": 0.1339111328125, + "loss_sft": 0.44217950850725174, + "loss_total_v6": 0.5759380608797073, + "step": 375 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04335855855855856, + "grad_norm": 30.96079444885254, + "learning_rate": 7.365182146448205e-06, + "loss": 9.51463508605957, + "loss_alignment": 0.26220703125, + "loss_alignment_w": 0.131103515625, + "loss_sft": 0.46331707388162613, + "loss_total_v6": 0.5946647226810455, + "step": 376 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04347387387387387, + "grad_norm": 36.995601654052734, + "learning_rate": 7.350601462458025e-06, + "loss": 9.53437614440918, + "loss_alignment": 0.27685546875, + "loss_alignment_w": 0.138427734375, + "loss_sft": 0.45786744356155396, + "loss_total_v6": 0.5958984792232513, + "step": 377 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04358918918918919, + "grad_norm": 34.72509002685547, + "learning_rate": 7.335995072666848e-06, + "loss": 9.625704765319824, + "loss_alignment": 0.285400390625, + "loss_alignment_w": 0.1427001953125, + "loss_sft": 0.45869269222021103, + "loss_total_v6": 0.6016065329313278, + "step": 378 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.043704504504504506, + "grad_norm": 32.527523040771484, + "learning_rate": 7.3213631368078196e-06, + "loss": 10.617846488952637, + "loss_alignment": 0.30908203125, + "loss_alignment_w": 0.154541015625, + "loss_sft": 0.5095626264810562, + "loss_total_v6": 0.6636154055595398, + "step": 379 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04381981981981982, + "grad_norm": 32.63654327392578, + "learning_rate": 7.30670581489344e-06, + "loss": 9.44723892211914, + "loss_alignment": 0.3203125, + "loss_alignment_w": 0.16015625, + "loss_sft": 0.4306318685412407, + "loss_total_v6": 0.5904524326324463, + "step": 380 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04393513513513513, + "grad_norm": 30.964580535888672, + "learning_rate": 7.292023267213836e-06, + "loss": 10.683540344238281, + "loss_alignment": 0.34326171875, + "loss_alignment_w": 0.171630859375, + "loss_sft": 0.4956021010875702, + "loss_total_v6": 0.667721226811409, + "step": 381 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04405045045045045, + "grad_norm": 32.35460662841797, + "learning_rate": 7.2773156543349965e-06, + "loss": 8.982898712158203, + "loss_alignment": 0.284423828125, + "loss_alignment_w": 0.1422119140625, + "loss_sft": 0.4190971329808235, + "loss_total_v6": 0.5614311248064041, + "step": 382 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.044165765765765766, + "grad_norm": 34.33378219604492, + "learning_rate": 7.262583137097019e-06, + "loss": 9.00016975402832, + "loss_alignment": 0.2685546875, + "loss_alignment_w": 0.13427734375, + "loss_sft": 0.42783648520708084, + "loss_total_v6": 0.5625105649232864, + "step": 383 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04428108108108108, + "grad_norm": 31.53550148010254, + "learning_rate": 7.247825876612353e-06, + "loss": 10.020842552185059, + "loss_alignment": 0.3056640625, + "loss_alignment_w": 0.15283203125, + "loss_sft": 0.4736842140555382, + "loss_total_v6": 0.6263026595115662, + "step": 384 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0443963963963964, + "grad_norm": 35.86270523071289, + "learning_rate": 7.233044034264034e-06, + "loss": 9.694149017333984, + "loss_alignment": 0.300048828125, + "loss_alignment_w": 0.1500244140625, + "loss_sft": 0.4559820666909218, + "loss_total_v6": 0.6058843582868576, + "step": 385 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04451171171171171, + "grad_norm": 33.89327621459961, + "learning_rate": 7.218237771703921e-06, + "loss": 9.013014793395996, + "loss_alignment": 0.241455078125, + "loss_alignment_w": 0.1207275390625, + "loss_sft": 0.44282998889684677, + "loss_total_v6": 0.5633133947849274, + "step": 386 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.044627027027027026, + "grad_norm": 35.83552169799805, + "learning_rate": 7.203407250850929e-06, + "loss": 9.473045349121094, + "loss_alignment": 0.294921875, + "loss_alignment_w": 0.1474609375, + "loss_sft": 0.44494011998176575, + "loss_total_v6": 0.5920653641223907, + "step": 387 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04474234234234234, + "grad_norm": 33.305015563964844, + "learning_rate": 7.18855263388926e-06, + "loss": 10.135141372680664, + "loss_alignment": 0.31396484375, + "loss_alignment_w": 0.156982421875, + "loss_sft": 0.4761282205581665, + "loss_total_v6": 0.6334463357925415, + "step": 388 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04485765765765766, + "grad_norm": 34.85303497314453, + "learning_rate": 7.173674083266624e-06, + "loss": 10.25771713256836, + "loss_alignment": 0.28515625, + "loss_alignment_w": 0.142578125, + "loss_sft": 0.49859023094177246, + "loss_total_v6": 0.6411073356866837, + "step": 389 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04497297297297297, + "grad_norm": 35.01792907714844, + "learning_rate": 7.158771761692464e-06, + "loss": 9.629278182983398, + "loss_alignment": 0.251220703125, + "loss_alignment_w": 0.1256103515625, + "loss_sft": 0.4765552207827568, + "loss_total_v6": 0.601829893887043, + "step": 390 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.045088288288288286, + "grad_norm": 37.930885314941406, + "learning_rate": 7.143845832136188e-06, + "loss": 10.044387817382812, + "loss_alignment": 0.3115234375, + "loss_alignment_w": 0.15576171875, + "loss_sft": 0.4719514846801758, + "loss_total_v6": 0.6277742385864258, + "step": 391 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.045203603603603607, + "grad_norm": 32.19792175292969, + "learning_rate": 7.128896457825364e-06, + "loss": 10.234847068786621, + "loss_alignment": 0.322265625, + "loss_alignment_w": 0.1611328125, + "loss_sft": 0.478178970515728, + "loss_total_v6": 0.6396779417991638, + "step": 392 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04531891891891892, + "grad_norm": 34.658992767333984, + "learning_rate": 7.113923802243957e-06, + "loss": 9.545734405517578, + "loss_alignment": 0.27734375, + "loss_alignment_w": 0.138671875, + "loss_sft": 0.4577534645795822, + "loss_total_v6": 0.5966084226965904, + "step": 393 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04543423423423423, + "grad_norm": 34.57074737548828, + "learning_rate": 7.098928029130529e-06, + "loss": 9.29569149017334, + "loss_alignment": 0.2666015625, + "loss_alignment_w": 0.13330078125, + "loss_sft": 0.44774100184440613, + "loss_total_v6": 0.5809807181358337, + "step": 394 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.045549549549549546, + "grad_norm": 36.43103790283203, + "learning_rate": 7.083909302476453e-06, + "loss": 9.454570770263672, + "loss_alignment": 0.270263671875, + "loss_alignment_w": 0.1351318359375, + "loss_sft": 0.4557177796959877, + "loss_total_v6": 0.5909106731414795, + "step": 395 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04566486486486487, + "grad_norm": 35.501949310302734, + "learning_rate": 7.068867786524116e-06, + "loss": 9.467187881469727, + "loss_alignment": 0.274658203125, + "loss_alignment_w": 0.1373291015625, + "loss_sft": 0.4540039598941803, + "loss_total_v6": 0.5916992798447609, + "step": 396 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04578018018018018, + "grad_norm": 32.60951232910156, + "learning_rate": 7.053803645765128e-06, + "loss": 8.853612899780273, + "loss_alignment": 0.2578125, + "loss_alignment_w": 0.12890625, + "loss_sft": 0.4245971664786339, + "loss_total_v6": 0.5533508136868477, + "step": 397 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04589549549549549, + "grad_norm": 34.34212112426758, + "learning_rate": 7.038717044938519e-06, + "loss": 10.379289627075195, + "loss_alignment": 0.298583984375, + "loss_alignment_w": 0.1492919921875, + "loss_sft": 0.4990779310464859, + "loss_total_v6": 0.6487056016921997, + "step": 398 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.046010810810810814, + "grad_norm": 33.82075881958008, + "learning_rate": 7.023608149028936e-06, + "loss": 10.514364242553711, + "loss_alignment": 0.31884765625, + "loss_alignment_w": 0.159423828125, + "loss_sft": 0.49812060594558716, + "loss_total_v6": 0.6571477502584457, + "step": 399 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04612612612612613, + "grad_norm": 35.156700134277344, + "learning_rate": 7.008477123264849e-06, + "loss": 10.501453399658203, + "loss_alignment": 0.27783203125, + "loss_alignment_w": 0.138916015625, + "loss_sft": 0.5174553468823433, + "loss_total_v6": 0.6563408374786377, + "step": 400 + }, + { + "action_cond_aligned": 0.84375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04624144144144144, + "grad_norm": 31.170303344726562, + "learning_rate": 6.993324133116726e-06, + "loss": 10.574359893798828, + "loss_alignment": 0.33642578125, + "loss_alignment_w": 0.168212890625, + "loss_sft": 0.49210478365421295, + "loss_total_v6": 0.6608974784612656, + "step": 401 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04635675675675675, + "grad_norm": 33.113887786865234, + "learning_rate": 6.978149344295242e-06, + "loss": 9.683165550231934, + "loss_alignment": 0.30810546875, + "loss_alignment_w": 0.154052734375, + "loss_sft": 0.45087043941020966, + "loss_total_v6": 0.6051978468894958, + "step": 402 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.046472072072072074, + "grad_norm": 35.79157638549805, + "learning_rate": 6.9629529227494575e-06, + "loss": 9.961891174316406, + "loss_alignment": 0.295654296875, + "loss_alignment_w": 0.1478271484375, + "loss_sft": 0.4743333011865616, + "loss_total_v6": 0.622618243098259, + "step": 403 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04658738738738739, + "grad_norm": 35.9149284362793, + "learning_rate": 6.9477350346650016e-06, + "loss": 10.16866683959961, + "loss_alignment": 0.32763671875, + "loss_alignment_w": 0.163818359375, + "loss_sft": 0.471601277589798, + "loss_total_v6": 0.635541707277298, + "step": 404 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0467027027027027, + "grad_norm": 29.79302406311035, + "learning_rate": 6.932495846462262e-06, + "loss": 9.498800277709961, + "loss_alignment": 0.2841796875, + "loss_alignment_w": 0.14208984375, + "loss_sft": 0.45170721411705017, + "loss_total_v6": 0.5936750024557114, + "step": 405 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04681801801801802, + "grad_norm": 31.171092987060547, + "learning_rate": 6.9172355247945586e-06, + "loss": 10.752296447753906, + "loss_alignment": 0.3134765625, + "loss_alignment_w": 0.15673828125, + "loss_sft": 0.5156769752502441, + "loss_total_v6": 0.6720185428857803, + "step": 406 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.046933333333333334, + "grad_norm": 33.696388244628906, + "learning_rate": 6.901954236546324e-06, + "loss": 9.621747016906738, + "loss_alignment": 0.32373046875, + "loss_alignment_w": 0.161865234375, + "loss_sft": 0.43928032368421555, + "loss_total_v6": 0.6013591885566711, + "step": 407 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04704864864864865, + "grad_norm": 29.60081672668457, + "learning_rate": 6.88665214883128e-06, + "loss": 9.337503433227539, + "loss_alignment": 0.28759765625, + "loss_alignment_w": 0.143798828125, + "loss_sft": 0.43964245915412903, + "loss_total_v6": 0.5835939347743988, + "step": 408 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04716396396396397, + "grad_norm": 30.998920440673828, + "learning_rate": 6.871329428990602e-06, + "loss": 10.591838836669922, + "loss_alignment": 0.2978515625, + "loss_alignment_w": 0.14892578125, + "loss_sft": 0.5132472515106201, + "loss_total_v6": 0.6619898825883865, + "step": 409 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04727927927927928, + "grad_norm": 33.37436294555664, + "learning_rate": 6.855986244591104e-06, + "loss": 10.302848815917969, + "loss_alignment": 0.29296875, + "loss_alignment_w": 0.146484375, + "loss_sft": 0.49713851511478424, + "loss_total_v6": 0.6439280807971954, + "step": 410 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.047394594594594594, + "grad_norm": 35.697994232177734, + "learning_rate": 6.840622763423391e-06, + "loss": 9.812016487121582, + "loss_alignment": 0.276611328125, + "loss_alignment_w": 0.1383056640625, + "loss_sft": 0.4750979468226433, + "loss_total_v6": 0.6132510453462601, + "step": 411 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04750990990990991, + "grad_norm": 37.782676696777344, + "learning_rate": 6.825239153500029e-06, + "loss": 9.085599899291992, + "loss_alignment": 0.28173828125, + "loss_alignment_w": 0.140869140625, + "loss_sft": 0.4266452118754387, + "loss_total_v6": 0.5678500458598137, + "step": 412 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04762522522522523, + "grad_norm": 34.81962203979492, + "learning_rate": 6.809835583053716e-06, + "loss": 9.812963485717773, + "loss_alignment": 0.3173828125, + "loss_alignment_w": 0.15869140625, + "loss_sft": 0.45425255596637726, + "loss_total_v6": 0.6133101880550385, + "step": 413 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04774054054054054, + "grad_norm": 33.26197052001953, + "learning_rate": 6.794412220535426e-06, + "loss": 9.39256477355957, + "loss_alignment": 0.269775390625, + "loss_alignment_w": 0.1348876953125, + "loss_sft": 0.45181190222501755, + "loss_total_v6": 0.587035283446312, + "step": 414 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.047855855855855854, + "grad_norm": 32.26844787597656, + "learning_rate": 6.778969234612583e-06, + "loss": 9.60873031616211, + "loss_alignment": 0.267578125, + "loss_alignment_w": 0.1337890625, + "loss_sft": 0.46654292941093445, + "loss_total_v6": 0.6005456149578094, + "step": 415 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.047971171171171174, + "grad_norm": 32.35195541381836, + "learning_rate": 6.763506794167207e-06, + "loss": 9.886505126953125, + "loss_alignment": 0.249755859375, + "loss_alignment_w": 0.1248779296875, + "loss_sft": 0.49321169406175613, + "loss_total_v6": 0.6179065406322479, + "step": 416 + }, + { + "action_cond_aligned": 0.59375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04808648648648649, + "grad_norm": 34.68537521362305, + "learning_rate": 6.748025068294067e-06, + "loss": 9.086755752563477, + "loss_alignment": 0.24365234375, + "loss_alignment_w": 0.121826171875, + "loss_sft": 0.4457298219203949, + "loss_total_v6": 0.5679222270846367, + "step": 417 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0482018018018018, + "grad_norm": 33.69749069213867, + "learning_rate": 6.732524226298841e-06, + "loss": 10.805288314819336, + "loss_alignment": 0.298583984375, + "loss_alignment_w": 0.1492919921875, + "loss_sft": 0.5268014892935753, + "loss_total_v6": 0.6753305345773697, + "step": 418 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.048317117117117114, + "grad_norm": 41.97480010986328, + "learning_rate": 6.717004437696249e-06, + "loss": 9.64705753326416, + "loss_alignment": 0.2900390625, + "loss_alignment_w": 0.14501953125, + "loss_sft": 0.4578605517745018, + "loss_total_v6": 0.6029411107301712, + "step": 419 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.048432432432432435, + "grad_norm": 34.10530471801758, + "learning_rate": 6.701465872208216e-06, + "loss": 8.65408706665039, + "loss_alignment": 0.251953125, + "loss_alignment_w": 0.1259765625, + "loss_sft": 0.4149344116449356, + "loss_total_v6": 0.5408804789185524, + "step": 420 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04854774774774775, + "grad_norm": 35.08158874511719, + "learning_rate": 6.685908699762003e-06, + "loss": 9.676810264587402, + "loss_alignment": 0.2939453125, + "loss_alignment_w": 0.14697265625, + "loss_sft": 0.45801112055778503, + "loss_total_v6": 0.6048006564378738, + "step": 421 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04866306306306306, + "grad_norm": 32.79195785522461, + "learning_rate": 6.670333090488357e-06, + "loss": 9.798166275024414, + "loss_alignment": 0.302490234375, + "loss_alignment_w": 0.1512451171875, + "loss_sft": 0.4612318128347397, + "loss_total_v6": 0.6123853474855423, + "step": 422 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04877837837837838, + "grad_norm": 31.945999145507812, + "learning_rate": 6.654739214719642e-06, + "loss": 9.984371185302734, + "loss_alignment": 0.2744140625, + "loss_alignment_w": 0.13720703125, + "loss_sft": 0.4864500015974045, + "loss_total_v6": 0.6240232288837433, + "step": 423 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.048893693693693695, + "grad_norm": 32.89323043823242, + "learning_rate": 6.6391272429879886e-06, + "loss": 10.328266143798828, + "loss_alignment": 0.3017578125, + "loss_alignment_w": 0.15087890625, + "loss_sft": 0.49436306208372116, + "loss_total_v6": 0.6455166190862656, + "step": 424 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04900900900900901, + "grad_norm": 31.15265655517578, + "learning_rate": 6.6234973460234184e-06, + "loss": 9.649938583374023, + "loss_alignment": 0.284423828125, + "loss_alignment_w": 0.1422119140625, + "loss_sft": 0.46066509187221527, + "loss_total_v6": 0.6031211316585541, + "step": 425 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04912432432432432, + "grad_norm": 32.648555755615234, + "learning_rate": 6.607849694751978e-06, + "loss": 9.112993240356445, + "loss_alignment": 0.289306640625, + "loss_alignment_w": 0.1446533203125, + "loss_sft": 0.4249393194913864, + "loss_total_v6": 0.5695621222257614, + "step": 426 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04923963963963964, + "grad_norm": 46.65313720703125, + "learning_rate": 6.592184460293878e-06, + "loss": 8.93709659576416, + "loss_alignment": 0.281982421875, + "loss_alignment_w": 0.1409912109375, + "loss_sft": 0.41766882687807083, + "loss_total_v6": 0.5585685074329376, + "step": 427 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.049354954954954955, + "grad_norm": 33.783573150634766, + "learning_rate": 6.576501813961609e-06, + "loss": 10.600584030151367, + "loss_alignment": 0.35498046875, + "loss_alignment_w": 0.177490234375, + "loss_sft": 0.4851072207093239, + "loss_total_v6": 0.6625364571809769, + "step": 428 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04947027027027027, + "grad_norm": 33.12092590332031, + "learning_rate": 6.560801927258081e-06, + "loss": 9.811582565307617, + "loss_alignment": 0.287109375, + "loss_alignment_w": 0.1435546875, + "loss_sft": 0.4696081727743149, + "loss_total_v6": 0.6132238805294037, + "step": 429 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04958558558558559, + "grad_norm": 35.86348342895508, + "learning_rate": 6.545084971874738e-06, + "loss": 9.667715072631836, + "loss_alignment": 0.288330078125, + "loss_alignment_w": 0.1441650390625, + "loss_sft": 0.46015871316194534, + "loss_total_v6": 0.6042321622371674, + "step": 430 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0497009009009009, + "grad_norm": 31.31944465637207, + "learning_rate": 6.529351119689687e-06, + "loss": 10.332385063171387, + "loss_alignment": 0.3017578125, + "loss_alignment_w": 0.15087890625, + "loss_sft": 0.49541397392749786, + "loss_total_v6": 0.6457740813493729, + "step": 431 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.049816216216216215, + "grad_norm": 32.588165283203125, + "learning_rate": 6.513600542765816e-06, + "loss": 9.445343017578125, + "loss_alignment": 0.2607421875, + "loss_alignment_w": 0.13037109375, + "loss_sft": 0.4599323570728302, + "loss_total_v6": 0.5903339684009552, + "step": 432 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.04993153153153153, + "grad_norm": 34.86098098754883, + "learning_rate": 6.49783341334891e-06, + "loss": 8.722469329833984, + "loss_alignment": 0.2626953125, + "loss_alignment_w": 0.13134765625, + "loss_sft": 0.4135625511407852, + "loss_total_v6": 0.5451543480157852, + "step": 433 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05004684684684685, + "grad_norm": 33.18212127685547, + "learning_rate": 6.4820499038657695e-06, + "loss": 9.598309516906738, + "loss_alignment": 0.28955078125, + "loss_alignment_w": 0.144775390625, + "loss_sft": 0.45505794882774353, + "loss_total_v6": 0.5998943746089935, + "step": 434 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05016216216216216, + "grad_norm": 40.03548812866211, + "learning_rate": 6.466250186922325e-06, + "loss": 10.13766098022461, + "loss_alignment": 0.3037109375, + "loss_alignment_w": 0.15185546875, + "loss_sft": 0.4822366312146187, + "loss_total_v6": 0.6336038112640381, + "step": 435 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.050277477477477475, + "grad_norm": 29.86594009399414, + "learning_rate": 6.450434435301751e-06, + "loss": 8.91922378540039, + "loss_alignment": 0.248291015625, + "loss_alignment_w": 0.1241455078125, + "loss_sft": 0.4332450032234192, + "loss_total_v6": 0.5574515238404274, + "step": 436 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.050392792792792795, + "grad_norm": 35.169857025146484, + "learning_rate": 6.434602821962571e-06, + "loss": 9.251317024230957, + "loss_alignment": 0.2724609375, + "loss_alignment_w": 0.13623046875, + "loss_sft": 0.4413664638996124, + "loss_total_v6": 0.5782073065638542, + "step": 437 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05050810810810811, + "grad_norm": 35.48283386230469, + "learning_rate": 6.418755520036775e-06, + "loss": 9.390089988708496, + "loss_alignment": 0.263671875, + "loss_alignment_w": 0.1318359375, + "loss_sft": 0.4549226015806198, + "loss_total_v6": 0.5868806168437004, + "step": 438 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05062342342342342, + "grad_norm": 30.39046287536621, + "learning_rate": 6.402892702827916e-06, + "loss": 9.707295417785645, + "loss_alignment": 0.28662109375, + "loss_alignment_w": 0.143310546875, + "loss_sft": 0.4633649066090584, + "loss_total_v6": 0.6067059636116028, + "step": 439 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.050738738738738735, + "grad_norm": 34.22409439086914, + "learning_rate": 6.387014543809224e-06, + "loss": 9.506427764892578, + "loss_alignment": 0.279052734375, + "loss_alignment_w": 0.1395263671875, + "loss_sft": 0.45493054389953613, + "loss_total_v6": 0.5941517055034637, + "step": 440 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.050854054054054056, + "grad_norm": 35.57810974121094, + "learning_rate": 6.371121216621698e-06, + "loss": 8.696233749389648, + "loss_alignment": 0.253662109375, + "loss_alignment_w": 0.1268310546875, + "loss_sft": 0.41674453765153885, + "loss_total_v6": 0.5435145571827888, + "step": 441 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05096936936936937, + "grad_norm": 32.06644821166992, + "learning_rate": 6.355212895072223e-06, + "loss": 9.116069793701172, + "loss_alignment": 0.27587890625, + "loss_alignment_w": 0.137939453125, + "loss_sft": 0.4320896118879318, + "loss_total_v6": 0.5697543919086456, + "step": 442 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05108468468468468, + "grad_norm": 34.34067916870117, + "learning_rate": 6.339289753131649e-06, + "loss": 9.367443084716797, + "loss_alignment": 0.2705078125, + "loss_alignment_w": 0.13525390625, + "loss_sft": 0.4508216381072998, + "loss_total_v6": 0.585465207695961, + "step": 443 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0512, + "grad_norm": 33.25232696533203, + "learning_rate": 6.323351964932909e-06, + "loss": 10.007814407348633, + "loss_alignment": 0.294921875, + "loss_alignment_w": 0.1474609375, + "loss_sft": 0.47756970673799515, + "loss_total_v6": 0.6254884004592896, + "step": 444 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.051315315315315316, + "grad_norm": 60.21445083618164, + "learning_rate": 6.3073997047691e-06, + "loss": 10.198347091674805, + "loss_alignment": 0.2919921875, + "loss_alignment_w": 0.14599609375, + "loss_sft": 0.4911259487271309, + "loss_total_v6": 0.6373967230319977, + "step": 445 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05143063063063063, + "grad_norm": 30.103267669677734, + "learning_rate": 6.291433147091583e-06, + "loss": 9.873602867126465, + "loss_alignment": 0.265625, + "loss_alignment_w": 0.1328125, + "loss_sft": 0.48407401144504547, + "loss_total_v6": 0.6171001493930817, + "step": 446 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05154594594594595, + "grad_norm": 32.939483642578125, + "learning_rate": 6.275452466508076e-06, + "loss": 9.475296020507812, + "loss_alignment": 0.279052734375, + "loss_alignment_w": 0.1395263671875, + "loss_sft": 0.45252709090709686, + "loss_total_v6": 0.5922060161828995, + "step": 447 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05166126126126126, + "grad_norm": 33.19239044189453, + "learning_rate": 6.259457837780741e-06, + "loss": 9.320676803588867, + "loss_alignment": 0.27099609375, + "loss_alignment_w": 0.135498046875, + "loss_sft": 0.4469832181930542, + "loss_total_v6": 0.5825423002243042, + "step": 448 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.051776576576576576, + "grad_norm": 31.699495315551758, + "learning_rate": 6.243449435824276e-06, + "loss": 9.879303932189941, + "loss_alignment": 0.32080078125, + "loss_alignment_w": 0.160400390625, + "loss_sft": 0.45702558755874634, + "loss_total_v6": 0.6174565106630325, + "step": 449 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05189189189189189, + "grad_norm": 31.909278869628906, + "learning_rate": 6.227427435703997e-06, + "loss": 9.557882308959961, + "loss_alignment": 0.27880859375, + "loss_alignment_w": 0.139404296875, + "loss_sft": 0.45790230482816696, + "loss_total_v6": 0.5973676294088364, + "step": 450 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05200720720720721, + "grad_norm": 35.512325286865234, + "learning_rate": 6.211392012633932e-06, + "loss": 9.761823654174805, + "loss_alignment": 0.29052734375, + "loss_alignment_w": 0.145263671875, + "loss_sft": 0.4647892490029335, + "loss_total_v6": 0.6101139634847641, + "step": 451 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05212252252252252, + "grad_norm": 37.040382385253906, + "learning_rate": 6.1953433419748995e-06, + "loss": 9.607522010803223, + "loss_alignment": 0.258544921875, + "loss_alignment_w": 0.1292724609375, + "loss_sft": 0.4713502451777458, + "loss_total_v6": 0.600470095872879, + "step": 452 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.052237837837837836, + "grad_norm": 38.89727783203125, + "learning_rate": 6.179281599232592e-06, + "loss": 9.576112747192383, + "loss_alignment": 0.25439453125, + "loss_alignment_w": 0.127197265625, + "loss_sft": 0.47121821343898773, + "loss_total_v6": 0.5985070616006851, + "step": 453 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.052353153153153156, + "grad_norm": 37.20854187011719, + "learning_rate": 6.163206960055652e-06, + "loss": 9.956546783447266, + "loss_alignment": 0.291748046875, + "loss_alignment_w": 0.1458740234375, + "loss_sft": 0.4766542837023735, + "loss_total_v6": 0.6222841441631317, + "step": 454 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05246846846846847, + "grad_norm": 29.16712188720703, + "learning_rate": 6.147119600233758e-06, + "loss": 9.759676933288574, + "loss_alignment": 0.30126953125, + "loss_alignment_w": 0.150634765625, + "loss_sft": 0.4595586508512497, + "loss_total_v6": 0.6099797934293747, + "step": 455 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05258378378378378, + "grad_norm": 31.666332244873047, + "learning_rate": 6.131019695695702e-06, + "loss": 9.878437042236328, + "loss_alignment": 0.29833984375, + "loss_alignment_w": 0.149169921875, + "loss_sft": 0.4688732177019119, + "loss_total_v6": 0.6174023002386093, + "step": 456 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.052699099099099096, + "grad_norm": 42.176631927490234, + "learning_rate": 6.114907422507459e-06, + "loss": 9.98486614227295, + "loss_alignment": 0.2919921875, + "loss_alignment_w": 0.14599609375, + "loss_sft": 0.4783022329211235, + "loss_total_v6": 0.6240541487932205, + "step": 457 + }, + { + "action_cond_aligned": 0.625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.052814414414414416, + "grad_norm": 42.157440185546875, + "learning_rate": 6.098782956870266e-06, + "loss": 8.392984390258789, + "loss_alignment": 0.240234375, + "loss_alignment_w": 0.1201171875, + "loss_sft": 0.4045969396829605, + "loss_total_v6": 0.5245615318417549, + "step": 458 + }, + { + "action_cond_aligned": 0.640625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05292972972972973, + "grad_norm": 31.031883239746094, + "learning_rate": 6.0826464751187e-06, + "loss": 8.234847068786621, + "loss_alignment": 0.25537109375, + "loss_alignment_w": 0.127685546875, + "loss_sft": 0.38699236512184143, + "loss_total_v6": 0.514677919447422, + "step": 459 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05304504504504504, + "grad_norm": 33.809139251708984, + "learning_rate": 6.066498153718735e-06, + "loss": 8.893904685974121, + "loss_alignment": 0.28369140625, + "loss_alignment_w": 0.141845703125, + "loss_sft": 0.413809671998024, + "loss_total_v6": 0.5558690279722214, + "step": 460 + }, + { + "action_cond_aligned": 0.8125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05316036036036036, + "grad_norm": 33.02869415283203, + "learning_rate": 6.0503381692658305e-06, + "loss": 9.85838508605957, + "loss_alignment": 0.31787109375, + "loss_alignment_w": 0.158935546875, + "loss_sft": 0.45699983090162277, + "loss_total_v6": 0.6161490231752396, + "step": 461 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05327567567567568, + "grad_norm": 33.932186126708984, + "learning_rate": 6.034166698482984e-06, + "loss": 9.340078353881836, + "loss_alignment": 0.2607421875, + "loss_alignment_w": 0.13037109375, + "loss_sft": 0.45362796634435654, + "loss_total_v6": 0.5837549418210983, + "step": 462 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05339099099099099, + "grad_norm": 34.18378829956055, + "learning_rate": 6.0179839182188125e-06, + "loss": 9.462618827819824, + "loss_alignment": 0.27880859375, + "loss_alignment_w": 0.139404296875, + "loss_sft": 0.45210086554288864, + "loss_total_v6": 0.5914136618375778, + "step": 463 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0535063063063063, + "grad_norm": 30.728487014770508, + "learning_rate": 6.001790005445607e-06, + "loss": 9.158416748046875, + "loss_alignment": 0.274169921875, + "loss_alignment_w": 0.1370849609375, + "loss_sft": 0.43482785671949387, + "loss_total_v6": 0.5724010765552521, + "step": 464 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.053621621621621623, + "grad_norm": 30.622459411621094, + "learning_rate": 5.985585137257401e-06, + "loss": 9.843891143798828, + "loss_alignment": 0.266845703125, + "loss_alignment_w": 0.1334228515625, + "loss_sft": 0.48178987950086594, + "loss_total_v6": 0.6152432411909103, + "step": 465 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05373693693693694, + "grad_norm": 31.533998489379883, + "learning_rate": 5.969369490868042e-06, + "loss": 9.625146865844727, + "loss_alignment": 0.2919921875, + "loss_alignment_w": 0.14599609375, + "loss_sft": 0.4554535523056984, + "loss_total_v6": 0.601571723818779, + "step": 466 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05385225225225225, + "grad_norm": 32.22454071044922, + "learning_rate": 5.953143243609235e-06, + "loss": 8.965929985046387, + "loss_alignment": 0.257080078125, + "loss_alignment_w": 0.1285400390625, + "loss_sft": 0.43149492144584656, + "loss_total_v6": 0.5603706240653992, + "step": 467 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05396756756756757, + "grad_norm": 39.68070602416992, + "learning_rate": 5.936906572928625e-06, + "loss": 9.735218048095703, + "loss_alignment": 0.29638671875, + "loss_alignment_w": 0.148193359375, + "loss_sft": 0.45992207527160645, + "loss_total_v6": 0.6084510982036591, + "step": 468 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.054082882882882884, + "grad_norm": 33.844844818115234, + "learning_rate": 5.920659656387836e-06, + "loss": 10.54603385925293, + "loss_alignment": 0.315185546875, + "loss_alignment_w": 0.1575927734375, + "loss_sft": 0.5010765939950943, + "loss_total_v6": 0.6591271460056305, + "step": 469 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0541981981981982, + "grad_norm": 35.61857223510742, + "learning_rate": 5.904402671660551e-06, + "loss": 9.08084774017334, + "loss_alignment": 0.260986328125, + "loss_alignment_w": 0.1304931640625, + "loss_sft": 0.43715137243270874, + "loss_total_v6": 0.5675529688596725, + "step": 470 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05431351351351351, + "grad_norm": 31.638782501220703, + "learning_rate": 5.8881357965305444e-06, + "loss": 9.294387817382812, + "loss_alignment": 0.271484375, + "loss_alignment_w": 0.1357421875, + "loss_sft": 0.445858970284462, + "loss_total_v6": 0.5808992385864258, + "step": 471 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05442882882882883, + "grad_norm": 29.8742733001709, + "learning_rate": 5.871859208889759e-06, + "loss": 9.572266578674316, + "loss_alignment": 0.2734375, + "loss_alignment_w": 0.13671875, + "loss_sft": 0.46145638823509216, + "loss_total_v6": 0.598266676068306, + "step": 472 + }, + { + "action_cond_aligned": 0.671875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.054544144144144144, + "grad_norm": 39.086814880371094, + "learning_rate": 5.855573086736351e-06, + "loss": 9.546757698059082, + "loss_alignment": 0.24755859375, + "loss_alignment_w": 0.123779296875, + "loss_sft": 0.4726184010505676, + "loss_total_v6": 0.5966723710298538, + "step": 473 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05465945945945946, + "grad_norm": 33.72978210449219, + "learning_rate": 5.839277608172739e-06, + "loss": 10.002437591552734, + "loss_alignment": 0.298828125, + "loss_alignment_w": 0.1494140625, + "loss_sft": 0.4754025414586067, + "loss_total_v6": 0.6251523047685623, + "step": 474 + }, + { + "action_cond_aligned": 0.765625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05477477477477478, + "grad_norm": 28.788270950317383, + "learning_rate": 5.82297295140367e-06, + "loss": 9.527597427368164, + "loss_alignment": 0.275634765625, + "loss_alignment_w": 0.1378173828125, + "loss_sft": 0.45753537863492966, + "loss_total_v6": 0.5954748243093491, + "step": 475 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05489009009009009, + "grad_norm": 32.00693130493164, + "learning_rate": 5.806659294734256e-06, + "loss": 9.365909576416016, + "loss_alignment": 0.287109375, + "loss_alignment_w": 0.1435546875, + "loss_sft": 0.44218088686466217, + "loss_total_v6": 0.5853693336248398, + "step": 476 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.055005405405405404, + "grad_norm": 41.32118606567383, + "learning_rate": 5.790336816568033e-06, + "loss": 9.344276428222656, + "loss_alignment": 0.270751953125, + "loss_alignment_w": 0.1353759765625, + "loss_sft": 0.4486718773841858, + "loss_total_v6": 0.5840173065662384, + "step": 477 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05512072072072072, + "grad_norm": 33.10407638549805, + "learning_rate": 5.774005695405008e-06, + "loss": 9.633926391601562, + "loss_alignment": 0.271484375, + "loss_alignment_w": 0.1357421875, + "loss_sft": 0.46650024503469467, + "loss_total_v6": 0.6021203696727753, + "step": 478 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05523603603603604, + "grad_norm": 32.90409469604492, + "learning_rate": 5.7576661098397024e-06, + "loss": 10.176679611206055, + "loss_alignment": 0.3330078125, + "loss_alignment_w": 0.16650390625, + "loss_sft": 0.4691418558359146, + "loss_total_v6": 0.6360425055027008, + "step": 479 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05535135135135135, + "grad_norm": 33.191001892089844, + "learning_rate": 5.74131823855921e-06, + "loss": 9.214507102966309, + "loss_alignment": 0.262451171875, + "loss_alignment_w": 0.1312255859375, + "loss_sft": 0.4451388716697693, + "loss_total_v6": 0.5759066939353943, + "step": 480 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.055466666666666664, + "grad_norm": 34.484012603759766, + "learning_rate": 5.72496226034123e-06, + "loss": 9.973201751708984, + "loss_alignment": 0.2685546875, + "loss_alignment_w": 0.13427734375, + "loss_sft": 0.4893529713153839, + "loss_total_v6": 0.6233251243829727, + "step": 481 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.055581981981981984, + "grad_norm": 38.642032623291016, + "learning_rate": 5.708598354052122e-06, + "loss": 9.326828002929688, + "loss_alignment": 0.26806640625, + "loss_alignment_w": 0.134033203125, + "loss_sft": 0.44898513704538345, + "loss_total_v6": 0.5829267203807831, + "step": 482 + }, + { + "action_cond_aligned": 0.703125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0556972972972973, + "grad_norm": 41.2027702331543, + "learning_rate": 5.692226698644938e-06, + "loss": 9.085186958312988, + "loss_alignment": 0.248779296875, + "loss_alignment_w": 0.1243896484375, + "loss_sft": 0.44355661422014236, + "loss_total_v6": 0.567824199795723, + "step": 483 + }, + { + "action_cond_aligned": 0.828125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05581261261261261, + "grad_norm": 41.07442855834961, + "learning_rate": 5.675847473157485e-06, + "loss": 10.38929557800293, + "loss_alignment": 0.333984375, + "loss_alignment_w": 0.1669921875, + "loss_sft": 0.4820946604013443, + "loss_total_v6": 0.6493309885263443, + "step": 484 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05592792792792793, + "grad_norm": 38.009727478027344, + "learning_rate": 5.659460856710346e-06, + "loss": 9.600249290466309, + "loss_alignment": 0.27099609375, + "loss_alignment_w": 0.135498046875, + "loss_sft": 0.4647921845316887, + "loss_total_v6": 0.6000155657529831, + "step": 485 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.056043243243243245, + "grad_norm": 33.77423858642578, + "learning_rate": 5.643067028504931e-06, + "loss": 10.07010555267334, + "loss_alignment": 0.29931640625, + "loss_alignment_w": 0.149658203125, + "loss_sft": 0.47978439182043076, + "loss_total_v6": 0.6293815970420837, + "step": 486 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05615855855855856, + "grad_norm": 38.14710235595703, + "learning_rate": 5.626666167821522e-06, + "loss": 8.96904182434082, + "loss_alignment": 0.252197265625, + "loss_alignment_w": 0.1260986328125, + "loss_sft": 0.4344969913363457, + "loss_total_v6": 0.5605651214718819, + "step": 487 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05627387387387387, + "grad_norm": 32.04140853881836, + "learning_rate": 5.610258454017301e-06, + "loss": 8.881336212158203, + "loss_alignment": 0.2685546875, + "loss_alignment_w": 0.13427734375, + "loss_sft": 0.4209892600774765, + "loss_total_v6": 0.5550835207104683, + "step": 488 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05638918918918919, + "grad_norm": 36.84969711303711, + "learning_rate": 5.593844066524401e-06, + "loss": 9.269258499145508, + "loss_alignment": 0.27392578125, + "loss_alignment_w": 0.136962890625, + "loss_sft": 0.4423047602176666, + "loss_total_v6": 0.5793287009000778, + "step": 489 + }, + { + "action_cond_aligned": 0.6875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.056504504504504505, + "grad_norm": 33.24451446533203, + "learning_rate": 5.577423184847932e-06, + "loss": 9.320512771606445, + "loss_alignment": 0.2578125, + "loss_alignment_w": 0.12890625, + "loss_sft": 0.45307648926973343, + "loss_total_v6": 0.5825320482254028, + "step": 490 + }, + { + "action_cond_aligned": 0.78125, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05661981981981982, + "grad_norm": 32.266544342041016, + "learning_rate": 5.560995988564023e-06, + "loss": 9.709208488464355, + "loss_alignment": 0.29296875, + "loss_alignment_w": 0.146484375, + "loss_sft": 0.4607684165239334, + "loss_total_v6": 0.6068255454301834, + "step": 491 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05673513513513514, + "grad_norm": 35.38919448852539, + "learning_rate": 5.544562657317863e-06, + "loss": 8.889284133911133, + "loss_alignment": 0.2744140625, + "loss_alignment_w": 0.13720703125, + "loss_sft": 0.4182817116379738, + "loss_total_v6": 0.5555802881717682, + "step": 492 + }, + { + "action_cond_aligned": 0.75, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05685045045045045, + "grad_norm": 32.004478454589844, + "learning_rate": 5.52812337082173e-06, + "loss": 10.124436378479004, + "loss_alignment": 0.28759765625, + "loss_alignment_w": 0.143798828125, + "loss_sft": 0.48882587254047394, + "loss_total_v6": 0.6327772736549377, + "step": 493 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.056965765765765765, + "grad_norm": 33.752471923828125, + "learning_rate": 5.5116783088530255e-06, + "loss": 9.271964073181152, + "loss_alignment": 0.28466796875, + "loss_alignment_w": 0.142333984375, + "loss_sft": 0.4376215711236, + "loss_total_v6": 0.579497754573822, + "step": 494 + }, + { + "action_cond_aligned": 0.71875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05708108108108108, + "grad_norm": 32.66241455078125, + "learning_rate": 5.495227651252315e-06, + "loss": 9.700106620788574, + "loss_alignment": 0.2783203125, + "loss_alignment_w": 0.13916015625, + "loss_sft": 0.4673711583018303, + "loss_total_v6": 0.6062566637992859, + "step": 495 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.0571963963963964, + "grad_norm": 32.86709213256836, + "learning_rate": 5.478771577921351e-06, + "loss": 9.888681411743164, + "loss_alignment": 0.28076171875, + "loss_alignment_w": 0.140380859375, + "loss_sft": 0.47744809836149216, + "loss_total_v6": 0.6180425882339478, + "step": 496 + }, + { + "action_cond_aligned": 0.65625, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05731171171171171, + "grad_norm": 31.3306884765625, + "learning_rate": 5.4623102688211186e-06, + "loss": 8.659295082092285, + "loss_alignment": 0.231689453125, + "loss_alignment_w": 0.1158447265625, + "loss_sft": 0.42539170384407043, + "loss_total_v6": 0.5412059277296066, + "step": 497 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.057427027027027025, + "grad_norm": 34.71675491333008, + "learning_rate": 5.445843903969854e-06, + "loss": 8.938067436218262, + "loss_alignment": 0.283203125, + "loss_alignment_w": 0.1416015625, + "loss_sft": 0.41714970022439957, + "loss_total_v6": 0.5586291998624802, + "step": 498 + }, + { + "action_cond_aligned": 0.796875, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.057542342342342345, + "grad_norm": 32.29189682006836, + "learning_rate": 5.429372663441086e-06, + "loss": 9.87841796875, + "loss_alignment": 0.32421875, + "loss_alignment_w": 0.162109375, + "loss_sft": 0.4556884691119194, + "loss_total_v6": 0.6174010932445526, + "step": 499 + }, + { + "action_cond_aligned": 0.734375, + "action_cond_missing": 0.0, + "action_cond_skipped": 0.0, + "epoch": 0.05765765765765766, + "grad_norm": 34.00673294067383, + "learning_rate": 5.412896727361663e-06, + "loss": 9.069567680358887, + "loss_alignment": 0.269775390625, + "loss_alignment_w": 0.1348876953125, + "loss_sft": 0.43238750845193863, + "loss_total_v6": 0.566847950220108, + "step": 500 + }, + { + "epoch": 0.05765765765765766, + "eval_loss": 0.6589862704277039, + "eval_loss_alignment": 0.33490060068649885, + "eval_loss_alignment_w": 0.16745030034324943, + "eval_loss_highlevel": 0.0, + "eval_loss_sft": 0.49153595606986117, + "eval_loss_total_v6": 0.658986257095086, + "eval_loss_wm_recon": 0.0, + "eval_loss_wm_recon_w": 0.0, + "eval_runtime": 114.5509, + "eval_samples_per_second": 15.233, + "eval_steps_per_second": 3.815, + "step": 500 + } + ], + "logging_steps": 1, + "max_steps": 1000, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": false + }, + "attributes": {} + } + }, + "total_flos": 3.134350761018786e+18, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +} diff --git a/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/zero_to_fp32.py b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/zero_to_fp32.py new file mode 100644 index 0000000000000000000000000000000000000000..5995d6e6f04e43b989587aa9022a3aef0c66d694 --- /dev/null +++ b/qwen-cua__runs__wm_abtest_sem_basewarmstart_superseded__v0-20260623-034830__checkpoint-500__evalweights/zero_to_fp32.py @@ -0,0 +1,760 @@ +#!/usr/bin/env python + +# Copyright (c) Microsoft Corporation. +# SPDX-License-Identifier: Apache-2.0 + +# DeepSpeed Team + +# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets +# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in +# the future. Once extracted, the weights don't require DeepSpeed and can be used in any +# application. +# +# example: +# python zero_to_fp32.py . output_dir/ +# or +# python zero_to_fp32.py . output_dir/ --safe_serialization + +import argparse +import torch +import glob +import math +import os +import re +import gc +import json +import numpy as np +from tqdm import tqdm +from collections import OrderedDict +from dataclasses import dataclass + +# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with +# DeepSpeed data structures it has to be available in the current python environment. +from deepspeed.utils import logger +from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS, + FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES, + FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS) + + +@dataclass +class zero_model_state: + buffers: dict() + param_shapes: dict() + shared_params: list + ds_version: int + frozen_param_shapes: dict() + frozen_param_fragments: dict() + + +debug = 0 + +# load to cpu +device = torch.device('cpu') + + +def atoi(text): + return int(text) if text.isdigit() else text + + +def natural_keys(text): + ''' + alist.sort(key=natural_keys) sorts in human order + http://nedbatchelder.com/blog/200712/human_sorting.html + (See Toothy's implementation in the comments) + ''' + return [atoi(c) for c in re.split(r'(\d+)', text)] + + +def get_model_state_file(checkpoint_dir, zero_stage): + if not os.path.isdir(checkpoint_dir): + raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist") + + # there should be only one file + if zero_stage <= 2: + file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt") + elif zero_stage == 3: + file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt") + + if not os.path.exists(file): + raise FileNotFoundError(f"can't find model states file at '{file}'") + + return file + + +def get_checkpoint_files(checkpoint_dir, glob_pattern): + # XXX: need to test that this simple glob rule works for multi-node setup too + ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys) + + if len(ckpt_files) == 0: + raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'") + + return ckpt_files + + +def get_optim_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt") + + +def get_model_state_files(checkpoint_dir): + return get_checkpoint_files(checkpoint_dir, "*_model_states.pt") + + +def parse_model_states(files): + zero_model_states = [] + for file in files: + state_dict = torch.load(file, map_location=device, weights_only=False) + + if BUFFER_NAMES not in state_dict: + raise ValueError(f"{file} is not a model state checkpoint") + buffer_names = state_dict[BUFFER_NAMES] + if debug: + print("Found buffers:", buffer_names) + + # recover just the buffers while restoring them to fp32 if they were saved in fp16 + buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names} + param_shapes = state_dict[PARAM_SHAPES] + + # collect parameters that are included in param_shapes + param_names = [] + for s in param_shapes: + for name in s.keys(): + param_names.append(name) + + # update with frozen parameters + frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None) + if frozen_param_shapes is not None: + if debug: + print(f"Found frozen_param_shapes: {frozen_param_shapes}") + param_names += list(frozen_param_shapes.keys()) + + # handle shared params + shared_params = [[k, v] for k, v in state_dict["shared_params"].items()] + + ds_version = state_dict.get(DS_VERSION, None) + + frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None) + + z_model_state = zero_model_state(buffers=buffers, + param_shapes=param_shapes, + shared_params=shared_params, + ds_version=ds_version, + frozen_param_shapes=frozen_param_shapes, + frozen_param_fragments=frozen_param_fragments) + zero_model_states.append(z_model_state) + + return zero_model_states + + +def parse_optim_states(files, ds_checkpoint_dir): + total_files = len(files) + state_dicts = [] + for f in tqdm(files, desc='Loading checkpoint shards'): + state_dict = torch.load(f, map_location=device, mmap=True, weights_only=False) + # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights + # and also handle the case where it was already removed by another helper script + state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None) + state_dicts.append(state_dict) + + if ZERO_STAGE not in state_dicts[0][OPTIMIZER_STATE_DICT]: + raise ValueError(f"{files[0]} is not a zero checkpoint") + zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE] + world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT] + + # For ZeRO-2 each param group can have different partition_count as data parallelism for expert + # parameters can be different from data parallelism for non-expert parameters. So we can just + # use the max of the partition_count to get the dp world_size. + + if type(world_size) is list: + world_size = max(world_size) + + if world_size != total_files: + raise ValueError( + f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. " + "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes." + ) + + # the groups are named differently in each stage + if zero_stage <= 2: + fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS + elif zero_stage == 3: + fp32_groups_key = FP32_FLAT_GROUPS + else: + raise ValueError(f"unknown zero stage {zero_stage}") + + fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))] + return zero_stage, world_size, fp32_flat_groups + + +def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters): + """ + Returns fp32 state_dict reconstructed from ds checkpoint + + Args: + - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are) + + """ + print(f"Processing zero checkpoint '{ds_checkpoint_dir}'") + + optim_files = get_optim_files(ds_checkpoint_dir) + zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir) + print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}") + + model_files = get_model_state_files(ds_checkpoint_dir) + + zero_model_states = parse_model_states(model_files) + print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}') + + if zero_stage <= 2: + return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + elif zero_stage == 3: + return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters) + + +def _zero2_merge_frozen_params(state_dict, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + frozen_param_fragments = zero_model_states[0].frozen_param_fragments + + if debug: + num_elem = sum(s.numel() for s in frozen_param_shapes.values()) + print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in frozen_param_fragments.values()]) + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + state_dict[name] = frozen_param_fragments[name] + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +def _has_callable(obj, fn): + attr = getattr(obj, fn, None) + return callable(attr) + + +def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + + # Reconstruction protocol: + # + # XXX: document this + + if debug: + for i in range(world_size): + for j in range(len(fp32_flat_groups[0])): + print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}") + + # XXX: memory usage doubles here (zero2) + num_param_groups = len(fp32_flat_groups[0]) + merged_single_partition_of_fp32_groups = [] + for i in range(num_param_groups): + merged_partitions = [sd[i] for sd in fp32_flat_groups] + full_single_fp32_vector = torch.cat(merged_partitions, 0) + merged_single_partition_of_fp32_groups.append(full_single_fp32_vector) + avail_numel = sum( + [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups]) + + if debug: + wanted_params = sum([len(shapes) for shapes in param_shapes]) + wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes]) + # not asserting if there is a mismatch due to possible padding + print(f"Have {avail_numel} numels to process.") + print(f"Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + total_numel = 0 + total_params = 0 + for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups): + offset = 0 + avail_numel = full_single_fp32_vector.numel() + for name, shape in shapes.items(): + + unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape) + total_numel += unpartitioned_numel + total_params += 1 + + if debug: + print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ") + state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape) + offset += unpartitioned_numel + + # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and + # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex + # paddings performed in the code it's almost impossible to predict the exact numbers w/o the + # live optimizer object, so we are checking that the numbers are within the right range + align_to = 2 * world_size + + def zero2_align(x): + return align_to * math.ceil(x / align_to) + + if debug: + print(f"original offset={offset}, avail_numel={avail_numel}") + + offset = zero2_align(offset) + avail_numel = zero2_align(avail_numel) + + if debug: + print(f"aligned offset={offset}, avail_numel={avail_numel}") + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero2_merge_frozen_params(state_dict, zero_model_states) + + _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def zero3_partitioned_param_info(unpartitioned_numel, world_size): + remainder = unpartitioned_numel % world_size + padding_numel = (world_size - remainder) if remainder else 0 + partitioned_numel = math.ceil(unpartitioned_numel / world_size) + return partitioned_numel, padding_numel + + +def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states): + if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0: + return + + if debug: + for i in range(world_size): + num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values()) + print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}') + + frozen_param_shapes = zero_model_states[0].frozen_param_shapes + wanted_params = len(frozen_param_shapes) + wanted_numel = sum(s.numel() for s in frozen_param_shapes.values()) + avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size + print(f'Frozen params: Have {avail_numel} numels to process.') + print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params') + + total_params = 0 + total_numel = 0 + for name, shape in zero_model_states[0].frozen_param_shapes.items(): + total_params += 1 + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + + param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states) + state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape) + + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements") + + +class GatheredTensor: + """ + A pseudo tensor that collects partitioned weights. + It is more memory efficient when there are multiple groups. + """ + + def __init__(self, flat_groups, flat_groups_offset, offset, partitioned_numel, shape): + self.flat_groups = flat_groups + self.flat_groups_offset = flat_groups_offset + self.offset = offset + self.partitioned_numel = partitioned_numel + self.shape = shape + self.dtype = self.flat_groups[0][0].dtype + + def contiguous(self): + """ + Merge partitioned weights from flat_groups into a single tensor. + """ + end_idx = self.offset + self.partitioned_numel + world_size = len(self.flat_groups) + pad_flat_param_chunks = [] + + for rank_i in range(world_size): + # for each rank, we need to collect weights from related group/groups + flat_groups_at_rank_i = self.flat_groups[rank_i] + start_group_id = None + end_group_id = None + for group_id in range(len(self.flat_groups_offset)): + if self.flat_groups_offset[group_id] <= self.offset < self.flat_groups_offset[group_id + 1]: + start_group_id = group_id + if self.flat_groups_offset[group_id] < end_idx <= self.flat_groups_offset[group_id + 1]: + end_group_id = group_id + break + # collect weights from related group/groups + for group_id in range(start_group_id, end_group_id + 1): + flat_tensor = flat_groups_at_rank_i[group_id] + start_offset = self.offset - self.flat_groups_offset[group_id] + end_offset = min(end_idx, self.flat_groups_offset[group_id + 1]) - self.flat_groups_offset[group_id] + pad_flat_param_chunks.append(flat_tensor[start_offset:end_offset]) + + # collect weights from all ranks + pad_flat_param = torch.cat(pad_flat_param_chunks, dim=0) + param = pad_flat_param[:self.shape.numel()].view(self.shape).contiguous() + return param + + +def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states): + param_shapes = zero_model_states[0].param_shapes + avail_numel = sum([flat_group.numel() for flat_group in fp32_flat_groups[0]]) * world_size + + # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each + # param, re-consolidating each param, while dealing with padding if any + + # merge list of dicts, preserving order + param_shapes = {k: v for d in param_shapes for k, v in d.items()} + + if debug: + for i in range(world_size): + print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}") + + wanted_params = len(param_shapes) + wanted_numel = sum(shape.numel() for shape in param_shapes.values()) + # not asserting if there is a mismatch due to possible padding + avail_numel = fp32_flat_groups[0].numel() * world_size + print(f"Trainable params: Have {avail_numel} numels to process.") + print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.") + + # params + # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support + # out-of-core computing solution + offset = 0 + total_numel = 0 + total_params = 0 + flat_groups_offset = [0] + list(np.cumsum([flat_tensor.numel() for flat_tensor in fp32_flat_groups[0]])) + for name, shape in tqdm(param_shapes.items(), desc='Gathering sharded weights'): + unpartitioned_numel = shape.numel() + total_numel += unpartitioned_numel + total_params += 1 + partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size) + + if debug: + print( + f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}" + ) + + # memory efficient tensor + tensor = GatheredTensor(fp32_flat_groups, flat_groups_offset, offset, partitioned_numel, shape) + state_dict[name] = tensor + offset += partitioned_numel + + offset *= world_size + + # Sanity check + if offset != avail_numel: + raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong") + + print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements") + + +def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states, + exclude_frozen_parameters): + state_dict = OrderedDict() + + # buffers + buffers = zero_model_states[0].buffers + state_dict.update(buffers) + if debug: + print(f"added {len(buffers)} buffers") + + if not exclude_frozen_parameters: + _zero3_merge_frozen_params(state_dict, world_size, zero_model_states) + + _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states) + + # recover shared parameters + for pair in zero_model_states[0].shared_params: + if pair[1] in state_dict: + state_dict[pair[0]] = state_dict[pair[1]] + + return state_dict + + +def to_torch_tensor(state_dict, return_empty_tensor=False): + """ + Convert state_dict of GatheredTensor to torch tensor + """ + torch_state_dict = {} + converted_tensors = {} + for name, tensor in state_dict.items(): + tensor_id = id(tensor) + if tensor_id in converted_tensors: # shared tensors + shared_tensor = torch_state_dict[converted_tensors[tensor_id]] + torch_state_dict[name] = shared_tensor + else: + converted_tensors[tensor_id] = name + if return_empty_tensor: + torch_state_dict[name] = torch.empty(tensor.shape, dtype=tensor.dtype) + else: + torch_state_dict[name] = tensor.contiguous() + return torch_state_dict + + +def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag=None, + exclude_frozen_parameters=False, + lazy_mode=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with + ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example + via a model hub. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + - ``lazy_mode``: get state_dict in lazy mode. It returns a dict of pesduo tensor instead of torch tensor, which is more memory efficient. + Convert the pesduo tensor to torch tensor by ``.contiguous()`` + + Returns: + - pytorch ``state_dict`` + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + # do the training and checkpoint saving + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu + model = model.cpu() # move to cpu + model.load_state_dict(state_dict) + # submit to model hub or save the model to share with others + + In this example the ``model`` will no longer be usable in the deepspeed context of the same + application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead. + + Note: the above usage may not work if your application doesn't have sufficient free CPU memory. + You may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with + the checkpoint. Or you can load state_dict in lazy mode :: + + from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, lazy_mode=True) # not on cpu + for name, lazy_tensor in state_dict.item(): + tensor = lazy_tensor.contiguous() # to cpu + print(name, tensor) + # del tensor to release memory if it no longer in use + """ + if tag is None: + latest_path = os.path.join(checkpoint_dir, 'latest') + if os.path.isfile(latest_path): + with open(latest_path, 'r') as fd: + tag = fd.read().strip() + else: + raise ValueError(f"Unable to find 'latest' file at {latest_path}") + + ds_checkpoint_dir = os.path.join(checkpoint_dir, tag) + + if not os.path.isdir(ds_checkpoint_dir): + raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist") + + state_dict = _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters) + if lazy_mode: + return state_dict + else: + return to_torch_tensor(state_dict) + + +def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, + output_dir, + max_shard_size="5GB", + safe_serialization=False, + tag=None, + exclude_frozen_parameters=False): + """ + Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be + loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed. + + Args: + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``output_dir``: directory to the pytorch fp32 state_dict output files + - ``max_shard_size``: the maximum size for a checkpoint before being sharded, default value is 5GB + - ``safe_serialization``: whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`). + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + - ``exclude_frozen_parameters``: exclude frozen parameters + """ + + # Dependency pre-check + if safe_serialization: + try: + from safetensors.torch import save_file + except ImportError: + print('If you want to use `safe_serialization`, please `pip install safetensors`') + raise + if max_shard_size is not None: + try: + from huggingface_hub import split_torch_state_dict_into_shards + except ImportError: + print('If you want to use `max_shard_size`, please `pip install huggingface_hub`') + raise + + # Convert zero checkpoint to state_dict + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, + tag, + exclude_frozen_parameters, + lazy_mode=True) + + # Shard the model if it is too big. + weights_name = "model.safetensors" if safe_serialization else "pytorch_model.bin" + if max_shard_size is not None: + filename_pattern = weights_name.replace(".bin", "{suffix}.bin").replace(".safetensors", "{suffix}.safetensors") + # an memory-efficient approach for sharding + empty_state_dict = to_torch_tensor(state_dict, return_empty_tensor=True) + state_dict_split = split_torch_state_dict_into_shards(empty_state_dict, + filename_pattern=filename_pattern, + max_shard_size=max_shard_size) + else: + from collections import namedtuple + StateDictSplit = namedtuple("StateDictSplit", ["is_sharded", "filename_to_tensors"]) + state_dict_split = StateDictSplit(is_sharded=False, + filename_to_tensors={weights_name: list(state_dict.keys())}) + + # Save the model by shard + os.makedirs(output_dir, exist_ok=True) + filename_to_tensors = state_dict_split.filename_to_tensors.items() + for shard_file, tensors in tqdm(filename_to_tensors, desc="Saving checkpoint shards"): + shard_state_dict = {tensor_name: state_dict[tensor_name] for tensor_name in tensors} + shard_state_dict = to_torch_tensor(shard_state_dict) + output_path = os.path.join(output_dir, shard_file) + if safe_serialization: + save_file(shard_state_dict, output_path, metadata={"format": "pt"}) + else: + torch.save(shard_state_dict, output_path) + # release the memory of current shard + for tensor_name in list(shard_state_dict.keys()): + del state_dict[tensor_name] + del shard_state_dict[tensor_name] + del shard_state_dict + gc.collect() + + # Save index if sharded + if state_dict_split.is_sharded: + index = { + "metadata": state_dict_split.metadata, + "weight_map": state_dict_split.tensor_to_filename, + } + save_index_file = "model.safetensors.index.json" if safe_serialization else "pytorch_model.bin.index.json" + save_index_file = os.path.join(output_dir, save_index_file) + with open(save_index_file, "w", encoding="utf-8") as f: + content = json.dumps(index, indent=2, sort_keys=True) + "\n" + f.write(content) + + +def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None): + """ + 1. Put the provided model to cpu + 2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` + 3. Load it into the provided model + + Args: + - ``model``: the model object to update + - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``) + - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14`` + + Returns: + - ``model`: modified model + + Make sure you have plenty of CPU memory available before you call this function. If you don't + have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it + conveniently placed for you in the checkpoint folder. + + A typical usage might be :: + + from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint + model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir) + # submit to model hub or save the model to share with others + + Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context + of the same application. i.e. you will need to re-initialize the deepspeed engine, since + ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it. + + """ + logger.info("Extracting fp32 weights") + state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag) + + logger.info("Overwriting model with fp32 weights") + model = model.cpu() + model.load_state_dict(state_dict, strict=False) + + return model + + +if __name__ == "__main__": + parser = argparse.ArgumentParser() + parser.add_argument("checkpoint_dir", + type=str, + help="path to the desired checkpoint folder, e.g., path/checkpoint-12") + parser.add_argument("output_dir", + type=str, + help="directory to the pytorch fp32 state_dict output files" + "(e.g. path/checkpoint-12-output/)") + parser.add_argument( + "--max_shard_size", + type=str, + default="5GB", + help="The maximum size for a checkpoint before being sharded. Checkpoints shard will then be each of size" + "lower than this size. If expressed as a string, needs to be digits followed by a unit (like `5MB`" + "We default it to 5GB in order for models to be able to run easily on free-tier google colab instances" + "without CPU OOM issues.") + parser.add_argument( + "--safe_serialization", + default=False, + action='store_true', + help="Whether to save the model using `safetensors` or the traditional PyTorch way (that uses `pickle`).") + parser.add_argument("-t", + "--tag", + type=str, + default=None, + help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1") + parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters") + parser.add_argument("-d", "--debug", action='store_true', help="enable debug") + args = parser.parse_args() + + debug = args.debug + + convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir, + args.output_dir, + max_shard_size=args.max_shard_size, + safe_serialization=args.safe_serialization, + tag=args.tag, + exclude_frozen_parameters=args.exclude_frozen_parameters)