karl-wang commited on Jun 27, 2025

Commit

9e025ef

verified ·

1 Parent(s): d10dd49

Upload folder using huggingface_hub

Browse files

Files changed (24) hide show

models/.DS_Store +0 -0
models/checkpoint-15000/.DS_Store +0 -0
models/checkpoint-15000/config.json +202 -0
models/checkpoint-15000/optimizer.pt +3 -0
models/checkpoint-15000/pytorch_model.bin +3 -0
models/checkpoint-15000/rng_state.pth +3 -0
models/checkpoint-15000/scheduler.pt +3 -0
models/checkpoint-15000/trainer_state.json +0 -0
models/checkpoint-15000/training_args.bin +3 -0
models/checkpoint-23000/.DS_Store +0 -0
models/checkpoint-23000/config.json +202 -0
models/checkpoint-23000/optimizer.pt +3 -0
models/checkpoint-23000/pytorch_model.bin +3 -0
models/checkpoint-23000/rng_state.pth +3 -0
models/checkpoint-23000/scheduler.pt +3 -0
models/checkpoint-23000/trainer_state.json +0 -0
models/checkpoint-23000/training_args.bin +3 -0
models/checkpoint-500/.DS_Store +0 -0
models/checkpoint-500/config.json +202 -0
models/checkpoint-500/pytorch_model.bin +3 -0
models/checkpoint-500/rng_state.pth +3 -0
models/checkpoint-500/scheduler.pt +3 -0
models/checkpoint-500/trainer_state.json +174 -0
models/checkpoint-500/training_args.bin +3 -0

models/.DS_Store ADDED Viewed

Binary file (6.15 kB). View file

models/checkpoint-15000/.DS_Store ADDED Viewed

Binary file (6.15 kB). View file

models/checkpoint-15000/config.json ADDED Viewed

	@@ -0,0 +1,202 @@

+{
+  "_commit_hash": "a0b4534a14f58e20944452dff00a22a06ce629d1",
+  "_name_or_path": "laion/larger_clap_music",
+  "architectures": [
+    "ClapModel"
+  ],
+  "audio_config": {
+    "_name_or_path": "",
+    "add_cross_attention": false,
+    "aff_block_r": 4,
+    "architectures": null,
+    "attention_probs_dropout_prob": 0.0,
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bos_token_id": null,
+    "chunk_size_feed_forward": 0,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "depths": [
+      2,
+      2,
+      12,
+      2
+    ],
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "drop_path_rate": 0.0,
+    "early_stopping": false,
+    "enable_fusion": false,
+    "enable_patch_layer_norm": true,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": null,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "flatten_patch_embeds": true,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "fusion_type": null,
+    "hidden_act": "gelu",
+    "hidden_dropout_prob": 0.1,
+    "hidden_size": 1024,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "initializer_factor": 1.0,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "layer_norm_eps": 1e-05,
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "min_length": 0,
+    "mlp_ratio": 4.0,
+    "model_type": "clap_audio_model",
+    "no_repeat_ngram_size": 0,
+    "num_attention_heads": [
+      4,
+      8,
+      16,
+      32
+    ],
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_classes": 527,
+    "num_hidden_layers": 4,
+    "num_mel_bins": 64,
+    "num_return_sequences": 1,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": null,
+    "patch_embed_input_channels": 1,
+    "patch_embeds_hidden_size": 128,
+    "patch_size": 4,
+    "patch_stride": [
+      4,
+      4
+    ],
+    "prefix": null,
+    "problem_type": null,
+    "projection_dim": 512,
+    "projection_hidden_act": "relu",
+    "pruned_heads": {},
+    "qkv_bias": true,
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "sep_token_id": null,
+    "spec_size": 256,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": true,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": null,
+    "torchscript": false,
+    "transformers_version": "4.30.2",
+    "typical_p": 1.0,
+    "use_bfloat16": false,
+    "window_size": 8
+  },
+  "hidden_size": 768,
+  "initializer_factor": 1.0,
+  "logit_scale_init_value": 14.285714285714285,
+  "model_type": "clap",
+  "num_hidden_layers": 16,
+  "projection_dim": 512,
+  "projection_hidden_act": "relu",
+  "text_config": {
+    "_name_or_path": "",
+    "add_cross_attention": false,
+    "architectures": null,
+    "attention_probs_dropout_prob": 0.1,
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bos_token_id": 0,
+    "chunk_size_feed_forward": 0,
+    "classifier_dropout": null,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "early_stopping": false,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": 2,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "hidden_act": "gelu",
+    "hidden_dropout_prob": 0.1,
+    "hidden_size": 768,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "initializer_factor": 1.0,
+    "initializer_range": 0.02,
+    "intermediate_size": 3072,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "layer_norm_eps": 1e-12,
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "max_position_embeddings": 514,
+    "min_length": 0,
+    "model_type": "clap_text_model",
+    "no_repeat_ngram_size": 0,
+    "num_attention_heads": 12,
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_hidden_layers": 12,
+    "num_return_sequences": 1,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": 1,
+    "position_embedding_type": "absolute",
+    "prefix": null,
+    "problem_type": null,
+    "projection_dim": 512,
+    "projection_hidden_act": "relu",
+    "pruned_heads": {},
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "sep_token_id": null,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": true,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": null,
+    "torchscript": false,
+    "transformers_version": "4.30.2",
+    "type_vocab_size": 1,
+    "typical_p": 1.0,
+    "use_bfloat16": false,
+    "use_cache": true,
+    "vocab_size": 50265
+  },
+  "torch_dtype": "float32",
+  "transformers_version": "4.35.0.dev0"
+}

models/checkpoint-15000/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1a4ce0b8df5e721a641adc43e3e3a1f36a3bba500c2e02047995ceadadcd19e3
+size 1551623930

models/checkpoint-15000/pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:916d3f0ea2913ca41fd63c12951925baa669808b35feda5713ab3eb126766df1
+size 776452854

models/checkpoint-15000/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f848fabb950660ee3d5e87f0502e308ecdb8d3e50728f9b017301f67b5c1c44f
+size 14244

models/checkpoint-15000/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:ca926e2c4f4c7ad8c406afa62faddf3cf8e566303a56e0d7338bae19c1817c0b
+size 1064

models/checkpoint-15000/trainer_state.json ADDED Viewed

The diff for this file is too large to render. See raw diff

models/checkpoint-15000/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4df838ef988efa77991d544c0f2afde996b0f0ca9ef7ccbe236caf5dbb119b48
+size 4344

models/checkpoint-23000/.DS_Store ADDED Viewed

Binary file (6.15 kB). View file

models/checkpoint-23000/config.json ADDED Viewed

	@@ -0,0 +1,202 @@

+{
+  "_commit_hash": "a0b4534a14f58e20944452dff00a22a06ce629d1",
+  "_name_or_path": "laion/larger_clap_music",
+  "architectures": [
+    "ClapModel"
+  ],
+  "audio_config": {
+    "_name_or_path": "",
+    "add_cross_attention": false,
+    "aff_block_r": 4,
+    "architectures": null,
+    "attention_probs_dropout_prob": 0.0,
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bos_token_id": null,
+    "chunk_size_feed_forward": 0,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "depths": [
+      2,
+      2,
+      12,
+      2
+    ],
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "drop_path_rate": 0.0,
+    "early_stopping": false,
+    "enable_fusion": false,
+    "enable_patch_layer_norm": true,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": null,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "flatten_patch_embeds": true,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "fusion_type": null,
+    "hidden_act": "gelu",
+    "hidden_dropout_prob": 0.1,
+    "hidden_size": 1024,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "initializer_factor": 1.0,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "layer_norm_eps": 1e-05,
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "min_length": 0,
+    "mlp_ratio": 4.0,
+    "model_type": "clap_audio_model",
+    "no_repeat_ngram_size": 0,
+    "num_attention_heads": [
+      4,
+      8,
+      16,
+      32
+    ],
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_classes": 527,
+    "num_hidden_layers": 4,
+    "num_mel_bins": 64,
+    "num_return_sequences": 1,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": null,
+    "patch_embed_input_channels": 1,
+    "patch_embeds_hidden_size": 128,
+    "patch_size": 4,
+    "patch_stride": [
+      4,
+      4
+    ],
+    "prefix": null,
+    "problem_type": null,
+    "projection_dim": 512,
+    "projection_hidden_act": "relu",
+    "pruned_heads": {},
+    "qkv_bias": true,
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "sep_token_id": null,
+    "spec_size": 256,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": true,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": null,
+    "torchscript": false,
+    "transformers_version": "4.30.2",
+    "typical_p": 1.0,
+    "use_bfloat16": false,
+    "window_size": 8
+  },
+  "hidden_size": 768,
+  "initializer_factor": 1.0,
+  "logit_scale_init_value": 14.285714285714285,
+  "model_type": "clap",
+  "num_hidden_layers": 16,
+  "projection_dim": 512,
+  "projection_hidden_act": "relu",
+  "text_config": {
+    "_name_or_path": "",
+    "add_cross_attention": false,
+    "architectures": null,
+    "attention_probs_dropout_prob": 0.1,
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bos_token_id": 0,
+    "chunk_size_feed_forward": 0,
+    "classifier_dropout": null,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "early_stopping": false,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": 2,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "hidden_act": "gelu",
+    "hidden_dropout_prob": 0.1,
+    "hidden_size": 768,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "initializer_factor": 1.0,
+    "initializer_range": 0.02,
+    "intermediate_size": 3072,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "layer_norm_eps": 1e-12,
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "max_position_embeddings": 514,
+    "min_length": 0,
+    "model_type": "clap_text_model",
+    "no_repeat_ngram_size": 0,
+    "num_attention_heads": 12,
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_hidden_layers": 12,
+    "num_return_sequences": 1,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": 1,
+    "position_embedding_type": "absolute",
+    "prefix": null,
+    "problem_type": null,
+    "projection_dim": 512,
+    "projection_hidden_act": "relu",
+    "pruned_heads": {},
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "sep_token_id": null,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": true,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": null,
+    "torchscript": false,
+    "transformers_version": "4.30.2",
+    "type_vocab_size": 1,
+    "typical_p": 1.0,
+    "use_bfloat16": false,
+    "use_cache": true,
+    "vocab_size": 50265
+  },
+  "torch_dtype": "float32",
+  "transformers_version": "4.35.0.dev0"
+}

models/checkpoint-23000/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:19a52979e49434aac9f438b7a3ca0e25438b072006e5a9c80e58217bd6608de3
+size 1551623930

models/checkpoint-23000/pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:074cefe525a058d5f4fb17fdf182c9a8b5675bf5e06c57b0184cf25f2a4e7301
+size 776452854

models/checkpoint-23000/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:bc66b1baf9dd7c42045b3d204884e2ad4f05ce7c4af00774dd91a4d392c85e3c
+size 14244

models/checkpoint-23000/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b51b5c9976c05919548fcfe5f9d95afe9ea06b109ce6cfd032e55729c50a2d96
+size 1064

models/checkpoint-23000/trainer_state.json ADDED Viewed

The diff for this file is too large to render. See raw diff

models/checkpoint-23000/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4df838ef988efa77991d544c0f2afde996b0f0ca9ef7ccbe236caf5dbb119b48
+size 4344

models/checkpoint-500/.DS_Store ADDED Viewed

Binary file (6.15 kB). View file

models/checkpoint-500/config.json ADDED Viewed

	@@ -0,0 +1,202 @@

+{
+  "_commit_hash": "a0b4534a14f58e20944452dff00a22a06ce629d1",
+  "_name_or_path": "laion/larger_clap_music",
+  "architectures": [
+    "ClapModel"
+  ],
+  "audio_config": {
+    "_name_or_path": "",
+    "add_cross_attention": false,
+    "aff_block_r": 4,
+    "architectures": null,
+    "attention_probs_dropout_prob": 0.0,
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bos_token_id": null,
+    "chunk_size_feed_forward": 0,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "depths": [
+      2,
+      2,
+      12,
+      2
+    ],
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "drop_path_rate": 0.0,
+    "early_stopping": false,
+    "enable_fusion": false,
+    "enable_patch_layer_norm": true,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": null,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "flatten_patch_embeds": true,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "fusion_type": null,
+    "hidden_act": "gelu",
+    "hidden_dropout_prob": 0.1,
+    "hidden_size": 1024,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "initializer_factor": 1.0,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "layer_norm_eps": 1e-05,
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "min_length": 0,
+    "mlp_ratio": 4.0,
+    "model_type": "clap_audio_model",
+    "no_repeat_ngram_size": 0,
+    "num_attention_heads": [
+      4,
+      8,
+      16,
+      32
+    ],
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_classes": 527,
+    "num_hidden_layers": 4,
+    "num_mel_bins": 64,
+    "num_return_sequences": 1,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": null,
+    "patch_embed_input_channels": 1,
+    "patch_embeds_hidden_size": 128,
+    "patch_size": 4,
+    "patch_stride": [
+      4,
+      4
+    ],
+    "prefix": null,
+    "problem_type": null,
+    "projection_dim": 512,
+    "projection_hidden_act": "relu",
+    "pruned_heads": {},
+    "qkv_bias": true,
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "sep_token_id": null,
+    "spec_size": 256,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": true,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": null,
+    "torchscript": false,
+    "transformers_version": "4.30.2",
+    "typical_p": 1.0,
+    "use_bfloat16": false,
+    "window_size": 8
+  },
+  "hidden_size": 768,
+  "initializer_factor": 1.0,
+  "logit_scale_init_value": 14.285714285714285,
+  "model_type": "clap",
+  "num_hidden_layers": 16,
+  "projection_dim": 512,
+  "projection_hidden_act": "relu",
+  "text_config": {
+    "_name_or_path": "",
+    "add_cross_attention": false,
+    "architectures": null,
+    "attention_probs_dropout_prob": 0.1,
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bos_token_id": 0,
+    "chunk_size_feed_forward": 0,
+    "classifier_dropout": null,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "early_stopping": false,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": 2,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "hidden_act": "gelu",
+    "hidden_dropout_prob": 0.1,
+    "hidden_size": 768,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "initializer_factor": 1.0,
+    "initializer_range": 0.02,
+    "intermediate_size": 3072,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "layer_norm_eps": 1e-12,
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "max_position_embeddings": 514,
+    "min_length": 0,
+    "model_type": "clap_text_model",
+    "no_repeat_ngram_size": 0,
+    "num_attention_heads": 12,
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_hidden_layers": 12,
+    "num_return_sequences": 1,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": 1,
+    "position_embedding_type": "absolute",
+    "prefix": null,
+    "problem_type": null,
+    "projection_dim": 512,
+    "projection_hidden_act": "relu",
+    "pruned_heads": {},
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "sep_token_id": null,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": true,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": null,
+    "torchscript": false,
+    "transformers_version": "4.30.2",
+    "type_vocab_size": 1,
+    "typical_p": 1.0,
+    "use_bfloat16": false,
+    "use_cache": true,
+    "vocab_size": 50265
+  },
+  "torch_dtype": "float32",
+  "transformers_version": "4.35.0.dev0"
+}

models/checkpoint-500/pytorch_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f65b89ff9341fe02f2c83e381f83f1599d90c2e0c037aea39894cdbacfcc5678
+size 776452854

models/checkpoint-500/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0145eb2bfb043a6b54a9c6889cb8adfa1128d6a25befd3bfc130e9e393a9ffde
+size 14244

models/checkpoint-500/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:7acd664636e5a7597958f170516014abdca4dc3c8b6440d5f6081ff7d62fb1cd
+size 1064

models/checkpoint-500/trainer_state.json ADDED Viewed

	@@ -0,0 +1,174 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 0.9861932938856016,
+  "global_step": 500,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.04,
+      "learning_rate": 3.944773175542407e-08,
+      "loss": 4.1595,
+      "step": 20
+    },
+    {
+      "epoch": 0.08,
+      "learning_rate": 7.889546351084814e-08,
+      "loss": 4.1591,
+      "step": 40
+    },
+    {
+      "epoch": 0.12,
+      "learning_rate": 1.183431952662722e-07,
+      "loss": 4.159,
+      "step": 60
+    },
+    {
+      "epoch": 0.16,
+      "learning_rate": 1.5779092702169629e-07,
+      "loss": 4.1588,
+      "step": 80
+    },
+    {
+      "epoch": 0.2,
+      "learning_rate": 1.9723865877712034e-07,
+      "loss": 4.1589,
+      "step": 100
+    },
+    {
+      "epoch": 0.24,
+      "learning_rate": 2.366863905325444e-07,
+      "loss": 4.1591,
+      "step": 120
+    },
+    {
+      "epoch": 0.28,
+      "learning_rate": 2.7613412228796843e-07,
+      "loss": 4.1591,
+      "step": 140
+    },
+    {
+      "epoch": 0.32,
+      "learning_rate": 3.1558185404339257e-07,
+      "loss": 4.159,
+      "step": 160
+    },
+    {
+      "epoch": 0.36,
+      "learning_rate": 3.550295857988166e-07,
+      "loss": 4.1589,
+      "step": 180
+    },
+    {
+      "epoch": 0.39,
+      "learning_rate": 3.944773175542407e-07,
+      "loss": 4.159,
+      "step": 200
+    },
+    {
+      "epoch": 0.43,
+      "learning_rate": 4.339250493096647e-07,
+      "loss": 4.1591,
+      "step": 220
+    },
+    {
+      "epoch": 0.47,
+      "learning_rate": 4.733727810650888e-07,
+      "loss": 4.1591,
+      "step": 240
+    },
+    {
+      "epoch": 0.51,
+      "learning_rate": 5.128205128205128e-07,
+      "loss": 4.1589,
+      "step": 260
+    },
+    {
+      "epoch": 0.55,
+      "learning_rate": 5.522682445759369e-07,
+      "loss": 4.1589,
+      "step": 280
+    },
+    {
+      "epoch": 0.59,
+      "learning_rate": 5.91715976331361e-07,
+      "loss": 4.1591,
+      "step": 300
+    },
+    {
+      "epoch": 0.63,
+      "learning_rate": 6.311637080867851e-07,
+      "loss": 4.1588,
+      "step": 320
+    },
+    {
+      "epoch": 0.67,
+      "learning_rate": 6.706114398422091e-07,
+      "loss": 4.1589,
+      "step": 340
+    },
+    {
+      "epoch": 0.71,
+      "learning_rate": 7.100591715976332e-07,
+      "loss": 4.1589,
+      "step": 360
+    },
+    {
+      "epoch": 0.75,
+      "learning_rate": 7.495069033530572e-07,
+      "loss": 4.1587,
+      "step": 380
+    },
+    {
+      "epoch": 0.79,
+      "learning_rate": 7.889546351084814e-07,
+      "loss": 4.1587,
+      "step": 400
+    },
+    {
+      "epoch": 0.83,
+      "learning_rate": 8.284023668639055e-07,
+      "loss": 4.159,
+      "step": 420
+    },
+    {
+      "epoch": 0.87,
+      "learning_rate": 8.678500986193294e-07,
+      "loss": 4.1588,
+      "step": 440
+    },
+    {
+      "epoch": 0.91,
+      "learning_rate": 9.072978303747536e-07,
+      "loss": 4.1589,
+      "step": 460
+    },
+    {
+      "epoch": 0.95,
+      "learning_rate": 9.467455621301776e-07,
+      "loss": 4.1589,
+      "step": 480
+    },
+    {
+      "epoch": 0.99,
+      "learning_rate": 9.861932938856016e-07,
+      "loss": 4.1588,
+      "step": 500
+    },
+    {
+      "epoch": 0.99,
+      "eval_loss": 4.158804893493652,
+      "eval_runtime": 67.7811,
+      "eval_samples_per_second": 88.638,
+      "eval_steps_per_second": 0.177,
+      "step": 500
+    }
+  ],
+  "max_steps": 50700,
+  "num_train_epochs": 100,
+  "total_flos": 1.21829989023744e+17,
+  "trial_name": null,
+  "trial_params": null
+}

models/checkpoint-500/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4df838ef988efa77991d544c0f2afde996b0f0ca9ef7ccbe236caf5dbb119b48
+size 4344