Loading error using unsloth/ggml lama.cpp

#1
by WhiteDan64 - opened

When I try to load this model with last build of (unsloth) llama.cpp, I get the following error:

[57846] 0.00.525.847 I print_info: file format = GGUF V3 (latest)
[57846] 0.00.525.848 I print_info: file type   = (guessed) all F32
[57846] 0.00.525.850 I print_info: file size   = 89.87 GiB (2.41 BPW)
[57846] 0.00.529.541 E llama_model_load: error loading model: unknown model architecture: 'glm5-next'
[57846] 0.00.529.546 E llama_model_load_from_file_impl: failed to load model
[57846] 0.00.529.553 E cmn  common_init_: failed to load model 'C:\AiProjects\models\antirez\glm-5.3-flash-gguf\GLM-5.3-Flash-Q2.gguf'

I was able to load the unsloth GGUF version, because in this case

[62596] 0.05.393.193 I common_params_fit_impl:   - CUDA0 (NVIDIA GeForce RTX 5070 Ti): 46 layers (41 overflowing),  13054 MiB used,   1836 MiB free
[62596] 0.05.393.246 I common_fit_params: successfully fit params to free device memory
[62596] 0.05.393.252 I common_fit_params: fitting params to free memory took 5.16 seconds
[62596] 0.05.451.990 I llama_model_loader: additional 2 GGUFs metadata loaded.
[62596] 0.05.451.996 I llama_model_loader: loaded meta data with 72 key-value pairs and 1412 tensors from C:\AiProjects\models\unsloth\GLM-5.3-Flash-GGUF\UD-IQ1_M\GLM-5.3-Flash-UD-IQ1_M-00001-of-00003.gguf (version GGUF V3 (latest))
[62596] 0.05.452.039 I llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
[62596] 0.05.452.042 I llama_model_loader: - kv   0:                       general.architecture str              = glm5next
[62596] 0.05.452.042 I llama_model_loader: - kv   1:                               general.type str              = model
[62596] 0.05.452.047 I llama_model_loader: - kv   2:                     general.sampling.top_p f32              = 0.950000
[62596] 0.05.452.048 I llama_model_loader: - kv   3:                      general.sampling.temp f32              = 1.000000
[62596] 0.05.452.048 I llama_model_loader: - kv   4:                               general.name str              = GLM 5.3 Flash
[62596] 0.05.452.049 I llama_model_loader: - kv   5:                         general.size_label str              = 288x10B
[62596] 0.05.452.049 I llama_model_loader: - kv   6:                            general.license str              = mit
[62596] 0.05.452.059 I llama_model_loader: - kv   7:                               general.tags arr[str,2]       = ["conversational", "unsloth"]

It seems that the identifier of the architecture adopted by llama.cpp is "glm5next" and not "glm5-next".

I hope that you can adopt the same identifier in your GGUF

Grazie

Here the full unsloth layer:

[62596] 0.05.452.042 I llama_model_loader: - kv   0:                       general.architecture str              = glm5next
[62596] 0.05.452.042 I llama_model_loader: - kv   1:                               general.type str              = model
[62596] 0.05.452.047 I llama_model_loader: - kv   2:                     general.sampling.top_p f32              = 0.950000
[62596] 0.05.452.048 I llama_model_loader: - kv   3:                      general.sampling.temp f32              = 1.000000
[62596] 0.05.452.048 I llama_model_loader: - kv   4:                               general.name str              = GLM 5.3 Flash
[62596] 0.05.452.049 I llama_model_loader: - kv   5:                         general.size_label str              = 288x10B
[62596] 0.05.452.049 I llama_model_loader: - kv   6:                            general.license str              = mit
[62596] 0.05.452.059 I llama_model_loader: - kv   7:                               general.tags arr[str,2]       = ["conversational", "unsloth"]
[62596] 0.05.452.060 I llama_model_loader: - kv   8:                          general.languages arr[str,2]       = ["en", "zh"]
[62596] 0.05.452.061 I llama_model_loader: - kv   9:                       glm5next.block_count u32              = 46
[62596] 0.05.452.062 I llama_model_loader: - kv  10:                    glm5next.context_length u32              = 1048576
[62596] 0.05.452.062 I llama_model_loader: - kv  11:                  glm5next.embedding_length u32              = 4096
[62596] 0.05.452.063 I llama_model_loader: - kv  12:               glm5next.feed_forward_length u32              = 12288
[62596] 0.05.452.063 I llama_model_loader: - kv  13:              glm5next.attention.head_count u32              = 64
[62596] 0.05.452.065 I llama_model_loader: - kv  14:  glm5next.attention.layer_norm_rms_epsilon f32              = 0.000010
[62596] 0.05.452.065 I llama_model_loader: - kv  15:                      glm5next.expert_count u32              = 288
[62596] 0.05.452.066 I llama_model_loader: - kv  16:                 glm5next.expert_used_count u32              = 8
[62596] 0.05.452.066 I llama_model_loader: - kv  17:                glm5next.expert_group_count u32              = 1
[62596] 0.05.452.066 I llama_model_loader: - kv  18:           glm5next.expert_group_used_count u32              = 1
[62596] 0.05.452.067 I llama_model_loader: - kv  19:                glm5next.expert_gating_func u32              = 2
[62596] 0.05.452.067 I llama_model_loader: - kv  20:                        glm5next.vocab_size u32              = 154880
[62596] 0.05.452.075 I llama_model_loader: - kv  21:           glm5next.attention.head_count_kv arr[i32,46]      = [0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, ...
[62596] 0.05.452.076 I llama_model_loader: - kv  22:             glm5next.attention.q_lora_rank u32              = 1536
[62596] 0.05.452.076 I llama_model_loader: - kv  23:            glm5next.attention.kv_lora_rank u32              = 512
[62596] 0.05.452.077 I llama_model_loader: - kv  24:              glm5next.rope.dimension_count u32              = 0
[62596] 0.05.452.077 I llama_model_loader: - kv  25:              glm5next.attention.key_length u32              = 512
[62596] 0.05.452.077 I llama_model_loader: - kv  26:            glm5next.attention.value_length u32              = 512
[62596] 0.05.452.078 I llama_model_loader: - kv  27:          glm5next.attention.key_length_mla u32              = 256
[62596] 0.05.452.078 I llama_model_loader: - kv  28:        glm5next.attention.value_length_mla u32              = 256
[62596] 0.05.452.079 I llama_model_loader: - kv  29:      glm5next.attention.layer_norm_epsilon f32              = 0.000001
[62596] 0.05.452.080 I llama_model_loader: - kv  30:                   glm5next.ssm.conv_kernel u32              = 4
[62596] 0.05.452.080 I llama_model_loader: - kv  31:                      glm5next.kda.head_dim u32              = 128
[62596] 0.05.452.081 I llama_model_loader: - kv  32:              glm5next.kda.gate_lower_bound f32              = -5.000000
[62596] 0.05.452.082 I llama_model_loader: - kv  33:      glm5next.attention.indexer.head_count u32              = 32
[62596] 0.05.452.082 I llama_model_loader: - kv  34:      glm5next.attention.indexer.key_length u32              = 128
[62596] 0.05.452.082 I llama_model_loader: - kv  35:           glm5next.attention.indexer.top_k u32              = 2048
[62596] 0.05.452.083 I llama_model_loader: - kv  36:           glm5next.attention.indexer.kpool u32              = 4
[62596] 0.05.452.083 I llama_model_loader: - kv  37:            glm5next.hyper_connection.count u32              = 4
[62596] 0.05.452.084 I llama_model_loader: - kv  38: glm5next.hyper_connection.sinkhorn_iterations u32              = 20
[62596] 0.05.452.084 I llama_model_loader: - kv  39:          glm5next.hyper_connection.epsilon f32              = 0.000001
[62596] 0.05.452.085 I llama_model_loader: - kv  40:        glm5next.expert_feed_forward_length u32              = 2048
[62596] 0.05.452.085 I llama_model_loader: - kv  41: glm5next.expert_shared_feed_forward_length u32              = 2048
[62596] 0.05.452.086 I llama_model_loader: - kv  42:               glm5next.expert_shared_count u32              = 1
[62596] 0.05.452.086 I llama_model_loader: - kv  43:         glm5next.leading_dense_block_count u32              = 3
[62596] 0.05.452.087 I llama_model_loader: - kv  44:              glm5next.expert_weights_scale f32              = 2.500000
[62596] 0.05.452.088 I llama_model_loader: - kv  45:               glm5next.expert_weights_norm bool             = true
[62596] 0.05.452.102 I llama_model_loader: - kv  46:                  glm5next.swiglu_clamp_exp arr[f32,46]      = [10.000000, 10.000000, 10.000000, 10....
[62596] 0.05.452.115 I llama_model_loader: - kv  47:                glm5next.swiglu_clamp_shexp arr[f32,46]      = [10.000000, 10.000000, 10.000000, 10....
[62596] 0.05.452.116 I llama_model_loader: - kv  48:              glm5next.nextn_predict_layers u32              = 1
[62596] 0.05.452.116 I llama_model_loader: - kv  49:                       tokenizer.ggml.model str              = gpt2
[62596] 0.05.452.116 I llama_model_loader: - kv  50:                         tokenizer.ggml.pre str              = glm4
[62596] 0.05.480.068 I llama_model_loader: - kv  51:                      tokenizer.ggml.tokens arr[str,154880]  = ["!", "\"", "#", "$", "%", "&", "'", ...
[62596] 0.05.491.701 I llama_model_loader: - kv  52:                  tokenizer.ggml.token_type arr[i32,154880]  = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
[62596] 0.05.549.690 I llama_model_loader: - kv  53:                      tokenizer.ggml.merges arr[str,321649]  = ["Ġ Ġ", "Ġ ĠĠĠ", "ĠĠ ĠĠ", "...
[62596] 0.05.549.697 I llama_model_loader: - kv  54:                tokenizer.ggml.eos_token_id u32              = 154820
[62596] 0.05.549.698 I llama_model_loader: - kv  55:            tokenizer.ggml.padding_token_id u32              = 154820
[62596] 0.05.549.700 I llama_model_loader: - kv  56:                tokenizer.ggml.bos_token_id u32              = 154822
[62596] 0.05.549.701 I llama_model_loader: - kv  57:                tokenizer.ggml.eot_token_id u32              = 154827
[62596] 0.05.549.701 I llama_model_loader: - kv  58:            tokenizer.ggml.unknown_token_id u32              = 154820
[62596] 0.05.549.701 I llama_model_loader: - kv  59:                tokenizer.ggml.eom_token_id u32              = 154829
[62596] 0.05.549.702 I llama_model_loader: - kv  60:               general.quantization_version u32              = 2
[62596] 0.05.549.703 I llama_model_loader: - kv  61:                          general.file_type u32              = 31
[62596] 0.05.549.704 I llama_model_loader: - kv  62:                      quantize.imatrix.file str              = GLM-5.3-Flash-GGUF/imatrix_unsloth.gguf
[62596] 0.05.549.705 I llama_model_loader: - kv  63:                   quantize.imatrix.dataset str              = unsloth_calibration_GLM-5.3-Flash.txt
[62596] 0.05.549.705 I llama_model_loader: - kv  64:             quantize.imatrix.entries_count u32              = 809
[62596] 0.05.549.706 I llama_model_loader: - kv  65:              quantize.imatrix.chunks_count u32              = 88
[62596] 0.05.549.706 I llama_model_loader: - kv  66:                                   split.no u16              = 0
[62596] 0.05.549.707 I llama_model_loader: - kv  67:                        split.tensors.count i32              = 1412
[62596] 0.05.549.708 I llama_model_loader: - kv  68:                                split.count u16              = 3
[62596] 0.05.549.714 I llama_model_loader: - kv  69:                    tokenizer.chat_template str              = [gMASK]<sop>\n{%- set effective_reason...
[62596] 0.05.549.715 I llama_model_loader: - kv  70:                       general.quantized_by str              = Unsloth
[62596] 0.05.549.715 I llama_model_loader: - kv  71:                           general.repo_url str              = https://huggingface.co/unsloth
[62596] 0.05.549.716 I llama_model_loader: - type  f32:  638 tensors
[62596] 0.05.549.716 I llama_model_loader: - type q8_0:  346 tensors
[62596] 0.05.549.717 I llama_model_loader: - type q2_K:    2 tensors
[62596] 0.05.549.717 I llama_model_loader: - type q3_K:    1 tensors
[62596] 0.05.549.717 I llama_model_loader: - type q4_K:    2 tensors
[62596] 0.05.549.718 I llama_model_loader: - type q5_K:  248 tensors
[62596] 0.05.549.718 I llama_model_loader: - type q6_K:   49 tensors
[62596] 0.05.549.718 I llama_model_loader: - type iq2_xxs:   42 tensors
[62596] 0.05.549.718 I llama_model_loader: - type iq3_xxs:   39 tensors
[62596] 0.05.549.719 I llama_model_loader: - type iq4_xs:    3 tensors
[62596] 0.05.549.719 I llama_model_loader: - type iq1_m:   42 tensors
[62596] 0.05.549.720 I print_info: file format = GGUF V3 (latest)
[62596] 0.05.549.720 I print_info: file type   = IQ1_M - 1.75 bpw
[62596] 0.05.549.724 I print_info: file size   = 90.87 GiB (2.43 BPW)
[62596] 0.05.549.816 I llama_prepare_model_devices: using device CUDA0 (NVIDIA GeForce RTX 5070 Ti) (0000:01:00.0) - 15037 MiB free
[62596] 0.05.549.871 I load_arch_hparams: indexer selection width = 2051 cells (512 pools of 4, plus a 3-wide tail)
[62596] 0.05.684.102 I load: 0 unused tokens
[62596] 0.05.704.576 W load: special_eot_id is not in special_eog_ids - the tokenizer config may be incorrect
[62596] 0.05.704.583 W load: special_eom_id is not in special_eog_ids - the tokenizer config may be incorrect
[62596] 0.05.704.583 I load: printing all EOG tokens:
[62596] 0.05.704.583 I load:   - 154820 ('<|endoftext|>')
[62596] 0.05.704.584 I load:   - 154827 ('<|user|>')
[62596] 0.05.704.584 I load:   - 154829 ('<|observation|>')
[62596] 0.05.704.894 I load: special tokens cache size = 36
[62596] 0.05.727.194 I load: token to piece cache size = 0.9811 MB
[62596] 0.05.727.213 I print_info: arch                  = glm5next
[62596] 0.05.727.213 I print_info: vocab_only            = 0
[62596] 0.05.727.214 I print_info: no_alloc              = 0
[62596] 0.05.727.214 I print_info: n_ctx_train           = 1048576
[62596] 0.05.727.215 I print_info: n_embd_inp            = 4096
[62596] 0.05.727.215 I print_info: n_embd                = 4096
[62596] 0.05.727.215 I print_info: n_embd_out            = 4096
[62596] 0.05.727.215 I print_info: n_layer               = 45
[62596] 0.05.727.216 I print_info: n_layer_all           = 46
[62596] 0.05.727.226 I print_info: n_head                = 64
[62596] 0.05.727.236 I print_info: n_head_kv             = [0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 0, 0, 1, 0, 1]
[62596] 0.05.727.237 I print_info: n_rot                 = 0
[62596] 0.05.727.237 I print_info: n_swa                 = 0
[62596] 0.05.727.237 I print_info: is_swa_any            = 0
[62596] 0.05.727.238 I print_info: n_embd_head_k         = 512
[62596] 0.05.727.238 I print_info: n_embd_head_v         = 512
[62596] 0.05.727.247 I print_info: n_gqa                 = [0, 0, 0, 64, 0, 0, 0, 64, 0, 0, 0, 64, 0, 0, 0, 64, 0, 0, 0, 64, 0, 0, 0, 64, 0, 0, 0, 64, 0, 0, 0, 64, 0, 0, 0, 64, 0, 0, 0, 64, 0, 0, 0, 64, 0, 64]
[62596] 0.05.727.255 I print_info: n_embd_k_gqa          = [0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 512]
[62596] 0.05.727.264 I print_info: n_embd_v_gqa          = [0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 0, 0, 512, 0, 512]
[62596] 0.05.727.265 I print_info: f_norm_eps            = 1.0e-06
[62596] 0.05.727.266 I print_info: f_norm_rms_eps        = 1.0e-05
[62596] 0.05.727.266 I print_info: f_clamp_kqv           = 0.0e+00
[62596] 0.05.727.267 I print_info: f_max_alibi_bias      = 0.0e+00
[62596] 0.05.727.267 I print_info: f_logit_scale         = 0.0e+00
[62596] 0.05.727.267 I print_info: f_attn_scale          = 0.0e+00
[62596] 0.05.727.268 I print_info: f_attn_value_scale    = 0.0000
[62596] 0.05.727.269 I print_info: n_ff                  = 12288
[62596] 0.05.727.270 I print_info: n_expert              = 288
[62596] 0.05.727.270 I print_info: n_expert_used         = 8
[62596] 0.05.727.270 I print_info: n_expert_groups       = 1
[62596] 0.05.727.270 I print_info: n_group_used          = 1
[62596] 0.05.727.271 I print_info: causal attn           = 1
[62596] 0.05.727.271 I print_info: pooling type          = -1
[62596] 0.05.727.271 I print_info: rope type             = -1
[62596] 0.05.727.271 I print_info: rope scaling          = linear
[62596] 0.05.727.272 I print_info: freq_base_train       = 10000.0
[62596] 0.05.727.273 I print_info: freq_scale_train      = 1
[62596] 0.05.727.273 I print_info: n_ctx_orig_yarn       = 1048576
[62596] 0.05.727.273 I print_info: rope_yarn_log_mul     = 0.0000
[62596] 0.05.727.274 I print_info: rope_finetuned        = unknown
[62596] 0.05.727.275 I print_info: model type            = 313B.A17B
[62596] 0.05.727.275 I print_info: model params          = 320.76 B
[62596] 0.05.727.275 I print_info: general.name          = GLM 5.3 Flash
[62596] 0.05.727.277 I print_info: vocab type            = BPE
[62596] 0.05.727.277 I print_info: n_vocab               = 154880
[62596] 0.05.727.277 I print_info: n_merges              = 321649
[62596] 0.05.727.277 I print_info: BOS token             = 154822 '[gMASK]'
[62596] 0.05.727.278 I print_info: EOS token             = 154820 '<|endoftext|>'
[62596] 0.05.727.278 I print_info: EOT token             = 154827 '<|user|>'
[62596] 0.05.727.278 I print_info: EOM token             = 154829 '<|observation|>'
[62596] 0.05.727.279 I print_info: UNK token             = 154820 '<|endoftext|>'
[62596] 0.05.727.279 I print_info: PAD token             = 154820 '<|endoftext|>'
[62596] 0.05.727.279 I print_info: LF token              = 198 'Ċ'
[62596] 0.05.727.280 I print_info: FIM PRE token         = 154838 '<|code_prefix|>'
[62596] 0.05.727.280 I print_info: FIM SUF token         = 154840 '<|code_suffix|>'
[62596] 0.05.727.280 I print_info: FIM MID token         = 154839 '<|code_middle|>'
[62596] 0.05.727.280 I print_info: EOG token             = 154820 '<|endoftext|>'
[62596] 0.05.727.281 I print_info: EOG token             = 154827 '<|user|>'
[62596] 0.05.727.281 I print_info: EOG token             = 154829 '<|observation|>'
[62596] 0.05.727.281 I print_info: max token length      = 1024
[62596] 0.05.727.326 I load_tensors: loading model tensors, this can take a while... (load_mode = mmap)

This GGUF is specific for DwarfStar, could not be compatible with other inference engines.

antirez changed discussion status to closed

Sign up or log in to comment