Text Generation
MLX
Safetensors
llama
apple-silicon
quantized
mixed-precision
axquant
axq
development
minicpm5
6bit
6-bit
conversational
4-bit precision
Instructions to use AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit with MLX:
# Make sure mlx-lm is installed # pip install --upgrade mlx-lm # Generate text with mlx-lm from mlx_lm import load, generate model, tokenizer = load("AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit") prompt = "Write a story about Einstein" messages = [{"role": "user", "content": prompt}] prompt = tokenizer.apply_chat_template( messages, add_generation_prompt=True ) text = generate(model, tokenizer, prompt=prompt, verbose=True) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
- Pi
How to use AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit with Pi:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit"
Configure the model in Pi
# Install Pi: npm install -g @mariozechner/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "mlx-lm": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Hermes Agent new
How to use AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit with Hermes Agent:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit"
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit
Run Hermes
hermes
- OpenClaw new
How to use AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit with OpenClaw:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit"
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit" \ --custom-provider-id mlx-lm \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
- MLX LM
How to use AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit with MLX LM:
Generate or start a chat session
# Install MLX LM uv tool install mlx-lm # Interactive chat REPL mlx_lm.chat --model "AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit"
Run an OpenAI-compatible server
# Install MLX LM uv tool install mlx-lm # Start the server mlx_lm.server --model "AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit" # Calling the OpenAI-compatible server with curl curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "AutomatosX/AX-MiniCPM5-1B-MLX-AXQ-6bit", "messages": [ {"role": "user", "content": "Hello"} ] }'
| { | |
| "analysis_sha256": "9c44404877f61bcdbcdc87bbb90214da353855153b72f0e4947a6f9051947e6d", | |
| "architecture_profile": { | |
| "adapter_id": "minicpm5-dense-v1", | |
| "config_model_type": "llama", | |
| "dense": true, | |
| "mtp_declared": false, | |
| "notes": [], | |
| "optimization_scope": "text-path", | |
| "product_family": "minicpm5", | |
| "support_level": "supported", | |
| "support_tier": "convertible", | |
| "text_layer_count": 24, | |
| "vision_present": false | |
| }, | |
| "assignments": [ | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "lm_head", | |
| "outlier_strategy": "none", | |
| "parameters": 200540160, | |
| "predicted_loss": 0.0, | |
| "reason": "protected lm_head policy", | |
| "role": "lm_head", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "lm_head.weight" | |
| }, | |
| { | |
| "bits": 8, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.0253125, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.045000000000000005, | |
| "long_context_loss": 0.016875, | |
| "mtp_acceptance_loss": 0.0045000000000000005, | |
| "output_kl": 0.05625, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.036562500000000005, | |
| "token_disagreement": 0.030937500000000003 | |
| }, | |
| "module_path": "model.embed_tokens", | |
| "outlier_strategy": "none", | |
| "parameters": 200540160, | |
| "predicted_loss": 0.0307125, | |
| "reason": "protected embedding policy", | |
| "role": "embedding", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 3, | |
| "storage_bpw": 8.5 | |
| }, | |
| "tensor": "model.embed_tokens.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.0.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.0.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.0.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.0.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.0.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.0.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.0.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.0.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.0.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.0.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.0.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.0.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.0.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.0.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.0.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.0.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.0.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.0.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.1.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.1.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.1.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.1.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.1.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.1.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.1.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.1.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.1.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.1.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.1.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.1.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.1.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.1.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.1.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.1.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.1.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.1.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.10.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.10.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.10.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.10.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.10.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.10.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.10.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.10.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.10.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.10.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.10.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.10.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.10.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.10.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.10.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.10.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.10.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.10.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.11.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.11.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.11.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.11.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.11.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.11.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.11.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.11.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.11.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.11.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.11.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.11.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.11.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.11.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.11.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.11.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.11.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.11.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.12.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.12.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.12.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.12.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.12.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.12.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.12.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.12.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.12.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.12.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.12.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.12.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.12.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.12.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.12.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.12.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.12.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.12.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.13.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.13.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.13.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.13.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.13.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.13.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.13.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.13.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.13.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.13.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.13.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.13.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.13.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.13.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.13.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.13.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.13.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.13.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.14.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.14.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.14.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.14.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.14.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.14.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.14.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.14.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.14.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.14.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.14.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.14.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.14.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.14.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.14.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.14.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.14.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.14.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.15.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.15.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.15.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.15.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.15.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.15.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.15.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.15.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.15.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.15.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.15.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.15.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.15.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.15.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.15.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.15.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.15.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.15.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.16.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.16.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.16.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.16.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.16.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.16.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.16.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.16.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.16.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.16.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.16.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.16.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.16.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.16.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.16.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.16.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.16.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.16.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.17.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.17.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.17.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.17.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.17.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.17.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.17.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.17.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.17.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.17.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.17.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.17.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.17.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.17.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.17.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.17.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.17.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.17.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.18.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.18.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.18.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.18.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.18.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.18.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.18.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.18.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.18.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.18.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.18.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.18.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.18.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.18.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.18.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.18.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.18.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.18.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.19.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.19.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.19.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.19.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.19.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.19.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.19.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.19.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.19.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.19.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.19.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.19.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.19.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.19.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.19.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.19.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.19.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.19.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.2.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.2.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.2.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.2.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.2.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.2.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.2.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.2.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.2.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.2.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.2.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.2.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.2.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.2.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.2.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.2.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.2.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.2.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.20.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.20.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.20.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.20.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.20.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.20.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.20.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.20.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.20.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.20.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.20.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.20.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.20.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.20.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.20.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.20.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.20.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.20.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.21.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.21.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.21.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.21.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.21.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.21.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.21.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.21.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.21.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.21.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.21.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.21.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.21.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.21.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.21.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.21.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.21.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.21.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.22.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.22.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.22.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.22.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.22.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.22.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.22.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.22.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.22.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.22.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.22.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.22.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.22.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.22.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.22.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.22.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.22.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.22.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.23.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.23.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.23.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.23.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.23.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.23.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.23.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.23.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.23.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.23.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.23.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.23.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.23.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.23.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.23.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.23.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.23.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.23.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.3.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.3.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.3.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.3.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.3.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.3.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.3.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.3.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.3.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.3.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.3.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.3.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.3.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.3.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.3.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.3.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.3.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.3.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.4.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.4.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.4.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.4.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.4.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.4.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.4.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.4.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.4.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.4.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.4.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.4.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.4.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.4.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.4.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.4.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.4.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.4.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.5.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.5.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.5.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.5.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.5.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.5.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.5.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.5.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.5.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.5.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.5.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.5.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.5.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.5.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.5.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.5.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.5.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.5.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.6.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.6.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.6.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.6.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.6.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.6.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.6.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.6.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.6.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.6.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.6.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.6.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.6.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.6.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.6.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.6.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 32, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.22910259710444142, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.4072935059634514, | |
| "long_context_loss": 0.6363961030678927, | |
| "mtp_acceptance_loss": 0.04072935059634514, | |
| "output_kl": 0.5091168824543142, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.33092597359530423, | |
| "token_disagreement": 0.2800142853498728 | |
| }, | |
| "module_path": "model.layers.6.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.31667070088658344, | |
| "reason": "selected by marginal quality gain per storage bit", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 5.0 | |
| }, | |
| "tensor": "model.layers.6.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.7.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.7.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.7.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.7.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.7.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.7.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.7.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.7.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.7.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.7.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 32, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.22910259710444142, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.4072935059634514, | |
| "long_context_loss": 0.6363961030678927, | |
| "mtp_acceptance_loss": 0.04072935059634514, | |
| "output_kl": 0.5091168824543142, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.33092597359530423, | |
| "token_disagreement": 0.2800142853498728 | |
| }, | |
| "module_path": "model.layers.7.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.31667070088658344, | |
| "reason": "selected by marginal quality gain per storage bit", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 5.0 | |
| }, | |
| "tensor": "model.layers.7.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.7.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.7.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.7.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.7.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 32, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.22910259710444142, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.4072935059634514, | |
| "long_context_loss": 0.6363961030678927, | |
| "mtp_acceptance_loss": 0.04072935059634514, | |
| "output_kl": 0.5091168824543142, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.33092597359530423, | |
| "token_disagreement": 0.2800142853498728 | |
| }, | |
| "module_path": "model.layers.7.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.31667070088658344, | |
| "reason": "selected by marginal quality gain per storage bit", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 5.0 | |
| }, | |
| "tensor": "model.layers.7.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.8.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.8.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.8.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.8.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.8.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.8.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.8.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.8.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.8.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.8.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 32, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.22910259710444142, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.4072935059634514, | |
| "long_context_loss": 0.6363961030678927, | |
| "mtp_acceptance_loss": 0.04072935059634514, | |
| "output_kl": 0.5091168824543142, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.33092597359530423, | |
| "token_disagreement": 0.2800142853498728 | |
| }, | |
| "module_path": "model.layers.8.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.31667070088658344, | |
| "reason": "selected by marginal quality gain per storage bit", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 5.0 | |
| }, | |
| "tensor": "model.layers.8.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.8.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.8.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.8.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.8.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 32, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.22910259710444142, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.4072935059634514, | |
| "long_context_loss": 0.6363961030678927, | |
| "mtp_acceptance_loss": 0.04072935059634514, | |
| "output_kl": 0.5091168824543142, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.33092597359530423, | |
| "token_disagreement": 0.2800142853498728 | |
| }, | |
| "module_path": "model.layers.8.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.31667070088658344, | |
| "reason": "selected by marginal quality gain per storage bit", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 5.0 | |
| }, | |
| "tensor": "model.layers.8.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.9.input_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.9.input_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.9.mlp.down_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.9.mlp.down_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.9.mlp.gate_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.9.mlp.gate_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.2025, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.36000000000000004, | |
| "long_context_loss": 0.135, | |
| "mtp_acceptance_loss": 0.036000000000000004, | |
| "output_kl": 0.45, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.29250000000000004, | |
| "token_disagreement": 0.24750000000000003 | |
| }, | |
| "module_path": "model.layers.9.mlp.up_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 7077888, | |
| "predicted_loss": 0.2457, | |
| "reason": "minimum storage candidate", | |
| "role": "mlp", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.9.mlp.up_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.layers.9.post_attention_layernorm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.layers.9.post_attention_layernorm.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 32, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.22910259710444142, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.4072935059634514, | |
| "long_context_loss": 0.6363961030678927, | |
| "mtp_acceptance_loss": 0.04072935059634514, | |
| "output_kl": 0.5091168824543142, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.33092597359530423, | |
| "token_disagreement": 0.2800142853498728 | |
| }, | |
| "module_path": "model.layers.9.self_attn.k_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.31667070088658344, | |
| "reason": "selected by marginal quality gain per storage bit", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 5.0 | |
| }, | |
| "tensor": "model.layers.9.self_attn.k_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 64, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.324, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.576, | |
| "long_context_loss": 0.8999999999999999, | |
| "mtp_acceptance_loss": 0.0576, | |
| "output_kl": 0.72, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.46799999999999997, | |
| "token_disagreement": 0.396 | |
| }, | |
| "module_path": "model.layers.9.self_attn.o_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.44783999999999996, | |
| "reason": "minimum storage candidate", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 4.5 | |
| }, | |
| "tensor": "model.layers.9.self_attn.o_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 32, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.22910259710444142, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.4072935059634514, | |
| "long_context_loss": 0.6363961030678927, | |
| "mtp_acceptance_loss": 0.04072935059634514, | |
| "output_kl": 0.5091168824543142, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.33092597359530423, | |
| "token_disagreement": 0.2800142853498728 | |
| }, | |
| "module_path": "model.layers.9.self_attn.q_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 3145728, | |
| "predicted_loss": 0.31667070088658344, | |
| "reason": "selected by marginal quality gain per storage bit", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 5.0 | |
| }, | |
| "tensor": "model.layers.9.self_attn.q_proj.weight" | |
| }, | |
| { | |
| "bits": 4, | |
| "group_size": 32, | |
| "method": "affine", | |
| "metrics": { | |
| "cosine_distance": 0.22910259710444142, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.4072935059634514, | |
| "long_context_loss": 0.6363961030678927, | |
| "mtp_acceptance_loss": 0.04072935059634514, | |
| "output_kl": 0.5091168824543142, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.33092597359530423, | |
| "token_disagreement": 0.2800142853498728 | |
| }, | |
| "module_path": "model.layers.9.self_attn.v_proj", | |
| "outlier_strategy": "none", | |
| "parameters": 393216, | |
| "predicted_loss": 0.31667070088658344, | |
| "reason": "selected by marginal quality gain per storage bit", | |
| "role": "attention", | |
| "scale_strategy": "group-affine", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 7, | |
| "storage_bpw": 5.0 | |
| }, | |
| "tensor": "model.layers.9.self_attn.v_proj.weight" | |
| }, | |
| { | |
| "bits": 16, | |
| "group_size": null, | |
| "method": "bf16", | |
| "metrics": { | |
| "cosine_distance": 0.0, | |
| "decode_latency_cost": 0.0, | |
| "hidden_state_error": 0.0, | |
| "long_context_loss": 0.0, | |
| "mtp_acceptance_loss": 0.0, | |
| "output_kl": 0.0, | |
| "peak_memory_cost": 0.0, | |
| "prefill_latency_cost": 0.0, | |
| "task_loss_delta": 0.0, | |
| "token_disagreement": 0.0 | |
| }, | |
| "module_path": "model.norm", | |
| "outlier_strategy": "none", | |
| "parameters": 1536, | |
| "predicted_loss": 0.0, | |
| "reason": "non-quantizable tensor preserved", | |
| "role": "norm", | |
| "scale_strategy": "none", | |
| "strategy_metadata": { | |
| "selected_from_candidates": 1, | |
| "storage_bpw": 16.0 | |
| }, | |
| "tensor": "model.norm.weight" | |
| } | |
| ], | |
| "calibration": null, | |
| "candidate_bits": [ | |
| 4, | |
| 6, | |
| 8, | |
| 16 | |
| ], | |
| "candidate_group_sizes": [ | |
| 32, | |
| 64 | |
| ], | |
| "constraints": { | |
| "effective_bpw_limit": 7.38, | |
| "lm_head_min_bits": 16, | |
| "max_model_size_ratio_to_uniform4": 1.1, | |
| "minimum_mtp_acceptance_retention": 0.95, | |
| "minimum_mtp_speedup": 1.2, | |
| "minimum_quality_retention": 0.98 | |
| }, | |
| "created_at": "2026-08-02T18:28:16.773889Z", | |
| "effective_bpw": 7.379967222761561, | |
| "evidence_kind": "architecture_prior", | |
| "global_validation_required": true, | |
| "group_size": 32, | |
| "hardware": { | |
| "name": "ax-engine-apple-silicon-affine-dwq-v2", | |
| "runtime": "ax-engine", | |
| "supported_bits": [ | |
| 2, | |
| 3, | |
| 4, | |
| 6, | |
| 8, | |
| 16 | |
| ], | |
| "supported_group_sizes": [ | |
| 32, | |
| 64, | |
| 128 | |
| ], | |
| "supported_methods": [ | |
| "affine", | |
| "awq", | |
| "dwq", | |
| "bf16" | |
| ] | |
| }, | |
| "kv_cache": null, | |
| "mtp": { | |
| "candidate_bits": [ | |
| 8, | |
| 16 | |
| ], | |
| "min_bits": 8, | |
| "mode": "protected", | |
| "optimize_for_acceptance": true, | |
| "preserve_external_sidecar": true, | |
| "protect_norms": true, | |
| "protect_output_head": true | |
| }, | |
| "mtp_distribution": {}, | |
| "nominal_bpw": 6.970061276094932, | |
| "objective": { | |
| "cosine_distance": 0.05, | |
| "decode_latency_cost": 0.05, | |
| "hidden_state_error": 0.12, | |
| "long_context_loss": 0.08, | |
| "mtp_acceptance_loss": 0.15, | |
| "output_kl": 0.25, | |
| "peak_memory_cost": 0.04, | |
| "prefill_latency_cost": 0.03, | |
| "task_loss_delta": 0.15, | |
| "token_disagreement": 0.08 | |
| }, | |
| "primary_runtime": "ax-engine", | |
| "profile": "general", | |
| "quantizer": "axquant", | |
| "random_seed": 0, | |
| "schema_version": "axquant.plan.v1", | |
| "software_versions": { | |
| "ax_engine": null, | |
| "axquant": "1.0.0", | |
| "mlx": "0.32.0", | |
| "mlx_lm": "0.31.3", | |
| "pydantic": "2.13.4", | |
| "python": "3.13.14", | |
| "safetensors": "0.8.0" | |
| }, | |
| "source_model": { | |
| "architecture": "LlamaForCausalLM", | |
| "format": "mlx", | |
| "local_path": null, | |
| "model_id": "openbmb/MiniCPM5-1B", | |
| "revision": null | |
| }, | |
| "status": "planned", | |
| "target_bpw": 7.38, | |
| "target_class": "4bit", | |
| "target_mode": "low-memory", | |
| "warnings": [ | |
| "This report contains architecture priors, not calibration measurements.", | |
| "Conversion planning requires --allow-unmeasured for this report.", | |
| "Multi-group architecture priors weakly prefer smaller group sizes; this is development evidence only (AXQ-028).", | |
| "Plan uses non-release architecture_prior evidence and requires complete-model validation.", | |
| "target BPW raised from 6.0000 to 7.3800 to satisfy protection floors (policy minimum 7.3772)", | |
| "convert ladder: prior" | |
| ], | |
| "weight_distribution": { | |
| "4bit": { | |
| "fraction": 0.6287771645272388, | |
| "parameters": 679477248 | |
| }, | |
| "8bit": { | |
| "fraction": 0.18557659369727533, | |
| "parameters": 200540160 | |
| }, | |
| "bf16": { | |
| "fraction": 0.18564624177548586, | |
| "parameters": 200615424 | |
| } | |
| } | |
| } | |