RestoreKV-Llama-3.1-8B-Instruct

PEFT LoRA adapter + restore-token embeddings for RestoreKV (paper), a budget-matched, single-pass plug-in that recovers full-cache behavior under aggressive KV cache eviction on top of KVzip.

  • Base model: meta-llama/Llama-3.1-8B-Instruct — base scorer: KVzip
  • adapter_model.safetensors: rank-8 LoRA (α=16) on q/k/v/o/gate/up/down proj
  • restore_embeddings.safetensors: 8 learned restore-token embeddings

Load via the RestoreKVPress in NVIDIA/kvpress.

License

CC BY-NC 4.0 (distilled with LongAlpaca-derived data; research / non-commercial).

Downloads last month
10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for higokri/RestoreKV-Llama-3.1-8B-Instruct

Adapter
(2783)
this model

Collection including higokri/RestoreKV-Llama-3.1-8B-Instruct

Paper for higokri/RestoreKV-Llama-3.1-8B-Instruct