Text Generation
Transformers
Safetensors
qwen3_5_text
dense
coding
agentic
unimodal
repackaged
quantized
compressed-tensors
int4
conversational
Instructions to use Jaidchen/Focus-Red-Int4 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jaidchen/Focus-Red-Int4 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Jaidchen/Focus-Red-Int4") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("Jaidchen/Focus-Red-Int4") model = AutoModelForCausalLM.from_pretrained("Jaidchen/Focus-Red-Int4", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Jaidchen/Focus-Red-Int4 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Jaidchen/Focus-Red-Int4" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jaidchen/Focus-Red-Int4", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/Jaidchen/Focus-Red-Int4
- SGLang
How to use Jaidchen/Focus-Red-Int4 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Jaidchen/Focus-Red-Int4" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jaidchen/Focus-Red-Int4", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Jaidchen/Focus-Red-Int4" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jaidchen/Focus-Red-Int4", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use Jaidchen/Focus-Red-Int4 with Docker Model Runner:
docker model run hf.co/Jaidchen/Focus-Red-Int4
File size: 6,585 Bytes
186d814 | 1 | {"attention_bias":false,"attention_dropout":0,"attn_output_gate":true,"bos_token_id":248044,"dtype":"bfloat16","eos_token_id":248044,"full_attention_interval":4,"head_dim":256,"hidden_act":"silu","hidden_size":5120,"initializer_range":0.02,"intermediate_size":17408,"layer_types":["linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention","linear_attention","linear_attention","linear_attention","full_attention"],"linear_conv_kernel_dim":4,"linear_key_head_dim":128,"linear_num_key_heads":16,"linear_num_value_heads":48,"linear_value_head_dim":128,"mamba_ssm_dtype":"float32","max_position_embeddings":262144,"model_type":"qwen3_5_text","num_attention_heads":24,"num_hidden_layers":64,"num_key_value_heads":4,"output_gate_type":"swish","pad_token_id":null,"partial_rotary_factor":0.25,"rms_norm_eps":0.000001,"rope_parameters":{"mrope_interleaved":true,"mrope_section":[11,11,10],"partial_rotary_factor":0.25,"rope_theta":10000000,"rope_type":"default"},"tie_word_embeddings":false,"use_cache":true,"vocab_size":248320,"architectures":["Qwen3_5ForCausalLM"],"transformers_version":"5.8.0.dev0","quantization_config":{"config_groups":{"group_0":{"format":"pack-quantized","input_activations":null,"output_activations":null,"targets":["Linear"],"weights":{"actorder":null,"block_structure":null,"dynamic":false,"group_size":32,"num_bits":4,"observer":"mse","observer_kwargs":{},"scale_dtype":null,"strategy":"group","symmetric":false,"type":"int","zp_dtype":"torch.int8"}}},"format":"pack-quantized","global_compression_ratio":null,"ignore":["model.layers.0.linear_attn.in_proj_a","model.layers.0.linear_attn.in_proj_b","model.layers.1.linear_attn.in_proj_a","model.layers.1.linear_attn.in_proj_b","model.layers.10.linear_attn.in_proj_a","model.layers.10.linear_attn.in_proj_b","model.layers.12.linear_attn.in_proj_a","model.layers.12.linear_attn.in_proj_b","model.layers.13.linear_attn.in_proj_a","model.layers.13.linear_attn.in_proj_b","model.layers.14.linear_attn.in_proj_a","model.layers.14.linear_attn.in_proj_b","model.layers.16.linear_attn.in_proj_a","model.layers.16.linear_attn.in_proj_b","model.layers.17.linear_attn.in_proj_a","model.layers.17.linear_attn.in_proj_b","model.layers.18.linear_attn.in_proj_a","model.layers.18.linear_attn.in_proj_b","model.layers.2.linear_attn.in_proj_a","model.layers.2.linear_attn.in_proj_b","model.layers.20.linear_attn.in_proj_a","model.layers.20.linear_attn.in_proj_b","model.layers.21.linear_attn.in_proj_a","model.layers.21.linear_attn.in_proj_b","model.layers.22.linear_attn.in_proj_a","model.layers.22.linear_attn.in_proj_b","model.layers.24.linear_attn.in_proj_a","model.layers.24.linear_attn.in_proj_b","model.layers.25.linear_attn.in_proj_a","model.layers.25.linear_attn.in_proj_b","model.layers.26.linear_attn.in_proj_a","model.layers.26.linear_attn.in_proj_b","model.layers.28.linear_attn.in_proj_a","model.layers.28.linear_attn.in_proj_b","model.layers.29.linear_attn.in_proj_a","model.layers.29.linear_attn.in_proj_b","model.layers.30.linear_attn.in_proj_a","model.layers.30.linear_attn.in_proj_b","model.layers.32.linear_attn.in_proj_a","model.layers.32.linear_attn.in_proj_b","model.layers.33.linear_attn.in_proj_a","model.layers.33.linear_attn.in_proj_b","model.layers.34.linear_attn.in_proj_a","model.layers.34.linear_attn.in_proj_b","model.layers.36.linear_attn.in_proj_a","model.layers.36.linear_attn.in_proj_b","model.layers.37.linear_attn.in_proj_a","model.layers.37.linear_attn.in_proj_b","model.layers.38.linear_attn.in_proj_a","model.layers.38.linear_attn.in_proj_b","model.layers.4.linear_attn.in_proj_a","model.layers.4.linear_attn.in_proj_b","model.layers.40.linear_attn.in_proj_a","model.layers.40.linear_attn.in_proj_b","model.layers.41.linear_attn.in_proj_a","model.layers.41.linear_attn.in_proj_b","model.layers.42.linear_attn.in_proj_a","model.layers.42.linear_attn.in_proj_b","model.layers.44.linear_attn.in_proj_a","model.layers.44.linear_attn.in_proj_b","model.layers.45.linear_attn.in_proj_a","model.layers.45.linear_attn.in_proj_b","model.layers.46.linear_attn.in_proj_a","model.layers.46.linear_attn.in_proj_b","model.layers.48.linear_attn.in_proj_a","model.layers.48.linear_attn.in_proj_b","model.layers.49.linear_attn.in_proj_a","model.layers.49.linear_attn.in_proj_b","model.layers.5.linear_attn.in_proj_a","model.layers.5.linear_attn.in_proj_b","model.layers.50.linear_attn.in_proj_a","model.layers.50.linear_attn.in_proj_b","model.layers.52.linear_attn.in_proj_a","model.layers.52.linear_attn.in_proj_b","model.layers.53.linear_attn.in_proj_a","model.layers.53.linear_attn.in_proj_b","model.layers.54.linear_attn.in_proj_a","model.layers.54.linear_attn.in_proj_b","model.layers.56.linear_attn.in_proj_a","model.layers.56.linear_attn.in_proj_b","model.layers.57.linear_attn.in_proj_a","model.layers.57.linear_attn.in_proj_b","model.layers.58.linear_attn.in_proj_a","model.layers.58.linear_attn.in_proj_b","model.layers.6.linear_attn.in_proj_a","model.layers.6.linear_attn.in_proj_b","model.layers.60.linear_attn.in_proj_a","model.layers.60.linear_attn.in_proj_b","model.layers.61.linear_attn.in_proj_a","model.layers.61.linear_attn.in_proj_b","model.layers.62.linear_attn.in_proj_a","model.layers.62.linear_attn.in_proj_b","model.layers.8.linear_attn.in_proj_a","model.layers.8.linear_attn.in_proj_b","model.layers.9.linear_attn.in_proj_a","model.layers.9.linear_attn.in_proj_b","lm_head"],"kv_cache_scheme":null,"quant_method":"compressed-tensors","quantization_status":"compressed","sparsity_config":{},"transform_config":{},"version":"0.18.0"}} |