Image-Text-to-Text
Transformers
Safetensors
kimi_k3
feature-extraction
smaug
abacusai
agentic
compressed-tensors
conversational
custom_code
8-bit precision
Instructions to use abacusai/Smaug-Agentic with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use abacusai/Smaug-Agentic with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="abacusai/Smaug-Agentic", trust_remote_code=True) messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("abacusai/Smaug-Agentic", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use abacusai/Smaug-Agentic with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "abacusai/Smaug-Agentic" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "abacusai/Smaug-Agentic", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/abacusai/Smaug-Agentic
- SGLang
How to use abacusai/Smaug-Agentic with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "abacusai/Smaug-Agentic" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "abacusai/Smaug-Agentic", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "abacusai/Smaug-Agentic" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "abacusai/Smaug-Agentic", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }' - Docker Model Runner
How to use abacusai/Smaug-Agentic with Docker Model Runner:
docker model run hf.co/abacusai/Smaug-Agentic
| tags: | |
| - kimi_k3 | |
| - smaug | |
| - abacusai | |
| - agentic | |
| - compressed-tensors | |
| - conversational | |
| - custom_code | |
| license: other | |
| license_name: "kimi-k3" | |
| license_link: https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE | |
| library_name: transformers | |
| pipeline_tag: image-text-to-text | |
| base_model: moonshotai/Kimi-K3 | |
| <div align="center"> | |
| <picture> | |
| <img src="https://cdn-avatars.huggingface.co/v1/production/uploads/63128dd099791aa61d180c72/dJ6uR23m09M-YEafBpmea.png" width="20%" alt="Smaug-Agentic"> | |
| </picture> | |
| </div> | |
| <hr> | |
| <div align="center" style="line-height:1"> | |
| <a href="https://abacus.ai" target="_blank"><img alt="Homepage" src="https://img.shields.io/badge/Homepage-Abacus.AI-white?color=1783ff&logoColor=white"/></a> | |
| <a href="https://huggingface.co/abacusai" target="_blank"><img alt="Hugging Face" src="https://img.shields.io/badge/%F0%9F%A4%97%20Hugging%20Face-Abacus.AI-ffc107?color=ffc107&logoColor=white"/></a> | |
| </div> | |
| <div align="center" style="line-height: 1;"> | |
| <a href="https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE"><img alt="License" src="https://img.shields.io/badge/License-Kimi_K3-f5de53?&color=f5de53"/></a> | |
| </div> | |
| ## 1. Model Introduction | |
| Smaug-Agentic is an agentic fine-tune of [Kimi K3](https://huggingface.co/moonshotai/Kimi-K3), the 2.8T-parameter Mixture-of-Experts model from Moonshot AI, finetuned by Abacus.AI. It continues the Smaug line from [Smaug-72B-v0.1](https://huggingface.co/abacusai/Smaug-72B-v0.1) — the first open-source model to pass an average score of 80% on the HuggingFace Open LLM Leaderboard — scaled to a frontier MoE base and targeted at long-horizon tool use and coding agents. | |
| The fine-tune adapts behaviour only. Every architectural parameter is unchanged from Kimi K3, so any inference stack that serves K3 serves this model. | |
| ### Key Features | |
| - **Agentic Post-Training**: Supervised fine-tuning on filtered multi-turn, tool-using coding trajectories, with reasoning tokens masked from the loss — the model sees its own thinking in context but is never supervised on it. | |
| - **Architecturally Identical to Kimi K3**: Same 2.8T MoE, same 1M-token context, same MoonViT-V2 vision encoder, same tokenizer. A drop-in replacement for existing K3 deployments. | |
| - **Bounded Deliberation**: Typical reasoning length is unchanged while the runaway tail collapses — p99 reasoning falls to 0.62× of base on SciCode and 0.55× on AA-LCR, with no loss of answer detail. | |
| - **Interleaved Thinking Preserved**: `reasoning_content` survives across turns, so multi-step agent loops keep the model's chain of thought. | |
| - **Native MXFP4 Weights**: Inherited from the base model, for broad hardware compatibility. | |
| ## 2. Model Summary | |
| <div align="center"> | |
| <table> | |
| <tbody> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Architecture</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">Mixture-of-Experts (MoE)</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Total Parameters</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">2.8T</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Activated Parameters</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">104B</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Layers</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">93</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Dense Layers</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">1</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Attention-Layer Composition</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">69 KDA + 24 Gated MLA</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Attention Hidden Dimension</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">7168</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Attention Heads</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">96</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Latent MoE Dimension</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">3584</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>MoE Hidden Dimension (per Expert)</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">3072</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Experts</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">896</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Selected Experts per Token</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">16</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Shared Experts</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">2</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Vocabulary Size</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">160K</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Context Length</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">1,048,576</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Attention Mechanism</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">KDA & Gated MLA</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Activation Function</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">SiTU-GLU</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Vision Encoder</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">MoonViT-V2 (401M)</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Quantization</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">MXFP4 weights / MXFP8 activations</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Modality</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">Text, Image</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Base Model</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><code>moonshotai/Kimi-K3</code></td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Adaptation</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">Supervised fine-tuning (agentic trajectories)</td> | |
| </tr> | |
| </tbody> | |
| </table> | |
| </div> | |
| ## 3. Evaluation Results | |
| This table lists only the benchmarks we ran ourselves. Reference columns reproduce the officially published [Kimi K3](https://huggingface.co/moonshotai/Kimi-K3) numbers and the accompanying figures for the other models; we did not re-run them. | |
| <div align="center"> | |
| <table> | |
| <thead> | |
| <tr> | |
| <th align="center" style="text-align: center">Benchmark</th> | |
| <th align="center" style="text-align: center"><sup><strong>Smaug-Agentic</strong><br><sup>(max)</sup></sup></th> | |
| <th align="center" style="text-align: center"><sup>Kimi K3<br><sup>(max)</sup></sup></th> | |
| <th align="center" style="text-align: center"><sup>Claude Fable 5<br><sup>(max, w/ fallback)</sup></sup></th> | |
| <th align="center" style="text-align: center"><sup>GPT-5.6 Sol<br><sup>(max)</sup></sup></th> | |
| <th align="center" style="text-align: center"><sup>Claude Opus 4.8<br><sup>(max)</sup></sup></th> | |
| <th align="center" style="text-align: center"><sup>GPT-5.5<br><sup>(xhigh)</sup></sup></th> | |
| <th align="center" style="text-align: center"><sup>GLM-5.2<br><sup>(max)</sup></sup></th> | |
| </tr> | |
| </thead> | |
| <tbody> | |
| <tr> | |
| <td align="center" colspan=8 style="text-align: center"><strong>Reasoning & Knowledge</strong></td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center">GPQA Diamond</td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>94.1</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">93.5</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">92.6</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">94.1</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">91.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">93.5</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">91.2</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center">AA-LCR</td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>75.7</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">74.7</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">70.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">73.7</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">67.7</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">74.3</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">71.3</td> | |
| </tr> | |
| <tr> | |
| <td align="center" colspan=8 style="text-align: center"><strong>Agentic Coding</strong></td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center">DeepSWE</td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>69.9</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">67.5</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">70.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">73.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">59.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">67.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">46.2</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center">Terminal-Bench 2.1</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">86.5</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">88.3</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">88.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">88.8</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">84.6</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">83.4</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">82.7</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center">SciCode</td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>60.8</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">58.7</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">60.2</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">56.1</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">53.5</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">56.1</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">50.5</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center">LiveBench (Agentic Coding)</td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>64.6</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">62.2</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">62.2</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">56.2</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">50.5</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">54.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">51.8</td> | |
| </tr> | |
| <tr> | |
| <td align="center" colspan=8 style="text-align: center"><strong>Agentic Tool Use</strong></td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center">AutomationBench</td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>31.0</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">30.8</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">29.1</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">29.7</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">27.2</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">22.7</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">12.9</td> | |
| </tr> | |
| <tr> | |
| <td align="center" colspan=8 style="text-align: center"><strong>Vision</strong></td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center">MMMU-Pro</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">81.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">81.6</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">81.2</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">83.0</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">78.9</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">81.2</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">—</td> | |
| </tr> | |
| </tbody> | |
| </table> | |
| </div> | |
| **Notes** | |
| All Smaug-Agentic results were produced on a dedicated 8×B300 deployment at temperature = 1.0 and reasoning effort 'max', following the Kimi K3 top-p convention: top-p = 0.95 for single-step tasks, top-p = 1.0 for agentic tasks. | |
| - GPQA Diamond and AA-LCR scores are the average of 3 runs. | |
| - DeepSWE: top run using mini-swe-agent. | |
| - Terminal-Bench 2.1: scored with the Terminus 2 agent; the official Kimi K3 number uses the Kimi Code agent, on which we scored lower (76.4). | |
| - SciCode: test split, prompt with background. Includes a repair for an upstream gold-injection defect that leaves 12 subproblems unwinnable; contributed upstream as [scicode-bench/SciCode#61](https://github.com/scicode-bench/SciCode/pull/61). | |
| - LiveBench: complete data for all models on the [LiveBench leaderboard](https://livebench.ai). | |
| - MMMU-Pro: `standard` (10-option) setting, single pass, no tool augmentation. | |
| ## 4. Behavioral Differences vs. Kimi K3 | |
| The benchmark deltas above are small. The behavioural change is not. Everything below is measured on paired runs at identical sampling settings (temperature = 1.0, top-p = 0.95, reasoning effort 'max', same completion cap, same task set), so none of it is a temperature artifact. | |
| ### 4.1 Bounded deliberation — typical reasoning is unchanged, the runaway tail collapses | |
| The single largest behavioural difference. Per-subproblem paired comparison on SciCode (288 subproblems, identical protocol), measuring characters of `reasoning_content`: | |
| <div align="center"> | |
| <table> | |
| <thead> | |
| <tr> | |
| <th align="center" style="text-align: center">Reasoning length</th> | |
| <th align="center" style="text-align: center"><sup><strong>Smaug-Agentic</strong></sup></th> | |
| <th align="center" style="text-align: center"><sup>Kimi K3</sup></th> | |
| <th align="center" style="text-align: center"><sup>Ratio</sup></th> | |
| </tr> | |
| </thead> | |
| <tbody> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>p50</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">2,062</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">2,138</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">0.96×</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>p75</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">4,960</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">5,748</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">0.86×</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>p90</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">12,853</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">18,245</td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>0.70×</strong></td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>p99</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">59,902</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">96,112</td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>0.62×</strong></td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>max</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">109,923</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">179,807</td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>0.61×</strong></td> | |
| </tr> | |
| </tbody> | |
| </table> | |
| </div> | |
| The median is untouched; the tail is halved. Counting the pathological cases directly: | |
| <div align="center"> | |
| <table> | |
| <thead> | |
| <tr> | |
| <th align="center" style="text-align: center">Pathological cases</th> | |
| <th align="center" style="text-align: center"><sup><strong>Smaug-Agentic</strong></sup></th> | |
| <th align="center" style="text-align: center"><sup>Kimi K3</sup></th> | |
| </tr> | |
| </thead> | |
| <tbody> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Subproblems thinking >40k chars</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">7</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">13</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Subproblems thinking >60k chars</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>3</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>8</strong></td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>Hit the 65k completion cap (truncated)</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>0</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>2</strong></td> | |
| </tr> | |
| </tbody> | |
| </table> | |
| </div> | |
| This replicates on a completely different benchmark. On AA-LCR (100 long-context questions, ~95k-token prompts) median reasoning is actually *slightly longer* for Smaug-Agentic (2,573 vs 2,308 chars), while p99 drops from 39,945 to 21,836 (**0.55×**) and the maximum from 40,344 to 30,734. | |
| Two unrelated task distributions, same signature: **normal deliberation is preserved, unbounded deliberation is suppressed.** In practice this shows up as fewer requests that burn the entire token budget without producing an answer. | |
| ### 4.2 It is *not* simply terser | |
| A natural worry is that the fine-tune just shortened everything. It did not. On GPQA Diamond, where both arms ran on the same serving stack, the visible answer length distribution is statistically indistinguishable: | |
| <div align="center"> | |
| <table> | |
| <thead> | |
| <tr> | |
| <th align="center" style="text-align: center">Visible answer chars</th> | |
| <th align="center" style="text-align: center"><sup><strong>Smaug-Agentic</strong></sup></th> | |
| <th align="center" style="text-align: center"><sup>Kimi K3</sup></th> | |
| <th align="center" style="text-align: center"><sup>Ratio</sup></th> | |
| </tr> | |
| </thead> | |
| <tbody> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>p50</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">757</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">779</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">0.97×</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>p90</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">1,164</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">1,155</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">1.01×</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>p99</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">1,731</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">1,747</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">0.99×</td> | |
| </tr> | |
| <tr> | |
| <td align="center" style="vertical-align: middle; text-align: center"><strong>mean</strong></td> | |
| <td align="center" style="vertical-align: middle; text-align: center">810</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">834</td> | |
| <td align="center" style="vertical-align: middle; text-align: center">0.97×</td> | |
| </tr> | |
| </tbody> | |
| </table> | |
| </div> | |
| Smaug-Agentic is shorter on 103 of 198 questions — a coin flip. Answer *style* is inherited from the base model intact; what changed is the willingness to deliberate without bound. | |
| ### 4.3 One decisive shell action per turn, sustained over very long loops | |
| This is what the training data optimises for, and it transfers cleanly. Across 113 DeepSWE tasks and 7h33m of continuous agentic work: **0 infrastructure errors, 0 timeouts**, and a median of **78 agent steps per task** (p90 159, max 218). Tasks that passed used *more* steps than tasks that failed (median 80 vs 70), i.e. failures are not the model giving up early. | |
| ## 5. Deployment | |
| > [!Note] | |
| > Because the architecture is unchanged, Smaug-Agentic runs anywhere Kimi K3 runs. The inference engines below serve it with the recipes published for the base model: | |
| - [vLLM](https://github.com/vllm-project/vllm) — see [recipes](https://recipes.vllm.ai/moonshotai/Kimi-K3) | |
| - [SGLang](https://github.com/sgl-project/sglang) — see [cookbook](https://docs.sglang.io/cookbook/autoregressive/Moonshotai/Kimi-K3) | |
| - [TokenSpeed](https://github.com/lightseekorg/tokenspeed) — see [recipes](https://lightseek.org/tokenspeed/recipes/models#kimi-k3) | |
| --- | |
| ## 6. Model Usage | |
| Sampling behaviour is inherited from Kimi K3, and these settings were used for every number above. | |
| Smaug-Agentic always has thinking enabled, and will return `reasoning_content`. Thinking effort is configured with the top-level `reasoning_effort` request field, which supports `"low"`, `"high"`, and `"max"` (default `"max"`). Set `temperature = 1.0`, with `top_p = 0.95` for single-step tasks and `top_p = 1.0` for agentic tasks. | |
| Like the base model, Smaug-Agentic was trained in the preserved thinking history mode. For multi-turn conversations and tool calls, the complete assistant message returned by the API must be passed back to `messages` as-is — including `reasoning_content` and `tool_calls`, not just `content`. | |
| ### Coding Agent Framework | |
| The model is trained for multi-turn tool use and works with agent frameworks that speak the OpenAI chat-completions contract. | |
| One practical note from our own evaluation: some OpenAI-compatible servers reject non-standard fields echoed back in conversation history (`provider_specific_fields`, `function_call`, `annotations`, `refusal`, `audio`). Strip those before re-sending. `reasoning_content` and `tool_calls` are accepted and should be kept, so that interleaved thinking survives across turns. | |
| --- | |
| ## 7. License | |
| Smaug-Agentic is a derivative of Kimi K3 and is released under the [Kimi K3 License](https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE), inherited from the base model. Users must comply with the base model's terms. | |
| --- | |
| ## 8. Citation | |
| ```bibtex | |
| @misc{abacusai2026smaugagentic, | |
| title = {Smaug-Agentic}, | |
| author = {Abacus.AI}, | |
| year = {2026}, | |
| note = {Agentic supervised fine-tune of moonshotai/Kimi-K3}, | |
| url = {https://huggingface.co/abacusai/Smaug-Agentic} | |
| } | |
| ``` | |
| The Smaug line and the DPO-Positive method behind it: | |
| ```bibtex | |
| @article{pal2024smaug, | |
| title={Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive}, | |
| author={Pal, Arka and Karkhanis, Deep and Dooley, Samuel and | |
| Roberts, Manley and Naidu, Siddartha and White, Colin}, | |
| journal={arXiv preprint arXiv:2402.13228}, | |
| year={2024} | |
| } | |
| ``` | |
| --- | |
| ## 9. Contact Us | |
| If you have any questions, please reach out at [Abacus.AI](https://abacus.ai). | |