File size: 25,431 Bytes
a73c283
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
7654e56
a73c283
 
 
 
 
 
 
 
 
 
 
 
 
 
8c3e1e5
a73c283
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
7654e56
a73c283
 
 
 
 
 
 
 
 
 
 
 
 
 
a864d62
a73c283
 
 
 
 
 
 
 
 
a864d62
a73c283
 
 
 
 
 
 
 
 
 
 
 
a864d62
a73c283
 
 
 
 
 
 
 
 
a864d62
a73c283
 
 
 
 
 
 
 
 
a864d62
a73c283
 
 
 
 
 
 
 
 
a864d62
a73c283
 
 
 
 
 
 
 
 
 
 
 
a864d62
a73c283
17f5c51
 
 
 
 
a73c283
 
 
 
 
 
a864d62
a73c283
 
 
 
 
 
 
 
 
 
 
a864d62
a73c283
7654e56
a73c283
a864d62
 
 
 
50a0d6f
a864d62
a73c283
 
 
 
 
 
 
 
 
 
 
 
 
 
7654e56
a73c283
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
7654e56
a73c283
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
7654e56
a73c283
 
 
 
 
 
 
 
 
 
 
 
7654e56
a73c283
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
7654e56
a73c283
 
 
 
 
 
 
 
7654e56
a73c283
 
 
 
 
 
 
 
 
 
7654e56
a73c283
7654e56
a73c283
 
 
 
 
 
 
 
 
 
 
7654e56
a73c283
 
 
 
 
 
7654e56
 
a73c283
 
 
7654e56
a73c283
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
---
tags:
- kimi_k3
- smaug
- abacusai
- agentic
- compressed-tensors
- conversational
- custom_code
license: other
license_name: "kimi-k3"
license_link: https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
library_name: transformers
pipeline_tag: image-text-to-text
base_model: moonshotai/Kimi-K3
---
<div align="center">
  <picture>
      <img src="https://cdn-avatars.huggingface.co/v1/production/uploads/63128dd099791aa61d180c72/dJ6uR23m09M-YEafBpmea.png" width="20%" alt="Smaug-Agentic">
  </picture>
</div>
<hr>
<div align="center" style="line-height:1">
  <a href="https://abacus.ai" target="_blank"><img alt="Homepage" src="https://img.shields.io/badge/Homepage-Abacus.AI-white?color=1783ff&logoColor=white"/></a>
  <a href="https://huggingface.co/abacusai" target="_blank"><img alt="Hugging Face" src="https://img.shields.io/badge/%F0%9F%A4%97%20Hugging%20Face-Abacus.AI-ffc107?color=ffc107&logoColor=white"/></a>
</div>
<div align="center" style="line-height: 1;">
  <a href="https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE"><img alt="License" src="https://img.shields.io/badge/License-Kimi_K3-f5de53?&color=f5de53"/></a>
</div>


## 1. Model Introduction

Smaug-Agentic is an agentic fine-tune of [Kimi K3](https://huggingface.co/moonshotai/Kimi-K3), the 2.8T-parameter Mixture-of-Experts model from Moonshot AI, finetuned by Abacus.AI. It continues the Smaug line from [Smaug-72B-v0.1](https://huggingface.co/abacusai/Smaug-72B-v0.1) — the first open-source model to pass an average score of 80% on the HuggingFace Open LLM Leaderboard — scaled to a frontier MoE base and targeted at long-horizon tool use and coding agents.

The fine-tune adapts behaviour only. Every architectural parameter is unchanged from Kimi K3, so any inference stack that serves K3 serves this model.

### Key Features
- **Agentic Post-Training**: Supervised fine-tuning on filtered multi-turn, tool-using coding trajectories, with reasoning tokens masked from the loss — the model sees its own thinking in context but is never supervised on it.
- **Architecturally Identical to Kimi K3**: Same 2.8T MoE, same 1M-token context, same MoonViT-V2 vision encoder, same tokenizer. A drop-in replacement for existing K3 deployments.
- **Bounded Deliberation**: Typical reasoning length is unchanged while the runaway tail collapses — p99 reasoning falls to 0.62× of base on SciCode and 0.55× on AA-LCR, with no loss of answer detail.
- **Interleaved Thinking Preserved**: `reasoning_content` survives across turns, so multi-step agent loops keep the model's chain of thought.
- **Native MXFP4 Weights**: Inherited from the base model, for broad hardware compatibility.
## 2. Model Summary

<div align="center">
<table>
<tbody>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Architecture</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">Mixture-of-Experts (MoE)</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Total Parameters</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">2.8T</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Activated Parameters</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">104B</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Layers</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">93</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Dense Layers</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">1</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Attention-Layer Composition</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">69 KDA + 24 Gated MLA</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Attention Hidden Dimension</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">7168</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Attention Heads</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">96</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Latent MoE Dimension</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">3584</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>MoE Hidden Dimension (per Expert)</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">3072</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Experts</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">896</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Selected Experts per Token</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">16</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Number of Shared Experts</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">2</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Vocabulary Size</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">160K</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Context Length</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">1,048,576</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Attention Mechanism</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">KDA &amp; Gated MLA</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Activation Function</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">SiTU-GLU</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Vision Encoder</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">MoonViT-V2 (401M)</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Quantization</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">MXFP4 weights / MXFP8 activations</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Modality</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">Text, Image</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Base Model</strong></td>
<td align="center" style="vertical-align: middle; text-align: center"><code>moonshotai/Kimi-K3</code></td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Adaptation</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">Supervised fine-tuning (agentic trajectories)</td>
</tr>
</tbody>
</table>
</div>

## 3. Evaluation Results

This table lists only the benchmarks we ran ourselves. Reference columns reproduce the officially published [Kimi K3](https://huggingface.co/moonshotai/Kimi-K3) numbers and the accompanying figures for the other models; we did not re-run them.

<div align="center">
<table>
<thead>
<tr>
<th align="center" style="text-align: center">Benchmark</th>
<th align="center" style="text-align: center"><sup><strong>Smaug-Agentic</strong><br><sup>(max)</sup></sup></th>
<th align="center" style="text-align: center"><sup>Kimi K3<br><sup>(max)</sup></sup></th>
<th align="center" style="text-align: center"><sup>Claude Fable 5<br><sup>(max, w/ fallback)</sup></sup></th>
<th align="center" style="text-align: center"><sup>GPT-5.6 Sol<br><sup>(max)</sup></sup></th>
<th align="center" style="text-align: center"><sup>Claude Opus 4.8<br><sup>(max)</sup></sup></th>
<th align="center" style="text-align: center"><sup>GPT-5.5<br><sup>(xhigh)</sup></sup></th>
<th align="center" style="text-align: center"><sup>GLM-5.2<br><sup>(max)</sup></sup></th>
</tr>
</thead>
<tbody>
<tr>
<td align="center" colspan=8 style="text-align: center"><strong>Reasoning &amp; Knowledge</strong></td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center">GPQA Diamond</td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>94.1</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">93.5</td>
<td align="center" style="vertical-align: middle; text-align: center">92.6</td>
<td align="center" style="vertical-align: middle; text-align: center">94.1</td>
<td align="center" style="vertical-align: middle; text-align: center">91.0</td>
<td align="center" style="vertical-align: middle; text-align: center">93.5</td>
<td align="center" style="vertical-align: middle; text-align: center">91.2</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center">AA-LCR</td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>75.7</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">74.7</td>
<td align="center" style="vertical-align: middle; text-align: center">70.0</td>
<td align="center" style="vertical-align: middle; text-align: center">73.7</td>
<td align="center" style="vertical-align: middle; text-align: center">67.7</td>
<td align="center" style="vertical-align: middle; text-align: center">74.3</td>
<td align="center" style="vertical-align: middle; text-align: center">71.3</td>
</tr>
<tr>
<td align="center" colspan=8 style="text-align: center"><strong>Agentic Coding</strong></td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center">DeepSWE</td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>69.9</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">67.5</td>
<td align="center" style="vertical-align: middle; text-align: center">70.0</td>
<td align="center" style="vertical-align: middle; text-align: center">73.0</td>
<td align="center" style="vertical-align: middle; text-align: center">59.0</td>
<td align="center" style="vertical-align: middle; text-align: center">67.0</td>
<td align="center" style="vertical-align: middle; text-align: center">46.2</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center">Terminal-Bench 2.1</td>
<td align="center" style="vertical-align: middle; text-align: center">86.5</td>
<td align="center" style="vertical-align: middle; text-align: center">88.3</td>
<td align="center" style="vertical-align: middle; text-align: center">88.0</td>
<td align="center" style="vertical-align: middle; text-align: center">88.8</td>
<td align="center" style="vertical-align: middle; text-align: center">84.6</td>
<td align="center" style="vertical-align: middle; text-align: center">83.4</td>
<td align="center" style="vertical-align: middle; text-align: center">82.7</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center">SciCode</td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>60.8</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">58.7</td>
<td align="center" style="vertical-align: middle; text-align: center">60.2</td>
<td align="center" style="vertical-align: middle; text-align: center">56.1</td>
<td align="center" style="vertical-align: middle; text-align: center">53.5</td>
<td align="center" style="vertical-align: middle; text-align: center">56.1</td>
<td align="center" style="vertical-align: middle; text-align: center">50.5</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center">LiveBench (Agentic Coding)</td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>64.6</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">62.2</td>
<td align="center" style="vertical-align: middle; text-align: center">62.2</td>
<td align="center" style="vertical-align: middle; text-align: center">56.2</td>
<td align="center" style="vertical-align: middle; text-align: center">50.5</td>
<td align="center" style="vertical-align: middle; text-align: center">54.0</td>
<td align="center" style="vertical-align: middle; text-align: center">51.8</td>
</tr>
<tr>
<td align="center" colspan=8 style="text-align: center"><strong>Agentic Tool Use</strong></td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center">AutomationBench</td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>31.0</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">30.8</td>
<td align="center" style="vertical-align: middle; text-align: center">29.1</td>
<td align="center" style="vertical-align: middle; text-align: center">29.7</td>
<td align="center" style="vertical-align: middle; text-align: center">27.2</td>
<td align="center" style="vertical-align: middle; text-align: center">22.7</td>
<td align="center" style="vertical-align: middle; text-align: center">12.9</td>
</tr>
<tr>
<td align="center" colspan=8 style="text-align: center"><strong>Vision</strong></td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center">MMMU-Pro</td>
<td align="center" style="vertical-align: middle; text-align: center">81.0</td>
<td align="center" style="vertical-align: middle; text-align: center">81.6</td>
<td align="center" style="vertical-align: middle; text-align: center">81.2</td>
<td align="center" style="vertical-align: middle; text-align: center">83.0</td>
<td align="center" style="vertical-align: middle; text-align: center">78.9</td>
<td align="center" style="vertical-align: middle; text-align: center">81.2</td>
<td align="center" style="vertical-align: middle; text-align: center">&mdash;</td>
</tr>
</tbody>
</table>
</div>

**Notes**

All Smaug-Agentic results were produced on a dedicated 8×B300 deployment at temperature = 1.0 and reasoning effort 'max', following the Kimi K3 top-p convention: top-p = 0.95 for single-step tasks, top-p = 1.0 for agentic tasks.

- GPQA Diamond and AA-LCR scores are the average of 3 runs.
- DeepSWE: top run using mini-swe-agent.
- Terminal-Bench 2.1: scored with the Terminus 2 agent; the official Kimi K3 number uses the Kimi Code agent, on which we scored lower (76.4).
- SciCode: test split, prompt with background. Includes a repair for an upstream gold-injection defect that leaves 12 subproblems unwinnable; contributed upstream as [scicode-bench/SciCode#61](https://github.com/scicode-bench/SciCode/pull/61).
- LiveBench: complete data for all models on the [LiveBench leaderboard](https://livebench.ai).
- MMMU-Pro: `standard` (10-option) setting, single pass, no tool augmentation.

## 4. Behavioral Differences vs. Kimi K3

The benchmark deltas above are small. The behavioural change is not. Everything below is measured on paired runs at identical sampling settings (temperature = 1.0, top-p = 0.95, reasoning effort 'max', same completion cap, same task set), so none of it is a temperature artifact.

### 4.1 Bounded deliberation — typical reasoning is unchanged, the runaway tail collapses

The single largest behavioural difference. Per-subproblem paired comparison on SciCode (288 subproblems, identical protocol), measuring characters of `reasoning_content`:

<div align="center">
<table>
<thead>
<tr>
<th align="center" style="text-align: center">Reasoning length</th>
<th align="center" style="text-align: center"><sup><strong>Smaug-Agentic</strong></sup></th>
<th align="center" style="text-align: center"><sup>Kimi K3</sup></th>
<th align="center" style="text-align: center"><sup>Ratio</sup></th>
</tr>
</thead>
<tbody>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>p50</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">2,062</td>
<td align="center" style="vertical-align: middle; text-align: center">2,138</td>
<td align="center" style="vertical-align: middle; text-align: center">0.96&times;</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>p75</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">4,960</td>
<td align="center" style="vertical-align: middle; text-align: center">5,748</td>
<td align="center" style="vertical-align: middle; text-align: center">0.86&times;</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>p90</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">12,853</td>
<td align="center" style="vertical-align: middle; text-align: center">18,245</td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>0.70&times;</strong></td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>p99</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">59,902</td>
<td align="center" style="vertical-align: middle; text-align: center">96,112</td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>0.62&times;</strong></td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>max</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">109,923</td>
<td align="center" style="vertical-align: middle; text-align: center">179,807</td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>0.61&times;</strong></td>
</tr>
</tbody>
</table>
</div>

The median is untouched; the tail is halved. Counting the pathological cases directly:

<div align="center">
<table>
<thead>
<tr>
<th align="center" style="text-align: center">Pathological cases</th>
<th align="center" style="text-align: center"><sup><strong>Smaug-Agentic</strong></sup></th>
<th align="center" style="text-align: center"><sup>Kimi K3</sup></th>
</tr>
</thead>
<tbody>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Subproblems thinking &gt;40k chars</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">7</td>
<td align="center" style="vertical-align: middle; text-align: center">13</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Subproblems thinking &gt;60k chars</strong></td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>3</strong></td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>8</strong></td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>Hit the 65k completion cap (truncated)</strong></td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>0</strong></td>
<td align="center" style="vertical-align: middle; text-align: center"><strong>2</strong></td>
</tr>
</tbody>
</table>
</div>

This replicates on a completely different benchmark. On AA-LCR (100 long-context questions, ~95k-token prompts) median reasoning is actually *slightly longer* for Smaug-Agentic (2,573 vs 2,308 chars), while p99 drops from 39,945 to 21,836 (**0.55×**) and the maximum from 40,344 to 30,734.

Two unrelated task distributions, same signature: **normal deliberation is preserved, unbounded deliberation is suppressed.** In practice this shows up as fewer requests that burn the entire token budget without producing an answer.

### 4.2 It is *not* simply terser

A natural worry is that the fine-tune just shortened everything. It did not. On GPQA Diamond, where both arms ran on the same serving stack, the visible answer length distribution is statistically indistinguishable:

<div align="center">
<table>
<thead>
<tr>
<th align="center" style="text-align: center">Visible answer chars</th>
<th align="center" style="text-align: center"><sup><strong>Smaug-Agentic</strong></sup></th>
<th align="center" style="text-align: center"><sup>Kimi K3</sup></th>
<th align="center" style="text-align: center"><sup>Ratio</sup></th>
</tr>
</thead>
<tbody>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>p50</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">757</td>
<td align="center" style="vertical-align: middle; text-align: center">779</td>
<td align="center" style="vertical-align: middle; text-align: center">0.97&times;</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>p90</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">1,164</td>
<td align="center" style="vertical-align: middle; text-align: center">1,155</td>
<td align="center" style="vertical-align: middle; text-align: center">1.01&times;</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>p99</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">1,731</td>
<td align="center" style="vertical-align: middle; text-align: center">1,747</td>
<td align="center" style="vertical-align: middle; text-align: center">0.99&times;</td>
</tr>
<tr>
<td align="center" style="vertical-align: middle; text-align: center"><strong>mean</strong></td>
<td align="center" style="vertical-align: middle; text-align: center">810</td>
<td align="center" style="vertical-align: middle; text-align: center">834</td>
<td align="center" style="vertical-align: middle; text-align: center">0.97&times;</td>
</tr>
</tbody>
</table>
</div>

Smaug-Agentic is shorter on 103 of 198 questions — a coin flip. Answer *style* is inherited from the base model intact; what changed is the willingness to deliberate without bound.

### 4.3 One decisive shell action per turn, sustained over very long loops

This is what the training data optimises for, and it transfers cleanly. Across 113 DeepSWE tasks and 7h33m of continuous agentic work: **0 infrastructure errors, 0 timeouts**, and a median of **78 agent steps per task** (p90 159, max 218). Tasks that passed used *more* steps than tasks that failed (median 80 vs 70), i.e. failures are not the model giving up early.

## 5. Deployment

> [!Note]
> Because the architecture is unchanged, Smaug-Agentic runs anywhere Kimi K3 runs. The inference engines below serve it with the recipes published for the base model:

- [vLLM](https://github.com/vllm-project/vllm) — see [recipes](https://recipes.vllm.ai/moonshotai/Kimi-K3)
- [SGLang](https://github.com/sgl-project/sglang) — see [cookbook](https://docs.sglang.io/cookbook/autoregressive/Moonshotai/Kimi-K3)
- [TokenSpeed](https://github.com/lightseekorg/tokenspeed) — see [recipes](https://lightseek.org/tokenspeed/recipes/models#kimi-k3)

---
## 6. Model Usage

Sampling behaviour is inherited from Kimi K3, and these settings were used for every number above.

Smaug-Agentic always has thinking enabled, and will return `reasoning_content`. Thinking effort is configured with the top-level `reasoning_effort` request field, which supports `"low"`, `"high"`, and `"max"` (default `"max"`). Set `temperature = 1.0`, with `top_p = 0.95` for single-step tasks and `top_p = 1.0` for agentic tasks.

Like the base model, Smaug-Agentic was trained in the preserved thinking history mode. For multi-turn conversations and tool calls, the complete assistant message returned by the API must be passed back to `messages` as-is — including `reasoning_content` and `tool_calls`, not just `content`.

### Coding Agent Framework

The model is trained for multi-turn tool use and works with agent frameworks that speak the OpenAI chat-completions contract.

One practical note from our own evaluation: some OpenAI-compatible servers reject non-standard fields echoed back in conversation history (`provider_specific_fields`, `function_call`, `annotations`, `refusal`, `audio`). Strip those before re-sending. `reasoning_content` and `tool_calls` are accepted and should be kept, so that interleaved thinking survives across turns.

---

## 7. License

Smaug-Agentic is a derivative of Kimi K3 and is released under the [Kimi K3 License](https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE), inherited from the base model. Users must comply with the base model's terms.

---

## 8. Citation

```bibtex
@misc{abacusai2026smaugagentic,
  title  = {Smaug-Agentic},
  author = {Abacus.AI},
  year   = {2026},
  note   = {Agentic supervised fine-tune of moonshotai/Kimi-K3},
  url    = {https://huggingface.co/abacusai/Smaug-Agentic}
}
```

The Smaug line and the DPO-Positive method behind it:

```bibtex
@article{pal2024smaug,
  title={Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive},
  author={Pal, Arka and Karkhanis, Deep and Dooley, Samuel and
          Roberts, Manley and Naidu, Siddartha and White, Colin},
  journal={arXiv preprint arXiv:2402.13228},
  year={2024}
}
```

---

## 9. Contact Us

If you have any questions, please reach out at [Abacus.AI](https://abacus.ai).