samai-8b โ€” M8 ็ปˆ็‰ˆๆƒ้‡ (GGUF)

samai-8b ๆ˜ฏๅŸบไบŽ Qwen/Qwen3.5-9B๏ผˆbf16๏ผ‰ๆŒ็ปญ่’ธ้ฆๅขžๅผบ็š„ๅฏน่ฏ/ๆ‰ง่กŒๆจกๅž‹ใ€‚ๆœฌไป“ๅบ“ไบคไป˜ M8ใ€Œagent ๆ‰ง่กŒ่ƒฝๅŠ›ๅขžๅผบใ€่ฝฎ็š„ๆœ€็ปˆ q4_k_m ้‡ๅŒ–ๆƒ้‡๏ผŒไธบ็ณปๅˆ—ๅทฅไฝœ็š„็ปˆ็‰ˆไบคไป˜ใ€‚

่ฏ„ๆต‹็ป“ๆžœ

่ฏ„ๆต‹้›† M7 ๅŸบ็บฟ M8 ็ปˆ็‰ˆ ๆๅ‡
agent60 A ๅ•่ทณ 100.0 100.0 โ€”
agent60 B ๅคšๅทฅๅ…ท 73.3 100.0 +26.7
agent60 C ๅคš่ฝฎ้“พๅผ 100.0 93.3 -6.7
agent60 D ่ดŸๅ‘็›ด็ญ” 80.0 93.3 +13.3
agent60 ๆ€ปๅˆ† 86.7 96.7 +10.0
knight15 ่ƒฝๅŠ›ๅ›žๅฝ’ 15/15 15/15 ้›ถๅ›ž้€€

ๅฎš้ถๅ‘ฝไธญ๏ผšๅคšๅทฅๅ…ท็ผ–ๆŽ’๏ผˆB +26.7๏ผ‰ไธŽ่ดŸๅ‘ๆ‹’็ญ”็›ด็ญ”๏ผˆD +13.3๏ผ‰ๅŒๅŒๆ˜พ่‘—ๆๅ‡๏ผ›knight15 ๆปกๅˆ†็กฎ่ฎคๆ ธๅฟƒ่ƒฝๅŠ›้›ถๅ›ž้€€ใ€‚

ๆ–‡ไปถ

ๆ–‡ไปถ ๅคงๅฐ sha256
samai8b_m8_q4_k_m.gguf 5.78 GB (5,780,090,720 B) 9566d8a7d85782b2284ee970d82306dfd33fb52df4b35e42a722a3d63c94f818

ๆบฏๆบไธŽ่ฎญ็ปƒ้…ๆ–น

  • ๅŸบๅบง๏ผšQwen/Qwen3.5-9B bf16๏ผŒ้€ๅฏนๆ ก้ชŒๆตๅผๅˆๅนถ LoRA๏ผˆ128/128 lora pairs ๅ…จๅ‘ฝไธญ๏ผ‰
  • ่ฎญ็ปƒ๏ผšQLoRA๏ผˆnf4, r=32, ฮฑ=64๏ผ‰๏ผŒๆ•™ๅธˆๅณ็จ‹ๅบ่Œƒๅผๅˆๆˆ็š„ๅ››็ฐ‡ agent ๆŒ‡ไปคๆ•ฐๆฎ๏ผˆๅ•่ทณ/ๅคšๅทฅๅ…ท/ๅคš่ฝฎ้“พๅผ/่ดŸๅ‘็›ด็ญ”๏ผŒๅ…ฑ 3200 ๆก๏ผŒๅซๅทฅๅ…ทๅฏ่พพๆ€ง็บข็บฟๆ ก้ชŒไธŽ็œŸ็ญ”ๆกˆ่ดŸๆ ทๆœฌ๏ผ‰
  • ้‡ๅŒ–้“พ๏ผšๅˆๅนถ bf16 โ†’ convert_hf_to_gguf.py f16 โ†’ llama-quantize q4_k_m
  • ่ฏ„ๆต‹๏ผš60 ้ข˜ agent ่ฏ„ๆต‹๏ผˆT4 ็œŸๆœบ๏ผ‰+ knight15 ่ƒฝๅŠ›ๅ›žๅฝ’้—จ๏ผŒๆŠฅๅ‘Š่ง m8_final_report.json / m8_knight15_report.json / m8_baseline_report.json

็”จๆณ• (llama.cpp)

llama-server -m samai8b_m8_q4_k_m.gguf -ngl 99 -c 2048 --port 8080

q4_k_m ๅœจ T4 (SM75) ไธŠ้ชŒ่ฏ้€š่ฟ‡๏ผ›CPU ๆจกๅผ็œŸๆŽจ็†ๅ†’็ƒŸไบฆ้€š่ฟ‡ใ€‚

PK: samai-8b M8 vs Ternary-Bonsai-2-27B (prism-ml)

ๅŒ็›˜ไฝๅฏนๅ†ณ (q4_k_m 5.78G vs PTQ1_0 5.95G), ๅ…จๆ–ฐ 48 ้ข˜ agent ไปปๅŠก้“ถ่กŒ (้›ถ่ฎญ็ปƒๆณ„ๆผ, ๅ››็ฐ‡: ๅ•่ทณ/ๅคšๅทฅๅ…ท/ๅคš่ฝฎ้“พๅผ/่ดŸๅ‘็›ด็ญ”), ๅŒ harness / ๅŒๆž„ server ้…็ฝฎ / greedy ๅˆคๅˆ†:

็ฐ‡ samai-8b M8 Bonsai-2-27B delta
A ๅ•่ทณ 58.3% 58.3% 0
B ๅคšๅทฅๅ…ท 50.0% 41.7% +8.3
C ๅคš่ฝฎ้“พๅผ 41.7% 41.7% 0
D ่ดŸๅ‘็›ด็ญ” 100.0% 100.0% 0
ๆ€ปๅˆ† 62.5% 60.4% +2.1

่ฃๅ†ณ: M8 ่ƒœๅ‡บ โ€” ไปฅ 9B/5.78G ๆ‰“ๅนณๅนถๅœจๆ€ปๅˆ†ไธŽ้€้ข˜ head-to-head (1 ่ƒœ 0 ่ดŸ) ไธŠๅŽ‹่ฟ‡ 27B/5.95G ็š„ ternary ๅŒ็บงๅฏนๆ‰‹, ๅคšๅทฅๅ…ท็ผ–ๆŽ’ๆ˜ฏๅ†ณ่ƒœ็ฐ‡ใ€‚้€้ข˜ๆ˜Ž็ป†่ง pk_summary.json, ้ข˜ๅบ“่ง m8_pk_eval.jsonlใ€‚

Downloads last month
-
GGUF
Model size
9B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support

Model tree for tchbcb/samai-8b-M8

Finetuned
Qwen/Qwen3.5-9B
Quantized
(514)
this model