Commit History

v5.1: revert INT8 — too lossy for 0.6B, keep LoRA merge + float32
26344b5

arthu1 commited on

v5: merge LoRA at startup + INT8 quantization + faster params
ca997b4

arthu1 commited on

Skip quantization for PEFT models — fixes generate crash
98ced47

arthu1 commited on

Fix: quantization fallback if generate breaks
c4e9e0c

arthu1 commited on

Revert to Docker/FastAPI + add dynamic INT8 quantization for faster CPU inference
27f81ac

arthu1 commited on

Switch to Gradio SDK + ZeroGPU for free GPU inference
264ac43

arthu1 commited on

Deploy North Air CPU API + model
9234544
verified

arthu1 commited on

Deploy North Air CPU API + model
13c18e1
verified

arthu1 commited on

Deploy North Air CPU API + model
6ec4b85
verified

arthu1 commited on

Deploy North Air CPU API + model
960805f
verified

arthu1 commited on

initial commit
99abe1b
verified

arthu1 commited on