lucas-mella commited on
Commit
465913a
·
verified ·
1 Parent(s): 046f03b

Upload README.md with huggingface_hub

Browse files
Files changed (1) hide show
  1. README.md +115 -119
README.md CHANGED
@@ -1,119 +1,115 @@
1
- ---
2
- license: apache-2.0
3
- base_model: Qwen/Qwen3-4B-Instruct-2507
4
- language:
5
- - es
6
- - en
7
- tags:
8
- - daimon
9
- - lora
10
- - tool-calling
11
- - code
12
- - spanish
13
- library_name: gguf
14
- ---
15
-
16
- > ## ⚠️ En actualización — nueva versión en camino
17
- >
18
- > Estamos **corrigiendo y republicando** estos pesos. La versión anterior tenía una
19
- > regresión en *tool-calling* (el mix de entrenamiento sobre-pesó el español y diluyó
20
- > el núcleo). Ya está entrenado el reemplazo, con el mix rebalanceado y un **gate
21
- > anti-regresión** que compara contra el modelo base antes de publicar.
22
- >
23
- > **No uses estos pesos para nada serio hasta que saquemos este cartel.**
24
- >
25
- > *We are fixing and republishing these weights. Do not rely on them until this notice is removed.*
26
-
27
- ---
28
-
29
-
30
-
31
- <div align="center">
32
- <img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-orb.png" width="92" alt="Daimon"/><br/>
33
- <img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-palabra.png" width="150" alt="daimon"/>&nbsp;&nbsp;<b style="font-size:1.7em;vertical-align:middle">r</b>
34
- </div>
35
-
36
- ---
37
-
38
- ## 🇪🇸 Español
39
-
40
- **daimon r** es el modelo **razonador de 4B** (fine-tune LoRA de `Qwen3-4B-Instruct-2507`), el hermano mayor de `daimon x`: mismo asistente de **código, agente (tool-calling) y conversación**, con foco en **español nativo**, pero con más capacidad de razonamiento.
41
-
42
- > Forma parte del proyecto **Daimon** *próximamente / coming soon*.
43
-
44
- ### 🧠 Con qué se entrenó
45
- Fine-tune **LoRA (QLoRA 4-bit)** sobre el mismo mix curado que `daimon x`, pesado hacia el núcleo de Daimon (tool-calling / agente):
46
-
47
- - **Tool-calling / agente** — xLAM, ToolACE, Hermes-FC, **Toucan** (trayectorias multi-turno reales de +495 servidores MCP)
48
- - **Código** evol-codealpaca, OpenCodeReasoning, glaive
49
- - **Razonamiento** — OpenThoughts, **OpenR1-Math** (con respuestas verificadas)
50
- - **Español nativo** **BSC-LT m-personas**, **projecte-aina MentorES**, **aya** (nativo, no traducido)
51
- - **In-house** acciones de agente + identidad de Daimon
52
-
53
- ### 📊 Benchmarks
54
- | Base | Ejemplos | train_loss | eval_loss |
55
- |---|---|---|---|
56
- | Qwen3-4B-Instruct-2507 | 4.979 | 0.762 | **0.633** |
57
-
58
- `eval_loss < train_loss`, y notablemente más bajo que `daimon x` (0.633 vs 0.868) → el 4B aprende mejor.
59
-
60
- ### 💻 Requisitos de hardware
61
- | Recurso | Mínimo | Recomendado |
62
- |---|---|---|
63
- | Disco (GGUF Q4_K_M + LoRA) | ~2.5 GB | ~2.5 GB |
64
- | RAM | 8 GB | 16 GB |
65
- | GPU | opcional (corre en CPU, más lento) | ≥ 4 GB VRAM (ej. GTX 1650) |
66
-
67
- Más pesado que `daimon x` por ser 4B, pero la cuantización **Q4_K_M** lo hace correr en GPUs modestas.
68
-
69
- ### ⬇️ Descargar (opcional — solo si querés usarlo)
70
- ```bash
71
- huggingface-cli download lucas-mella/Daimon-R
72
- # correr con llama.cpp (base GGUF + adapter LoRA):
73
- llama-server --model Qwen3-4B-Instruct-2507-Q4_K_M.gguf \
74
- --lora daimon-r-lora-f16.gguf --alias daimon-r
75
- ```
76
-
77
- ---
78
-
79
- ## 🇬🇧 English
80
-
81
- **daimon r** is the **4B reasoning** model (LoRA fine-tune of `Qwen3-4B-Instruct-2507`), the big sibling of `daimon x`: the same **code, agentic tool-calling and conversation** assistant with a focus on **native Spanish**, but with stronger reasoning.
82
-
83
- > Part of the **Daimon** project — *coming soon*.
84
-
85
- ### 🧠 Training
86
- **LoRA (4-bit QLoRA)** fine-tune on the same curated mix as `daimon x`, weighted toward Daimon's tool-calling/agent core:
87
-
88
- - **Tool-calling / agent** — xLAM, ToolACE, Hermes-FC, **Toucan** (real multi-turn trajectories from 495+ MCP servers)
89
- - **Code** — evol-codealpaca, OpenCodeReasoning, glaive
90
- - **Reasoning** OpenThoughts, **OpenR1-Math** (verified answers)
91
- - **Native Spanish** — **BSC-LT m-personas**, **projecte-aina MentorES**, **aya** (native, not translated)
92
- - **In-house** — Daimon agent-actions + identity
93
-
94
- ### 📊 Benchmarks
95
- | Base | Examples | train_loss | eval_loss |
96
- |---|---|---|---|
97
- | Qwen3-4B-Instruct-2507 | 4,979 | 0.762 | **0.633** |
98
-
99
- `eval_loss < train_loss`, and notably lower than `daimon x` (0.633 vs 0.868) the 4B learns better.
100
-
101
- ### 💻 Hardware requirements
102
- | Resource | Minimum | Recommended |
103
- |---|---|---|
104
- | Disk (Q4_K_M GGUF + LoRA) | ~2.5 GB | ~2.5 GB |
105
- | RAM | 8 GB | 16 GB |
106
- | GPU | optional (CPU works, slower) | ≥ 4 GB VRAM (e.g. GTX 1650) |
107
-
108
- Heavier than `daimon x` (it's 4B), but **Q4_K_M** quantization lets it run on modest GPUs.
109
-
110
- ### ⬇️ Download (optional)
111
- ```bash
112
- huggingface-cli download lucas-mella/Daimon-R
113
- # run with llama.cpp (base GGUF + LoRA adapter):
114
- llama-server --model Qwen3-4B-Instruct-2507-Q4_K_M.gguf \
115
- --lora daimon-r-lora-f16.gguf --alias daimon-r
116
- ```
117
-
118
- ---
119
- <sub>Base: Qwen3-4B-Instruct-2507 (Apache-2.0). LoRA + mix: proyecto Daimon.</sub>
 
1
+ ---
2
+ license: apache-2.0
3
+ base_model: Qwen/Qwen3-4B-Instruct-2507
4
+ language:
5
+ - es
6
+ - en
7
+ tags:
8
+ - daimon
9
+ - lora
10
+ - tool-calling
11
+ - agent
12
+ - code
13
+ - spanish
14
+ library_name: gguf
15
+ ---
16
+
17
+ <div align="center">
18
+ <img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-R.png" width="220" alt="daimon r"/>
19
+ </div>
20
+
21
+ ---
22
+
23
+ ## 🇪🇸 Español
24
+
25
+ **daimon r** es el cerebro razonador (4B) de **Daimon**, un asistente personal local-first:
26
+ corre en tu máquina, no en la nube. Fine-tune **LoRA** de `Qwen/Qwen3-4B-Instruct-2507` para el núcleo
27
+ de Daimon: **acciones de agente (tool-calling JSON), código y conversación en español nativo**.
28
+
29
+ ### 📊 Benchmark (medido, reproducible)
30
+
31
+ <div align="center">
32
+ <img src="https://huggingface.co/lucas-mella/Daimon-R/resolve/main/daimon-r-benchmarks-light.png" width="640" alt="benchmark daimon r vs base"/>
33
+ </div>
34
+
35
+ | Métrica (198 casos held-out) | Base Qwen3-4B-Instruct-2507 | **daimon r** | |
36
+ |---|---|---|---|
37
+ | JSON válido / valid JSON | 100.0% | **100.0%** | ➖ empata |
38
+ | Acción correcta / correct action | 75.3% | **94.9%** | ✅ gana |
39
+ | Acción + campos correctos / correct fields | 47.5% | **94.9%** | ✅ gana |
40
+
41
+ *Benchmark objetivo y reproducible: 198 escenarios sintéticos held-out (vocabulario
42
+ disjunto del entrenamiento, cero solapamiento textual), calificados determinísticamente
43
+ JSON parseable, acción esperada, campos correctos (`ref`/`path`/`command`/…). Sin juez LLM.
44
+ Medido sobre estos GGUF exactos servidos con llama.cpp. Script:
45
+ [`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) los JSONs de
46
+ resultados se generan antes de cada publicación.*
47
+
48
+ ### 🧠 Con qué se entrenó (por contribución)
49
+
50
+ - **Acciones de agente (in-house, sintético)** escenarios browser/computer/code con el
51
+ esquema JSON exacto de producción de Daimon (`{"thought": …, "action": "click", "ref": …}`),
52
+ generados por construcción (la respuesta correcta se conoce con certeza, sin teacher API).
53
+ Es lo que mueve las tres métricas de arriba.
54
+ - **Comportamiento e identidad Daimon (in-house)** 231 seeds: persona en primera persona,
55
+ honestidad ante lo que no sabe, registro rioplatense conciso, convención de canvas HTML.
56
+ - El **código, el razonamiento y el multilingüe** vienen del modelo base (por eso el LoRA es
57
+ chico y el nivel de código se mantiene intacto). Probamos también mezclas grandes con
58
+ datasets públicos (xLAM, ToolACE, código, español nativo) y fine-tunes sobre el historial
59
+ real de commits — **ninguna de esas variantes le ganó a esta en el gate, así que no se
60
+ publicaron**. Solo publicamos lo que gana una comparación pre-registrada contra el base.
61
+
62
+ ### 💻 Requisitos de hardware
63
+
64
+ | Recurso | Requisito |
65
+ |---|---|
66
+ | Disco | ~2.6 GB (base GGUF + LoRA) |
67
+ | RAM | 8 GB mínimo |
68
+ | GPU / memoria unificada | ≥ 4 GB VRAM (ej. GTX 1650) o Apple Silicon ≥ 8 GB de memoria unificada |
69
+
70
+ ### ✅ Probalo vos mismo (verificable)
71
+
72
+ ```bash
73
+ huggingface-cli download lucas-mella/Daimon-R --local-dir ./daimon
74
+ llama-server -m ./daimon/Qwen3-4B-Instruct-2507-Q4_K_M.gguf --lora ./daimon/daimon-r-lora-f16.gguf -c 4096
75
+ ```
76
+
77
+ Después probá una acción de agente (el núcleo de lo que se entrenó — este es un caso
78
+ real del set de evaluación, verificado contra estos pesos exactos antes de publicar):
79
+
80
+ ```bash
81
+ curl -s http://127.0.0.1:8080/v1/chat/completions -H "Content-Type: application/json" -d '{
82
+ "temperature": 0,
83
+ "messages": [
84
+ {"role": "system", "content": "Sos el navegador autónomo de Daimon. En cada paso recibís el objetivo, la página actual (elementos interactivos con su ref + texto visible) y el historial. Respondé SOLO con un objeto JSON de esta forma:\n{\"thought\":\"...\",\"action\":\"navigate|click|fill|scroll|back|done\",\"ref\":<n>,\"text\":\"...\",\"url\":\"...\"}"},
85
+ {"role": "user", "content": "Objetivo: poné 'gatos' en 'Email'\n\nURL: https://un-sitio-de-noticias.test/\nTítulo: Un Sitio De Noticias\nElementos:\n [0] input \"Nombre\"\n [1] input \"Email\"\nTexto:\nun sitio de noticias\n\nHistorial: (vacío)\n\nPróxima acción (JSON):"}
86
+ ]
87
+ }'
88
+ ```
89
+
90
+ Respuesta esperada (un único objeto JSON, sin prosa alrededor):
91
+ `{"thought": "…", "action": "fill", "ref": 1, "text": "gatos"}`
92
+
93
+ SHA-256 del LoRA publicado: `77fd6ad400b691ea391d70a7f9c0ddfb50ace1f882b9dac7f4b01b11e5fb7ae6`.
94
+
95
+ ---
96
+
97
+ ## 🇬🇧 English
98
+
99
+ **daimon r** is the 4B reasoning brain of **Daimon**, a local-first personal AI assistant.
100
+ LoRA fine-tune of `Qwen/Qwen3-4B-Instruct-2507` for Daimon's core: **agent actions (JSON tool-calling),
101
+ code, and native-Spanish conversation**. Benchmark table above — measured on these exact
102
+ GGUFs, deterministic grading, no LLM judge; losing dimensions are shown losing.
103
+
104
+ Hardware: ~2.6 GB disk, 8 GB+ RAM, GPU optional see the Spanish
105
+ table (unified-memory Apple Silicon works via llama.cpp Metal).
106
+
107
+ ### Files
108
+
109
+ - `Qwen3-4B-Instruct-2507-Q4_K_M.gguf` — base model (GGUF)
110
+ - `daimon-r-lora-f16.gguf` Daimon LoRA (apply with `--lora`)
111
+
112
+ ---
113
+
114
+ <sub>Base: Qwen/Qwen3-4B-Instruct-2507 (Apache-2.0). LoRA + data mix: Daimon project — coming soon.
115
+ Watch <a href="https://huggingface.co/lucas-mella">@lucas-mella</a>.</sub>