docs: arquitectura real primero (base congelada + LoRA + spores), narrativa de entrenamiento fuera
Browse files
README.md
CHANGED
|
@@ -27,10 +27,21 @@ corre en tu máquina, no en la nube. Fine-tune **LoRA** de `Qwen/Qwen3-4B-Instru
|
|
| 27 |
de Daimon: **acciones de agente (tool-calling JSON), código y conversación en español nativo**.
|
| 28 |
|
| 29 |
**Qué es exactamente**: el modelo base `Qwen/Qwen3-4B-Instruct-2507` (GGUF cuantizado, intacto) + un
|
| 30 |
-
**LoRA
|
| 31 |
funciona con llama.cpp / LM Studio / cualquier stack GGUF, **sin necesidad del software
|
| 32 |
de Daimon** — abajo está el contrato completo de prompts para usarlo standalone.
|
| 33 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 34 |
### 📊 Benchmarks de la comunidad — primero, porque no son nuestros
|
| 35 |
|
| 36 |
<div align="center">
|
|
@@ -89,20 +100,6 @@ Medido sobre estos GGUF exactos servidos con llama.cpp. Script:
|
|
| 89 |
[`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
|
| 90 |
resultados se generan antes de cada publicación.*
|
| 91 |
|
| 92 |
-
### 🧠 Con qué se entrenó (por contribución)
|
| 93 |
-
|
| 94 |
-
- **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el
|
| 95 |
-
esquema JSON exacto de producción de Daimon (`{"thought": …, "action": "click", "ref": …}`),
|
| 96 |
-
generados por construcción (la respuesta correcta se conoce con certeza, sin teacher API).
|
| 97 |
-
Es lo que mueve las tres métricas de arriba.
|
| 98 |
-
- **Comportamiento e identidad Daimon (in-house)** — 231 seeds: persona en primera persona,
|
| 99 |
-
honestidad ante lo que no sabe, registro rioplatense conciso, convención de canvas HTML.
|
| 100 |
-
- El **código, el razonamiento y el multilingüe** vienen del modelo base (por eso el LoRA es
|
| 101 |
-
chico y el nivel de código se mantiene intacto). Probamos también mezclas grandes con
|
| 102 |
-
datasets públicos (xLAM, ToolACE, código, español nativo) y fine-tunes sobre el historial
|
| 103 |
-
real de commits — **ninguna de esas variantes le ganó a esta en el gate, así que no se
|
| 104 |
-
publicaron**. Solo publicamos lo que gana una comparación pre-registrada contra el base.
|
| 105 |
-
|
| 106 |
### 💻 Requisitos de hardware
|
| 107 |
|
| 108 |
| Recurso | Requisito |
|
|
@@ -195,17 +192,6 @@ BFCL-lite (tabla de abajo) — el fine-tune lo mantiene por encima del base.
|
|
| 195 |
El loop del agente (ejecutar la acción, observar, re-prompt con el historial)
|
| 196 |
lo implementás vos — el modelo es el cerebro que decide la próxima acción.
|
| 197 |
|
| 198 |
-
### 🧬 Spores de conocimiento (dataset companion)
|
| 199 |
-
|
| 200 |
-
El proyecto Daimon también publica **[daimon-spores](https://huggingface.co/datasets/lucas-mella/daimon-spores)**: un banco de 17 dominios
|
| 201 |
-
de herramientas (uv, docker, react, pytest…) como **KV-caches portables** — un manual
|
| 202 |
-
pasado UNA vez por el modelo, cuantizado int4+LZMA (~5.5×), que se antepone como
|
| 203 |
-
prefijo de cache para que el modelo "recuerde" el manual **sin gastar tokens de contexto**.
|
| 204 |
-
Medido con 3 brazos (base / RAG / spore): uv pasa de 8% → **96%** (supera al RAG).
|
| 205 |
-
|
| 206 |
-
⚠️ Importante: los spores NO se aplican sobre este adapter. Se atan a `Qwen/Qwen2.5-Coder-1.5B` (base, no Instruct) — otro modelo del mismo ecosistema; daimon-r sigue siendo el cerebro agéntico.
|
| 207 |
-
El dataset incluye un loader autocontenido y los benchmarks congelados para reproducir la tabla.
|
| 208 |
-
|
| 209 |
---
|
| 210 |
|
| 211 |
## 🇬🇧 English
|
|
|
|
| 27 |
de Daimon: **acciones de agente (tool-calling JSON), código y conversación en español nativo**.
|
| 28 |
|
| 29 |
**Qué es exactamente**: el modelo base `Qwen/Qwen3-4B-Instruct-2507` (GGUF cuantizado, intacto) + un
|
| 30 |
+
**LoRA angosto** que lo especializa como cerebro de agente. La base queda **congelada**: la habilidad viene del LoRA y el **conocimiento** viene de los spores (sección siguiente) — no de re-entrenar el modelo entero. Es un modelo estándar:
|
| 31 |
funciona con llama.cpp / LM Studio / cualquier stack GGUF, **sin necesidad del software
|
| 32 |
de Daimon** — abajo está el contrato completo de prompts para usarlo standalone.
|
| 33 |
|
| 34 |
+
### 🧬 Spores de conocimiento (dataset companion)
|
| 35 |
+
|
| 36 |
+
El proyecto Daimon también publica **[daimon-spores](https://huggingface.co/datasets/lucas-mella/daimon-spores)**: un banco de 17 dominios
|
| 37 |
+
de herramientas (uv, docker, react, pytest…) como **KV-caches portables** — un manual
|
| 38 |
+
pasado UNA vez por el modelo, cuantizado int4+LZMA (~5.5×), que se antepone como
|
| 39 |
+
prefijo de cache para que el modelo "recuerde" el manual **sin gastar tokens de contexto**.
|
| 40 |
+
Medido con 3 brazos (base / RAG / spore): uv pasa de 8% → **96%** (supera al RAG).
|
| 41 |
+
|
| 42 |
+
⚠️ Importante: los spores NO se aplican sobre este adapter. Se atan a `Qwen/Qwen2.5-Coder-1.5B` (base, no Instruct) — otro modelo del mismo ecosistema; daimon-r sigue siendo el cerebro agéntico.
|
| 43 |
+
El dataset incluye un loader autocontenido y los benchmarks congelados para reproducir la tabla.
|
| 44 |
+
|
| 45 |
### 📊 Benchmarks de la comunidad — primero, porque no son nuestros
|
| 46 |
|
| 47 |
<div align="center">
|
|
|
|
| 100 |
[`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
|
| 101 |
resultados se generan antes de cada publicación.*
|
| 102 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 103 |
### 💻 Requisitos de hardware
|
| 104 |
|
| 105 |
| Recurso | Requisito |
|
|
|
|
| 192 |
El loop del agente (ejecutar la acción, observar, re-prompt con el historial)
|
| 193 |
lo implementás vos — el modelo es el cerebro que decide la próxima acción.
|
| 194 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 195 |
---
|
| 196 |
|
| 197 |
## 🇬🇧 English
|