lucas-mella commited on
Commit
8c035a6
·
verified ·
1 Parent(s): afb7b6d

docs: arquitectura real primero (base congelada + LoRA + spores), narrativa de entrenamiento fuera

Browse files
Files changed (1) hide show
  1. README.md +12 -26
README.md CHANGED
@@ -27,10 +27,21 @@ corre en tu máquina, no en la nube. Fine-tune **LoRA** de `Qwen/Qwen3-4B-Instru
27
  de Daimon: **acciones de agente (tool-calling JSON), código y conversación en español nativo**.
28
 
29
  **Qué es exactamente**: el modelo base `Qwen/Qwen3-4B-Instruct-2507` (GGUF cuantizado, intacto) + un
30
- **LoRA de ~66MB** que lo especializa como cerebro de agente. Es un modelo estándar:
31
  funciona con llama.cpp / LM Studio / cualquier stack GGUF, **sin necesidad del software
32
  de Daimon** — abajo está el contrato completo de prompts para usarlo standalone.
33
 
 
 
 
 
 
 
 
 
 
 
 
34
  ### 📊 Benchmarks de la comunidad — primero, porque no son nuestros
35
 
36
  <div align="center">
@@ -89,20 +100,6 @@ Medido sobre estos GGUF exactos servidos con llama.cpp. Script:
89
  [`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
90
  resultados se generan antes de cada publicación.*
91
 
92
- ### 🧠 Con qué se entrenó (por contribución)
93
-
94
- - **Acciones de agente (in-house, sintético)** — escenarios browser/computer/code con el
95
- esquema JSON exacto de producción de Daimon (`{"thought": …, "action": "click", "ref": …}`),
96
- generados por construcción (la respuesta correcta se conoce con certeza, sin teacher API).
97
- Es lo que mueve las tres métricas de arriba.
98
- - **Comportamiento e identidad Daimon (in-house)** — 231 seeds: persona en primera persona,
99
- honestidad ante lo que no sabe, registro rioplatense conciso, convención de canvas HTML.
100
- - El **código, el razonamiento y el multilingüe** vienen del modelo base (por eso el LoRA es
101
- chico y el nivel de código se mantiene intacto). Probamos también mezclas grandes con
102
- datasets públicos (xLAM, ToolACE, código, español nativo) y fine-tunes sobre el historial
103
- real de commits — **ninguna de esas variantes le ganó a esta en el gate, así que no se
104
- publicaron**. Solo publicamos lo que gana una comparación pre-registrada contra el base.
105
-
106
  ### 💻 Requisitos de hardware
107
 
108
  | Recurso | Requisito |
@@ -195,17 +192,6 @@ BFCL-lite (tabla de abajo) — el fine-tune lo mantiene por encima del base.
195
  El loop del agente (ejecutar la acción, observar, re-prompt con el historial)
196
  lo implementás vos — el modelo es el cerebro que decide la próxima acción.
197
 
198
- ### 🧬 Spores de conocimiento (dataset companion)
199
-
200
- El proyecto Daimon también publica **[daimon-spores](https://huggingface.co/datasets/lucas-mella/daimon-spores)**: un banco de 17 dominios
201
- de herramientas (uv, docker, react, pytest…) como **KV-caches portables** — un manual
202
- pasado UNA vez por el modelo, cuantizado int4+LZMA (~5.5×), que se antepone como
203
- prefijo de cache para que el modelo "recuerde" el manual **sin gastar tokens de contexto**.
204
- Medido con 3 brazos (base / RAG / spore): uv pasa de 8% → **96%** (supera al RAG).
205
-
206
- ⚠️ Importante: los spores NO se aplican sobre este adapter. Se atan a `Qwen/Qwen2.5-Coder-1.5B` (base, no Instruct) — otro modelo del mismo ecosistema; daimon-r sigue siendo el cerebro agéntico.
207
- El dataset incluye un loader autocontenido y los benchmarks congelados para reproducir la tabla.
208
-
209
  ---
210
 
211
  ## 🇬🇧 English
 
27
  de Daimon: **acciones de agente (tool-calling JSON), código y conversación en español nativo**.
28
 
29
  **Qué es exactamente**: el modelo base `Qwen/Qwen3-4B-Instruct-2507` (GGUF cuantizado, intacto) + un
30
+ **LoRA angosto** que lo especializa como cerebro de agente. La base queda **congelada**: la habilidad viene del LoRA y el **conocimiento** viene de los spores (sección siguiente) — no de re-entrenar el modelo entero. Es un modelo estándar:
31
  funciona con llama.cpp / LM Studio / cualquier stack GGUF, **sin necesidad del software
32
  de Daimon** — abajo está el contrato completo de prompts para usarlo standalone.
33
 
34
+ ### 🧬 Spores de conocimiento (dataset companion)
35
+
36
+ El proyecto Daimon también publica **[daimon-spores](https://huggingface.co/datasets/lucas-mella/daimon-spores)**: un banco de 17 dominios
37
+ de herramientas (uv, docker, react, pytest…) como **KV-caches portables** — un manual
38
+ pasado UNA vez por el modelo, cuantizado int4+LZMA (~5.5×), que se antepone como
39
+ prefijo de cache para que el modelo "recuerde" el manual **sin gastar tokens de contexto**.
40
+ Medido con 3 brazos (base / RAG / spore): uv pasa de 8% → **96%** (supera al RAG).
41
+
42
+ ⚠️ Importante: los spores NO se aplican sobre este adapter. Se atan a `Qwen/Qwen2.5-Coder-1.5B` (base, no Instruct) — otro modelo del mismo ecosistema; daimon-r sigue siendo el cerebro agéntico.
43
+ El dataset incluye un loader autocontenido y los benchmarks congelados para reproducir la tabla.
44
+
45
  ### 📊 Benchmarks de la comunidad — primero, porque no son nuestros
46
 
47
  <div align="center">
 
100
  [`agent_actions_eval.py`](https://github.com/lucasmella-stack/daimon) — los JSONs de
101
  resultados se generan antes de cada publicación.*
102
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
103
  ### 💻 Requisitos de hardware
104
 
105
  | Recurso | Requisito |
 
192
  El loop del agente (ejecutar la acción, observar, re-prompt con el historial)
193
  lo implementás vos — el modelo es el cerebro que decide la próxima acción.
194
 
 
 
 
 
 
 
 
 
 
 
 
195
  ---
196
 
197
  ## 🇬🇧 English