DuoNeural's picture
Upload README.md with huggingface_hub
6c4b628 verified
|
Raw
History Blame Contribute Delete
3.57 kB
---
license: apache-2.0
tags:
- duoneural
- safety-geometry
- native-refusal
- research
- from-scratch
---
# DuoNeural Native Refusal 0PCT (~50M)
Part of the **Native Refusal Geometry** experiment series.
DuoNeural 2026-06-07 | Archon, Jesse Caldwell, Aura
## What this is
A ~50M parameter GPT-style language model trained **from scratch** with
**0% refusal data** mixed into the pretraining corpus.
This is a research model investigating whether native refusal training
(pretraining data mixture) produces the same safety geometry signature as
RLHF-aligned models — specifically the three-zone crystallization arc
documented in DuoNeural P36.
## Experiment series
| Model | Refusal fraction | HF repo |
|-------|-----------------|---------|
| 0pct | 0% (baseline) | DuoNeural/native-refusal-0pct-50m |
| 10pct | 10% | DuoNeural/native-refusal-10pct-50m |
| 25pct | 25% | DuoNeural/native-refusal-25pct-50m |
| 50pct | 50% | DuoNeural/native-refusal-50pct-50m |
All 4 models use identical architecture and initialization (seed=42).
The only variable is refusal data fraction.
## Architecture
- Standard GPT: d_model=384, 16 layers, 8 heads, SwiGLU FFN
- ~50M parameters, tied embeddings
- Trained on FineWeb-Edu + synthetic refusal pairs
- AdamW optimizer, cosine LR decay
- 300M tokens total
## Geometry results
```json
{
"probe_layers": [
1,
2,
3,
4,
5,
6,
7,
8,
9,
10,
11,
12,
13,
14,
15,
16
],
"angles_by_layer": {
"1": {
"refusal|harm_awareness": 10.46,
"refusal|self_identity": 7.74,
"refusal|ethics": 9.07,
"refusal|benign_general": 9.08,
"harm_awareness|self_identity": 10.74,
"harm_awareness|ethics": 9.54,
"harm_awareness|benign_general": 10.45,
"self_identity|ethics": 8.53,
"self_identity|benign_general": 9.49,
"ethics|benign_general": 9.95
},
"2": {
"refusal|harm_awareness": 8.5,
"refusal|self_identity": 7.5,
"refusal|ethics": 8.18,
"refusal|benign_general": 9.23,
"harm_awareness|self_identity": 9.29,
"harm_awareness|ethics": 7.39,
"harm_awareness|benign_general": 9.86,
"self_identity|ethics": 7.62,
"self_identity|benign_general": 8.55,
"ethics|benign_general": 8.75
},
"3": {
"refusal|harm_awareness": 8.66,
"refusal|self_identity": 6.86,
"refusal|ethics": 8.58,
"refusal|benign_general": 9.27,
"harm_awareness|self_identity": 8.66,
"harm_awareness|ethics": 6.53,
"harm_awareness|benign_general": 9.77,
"self_identity|ethics": 7.39,
"self_identity|benign_general": 8.43,
"ethics|benign_general": 8.38
},
"4": {
"refusal|harm_awareness": 10.65,
"refusal|self_identity": 7.43,
"refusal|ethics": 10.0,
"refusal|benign_general": 11.39,
"harm_awareness|self_identity": 10.56,
"harm_awareness|ethics": 7.67,
"harm_awareness|benign_general": 11.19,
"self_identity|ethics": 8.96,
"self_identity|benign_general": 10.2,
"ethics|benign_general": 9.49
},
"5": {
"refusal|harm_awareness": 12.59,
"refusal|self_identity": 9.11,
"refusal|ethics": 11.68,
"refusal|benign_general": 14.05,
"harm_awareness|self_identity": 11.87,
"harm_a
```
## Connected papers
- DuoNeural P34: Reasoning Channel Bypass (two-loci model)
- DuoNeural P35: DHP Scope Constraints (GBSP)
- DuoNeural P36: Scale-Dependent Safety Geometry