RWKV-7 « G1a » 0.4B — BRIK (int4)

Poids RWKV-7 G1a 0.4B (BlinkDL, Apache-2.0) convertis au format BRIK pour tourner dans le navigateur sur le GPU du visiteur (WebGPU), sans serveur d'inférence. Convertis depuis un GGUF f16.

Fichier rwkv7-g1a-0.4b-q4.brik (304 Mo)
Quantification int4 (poids déjà quantifiés dans la disposition que lisent les kernels — aucune déquantification au chargement)
Tokenizer embarqué dans le fichier (vocab RWKV World, aucun téléchargement séparé)
Architecture 24 blocs, d=1024, vocab 65 536
Moteur Brimkern — kernels WGSL maison

Essayer en un clic

👉 https://brimkern.com/chat?model=romainkh14/RWKV-7-G1a-0.4B_BRIK

Le modèle est streamé par plages HTTP (Range), mis en cache par le navigateur, puis réutilisable hors ligne. Rien n'est envoyé à un serveur : le prompt et la génération restent sur la machine.

Pourquoi RWKV ici

RWKV-7 est récurrent : un état de taille fixe (~1 Mo) remplace le cache KV, donc la mémoire ne grandit pas avec la conversation — l'inverse d'un transformeur, où le cache enfle à chaque token. Sur un appareil léger, c'est la différence entre une conversation qui tient et une qui finit par saturer.

Et il est Apache-2.0 : le plus permissif du catalogue Brimkern, sans restriction d'usage commercial.

Intégrer dans un site (SDK)

<script src="https://brimkern.com/sdk.js"></script>
<script>
  Brimkern.embed({
    model: 'https://huggingface.co/romainkh14/RWKV-7-G1a-0.4B_BRIK/resolve/main/rwkv7-g1a-0.4b-q4.brik',
    system: 'Tu es l’assistant du site. Réponds brièvement, en français.',
    title: 'Assistant',
  });
</script>

Le calcul se fait sur le GPU du visiteur : aucun coût par token, aucune limite de débit, et le modèle ne se télécharge que si quelqu'un ouvre réellement le widget.

Mesuré

Chrome, portable Apple Silicon, build de production : 33-36 tok/s en décodage, première réponse en ~2 s une fois le fichier en cache. Réponses vérifiées en anglais et en français.

Format

Un .brik est un conteneur auto-descriptif : architecture, tokenizer et configuration voyagent DANS le fichier, les poids sont pré-quantifiés dans la disposition exacte que lisent les kernels, et chaque couche est une plage HTTP contiguë (chargement partiel, reprise, hors-ligne ensuite). Spécification : BRIK_FORMAT.md.

Licence

Poids sous Apache-2.0 (RWKV-7 G1a, BlinkDL). Le moteur Brimkern est sous licence MIT.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for romainkh14/RWKV-7-G1a-0.4B_BRIK

Base model

BlinkDL/rwkv7-g1
Finetuned
(2)
this model