Instructions to use romainkh14/RWKV-7-G1a-0.4B_BRIK with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- RWKV
How to use romainkh14/RWKV-7-G1a-0.4B_BRIK with RWKV:
# No code snippets available yet for this library. # To use this model, check the repository files and the library's documentation. # Want to help? PRs adding snippets are welcome at: # https://github.com/huggingface/huggingface.js
- Notebooks
- Google Colab
- Kaggle
RWKV-7 « G1a » 0.4B — BRIK (int4)
Poids RWKV-7 G1a 0.4B (BlinkDL, Apache-2.0) convertis au format BRIK pour tourner dans le navigateur sur le GPU du visiteur (WebGPU), sans serveur d'inférence. Convertis depuis un GGUF f16.
| Fichier | rwkv7-g1a-0.4b-q4.brik (304 Mo) |
| Quantification | int4 (poids déjà quantifiés dans la disposition que lisent les kernels — aucune déquantification au chargement) |
| Tokenizer | embarqué dans le fichier (vocab RWKV World, aucun téléchargement séparé) |
| Architecture | 24 blocs, d=1024, vocab 65 536 |
| Moteur | Brimkern — kernels WGSL maison |
Essayer en un clic
👉 https://brimkern.com/chat?model=romainkh14/RWKV-7-G1a-0.4B_BRIK
Le modèle est streamé par plages HTTP (Range), mis en cache par le navigateur, puis réutilisable hors ligne. Rien n'est envoyé à un serveur : le prompt et la génération restent sur la machine.
Pourquoi RWKV ici
RWKV-7 est récurrent : un état de taille fixe (~1 Mo) remplace le cache KV, donc la mémoire ne grandit pas avec la conversation — l'inverse d'un transformeur, où le cache enfle à chaque token. Sur un appareil léger, c'est la différence entre une conversation qui tient et une qui finit par saturer.
Et il est Apache-2.0 : le plus permissif du catalogue Brimkern, sans restriction d'usage commercial.
Intégrer dans un site (SDK)
<script src="https://brimkern.com/sdk.js"></script>
<script>
Brimkern.embed({
model: 'https://huggingface.co/romainkh14/RWKV-7-G1a-0.4B_BRIK/resolve/main/rwkv7-g1a-0.4b-q4.brik',
system: 'Tu es l’assistant du site. Réponds brièvement, en français.',
title: 'Assistant',
});
</script>
Le calcul se fait sur le GPU du visiteur : aucun coût par token, aucune limite de débit, et le modèle ne se télécharge que si quelqu'un ouvre réellement le widget.
Mesuré
Chrome, portable Apple Silicon, build de production : 33-36 tok/s en décodage, première réponse en ~2 s une fois le fichier en cache. Réponses vérifiées en anglais et en français.
Format
Un .brik est un conteneur auto-descriptif : architecture, tokenizer et configuration voyagent
DANS le fichier, les poids sont pré-quantifiés dans la disposition exacte que lisent les kernels, et
chaque couche est une plage HTTP contiguë (chargement partiel, reprise, hors-ligne ensuite).
Spécification : BRIK_FORMAT.md.
Licence
Poids sous Apache-2.0 (RWKV-7 G1a, BlinkDL). Le moteur Brimkern est sous licence MIT.