File size: 1,650 Bytes
7070f0a
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
---
library_name: transformers
pipeline_tag: text-generation
language:
- code
- pt
- en
tags:
- html
- css
- javascript
- code-generation
- from-scratch
datasets:
- bigcode/the-stack-smol-xl
license: other
---

# WebCoder-100M

WebCoder-100M é um pequeno modelo decoder-only treinado **do zero** para geração e continuação de HTML, CSS e JavaScript.

## Arquitetura

- Parâmetros: **100,000,512** (100.000512M)
- Layers: 11
- Hidden size: 768
- Attention heads: 12
- Contexto: 1024 tokens
- Vocabulário: 27,664
- Precisão de treino: BF16

## Dataset

Treinado a partir dos subconjuntos HTML, CSS e JavaScript de `bigcode/the-stack-smol-xl`, com limpeza, deduplicação e filtro opcional por metadados de licença.

O código-fonte original do dataset pode possuir licenças variadas. Consulte o dataset e a origem de cada amostra antes de usar os pesos em cenários que exijam revisão jurídica específica.

## Formato de prompt

```text
<|bos|><|prompt|>
Crie uma landing page responsiva.
<|html|>
```

Também existem os tokens `<|css|>` e `<|javascript|>`.

## Métricas desta execução

- Step final: 8000
- Eval loss: 1.2921
- Perplexidade: 3.6405
- Tempo de treino: 47.43 min

## Limitações

Este é um modelo de aproximadamente 100M parâmetros e treinamento curto. Pode produzir HTML/CSS/JS inválido, inseguro, incompleto ou repetitivo. Revise o código antes de executar ou publicar.

## Uso com Transformers

```python
from transformers import AutoTokenizer, AutoModelForCausalLM

tok = AutoTokenizer.from_pretrained("caikybaldo999/webcoder-pro")
model = AutoModelForCausalLM.from_pretrained("caikybaldo999/webcoder-pro")
```