khtst-multimodal-ptbr / scripts /00_bootstrap_venv.sh
PowerMachine's picture
KHTST v17 KHMAMBAJEPA — MoE QUANTIZADO por indexador/floresta (Teos 29.1–29.4: stack fora do contrato de subclasses resolvido, equivalência EXATA por independência de linha da GEMM, floresta B=2≡B=1 bit-exata; torchao+MoE-pack 237 camadas+2 MoEs 3.92× Δperda −0.0001); perda TCE ALTA corrigida (Teos 29.5–29.9: normalização dimensional exata ∇L/d, limiar de sucesso invariante de escala, λ_jepa pela razão PONDERADA no RM — jepa/perda 24.96→1.12, taxa 0.0→0.075, razão de ganho 0.716→0.789, held-out em paridade 6.586 vs 6.559); SonicMoE + Token Rounding em Cython (Teos 29.10–29.11, GEMM estofado bit-exato, τ* por medição); AUDITORIA DE MEMÓRIA em tempo real I1–I4 (Teo 29.12, statm nível C — verdes no passo 100 real); ReplaySSM (Teos 29.13–29.14: saída/gradiente BIT-EXATOS, ativação 113→31 KB); vocab 16384 alinhado (tokenizador retreinado); jepa_validator.pyx aprimorado (API preservada + auditoria + rounding); venv otimizado (00_bootstrap_venv.sh); suíte v17 34✓, verificar_tudo 49✓, regressão v1–v16 completa; SEM estados de treino (requisito)
8b92760 verified
Raw History Blame Contribute Delete
1.82 kB
#!/usr/bin/env bash
# 00_bootstrap_venv.sh — reconstrução RÁPIDA e otimizada do ambiente virtual.
# Aprendizado do último treino (observação do ambiente):
# • o venv é VOLÁTIL entre sessões ⟹ reconstrução deve ser determinística e rápida;
# • pip cache http-v2 reutiliza wheels grandes (torch ~900 MB baixado 1×);
# • torch CPU-only (índice -cpu) evita baixar CUDA de ~2.5 GB — RAM 3 GiB, disco 9 GiB;
# • instalação ÚNICA em lote (1 resolução de dependências = menos tempo e menos pico de RAM);
# • venv FORA do repositório (/home/z/my-project/venv) — nunca publicado no HF.
set -euo pipefail
VENV=/home/z/my-project/venv
if [ ! -x "$VENV/bin/python" ]; then
python3 -m venv "$VENV"
fi
PY="$VENV/bin/python"
# ensurepip pode não disparar na criação (Debian mínimo) — garante o pip
if ! "$PY" -m pip --version >/dev/null 2>&1; then
"$PY" -m ensurepip --upgrade >/dev/null 2>&1 || true
fi
if ! "$PY" -m pip --version >/dev/null 2>&1; then
curl -sS https://bootstrap.pypa.io/get-pip.py -o /tmp/get-pip.py \
&& "$PY" /tmp/get-pip.py -q
fi
"$PY" -m pip install -q --upgrade pip 2>&1 | tail -1 || true
# torch CPU primeiro (índice dedicado; wheel em cache após a 1ª vez)
"$PY" -m pip install -q torch --index-url https://download.pytorch.org/whl/cpu
# resto em UM lote (PyPI)
"$PY" -m pip install -q datasets tokenizers safetensors "huggingface_hub>=0.25" numpy pillow \
transformers accelerate torchao pyarrow soundfile requests matplotlib cython scikit-learn
"$PY" - <<'EOF'
import torch, torchao, datasets, tokenizers, safetensors, numpy, sklearn, Cython
print("venv OK — torch", torch.__version__, "| torchao", torchao.__version__,
"| datasets", datasets.__version__, "| cython", Cython.__version__,
"| cuda:", torch.cuda.is_available())
EOF