Corpus Jurídico BR
AI & ML interests
None defined yet.
Corpus Jurídico BR
Este espaço organiza a etapa de dados de um projeto de RAG jurídico local.
A fase atual do projeto tem um objetivo simples e específico: capturar, estruturar, limpar e validar textos de leis federais brasileiras para que eles possam ser usados posteriormente em uma aplicação local de recuperação de informação e consulta jurídica.
Nesta etapa, o projeto ainda não é um chatbot, não é uma API, não é um modelo treinado e não contém embeddings. O foco atual é apenas preparar uma base textual confiável.
Fase atual do projeto
A fase atual é a construção do corpus textual.
O trabalho realizado nesta etapa inclui:
- captura de leis federais brasileiras;
- organização dos textos em formato estruturado;
- preservação do inteiro teor das normas;
- geração de segmentos jurídicos derivados;
- manutenção de metadados de origem;
- limpeza de ruídos de portal e quebras artificiais;
- validação de integridade dos arquivos;
- preparação da base para uso futuro em RAG local.
Dataset principal
Repositório: corpus-juridico-br/corpus-leis-federais-br
Status: privado, com acesso restrito aos membros autorizados da organização.
O dataset contém:
- leis federais brasileiras em inteiro teor;
- segmentos jurídicos derivados dos textos;
- documentação técnica;
- scripts auxiliares de validação e auditoria.
O dataset não contém:
- embeddings;
- índice vetorial;
- aplicação final;
- interface de consulta;
- chatbot;
- ambiente virtual;
- caches;
- logs de execução;
- credenciais;
- dados brutos intermediários.
Resumo da versão textual
| Item | Informação |
|---|---|
| Versão textual | 2026-05-14 |
| Tipo normativo | Lei |
| Período coberto | 1988 a 2026 |
| Normas integrais | 7.760 |
| Segmentos jurídicos | 81.164 |
| Shards de normas | 78 |
| Shards de segmentos | 41 |
| Validação automatizada | Aprovada |
| Problemas encontrados na validação final | 0 |
Fontes utilizadas
O corpus foi montado a partir de fontes oficiais e institucionais.
As fontes utilizadas nesta etapa foram:
- Senado Federal, para descoberta inicial e metadados legislativos;
- Planalto, como fonte principal para o inteiro teor das normas;
- Câmara dos Deputados via LexML, como fonte de apoio quando o texto do Planalto não foi localizado de forma aproveitável.
Distribuição final das fontes no corpus textual:
| Fonte | Normas |
|---|---|
| Planalto | 6.851 |
| Câmara dos Deputados | 909 |
Tratamento textual
O tratamento textual foi feito de forma conservadora.
A intenção não foi alterar o conteúdo jurídico das normas, mas deixar os textos mais adequados para uso computacional posterior.
O processamento se concentrou em:
- remover ruídos de páginas e portais;
- recompor quebras artificiais de linha;
- organizar cabeçalhos, ementas e artigos;
- preservar o texto integral das normas;
- criar segmentos jurídicos para recuperação posterior;
- manter vínculo entre cada segmento e sua norma de origem;
- registrar metadados e hashes de integridade.
Validação
A validação final verificou:
- unicidade de identificadores;
- presença dos campos obrigatórios;
- consistência entre texto e hash;
- vínculo entre normas integrais e segmentos;
- ausência de ruídos evidentes de portal;
- ausência de caracteres corrompidos;
- consistência entre os arquivos publicados e seus shards.
Resultado da etapa atual:
7.760 normas integrais e 81.164 segmentos jurídicos validados, com 0 problemas encontrados na validação final.
Próxima etapa pretendida
Depois da consolidação do corpus textual, a base poderá ser usada em ambiente local para etapas posteriores do projeto, como:
- geração de embeddings;
- criação de índice vetorial;
- testes de recuperação de informação;
- avaliação de respostas em RAG;
- construção de uma aplicação local de consulta jurídica.
Essas etapas ainda não fazem parte desta publicação.
Aviso de uso
Este corpus é uma base textual preparada para apoiar um projeto de RAG jurídico local.
Ele não substitui as fontes oficiais, não constitui aconselhamento jurídico e não deve ser usado como fonte única para decisões profissionais. Para qualquer uso jurídico real, a norma deve ser conferida na fonte oficial indicada nos metadados do dataset.