Text Generation
Transformers
Safetensors
English
Spanish
Portuguese
llama
research
latin-america
cenia
latamgpt
conversational
text-generation-inference
Instructions to use StudioRose95/aaaaaaaaaaaaa with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use StudioRose95/aaaaaaaaaaaaa with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="StudioRose95/aaaaaaaaaaaaa") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("StudioRose95/aaaaaaaaaaaaa") model = AutoModelForCausalLM.from_pretrained("StudioRose95/aaaaaaaaaaaaa", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use StudioRose95/aaaaaaaaaaaaa with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "StudioRose95/aaaaaaaaaaaaa" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "StudioRose95/aaaaaaaaaaaaa", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/StudioRose95/aaaaaaaaaaaaa
- SGLang
How to use StudioRose95/aaaaaaaaaaaaa with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "StudioRose95/aaaaaaaaaaaaa" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "StudioRose95/aaaaaaaaaaaaa", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "StudioRose95/aaaaaaaaaaaaa" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "StudioRose95/aaaaaaaaaaaaa", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use StudioRose95/aaaaaaaaaaaaa with Docker Model Runner:
docker model run hf.co/StudioRose95/aaaaaaaaaaaaa
| license: llama3.1 | |
| inference: false | |
| language: | |
| - en | |
| - es | |
| - pt | |
| base_model: | |
| - meta-llama/Llama-3.1-70B | |
| library_name: transformers | |
| tags: | |
| - research | |
| - latin-america | |
| - cenia | |
| - latamgpt | |
| <img src="assets/latam_gpt.png" alt="Logo" width="70%" /> | |
| # Llama-3.1-70B-LatamGPT-SFT-1.0 | |
| 🌐 Versiones de lenguaje: [Inglés](README.md) | [Português](README_pt.md) | |
| LatamGPT es un modelo de lenguaje desarrollado desde América Latina y el Caribe, con foco en la representación de las particularidades lingüísticas, culturales y regionales. Está construido sobre la base de **Llama 3.1 70B** y adaptado mediante **preentrenamiento continuo** (*continued pretraining*, CPT) con datos latinoamericanos y **ajuste supervisado** (*supervised fine-tuning*, SFT) orientado a instrucciones, conversación y tareas de lenguaje natural en español, portugués e inglés. Este desarrollo fortalece la soberanía tecnológica y el despliegue de capacidades locales, permitiendo que la región lidere su propia innovación. | |
| El objetivo de LatamGPT es ofrecer un modelo abierto, multilingüe y culturalmente pertinente, que reduzca la brecha de representación regional frente a los modelos globales, con mejor cobertura de expresiones, contextos, referencias culturales y usos lingüísticos propios de América Latina y el Caribe. | |
| ## Información del modelo | |
| LatamGPT 1.0 es un modelo autoregresivo basado en arquitectura Transformer. Hereda las capacidades generales de Llama 3.1 70B y las complementa con un proceso de adaptación regional en dos etapas principales: | |
| 1. **Continued pretraining (CPT):** especialización del modelo base con datos de América Latina. | |
| 2. **Supervised fine-tuning (SFT):** ajuste supervisado para mejorar seguimiento de instrucciones, calidad conversacional, utilidad y desempeño en tareas regionales. | |
| **Idiomas soportados:** español, portugués e inglés, con foco especial en variantes, registro y uso regional latinoamericano. | |
| **Licencia:** el uso del modelo LLama 3.1 LatamGPT está sujeto a la licencia de [Llama 3.1 Community License Agreement](https://www.llama.com/llama3_1/license/) Copyright © Meta Platforms, Inc. Built with Llama. Se recomienda revisar cuidadosamente los términos aplicables antes de redistribuir, modificar o desplegar el modelo en producción. | |
| **Contacto:** [latam-gpt@cenia.cl](mailto:latam-gpt@cenia.cl) | |
| > **Nota:** próximamente se publicará un catálogo de datos y un reporte técnico del modelo. Estos documentos entregarán mayor detalle sobre las fuentes de datos, los criterios de curación, las etapas de entrenamiento, la metodología de evaluación y las principales limitaciones de LatamGPT. | |
| ## Usos previstos | |
| LatamGPT está pensado para investigación, experimentación, desarrollo de aplicaciones y uso comercial en contextos latinoamericanos donde se requiera generación de texto, asistencia conversacional, resumen, clasificación, redacción, apoyo a análisis y otras tareas de lenguaje natural. | |
| Este modelo puede ser especialmente útil en escenarios donde el idioma, las referencias culturales o los contextos regionales de América Latina sean relevantes para la calidad de las respuestas. | |
| ### Usos fuera de alcance | |
| LatamGPT no debe utilizarse para fines que infrinjan leyes, regulaciones, derechos de terceros o las condiciones de licencia aplicables. Tampoco debe emplearse sin controles adicionales en contextos de alto impacto, como salud, educación, finanzas, justicia, seguridad pública u otros ámbitos donde una salida incorrecta pueda producir daños significativos. | |
| El modelo no está optimizado para idiomas distintos de español, portugués e inglés. Aunque puede generar texto en otros idiomas, su desempeño fuera de estos tres idiomas no constituye un objetivo principal de esta versión. | |
| ## Cómo usar el modelo | |
| ### Requisitos de memoria | |
| LatamGPT está basado en un modelo de 70B parámetros. Para inferencia en precisión BF16/FP16 se requieren aproximadamente 140 GB de VRAM solo para los pesos del modelo, por lo que se recomienda usar múltiples GPUs de alta memoria. | |
| ### Uso con Hugging Face Transformers | |
| Para usar LatamGPT con `transformers`, puedes cargar el modelo y el tokenizador de la siguiente forma: | |
| ```python | |
| from transformers import pipeline | |
| import torch | |
| pipe = pipeline( | |
| "text-generation", | |
| model="latamgpt/Llama-3.1-70B-LatamGPT-SFT-1.0", | |
| torch_dtype=torch.bfloat16, | |
| device_map="auto", | |
| ) | |
| messages = [ | |
| {"role": "system", "content": "Eres un asistente útil, claro y preciso, con foco en América Latina y el Caribe"}, | |
| {"role": "user", "content": "Explica en un párrafo breve qué es LatamGPT."}, | |
| ] | |
| out = pipe(messages, max_new_tokens=256, temperature=0.6, top_p=0.9, do_sample=True) | |
| print(out[0]["generated_text"][-1]["content"]) | |
| ``` | |
| ## Nota importante | |
| Este modelo incluye un chat template predefinido y una configuración especial del tokenizer. Recomendamos utilizar el tokenizer, el chat template y la generation config por defecto que se proporcionan en este repositorio. | |
| Por favor, evita modificar el chat template o sobrescribir manualmente la configuración del tokenizer, ya que el modelo depende de sus tokens predefinidos y de su formato conversacional. Cambiar estas configuraciones puede degradar la calidad de las respuestas o hacer que las generaciones no terminen correctamente. | |
| ## Datos de entrenamiento | |
| LatamGPT 1.0 fue construido a partir de Llama 3.1 70B y adaptado con datos regionales de América Latina y el Caribe. El foco principal del proceso de entrenamiento fue incorporar datos representativos de la región, reunidos mediante una alianza estratégica de más de 75 instituciones. | |
| La etapa de preentrenamiento continuo fue realizada con LatamGPT Corpus 1.0, un conjunto de datos compuesto por aproximadamente 297B tokens. El dataset estará disponible próximamente en Hugging Face: [link próximamente]. | |
| Este trabajo abarca datos de 20 países: Argentina, Brasil, Bolivia, Chile, Colombia, Costa Rica, Cuba, República Dominicana, Ecuador, El Salvador, Guatemala, Honduras, México, Nicaragua, Panamá, Paraguay, Perú, Puerto Rico, Uruguay y Venezuela. | |
| Los datos regionales cubren distintas áreas temáticas de interés cultural, social, histórico, científico y territorial, incluyendo: pueblos originarios, comida y gastronomía, dialectos y lenguas, hechos históricos, celebraciones y festividades, lugares y geografía, artes, humanidades y ciencias sociales, comunicación y medios, política, personajes importantes, mitología, flora y fauna, deportes y recreación, economía y finanzas, ciencias duras, educación, y medicina y salud. | |
| La etapa de preentrenamiento continuo busca ampliar la cobertura del modelo sobre lenguas, expresiones, entidades, referencias culturales y contextos propios de América Latina y el Caribe. | |
| La etapa de ajuste supervisado incorpora ejemplos orientados a mejorar el seguimiento de instrucciones, la interacción conversacional y la utilidad del modelo en tareas de lenguaje natural. | |
| El proceso de construcción de datos considera criterios de calidad, trazabilidad y diversidad regional. Sin embargo, como todo modelo entrenado sobre grandes colecciones de texto, LatamGPT puede reflejar sesgos, vacíos o errores presentes en sus datos de entrenamiento. | |
| ## Responsabilidad y seguridad | |
| LatamGPT debe desplegarse como parte de sistemas más amplios que incorporen controles de seguridad, monitoreo y mecanismos de mitigación de riesgos. El modelo no debe considerarse una fuente infalible de información ni utilizarse sin validación humana en contextos de alto impacto. | |
| Quienes integren LatamGPT en productos o servicios son responsables de definir políticas de uso, filtros, evaluaciones y límites adecuados para su caso de aplicación. | |
| ### Despliegue responsable | |
| Antes de desplegar LatamGPT en producción, se recomienda: | |
| - Evaluar el modelo en el dominio específico de uso. | |
| - Implementar filtros de entrada y salida cuando corresponda. | |
| - Monitorear errores, sesgos y usos indebidos. | |
| - Definir mecanismos de retroalimentación y reporte. | |
| - Evitar que el modelo tome decisiones críticas sin supervisión humana. | |
| ## Consideraciones éticas y limitaciones | |
| LatamGPT busca contribuir al desarrollo de modelos de lenguaje más representativos de América Latina. Aun así, el modelo puede producir respuestas incorrectas, incompletas, sesgadas o desactualizadas. | |
| Sus salidas deben interpretarse como contenido generado automáticamente y no como asesoría profesional. En aplicaciones sensibles, las respuestas deben ser revisadas por personas expertas antes de ser utilizadas. | |
| Entre sus principales limitaciones se encuentran: | |
| - Posibilidad de alucinaciones o errores factuales. | |
| - Variación de desempeño entre idiomas, países y dominios. | |
| - Reproducción de sesgos presentes en los datos. | |
| - Dificultad para reconocer información desactualizada. | |
| - Sensibilidad al prompt y al contexto entregado. | |
| - Desempeño limitado fuera de español, portugués e inglés. | |
| ## Cita | |
| Si utilizas LatamGPT en investigación, productos o reportes técnicos, por favor cita el proyecto usando la siguiente referencia: | |
| ```bibtex | |
| @misc{latamgpt2026, | |
| title = {Llama-3.1-70B-LatamGPT-SFT-1.0}, | |
| author = {LatamGPT Team}, | |
| year = {2026}, | |
| howpublished = {\url{https://huggingface.co/latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0}} | |
| } | |
| ``` | |
| ## Agradecimientos | |
| LatamGPT es posible gracias al trabajo colaborativo de equipos técnicos, instituciones, comunidades y organizaciones que contribuyen al desarrollo de inteligencia artificial abierta y representativa para América Latina y el Caribe. | |
| <img src="asssets/alianzas.png" alt="Alianzas" width="100%" /> | |