AnotherPotatoCoder's picture
Upload README.md with huggingface_hub
3647135 verified
|
Raw
History Blame Contribute Delete
19 kB
---
license: mit
language: [km]
base_model: [Qwen/Qwen2.5-0.5B]
pipeline_tag: text-generation
tags: [khmer, qwen2, instruct, low-resource-language]
---
# KhmerLLM_instruct_e3
## Model Description
**KhmerLLM_instruct_e3** is a Khmer-language instruction-tuned model built on top of **Qwen/Qwen2.5-0.5B** (base, non-instruct). It was produced in two stages:
1. **Continual pretraining**: The Qwen2.5-0.5B base model was further pretrained on ~5GB of Khmer text to adapt it to the Khmer language. The base Qwen2.5-0.5B model struggles to produce coherent Khmer word segmentation and grammar; after continual pretraining, the model generates significantly more coherent and fluent Khmer text.
2. **Instruction fine-tuning**: The continually-pretrained model was then fine-tuned on ~50,000 Khmer instruction/response pairs, giving it the ability to follow instructions and behave as a conversational/instruct-style model.
**Known limitations**: Despite the fluency improvements, the model **hallucinates frequently** โ€” likely due to the limited scale of both the pretraining corpus (~5GB) and instruction dataset (~50k pairs) relative to what's needed for a low-resource language like Khmer. Factual claims from this model should not be trusted without verification.
- **Developed by:** AnotherPotatoCoder
- **Model type:** Causal decoder-only language model (Qwen2 architecture)
- **Language(s):** Khmer (km)
- **License:** MIT
- **Finetuned from model:** [Qwen/Qwen2.5-0.5B](https://huggingface.co/Qwen/Qwen2.5-0.5B) (base, not instruct)
## Uses
### Direct Use
- Khmer text generation and completion
- Simple Khmer instruction-following / conversational assistant tasks
- Research and experimentation on low-resource language adaptation
### Out-of-Scope Use
- **Factual / knowledge-intensive tasks** โ€” the model hallucinates frequently and should not be used where factual accuracy matters (e.g., medical, legal, financial advice).
- Production or safety-critical deployments without further evaluation and fine-tuning.
- Tasks requiring strong reasoning or long-context understanding; the model is only 0.5B parameters and has limited capacity.
## Bias, Risks, and Limitations
- **Hallucination**: The model frequently generates plausible-sounding but factually incorrect or fabricated content, likely due to limited training data scale (~5GB pretraining, ~50k instruction pairs).
- **Data provenance**: Training data was a mix of public and self-collected/scraped Khmer text and instruction pairs; it has not been rigorously audited for bias, toxicity, or duplication.
- **Small model size (0.5B params)**: Limits reasoning ability and knowledge capacity compared to larger models.
- **Language coverage**: Optimized for Khmer; performance on other languages is not guaranteed and may be degraded relative to the original Qwen2.5-0.5B base.
### Recommendations
Users should independently verify any factual claims generated by this model, especially for anything used outside casual/experimental contexts. This model is best suited for research, prototyping, and further fine-tuning rather than direct deployment.
## How to Get Started with the Model
```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
repo_id = "AnotherPotatoCoder/KhmerLLM_instruct_e3"
tokenizer = AutoTokenizer.from_pretrained(repo_id)
model = AutoModelForCausalLM.from_pretrained(
repo_id,
dtype=torch.float16,
device_map="auto",
)
model.eval()
prompt = "แžŸแžฝแžŸแŸ’แžŠแžธ! แžแžพแžขแŸ’แž“แž€แžˆแŸ’แž˜แŸ„แŸ‡แžขแŸ’แžœแžธ?"
messages = [
{"role": "system", "content": "แžขแŸ’แž“แž€แž‚แžบแž‡แžถแž‡แŸ†แž“แžฝแž™แž€แžถแžšแžŠแŸแž›แŸ’แžขแž˜แŸ’แž“แžถแž€แŸ‹แŸ”"},
{"role": "user", "content": prompt}
]
input_text = tokenizer.apply_chat_template(
messages, tokenize=False, add_generation_prompt=True
)
inputs = tokenizer(input_text, return_tensors="pt").to(model.device)
with torch.no_grad():
outputs = model.generate(
**inputs,
max_new_tokens=200,
do_sample=True,
temperature=1.0,
top_k=100,
top_p=0.8,
no_repeat_ngram_size=3,
pad_token_id=tokenizer.eos_token_id,
)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
```
## Training Details
### Training Data
A mix of publicly available Khmer text/datasets and self-collected/scraped Khmer text:
- **Continual pretraining corpus:** ~5GB of Khmer text
- **Instruction fine-tuning dataset:** ~50,000 Khmer instruction/response pairs
Exact dataset sources are not fully itemized here; update this section with specific dataset names/links if you'd like full reproducibility and attribution.
### Training Procedure
Two-stage training:
1. **Continual pretraining** on ~5GB Khmer text corpus, starting from `Qwen/Qwen2.5-0.5B` (base).
2. **Instruction fine-tuning** on ~50,000 Khmer instruction pairs, starting from the continually-pretrained checkpoint (stage 1 output).
#### Training Hyperparameters
- **Training regime:** fp16/mixed precision (weights stored in fp16 on the Hub)
- **Epochs (instruct stage):** 3
- **Base architecture:** Qwen2 (0.5B parameters)
### Speeds, Sizes, Times
- **Continual pretraining:** ~4 hours, 3 epochs, on a single NVIDIA A100 (rented via vast.ai)
- **Instruction fine-tuning:** performed on the continually-pretrained checkpoint (see above)
## Evaluation
No formal benchmark evaluation has been conducted yet. Comparative examples against the base `Qwen/Qwen2.5-0.5B-Instruct` model are provided below to illustrate qualitative differences in Khmer fluency and coherence.
### Qualitative Comparison: KhmerLLM_instruct_e3 vs. Qwen2.5-0.5B-Instruct
| Prompt (Khmer) | KhmerLLM_instruct_e3 Output | Qwen2.5-0.5B-Instruct Output |
| ------------------------------------------------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| แžŸแžฝแžŸแŸ’แžŠแžธ! แžแžพแžขแŸ’แž“แž€แžˆแŸ’แž˜แŸ„แŸ‡แžขแŸ’แžœแžธ? | แžŸแžฝแžŸแŸ’แžแžธ! แžแŸ’แž‰แžปแŸ†แžˆแŸ’แž˜แŸ„แŸ‡ แžœแžถแž›แŸ’แž˜แžทแž€แžทแŸ” ๐Ÿ˜Š | แž”แž„แŸ’แž แžถแž‰แžŠแŸ‚แžš! เบซแŸ’แž›แŸ„แž™แž‘แžนแž€แž…แžทแžแŸ’แžแž–แžธแžšแž“แŸ…แž–แŸแž›แžŠแŸ†แžŽแžพแžšแž€แžถแžŸแŸ‹แž“แžนแž„แžšแž”แžŸแŸ‹แžแŸ’แž›แžฝแž“: 1. ่‹ฑ่ชž (English) 2. ๆณฐ่ฏญ (Thai) 3. ้ฉฌๅฐผๆ‹‰่ฏ (Magana Language) 4. ็Žฏไฟ่‹ฑ่ฏญ (Eco English) 5. ๆผข่ชž (Chinese) แžŸแž แž‚แž˜แž“แžปแž˜แžแžถแž„ |
| แžŸแžผแž˜แž”แŸ’แžšแžถแž”แŸ‹แžแŸ’แž‰แžปแŸ†แžขแŸ†แž–แžธแž”แŸ’แžšแž‘แŸแžŸแž€แž˜แŸ’แž–แžปแž‡แžถ | แž”แŸ’แžšแž‘แŸแžŸแž€แž˜แŸ’แž–แžปแž‡แžถแž‚แžบแž‡แžถแž”แŸ’แžšแž‘แŸแžŸแžŠแŸ‚แž›แž…แŸ†แžŽแžถแžŸแŸ‹แž‡แžถแž„แž‚แŸแž“แŸ…แžขแžถแžŸแŸŠแžธแžขแžถแž‚แŸ’แž“แŸแž™แŸแžŠแŸ‚แž›แž˜แžถแž“แžขแžถแž™แžปแž€แžถแž›แž‡แžทแž แŸฃแŸ  แž†แŸ’แž“แžถแŸ†แŸ” แž”แŸ’แžšแž‘แŸแžŸแž€แž˜แŸ’แž–แžปแž‡แžถแžŸแŸ’แžแžทแžแž“แŸ…แž€แŸ’แž“แžปแž„แžแŸ†แž”แž“แŸ‹แžขแžถแžŸแŸŠแžธแžขแžถแž‚แŸ’แž“แŸแž™แŸ (แžขแŸŠแžธแž“assistant) แž“แžทแž„แžขแžถแžŸแŸŠแžธแž—แžถแž‚แžฆแžŸแžถแž“ (แž—แžผแž˜แžถ) แž แžพแž™แžœแžถแž‡แžถแž‘แžนแž€แžŠแžธแž“แŸƒแžแŸ†แž”แž“แŸ‹แž˜แžถแžŸ (แžขแžถแžŸแŸŠแžธ) แžŠแŸ‚แž›แžšแžฝแž˜แž˜แžถแž“แž”แŸ’แžšแž‘แŸแžŸแž…แŸ†แž“แžฝแž“ แŸกแŸ  แž‚แžบแŸ– แž€แž˜แŸ’แž–แžปแž‡แžถ แžกแžถแžœ แž—แžผแž˜แžถ แžแŸƒ แžœแŸ€แžแžŽแžถแž˜ แž…แžทแž“ แž“แžทแž„แžแŸƒแŸ” ... | แž‡แžถแž‘แžพแžšแž‡แžถแž˜แžฝแž‰แžแžทแž…แžแžผแž…แŸ—แžฒแŸ’แž™แžŸแŸ’แž›แŸแž„แž‘แŸ€แž: - "แž˜แžนแž€แžŸแŸ’แžšแžกแžถแž‰แŸ‹" (แž€แŸ’แž“แžปแž„แž‚แžธแž แŸŠแžผแžœ) - "แž’แŸ’แžœแžพแžŠแŸ„แž™" (แž‚แžผแž„แž‚แŸ’แžšแžผแž‚แžทแž) - แž”แŸ’แžŸแžถแž•แŸ’แž“แŸ‚แž€แž˜แžปแžแž˜แŸ‚แž›แž˜แžผแž” (แžšแž แžผแžแž‘ |
| แžแžพแžšแžถแž‡แž’แžถแž“แžธแž“แŸƒแž”แŸ’แžšแž‘แŸแžŸแž”แžถแžšแžถแŸ†แž„แžˆแŸ’แž˜แŸ„แŸ‡แžขแŸ’แžœแžธ? | แžšแžŠแŸ’แž‹แž’แžถแž“แžธแž“แŸƒแž”แŸ’แžšแž‘แŸแžŸแž”แŸ‰แžถแžšแžธแžŸแž‚แžบแž”แŸ‰แžถแžšแžธแžŸแŸ” | แžŸแžšแžŸแŸแžšแž–แžŽแŸŒแžŸแŸ’แžŸแžผแžœแž—แžถแž–แžแžถแžŠแŸ‚แž›แžแŸ’แž›แžถแŸ‹แž”แž‰แŸ’แž…แž”แŸ‹แž‘แŸแž–แŸ’แž‘แŸ‹: 1.แžŸแž˜แŸ’แžšแžถแž”แŸ‹แž–แžทแž…แŸ’แž…แž€แŸ’แžšแŸ„แž˜ แžŸแŸ†แžแžถแž“แŸ‹: - ้ซ˜ๅบฆ๏ผš Heights - ๅฎ‰ๅ…จ๏ผš Safety 2.แžŸแŸŠแžปแž“แžแžถแž„แž€แŸ’แž“แžปแž„แž†แŸ’แž“แžถแŸ‰แŸ‚แžแžนแž˜แžปแž ( |
| แžแžพแžขแŸ’แž“แž€แžขแžถแž…แž‡แžฝแž™แžแŸ’แž‰แžปแŸ†แžŸแžšแžŸแŸแžšแžขแŸŠแžธแž˜แŸ‚แž›แž”แžถแž“แž‘แŸ? | แž€แŸ’แž“แžปแž„แž“แžถแž˜แž‡แžถแž‡แŸ†แž“แžฝแž™แž€แžถแžš AI แžแŸ’แž‰แžปแŸ†แž˜แžทแž“แž˜แžถแž“แžŸแž˜แžแŸ’แžแž—แžถแž–แžŸแžšแžŸแŸแžšแžขแŸŠแžธแž˜แŸ‚แž›แž‘แŸแŸ” แž‘แŸ„แŸ‡แž™แŸ‰แžถแž„แžŽแžถแž€แŸแžŠแŸ„แž™ แžแŸ’แž‰แžปแŸ†แžขแžถแž…แžŽแŸ‚แž“แžถแŸ†แž‚แŸ†แž“แžทแžแž˜แžฝแž™แž…แŸ†แž“แžฝแž“แžŸแž˜แŸ’แžšแžถแž”แŸ‹แž€แžถแžšแžŸแžšแžŸแŸแžšแžขแŸŠแžธแž˜แŸ‚แž›แž”แŸ’แžšแž€แž”แžŠแŸ„แž™แž”แŸ’แžšแžŸแžทแž‘แŸ’แž’แž—แžถแž–แŸ– 1. แž‡แŸ€แžŸแžœแžถแž„แžขแŸŠแžธแž˜แŸ‚แž›แžœแŸ‚แž„แŸ– ... | แžขแŸƒแžแžผแžŽแžถแžŸแž„แŸ‹แžŸแžšแŸ„แž…แž€แŸ’แžšแžŠแžพแž˜แŸ’แž”แžธแž€แžถแž›แž–แžถแžŽแžทแž—แŸ’แž‡แžถแž–แž‡แžถแž˜แžฝแžšแžŠแŸ‚แž“แž–แŸแž›แžŠแŸ†แžกแžพแž„แž˜แžพแž›แžšแž”แžŸแŸ‹แž–แŸ’แžšแžนแžแŸ’แžแž™แž แŸแžŠแŸƒแž‘แŸ…แž“แŸแŸ‡. แž แžพแž™แž”แŸ’แžšแžŸแŸ„แž”แžขแŸ„แž™แž€แŸ’แž“แžปแž„แžŸแž˜แŸแž™แžแžถแž˜แž›แŸ† |
| แžŸแžผแž˜แžŸแžšแžŸแŸแžšแžขแŸŠแžธแž˜แŸ‚แž›แžŸแžปแŸ†แž…แŸ’แž”แžถแž”แŸ‹แžŸแž˜แŸ’แžšแžถแž€แž€แžถแžšแž„แžถแžšแž˜แžฝแž™แžแŸ’แž„แŸƒ | แž”แŸ’แžšแž’แžถแž“แž”แž‘แŸ– แž€แžถแžšแžŸแž˜แŸ’แžšแžถแž€แž€แžถแžšแž›แŸ†แž แŸ‚แž€แžถแž™ แž“แžทแž„แž›แŸ†แž แŸ‚แž€แžถแž™แž“แŸ…แžแŸ’แž„แŸƒแžˆแž”แŸ‹แžŸแž˜แŸ’แžšแžถแž€ แž‡แžถแž‘แžธแž‚แŸ„แžšแž– [แžขแŸ’แž“แž€แž‘แž‘แžฝแž›] แžแŸ’แž‰แžปแŸ†แžŸแž„แŸ’แžƒแžนแž˜แžแžถแžขแŸŠแžธแž˜แŸ‚แž›แž“แŸแŸ‡แžšแž€แžƒแžพแž‰แžขแŸ’แž“แž€แž”แžถแž“แž›แŸ’แžขแŸ” แžแŸ’แž‰แžปแŸ†แž€แŸ†แž–แžปแž„แžŸแžšแžŸแŸแžšแžŠแžพแž˜แŸ’แž”แžธแžŸแžปแŸ†แžˆแž”แŸ‹แžŸแž˜แŸ’แžšแžถแž€แž˜แžฝแž™แžแŸ’แž„แŸƒแž–แžธแž€แžถแžšแž„แžถแžšแžŠแŸ‚แž›แžแŸ’แž‰แžปแŸ†แž”แžถแž“แž’แŸ’แžœแžพแž€แžถแž›แž–แžธแžŸแž”แŸ’แžแžถแž แŸแž˜แžปแž“แŸ” ... | แžŸแž˜แž แžแŸแž‘แžถแž…แŸ‹แž“แžนแž„แž”แŸ’แžšแž–แŸแž“แŸ’แž’แž•แŸ’แž‘แŸƒแžแžถแž„แžแžถแŸ†แž„, แžขแž„แŸ’แž›แžถแž”แž€แžถแž“แŸ‹แžšแžฟแž„ (Radar) แž”แžถแž“แž•แŸ’แžŸแŸแž„แŸ—แŸ– "SAR Radar" แžŸแŸ†แžšแžถแž”้ƒจ่ฝแžทแžแŸ’แž™แžšแž„แŸ’แžœแž„แŸ‹แž…แžถแžŸแŸ‹แž แŸŠแž˜ (Orbital Command and Service Radar) แž“แŸ…แž”แŸ’แžแžผแžšแž€แžถแž„ |
| แžŸแžผแž˜แžŸแžšแžŸแŸแžšแžšแžฟแž„แžแŸ’แž›แžธแž˜แžฝแž™แžขแŸ†แž–แžธแž€แžปแž˜แžถแžšแž˜แŸ’แž“แžถแž€แŸ‹แžŠแŸ‚แž›แž”แžถแž“แžšแž€แžƒแžพแž‰แž†แŸ’แž€แŸ‚แžœแž„แŸ’แžœแŸแž„ | แž˜แžถแž“แž–แŸแž›แž˜แžฝแž™แž“แŸ…แž€แŸ’แž“แžปแž„แž—แžผแž˜แžทแžแžผแž…แž˜แžฝแž™แžŸแŸ’แžแžทแžแž“แŸ…แž…แž“แŸ’แž›แŸ„แŸ‡แž—แŸ’แž“แŸ†แž–แžธแžš แž˜แžถแž“แž€แŸ’แž˜แŸแž„แž”แŸ’แžšแžปแžŸแž˜แŸ’แž“แžถแž€แŸ‹แžˆแŸ’แž˜แŸ„แŸ‡ Jack แŸ” Jack แž˜แžถแž“แž…แžทแžแŸ’แžแžŸแž”แŸ’แž”แžปแžšแžŸ แž“แžทแž„แž…แž„แŸ‹แžŠแžนแž„แž…แž„แŸ‹แžƒแžพแž‰ แž แžพแž™แž‚แžถแžแŸ‹แžแŸ‚แž„แžแŸ‚แž…แŸ†แžŽแžถแž™แž–แŸแž›แžŠแžพแžšแž›แŸแž„แž€แŸ’แž“แžปแž„แž‘แžธแžšแž แŸ„แžŸแŸ’แžแžถแž“ แž“แžทแž„แž–แŸ’แžšแŸƒแžˆแžพแž€แŸ’แž”แŸ‚แžšแž“แŸ„แŸ‡แŸ” แžแŸ’แž„แŸƒแž˜แžฝแž™ แž‚แžถแžแŸ‹แž”แžถแž“แž‡แŸ†แž–แž”แŸ‹แžŠแžฝแž›แž›แžพแž•แŸ‚แž“แž‘แžธแž…แžถแžŸแŸ‹แžŠแŸ‚แž›แž†แŸ’แž›แžถแž€แŸ‹แžแžถแž˜แž–แŸ’แžšแŸƒแŸ” ... | "แžšแžทแž‘แŸ’แž™แžถแžŸแŸŠแžผ" |
| แžŸแžผแž˜แžแŸ‚แž„แž€แŸ†แžŽแžถแž–แŸ’แž™แžแŸ’แž›แžธแž˜แžฝแž™แžขแŸ†แž–แžธแžšแžŠแžผแžœแžœแžŸแŸ’แžŸแžถ | แž€แŸ†แžŠแŸ…แž–แŸ’แžšแŸ‡แžขแžถแž‘แžทแžแŸ’แž™แž–แŸแž›แžขแŸ’แž“แž€แž…แŸแž‰แž‘แŸ…แž€แŸ’แžšแŸ… แž’แŸ’แžœแžพแžฑแŸ’แž™แžŸแŸ’แž”แŸ‚แž€แžšแž”แžŸแŸ‹แžขแŸ’แž“แž€แžŸแžพแž˜แžŠแŸ„แž™แž‘แžนแž€แž แžผแžšแŸ” แž‘แžนแž€แž แžผแžšแžŠแžผแž…แž‡แžถแžขแŸ’แž“แž€แžขแžถแž…แž”แž“แŸ’แž’แžผแžšแžขแžถแžšแž˜แŸ’แž˜แžŽแŸแž”แžถแž“ แž˜แžทแž“แž˜แžถแž“แž€แžถแžšแžšแŸ†แžแžถแž“ แž“แžทแž„แžŸแŸ’แž„แž”แŸ‹แžŸแŸ’แž„แžถแžแŸ‹แž“แŸ…แž€แŸ’แž“แžปแž„แž…แžทแžแŸ’แžแžšแž”แžŸแŸ‹แžขแŸ’แž“แž€แŸ” แž€แžถแžšแž†แŸ’แž›แžปแŸ‡แž”แž‰แŸ’แž…แžถแŸ†แž„แž“แŸ…แž€แŸ’แž“แžปแž„แž–แŸ’แžšแŸ‡แžขแžถแž‘แžทแžแŸ’แž™ ... | แž”แžถแž“แž’แŸ’แžœแžพแž”แŸ’แžšแž‘แŸแžŸแžšแž”แžŸแŸ‹แž“แžถแž„แžฏแž€แžถแžŽแžกแžพแž„แžกแžถแž”แŸ’แžšแžŠแžปแžŽแŸ’แž แŸƒแž”แŸ’แžแžผแžšแžแŸ’แž˜แŸ…แžŠแŸ‚แž›แž˜แžถแž“แž—แžถแž–แžšแž”แžถแž‰แž”แŸ’แž›แŸ‚แž€. แž˜แžทแž“แžแŸ’แžšแžผndonแŸแŸ‡แž‡แžถแž„แž‚แŸ’แžšแž”แŸ‹แž‚แŸ’แž“แžถแŸ– 1. แžŸแž˜แŸ’แžšแžถแž”แŸ‹แž•แŸ’แžŠแž›แŸ‹แž˜แžถแž |
| แž”แžพแžŸแžทแž“แž‡แžถแžแŸ’แž‰แžปแŸ†แž˜แžถแž“แž•แŸ’แž›แŸ‚แž”แŸ‰แŸ„แž˜ แŸฅ แž แžพแž™แžฒแŸ’แž™แž˜แžทแžแŸ’แžแž—แž€แŸ’แžแžท แŸข แž“แžถแž€แŸ‹แŸ—แž˜แŸ’แž“แžถแž€แŸ‹แž˜แžฝแž™ แžแŸ’แž‰แžปแŸ†แž“แŸ…แžŸแž›แŸ‹แž”แŸ‰แžปแž“แŸ’แž˜แžถแž“? | แž”แŸ’แžšแžŸแžทแž“แž”แžพแžขแŸ’แž“แž€แž˜แžถแž“แž•แŸ’แž›แŸ‚ pears แž…แŸ†แž“แžฝแž“ 5 แž แžพแž™แž˜แžทแžแŸ’แžแžšแž”แžŸแŸ‹แžขแŸ’แž“แž€แž˜แžถแž“แž…แŸ†แž“แžฝแž“แž–แžธแžš แžขแŸ’แž“แž€แž“แžนแž„แž˜แžถแž“แž•แŸ’แž›แŸ‚แžŸแŸ’แžแŸ’แžšแž”แžบแžšแžธแžŸแžšแžปแž”แž…แŸ†แž“แžฝแž“ 10 แŸ” แž…แŸ†แž“แžฝแž“แž“แŸƒแž•แŸ’แž›แŸ‚ passistant แž“แžนแž„แž˜แžถแž“แž…แŸ†แž“แžฝแž“แžŸแžšแžปแž”แž“แŸƒแž•แŸ’แž›แŸ‚แž”แŸ‰แŸ„แž˜แŸ” | แžŸแŸŠแŸแžšแžธแž€แžถแž›แž–แžนแž„แžŠแŸ‚แž›แž…แžถแŸ†แž†แŸ’แž“แžถแŸ‡แžแŸ’แž˜แžผแž“แž”แŸ†แž•แžปแžแž“แŸƒแžขแŸ’แžœแžธแž”แžถแž“แŸ‹แž‘แžนแž€: 1. ่จๅก (Sakura) - เนƒเธ™เธเธตเนˆเธ›เธธเนˆเธ™, แžแŸ’แžšแžผแžœแž€แžถแžœแž˜แžถแž‡แž’แž˜แŸ’แž˜แž‰แŸ’แž‰ แžŠแŸ†แžŽแžพแžšแž€แžถแžŽแžถแž…แŸ‹ แž˜แžถแžŸแŸ‹แž‚แŸแž˜แžป |
| แžแžพแžแŸ’แž‰แžปแŸ†แž‚แžฝแžšแž’แŸ’แžœแžพแžŠแžผแž…แž˜แŸ’แžแŸแž…แžŠแžพแž˜แŸ’แž”แžธแžšแŸ€แž“แž—แžถแžŸแžถแžขแž„แŸ‹แž‚แŸ’แž›แŸแžŸแžฑแŸ’แž™แž”แžถแž“แž›แžฟแž“? | แž“แŸแŸ‡แž‚แžบแž‡แžถแž‚แž“แŸ’แž›แžนแŸ‡แžแŸ’แž›แŸ‡แŸ—แžŠแŸ‚แž›แžขแžถแž…แž‡แžฝแž™แžขแŸ’แž“แž€แžšแŸ€แž“แž—แžถแžŸแžถแžขแžถแž˜แŸแžšแžทแž€แž”แžถแž“แž™แŸ‰แžถแž„แž›แžฟแž“แŸ– 1. แž…แžถแž”แŸ‹แž•แŸ’แžแžพแž˜แžŠแŸ†แž”แžผแž„แŸ– แžœแžถแž‡แžถแžšแžฟแž„แžŸแŸ†แžแžถแž“แŸ‹แž€แŸ’แž“แžปแž„แž€แžถแžšแžšแŸ€แž“แž—แžถแžŸแžถแžแŸ’แž˜แžธแžฑแŸ’แž™แž”แžถแž“แž†แžถแž”แŸ‹แžแžถแž˜แžŠแŸ‚แž›แžขแžถแž…แž’แŸ’แžœแžพแž‘แŸ…แž”แžถแž“แŸ” ... | แžŸแžทแž‘แŸ’แž’แžทแž–แžธแž”แžถแžแŸ‹แž แŸŠแžผแž“แž˜แžปแžแžšแž„แŸ’แžœแžถแž›แŸ‹แžŸแž„แŸ— 2019, แž‚แžฏแžŽแŸ…แž‡แžถแž–แŸ‚แž›แž€แžถแž“แŸ‹แžŠแŸ„แž™แž”แŸ’แžšแž‘แŸััแžแŸ’แž˜แžนแžแŸ’แžแž“แŸ’แž‘แž˜แžถแž“แžถแž‘แžถแž•แŸ’แž›แžผแžœแž‚แžปแžŽ. แž”แžถแžŒแžˆแžถแž„แž–แžทแž“แžทแžแŸ’แž™แžŸแžถแž…แŸ‹แž•แŸ’แž›แžถแžŸ |
| แžŸแžผแž˜แž”แž€แž”แŸ’แžšแŸ‚แžƒแŸ’แž›แžถแž“แŸแŸ‡แž‘แŸ…แž‡แžถแž—แžถแžŸแžถแžขแž„แŸ‹แž‚แŸ’แž›แŸแžŸแŸ– 'แžแŸ’แž‰แžปแŸ†แžŸแŸ’แžšแž›แžถแž‰แŸ‹แž”แŸ’แžšแž‘แŸแžŸแž€แž˜แŸ’แž–แžปแž‡แžถ' | "แžแŸ’แž‰แžปแŸ†แžŸแŸ’แžšแž›แžถแž‰แŸ‹แž€แž˜แŸ’แž–แžปแž‡แžถ" | แžŸแŸ†แžšแžถแž”แŸ‹แžŸแžทแž€แŸ’แžŸแžถแž˜แžพแž˜, "แžแŸ’แžŠแžนไบคแžŸแŸ’แžแžถแžœแžแž„แžธ" (Kongfu) แž แžพแž™แž˜แžถแž“แžˆแŸ’แž˜แŸ„แŸ‡แž€แžถแž™แžŸแŸŠแŸแžšแžทแž…แž€แŸ’แž“แžปแž„แžšแžœแžถแž„แžขแŸ†แž–แžธแž€แŸ’แžšแžปแž˜แž แŸŠแžผแžŸแŸ’แž˜แžถแžŽแž–แžทแž—แž–แž›แŸ„แž€แŸ” 1. แžขแž„แŸ’แž‚แž€แžถแžแŸ‹แžฏแž€ |
> **Takeaway:** `KhmerLLM_instruct_e3` produces dramatically more fluent, grammatical, and topically-relevant Khmer text than the unmodified `Qwen2.5-0.5B-Instruct`, which struggles to produce coherent Khmer at all. However, the examples above also illustrate this model's core weakness โ€” **hallucination**: e.g. the math prompt ("5 apples, give 2 to friends") is answered incorrectly ("10" instead of the correct "3"), the translation prompt echoes the Khmer phrase back instead of translating it to English, and longer factual answers (e.g. about Cambodia) drift into inaccurate claims partway through. Treat outputs as fluent but _unreliable_.
>
> Note: `KhmerLLM_instruct_e3` was fine-tuned from a continually-pretrained Khmer version of `Qwen2.5-0.5B` (base), while the comparison model here, `Qwen2.5-0.5B-Instruct`, is Qwen's own official instruct model with no Khmer-specific adaptation. This comparison is meant to demonstrate the effect of Khmer-specific continual pretraining + fine-tuning, not a general capability benchmark.
## Hardware Used
- **Hardware Type:** NVIDIA A100 (rented via vast.ai) for continual pretraining; NVIDIA P100 (Kaggle) for instruction fine-tuning
- **Hours used:** ~4 hours (continual pretraining, A100) + ~3 hours (instruction fine-tuning on ~50,000 pairs, P100)
- **Cloud Provider:** vast.ai (continual pretraining), Kaggle (instruction fine-tuning)
## Technical Specifications
### Model Architecture and Objective
Causal (autoregressive) decoder-only transformer, Qwen2 architecture, 0.5B parameters. Trained with a standard next-token prediction objective during continual pretraining, and instruction-tuned (supervised fine-tuning on instruction/response pairs) in the second stage.
### Compute Infrastructure
- **Hardware:** NVIDIA A100 GPU (vast.ai rental)
- **Software:** ๐Ÿค— Transformers, PyTorch
## Model Card Authors
AnotherPotatoCoder
## Model Card Contact
Open an issue or discussion on this model's Hugging Face repository.