--- license: unknown base_model: Qwen/Qwen-Image-2512 tags: - text-to-image - lora - korean-typography - qwen-image - diffsynth-studio pipeline_tag: text-to-image --- # Qwen-Image-2512 Korean Text Rendering LoRA `Qwen/Qwen-Image-2512` DiT를 대상으로 한 LoRA 어댑터로, 이미지 안에 정확한 한글 텍스트를 렌더링하는 능력을 개선하기 위해 학습했습니다. 베이스 모델 가중치는 전부 고정(frozen)하고 어댑터만 학습했습니다 (adapter-only). > ⚠️ **이 저장소만으로는 사용할 수 없습니다.** `adapter_model.safetensors`는 LoRA > **델타(차이값)만** 담고 있고, 원본 가중치를 포함하지 않습니다. 실제 추론에는 아래 베이스 > 모델을 별도로 받아 함께 로드해야 합니다: > - [`Qwen/Qwen-Image-2512`](https://huggingface.co/Qwen/Qwen-Image-2512) — transformer(DiT) > - [`Qwen/Qwen-Image`](https://huggingface.co/Qwen/Qwen-Image) — text_encoder, vae ## 학습 데이터 atomic_text(원자 텍스트) + atomic_text_new(신규 원자 텍스트) + infographic(인포그래픽, 1.5~4배 반복 샘플링) 조합, 총 45,482행(train) / 478행(validation)으로 학습했습니다. - `atomic_text`: 9,667 노출 - `atomic_text_new`: 27,287 노출 - `infographic`: 8,528 노출 (원본 2,246장을 반복 샘플링해 비중 보정) **공개 데이터셋과의 차이**: 같은 계보의 데이터를 정리해 [`fasoo/korean-text-rendering-data`](https://huggingface.co/datasets/fasoo/korean-text-rendering-data) 로 별도 공개했지만, 이 체크포인트의 실제 학습 레시피와 완전히 동일하지는 않습니다. ## 사용 방법 (DiffSynth-Studio) ```python from diffsynth import ModelManager, QwenImagePipeline model_manager = ModelManager() model_manager.load_models([ # Qwen/Qwen-Image-2512:transformer, Qwen/Qwen-Image:text_encoder, Qwen/Qwen-Image:vae ]) pipe = QwenImagePipeline.from_model_manager(model_manager) pipe.load_lora(pipe.dit, "adapter_model.safetensors") image = pipe(prompt='KR-Atomic-Text, ... Place the Korean text "무작위 표집" ...') ``` 정확한 로딩 인자(`model_id_with_origin_paths` 등)는 베이스 모델 구성에 따라 달라질 수 있습니다. ## 라이선스 관련 주의 - 베이스 모델(`Qwen/Qwen-Image-2512`, `Qwen/Qwen-Image`)의 라이선스 조건이 이 어댑터에도 적용됩니다 — 사용 전 확인하세요.