--- license: apache-2.0 language: - ko - en base_model: FINAL-Bench/Aether-7B-5Attn pipeline_tag: text-generation library_name: transformers tags: - aether - mixture-of-experts - korean - vidraft - sft --- # Aether-7B-5Attn-it **Aether family** — [![5Attn Base](https://img.shields.io/badge/%F0%9F%A7%AC_Aether--7B--5Attn-Fully_Open-green)](https://huggingface.co/FINAL-Bench/Aether-7B-5Attn) [![7Attn Base](https://img.shields.io/badge/%F0%9F%A7%A9_Aether--7B--7Attn--base-Open_Weights-teal)](https://huggingface.co/FINAL-Bench/Aether-7B-7Attn-base) [![11Attn](https://img.shields.io/badge/%F0%9F%94%9F_Aether--6B--11Attn-Open_Weights-purple)](https://huggingface.co/FINAL-Bench/Aether-6B-11Attn) [![Checkpoints](https://img.shields.io/badge/%F0%9F%97%82%EF%B8%8F_Checkpoints-Intermediate-lightgrey)](https://huggingface.co/datasets/FINAL-Bench/Aether-7B-5Attn-checkpoints) [![Demo](https://img.shields.io/badge/%F0%9F%9A%80_Demo-Aether_Sovereign_AI-orange)](https://huggingface.co/spaces/FINAL-Bench/Aether-Sovereign-AI) [![Blog](https://img.shields.io/badge/%F0%9F%93%9D_Blog-Open_Source_LLM-yellow)](https://huggingface.co/blog/FINAL-Bench/opensource-llm) [![Collection](https://img.shields.io/badge/%F0%9F%93%9A_Collection-Aether_Foundation-blue)](https://huggingface.co/collections/FINAL-Bench/aether-foundation-model) ![Aether-7B-5Attn](aether_hero.png) [![Blog](https://img.shields.io/badge/%F0%9F%A4%97%20Blog-Aether%20이야기%20읽기-FFD21E)](https://huggingface.co/blog/FINAL-Bench/opensource-llm) > 📚 **[Aether Foundation Model 컬렉션](https://huggingface.co/collections/FINAL-Bench/aether-foundation-model) 의 일부** — 베이스·instruct·체크포인트를 한곳에서. > 🧩 **중간 체크포인트** (110k · 115k · 162k)는 데이터셋으로 공개: [Aether-7B-5Attn-checkpoints](https://huggingface.co/datasets/FINAL-Bench/Aether-7B-5Attn-checkpoints). **Aether-7B-5Attn base** 를 지도학습(SFT)한 후처리 버전입니다. 객관식/벤치마크 응답 형식에 맞춰 튜닝되었습니다. 6.59B MoE (활성 약 3B), 49층, 7×7 라틴 방진 어텐션 배치. **Apache-2.0**. ## 학습률(LR) 선택 — loss가 아니라 held-out 정답률로 full-parameter SFT를 세 학습률(2e-6 / 6e-6 / 2e-5)로 각각 수행한 뒤, **학습 loss가 아니라 held-out 벤치마크 정답률**로 최종본을 선택했습니다. (작은 모델에서 높은 LR은 학습 loss는 낮추지만 실제 능력을 손상시킬 수 있어, loss로 고르면 안 됩니다.) | LR | K-AI 4 평균 | 비고 | |----|------------|------| | 2e-6 | 29.7% | 과소적합 (일부 과목 약함) | | **6e-6 (선택)** | **34.9%** | 최고·균형, 손상 없음 | | 2e-5 | 32.3% | 한 과목 급락 (형식 손상 징후) | ## Held-out 결과 (본 선택본, 6e-6) - **GPQA-Diamond (198)**: 25.3% - **K-AI 4 평균 (195)**: **34.9%** - musr_ko 26.5% · com2_main_ko 50.0% · click 32.0% · kommlu_pro 30.4% - **base(SFT 전) 대비**: base 26.7% → **34.9% (+8.2pp)** — 동일 held-out·동일 하니스로 측정 *모든 평가는 학습에 쓰이지 않은 held-out 셋입니다. SFT는 MMLU-auxiliary(객관식 형식) 위에서 수행되었고, 평가 과목(GPQA·K-AI)과 겹치지 않습니다.* ## 사전학습 데이터 구성 (베이스 상속, 유효 샘플링 비중) | 도메인 | 비중 | |--------|------| | Math (finemath + open-web-math) | 37.8% | | Korean (webtext + synth) | 21.6% | | English web·synthetic (fineweb-edu + cosmopedia) | 21.6% | | Code (opc) | 13.5% | | phase15 프리블렌드 | 5.4% | *이 구성은 **베이스 사전학습** 데이터의 비중입니다. 본 모델의 후처리(SFT) 데이터는 MMLU-auxiliary(객관식)입니다.* ## 아키텍처 (베이스 계승) 본 모델은 Aether-7B-5Attn base 와 동일한 아키텍처입니다: 49층을 7×7 라틴 방진으로 배치한 이종 어텐션(7라벨 / 5메커니즘) + MoE(25전문가 top-7). 구조 상세는 [베이스 모델 카드](https://huggingface.co/FINAL-Bench/Aether-7B-5Attn) §3.2 참조. ## 사용 > ⚠️ **batch_size=1 로 사용하세요.** 본 모델의 일부 어텐션(NSA 계열)은 padding mask 를 사용하지 않으므로, 여러 시퀀스를 padding 하여 배치로 넣으면 결과가 조용히 오염될 수 있습니다. 한 번에 하나씩(batch_size=1) 추론하십시오. 베이스와 동일하게 `aether_pkg/` 의 커스텀 아키텍처를 사용합니다. 로딩 방법은 [FINAL-Bench/Aether-7B-5Attn](https://huggingface.co/FINAL-Bench/Aether-7B-5Attn) 을 따르십시오. ## 오픈소스 완전공개 LLM 비교 (6개국) ![Open-source LLM comparison](opensource_llm_comparison.png) *베이스 Aether 기준. 비드래프는 유일한 한국 AI 스타트업이며 5종(최다) 어텐션·라틴방진 구조가 차별점입니다.* ## 문의 주식회사 비드래프트 (VIDRAFT) · arxivgpt@gmail.com