When Tokenizers Fail: Byte-Level Chunking for Zero-Shot Transfer to Low-Resource Languages Paper • 2608.27658 • Published Aug 27
How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data Paper • 2604.13977 • Published Apr 15 • 3
On the Utility and Factual Reliability of Pruned Mixture-of-Experts Models in the Biomedical Domain Paper • 2607.01444 • Published Jul 1 • 2
Enhancing Linguistic Competence of Language Models through Pre-training with Language Learning Tasks Paper • 2601.03448 • Published Jan 6 • 13
Enhancing Linguistic Competence of Language Models through Pre-training with Language Learning Tasks Paper • 2601.03448 • Published Jan 6 • 13
Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates Paper • 2512.04844 • Published Dec 4, 2025 • 5
Vocabulary Expansion of Chat Models with Unlabeled Target Language Data Paper • 2412.11704 • Published Dec 16, 2024
Enhancing Reasoning Capabilities of LLMs via Principled Synthetic Logic Corpus Paper • 2411.12498 • Published Nov 19, 2024 • 2
Vocabulary Expansion for Low-resource Cross-lingual Transfer Paper • 2406.11477 • Published Jun 17, 2024
An Empirical Study on Cross-lingual Vocabulary Adaptation for Efficient Generative LLM Inference Paper • 2402.10712 • Published Feb 16, 2024
Learning Deductive Reasoning from Synthetic Corpus based on Formal Logic Paper • 2308.07336 • Published Aug 11, 2023