Jais 2: A Family of Arabic-Centric Open Large Language Models Paper • 2608.13580 • Published Jul 7 • 1
Llama-3-Nanda-10B-Chat: An Open Generative Large Language Model for Hindi Paper • 2504.06011 • Published Apr 8, 2025 • 2
Llama-3.1-Sherkala-8B-Chat: An Open Large Language Model for Kazakh Paper • 2503.01493 • Published Mar 3, 2025 • 1
Bilingual Adaptation of Monolingual Foundation Models Paper • 2407.12869 • Published Jul 13, 2024
Predicting the Type and Target of Offensive Posts in Social Media Paper • 1902.09666 • Published Feb 25, 2019 • 1
Beyond English-Only Reading Comprehension: Experiments in Zero-Shot Multilingual Transfer for Bulgarian Paper • 1908.01519 • Published Aug 5, 2019
SOLID: A Large-Scale Semi-Supervised Dataset for Offensive Language Identification Paper • 2004.14454 • Published Apr 29, 2020
On the Effect of Dropping Layers of Pre-trained Transformer Models Paper • 2004.03844 • Published Apr 8, 2020 • 1
SemEval-2020 Task 12: Multilingual Offensive Language Identification in Social Media (OffensEval 2020) Paper • 2006.07235 • Published Jun 12, 2020
M4: Multi-generator, Multi-domain, and Multi-lingual Black-Box Machine-Generated Text Detection Paper • 2305.14902 • Published May 24, 2023 • 1
We Can Detect Your Bias: Predicting the Political Ideology of News Articles Paper • 2010.05338 • Published Oct 11, 2020 • 1
Factcheck-GPT: End-to-End Fine-Grained Document-Level Fact-Checking and Correction of LLM Output Paper • 2311.09000 • Published Nov 15, 2023 • 1
EXAMS: A Multi-Subject High School Examinations Dataset for Cross-Lingual and Multilingual Question Answering Paper • 2011.03080 • Published Nov 5, 2020
bgGLUE: A Bulgarian General Language Understanding Evaluation Benchmark Paper • 2306.02349 • Published Jun 4, 2023
DetectLLM: Leveraging Log Rank Information for Zero-Shot Detection of Machine-Generated Text Paper • 2306.05540 • Published May 23, 2023
AraStance: A Multi-Country and Multi-Domain Dataset of Arabic Stance Detection for Fact Checking Paper • 2104.13559 • Published Apr 28, 2021
RuleBert: Teaching Soft Rules to Pre-trained Language Models Paper • 2109.13006 • Published Sep 24, 2021
Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs Paper • 2308.13387 • Published Aug 25, 2023 • 1
ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic Paper • 2402.12840 • Published Feb 20, 2024 • 3
EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models Paper • 2403.10378 • Published Mar 15, 2024