Qwen-AgentWorld: Language World Models for General Agents Paper • 2606.24597 • Published Jun 23 • 164
SWE-bench-java: A GitHub Issue Resolving Benchmark for Java Paper • 2408.14354 • Published Aug 26, 2024 • 41
microsoft/Phi-3-vision-128k-instruct Text Generation • 4B • Updated Dec 10, 2025 • 67.3k • 973
PanGu-Coder2: Boosting Large Language Models for Code with Ranking Feedback Paper • 2307.14936 • Published Jul 27, 2023 • 42 • 2
PanGu-Coder2: Boosting Large Language Models for Code with Ranking Feedback Paper • 2307.14936 • Published Jul 27, 2023 • 42
Running Agents 1.52k Big Code Models Leaderboard 📈 1.52k Explore code model rankings and submit evaluation requests