metadata
language:
- en
tags:
- model
- leaderboard
model-index:
- name: droplychee/DropLychee-1.2
results:
- task:
type: multiple-choice
name: Diamond
dataset:
type: Idavidrein/gpqa
name: diamond
metrics:
- type: accuracy
value: 87.8
- task:
type: text-generation
name: SkillsBench V1.1
dataset:
type: benchflow/skillsbench
name: default
metrics:
- type: accuracy
value: 48.2
- task:
type: multiple-choice
name: Mmlu Pro
dataset:
type: TIGER-Lab/MMLU-Pro
name: pro
metrics:
- type: accuracy
value: 86.2
- task:
type: code-generation
name: SWE Bench Pro
dataset:
type: ScaleAI/SWE-bench_Pro
name: default
metrics:
- type: pass@1
value: 53.5
- task:
type: code-generation
name: Swe Bench Resolved
dataset:
type: SWE-bench/SWE-bench_Verified
name: verified
metrics:
- type: resolved
value: 77.2
- task:
type: multiple-choice
name: Mmmu Pro Vision
dataset:
type: MMMU/MMMU_Pro
name: pro
metrics:
- type: accuracy
value: 75.8
- task:
type: multiple-choice
name: MathArena Aime 2026
dataset:
type: MathArena/aime_2026
name: default
metrics:
- type: accuracy
value: 94.1
- task:
type: text-generation
name: Terminalbench 2
dataset:
type: harborframework/terminal-bench-2.0
name: default
metrics:
- type: accuracy
value: 59.3
- task:
type: text-generation
name: Hle
dataset:
type: cais/hle
name: default
metrics:
- type: accuracy
value: 24
- task:
type: multiple-choice
name: MathArena Hmmt Feb 2026
dataset:
type: MathArena/hmmt_feb_2026
name: default
metrics:
- type: accuracy
value: 84.3