MD-Mushfiqur123 commited on
Commit
c8024e2
·
verified ·
1 Parent(s): b4e75bb

Update README.md

Browse files
Files changed (1) hide show
  1. README.md +62 -8
README.md CHANGED
@@ -5,20 +5,29 @@ tags:
5
  - model
6
  - leaderboard
7
  model-index:
8
- - name: আপনার-মডেলের-নাম
9
  results:
10
  - task:
11
- type: multiple-choice # টাস্ক টাইপ (যেমন: text-generation, multiple-choice)
12
- name: GPQA
13
  dataset:
14
  type: Idavidrein/gpqa
15
- name: default # ডেটাসেটের সাবসেট (বেশিরভাগ ক্ষেত্রে 'default' বসালে চলে)
16
  metrics:
17
- - type: accuracy # মেট্রিক্স টাইপ (accuracy, exact_match, pass@1 ইত্যাদি)
18
  value: 87.8
 
 
 
 
 
 
 
 
 
19
  - task:
20
  type: multiple-choice
21
- name: MMLU-Pro
22
  dataset:
23
  type: TIGER-Lab/MMLU-Pro
24
  name: default
@@ -26,14 +35,32 @@ model-index:
26
  - type: accuracy
27
  value: 86.2
28
  - task:
29
- type: text-generation # কোডিং বেঞ্চমার্কের জন্য সাধারণত text-generation বা code-generation হয়
30
  name: SWE Bench Pro
31
  dataset:
32
  type: ScaleAI/SWE-bench_Pro
33
  name: default
34
  metrics:
35
- - type: resolved # SWE-bench এ সাধারণত resolved ব্যবহার করা হয়
36
  value: 53.5
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
37
  - task:
38
  type: multiple-choice
39
  name: MathArena AIME 2026
@@ -43,4 +70,31 @@ model-index:
43
  metrics:
44
  - type: accuracy
45
  value: 94.1
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
46
  ---
 
5
  - model
6
  - leaderboard
7
  model-index:
8
+ - name: droplychee/DropLychee-1.2
9
  results:
10
  - task:
11
+ type: multiple-choice
12
+ name: GPQA Diamond
13
  dataset:
14
  type: Idavidrein/gpqa
15
+ name: default
16
  metrics:
17
+ - type: accuracy
18
  value: 87.8
19
+ - task:
20
+ type: text-generation
21
+ name: SkillsBench V1.1
22
+ dataset:
23
+ type: benchflow/skillsbench
24
+ name: default
25
+ metrics:
26
+ - type: accuracy
27
+ value: 48.2
28
  - task:
29
  type: multiple-choice
30
+ name: MMLU Pro
31
  dataset:
32
  type: TIGER-Lab/MMLU-Pro
33
  name: default
 
35
  - type: accuracy
36
  value: 86.2
37
  - task:
38
+ type: code-generation
39
  name: SWE Bench Pro
40
  dataset:
41
  type: ScaleAI/SWE-bench_Pro
42
  name: default
43
  metrics:
44
+ - type: pass@1
45
  value: 53.5
46
+ - task:
47
+ type: code-generation
48
+ name: SWE Bench Resolved
49
+ dataset:
50
+ type: SWE-bench/SWE-bench_Verified
51
+ name: default
52
+ metrics:
53
+ - type: resolved
54
+ value: 77.2
55
+ - task:
56
+ type: multiple-choice
57
+ name: MMMU Pro Vision
58
+ dataset:
59
+ type: MMMU/MMMU_Pro
60
+ name: default
61
+ metrics:
62
+ - type: accuracy
63
+ value: 75.8
64
  - task:
65
  type: multiple-choice
66
  name: MathArena AIME 2026
 
70
  metrics:
71
  - type: accuracy
72
  value: 94.1
73
+ - task:
74
+ type: text-generation
75
+ name: Terminalbench 2
76
+ dataset:
77
+ type: harborframework/terminal-bench-2.0
78
+ name: default
79
+ metrics:
80
+ - type: accuracy
81
+ value: 59.3
82
+ - task:
83
+ type: text-generation
84
+ name: HLE
85
+ dataset:
86
+ type: cais/hle
87
+ name: default
88
+ metrics:
89
+ - type: accuracy
90
+ value: 24.0
91
+ - task:
92
+ type: multiple-choice
93
+ name: MathArena Hmmt Feb 2026
94
+ dataset:
95
+ type: MathArena/hmmt_feb_2026
96
+ name: default
97
+ metrics:
98
+ - type: accuracy
99
+ value: 84.3
100
  ---