One of the better finetunes

#8
by zviratko - opened

Thank you

Intelligence Benchmark Comparison

              Mode    Sampled                      BigBang-v1-oQ4e-mtp               BigBang-v1-oQ5e-mtp               BigBang-v1-oQ6e-mtp               BigBang-v1-oQ8e-mtp  Qwopus3.6-35B-A3B-Coder-oQ8e-mtp
--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
MMLU          Sample  300/14042                                  82.0%                             80.7%                             81.3%                             81.0%                             82.0%
MMLU_PRO      Sample  300/12032                                  61.3%                             59.3%                             63.3%                             63.7%                             66.7%
HUMANEVAL     Full    164                                        86.6%                             87.2%                             85.4%                             89.0%                             91.5%

--- Detail ---

Model: BigBang-v1-oQ4e-mtp
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 82.0%       246     300     105.5      No
MMLU_PRO             61.3%       184     300     209.5      No
HUMANEVAL            86.6%       142     164     137.1      No

Model: BigBang-v1-oQ5e-mtp
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 80.7%       242     300     111.6      No
MMLU_PRO             59.3%       178     300     285.7      No
HUMANEVAL            87.2%       143     164     138.5      No

Model: BigBang-v1-oQ6e-mtp
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 81.3%       244     300     117.4      No
MMLU_PRO             63.3%       190     300       374      No
HUMANEVAL            85.4%       140     164     182.6      No

Model: BigBang-v1-oQ8e-mtp
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 81.0%       243     300     123.3      No
MMLU_PRO             63.7%       191     300     397.3      No
HUMANEVAL            89.0%       146     164     170.6      No

Model: Qwopus3.6-35B-A3B-Coder-oQ8e-mtp
Benchmark         Accuracy   Correct   Total   Time(s)   Think
--------------------------------------------------------------
MMLU                 82.0%       246     300     136.2      No
MMLU_PRO             66.7%       200     300     450.4      No
HUMANEVAL            91.5%       150     164     265.1      No

Sign up or log in to comment