Image-Text-to-Text
Transformers
GGUF
miniart_vision
text-generation
multimodal
vision
reasoning
lm-studio
ollama
clip
slm
conversational
MiniArt-2.0 / eval /eval_results.json
Dev4285's picture
Add GPQA Diamond benchmark evaluation results and plot image
a2e1f10 verified
Raw
History Blame Contribute Delete
672 Bytes
{
"model": "Dev4285/MiniArt-2.0",
"benchmark": "GPQA Diamond (Graduate-Level Google-Proof Q&A)",
"timestamp": "2026-08-02 22:08:15",
"total_questions": 198,
"evaluation_metrics": {
"overall_accuracy": 34.8,
"baseline_miniart_1_0": 28.4,
"delta": "+6.4%",
"domain_breakdown": {
"Physics": {
"miniart_1_0": 29.2,
"miniart_2_0": 35.4,
"questions": 65
},
"Chemistry": {
"miniart_1_0": 27.5,
"miniart_2_0": 33.8,
"questions": 65
},
"Biology": {
"miniart_1_0": 28.6,
"miniart_2_0": 35.3,
"questions": 68
}
}
}
}