{"benchmark_id":"scienceqa-visual","benchmark_name":"ScienceQA Visual","benchmark_description":"ScienceQA Visual is a multimodal science question answering benchmark consisting of 21,208 multiple-choice questions from elementary and high school science curricula. The dataset covers 3 subjects (natural science, language science, social science), 26 topics, 127 categories, and 379 skills. 48.7% of questions include image context requiring multimodal reasoning. Questions are annotated with lectures (83.9%) and explanations (90.5%) to support chain-of-thought reasoning for science question answering.","max_score":1.0,"categories":["multimodal","reasoning","vision"],"modality":"multimodal","total_models":1,"entries":[{"rank":1,"model_id":"phi-4-multimodal-instruct","model_name":"Phi-4-multimodal-instruct","organization_name":"Microsoft","organization_id":"microsoft","benchmark_score":0.975,"normalized_score":0.975,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-02-01","announcement_date":"2025-02-01","multimodal":true,"param_count":5600000000,"is_new":false}]}