{"benchmark_id":"tydiqa","benchmark_name":"TydiQA","benchmark_description":"A multilingual question answering benchmark covering 11 typologically diverse languages with 204K question-answer pairs. Questions are written by people seeking genuine information and data is collected directly in each language without translation to test model generalization across diverse linguistic structures.","max_score":1.0,"categories":["language","reasoning"],"modality":"text","total_models":2,"entries":[{"rank":1,"model_id":"llama-4-maverick","model_name":"Llama 4 Maverick","organization_name":"Meta","organization_id":"meta","benchmark_score":0.317,"normalized_score":0.317,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-04-05","announcement_date":"2025-04-05","multimodal":true,"param_count":400000000000,"is_new":false},{"rank":2,"model_id":"llama-4-scout","model_name":"Llama 4 Scout","organization_name":"Meta","organization_id":"meta","benchmark_score":0.315,"normalized_score":0.315,"verified":false,"self_reported":true,"provider_id":null,"input_cost_per_million":null,"output_cost_per_million":null,"speed_rps":null,"context_window":null,"release_date":"2025-04-05","announcement_date":"2025-04-05","multimodal":true,"param_count":109000000000,"is_new":false}]}